陶哲軒將此與1900年至1930年間震撼數學界的基礎危機相提並論。當時,羅素悖論和哥德爾不完備定理迫使數學家們闡明他們一直以來視為理所當然的假設。那場危機催生了一個嚴謹的框架,並已沿用了一個世紀。

陶哲軒認為,如今的壓力測試已有所轉變。它不再關乎數學真理,而是關於「數學價值觀和實踐中大部分隱而不宣的框架」:什麼才算貢獻、什麼會獲得獎勵、理解某事意味著什麼,以及機器是否能被視為完成了這項工作。

他的工作假設是:「AI 工具將在合理的時間內,能夠以合理的成功率、品質、監督和成本,執行相當一部分研究級別的數學任務。」

作為證據,他提到了 First-Proof Project。在第二輪測試中,十個從未發表過的研究問題在受控條件下,由四個 AI 系統進行了測試。其中七個問題至少從一個系統獲得了及格分數,這意味著其解決方案被判斷為基本完美或僅需少量修改,每個問題的成本介於數十到數百美元之間。

當指標變成目標時,陶哲軒寫道,數學的許多目標一直以來都緊密相連,解決問題、建立理論、促進社群和培養下一代都相互滋養。然而,AI 卻可能將這些目標分開。

他引用了古德哈特定律(Goodhart's law):「當一個衡量標準變成目標時,它就不再是一個好的衡量標準。」生成式 AI 特別容易出現這種情況,因為它追求的是良好輸出的「表象」,而非實質。

AI 產業的財務誘因讓情況變得更糟,因為它獎勵的正是那種容易引用、可作為基準的「勝利」,而這些勝利長期以來被數學家們用作更深層次目標的替代品。

證明過多,理解不足。陶哲軒警告,如果他的工作假設成立,數學領域可能會從證明稀缺轉變為證明過剩,AI 生成的證明將堆積如山,速度快到任何人都無法檢查、閱讀或吸收。Erdős 問題資料庫中已經包含數十個 AI 生成的提交,卻沒有人類專家自願驗證。

AI 精心修飾的證明則有另一個問題。陶哲軒觀察到,在人類撰寫的證明中,困難的部分往往會保留自然的「摩擦力」:一個仔細的引理、符號的改變,以及明顯經過多次重寫的段落。過度精修的 AI 證明卻會去除這些雜亂和有用的信號,產生「易於閱讀卻難以學習」的文本。正如陶哲軒所說,人類闡述中的「錯誤」實際上「對讀者非常有幫助」。

無人能解釋的證明是不完整的。為了提供具體指導,陶哲軒提到了國際數學聯盟於2026年6月發布並支持的《萊頓人工智慧與數學宣言》。

他自己的經驗法則:「如果作者無法令人信服地證明他們能夠就其成果進行清晰、專家級別的演講,且內容正確並適當歸因,那麼該成果就不應發表。」即使證明已通過形式驗證,若無人能妥善解釋,也應視為不完整。

陶哲軒認為,培養年輕數學家需要特別謹慎,因為數學家需要保護其工作「不可化約的人類面向」,並嚴格限制 AI 工具的使用。培養數學家的目標並非僅僅是產出正確的作業。陶哲軒本人也透露他會使用 AI 進行文獻檢索、圖表製作、文本補全以及將投影片轉換為論文格式。

最近,著名數學家 Timothy Gowers 和 Peter Sarnak 肯定了大型語言模型在數學方面的實際能力,但也指出其在產生真正新穎想法方面的局限性,這一發現也出現在其他研究中。陶哲軒的這篇文章超越了這場辯論,因為他較不關心 AI 能做什麼或不能做什麼,而更關心數學本身真正想要什麼。