今天在 Decoder 節目中,我與 The Verge 駐倫敦的 AI 記者 Robert Hart 進行對談,討論人工智慧對數學領域的影響,以及許多頂尖數學家因此面臨的存在危機。
OpenAI 最近發布了一系列長期未解的數學問題的解決方案,在學術界投下了一顆震撼彈。這在數學社群中引發了巨大爭議,而 Rob 花了一些時間與當代一些最傑出的數學家討論此事。
有趣的是,AI 系統在小學算術方面仍然相當糟糕,卻在非常高階的抽象數學上表現越來越好。這為高等數學領域帶來了一些重大問題。
如果 AI 能處理這種水準的數學問題,這是否意味著 AI 實驗室能將這些技能轉移到其他領域?如果前沿模型能輕易解答所有懸而未決的問題,那麼學術補助和大學計畫訓練新一代人類數學家去發現新問題、解決現有問題的意義何在?
如果所有對數學的關注,都只是前沿 AI 實驗室的一場大型行銷活動,而他們根本不在乎這個最古老、最基礎的學術領域會發生什麼事,那該怎麼辦?
這裡面牽涉甚廣,Robert 已經與許多人就這些問題進行了深入討論,聽取了各種不同的觀點。
好的,接下來是 Verge 的 AI 記者 Robert Hart 談論 AI 對數學的影響。我們開始吧。
這次訪談為了篇幅和清晰度進行了輕微編輯。Robert Hart,您是 The Verge 駐倫敦的 AI 記者。歡迎來到 Decoder。
謝謝您的邀請。
我很高興能與您交談。最近您深入探討了 AI 和數學之間發生的許多事情。您與許多頂尖數學家談論了 AI 導致的數學危機。這感覺像是一個巨大的議題,而且關於這兩者之間的互動,還有很多有待了解和發現。這是一場徹底的存在危機,完全符合 Decoder 的主題。請您大致說明一下目前的情況。
我認為「很多」這個詞總結得很好。基本上,這是一場關於「什麼是數學?數學家在做什麼?以及數學家未來扮演什麼角色?」的存在危機。
很大程度上,這歸因於 AI 能力在過去六個月到一年內出現的爆炸性轉變。AI 在極短時間內,從表現非常糟糕,轉變為在專業水準上看似真正相當出色。這就像其他領域在過去五年中一直在努力應對的問題,現在在數學界以非常壓縮的時間發生。
我會將其與軟體工程相提並論。我們在軟體工程領域已經歷了一段時間的 AI 危機。然而,直到 2024 年,甚至去年,普遍的看法仍然是 AI 模型在數學方面特別差。著名的例子是這些模型無法計算單字「strawberry」中有多少個「R」。連簡單的計數都難倒它們。那麼,是什麼讓它們在數學方面變得更好了?它們在一般算術方面仍然很差,但在高等數學方面卻很出色,還是介於兩者之間?
它們在某些數學領域確實仍然非常非常糟糕。我查過了,它們現在可以數「strawberry」了。我想是有人調整過了。
我認為「strawberry」是被硬編碼進去的。我想說清楚,我的陰謀論是「strawberry」這個問題被硬編碼進了所有模型。
我也這麼認為。這個陰謀論我會相信。
但是的,它在這些方面仍然很糟糕,數學、算術,甚至星期幾。我男朋友前幾天說:「它一直以為是星期三。但不是星期三。」或者時間。Elissa Welle 幾個月前為我們寫道,ChatGPT 不會看時間。現在仍然不會。但這並不是數學的全部。
所以這裡存在一個脫節。要擅長數學,你必須擅長計數、加法或乘法。但很多時候,數學實際上是關於推理。如果你看學術數學論文,很多時候你不會看到數字,我想這就總結了這一點。所以它們仍然很糟糕,但現在在另一個部分卻非常出色。
至於原因,在某個時間點,這些系統的能力會達到一個臨界點。我們在寫作和程式設計方面都看到了這一點。它們非常擅長在不同領域之間建立連結,以新方式應用舊方法等等。似乎他們正在訓練的新模型已經達到了那個「頓悟」的水平,現在它能夠處理數學了。
同時,也很重要的是,我們從外部來看,常將數學視為一個單一的學科。但想像一下,例如生物學。它涵蓋了從觀察動物、描述行為,一直到細胞機制和生物化學等廣泛領域。數學也不是一個單一的學科。AI 在某些部分表現確實很好,但在像計數這樣的一些部分,它仍然非常糟糕。
即使在更抽象的層面,數學家們也提出拓撲學是 AI 顯然仍然相當不擅長的領域之一。老實說,我無法驗證這一點,這超出了我的專業範圍。儘管如此,情況仍然是好壞參半。
所以您將數學描述為一個巨大的領域,顯然有許多學術興趣領域。有些部分模型已經做得相當好。有些部分,也許是人們認為的數學基礎部分,也就是簡單的計數,它們仍然在掙扎,然後中間還有一個廣泛的範圍。存在危機是在中間的廣泛範圍,人們不知道會發生什麼?還是在它表現非常好的部分?
兩者兼而有之,我覺得這將是貫穿始終的主題。沒有人真正害怕它成為一個平庸的數學家,但顯然這個領域的工作有著巨大的影響。就研究要素或尖端領域而言,正如我們從許多引起轟動的結果中看到的那樣,它能做什麼?現在有些領域,它似乎正在產生與優秀數學家水準相當的工作,而另一些部分,是的,它仍然不會計數。
這一切都牽涉到它是否會重塑就業結構或資金結構。您也提出了關於「什麼是數學知識?」以及這些工作者將扮演什麼角色的模糊問題。所有這些都交織在一起。
我認為這與 AI 在各領域的興起大致相符。只要你能為問題增加運算能力或算力,並且存在某種可驗證性,模型似乎就會持續改進。而在中間部分,你可能需要一些世界知識,或者模型可能需要對世界本身有實際的智慧,它們似乎就會遇到困難。
數學的這些部分,至少在您的文章中報導的和實驗室所討論的,似乎幾乎完全是獨立的理論問題。在這些問題上,模型可以生成證明或解決一個從未有人能解決的問題,然後嘗試驗證其存在性,並且可以一次又一次地運行。
我想這讓我們回到了今年五月,當時一個我們尚未真正見過的 OpenAI 內部模型,推翻了有 80 年歷史的「單位距離猜想」。然後最近我們又聽說了 OpenAI 的 Astra。Astra 似乎是那個讓開關被撥動,讓所有人決定這是一場存在危機的模型。Astra 取得了什麼成就,為什麼它如此重要?
我也相當確定 Astra 可能也是早期那個模型的幕後推手。OpenAI 只是將其列為一個未命名的內部模型。它很可能是 Astra。我詢問時他們沒有回答我。
幾週前,OpenAI 發布了一篇部落格文章,同時附帶了大量的證明文件,我想有數百頁。他們稱之為「數學與理論電腦科學的 10 項進展」。這基本上是他們聲稱最新模型 Astra 在某種程度上解決的一系列學科問題。我記得其中一個是量子賽局理論,我不知道該如何解釋。更難解釋的是,還有高維度(超過三維)的球體堆積問題,以及許多其他不同的學科問題。
這在社群中引起了很大的轟動。這有點像一顆震撼彈。正如我們所說,之前也曾有過這些個別的突破,但 OpenAI 一次性發布了 10 項,而且都是相當重大的突破。研究人員告訴我,如果這些是由人類解決的,我們會印象深刻。如果一個人解決了所有 10 個,我們可能根本不會相信。
這些也是數學家們真正關心的問題,這一點很重要。許多以前的突破曾被指責是在數學家們不太關心的領域。而這些問題是數學家,優秀的數學家,花費大量時間試圖解決卻未能成功的。
讓我們談談這 10 個問題。您報導了它們。OpenAI 確實提供了一些文件。但它們並非完全憑空產生,對吧?
它們是基於前人工作的。關於歸屬問題存在一些疑問。反應如何?是「哦,模型做到了!」還是我們在許多 AI 工作中看到的反應,基本上歸結為「你們偷了這個,沒有歸功於任何人,你們站在巨人的肩膀上卻沒有提及。」反應究竟如何?
總體而言,我採訪的人們普遍反應是相當印象深刻。正如我所說,這些都是數學家關心的問題。其中有一個問題特別引起關注,原因在於他們如何歸功以及他們如何在部落格文章中宣布這一切。OpenAI 最初表示這 10 個問題在過去 10 年中沒有任何進展。但如果你實際閱讀論文,其中一篇清楚地寫道:「哦,我們是基於這兩位研究人員的進展。」
所以後來這個說法被悄悄地修改了。但我採訪的一些研究人員對此相當不滿,他們確實覺得這是一種「你們沒有歸功於你們在此大量使用的東西,而且是你們自己承認的」行為。話雖如此,我採訪的一位被點名的研究人員,對整件事也有些矛盾,所以情況確實是好壞參半。
總體印象是這相當令人印象深刻。這些是真正困擾人們的突破,它確實推動了該領域的發展,如果這些是由人類數學家完成的,幾位研究人員實際上表示:「如果一位研究人員解決了其中任何一個問題,他們可能就能確保學術生涯無憂了。」
有趣的是,在學術界,歸屬和引用是整個遊戲的關鍵。而 AI 公司似乎可以馬虎行事,這是任何人類都無法做到的。這次發現或工作的規模是否掩蓋了其粗糙之處?如果人類取得了相同的成就,但同樣馬虎,反應會一樣嗎?
我的一部分總是想傾向於「哦,這看起來像抄襲」的觀點。但如果你真的閱讀他們發布的論文,我採訪的一位研究人員說,世界上可能只有大約 50 人會深入閱讀這些論文,你會發現它非常清楚。它沒有試圖抄襲。老實說,我認為這只是一份糟糕的新聞稿。
儘管我偶爾喜歡深入探討,但作為一名報導科學十多年的人,我發現新聞稿經常會過度吹噓實際的發現、其重要性和新穎性。我認為這只是這裡發生的另一個案例。
這看起來可以重複嗎?他們提供了一些證據證明他們解決了 10 個無法解決的問題。他們有提供任何證據證明他們可以再解決 10 個嗎?
這就是問題所在。所以,我為此採訪的將近十幾個人,最大的未知數是:「他們嘗試了多少次才得到這 10 個?」誰知道呢?他們知道,但他們不說。



