每隔幾十年,就會有人宣稱科學已走到盡頭。1903 年,備受尊敬的物理學家阿爾伯特·邁克爾遜(Albert Michelson)寫道:「物理科學的事實都已被發現。」1980 年代,史蒂芬·霍金(Stephen Hawking)預測理論物理學可能在本世紀末結束。隨著人工智慧的爆炸性到來,這種感覺再次瀰漫,這次還伴隨著諾貝爾獎。

2024 年,Google DeepMind 的 Demis Hassabis 和 John Jumper 因其神經網路 AlphaFold 獲得部分諾貝爾化學獎。AlphaFold 透過學習數千種實驗測量的蛋白質形狀,預測蛋白質的三維結構。這個棘手的問題困擾了系統性研究半個世紀;AlphaFold 似乎一勞永逸地解決了它,全世界都為其方法的潛力所著迷。

Hassabis 和他的團隊稱 AlphaFold 為「AI 如何將所有科學加速到數位速度的範本」。在 DeepMind 成功的鼓舞下,一波為生物學、化學和材料發現建立基礎模型的初創公司籌集了數十億美元。AlphaFold 證明了 AI 與充足數據的結合可以帶來突破性發現(即使我們不理解其潛在機制),這似乎再次為我們鋪平了通往其餘科學領域的道路。

誠然,AI 將為科學帶來非凡的變革,但越來越清楚的是,AlphaFold 及其類似的工具可能不是這種轉變的最佳範本。儘管它是一項深遠的成就,但產生 AlphaFold 這種成果的條件極為罕見,要在其他領域滿足這些條件所需的時間將以數十年而非數年來衡量。相反,科學的加速將來自另一種方法:AI 代理。

AlphaFold 成功的首要條件是蛋白質資料庫(Protein Data Bank)的存在,這是一個包含約 17 萬個經過實驗驗證的蛋白質結構的數據集,DeepMind 團隊得以在此基礎上訓練其模型。蛋白質資料庫的創建並不容易:它耗費了 53 年的國際科學合作,根據最近的估計,約 210 億美元的實驗工作才得以完成。

如此規模的工作在資金籌措上出了名的困難,協調上幾乎不可能,執行上也非常耗時;因此,它們往往以失敗告終。

但即使在具有必要凝聚力和資源,且相關數據未因商業所有權而無法取得的領域,另一個鮮少被討論的障礙是:生成可比較數據的科學不可能性。以蛋白質結構為例,關鍵的實驗技術,蛋白質晶體學,是一種異常可重複且可靠的工具,以至於超過 25 項諾貝爾獎都依賴於它。但在大多數實驗科學中,結果往往變化多端。細胞株會漂移,化學品含有微量污染物,實驗室濕度會改變。

要在生物學或大多數化學領域訓練現代神經網路,需要創建足夠一致、準確、精確且可擴展的測量數據集,這將需要新型測量方法和新的標準化方法,而這些都無法在短期內準備就緒。當然,有少數領域符合這些要求:天氣預報、大部分基因組學以及化學中非常有限的領域。這些領域可能很快就會看到 AlphaFold 式的突破,如果尚未發生的話。

正如美國新興生物技術國家安全委員會所主張的,政府對這些數據集的生產和協調支持將至關重要。但對於大多數科學中的開放性問題,我們至少在短期內需要一個不同的計畫。幸運的是,一些更安靜、更謙遜的事物已開始展現潛力。

科學家總是在不確定性下進行推理。致力於識別新藥物靶點的生物學家從未擁有完美的數據集。相反,他們結合對接計算和已知結構,考慮分子動力學,進行少量結合分析,並運用他們的判斷力,根據每種方法的特定優勢和失敗點來權衡。科學的技能不在於任何單一工具;它在於綜合多種工具的產出,並隨著證據的出現而修正結果。這就是大多數實際研究的進行方式。但直到最近,沒有任何軟體能做到這一點。

現在,代理可以做到。簡單來說,代理是一種 AI 推理引擎,它被賦予了使用數位或實體工具的權限和能力。在過去幾年中,AI 領域的根本性架構轉變使得這些由大型語言模型驅動的程式迅速普及,大大減少了對科學專業數據集的需求。對於科學而言,這項技術進步代表著一項基礎性變革:它使我們能夠創建數位工具,模仿實際研究的迭代、高度偶然的過程。

像 AlphaFold 這樣的工具對有限的問題應用強大的方法,而代理本質上是通才。它們不代表一種新的科學方法,相反,它們以數位方式模擬人類的發現過程。

以 Google 在五月宣布的 AI Co-Scientist 為例。研究人員給它一份一頁的簡報和一個目標:找出抗生素抗藥性如何在細菌物種之間傳播,這是耐藥性感染的關鍵驅動力。該系統啟動了子代理。一個從文獻中草擬假設。另一個像同行評審員一樣挑剔它們。第三個進行競賽以評選最強的候選者。第四個完善了獲勝的假設。

該代理得出結論,抗藥性基因搭乘細菌病毒的便車,藉助任何能將它們帶入新宿主的病毒。這個假設是正確的。倫敦帝國學院的研究人員花了十年時間,透過艱苦的濕實驗工作才得出相同的結論;他們的論文,Co-Scientist 之前從未見過,當時仍在同行評審中。

像 Co-Scientist 這樣的代理仍然是新穎的工具,在它們成為科學過程中無處不在的一部分之前,還有真正的挑戰需要克服:它們仍然容易產生幻覺,判斷力不一致,並且存在記憶和輸入限制,這限制了它們自主運行的時間。但這些技術障礙將會消除,隨著它們的消除,我們將開始注意到科學代理對科學進行的可靠性、一致性和速度的複合效應。

也許最值得注意的是,代理為科學的「重現性危機」提供了一個結構性解決方案,這是研究人員無法複製彼此結果的普遍問題。幾十年來,科學界一直懇求研究人員分享他們的原始數據和確切程式碼,以努力標準化實驗過程。但研究人員長期以來一直抵制這種繁瑣的行政工作,因為這是在有趣的科學完成之後才進行的。

相比之下,代理會自動記錄它們的每一個動作,創建導致其結果的方法的精確記錄,並允許精確複製。

第二個結果將是科學記憶的放大。知識在研究人員之間的傳遞是一個出了名的模糊過程;如果不是透過多年的培訓和觀察來完成,研究生就只能翻閱幾十年來前輩們雜亂的實驗室筆記,尋找那些能決定其實驗方案成敗的細節。然而,隨著代理在科學過程中佔據越來越大的比重,實驗室的整個科學歷史將被記錄在一個集中、標準化的機構知識庫中。

但代理最重要的影響將是速度。在任何領域,當測試一個想法所需的時間少於在會議上爭論它的時間時,人們就會停止爭論,直接進行測試。一個代理能夠在一小時內閱讀一千篇論文,設計五百個分子,並在早上從失敗的測試中學習,這將降低實驗成本,並從根本上改變科學進行的速度。

它還將賦予研究人員追逐他們以前從未敢於冒險的大膽、奇特問題的自由,開啟我們尚未想像的科學大門。

雖然 AlphaFold 範本肯定會是驚人發現的關鍵,但它本身並不會將我們帶到科學的終點。相反,向代理式 AI 的轉變代表著一個更為罕見的突破層級:一種同時涵蓋所有科學領域的工具。從歷史上看,這種範圍的工具只出現過幾次:微積分、統計推斷、光譜學、電腦。每一個都揭示了一個無人想過要闡述的問題世界,而這些問題反過來又重新定義了它們的領域。隨著代理的出現,另一場這樣的轉變即將到來。

Eric Schmidt 曾於 2001 年至 2011 年擔任 Google 執行長。2024 年,他與妻子 Wendy 共同創立了 Schmidt Sciences,這是一個資助科學與技術領域非傳統探索的慈善事業。Suhas Mahesh 領導 Schmidt Sciences AI 中心的人工智慧科學工作。

他是材料發現 AI 專家。額外研究由 Eric Schmidt 辦公室的副研究員兼科學負責人 Maya Levin 提供。