DNA 通常被解釋為蛋白質乃至生命生產的「密碼本」或「指令集」。部分 DNA 片段稱為基因,負責編碼蛋白質,但絕大多數 DNA 被視為「非編碼區」。其中一些功能不明,而另一些片段則對調節基因活動至關重要。這些調控元件能以複雜方式互動,其影響在不同細胞和組織中可能有所差異,有些甚至會影響基因組中遠處的基因。

了解 DNA 變化如何影響這種調控,「是理解大多數疾病的基礎」,不列顛哥倫比亞大學基因組學家 Carl de Boer 表示。這就是為什麼研究人員正努力理解人類 DNA 在整個基因組中每一個可想像的微小變異對基因調控可能意味著什麼。

Google DeepMind 為此目的構建的最新 AI 工具 AlphaGenome,最初於 2025 年宣布。今年一月,《自然》雜誌發表了一篇論文提供了更多細節,該模型也已開放供公眾非商業使用。這個 AI 模型能夠比較原始 DNA 序列與改變後的序列,並預測該變化可能如何影響基因表達及其他調控活動。然而,研究人員過去必須自行選擇要測試的變異、編寫程式碼並運行這個計算要求極高的模型。

現在,DeepMind 已預先完成了這項工作,針對參考人類基因組中所有 90 億種可能的單字母變化進行了預測。DeepMind 於 9 月 8 日宣布創建並公開發布 AlphaGenome Atlas,這是一個線上資料庫,儲存了使用 AlphaGenome 模型預先計算的預測結果。

Atlas 為科學家提供了更易於使用的介面,無需編寫程式碼或自行運行 AlphaGenome 模型。它還包含一項備受期待的新功能:一個單一的影響分數,旨在讓使用者一眼看出某個變異是否可能具有重要意義。Google DeepMind 科學副總裁 Pushmeet Kohli 表示:「理解我們的 DNA 是一項巨大的挑戰。理解這種生命語言可以解鎖許多事物。」

AlphaGenome 的預測存在一些重要的限制。例如,許多疾病與多個基因變異相關。儘管 AlphaGenome 檢視了變異周圍相對較大的 DNA 片段(100 萬個鹼基對),但某些 DNA 序列,例如增強子,可以在非常長的距離上調控基因,有時甚至超出模型的視野範圍,其影響難以預測。

但 Atlas 仍然可以幫助科學家篩選可能性,並優先進行實驗室驗證其預測的實驗。DeepMind 基因組學負責人 Žiga Avsec 表示,透過這種方式,它能極大地加速基礎生物學、疾病研究和治療開發方面的工作。

de Boer 表示:「他們似乎為人們創造了一個有用的資源。」他最近協助建立了一個框架,用於更好地比較類似 AlphaGenome 的計算模型,但他與 DeepMind 沒有關聯。儘管 de Boer 認為 AlphaGenome 是「該領域的領先模型」,但他指出它也「非常緩慢且計算密集」。Atlas 可以讓那些無法使用較新硬體的人受益,或者僅僅減少重複相同模擬的人數。

Atlas 可供非商業研究免費使用,並有可能提供商業授權。

整個人類基因組大約包含 30 億個鹼基對。在每個位置上,有三種可能的單核苷酸替換,因此 Atlas 中包含了 90 億個變異。完整的資料集大約為 1 拍位元組(petabyte)。

Avsec 表示:「當我們開始考慮這個專案時,從計算角度來看,這似乎是不可能完成的。」早期估計告訴團隊,他們需要將計算速度提高 80 倍,才能在合理的時間內編譯出 Atlas。為了達到這個目標,團隊透過多種不同技術獲得了優勢,包括模型蒸餾(model distillation)、GPU 核心優化(GPU kernel optimization)以及消除冗餘計算。Avsec 說:「為了實現如此大規模的運算,我們投入了大量的思考和工程努力。」

AlphaGenome 和 Atlas 建立在 DeepMind 多年相關工作的基礎上。2020 年,AlphaFold 從胺基酸序列預測了蛋白質的三維結構。2023 年,AlphaMissense 預測了 7100 萬種可能改變蛋白質的變異是良性還是致病性。

與新的 Atlas 類似,這些專案的預測結果也已在公共資料庫中提供。Atlas 允許科學家查詢單一變異,並查看模型預測的更詳細資訊,包括 11 種不同的輸出類型。但最主要的數字是單一的影響分數,其本質上是對這些預測許多方面的簡化。de Boer 說:「它有明確的用途,但也可能很容易被誤解。我們正在談論一個非常複雜的系統,其中有許多動態部分。」