AI 系統創造出基因上與殺菌病毒相距甚遠的版本。

AI 在生物學領域的工作多半集中於蛋白質設計,因為蛋白質是生命活動的核心。了解如何製造新蛋白質,意味著能直接操縱生物化學,創造潛在有用的新功能。

由於基因密碼在 DNA 和蛋白質之間提供了一層抽象,因此不清楚訓練於 DNA 的模型能做什麼。然而,人們還是開發了大型基因體模型,結果發現它能輸出 DNA 序列,這些序列可在細菌中編碼出功能性蛋白質,並模仿複雜細胞中的基因結構。現在,這些模型已被用來輸出感染細菌的病毒基因體。

這並非科幻小說,模型創造的所有病毒都與現有病毒密切相關。但它們確實擁有一些獨特的特徵,這些特徵在演化上很難自然產生。史丹佛大學的研究人員指出,我們現在可能需要開始思考,如何為未來可能有人開發出能設計針對脊椎動物病毒的相關 AI 做好準備。

大型語言模型主要透過預測人類生成文本中下一個詞語的能力來進行訓練,其資料量越大越好。大型基因體模型採用相同的方法,但應用於 DNA。從某種程度上說,這簡化了問題,因為 DNA 只使用四種「字母」:A、T、C 和 G。但更複雜的是,基因體通常有某些區域,其中下一個字母至關重要,而另一些序列中,下一個鹼基可以是任何東西,且無關緊要。

因此,大型基因體模型需要在許多我們人類尚未弄清楚的情況下,識別其輸出序列的生物學背景。然而,如果我們提供足夠的基因體序列,它們似乎就能做到。具有相關功能的細菌基因往往會聚集在一起。如果用部分基因叢集的序列提示大型基因體模型,它將輸出編碼相關功能蛋白質的 DNA 序列,其中可能包括我們迄今尚未發現的、具有功能的蛋白質。

然而,我們自身的知識不足限制了這些模型的能力。如果我們用來自複雜細胞的一小段序列提示它們,它會回傳一串包含看似基因和調控 DNA 的鹼基。但由於大多數基因在真核生物基因體中幾乎可以位於任何位置,我們不知道這些「幻覺」基因可能執行什麼功能(如果有的話),因此我們無法真正測試它們。

儘管如此,作為訓練這些模型(稱為 Evo 1 和 Evo 2)的預防措施,研究人員並未向它們提供任何感染複雜細胞的病毒序列。即使我們無法理解它們的輸出,仍有可能輸出危險的東西。

但世界上有許多攻擊細菌且無法感染人類的病毒。Evo 的開發者認為,這些病毒是合適的目標。因此,他們沒有探究 Evo 1 和 Evo 2 是否能輸出看起來合理的基因,而是決定測試它們是否能輸出完整的基因體。

他們選擇作為測試案例的模型病毒是名稱響亮的 ΦX174,它屬於感染大腸桿菌的病毒家族。除了使用地球上研究最透徹的細菌進行測試的便利性外,ΦX174 還具有多項顯著特徵。它相當簡單:約 5,400 個鹼基上分佈著 11 個基因,所有 11 個基因都具有已識別的功能,且病毒的感染週期已得到充分描述。

從與大型基因體模型協作的角度來看,它還有一個有用的特徵:病毒的末端總是具有相同的短序列鹼基。因此,如果將這些鹼基作為提示詞,大型基因體模型應該能夠識別出它需要回傳一個與 ΦX174 有某種關聯的序列。

為了進一步準備模型,Evo 1 和 Evo 2 被輸入了超過 200 萬個額外的噬菌體 DNA 序列,然後用 ΦX174 所屬的微小病毒科(Microviridae)特有序列進行微調。之後,他們嘗試了不同的提示詞。如果提示詞包含過多的 ΦX174 起始序列,它只會簡單地回傳基因體的其餘部分。如果太少,它將生成大量不相關的序列。研究人員最終發現,使用四到九個鹼基的起始序列作為提示詞效果最好。

雖然輸出被設定為回傳類似 ΦX174 的東西,但它們實際上可以是任何東西,從與正常病毒幾乎一模一樣的副本到僅僅模糊地具有病毒特徵的序列。為了解決這個問題,研究團隊對輸出設定了許多預設條件,旨在排除一些極端的結果,同時仍允許一定程度的修改。

例如,ΦX174 使用其自身的刺突蛋白來附著並感染細菌;如果編碼刺突蛋白的基因缺失或受損,病毒就無法運作。因此,他們丟棄了任何刺突蛋白與真實病毒相似度低於 60% 的輸出。他們還排除了過長或過短(< 4,000 個鹼基或 > 6,000 個)、包含超過 10 個相同鹼基的連續序列,以及兩種鹼基配對(GC 和 AT)頻率異常的病毒。

在電腦分析階段排除這些不符合條件的序列後,他們剩下合理數量的潛在輸出進行測試:302 個建議的病毒序列。他們能夠化學合成其中 285 個序列,並將它們插入細菌中觀察結果。在大多數情況下,結果是「什麼都沒有發生」。但有 16 個序列成功抑制了大腸桿菌的生長,表明它們確實作為病毒發揮作用。其中 9 個是 AI 最初輸出的序列,其餘 7 個在插入細菌後獲得了額外的突變。

在某些方面,這些設計的病毒與原始的 ΦX174 非常相似,但在其他方面則相當不同。

從「相同」的角度來看,在 285 個測試輸出中最有效的病毒,往往與原始病毒非常相似。在 285 個測試輸出中,只有 16 個是可行的病毒(5.6%)。但如果只看與原始 ΦX174 最相似的輸出(序列相似度達到 98% 或更高),可行性則上升到 46%。因此,如果病毒與正常的 ΦX174 不太相似,那麼它作為病毒運作的可能性就很低。

大多數可行的病毒都具有原始病毒中發現的相同基因組。在病毒基因體複製開始的 DNA 片段中,沒有任何一個病毒有單一的改變。

所有這些都與過去的研究結果一致,這些研究表明,即使只改變一個鹼基,導致病毒基因體中一個蛋白質的一個胺基酸發生變化,平均也有 20% 的機會使病毒完全失活。ΦX174 不僅害怕改變;它通常會因此而死亡。因此,AI 建議的改變產生了一群可行的病毒,這些病毒平均而言與原始病毒非常相似。

然而,作為個體,這些病毒卻相當獨特。其中一個完全失去了其中一個病毒蛋白質,並透過基因體其他地方的改變來彌補其損失。另一個則增加了一個全新的基因。許多基因比原始基因更長或更短。甚至有一個用來自一個遠緣相關病毒的基因取代了 ΦX174 的一個基因。

研究人員基於任何一個胺基酸改變有 20% 機會使病毒失活的觀點,進行了一項有趣的分析。他們計算後表示,任何改變少於 25 個的病毒,其可行性只有 2.3%。在 AI 輸出的約 300 個病毒中,有 5 個病毒落在這個範圍內,其中 3 個是可行的。

當胺基酸改變超過 25 個時,產生可行病毒的機會基本上為零。然而,近四分之一的 AI 建議病毒,即使改變超過 25 個,仍然是可行的,其中兩個甚至有超過 50 個胺基酸的改變。

這告訴我們,AI 比隨機突變更有可能產生能維持病毒活性的改變。

這項研究從學術角度來看很有趣,但研究人員也表明它可能有用。噬菌體已被測試作為對抗標準抗生素有抗藥性的細菌感染的療法。但許多細菌菌株已經對某些病毒家族(包括 ΦX174)產生了抗藥性。一個潛在的解決方案是使用噬菌體混合物,因為對所有噬菌體都產生抗藥性可能不容易甚至不可能。

而在這裡,AI 產生了一種潛在的病毒混合物。因此,團隊測試了一種通常以大腸桿菌為食的天然噬菌體混合物,並將其與 16 種可行的 AI 產品混合物進行比較。在他們的測試中,天然噬菌體混合物失敗了,但 AI 生成的組別成功地迅速演化出感染其原本具有抗藥性宿主的能力。研究人員猜測,克服抗藥性的過程涉及一些 AI 設計的病毒交換 DNA 片段以及額外突變的出現。

目前尚不清楚這是否是一項重大的潛在益處;噬菌體療法已考慮多年,但儘管抗藥性細菌菌株問題日益嚴重,卻尚未廣泛應用。作者們非常清楚,大型基因體模型伴隨著風險。儘管他們從訓練數據中排除了感染脊椎動物的病毒,但任何擁有足夠計算資源的人都可以重複此過程,並將這些病毒納入其中。

這篇論文最後呼籲對此類及相關領域(例如訂購客製化 DNA 序列)進行更好的治理。然而,到目前為止,AI 的監管在很大程度上未能跟上該領域的快速發展。