Quine 是一項研究計畫,旨在建立一個多模態的生物學世界模型,並透過互動式平台連接模型、科學工具、文獻和研究人員。
我們與哈佛大學和麻省理工學院的布羅德研究所(Broad Institute)研究人員合作,已利用此系統優先篩選出預計能促進腫瘤狀態轉變的化合物,並在多項濕實驗室分析中驗證了數個排名靠前的候選藥物。
Quine 學者計畫將提供一批科學家使用此系統的機會,加速他們自身的研究並提供科學回饋。
Quine 是一項實驗性研究技術,僅供研究用途,而非臨床或醫療用途。其輸出結果可能不完整或不準確,需要合格研究人員的審查以及適當的科學和實驗驗證。隨著技術成熟,我們預計將透過 Microsoft Discovery 等產品擴大其應用範圍。
二十多年來,微軟研究院一直致力於計算與生物學的交叉領域。我們的研究涵蓋了免疫學、病毒學、基因組學、生物醫學影像、細胞生物學和蛋白質工程。這項工作產生了基礎方法、新科學和技術,並已應用於臨床,從罕見病和傳染病診斷到癌症生物標誌物檢測。
在這項工作中,一個教訓變得越來越清晰:生物學並不像我們的模型和工具那樣,能被整齊地劃分為界線分明的區塊。基因影響蛋白質;蛋白質在細胞內相互作用;細胞組織成組織;實驗不斷重塑科學家的知識和他們接下來選擇探究的問題。因此,要在最困難的生物學問題上取得進展,需要的不是僅僅針對個別資料集或任務、能力日益增強的模型,而是能夠跨尺度和模態連接知識、對實驗和證據進行推理,並參與科學進步的迭代過程的系統。
今天,微軟研究院推出了 Quine,這是一項旨在跨越這些界限的研究計畫,反映了我們對一個透過科學使用而演進的發現系統的長期願景。Quine 將生物學的世界模型與一個連接科學工具、文獻、濕實驗室和使用這些工具的研究人員的平台結合在一起。
即使實驗技術不斷改進,濕實驗室的通量也隨之增加,生物學本質上仍受時間和複雜性的限制。自然無法被催促,也無法從第一性原理推導出來。實驗緩慢,迭代週期漫長,許多最重要的問題涉及相互作用、組合設計空間和下游效應,這些都太過龐大,無法單獨透過實驗探索。
同時,大規模機器學習的進步,特別是通用基礎模型和能夠迭代解決問題的推理模型的出現,預示著一種新的可能性。這些系統開始展現出超越模式識別的能力:整合跨領域資訊、對抽象概念進行推理,並支援迭代式問題解決。同樣重要的是,許多為人類語言開發的技術已被證明非常適用於生物學的各個方面,使模型能夠學習跨多樣資料類型和尺度的生物系統表示。
這給我們提出了一個發人深省的問題:建立一個生物學世界模型需要什麼?我們所說的世界模型,是指一個能夠表示生物系統狀態、預測該狀態如何響應干預而演變,並在未來多個步驟中推斷這些干預後果的系統。這樣的系統不會取代實驗。相反,它將使我們能夠在投入稀缺的實驗室資源之前,利用計算來探索、提出、排序和優先考慮潛在的前進路徑。我們的北極星是這樣一個未來:科學家、模型和實驗在一個持續加速的循環中運作。
Quine 是我們實現這一願景的第一步。它包含一個生物學世界模型和一個將模型連接到編排與推理模型、科學工具、文獻以及使用這些工具的科學家團隊的平台。
這項工作的核心是世界模型,它學習跨生物學模態和尺度的共享表示,包括序列、結構、功能、細胞狀態和影像資料。透過共同訓練這些模態,Quine 可以利用一種模態的證據來為另一種模態的預測提供資訊,捕捉那些若由系統協調單獨的單領域專業模型時可能被孤立或遺失的關係。
這種多模態設計反映了生物學的現實:理解任何一個層次都需要其他層次的背景。我們發現,跨這些連接的表示進行學習不僅沒有稀釋性能,反而強化了它,使模型能夠更有效地泛化並支援更廣泛的生物學推理任務。
透過將此模型整合到一個統一的系統中,該系統促進計算實驗並從迭代中學習,研究人員可以在實驗室測試之前生成跨模態的預測,並推斷生物干預的後果。至關重要的是,世界模型不需要完美,事實上,它永遠無法完美地模擬生物學,它只需要有效地為實驗設計提供資訊。
一個具體例子來自我們在胰腺導管腺癌(PDAC)方面的工作,這是最常見的胰腺癌形式,也是最難治療的癌症之一。我們與麻省理工學院和哈佛大學布羅德研究所的研究人員合作,多年來一直致力於開發和應用患者來源的離體模型,以探究一個長期存在的假設:腫瘤行為和藥物反應不僅取決於遺傳學,還取決於轉錄細胞狀態。在 PDAC 中,腫瘤細胞可以處於與其對治療反應相關的不同細胞狀態。
透過 Quine,我們現在已將該假設付諸實踐,探索癌症的非遺傳特徵,特別是細胞狀態,是否可以作為可操作的治療靶點。我們使用 Quine 預測並優先篩選了數千種化合物,根據它們將腫瘤細胞轉變為治療相關狀態的潛力。在專注於從經典細胞狀態轉變為基底細胞狀態的濕實驗室研究中,Quine 排名最高的化合物在實驗分析中產生了最大的預期轉變。
整個過程,從快速縮小化合物搜尋空間到優先篩選出少數有希望的候選藥物進行實驗室驗證,僅花費了一個週末,潛在地節省了數月的實驗工作和大量的研究成本。值得注意的是,一些最強烈的效果來自具有意想不到作用機制的化合物,提供了早期證據表明 AI 可以為藥物再利用和發現開闢新機會。
雖然反向狀態轉變(從基底細胞狀態轉變為經典細胞狀態)證明更為困難,但 Quine 預測現有化合物將產生這種較弱的效果。更值得注意的是,實驗揭示了一些我們沒有完全預料到的事情:Quine 預測有幾種化合物會持續將細胞轉向一種獨特的第三種表型,這一觀察結果在實驗室中得到了證實,這表明胰腺癌細胞狀態的圖景比簡單的經典-基底軸更豐富。這些實驗不僅驗證了模型的假設,也產生了新的假設。
我們在這裡的持續工作將利用新整合的 RNA 資料集和任務來表示這種更豐富的圖景,強化狀態轉變預測,並提供經過校準的置信度估計,幫助科學家優先考慮最有希望的濕實驗室測試假設。這正是 Quine 旨在支援的回饋循環。每一輪實驗都增進了我們對生物學的理解,而每一個新見解都可以成為下一代系統的訓練訊號。
我們創建 Quine 是為了改進我們自己的科學研究方式。隨著系統的演進,我們將其嵌入到我們正在進行的科學計畫中。每一個研究問題、實驗結果和意想不到的發現都成為完善模型、改進工作流程以及更好地理解 AI 如何有意義地加速我們研究的機會。隨著時間的推移,該系統成為我們在多個領域(包括癌症生物學、蛋白質工程、基因組學和生物影像學)進行發現的核心。
我們希望透過在早期階段推出 Quine 來繼續在此基礎上發展。Quine 源於我們自己的研究,但我們不希望其持續發展孤立進行。許多將決定其下一步發展方向的問題,並非我們能獨自回答;它們需要更廣泛科學社群的專業知識、創造力和視角。因此,我們正在啟動 Quine 學者計畫,將系統直接交到在生物學和醫學前沿工作的科學家手中。
負責任的開發始終是第一要務。我們相信 AI 和生物學的進步必須與安全、保障和負責任的管理齊頭並進。我們對 Quine 的開發和使用採取了審慎的分階段方法,初期僅限於 Quine 學者計畫和選定的研究合作夥伴。持續的內部審查和內建的安全措施將幫助我們在系統演進過程中保持適當的監督。隨著技術成熟,我們預計將透過 Microsoft Discovery 等產品擴大其應用範圍。
將 AI 在生物學領域的進展框定在基準測試和排行榜上是很有誘惑力的。這些固然重要,但 Quine 的真正考驗在於它在實際科學實踐中會發生什麼。當證據不完整時,它有用嗎?當面對從未真正被問過的問題時,它能提供幫助嗎?它能幫助縮短從問題到發現的路徑嗎?
最終,這才是我們關心的標準。我們的目標是讓 Quine 退居科學實踐的幕後,而科學本身則在前景中加速發展。主角不是模型或平台。



