Talos 是一款開源工具,用於自動化、迭代地重新分析罕見疾病的基因組數據。隨著科學知識不斷演進,它能有效率地重新檢視儲存的定序資料,並標記出具有新證據的變異。
Talos 經過優化,具有極低的偽陽性率:在近 1,100 名患者的驗證集中,它恢復了 90% 的範圍內診斷,同時每位患者僅標記 1.3 個候選變異供專家審查。這對於大規模持續進行再分析至關重要。
Talos 已部署於近 5,000 名未確診患者的前瞻性世代,帶來了 241 例新診斷(額外診斷率 5.1%)。從支持性證據公開到最終診斷,平均僅需 32 天。
在每月迭代週期中,分析師平均每 200 名患者只需審查一個新變異,這證明了頻繁、系統性的再分析可以持續運行。
為何基因組再分析至關重要
基因組檢測已徹底改變了罕見疾病的診斷方式,但即使有了這項進展,仍有超過一半的患者在首次檢測後未能確診。這是因為我們對基因組的知識仍不完整,研究人員每天都在學習更多關於特定基因功能及其與疾病關係的知識。
然而,與大多數診斷調查不同,基因組數據具有獨特的特性:它可以無限期地儲存和重新檢視。由於我們對基因組的理解不斷進步,僅僅在稍後重新運行分析,就可能得出首次無法做出的診斷。這是因為每年都有數百個新的基因與疾病關聯以及數千個新的變異分類被報告。
對未確診患者的基因組進行再分析是解決方案;一項針對近 9,500 名未確診患者的統合分析發現,在約兩年內,再分析將診斷率提高了約 10%。然而,問題在於目前的再分析絕大多數是人工進行的,它依賴於積極的臨床醫師、稀缺的實驗室人員以及不一致的報銷政策,因此絕大多數儲存的基因組從未被重新檢視,數據不斷累積。
自動化長期以來被認為是解決方案,但自動化機器的開發者必須在敏感度、特異性、人類需要審查的候選變異數量以及分析運行頻率之間權衡取捨。
Talos 是由人口基因組學中心、Australian Genomics、Broad Institute 和 Microsoft 合作開發的,旨在解決這些權衡問題,並在國際規模上證明系統性再分析既可行又有價值。我們最近發表了一篇期刊文章,詳細介紹了 Talos 的運作方式並評估了其在多個罕見疾病世代中的表現。
Talos 的運作方式
Talos 每次運行時,都會根據最新的社群知識重新解釋患者現有的變異判讀。它利用兩個持續更新的公共資源:PanelApp Australia 用於基因與疾病關係和遺傳模式,以及 ClinVar 用於變異層級的致病性。然後,它應用一種變異優先排序演算法,旨在找出最有可能符合 ACMG/AMP 臨床報告標準的變異。
Talos 流程概述。Talos 分多個階段運作,首先收集關於基因變異和擁有這些變異的患者的不變資訊,然後應用最新知識來篩選和優先排序可能具有臨床相關性的變異,最後將這些變異連同支持性證據呈現給臨床醫師。
該流程利用新發現的資訊來標記和篩選變異,然後利用家庭結構(例如,遺傳模式和新生變異狀態)以及患者的表型(如果可用)來精煉候選集。Talos 可用於解釋來自外顯子或基因組數據的單核苷酸變異、小型插入/刪除、拷貝數變異和大型結構變異。
Talos 有兩個獨特的設計選擇。首先,它刻意採取保守策略,優化為返回一小組高可信度變異,而不是一個冗長的排序列表,因為在真實世界的基因組再分析中,限制因素是人類審查時間,而非演算法召回率。其次,在重複運行時,Talos 只返回自上次週期以來支持性證據已發生變化的變異,讓臨床醫師能夠專注於真正的新發現。
經專家人工分析驗證
我們在兩個獨立的世代中對 Talos 進行了基準測試,這些世代之前都經過了仔細的人工分析:澳大利亞重症嬰幼兒急性護理基因組學 (ACG) 世代,以及美國的罕見基因組計畫 (RGP) 世代,該世代包含先前無診斷結果的家庭。這總共包括 1,089 名先證者。
在 ACG 三人組中,Talos 恢復了 90% 的範圍內診斷,同時每個家庭平均僅返回 1.3 個候選變異。它錯過的診斷主要是由於其保守策略的直接結果,例如缺乏 ClinVar 支持的隱性變異,而人類分析師則透過反式配置或功能性研究進行了分類。
關鍵的是,Talos 在截然不同的 RGP 世代中保持了相同的操作點,RGP 世代是一組先前臨床檢測無診斷結果的家庭,先證者年齡高達 82 歲。在 RGP 三人組中,它恢復了 87% 的範圍內診斷(54 例中的 47 例),每個三人組平均 1.3 個候選變異,顯示了跨世代的普遍性。
然後,我們與廣泛使用的優先排序工具 Exomiser 進行了直接基準測試。Talos 在小型變異的整體敏感度上與之匹配,但操作點截然不同:Exomiser 排序並返回一個廣泛的列表,而 Talos 返回一個簡短、高度特異性的列表。在配對比較中,當 Exomiser 的所有排序變異都經過審查時,兩種工具在統計上無法區分,但一旦審查限制在實際預算內,前五名(p = 0.017)或第一名(p < 0.0001)排序變異時,Talos 顯著領先。
值得注意的是,這兩種工具發現了不同的變異,因此它們是互補的,理想情況下應在診斷流程中一起使用。
國際規模部署
我們最興奮的實驗是針對一個已檢測但未確診的世代,包含 4,735 名個體,這些個體來自 Australian Genomics 研究和一個單一診斷實驗室。大多數患者是單人,具有神經發育、心臟、腎臟和/或神經學指徵。
Talos 在 238 名個體中產生了 241 例新診斷,額外診斷率為 5.1%,所有可能致病變異隨後均經認證實驗室確認為致病性或可能致病性。
這些診斷的來源說明了為何再分析是一種如此強大的範式:其中 32% 來自原始檢測後發現的新基因與疾病關聯,22% 來自新的變異層級證據(重新分類),45% 來自改進的篩選和分析,包括原始未檢查的拷貝數變異 (CNVs) 和結構變異等變異類型、設定過於狹窄的表型篩選器以及其他來源。
診斷率在不同臨床領域保持一致(神經發育、心臟和腎臟指徵約為 5-6%),但原因有所不同:新的基因關聯和 CNVs 在神經發育診斷中佔主導地位,而變異重新分類則驅動了大多數心臟診斷。基因組數據表現優於外顯子數據(6.1% 對 4.8%),部分原因是達到了非編碼區診斷,例如 RNU4-2 和深層內含子 MRPL39 變異。
一個反覆出現的主題是傳統知識庫的滯後性:59% 的新基因與疾病診斷在再分析時尚未在 OMIM 中整理,這突顯了利用 PanelApp Australia 等快速更新資源的價值。
從一次性事件到持續計畫
隨後,我們運行了 Talos 進行了 29 個月的迭代週期。大多數診斷(92%)在世代的首次運行中得出,但迭代設計在兩個方面證明了其價值。首先,它展示了持續再分析的可擴展性:由於後續週期只返回新的可採取行動證據,因此在整個計畫中,平均每 200 個案例只發現一個變異。
其次,它展示了我們從科學發現到診斷的速度:從新知識出現在公共資料庫到患者獲得診斷,平均僅需 32 天,最快的案例在一天內完成。圖 2 提供了三個範例患者的時間線,顯示了持續再分析如何在科學新發現的數週內為家庭帶來答案。整個流程的運行成本足夠低廉,可以持續運行:註釋 1,000 個基因組的成本約為 11 美元,每月再分析的運行成本每個世代僅需幾美分。
三位範例患者的診斷歷程。每位患者在基因定序後等待診斷多年。對於患者 1,使其確診的科學發現發生在檢測後一個月,但直到首次使用 Talos 重新分析其基因數據後才做出診斷。對於患者 2 和 3,診斷在相關科學發現的一個月內做出,因為患者已經在再分析流程中。
展望未來
Talos 將基因組再分析從一個罕見、勞動密集型的事件,轉變為一個能夠跟上科學進步的持續、自動化計畫。透過優化特異性,它尊重了專家審查時間這個真正的瓶頸,並透過利用 PanelApp Australia 和 ClinVar 等公開共享、頻繁更新的資源,將全球社群累積的知識轉化為個別患者的診斷,通常在數週內完成。
我們相信我們已經建立了一項基礎能力,並很高興看到社群在此基礎上如何發展。特別是,隨著更先進的 AI 模型可用於理解和預測基因變異的後果,我們期待將它們應用於未解決的罕見疾病案例的再分析中。
Talos 是開源的,並且易於部署在 Azure 等雲端環境中。我們的結果為旨在為許多仍在尋求診斷的患者提供頻繁、可擴展再分析的醫療系統提供了實用的藍圖。



