藥物開發是一項高成本、高風險的事業,在市場日益強調先發優勢的壓力下,其挑戰不斷增加。自 1950 年代以來,新藥開發成本大約每九年翻倍,這種現象被稱為厄倫定律(Eroom’s Law)。如今,將一種新藥推向市場平均需要 10-15 年,成本介於 10 億到 25 億美元之間,失敗率高達 90% 以上。

AI 已成為製藥業提高成功率和縮短時程的最大賭注。藥廠越快識別、測試和優化新的化學化合物,開發後期發生昂貴失敗的風險就越低。全球生命科學公司 Cytiva 蛋白質研究策略總監 Paul Belcher 表示:「藥物開發的主要成本仍在臨床階段,因此試圖降低風險並提高成功率顯然非常有益。」他補充說:「AI 是一種藥廠希望不僅能節省時間、壓縮時程,還能讓更高品質的候選藥物進入臨床的方法。」

AI 在藥物發現的早期應用展現了潛力,但也凸顯了對可靠真實資料以及實驗室系統整合的需求。AI 為實驗室帶來效率,其中最有前景的早期應用之一是命中化合物篩選(hit identification)。這涉及篩選分子實體庫,以針對與疾病相關的靶點(例如蛋白質)尋找能與其結合的分子。

成功的命中化合物為研究人員提供了進一步測試和精煉的起點,目標是最終開發出可行的藥物。Belcher 觀察到從經驗篩選轉向預測性設計的轉變:藥廠現在不再是物理篩選化合物庫,而是使用 AI 從頭設計候選藥物,並在投入研發(R&D)之前預測它們將如何與疾病靶點互動。

這意味著公司不再受限於物理篩選的數量來識別起點。Belcher 說:「AI 消除了這種限制。」他補充:「它還可以幫助在物理測試之前,淘汰低品質的候選藥物,從而節省時間和資源。」

然而,Belcher 指出,AI 尚未能可靠地預測新化合物的動力學或可開發性。這表示每個 AI 生成的候選藥物仍需要在實驗室中進行驗證。傳統的篩選工作流程旨在大規模識別命中化合物,而非詳細分析大量複雜的候選藥物。這給實驗室團隊帶來了更大的壓力,他們現在必須測試、表徵和純化數量不斷增加、種類更多樣的 AI 生成化合物。

Belcher 解釋:「目前用於命中化合物篩選的技術可以篩選數十萬,有時甚至數百萬種化合物,使用二元或基於閾值的技術產生低保真度資料,即『是』或『否』的反應。」他補充:「AI 可以增加命中化合物的數量,並可能提供更高品質的命中化合物。這增加了對更高通量、資訊豐富技術的需求,以進一步驗證和表徵這些命中化合物。」

模型需要完整、高品質的資料。隨著 AI 加速了對資料豐富實驗室系統的需求,它也凸顯了對更好、更完整資料的根本需求。許多早期的 AI 模型都是在公開可用的資料集上訓練的,現在正遇到 Belcher 所稱的「資料瓶頸」。

由於模型存取相同的資料,它們都得出相似的結論,隨著時間推移回報遞減。此外,這些資料集在建構時並未考慮到 AI 的需求,這意味著它們缺乏保持模型準確和無偏誤所需的結構、標籤和多樣性。

出版偏誤加劇了這個問題。Belcher 說:「大多數公開可用的資料集和科學出版物都只關注正面結果。」他指出:「沒有人願意分享他們的失敗。這種偏誤幾乎就像是綁住了一隻手。AI 模型可以識別與成功相關的模式,但它們缺乏對失敗的全面理解,而這正是讓預測更可靠的關鍵。」

Belcher 認為能顯著改善模型的資料,那些失敗的實驗、那些無法結合的化合物,仍然難以取得,令人沮喪。他說:「我們常開玩笑說應該要有一本『負面資料』期刊。」他補充:「這些資料通常埋藏在實驗室筆記中,從未被用來指導或引導未來的研究。」

這種負面資料的缺乏造成了一個根本問題:如果無法存取廣泛的資料,模型就無法充分訓練以避免偏誤。Belcher 指出:「在所有機器學習應用中,模型的效能都高度依賴於訓練資料的品質和範圍。」

隨著 AI 的發展,資料偽造也變得更加容易,加劇了對資料完整性的擔憂。以西方墨點法(Western blots)為例。這是識別血液或組織樣本中蛋白質的標準技術之一,也是生物醫學研究中最常見的篡改目標之一。Belcher 引用荷蘭微生物學家 Elisabeth Bik 的研究,她發現近 4% 的生物醫學論文包含重複或篡改的圖像。這是在 2016 年,當時生成式 AI 還未讓偽造變得如此輕而易舉。

Belcher 說:「篡改或偽造的資料在科學界一直是一個問題,但在 AI 世界中,特別是當它被用來訓練模型時,可能會產生潛在的災難性後果。」他強調:「需要更多工具來驗證資料是否未經篡改。」

一些供應商已開始應對這項挑戰。Belcher 指出,例如 Cytiva 的 Image Integrity Checker 解決方案,它使用安全雜湊演算法(與區塊鏈相同的技術)來檢測科學圖像是否被篡改。他補充:「我們開始看到許多出版商對此表現出濃厚興趣,希望將其作為標準採用,因為這是一種快速確保出版文獻真實性的方法。」

自動化實驗室有望加速突破。Belcher 將藥物發現的未來狀態描述為幾乎無需人工干預的全自動化實驗室。實現這一願景的基礎是資料和基礎設施的一致性。

這些由 AI 驅動的「暗實驗室」(dark labs),或稱「閉環實驗室」(labs-in-the-loop),全天候運作。它們循環進行預測、測試和優化,然後將結果回饋給 AI 模型,以指導下一輪實驗。Belcher 表示,這可以提高進入臨床試驗的候選藥物成功率。更好的起點,結合更多輪的優化,應該能產生更優質、更少風險的候選藥物進入臨床。

然而,實驗室的自動化高度依賴於整合。這意味著需要可互通的系統、高度結構化和全面的資料集,以及資料的輕鬆進出。大多數實驗室尚未達到這個水平。Belcher 指出:「如今,實驗室中的許多儀器都是獨立運作的。」他補充:「你可以擁有世界上最好的技術,但如果它是一個封閉的生態系統,如果使用者無法取出資料,那它就毫無用處。」

整合的基礎設施可以使實驗室大規模生成 FAIR 資料(可尋找、可存取、可互通、可重複使用)。這不僅能為個別實驗室報告提供資訊,還可以訓練後續世代的 AI 模型,有效地在計算機驅動的「乾實驗室」(dry lab)與實體「濕實驗室」(wet lab)之間形成閉環。

Belcher 說:「我們的目標是幫助科學家和研究人員加速他們的突破,並使自動化實驗室的未來狀態成為現實。」他表示:「我們希望幫助他們生成可靠的資料,簡化發現過程中的工作流程,並希望他們正在研究的成果能更快、更有信心地成為改變生命的療法。」

關於成本與下一步:AI 驅動的藥物發現仍處於早期階段。值得注意的是,目前還沒有主要透過 AI 驅動設計發現的藥物獲得 FDA 的全面批准,儘管 Belcher 預計這將在未來兩到三年內改變。

AI 最終能對藥物發現產生多大的影響?Belcher 說:「最終目標將是完全透過電腦模擬預測藥效和毒性,從而消除絕大多數實體濕實驗室工作的需求。」但除了模型的成熟度之外,還有許多障礙,包括監管挑戰和成本問題。史丹佛大學的一項研究發現,自 2016 年以來,訓練尖端 AI 模型的成本每年翻倍以上,這給一個已經以極高研發支出為特徵的行業增加了更多財務壓力。

Belcher 承認這種緊張關係,但對未來仍保持樂觀。他說:「我認為我們將達到一個平衡點,從成本和風險的角度來看,AI 和濕實驗室工作之間會取得平衡。」他補充:「只要計算成本永遠不會超過臨床開發成本,我認為 AI 將會是一個優勢。」

了解更多 Cytiva 如何利用更快的發現來重塑蛋白質純化工作流程。此內容由 MIT Technology Review 的客製內容部門 Insights 製作。它並非由 MIT Technology Review 的編輯人員撰寫。它由人類作家、編輯、分析師和插畫家研究、設計和撰寫。這包括調查的撰寫和資料收集。可能使用的 AI 工具僅限於經過徹底人工審查的次要生產過程。