穿戴裝置能大規模捕捉連續的生理訊號。這些訊號,從心率動態到睡眠模式,能在症狀出現前揭示早期生理變化。現在的瓶頸不再是數據收集,而是如何將這些訊號轉化為可靠且具臨床意義的生物標記。
現有的基於語言模型的代理系統能自動化部分科學工作流程,但常在處理生理時間序列數據時失效。這些系統過度優化預測性能,卻忽略了統計有效性,導致虛假相關、數據洩漏和脆弱的特徵。
為此,我們推出了「生物標記發現框架」(Biomarker Discovery Framework),這是一個多代理系統,將候選生物標記的優先排序構建為在人類監督下的迭代研究循環。透過結合假設生成、平行統計分析、模型訓練、對抗性驗證和基於文獻的推理,Biomarker Discovery Framework 在保持嚴格統計嚴謹性和人類監督的同時,加速了發現過程。
在三個隊列(共 9,279 名參與者觀察)中,Biomarker Discovery Framework 成功找回已知的臨床訊號,在獨立數據集中識別出趨同的生物標記,並在結合人口統計特徵後,改善了下游預測。
Biomarker Discovery Framework 結合了用於數值分析的確定性計算,以及用於假設形成和解釋的生成式推理。一個「協調者」(Orchestrator)代理將自然語言的研究指令分解為執行計畫,並引導專業代理完成六個階段的流程。同時,共享記憶、結構化事實表和通用工具確保了整個工作流程的可追溯性。
這六個階段包括:數據理解,由偵察代理(Scout agents)繪製數據模式、缺失值、時間結構和臨床終點,同時洩漏控制確保目標標籤與特徵建構分離。候選假設基礎,由文獻代理(Literature agents)和假設代理(Hypotheses agents)檢索並驗證先前的證據,然後提出生理上合理的特徵和複合測量。
接著是迭代發現循環,統計代理(Statistical agents)和機器學習代理(ML agents)執行確定性程式碼,以建構特徵、估計關聯、調整多重檢定並評估預測訊號。評論代理(Critic agent)識別薄弱假設和未解決的空白,並在需要時提示進一步分析。
對抗性驗證階段,評論代理(Critic agents)和防禦代理(Defender agents)對候選標記進行壓力測試,檢查目標洩漏、過度擬合、混雜敏感性、建構重疊、不穩定性和生理不合理性。一個結構化的 11 項內部檢查清單會分配明確的報告標籤,包括已篩選、條件性、探索性、已拒絕和不穩定。
深入研究與評估階段,機制代理(Mechanism agents)、新穎性代理(Novelty agents)和策略代理(Strategy agents)評估生物學合理性、先前文獻和潛在的轉化相關性,而不會將關聯視為因果證據。最後是報告撰寫與組裝,報告代理(Report agents)根據事實表驗證數值主張,並將分析、圖表、文獻和限制編譯成草稿,供專家審查。
舉例來說,當收到一個優先排序與憂鬱症嚴重程度相關的穿戴裝置候選標記的請求時,Biomarker Discovery Framework 分析了 DWB 數據集,提出了睡眠時間變異性特徵,並估計了睡眠時長變異性與 PHQ-8 嚴重程度之間的關聯(ρ = 0.252)。該工作流程隨後檢查了穩定性、洩漏、亞組一致性和替代解釋,然後將結果構建為一個基於文獻的晝夜節律不穩定假說,供人類審查。
為了評估 Biomarker Discovery Framework 從嘈雜數據中提取合理生理洞察的能力,我們將其獨立應用於三個大型隊列,總計 9,279 名參與者觀察,涵蓋心理健康(DWB 和 GLOBEM)和代謝疾病(WEAR-ME)領域。該流程自主識別出 41 個心理健康候選數位生物標記和 25 個代謝結果候選數位生物標記。
Biomarker Discovery Framework 不僅僅是選擇現有變數;它還建構了新穎的複合特徵。例如,在心理健康領域,它將睡眠時長變異性和睡眠起始時間變異性識別為憂鬱症嚴重程度的主要相關因素。在代謝領域,它推導出心血管健康指數(步數除以靜息心率)作為胰島素阻抗的非侵入性相關因素,並將其與先前關於葡萄糖調節和心臟代謝健康的文獻聯繫起來。
我們將 Biomarker Discovery Framework 部署到三個不同的大型隊列中,總計 9,279 名參與者觀察,涵蓋心理健康和代謝疾病領域。在兩個憂鬱症領域中,Biomarker Discovery Framework 優先考慮了相關晝夜節律不穩定結構的不同操作化定義。
在 DWB 中,睡眠時長變異性與 PHQ-8 嚴重程度相關(ρ = 0.252,p < 0.001)。在 GLOBEM 中,睡眠起始時間變異性作為一個探索性、低訊號的關聯與 PHQ-4 相關(ρ = 0.126,p < 0.001;CV AUC = 0.535)。由於隊列、終點和特徵定義不同,且沒有重複出現完全相同的候選標記,這種模式應被解釋為暗示結構層面的趨同,而非直接複製。
總體而言,Biomarker Discovery Framework 識別出 41 個心理健康候選數位生物標記和 25 個代謝結果候選數位生物標記。雖然效應量反映了被動感測數位表型分析中常見的適度大小,但將這些由 Biomarker Discovery Framework 導出的特徵與人口統計變數結合後,預測性能有所提升(憂鬱症的 ΔR² = 0.040,胰島素阻抗的 ΔR² = 0.021)。
為了評估手稿品質,15 位醫學、生物醫學數據科學、機器學習、生物資訊學和數位健康領域的專家審查了來自 Biomarker Discovery Framework 和三個當代 AI 研究系統(Google DeepMind 的 AI co-scientist、Biomni 和 Google ADK 的 Data Science Agent)的盲評報告。
Biomarker Discovery Framework、Biomni 和 Data Science Agent 在 21 個會話中一起評分,而 Biomarker Discovery Framework 則在單獨的 13 個會話中使用相同的評估工具進行評分。
在盲評中,Biomarker Discovery Framework 在所有七個品質維度上均獲得最高平均分數。根據研究模擬的編輯評分標準,它是唯一獲得「接受」或「小幅修改」建議的系統:2 個接受,8 個小幅修改,8 個大幅修改,3 個拒絕。
審稿人估計,他們平均會保留 56.9% 的 Biomarker Discovery Framework 生成的手稿內容,而基準系統的保留率為 18.8%–30.4%,並在 13 次四系統排名會話中的 9 次中將 Biomarker Discovery Framework 排名第一。
隨著穿戴式健康數據在人群中持續擴大規模,數位醫療的瓶頸不再是數據收集,而是有原則、嚴謹的假設生成。單純擴展模型能力並不能解決科學嚴謹性的問題。
然而,當 AI 部署在一個精心設計的架構中,將確定性計算與生成式推理分離,並迫使代理們防禦性地辯論其發現時,AI 就能在人類監督下支持結構化的假設生成、驗證和優先排序。透過從黑箱自動化轉向透明、人類參與的工作流程,我們可以建立能夠安全加速臨床研究中「假設到驗證」週期的 AI 系統。
這篇部落格文章由 Google Research 的 Yubin Kim、Hamid Palangi 和 Daniel McDuff 撰寫。這項工作由麻省理工學院博士生 Yubin Kim 在 Google 實習期間主導,導師為 Daniel McDuff 和 Hamid Palangi。
我們感謝來自 Google Research、Google DeepMind 和學術界的共同作者和合作者對這項工作的貢獻。


