消費型穿戴裝置利用動作和生理感測器來估計活動和睡眠,但這些訊號只能間接反映血糖調節情況。連續血糖監測器 (CGM) 透過植入皮膚下的小型感測器,每隔幾分鐘追蹤間質血糖,捕捉空腹、夜間和餐後模式,補充了這些測量數據。然而,解讀這些追蹤數據仍具挑戰性,尤其當高品質的臨床標籤稀缺且獲取成本高昂時。
許多現有的 CGM 基礎模型,包括 CGMformer、GluFormer 和 CGM-JEPA,都透過單一表示流處理血糖數據,而非明確區分緩慢的基線和瞬態事件動態。但 CGM 並非未經區分的數據流:它包含相對緩慢的基線模式,並夾雜著可能反映飲食、活動或感測器偽影的短期偏差。
如果我們能利用日常 CGM 數據,在有限的標註數據下,估計糖尿病風險、胰島素阻抗和胰臟 β 細胞功能障礙等指標,那會怎麼樣呢?
這就是我們開發 GlucoFM 的原因,它是一個自我監督的基礎模型,採用雙流設計,將較慢的血糖趨勢與短期偏差分開,同時保留了時間和數據缺失的資訊。潛在預測目標隨後學習其每日情境和時間演變。我們在四個不同群組上,針對七項臨床預測任務(糖尿病風險、胰島素阻抗、胰臟 β 細胞功能障礙、高血脂、低血糖、肥胖和血糖類型)評估了 GlucoFM,共進行了 14 次群組-任務評估。
在這些評估中,GlucoFM 的 PR-AUC 平均比表現最佳的 GluFormer 變體高出 5.8 個百分點,兩者都在相同的語料庫上進行預訓練。在 PR-AUC 方面,GlucoFM 在所有糖尿病風險和胰臟 β 細胞功能障礙評估中均領先,並在四項胰島素阻抗評估中有三項領先。
我們還評估了 GlucoFM 在餐後血糖反應 (PPGR) 預測方面的表現。在匹配的輸入和評估協議下,GlucoFM 在兩種 CGM 裝置(Dexcom 和 Libre)上的平均絕對誤差 (MAE) 達到最低。此外,GlucoFM 實現了最佳的整體跨資料集遷移性能,並展現出強大的少量樣本適應能力,即使新群組或標註受試者的數據極為有限也能表現良好。
訓練 GlucoFM 理解代謝
我們使用來自 Wear-CGM 和四個已發表資料集的 109,066 小時未標註 CGM 數據對 GlucoFM 進行預訓練,總計 477 份參與者/會話記錄。CGM 記錄可能包含間隙、不同的採樣間隔和感測器偽影。GlucoFM 將每個記錄對齊到 24 小時、五分鐘的網格,並保留一個觀察遮罩,使測量和未觀察到的位置保持區分。
其雙流編碼器將代表較慢血糖趨勢的低頻狀態成分,與捕捉可能源於生理、行為或感測偽影的短期偏差的殘差事件成分分開。GlucoFM 不重建精確的原始血糖讀數,因為這些讀數可能受到測量雜訊和感測器偽影的影響,而是使用潛在預測預訓練,包含兩個互補任務。
情境預測: 我們遮蔽(即隱藏)每日血糖序列的一部分,並要求模型從周圍情境中預測其潛在表示。透過在潛在空間中進行預測,模型能夠捕捉更廣泛的每日血糖模式,而無需重建每個感測器讀數。
時間動態: 我們還訓練模型預測一個人的穩定基線和短期偏差將如何從一個小時轉移到下一個小時。這鼓勵模型捕捉血糖動態的連續性,而不是將讀數視為時間中孤立的快照。最後,CGM 感知增強引入了基線漂移、類似壓縮的下降、更稀疏的採樣和短暫斷開,使模型暴露於真實 CGM 記錄中遇到的變異性和缺失數據。
GlucoFM 的能力
我們在四個群組(CGMacros、Stanford、Hall 和 ShanghaiT2DM)和七項臨床預測任務中評估了 GlucoFM,並單獨評估了兩小時餐後血糖反應預測。具體來說,我們探討了其凍結表示是否能為未見過參與者的單個 24 小時窗口提供資訊;是否為預測餐後血糖軌跡提供有用的歷史情境;結合多天數據是否能改善受試者層級的預測;這些表示如何良好地遷移到新群組;以及當標註數據有限時,它們如何有效地適應。
代謝任務的準確性
首先,我們使用了受試者分離的窗口級線性探測。我們凍結了每個模型的編碼器,在單個 24 小時表示上訓練了一個線性分類器,並確保沒有參與者同時出現在訓練和測試折疊中。這測試了單日表示是否對未見過的參與者具有表型資訊,同時保留了日復一日的變異性。
GlucoFM 在所有評估方法中實現了最強的任務平均 PR-AUC。在 14 次群組-任務評估中,它將最強的 CGM 特定基準(在相同數據上重新訓練)的平均 PR-AUC 從 54.7 提高到 58.8,絕對提高了 4.1 個百分點,相對於該基準約為 7.5%。GlucoFM 在所有糖尿病風險和胰臟 β 細胞功能障礙評估中均實現最高的 PR-AUC,並在四項胰島素阻抗評估中有三項領先。
預測餐後血糖反應
為了在動態預測任務上測試 GlucoFM,我們使用每次記錄餐前可用的資訊,預測相對於餐點開始值的完整兩小時血糖變化軌跡。我們使用受試者分離的交叉驗證,評估了來自 34 名參與者的 874 個配對餐點事件,並在相同的分割下分別建模 Dexcom 和 Libre(兩種 CGM 裝置)。
我們逐步將每個凍結的模型表示與一小時的餐前 CGM、餐點營養資訊(包括能量、碳水化合物、脂肪、蛋白質和膳食纖維)以及參與者層級資訊(如空腹血糖、BMI 和糖尿病狀態)結合。在完整情境下,GlucoFM 在所有評估模型中實現了最低的平均 MAE:21.88 mg/dL,而最佳基準為 22.90 mg/dL,訓練折疊平均基準為 27.69 mg/dL。這些結果表明 GlucoFM 為預測餐後血糖變化提供了互補的歷史情境。
超越單日觀察
單一的 24 小時追蹤可能無法完全捕捉一個人的血糖模式,因此我們測試了結合多天數據是否能改善受試者層級的預測。GlucoFM 分別編碼每一天,並將最多七天的表示進行平均,每個參與者貢獻相等。
如下圖所示,額外的天數在大多數資料集的大多數設定中都改善了 PR-AUC,包括 Stanford 胰臟 β 細胞功能障礙增加了 9.6 個百分點,Hall 糖尿病預測增加了 14.0 個百分點。CGMacros 在 Dexcom、Libre 和融合感測器數據上也顯示出大部分正向增益。
上海 T2DM 胰島素阻抗是簡單平均法下的主要例外,這表明最佳的聚合策略可能因任務而異。總體而言,GlucoFM 的凍結每日表示可以結合起來,在不重新訓練編碼器的情況下加強受試者層級的預測。
跨群組泛化
接下來,我們想知道模型學習到的生理模式是否能泛化。如果我們使用來自一個臨床群組的數據訓練下游分類器來識別糖尿病風險,它是否仍然適用於來自完全不同研究的患者?跨資料集遷移長條圖突顯了 GlucoFM 如何應對這一挑戰,特別繪製了它在糖尿病風險和胰島素阻抗方面相對於次佳模型的直接改進。
在下圖中,正向長條表示 GlucoFM 優於最強的競爭方法:它在 12 次評估中有 11 次領先 0.5 – 8.6 個 PR-AUC 百分點,僅一次落後 0.6 個百分點。其絕對 PR-AUC 範圍從 Stanford 到 Hall 任務的 61.6% 到 Hall 到 CGMacros 胰島素阻抗的 90.0%,這表明專注於底層生理學有助於凍結表示忽略群組特定的雜訊,找到普遍的代謝模式。
用更少數據學習
標註的臨床數據獲取成本高昂,因此我們還在兩種少量樣本設定下測試了 GlucoFM:左圖顯示了每類標註參與者的數量變化,而右圖顯示了每個參與者可用觀察數據的比例變化。向右移動表示增加標註數據,點越高表示任務平均 PR-AUC 越好。
橙色的 GlucoFM 標記在每個評估的數據預算下都是最高的,包括最有限的設定,例如每類一個樣本和 1% 的觀察數據。當標註受試者稀缺時,這種優勢尤其明顯,顯示該模型即使只有少量範例也能高效地捕捉正確的訊號。
在兩個時間尺度上建模血糖動態
我們還仔細研究了將訊號分成兩個流是否真的有所不同。我們將完整的雙流設計與更簡單的替代方案進行了比較:一個直接處理原始血糖,一個旨在強調較慢的趨勢,另一個旨在強調較快、短期的偏差。
正如我們的編碼器設計分析所示,「僅事件」版本是最弱的,證明僅靠瞬態波動不足以形成穩定的代謝圖景。雖然原始輸入和「僅狀態」版本具有競爭力,但完整的雙流模型始終表現最佳。這些結果支持在結合之前,將較慢和較快的血糖動態組織為互補流,而不是僅依賴其中任何一個流。
結論
我們的結果表明,CGM 模型可以從明確考慮血糖動態的多尺度結構中受益,包括較慢的趨勢、短期偏差、每日時間和感測器數據缺失。透過從未標註的 CGM 中學習可重複使用的模式,GlucoFM 生成的表示在評估的預測、遷移和少量樣本設定中表現出色,提供了一種更好地利用有限標註臨床數據的方法。
代謝反應因人、群組和感測器裝置而異,而我們目前的預訓練人群規模仍然不大。我們的下一步是訓練更大、更多樣化的人群,並將 GlucoFM 從獨立處理的 24 小時窗口擴展到原生的多日建模,以捕捉數週或數月內展開的趨勢,並探索這些表示如何處理即時變化。關於代謝健康仍有許多值得學習的地方,我們很高興看到這些工具將帶我們走向何方。
致謝
以下研究人員對這項工作做出了貢獻:Zechen Li, Keerthana Natarajan, Weizhi Zhang, Simon A. Lee, Yuwei Zhang, Maxwell A Xu, Menglian Zhou, Zeinab Esmaeilpour, Flora D. Salim (來自 Monash 大學)。


