據估計,目前全球有數十億穿戴式裝置正在使用中,精確追蹤著人們數天、數週乃至數月的心率、運動、皮膚溫度、血氧濃度和睡眠狀況。這種連續、長期的生理和行為數據流,為預防性、個人化健康提供了最有潛力的原始資料。
然而,將這些低階訊號轉化為有意義的洞察仍具挑戰。首先,每個人的基礎生理狀況、生活方式和健康狀況差異極大,因此對某人而言代表風險的模式,對另一個人可能不然。
其次,訓練模型所需的標籤(如確診、實驗室結果、經驗證的問卷)成本高昂、收集緩慢,且幾乎不可能回溯取得。因此,大多數穿戴式健康模型都是一次針對一個結果而建構,採用客製化、監督式的流程,目標狹隘,難以泛化到人類健康的廣泛領域。
在「邁向穿戴式健康資料的通用智慧與介面」這項研究中,我們採取了不同的方法。我們推出了 SensorFM,這是一個大型感測器基礎模型,能夠直接從大規模、未標記的穿戴式裝置數據中學習。
SensorFM 透過從五百萬名同意參與者的多模態感測器訊號中預訓練,數據量超過一兆分鐘,學習到一種單一、可重複使用的生理數據表示方式。這種表示方式可應用於心血管、代謝、睡眠和心理健康,以及生活方式和人口統計因素。據我們所知,這是迄今為止用於訓練模型最大且最多樣化的穿戴式裝置數據集。
為了建立預訓練語料庫,我們從五百萬名同意將其數據用於健康與保健研究的參與者中,抽取了去識別化的數據,這些數據收集於 2024 年 9 月至 2025 年 9 月之間。該數據集涵蓋了超過 100 個國家、美國所有 50 個州,以及超過 20 種 Fitbit 和 Pixel Watch 裝置型號。
我們從每個人身上提取了數週的數據,總計超過二十億小時(即一兆多分鐘)的每分鐘解析度訊號。SensorFM 攝取了來自五種感測器模態的 34 個一分鐘聚合特徵:光體積變化描記法 (PPG)、加速度計、皮膚電活動 (EDA)、皮膚溫度和高度計。這些數據共同捕捉了 24 小時內的心率和心率變異性、血氧飽和度、睡眠階段、運動和步數、皮膚電導率和溫度。
SensorFM 不依賴標籤,而是透過自我監督重建來學習,其基礎是 LSM-2 方法及其「自適應和繼承遮罩」(AIM) 框架。這是一個關鍵的設計選擇,因為穿戴式裝置的數據缺失和碎片化(例如,數據不可用的時間段)是常態,這可能是由感測器電源週期、裝置脫離手腕、省電模式操作以及感測器開關等各種因素造成的。
傳統的自我監督方法假設輸入是完整且不間斷的,因此被迫要麼填補空白(可能引入偏差),要麼丟棄不完整的數據窗口(這會浪費寶貴的數據)。AIM 則不採取這兩種方式:它將現實世界中的數據缺失視為一種自然現象,直接從不完整的記錄中學習,將真實空白處繼承的標記與為重建目標而人為遮罩的標記結合起來,並將兩者視為等效。
結果是,其表示方式在建構時就考慮到了數據缺失。SensorFM 不僅容忍碎片化數據,還能有效地利用它,如下面的生成結果所示。
對於任何基礎模型來說,一個核心問題是規模是否能轉化為能力。我們進行了一系列系統性的規模擴展實驗,預訓練數據量(從約 200 萬到 20 億感測器小時)和模型大小(從 10 萬到 1 億參數)都跨越了四個數量級。
結果顯示出清晰且令人鼓舞的訊號:隨著數據和容量的增長,預訓練損失會可預測地下降,而且,至關重要的是,這些提升會轉移到下游的健康任務中。在完整的五百萬人語料庫上訓練的最大模型 (SensorFM-B),其重建損失比最小版本減少了 31%,並在下游任務中平均提升了 9% 的分類任務效能 (AUC) 和 21% 的迴歸任務效能 (Pearson 係數)。
最大的改進來自於同時擴展這兩個維度。按比例增加數據和容量,在生成式預訓練和判別式下游效能方面都產生了接近線性的增益,且曲線沒有顯示出飽和的跡象。在所有模型變體中,SensorFM-B 在 35 個任務中贏得了 33 個。
為了測試所學表示方式的通用性,我們在 35 個判別式健康任務上評估了 SensorFM,這些任務來自三個獨立、經機構審查委員會批准的前瞻性研究,總計有 13,985 名參與者。這些任務涵蓋六個類別:心血管健康、代謝風險、心理健康、睡眠、人口統計學和生活方式。
為了直接探究嵌入的品質,我們保持 SensorFM 編碼器凍結,並在其之上僅訓練了一個輕量級的線性頭部,然後與基於特徵工程訓練的監督式基準進行比較。以下是我們的發現:
廣泛泛化:SensorFM 嵌入上的線性探測在 35 個任務中的 34 個上表現優於特徵工程的監督式基準,且無需任何任務特定的架構。隱式學習生理學:添加人口統計特徵(年齡、性別等)會帶來適度的提升,但隨著模型規模的擴大,這種提升會縮小,這表明較大的模型在預訓練期間會隱式捕捉與生理相關的特徵。
在難以測量的狀況中表現出色:規模化預訓練對於憂鬱症和焦慮症等狀況特別有價值,這些狀況因人而異,且在感測器數據中只留下微弱的痕跡。SensorFM 似乎能夠學習通常會掩蓋這些訊號的個體差異,並找出跨越不同人群的模式。
標籤效率:僅使用一小部分標記範例,SensorFM 就能迅速超越僅基於人口統計學和特徵工程的基準,這在醫療保健領域是一個重要特性,因為高品質的標籤非常稀缺。
一個通用的嵌入只有在適應它所需的努力程度下才有用。傳統上,將嵌入轉化為每個新端點的強大預測器,需要手動進行特徵工程、架構選擇和超參數調整,這是一項繁瑣的工作,隨著任務數量的增加而變得更加困難。
為了實現自動化,我們建立了一個「代理教室」:一組協作和競爭的 LLM 代理,它們迭代地生成、測試和完善可執行程式碼,以在 SensorFM 嵌入上建立預測頭部。在我們的實驗中,該系統探索了超過 30,000 種候選解決方案。
代理設計的頭部在 20 個分類任務中的 16 個和 15 個迴歸任務中的 12 個上擊敗了簡單的線性探測。有兩種模式特別突出:解決方案的品質在搜尋過程中單調提升,並且它與底層 LLM 的能力成比例,能力更強的模型(例如更新版本的 Gemini)產生更好的解決方案,而代理之間的協作有助於能力較弱的模型縮小差距。
最後,我們探討了 SensorFM 是否能端到端地發揮作用,作為一個將 AI 健康教練建立在個人自身生理數據基礎上的工具。我們將 SensorFM 整合到一個個人健康代理中,並比較了從 31 個真實參與者資料中生成健康摘要的三種條件:人口統計數據 + 每日穿戴式裝置指標 + SensorFM 預測;人口統計數據 + 每日穿戴式裝置指標 + 真實測量值;僅有人口統計數據 + 每日穿戴式裝置指標(基準線)。
一組對條件不知情的臨床醫生,根據五個評分維度,背景、相關性、合理性、個人化和潛在危害,對生成的摘要進行了評分,在超過 40 小時的專家評估中產生了 1,860 個評分。這些發現令人驚訝。在每個評分維度上,加入 SensorFM 預測顯著改善了相對於基準線的回應。
並且,將代理建立在 SensorFM 預測與實際真實測量值之間,沒有統計學上的顯著差異,這意味著模型的推論對代理的幫助,與真實標籤所能提供的幫助幾乎相同。
SensorFM 指出了穿戴式健康研究的一個轉變方向:從許多客製化、單一結果的模型,轉向一種單一、通用的人體生理學表示方式,這種方式可以靈活、高效且大規模地進行調整。透過從超過一兆分鐘的未標記感測器數據中學習,它能夠泛化到心血管、代謝、睡眠和心理健康等領域;支援標籤高效的適應和穩健的每日指標估計;可以透過代理教室自動進行專業化;並能將個人健康代理建立在個人自身的訊號基礎上。
我們要感謝來自 Google Research、Google DeepMind 和學術界的共同作者及合作夥伴對這項工作的貢獻。


