當醫師會見病患時,諮詢遠不止於言語交流。醫師會觀察病患步態、察覺不適徵兆、注意呼吸,並引導病患進行身體檢查動作。這些持續不斷的視覺和聽覺資訊,與口述的臨床病史無縫整合。這些非語言的視覺和聽覺線索對於有效診斷、建立病患信任和臨床溝通至關重要。

具備臨床推理和對話能力的 AI 系統,有潛力大幅提升醫療專業知識和照護的可近性,促進醫師能將時間專注於病患互動中最有意義層面的未來。在早期工作中,我們的臨床推理和對話研究 AI 系統「醫學智慧探索者 (AMIE)」在文字型診斷對話中展現專家級表現,並證明能有效輔助臨床醫師進行鑑別診斷。最近,我們將 AMIE 的能力從診斷擴展到長期疾病治療和管理。

我們也將 AMIE 的能力擴展到腫瘤科、心臟科和眼科的專科級評估,以及在病患演員參與的模擬情境中,跨影像和臨床文件的多模態診斷推理。同時,我們已開始透過以醫師為中心的監督框架,將這些研究進展轉化為臨床實踐,並進行了首次真實世界臨床研究,包括與 Beth Israel Deaconess Medical Center 合作的臨床可行性研究,以及與 Included Health 合作進行的全國性隨機研究。

儘管有這些進展,我們研究中的一個根本限制是,文字型介面捨棄了臨床實踐中的視覺和聽覺維度。病患必須將複雜的身體症狀轉化為書面描述,這會丟失診斷資訊,並可能對數位或健康素養有限的病患產生負面影響。純文字系統無法獨立觀察提供臨床推理依據的視覺和聽覺線索,也無法引導病患進行影響鑑別診斷的身體檢查動作。

今天,在「邁向專家級即時影音諮詢的醫療 AI」中,我們展示了 AMIE 的即時影音配置版本 AMIE (Video),它解決了這些限制。AMIE (Video) 基於 Gemini 和 Project Astra 打造,進行同步臨床影音諮詢,即時感知非語言臨床線索、引導病患演員進行虛擬身體檢查,並進行診斷推理。

在一項多臂隨機研究中,包含 100 個情境、300 次即時諮詢,以及 30 位通過認證的基層醫療醫師 (PCP),我們首次展示了 AI 系統在即時臨床影音諮詢中展現專家級表現。

透過影音進行有效的臨床對話需要平衡相互衝突的需求:系統必須以自然的對話速度回應病患,同時進行仔細的臨床推理並持續處理視覺和聽覺串流。目前,單一代理無法滿足所有這些要求。深度推理需要時間,但對話停頓會損害病患信任和醫病關係。

為了解決這個挑戰,AMIE (Video) 採用非同步多代理架構,將工作分配給三個持續並行運作的專門代理:

「對話代理 (Talker agent)」:面向病患的代理,負責驅動反應靈敏、低延遲的語音互動。它在整合其他代理的指導下,維持自然的對話流程。

「規劃代理 (Planner agent)」:在背景運作,持續完善系統的臨床推理,更新鑑別診斷和管理計畫,同時識別資訊缺口並重新排序多樣化的臨床目標。

「感知代理 (Perception agent)」:持續審查音訊和視訊串流,識別臨床相關的非語言線索(例如可見的痛苦跡象、身體檢查發現或聽覺信號),並將這些觀察結果置於正在進行的對話中。

這種解耦設計使 AMIE (Video) 能夠在執行診斷推理和影音感知時,維持自然的對話延遲,否則這些操作會引入不可接受的延遲。自動評估證實,這個三代理架構中的每個代理都對臨床指標的改進做出了重要貢獻,例如病史詢問能力、臨床推理和治療建議,以及對話品質相關指標,包括以病患為中心的溝通技巧和回應延遲。

開發影音醫療 AI 的一個關鍵挑戰是,如何大規模地描述系統的感知和推理能力。為了指導開發,我們從醫學文獻中歸納出與遠距醫療相關的臨床影音能力分類。然後,我們圍繞此分類建立了一套自動評估工具。

這個評估框架結合了針對性的單輪影音評估和多輪模擬語音諮詢。單輪影音評估測試臨床感知和推理的特定實例(例如,正確識別解剖學上的左右側或辨識呼吸窘迫的跡象)。多輪模擬語音諮詢則評估端到端的對話表現,同時將視覺線索以文字描述的形式注入模擬中(例如,針對帕金森氏症情境的 AI 病患模擬器,在被提示展示筆跡時,可能會注入「[將紙舉向攝影機,顯示字跡潦草、微小]」的口頭描述)。

總體而言,這些互補的評估使得系統設計能夠快速迭代,並在人工評估之前充分描述了 AMIE (Video) 的能力和失效模式。

為了在更具挑戰性和真實的端到端影音臨床諮詢情境中評估臨床能力,我們進行了一項大規模、隨機的客觀結構式臨床考試 (OSCE) 研究,採用同步影音諮詢介面。為了在評估中涵蓋廣泛的醫療狀況,該研究涵蓋了五個身體系統的 100 個臨床情境,包括心肺、腹部、頭/眼/耳/鼻/喉 (HEENT)、神經/精神和肌肉骨骼狀況。十五位受過訓練的病患演員在三個研究組別中進行了 300 次標準化諮詢:

AMIE (Video):AMIE 的影音配置版本,進行即時影音諮詢。

AMIE (Text):純文字版本,作為基線以區分影音能力的貢獻。

PCP (Video):十位通過認證的基層醫療醫師,透過相同的影音介面進行諮詢。

由 20 位經驗豐富的基層醫療醫師組成的獨立小組,使用既定的臨床評分標準評估所有諮詢,包括一般臨床能力量表和針對每個情境量身定制的詳細案例特定評分標準。

主要結果如下:

專家級臨床表現:在核心臨床能力、病史詢問完整性、診斷準確性、管理適當性和溝通品質方面,臨床評估者認為 AMIE (Video) 與基層醫療醫師相當。AMIE (Video) 在這些方面也達到或超越了 AMIE (Text)。

身體觀察和檢查的優勢:在引導身體徵象和主動引導病患演員進行虛擬檢查動作方面,AMIE (Video) 的平均評分顯著高於基層醫療醫師和 AMIE (Text)。這種優勢也反映在案例特定的感知和檢查評分標準中。

病患演員偏好影音體驗:病患演員強烈偏好同步影音介面而非文字聊天,認為它更容易使用,且更有效地傳達健康問題。他們還認為 AMIE (Video) 在同理心、醫病關係和照護信心方面優於基層醫療醫師和 AMIE (Text)。

這項研究存在重要限制,因此在這些限制的背景下解釋這些結果至關重要。這項研究完全是在模擬臨床情境下,由專業病患演員參與進行的,而非真實病患的實際健康狀況。病患演員無論多麼熟練,都無法完全複製真實臨床遭遇的複雜性和不可預測性,且情境僅限於可透過表演真實呈現的病況,省略了影音感知對診斷至關重要的重要臨床表現。

在研究範圍之外,針對性的自動評估仍揭示了偶爾的感知和推理錯誤,儘管整體對話品質和診斷準確性很高,且系統仍存在間歇性技術問題,可能破壞對話的自然性。鑑於 Project Astra 的原型性質,這包括未來的開發可能在系統層面解決的技術考量,這些考量超出了本研究中探索的特定醫療應用。

在對真實病患和真實臨床狀況的研究中評估這些發現,是得出任何實際應用結論之前的必要下一步。

展望未來:

這項工作證明,從文字型到影音型臨床 AI 的轉變,已能達到專家級水準。AMIE (Video) 融入了臨床實踐中豐富的感知層面,觀察非語言線索、引導身體檢查,並透過口語對話自然交流,這些能力更接近遠距醫療影音諮詢的體驗。在邁向負責任的真實世界證據的道路上,仍存在重要問題。

我們的研究結果需要透過真實病患進行驗證,擴展到無法透過表演呈現的臨床表現,並由強大的安全框架支持。我們已經朝這個方向邁出了初步步伐:與 Beth Israel Deaconess Medical Center 合作的真實世界可行性研究,為文字型 AMIE 在臨床實踐中的安全性和實用性提供了初步證據,而我們與 Included Health 合作進行的全國性隨機研究,正在進一步評估 AI 在真實世界虛擬照護中的應用。總體而言,這些研究經驗將有助於指導如何將影音能力負責任地整合到臨床實踐中。