研究備註:CARE-X 是一個研究模型,並非 Microsoft 的產品或醫療設備。它尚未獲得任何監管機構的批准,不適用於臨床診斷、篩檢或病患照護。以下描述的結果是回溯性研究發現,不代表 CARE-X 在任何臨床用途上的安全性、有效性或適用性。提及的潛在工作流程僅為未來研究領域的描述,並非目前可用的功能或推薦用途。
一覽
挑戰:胸部 X 光判讀涵蓋多樣任務,需要富有表達力的報告生成和校準的診斷預測。
CARE-X 是一個統一的胸部 X 光 VLM,適用於多樣化的臨床判讀任務。它結合了生成式和結構化預測,提供自由文本推理和確定性輸出。
CARE-X 使用強化學習(DAPO)在多任務環境中獎勵臨床正確性。
在 CARE-X 之外的另一項研究實驗中,我們將 Qwen3-VL-4B-Instruct 與確定性測量工具結合,評估直接計算是否能比單純的視覺近似,更能改善依賴測量的病症表現。
該模型已在來自 Narayana Health 的真實印度臨床數據上進行驗證,包括罕見的加護病房病理和經 CT 確認的擴大病症。
放射科醫師的需求:任務多樣性、靈活性和臨床忠實度
一個具有臨床實用性的放射學 AI 系統必須支援廣泛的任務、適應不同的工作流程,並產生醫學上準確的輸出。
放射科醫師和其他臨床醫師使用胸部 X 光的目的多種多樣。一個具有臨床實用性的 AI 系統必須能夠支援這些任務。它可能被要求為報告生成詳細的發現和簡潔的印象,回答關於發現是否存在或位置的問題,識別醫療設備並評估其放置,或精確指出影像中異常出現的位置。
這些任務也需要不同類型的輸出,從敘述性報告到校準的診斷分數。最重要的是,它們需要臨床準確性。一份報告可能表面上寫得完美無缺,但如果它遺漏了發現、顛倒了否定詞,或錯誤識別了位置,則在臨床上可能是錯誤的。某些發現可能在一個情境中微不足道,但在另一個情境中卻至關重要。
CARE-X 作為一個研究模型開發,旨在探索統一方法如何解決這些多樣化的需求。該系統結合了生成式和判別式能力、臨床校準優化以及基於工具的推理,以支援更廣泛的放射學工作流程,同時保持臨床忠實度。
當前放射學視覺語言模型的不足之處
儘管最近的模型在任務廣度上表現出色,但在放射科醫師的需求與當前系統所提供的之間,仍存在關鍵差距:
診斷決策缺乏校準置信度。生成式 VLM 以自由文本預測診斷,但通常不提供校準的置信度分數。在臨床環境中,置信度至關重要。臨床醫師無法在不同臨床情境中調整敏感度-特異度權衡,這是實際部署的重要要求。判別式模型提供這些特性,但缺乏開放式生成的靈活性。
交叉熵損失未能優化臨床忠實度。標準訓練方法對所有詞元級錯誤一視同仁,無論其臨床後果如何。一個座標錯誤可能不會比無害的措辭改變受到更多懲罰。「是」可能被翻轉為「否」,儘管臨床意義完全不同。遺漏危及生命的發現可能與省略次要觀察結果受到相同的訓練懲罰。因此,模型並未明確針對病患照護中最重要的事情進行優化。
不具備依賴測量的發現能力。某些放射學發現不僅需要視覺識別。心臟肥大、縱膈腔增寬等放射學徵象依賴於精確測量。例如,模型可能正確識別胸部 X 光片是採用 AP 還是 PA 視角獲取。但確定心臟肥大需要測量心臟和胸腔寬度並確定心胸比。這些量應該被測量和計算,而不是僅憑視覺近似,同時還要考慮視角類型、曝光、病患旋轉等變數。
總之,這些差距要求的不僅僅是一個流暢的生成模型。該系統必須結合廣泛的任務覆蓋、結構化預測、臨床校準優化,以及在需要直接測量時的量化工具。
CARE-X:一個模型,靈活輸出
CARE-X 將這些多樣化的解釋能力整合到一個模型中,根據每個任務的需求使用生成式或雙重推論:
雙重推論意味著單次前向傳播會產生自迴歸回應和帶有置信度分數的結構化輔助頭預測。這為需要操作點控制的任務提供了自由文本的靈活性以及可調整閾值的輸出。
CARE-X 的架構和訓練方法
CARE-X 建基於 SigLIP2-so400M 視覺編碼器和 Phi-4-mini-instruct (3.8B) 語言模型,兩者透過輕量級轉接器連接。為了支援自由文本生成和結構化臨床預測,該模型透過任務專用輔助頭(用於分類和視覺定位)來增強共享的語言骨幹。這些輔助頭提供校準的診斷預測和空間定位訊號,同時與生成式語言模型共享表示。
它們不是獨立訓練的,而是與語言模型目標共同訓練,讓結構化監督能夠豐富共享表示並改善相同任務上的生成性能。
訓練。CARE-X 使用三階段監督式微調(視覺預訓練、轉接器/頭部訓練和 LoRA 適應),然後是基於 DAPO 的強化學習。DAPO 優化了用於臨床報告、診斷準確性和空間定位品質的任務專用獎勵。
圖 1. CARE-X 模型。(左)帶有任務專用頭部(分類、定位和語言模型)的監督式微調,共享相同的 Phi-4-mini-instruct 骨幹。分類頭輸出校準的 P(Yes)/P(No) 分數;定位頭輸出帶有置信度的邊界框座標;語言模型頭生成自由文本回應。(右)DAPO 採用任務專用獎勵,用於跨報告生成、定位和 VQA 的多任務強化對齊。
輔助監督:結構化預測強化生成
這項工作的核心發現是,將判別式輔助頭與生成式 VLM 共同訓練,可以豐富共享表示,從而在相同任務上帶來更強的生成性能,同時也提供校準的結構化預測。
定位改進
輔助定位頭始終比生成式解碼更能改善定位。在解剖學定位(Chest ImaGenome)上,mAP 和 mIoU 分別增加了 +28.2 個百分點和 +6.2 個百分點,而最大的增益發生在短語定位(PadChest)上,mAP 增加了 +24.6 個百分點,mIoU 增加了 +14.1 個百分點。複合空間損失增強了共享表示中的幾何精確度。
DAPO 彌補了與專用檢測頭的差距
DAPO 訓練的生成輸出接近或超越了 SFT 輔助檢測頭。在解剖學定位上,CARE-X 生成式(0.868 mAP)超越了 SFT 檢測頭(0.865)。這在實踐中具有重要意義,它證明了獎勵校準學習可以使自迴歸空間解碼與結構化預測達到同等水平,為臨床醫師提供單一生成推論模式,而無需在測試時使用輔助頭。
帶有可調操作點的校準分類
除了表示豐富之外,分類頭還提供了一個獨特的部署優勢:帶有可調閾值的校準機率分數允許臨床醫師從單次前向傳播中,在「高靈敏度篩檢」和「高特異性確認」之間切換,這是純生成式架構無法提供的功能。
四個基準測試中強大的報告生成能力
在論文的比較集中,CARE-X 在 MIMIC-CXR、IU-Xray、CheXpert-Plus 和 ReXGradient 的大多數報告指標上取得了最強的性能。CRIMSON 是一個獨立的指標,用於評估異常發現並根據臨床嚴重程度權衡錯誤,這表明這些增益反映了臨床上有意義的改進,而非獎勵特定的優化。
圖 2. CARE-X 與四個胸部 X 光數據集(ReXGradient、MIMIC-CXR、IU-Xray 和 CheXpert-Plus)上基準報告生成模型的 CRIMSON 分數(↑)。CARE-X(高亮顯示)在每個數據集上都取得了最高的 CRIMSON 分數。
CARE-X 在 ReXVQA 上達到 94% 的準確度
截至 2026 年 8 月,CARE-X 在 ReXrank RexVQA 排行榜上排名第一。在 ReXVQA 基準測試(跨五個臨床相關類別的 41,007 個問答對)中,CARE-X 達到了 94% 的總體準確度,比下一個表現最佳的公開報告模型高出六個百分點。
圖 3:ReXVQA 在五個發現品質維度上的準確度,否定、存在、位置、鑑別診斷、幾何資訊和總體。CARE-X 在每個軸上都持續優於 CheXOne-R1 和 MedGemma,在鑑別診斷、位置評估和否定方面的差距最大。
工具增強測量:感知與計算的交錯
一些放射學發現依賴於定量測量而非視覺模式。在 CARE-X 之外的另一項研究實驗中,我們建立了一個推論時管線,將 Qwen3-VL-4B-Instruct 與確定性測量工具結合,讓模型能夠在影像理解和精確計算之間交替進行。Qwen3-VL-4B-Instruct 在整個推論過程中保留對 X 光片的視覺存取權限,根據需要調用工具來識別解剖學地標、計算測量值並評估診斷閾值。這創建了一個多輪推理循環,交錯了感知與計算。



