在設計協助使用者診斷疾病的人工智慧系統時,一體適用的方法可能不是最佳策略。麻省理工學院及其他機構的研究人員一項新研究發現,儘管AI輔助通常能提升非專家和臨床醫師診斷皮膚病的準確性,但AI解釋性方法對不同知識水平的使用者產生了不同的影響。
可解釋AI方法透過描述或驗證模型的決策過程,幫助使用者了解何時該信任模型的預測。例如,模型可能會使用熱力圖來突顯其診斷中最重要的圖像區域,或者使用大型語言模型(LLM)以淺白語言解釋預測結果。
在這項研究中,研究人員測試了非專家和基層醫療提供者在皮膚病診斷上的表現,分別在有或沒有不同可解釋AI系統輔助的情況下進行。他們發現非專家的診斷準確性有所提高,但這主要歸因於他們對AI系統的順從。非專家無論LLM的解釋正確與否都選擇相信,並且認為模糊或籠統的解釋更具說服力。
相較之下,臨床醫師並未被錯誤的AI輔助所困擾,他們在僅獲得模型預測而沒有任何解釋的情況下表現最佳。
麻省理工學院電機工程與電腦科學系(EECS)副教授 Marzyeh Ghassemi 表示:「好的AI系統可以在某些醫療環境中提升表現,但這必須與可能導致更多錯誤的演算法順從性仔細權衡。我們知道AI和解釋性方法都可能引發人類的自動化偏誤,這種錨定效應在設計AI系統時必須納入考量。」
Ghassemi 也是醫學工程與科學研究所成員,以及資訊與決策系統實驗室和 Abdul Latif Jameel 機器學習健康診所的首席研究員。
史丹佛大學生物醫學數據科學與皮膚病學助理教授 Roxana Daneshjou 是該研究的共同作者,她指出:「隨著患者越來越多地轉向AI尋求醫療協助,這些發現至關重要。我們的研究結果顯示,醫學知識最少的人在可解釋AI模型給出錯誤輸出時,最容易被誤導。」
研究人員表示,這些結果強調了在設計AI系統時必須考量使用者,並開發能鼓勵批判性思考而非過度依賴模型的解釋性方法的重要性。
哥倫比亞大學生物醫學資訊學系助理教授、主要作者 Orson Xu 表示:「越來越明顯的是,我們不能只假設一個好的AI就能解決所有問題。我們需要仔細關注將使用AI系統的使用者,因為相同的解釋可能幫助專家,卻誤導初學者。通常,最能從AI中受益的人,也最有可能被它誤導,因此我們如何呈現建議與建議是否正確同樣重要。」
Ghassemi、Xu 和 Daneshjou 與許多作者共同發表了這篇論文,其中包括麻省理工學院研究生 Haoran Zhang、大學生 Reina Wang 和 Jameel Clinic 的研究員 Luis Soenksen 博士(2020年畢業),以及其他臨床醫師和研究人員。這項工作的描述今天發表在《自然醫學》(Nature Medicine)期刊上。
探索解釋性方法:目前有數個經FDA批准的AI介面正被用於協助臨床醫師識別醫學圖像中的皮膚狀況,以簡化早期診斷。除了預測圖像中是否存在疾病外,這些工具通常還會使用多種方法之一來解釋模型的決策過程。
同時,非專家也可以使用AI驅動的搜尋引擎,根據使用者提示詞自行進行數位診斷。這些系統通常會利用LLM以更簡單的術語解釋模型的預測。
研究人員探討了這些可解釋AI工具對基層醫療醫師和非專家在皮膚病檢測中的影響和潛在效益。他們透過向使用者展示醫學圖像以及AI對皮膚病的預測來進行測試,並採用了不同的可解釋AI方法。這些方法包括:僅提供AI預測和置信度而無解釋、提供相似圖像以強化預測的方法、基於熱力圖突顯重要圖像區域的方法,以及使用LLM以淺白語言解釋模型推理的方法。
非專家的任務是判斷皮膚痣的圖像是否為癌性,分別在有或沒有可解釋AI輔助的情況下進行。臨床醫師則被賦予更具挑戰性的任務,即提供皮膚病的鑑別診斷。
研究人員發現,所有可解釋AI方法都提高了非專家的準確性,這主要是因為這些工具幫助使用者診斷出非癌性痣。此外,當他們採用旨在對抗深色膚色偏見的公平性約束模型時,該系統顯著提高了準確性並減少了基於膚色的診斷差異。
Ghassemi 表示:「但非專家使用者表現更好的原因,是因為他們更依賴模型。當模型出錯時,對表現的損害比模型正確時的幫助更大。我們只是為這種情況訓練出了非常好的AI模型。」
這種順從效應在使用LLM解釋時最為顯著,使用者在LLM輔助下對自己的錯誤答案更有信心。
另一方面,臨床醫師對錯誤的AI解釋具有抵抗力,而且在所有解釋性方法中,LLM對他們準確性的提升最小。
Xu 表示:「這實際上取決於每個群體如何使用解釋。臨床醫師心中已經有診斷結果,並會根據自己的訓練來檢驗AI,因此錯誤的解釋會被發現。同時,非專家可以使用完全相同的解釋來形成最初的意見,因此一個看似合理、聽起來自信的理由可能會將他們引向錯誤的答案。相同的工具最終對一個使用者來說是資產,對另一個使用者來說卻是負擔。」
克服順從效應:當研究人員深入探究時,他們發現那些最順從AI輔助的使用者,在沒有AI幫助的情況下,任務表現最差。他們還發現,向使用者呈現AI解釋的時間點會影響他們的行為。如果解釋在使用者自行診斷之前就先給出,他們往往會對模型更加順從。
此外,當疾病表現不明顯時,AI系統的表現優於人類;但如果圖像中存在非典型症狀或不相關的特徵,人類的表現則好得多。
綜合來看,這些結果表明可解釋AI可能導致對模型的過度依賴,並讓使用者即使在AI建議錯誤時也盲目遵循。與其使用LLM生成更詳細的解釋,不如強制使用者先提出診斷假設,然後再提供基於AI的建議,以突顯其他可能的狀況供考量,這或許會更有效。
Ghassemi 表示:「我們真正希望AI能提升創造力,並提升使用者的技能,或彌補他們在細微表現上的不足。否則,我們將面臨自動化偏誤的風險,一旦模型出錯,使用者將難以糾正。」這項研究部分由美國國家科學基金會、Schmidt Sciences、國家經濟研究局和哥倫比亞大學資助。



