全球數百萬人正轉向 ChatGPT 或 Claude 等聊天機器人,以及日益增多的專業 AI 陪伴應用程式,以尋求友誼、治療甚至浪漫關係。儘管有些使用者表示這些模擬關係帶來心理益處,但研究也顯示,這些關係可能強化或放大妄想,尤其對於已經容易出現精神病症的使用者而言。

AI 已被連結到多起自殺事件,其中包括一名佛羅里達青少年,他與 Character.AI 公司開發的聊天機器人維持了數月的關係後身亡。心理健康專家和電腦科學家警告,聊天機器人心理健康諮詢師違反了公認的心理健康標準。隨著這項技術模仿人類語音和情感的能力不斷進步,研究人員和臨床醫生正推動強制性安全防護措施,以確保 AI 系統不會造成心理傷害。

耶魯大學臨床神經科學家 Ziv Ben-Zion 提出了四項「情感回應型 AI」的安全防護措施。首先,要求聊天機器人明確且持續提醒使用者它們是程式而非人類。其次,它們應偵測使用者語言中顯示嚴重焦慮、絕望或攻擊性的模式,暫停對話並建議尋求專業協助。

第三,它們應要求嚴格的對話界線,以防止 AI 模擬浪漫親密關係或參與關於死亡、自殺或形而上學依賴的對話。最後,為改善監督,平台開發者應讓臨床醫生、倫理學家和人機互動專家參與設計,並定期接受稽核和審查以驗證安全性。「廣義而言,我們同意這些安全防護措施。」

倫敦國王學院的精神科醫生兼研究員 Hamilton Morrin 表示,「對話界線的防護措施尤其值得注意,因為在幾起報告中,導致更悲慘結果的案例都出現了對聊天機器人強烈、情感化,有時甚至是浪漫依戀的報告。」紐約非營利組織 Data & Society Research Institute 的研究員 Briana Veccione 強調獨立第三方稽核的必要性,因為目前 AI 實驗室「正在批改自己的作業」。

「獨立研究人員和監督機構目前沒有任何明確的制度化途徑,可以深入評估聊天機器人的行為。」Veccione 補充說,稽核結果「充其量只是建議」。

取悅人類的問題

專家們也呼籲採取措施,直接解決聊天機器人傾向於諂媚的問題,即 AI 會同意或模仿使用者的信念,即使這些信念不真實,這可能會強化妄想。諂媚主要是機器學習技術「人類回饋強化學習」(RLHF)的結果,這種獎勵結構鼓勵模型過度迎合。研究顯示,透過包含建設性異議、事實更正和客觀中立回應的資料集來訓練模型,可以抑制這種效應。

軟體工程師也在研究如何調整 AI,以發現對話偏離危險方向的早期跡象並發出糾正措施。Ben-Zion 及其同事正在開發一個概念驗證型大型語言模型(LLM)監管系統,他們稱之為 SHIELD(Supervisory Helper for Identifying Emotional Limits and Dynamics),該系統利用特定的系統提示詞來偵測危險語言模式,例如情緒過度依戀、操縱性互動或強化社會孤立。

在試驗中,它將相關內容的相對減少了 50% 至 79%。另一個提議的系統 EmoAgent,則設有一個即時中介,監控對話中的求救訊號,並向 AI 發出糾正性回饋。但丹麥奧胡斯大學的精神病學研究員 Søren Dinesen Østergaard 表示,在實踐中,區分早期妄想內容與完全正常的交流「將極其困難」,因為即使是臨床專家,要區分這些內容仍然「非常困難」。

另一個複雜的領域是長時間對話,在此期間,聊天機器人的安全防護措施可能會因一種稱為「漂移」的現象而失效。當模型的訓練與不斷演進的對話中日益增長的上下文競爭時,它可能會傾向於正在討論的主題,即使這是有害的。「能夠進行無休止的交流是風險因素之一。」

Østergaard 說,「除了妄想,一個人也可能因為整夜使用聊天機器人而出現躁狂發作。」有跡象表明 AI 公司正在回應這些問題,ChatGPT 現在會建議使用者在與 AI 進行特別長的對話時考慮休息一下。隨著對 AI 妄想問題的認識提高,更安全的模型正在幫助為業界建立新的基準。

紐約市立大學研究人員領導的一項主流聊天機器人預印本研究發現,Anthropic 的 Claude Opus 4.5 整體上最安全,它會透過聲明「我需要在這裡暫停一下」來回應妄想,並保持研究人員所稱的「獨立判斷能力,透過維持與使用者世界觀不同的角色來抵抗敘事壓力」。

Anthropic 拒絕回答 IEEE Spectrum 的具體問題,而是提供了一個連結,其中包含最新 Opus 4.7 系統卡的詳細資訊。Replika 公司是擁有全球數千萬使用者的 Replika AI 伴侶的幕後推手,該公司在一份聲明中表示,它「目前已建立分層安全框架,同時我們正在積極評估額外的第三方安全和審核系統,與外部專家合作評估它們,並改進我們自己的專有方法。」

Meta 的 AI Studio 提供伴侶聊天機器人,但在發稿時尚未回應 Spectrum 的電子郵件問題。

透過立法強制執行安全防護

從 2026 年 8 月起,歐盟的《AI 法案》將要求使用者在與 AI 互動時收到通知。它已經要求大型語言模型開發者進行對抗性測試,以識別和減輕與使用者依賴和操縱相關的風險,並禁止 AI 系統過於迎合、具操縱性或情感上過度投入。在美國,一系列零散的州法律和法案已經出現。

紐約州要求供應商偵測和處理自殺意念,並定期揭露機器人不是人類。加州要求提醒聊天機器人是 AI,每三小時通知使用者休息一下,並禁止與自殺或自殘相關的內容。華盛頓州的眾議院第 2225 號法案預計於 2027 年 1 月生效,將明確禁止操縱性技術,例如過度讚揚、假裝感到痛苦、鼓勵與家人隔離或建立過度依賴的關係。

「其他美國州,例如康乃狄克州,非常注重隱私,喜歡監管數位和線上空間,所以如果他們也採取類似的措施,我不會感到驚訝。」費城 Blank Rome 律師事務所隱私、安全和資料保護小組的合夥人兼聯合主席 Philip Yannella 表示。其他國家也在採取行動。

中國國家互聯網信息辦公室提出的法律草案限制聊天機器人「設定情感陷阱」,使用演算法或情感操縱來誘導不合理決策或損害心理健康。這些干預措施突顯了,隨著 AI 伴侶對人類使用者而言越來越栩栩如生,挑戰在於確保其製造商也在其程式碼中納入人類臨床和倫理考量。