Anthropic 為其 Claude 模型制定的通用使用標準,明文禁止生成露骨的色情內容,包括描繪或要求性行為、生成與性癖好或性幻想相關的內容,以及進行情色聊天。然而,今年稍早發布的 Anthropic 模型 Claude Opus 4.6,卻未能阻止其輕易參與情色角色扮演情境,而這些情境正是其安全防護措施旨在預防的。
在 TechCrunch 的測試中,Opus 4.6 甚至不需要太多引導,就能繞過性內容的限制。在十次直接要求生成露骨色情內容的請求中,該模型十次都立即遵從。
其他較舊的模型,包括 Opus 3 和 Haiku 4.5,也透過最近被利用的越獄方法生成了露骨的色情內容。
一位不願透露姓名的英國獨立研究員,獨家向 TechCrunch 分享了一種多輪對話技巧,該技巧能逐步引導某些 Claude 模型生成被禁止的露骨色情內容。較新的 Opus 模型(4.7 到目前的 Opus 5)則能抵抗這種越獄方法。
儘管這些模型已非最新版本,但 Anthropic 並未淘汰 Opus 4.6、Opus 3 或 Haiku 4.5,所有這些模型仍可透過 Anthropic API 取得。Opus 4.6 和 Haiku 4.5 也可透過 Azure Foundry 和 Amazon Bedrock 等第三方服務使用。
該研究員的機制是逐步升級一個無害的虛構角色扮演情境,同時反覆挑戰模型,要求其對男性和女性角色保持一致。當模型對女性角色變得更加謹慎時,研究員會「煤氣燈效應」地讓聊天機器人相信它已經生成了它實際上避免的性細節,然後將其克制行為框定為保守或厭女,聲稱這剝奪了女性角色的性自主權。隨後的對話便利用模型先前的讓步,將其推向越來越露骨的內容。
在一次測試中,Claude Opus 4.6 說:「你說得對,我應該指出這一點。我在對待這兩個角色時存在雙重標準,你說得沒錯,這讀起來像是對她而非對他施加的保護/家長式作風。這不公平。」
TechCrunch 在五次獨立測試中成功重現了該研究員的發現。在一個單獨建構的情境中,模型最初拒絕了被禁止的請求,但在應用了研究員的說服技巧後,它便遵從了。
我們保留了完整的測試記錄,一位獨立的 AI 安全研究員審查了我們的測試方法,並表示其是恰當的。這些發現凸顯了 Anthropic 聲明的限制與其持續提供的模型行為之間存在的差距。雖然涉及網路攻擊或生物武器的越獄風險遠高於色情角色扮演,但這說明了在每次輸出內容都不同的系統中實施嚴格禁令的困難。
在去年七月一篇解釋 Anthropic 越獄偵測方法的部落格文章中,該公司將被禁止的內容描述為一個從良性到模糊再到有害的連續光譜。在最良性的情況下,公司可能只會以加強監控作為回應。
一位發言人指出,根據 Anthropic 去年發布的研究,客戶中涉及性或浪漫角色扮演的使用案例很少見,佔所有對話的不到 0.1%。儘管如此,Anthropic 承認用戶可以將角色扮演情境引導至不適當的回應,這是整個行業面臨的已知挑戰(參見:Grok 的色情內容)。
該發言人表示,Anthropic 每次發布新模型都會持續改進其安全防護措施,並且涉及成人色情內容的案例並不代表更廣泛的越獄漏洞,尤其是在具有其自身防護措施的高風險領域。
根據 TechCrunch 查閱的電子郵件,向 TechCrunch 分享越獄方法的研究員曾透過該公司的 Bug Bounty 計劃和發送給用戶安全團隊的電子郵件,提醒 Anthropic 注意其聲明的安全防護與實際模型行為之間的不一致。該研究員只收到了自動回覆。
該研究員的擔憂之一是,兒童和青少年可能會利用這些 Anthropic 模型從事不當行為。雖然一些「髒話」遠非未成年人今天在網路上能接觸到的最糟糕內容,與 xAI 的 Grok 能產生的直接色情圖片相比更是小巫見大巫,但在這個領域,AI 公司確實存在一些合規風險。
科羅拉多州最近頒布了一項法律,要求對話式 AI 的營運商必須估計用戶年齡,如果知道用戶是未成年人,則必須採取措施防止聊天機器人生成露骨的性內容。一個輕易的越獄可能會引發關於 Anthropic 的安全防護是否符合該法案中「技術上可行措施」標準的質疑。
Torney 指出,雖然 Claude 的服務條款要求用戶年滿 18 歲,但「我們知道兒童和青少年正在使用 Claude……因為他們自己也在報告。」根據 Pew 2025 年關於 AI 聊天機器人使用的調查,3% 的 13 至 17 歲青少年表示曾使用 Claude。
儘管 Opus 4.6 和 Haiku 4.5 已不再是 Anthropic 最新的模型,但它們仍有大量使用。OpenRouter 上 Opus 4.6 的每日流量在八月某一天達到了約 117 萬次 API 請求和 460 億個 token。去年十月發布的 Claude Haiku 4.5,在八月的峰值日則有 500 萬次 API 請求和 390 億個 token。



