在與川普政府協商數週後,Anthropic 的 Claude Fable 5 模型終於獲准恢復上線。Anthropic 在 X 平台上表示,計劃於週三開始恢復全球用戶對 Claude 平台的存取權限,並將很快在 AWS、Google Cloud 和 Microsoft Foundry 上重新啟用存取,但尚未提供具體時間表。

Anthropic 已收到商務部通知,解除對 Claude Fable 5 和 Mythos 5 的出口管制。公司將開始恢復存取,並感謝用戶的耐心以及所有協助重新部署模型的人員。

Anthropic 週二晚間也發布了一篇部落格文章,詳細說明了事件的來龍去脈、修訂後的安全措施、正在推動的新 AI 產業流程,以及未來如何與政府分享資訊和進行模型預發布測試。

今年六月初,Anthropic 在川普政府發出最後通牒後,將其面向消費者的 Fable 5 模型下架。Fable 5 與 Anthropic 的 Mythos 5 採用相同的底層技術,但具備更多安全防護。政府因擔憂技術可能被「越獄」,對 Anthropic 實施了出口管制指令,禁止任何外國國民(包括企業客戶的非美國成員,甚至許多 Anthropic 自己的員工)使用 Mythos 5 或 Fable 5。

為了應對 Amazon 研究人員發現並導致出口管制指令啟動的「越獄」問題,Anthropic 在部落格文章中表示,他們已「訓練出一個改進的安全分類器,專門針對並阻止」此類行為。公司補充說:「如果對 Fable 5 的請求被阻止,用戶將收到通知,該請求將轉發至 Opus 4.8。新的分類器意味著 Amazon 報告中描述的特定技術在超過 99% 的情況下會被阻止。」

川普政府最近也批准了 Mythos 5 的回歸,但僅限於預先批准的組織。這些組織的非美國成員以及 Anthropic 自己的外國員工獲准重新存取該模型。此決定是在 OpenAI 推出 GPT-5.6 之後不久,GPT-5.6 也僅在類似規則下首次亮相:分階段推出,最初僅限於預先批准的組織和政府部門。

Anthropic 週二表示,公司將「繼續與政府協調,擴大 Mythos 5 對更廣泛的國內外合作夥伴的存取」。該公司還在部落格文章中專門提到其與川普政府密切合作的新計畫,強調在數月的公開爭議、訴訟和總統行動之後,公司為重新獲得政府青睞所做的多方努力。

公司表示,計劃提供「預發布政府存取和評估」,特別是針對與國家安全能力相關的模型。這將允許政府合作夥伴在模型廣泛發布之前,獨立評估其能力並測試安全防護措施。政府在這些預發布測試期間也將能與 Anthropic 的技術人員合作。

Anthropic 還表示,當「發現重大越獄或濫用模式」時,計劃引入「快速資訊共享」機制。公司將與政府及其他領先的 AI 實驗室合作,為前沿模型供應商建立一個「共享的自願性安全和評估標準」。

最後,Anthropic 表示將「成立專門的 Anthropic 團隊來處理共同的政府優先事項,提供大量的運算資源以支持政府測試和研究,並提供我們的安全和紅隊測試專業知識,以幫助推進 AI 評估的最新技術。」

川普政府最初的出口管制指令對 Anthropic 來說時機不佳,因為該公司正準備進行首次公開募股(IPO),並且數月來一直因供應鏈風險指定問題與政府爭執不休。

公司在部落格文章中強調,目前「AI 產業對於如何判斷越獄的嚴重性尚未達成共識」。這個問題「在未來幾個月將變得更加嚴峻,因為更多具備強大網路安全(及其他)能力的模型將被訓練、評估和發布。」

因此,Anthropic 表示已與 Amazon、Microsoft、Google 以及其 Project Glasswing 計畫中的其他企業合作,起草一個廣泛認可的 AI 越獄評估框架。該框架提出四個類別:攻擊者的能力增益、能力增益的廣度、更廣泛的武器化難易度,以及可發現性(或其他人重複該越獄的難易度)。

Anthropic 還表示已成立一個新團隊,提供「24/7 監控關鍵越獄提交管道」,並將很快推出 HackerOne 計畫,供研究人員提交他們為 Fable 5 發現的潛在越獄。

Anthropic 在部落格文章中也包含了一項免責聲明,指出「任何 AI 模型都可能無法完全抵禦(即免疫於)越獄。我們預計我們的模型會被發現一些越獄,且其嚴重性會有所不同:將會有許多輕微的越獄,一些狹隘的有害越獄,儘管在撰寫本文時尚未發現 Fable 5 的通用越獄,但專業安全研究人員仍在持續進行紅隊測試。」