美國已解除對 Anthropic 最新 Claude 模型 Fable 5 和 Mythos 5 的出口限制,此前川普政府曾以國安風險為由,對這些模型提出擔憂,並暫停其發布約三週。

Anthropic 在一篇部落格文章中證實,Fable 5 即日起將在全球上市,而美國組織自 6 月 26 日起已恢復對 Mythos 5 的存取權限。Anthropic 表示,目前正與政府合作,透過「Glasswing 計畫」將 Mythos 的存取權擴展到更廣泛的國內外合作夥伴。該計畫允許受信任公司的網路安全研究人員,為防禦目的存取 Mythos。

路透社和《紐約時報》檢視的一封致 Anthropic 的信函中,商務部長 Howard Lutnick 表示,Anthropic「將不再需要其 Claude Mythos 和 Claude Fable AI 模型出口或境內轉移的許可證」。信中承認 Anthropic 已「與美國政府密切協調,採取措施應對」這些模型帶來的風險。

Lutnick 表示,Anthropic 為避免模型發布進一步延遲,同意擴大與政府的合作夥伴關係。該公司還表示,已建立一個與駭客合作對其模型進行紅隊測試的計畫,並設有專門的內部團隊,全天候監控新興的越獄威脅報告。

Lutnick 在信中提醒 Anthropic,美國「保留重新評估這些決定」並隨時重新實施出口限制的權利。但就目前而言,Lutnick 與白宮幕僚長 Susie Wiles 一同在 X 平台上慶祝 Fable 5 的重新部署。

Lutnick 表示:「在過去兩週,我們與 Anthropic 密切合作,分析並批准 Fable 5,以確保美國政府內部的一致性,並強化美國在 AI 領域的領導地位。」

Wiles 並未直接提及 Anthropic,但聲稱這是川普的勝利,她寫道:「政府和私營部門以前所未有的方式合作,這種『美國優先』的基礎是前所未有的。我們的共同優先事項仍然是:盡可能快速且安全地部署最佳技術。」

6 月 12 日,商務部命令 Anthropic 停止美國境外用戶存取其最先進的模型。該命令源於擔心中國、俄羅斯或其他受關注國家可能利用這些模型攻擊美國基礎設施,例如電網或銀行系統。Anthropic 因無法按國家阻擋用戶,因此全面停止了所有存取。

Anthropic 的部落格文章指出,Mythos 被認為「對希望在網路攻擊中濫用它的惡意行為者具有獨特的吸引力」。根據 Anthropic 的說法,該模型「可以比任何其他模型,以及除了最熟練的人類安全專家之外的所有人,更有效地發現和利用軟體漏洞」,而這些「卓越的網路安全能力」可能被用來對付美國。

Anthropic 表示,Fable 5 與 Mythos 5 共享「相同的底層模型」,但與 Mythos 5 不同的是,它「不提供此類獨特的攻擊能力」。Fable 5 專為大眾設計,已經擁有 Anthropic 應用於模型的最強大安全防護措施,Anthropic 表示,在重新部署之前,這些防護措施現在更加強化。

經過數週的測試,Fable 5 已不再受 Amazon 研究人員發現的繞過方法影響,該方法曾識別出多個軟體漏洞並觸發了出口限制。Anthropic 表示,最令人不安的是,該模型曾被操縱以產生程式碼,演示如何利用一個漏洞。

根據 Anthropic 的說法,測試證實市場上較不先進的競爭模型,例如 GPT-5.5 和 Kimi K2.7,「也能識別出 Fable 5 在報告中發現的相同漏洞」。Anthropic 表示,這證實「所報告的技術並未揭露任何獨特的 Mythos 級網路能力」,並且「只涉及例行的防禦性網路安全工作」。

Anthropic 寫道:「即便如此,我們仍迅速採取行動解決所報告的繞過問題。」Anthropic 表示,該越獄方法目前在超過 99% 的情況下被阻擋。然而,該公司承認,加強安全防護措施帶來了「權衡」,可能導致某些良性提示詞在「例行程式碼編寫和偵錯任務」中被阻擋。

Anthropic 表示:「我們與政府密切合作,訓練了一個改進的安全分類器,專門針對並阻擋報告中描述的行為。」「如果對 Fable 5 的請求被阻擋,用戶將會收到通知,該請求將轉而發送給 Opus 4.8。」

Anthropic 表示,當然,Anthropic 的新分類器雖然有助於避免對模型進行獨特的危險攻擊,但也可能「出錯」。該公司長期以來一直認為,建立一個完全「不受」越獄影響的模型「可能是不可能的」,但透過加強紅隊測試,Anthropic 希望「確保我們和我們的安全合作夥伴將是第一個發現重大越獄並在惡意行為者利用它們造成傷害之前修復它們的人。」

Anthropic 表示,Amazon 標記的攻擊目前僅在「極少數情況」下有效,在這些情況下,「模型可能提供的資訊不足以幫助網路攻擊者」。

Anthropic 表示,透過「謹慎」行事,「絕大多數越獄將無法成功解除危險行為」,並且「產生越獄的成本和精力將非常高」。

該公司表示:「即使越獄成功,我們的額外防禦層」,這需要阻擋一些良性請求,「也能提供額外的緩解措施。」

Anthropic 的部落格文章似乎淡化了 Amazon 所識別的威脅,認為其風險低於該公司認為對政府構成最大威脅的「通用越獄」,後者可以解鎖廣泛的漏洞並啟用不可預見的攻擊。

Anthropic 表示,為了簡化公私合作夥伴關係並確保對最大風險做出最快速的反應,AI 產業的目標應該是將風險分類,以確保內部和政府都能採取適當的干預措施。

目前,Anthropic 正與 Amazon、Microsoft、Google 和其他 Glasswing 合作夥伴合作,「起草一個評估 AI 越獄嚴重性以及 AI 開發者應如何應對的共識框架」。

Anthropic 表示,歡迎其他產業合作夥伴加入這些討論,儘管這個過程「不完美」,但重點是建立四個評估越獄的標準。這些標準包括評估越獄提供的能力、它啟用的攻擊任務數量、人類將越獄武器化的難易程度(單一提示詞越獄被標記為風險最高),以及發現越獄是否需要專業知識。

部落格文章指出,利用這個框架,Anthropic 已建立一個團隊,將全天候監控越獄提交管道。這家 AI 公司也證實,正在推出一個「新的 HackerOne 計畫,安全研究人員可以透過該計畫提交他們在 Fable 5 中發現的潛在網路越獄」,以保持紅隊測試為首要任務。

對於 Anthropic 而言,政府測試的一個結果似乎是改善了與政府的關係,此前該公司曾因被列為國家安全風險而起訴美國政府,該風險指定將這家 AI 公司列入黑名單。Anthropic 聲稱,該指定是對公司拒絕允許政府存取模型以用於建造自主武器或進行國內大規模監控的報復。

Anthropic 在其部落格中表示,正在擴大與政府合作夥伴在部署前測試和評估方面的承諾。Anthropic 表示,這些努力將包括向政府提供前沿模型的早期存取權限、迅速分享有關新越獄方法的資訊,以及投入資源進行聯合研究,這將「有助於推進 AI 評估的最新技術水平」。

Anthropic 表示,這次合作為「有效全球協調 AI 風險和效益」提供了「一個範本的開端」,同時敦促國會通過立法,確保所有前沿模型開發者都能達成共識。

政府的行動速度對於 Anthropic 來說過於緩慢。Anthropic 執行長 Dario Amodei 本月稍早提出了他的立法提案,並引用《魔戒》來強調他的觀點:

在《魔戒》的一個支線情節中,兩位哈比人試圖喚醒樹鬍,一棵睿智但行動遲緩的有感知樹木,來保衛他的森林,抵禦一支正在砍伐森林的軍隊。問題是樹鬍的行動速度與哈比人截然不同。他光是向另一棵樹打招呼就需要一整天的時間,因此要讓他和他的同伴們足夠快地行動幾乎是不可能的。AI 與我們的政治機構之間的交集,感覺有點像哈比人與樹鬍。

最初,川普計畫對 AI 監管採取不干預態度,以刺激創新。然而,Anthropic 的 Mythos 發布嚇到了川普,促使他在五月要求對前沿模型進行自願性安全測試。自那以後,兩位熟悉討論的人士告訴《紐約時報》,川普「仍在制定一個框架,說明公司應如何正式提交新的 AI 模型進行審查,以及它們將遵守哪些標準」。

Amodei 在他的文章中呼籲國會迅速採取行動,重新構想安全法規,以應對一個「AI 可以從一個有趣的玩具」變成「資料中心裡一個充滿天才的國家」的世界,否則將面臨「國家戰略」後果的風險。

然而,專注於 AI 和國家安全的非營利組織 Frontier Security Institute 的執行董事 Isaac Harris 告訴路透社,Anthropic 與政府深化合作後,「最大的問號」是「美國政府將如何處理來自中國、防護措施較少但具有同等危險能力的 AI 模型在美國市場的流通問題」。

值得注意的是,Anthropic 最近指控中國 AI 公司阿里巴巴對 Claude 發動了最大規模的複製攻擊。作為回應,Anthropic 敦促國會通過立法,懲罰被發現竊取美國公司成果的中國公司。否則,無法取得 Anthropic 模型的惡意行為者,可能會轉向防護措施較低且能力日益接近的中國模型,發動讓美國措手不及的攻擊。