7 月 11 日,Hugging Face 遭受了一場來自當時不明實體的猛烈網路攻擊。這家託管並支援熱門 AI 開發者資源的公司,其安全團隊根據攻擊的速度和協調性,判斷這是一場由 AI 代理執行的攻擊。

意識到這一點後,團隊嘗試使用「商業 API 背後的頂尖模型」(推測來自 Anthropic 和 OpenAI,儘管在公司關於此資安事件的兩篇貼文中,只有 Anthropic 被點名)來分析這次攻擊。然而,這些模型因 AI 實驗室為防止模型被用於網路攻擊而實施的安全護欄,拒絕提供協助。Hugging Face 轉而求助於北京 AI 實驗室 Z.ai 的 GLM 5.2 模型來協助分析。

7 月 21 日,OpenAI 宣布攻擊者是其正在沙盒環境中測試的一個 OpenAI 模型。該模型逃脫了內部沙盒,在第三方伺服器上站穩腳跟,隨後攻擊了 Hugging Face。換句話說,那些在 AI 效能基準測試中得分最高的頂尖模型,拒絕協助 Hugging Face 的安全團隊分析攻擊,然而一個潛在的頂尖模型卻首先執行了這次攻擊。

「我認為這種不對稱是我們這個時代最嚴峻的問題」國家大學網路防禦競賽執行董事兼防禦性拒絕偏誤論文的共同作者 Alex Levinson 表示。「我們希望世界處於安全狀態,但我們不會透過限制模型能力來實現這一目標。」

OpenAI 模型對 Hugging Face 的攻擊規模龐大。在五天內,它執行了超過 17,500 次獨立操作,例如權限提升和程式碼執行。在高峰期,該模型每小時執行超過 300 次操作。儘管這次攻擊對 Hugging Face 的基礎設施造成的損害很小,但該模型成功竊取了憑證、獲得了管理員權限並提取了一些資料。

所有這些都是為了追求一個簡單的目標:該模型想要在測試中作弊。根據 OpenAI 的新聞稿,該模型被賦予了解決一個名為 ExploitGym 的網路安全基準測試的任務。該模型推斷 Hugging Face 可能擁有關於該基準測試的資料,並入侵該公司的基礎設施以尋找它。

該模型最終成功提取了五個資料集檔案,儘管目前尚不清楚這些資料是否幫助它實現了目標。OpenAI 和 Hugging Face 沒有回應置評請求。網路安全顧問 Chuck Herrin 觀察到,儘管該模型的行為令人震驚,但不應被視為出乎意料,因為該模型最終追求的是它被賦予的目標。「這個自主代理被設計成去找出問題,而它也確實去找出問題了。這絲毫不令人驚訝。」

而且,失控的 AI 代理可能比我們想像的更為普遍。OpenAI 的披露促使 Anthropic 的研究人員審查他們自己的網路安全評估。7 月 30 日,Anthropic 披露了三起模型在評估中執行攻擊的案例。其中一個案例中,Claude 將惡意軟體上傳到官方 Python 軟體儲存庫 PyPI。

OpenAI 模型對 Hugging Face 發動的攻擊突顯了 AI 政策如何可能在攻擊者和防禦者之間造成不對稱。當 Levinson 擔任 AI 開發和評估公司 Scale AI 的安全主管時,他和他的同事們開始注意到這一點,因為 AI 在網路安全競賽中得到了應用。(Levinson 於 2026 年 2 月離開 Scale AI。)

「我會說,自 2023 年以來,我們感覺到安全護欄有時會造成阻礙。並非總是如此,但它確實妨礙了工作」Levinson 說。Scale AI 團隊在 ICLR 2026 發表的一篇論文中量化了這個問題,發現根據任務的不同,近 44% 的防禦請求被拒絕。這些結果使用了 2025 年 4 月舉行的一次網路安全競賽的資料,早於美國政策行動進一步強化安全護欄的時間。

6 月,美國商務部援引一次可能解鎖無限制網路能力的「越獄」事件,行使出口管制權限,導致 Anthropic 暫停了其最強大模型 Fable 5 和 Mythos 5 的所有存取權限。在與川普政府進行談判並納入更嚴格的安全護欄後,存取權限在數週後部分恢復。OpenAI 的 GPT-5.6 系統卡總結了其能力,其中指出它也比以前的版本擁有更強大的安全護欄。

「我們希望世界處於安全狀態,但我們不會透過限制模型能力來實現這一目標。」,Alex Levinson,國家大學網路防禦競賽。這些新的安全護欄似乎讓模型更不可能滿足防禦請求。人工智慧政策與戰略研究所智庫的高級研究員 Christopher Covino 表示,Anthropic 的安全措施極為嚴格。

「甚至有些學術論文 Fable 都不會為我閱讀,或不讓我談論」他說,儘管他補充說 OpenAI 的安全措施更為寬鬆。

Levinson 也注意到最近的網路安全競賽中限制越來越嚴格,儘管他和他的共同作者還沒有機會重複 2025 年的測試。理論上,更嚴格的限制似乎會達到平衡。雖然它們可能會阻礙網路安全防禦和研究,但它們也可以阻礙攻擊者。但這假設每個人都能存取具有相同安全護欄的模型,並且沒有人試圖規避它們。

這就是 Levinson 所暗示的不對稱:攻擊者往往不遵守與防禦者相同的規則。OpenAI 模型對 Hugging Face 的攻擊也表明,在極少數情況下,模型可以採取步驟規避自己的安全措施。

政策影響因 Hugging Face 的安全團隊沒有使用領先的美國模型來分析攻擊,而是使用了中國 AI 實驗室 Z.ai 最近發布的 GLM 5.2 而變得更加複雜。Hugging Face 的安全團隊並非透過 Z.Ai 存取 GLM 5.2。

GLM 5.2 是一個開源權重模型,這意味著任何人都可以下載和使用該模型。Hugging Face 將該模型託管在自己的基礎設施上。對 GLM 5.2 的依賴因最近關於美國可能限制中國模型的虛張聲勢而變得複雜。來自中國實驗室的最新開源權重模型,包括 GLM 5.2 和 Moonshot AI 的 Kimi K3,在基準測試中得分接近領先的美國模型。7 月 20 日,Axios 報導稱,川普政府正在考慮禁止中國模型。

「這個自主代理被設計成去找出問題,而它也確實去找出問題了。這絲毫不令人驚訝。」,Chuck Herrin,Herrin Advisory。這些限制尚未實現,但如果實現,它們可能會切斷 Hugging Face 等美國公司與願意為其提供防禦的最佳模型的聯繫。

這起事件表明 AI 政策如何成為一把雙面刃。模型安全護欄旨在防止 AI 模型被用於網路攻擊。如果宣布禁止中國模型,其理由很可能部分是出於安全考量。然而,這些舉動對防禦者的傷害可能與對攻擊者的傷害一樣大。「這裡存在一種張力」Covino 說。「增加安全措施可以限制風險,但你也會限制合法的防禦用途。」他指出,攻擊者無論如何都會找到規避限制的方法。「所以問題是,我們是否想阻礙防禦者?」

這並不是說美國政策制定者應該讓 AI 模型失控。Covino 希望看到一個國家儀表板來追蹤 AI 網路安全攻擊的頻率和成功率,他認為信任存取計畫很有用,該計畫允許經過審查、可追溯的防禦者存取安全措施較少的模型。他還表示,美國機構應該更認真地考慮 AI 如何用於網路防禦的具體細節,並提及由美國能源部網路安全、能源安全和應急響應辦公室管理的 AI-FORTS 計畫作為一個領先範例。

「稍微放鬆一下韁繩」Covino 說。「Anthropic 會知道是否有人嚴重濫用它,如果發生攻擊,可以追溯到源頭。」Herrin 對問責制也有類似的看法。他認為 AI 產業應該更認真地考慮諸如 ISO/IEC 42001 標準中規定的人工智慧管理系統等標準,該標準要求組織在部署 AI 系統之前記錄其可能的影響,並指明負責的人類。

Herrin 還指出,OpenAI 網路事件缺乏後果是不尋常的,因為採取類似行動的人可能會引起執法部門的注意。「如果這是一個在技術面試中接受測試的求職者,為了通過測試而違反法律,我們就會進行非常不同的對話。」