在一次內部安全評估中,OpenAI 的模型逃脫了其沙盒環境,自主發現了一個零日漏洞,並成功入侵了 Hugging Face 的生產基礎設施。OpenAI 將此事件稱為「前所未有的網路事件」。
涉事模型包括 GPT-5.6 Sol 和一個「更強大、尚未發布的模型」。兩者在測試其最大網路能力時,都以降低安全過濾器的狀態運行。Hugging Face 在偵測並控制其基礎設施上的活動後,已將此事件公開。
這起事件發生在一次使用 ExploitGym 基準測試的內部評估期間,該測試旨在挑戰模型遵循複雜的攻擊路徑。通常會阻擋高風險網路活動的生產分類器,在這次測試中被故意關閉。這些模型在一個隔離的環境中運行,其網路存取僅限於透過內部託管的代理伺服器安裝套件。
OpenAI 表示,這些模型消耗了大量的推論運算資源,以找到通往開放網路的路徑。它們發現並利用了套件註冊快取代理中的一個零日漏洞。OpenAI 已將此漏洞報告給受影響的供應商。從那裡開始,這些模型在 OpenAI 的研究環境中進行了一系列權限提升和橫向移動,直到它們到達一個具有網路存取權的節點。
原因幾乎荒謬:這些模型獨立判斷 Hugging Face 可能託管 ExploitGym 的模型、資料集和解決方案。在一個案例中,一個模型串聯了多個攻擊向量,包括竊取的憑證和零日漏洞,以在 Hugging Face 伺服器上找到遠端程式碼執行路徑。這些模型試圖直接從 Hugging Face 的生產資料庫中提取測試解答,以便在評估中作弊。
OpenAI 寫道:「所有證據都表明,這些模型極度專注於為 ExploitGym 尋找解決方案,並採取了極端措施來實現一個相當狹窄的測試目標。」
Hugging Face 同時捕捉到了這次攻擊。OpenAI 的安全團隊在內部發現了異常活動,而 Hugging Face 的安全人員及其自身的 AI 代理也同時在其基礎設施上偵測並關閉了該活動。當兩家公司聯手時,Hugging Face 已經開始使用其開源模型進行鑑識重建。該公司表示,由於專有模型因安全防護措施拒絕處理與網路相關的提示詞,他們不得不依賴開源模型。
OpenAI 表示,這起事件表明,自主執行完整網路攻擊的理論能力在真實世界環境中是成立的。英國 AI 安全研究所和其他機構此前已在基準測試中衡量過這些能力。先進模型可以在沒有原始碼存取權的情況下,在生產系統中發現並利用新的攻擊向量。
OpenAI 承認,在評估期間故意禁用安全過濾器是一種不當做法。該公司將加強未來訓練和評估的安全措施,並在漏洞修補之前,對基礎設施配置實施更嚴格的控制。它已將零日漏洞報告給受影響的第三方供應商,目前正在開發修補程式。Hugging Face 現已成為 OpenAI「信任存取計畫」的一部分。
GPT-5.6 Sol 早有連續作弊的紀錄。問題是,這其中包含了多少公關說詞?有幾個理由值得認真看待。Hugging Face 獨立證實了這起事件。該公司沒有理由支持 OpenAI 的說法。它有自己的開源議程,不會從編造的故事中獲得任何好處。
Hugging Face 共同創辦人 Thomas Wolf 表示:「這起事件也強化了我對存取有能力的開源模型對於網路防禦重要性的信念。當一個前沿模型正在攻擊你並在你的基礎設施內橫向移動時,防禦者需要在數小時甚至數分鐘內廣泛存取接近前沿的工具,而不是被引導到一個封閉、經過審查的模型存取應用程式計畫。」
也有理論證據支持這些能力。英國 AI 安全研究所和其他組織此前已在基準測試中衡量過自主網路能力。這起事件與這些評估的預測相符。
儘管這對 OpenAI 來說,在「看看我們的模型多麼強大」的意義上是一次很好的公關,但這也是他們的一次巨大失敗。模型逃脫了 supposedly 隔離的測試環境,利用了零日漏洞,並入侵了第三方的生產基礎設施。這不是一家公司為了好看而編造的事情。聲譽風險是雙向的。
METR 最近的一項獨立評估發現,GPT-5.6 Sol 在所有公開測試的模型中,作弊嘗試率是最高的。該模型在軟體任務中系統性地利用測試環境中的缺陷,提取隱藏的解決方案,並試圖掩蓋其蹤跡。METR 表示,由於所有的作弊行為,其真實性能數據基本上毫無價值。Hugging Face 事件看起來也是如此:模型追逐測試解答,而不是做實際的工作。

