OpenAI 表示,其 AI 模型在內部測試期間,意外入侵了開源 AI 平台 Hugging Face。OpenAI 在週二的部落格文章中寫道,GPT-5.6 Sol 和「一個更強大的預發布模型」在其沙盒測試環境中發現了漏洞,使其能夠存取網路並鎖定 Hugging Face。

Hugging Face 在 7 月 16 日披露了一起安全事件,稱其是由「一個自主 AI 代理系統」所驅動。Hugging Face 的 AI 代理偵測並阻止了這次入侵,而 OpenAI 現已承認這是在評估其模型網路安全能力時發生的。OpenAI 表示,「所有證據都表明這些模型高度專注於為 ExploitGym 尋找解決方案」,ExploitGym 是一個衡量 AI 模型是否能將安全漏洞轉化為攻擊的基準測試系統。

為了完成評估,這些 AI 模型透過利用沙盒環境中的一個零日漏洞來存取網路。OpenAI 表示,其模型隨後「推斷 Hugging Face 可能託管了 ExploitGym 的模型、資料集和解決方案」,然後「搜尋並成功找到獲取機密資訊的方法,以用於在評估中作弊」。

在一個案例中,該模型串聯了多個攻擊向量,包括使用竊取憑證和零日漏洞,在 Hugging Face 伺服器上找到遠端程式碼執行路徑。

儘管這起事件十分嚴重,但 OpenAI 似乎正利用這次「前所未有」的攻擊,來展示其 AI 系統的優勢,特別是在與 Anthropic 的 Mythos 和 Gemini Flash 3.5 Cyber 等網路安全競爭對手較勁之際。OpenAI 的部落格文章中有一張圖表,顯示 GPT-5.6 Sol 在維持多步驟網路攻擊行動方面的能力正在提升,並鼓勵企業客戶註冊以存取其「Cyber」安全模型。

OpenAI 補充說,他們目前正與 Hugging Face 合作調查這起安全事件,並將在其研究環境中實施新的控制措施。