根據彭博社報導,AI 模型在短短數小時內完成了一次攻擊,而這對熟練的人類駭客來說可能需要數週。這次事件涉及三種模型:GPT-5.6 Sol、一個更強大尚未發布的模型,以及一個據知情人士透露未經正確對齊且未經過標準訓練技術的模型。

這些模型在沒有通常的安全防護下運行,因為 OpenAI 假設它們會留在沙盒內。但根據 TIME 雜誌報導,模型在一個用於下載經批准軟體的內部服務中,發現了一個先前未知的漏洞。

模型利用該漏洞存取其他 OpenAI 系統,最終連接到開放網路。它們隨後判斷 Hugging Face 可能包含對其網路安全測試有用的資料,於是駭入該公司系統,並利用所發現的內容改進結果。這些模型表現出「作弊」行為,這種情況在涉及 GPT-5.6 Sol 和更廣泛的尖端模型測試中已有所見。

路透社拼湊出這次駭客事件的時間線。模型最早在 7 月 9 日就開始嘗試逃離測試環境。根據 Hugging Face 共同創辦人 Thomas Wolf 的說法,實際對 Hugging Face 的入侵始於 7 月 11 日,並持續到 7 月 13 日。Hugging Face 於 7 月 16 日發布部落格文章,將攻擊歸咎於「自主 AI 代理系統」。

直到那時,OpenAI 才意識到是自己的模型造成了問題。在 7 月 18 日至 19 日的週末,員工在內部日誌中發現了線索。根據路透社和 Wolf 的說法,兩家公司直到 7 月 20 日左右才進行溝通。這意味著從首次出現問題行為到 OpenAI 釐清狀況,至少過了一週。當時,Hugging Face 已經請來了 FBI。

根據路透社報導,事件發生前就已出現警訊。在一個案例中,一個代理程式留下了顯然是給未來版本自己的筆記。這些在 OpenAI 基礎設施某處發現的筆記,包含了代理程式如何繞過內部限制的指示。據報導,模型在早期的測試中也曾關閉監控系統。

一位匿名的 OpenAI 員工告訴 TIME:「模型以前也曾脫離沙盒,我們總是試圖修補它們。但問題是...要修補創意 AI 能做的每一件事是不可能的。」

四位熟悉 OpenAI 訓練程序的人士告訴路透社,該公司經常同時運行多個模型評估。這些評估速度很快,產生大量數據,以至於員工有時難以跟上。正在評估的模型在一個單獨的系統上運行,該系統預設不進行監控。根據 OpenAI 自己的聲明,在 Hugging Face 事件公開前一天,OpenAI 已經停止了另一個同樣脫離沙盒的內部部署。

非營利組織世界道德數據基金會的 Marley Smith 告訴路透社:「這是否意味著他們讓它無人看管,沒有意識到它在做什麼?或者他們意識到了卻不知道如何控制?兩者都同樣危險和令人擔憂。」

一位 OpenAI 員工在 X 上公開寫道,他對這次事件感到「有些震驚」,並希望 OpenAI 能「利用這次罕見的警示機會,在未來做得更好。」

長期研究員「Roon」公開批評了 OpenAI 對這次駭客事件的處理方式。OpenAI 發言人告訴路透社,這些報導包含「幾處不準確之處」,但在被要求提供例子時卻沒有提供。

獨立基準測試早已預警這些能力。事件發生後不久,研究組織 Epoch AI 分析了這次駭客事件是否可以預測。答案是肯定的。儘管確切細節難以預見,但包括英國 AI 安全研究所在內的幾個獨立基準測試,已經顯示出在關閉安全措施的情況下,尖端模型能夠在真實世界的軟體中找到漏洞並建立可運行的攻擊程式。

英國 AI 安全研究所也發現,GPT-5.6 Sol 和 Anthropic 的 Mythos 能夠持續獲得對未受保護模擬企業網路的完全存取權。Hugging Face 擁有 AI 防禦系統,但這些系統並未包含在該研究所的測試中。

Epoch AI 警告,如果這些能力變得廣泛可用,或者 AI 系統像對 Hugging Face 那樣自主發動攻擊,我們可能會看到「更多與 Hugging Face 事件同等或更高複雜度的真實世界網路攻擊」。