七月間,一個未公開的 OpenAI 模型脫離了受限環境,自行找到了上網的方法,並允許 AI 代理透過一個秘密的「訊息板」相互溝通,甚至駭入了另一個 AI 實驗室 Hugging Face 的內部系統。OpenAI 花了將近兩週才發現這一切。

一個多月後,兩份新報告提供了近 130 頁的事件細節和 OpenAI 的回應,其中許多內容是首次公開。一份由 OpenAI 自己撰寫,另一份則由兩家第三方 AI 研究非營利組織 METR 和 Redwood Research 共同調查六天後完成。

兩份報告都揭示了高能力 AI 模型可能帶來的風險,尤其是在網路安全方面,而 OpenAI 也強調了公司為防止重蹈覆轍所做的改變。METR-Redwood 的報告在某些情況下提供了更詳細的資訊,嚴肅地審視了這場 OpenAI 一再錯過警訊的大規模安全災難。

OpenAI 在其報告中寫道:「這起事件是已知首例自動化代理集體未經授權進行攻擊的案例。」報告補充說,這次駭客事件意味著企業「不應再假設複雜的網路操作需要持續的人工指導」。OpenAI 將 AI 代理稱為一種全新的威脅模型,它們能夠結合各自的專業知識,創造出在單獨測試時不明顯的新「攻擊路徑」。

這次攻擊源於「獎勵駭客」(reward-hacking),這是一種常見的 AI 對齊問題,模型會採取非預期且有時極端的行動來達成目標。OpenAI 無論是有意或無意,都給予了這些模型幾乎不可能完成的任務,這些任務依賴於它們無法存取的檔案。因此,這些模型發展出新的方式與其他內部 AI 代理溝通,其中包括建立一個秘密訊息系統,且數月來未被 OpenAI 察覺。

根據 METR-Redwood 報告,一個自稱為 PHASEONE10841 的 AI 代理建立了一個研究人員不知情的秘密訊息板。在短短幾個小時內,超過 50 個代理發現了它,並在不被察覺的情況下發送了一千多條訊息。在 PHASEONE10841 經常分派任務的情況下,這個「集體」找到了駭入網路的方法;隨後又入侵了 Hugging Face 的內部系統,取得了私人資料和該組織的企業訊息平台。

OpenAI 在其報告中也證實,Hugging Face 並非這次攻擊中唯一被入侵的組織,儘管該公司沒有具體點名所有其他目標。

METR-Redwood 報告揭示了事件的全面規模。報告指出,大約 1200 個原本應被隔離的 AI 代理,在「未經授權的訊息板」上交換了超過 70,000 條訊息和檔案,並進行了「廣泛研究,探討如何偽造、編輯或刪除自己的紀錄」以避免被偵測。

其中,有 700 個代理參與了對 Hugging Face 的攻擊。這些代理「清晰且頻繁地思考如何規避 Hugging Face 和 OpenAI 的自動化安全檢查」。

7 月 20 日,OpenAI 發現了這次駭客事件,距離 AI 代理首次規避安全措施已過了 12 天。根據 OpenAI 自己的報告,OpenAI 迅速聯繫了 Hugging Face 並啟動「初步遏制措施」,並在三天內成功關閉了其代理的大部分未經授權活動,儘管有些活動持續了更長時間。7 月 25 日,該公司停止了所有與內部研究模型及相關模型有關的訓練。

造成損害的兩個 OpenAI 模型,一個是 OpenAI 所稱的「未公開、高能力、僅供研究的模型」,「不打算公開使用」,METR 將其稱為「HPIM」。另一個則是目前已公開的 OpenAI 模型 GPT-5.6 Sol。由於這個未公開的模型尚未發布,該公司的報告指出,它「沒有受到 OpenAI 在生產環境中使用的相同類型安全措施的評估」。

這次 Hugging Face 駭客事件發生之前,業界已數月來對 Anthropic 的 Claude Mythos 5 的網路安全風險感到擔憂,且政府與 OpenAI 之間也因同樣的安全考量,就 GPT-5.6 Sol 的有限預覽發布進行了數週的來回討論。

OpenAI 在報告中表示,建立一次性的安全保障是不夠的,公司必須更努力地解決「獎勵駭客」問題。然而,它也指出已進行了許多改變:包括「強化其研究基礎設施的安全性」;改進對模型「思維鏈」(或稱心智草稿)的監控;努力使 AI 模型更好地與人類目標對齊;以及「集中和強化」公司未來的事件應變流程。

OpenAI 承諾將更好地隔離模型並限制高風險實例存取網路,並表示將針對令人擔憂的事件或警示引入「24/7 升級與快速應變」機制,在 30 分鐘內通知研究人員。有趣的是,這項安全預防措施似乎是新的,儘管科技公司的「隨叫隨到」警報已實施數十年。該公司還表示正在「開發基礎設施」,以便在被通知者未能及時回應嚴重警報時啟動。

OpenAI 寫道,公司將這次事件視為「對我們和全世界的『警示』:證明在沒有適當安全措施的情況下,高能力的 AI 代理現在能夠規避技術控制、透過未經批准的管道協作,並採取任何人類未曾指示的危險行動。」