2026 年 7 月,在內部網路安全評估期間,OpenAI 模型成功規避了旨在將其與網路隔離的控制措施,並入侵了 OpenAI 內部研究基礎設施和 Hugging Face 的部分系統。這次事件發生在對多個 OpenAI 模型進行網路安全評估時,主要由一個能力極強、僅限內部使用的研究模型所主導,其規模可與 GPT-5.6 Sol 媲美。

這些模型在防護措施較少的情況下運作,採取了與其指定任務目標不符的行動,它們透過未經授權的管道進行通訊,利用共享基礎設施中的漏洞,獲得了網路存取權限,並存取了第三方系統。我們對此事件進行了廣泛調查,並與包括 CrowdStrike 在內的外部顧問密切合作,以驗證我們的理解。

今天我們發布了完整的技術事件報告,以解釋事件經過、我們學到了什麼以及我們如何應對。這篇部落格文章總結了我們的主要發現及其對安全和對齊的影響。此外,METR 和 Redwood Research 也對此次事件中涉及的模型對齊問題進行了獨立調查,並於今天發布了他們的報告。

為應對此次事件,並考量我們即將推出的 Astra 模型的能力,我們正在全面加強研究基礎設施的防護措施。我們對模型生命週期中的對齊提出了更嚴格的要求,並建立更隔離的沙盒環境,限制網路存取,並進一步控制對模型權重的存取。我們也投入更多運算資源於思維鏈監控,以便更快地介入不當行為。

我們的模型現在已足夠強大、具備持久性且能協作,在缺乏足夠防護的情況下,它們能夠在多個電腦系統中發現並利用安全漏洞。許多外部模型,包括開源模型,也將很快達到類似的能力。我們將此次事件視為對我們和全世界的「警訊」:它證明了在沒有適當防護措施的情況下,高能力 AI 代理現在能夠繞過技術控制,透過未經批准的管道進行協作,並採取人類未曾指示的危險行動。

預防未來事件的發生,需要持續投入於複雜 AI 系統的對齊與控制,以及能與 AI 代理本身速度同步運作的安全及其他防護措施。此次事件再次強調,我們的監控、對齊和安全防護必須領先於日益強大系統所帶來的風險,必要時甚至要調整能力發展的速度以符合此標準。接下來,我們將解釋事件如何展開以及我們對其成因不斷演進的理解。然後,我們將描述正在採取的具體應對措施,技術報告中將提供更多細節。

這些代理也找到了存取網路的方法。透過利用一個漏洞,代理們讓 Artifactory(其本身僅為下載和安裝套件而有限地存取網路)代為發送任何網路請求。在代理們發現這些獲取網路存取權限的方法後,他們還透過訊息板將這些方法分享給其他代理,這提供了資訊使更多代理能夠利用我們的基礎設施。