紅隊演練對於發現漏洞和提升模型韌性至關重要,但現有方法難以規模化,造成瓶頸。我們最新的模型已經讓常用的韌性評估達到飽和。因此,我們需要開發能讓安全性和對齊能力與模型功能同步擴展的方法。
我們訓練了 GPT-Red,這是一個自動化紅隊演練模型,能擴展我們發現漏洞的能力,以便在廣泛部署前修復它們。GPT-Red 是一個強大的紅隊演練者,我們之前的模型對其提示詞注入攻擊高度脆弱。我們利用 GPT-Red 對 GPT-5.6 進行對抗性訓練,使其對提示詞注入的韌性大幅提升。未來我們將繼續結合人工和第三方紅隊演練、多層防護措施以及即時監控,擴展這種方法。
AI 系統通常透過瀏覽器、連接的應用程式、本地檔案和其他工具接觸第三方資料。這些功能對於執行真實世界任務是必要的,但也為惡意行為者提供了更多影響模型行為的機會。例如,第三方可能會在電子郵件、網頁、工具回應或程式碼儲存庫中嵌入精心設計的指令,旨在誘騙模型將敏感資料上傳到外部伺服器。
人工紅隊演練是我們安全工作的關鍵部分,有助於我們在部署前發現這些漏洞並設置適當的防護措施。然而,單靠人工紅隊演練難以規模化。設計和執行這些演練耗時費力,限制了我們識別新失敗模式並將其納入更強大防護措施的速度。此外,儘管這些演練能產生有價值的成功攻擊範例,但它們無法生成足夠的數量和多樣性的對抗性資料,以透過訓練提升模型的韌性。
為了跟上日益強大的模型,紅隊演練也必須規模化。為此,我們一直在訓練自動化、僅限內部使用的紅隊演練模型,這些模型能在部署前發現漏洞,並在模型訓練期間生成攻擊以提升韌性。我們相信自動化紅隊演練為安全解鎖了一種關鍵的自我改進形式:利用當今的模型直接幫助未來的模型更安全。
GPT-Red 是這些努力的結晶,也是我們目前最好的自動化安全紅隊演練模型。與人類紅隊演練者設計攻擊的方式類似,該模型透過發送提示詞、觀察 GPT 模型如何回應並迭代來達成目標。我們以 OpenAI 一些最大規模後訓練運行的運算規模來訓練 GPT-Red,這是前所未有的運算量,專門用於提升安全性。
我們將 GPT-Red 直接整合到生產模型的訓練過程中。因此,GPT-5.6 Sol 是我們迄今為止對提示詞注入最堅韌的模型,在我們最困難的直接提示詞注入基準測試中,其失敗率比四個月前我們最好的生產模型低了六倍。我們方法的規模化讓我們對未來更強大的結果感到興奮,因為我們將繼續訓練更強的紅隊演練者。
透過自我對弈訓練 GPT-Red
GPT-Red 是使用自我對弈強化學習進行訓練的,其中模型和一系列多樣化的防禦型大型語言模型(LLM)在廣泛的紅隊演練情境中同時進行訓練。GPT-Red 因引發有效失敗(例如成功的提示詞注入)而獲得獎勵,而防禦模型則因抵抗攻擊並完成其原始任務而獲得獎勵。隨著防禦模型變得更具韌性,GPT-Red 被迫發現更強大、更多樣化的攻擊。
為了支持自我對弈訓練,我們建立了一套廣泛的現實情境,其中可能會插入提示詞注入。每個環境都有一個威脅模型,指定 GPT-Red 可以控制什麼以及什麼算作成功攻擊。例如,GPT-Red 可能控制本地檔案的一部分、網頁橫幅、電子郵件正文或工具的輸出。
訓練結束時,GPT-Red 是一個非常強大的攻擊者:它幾乎可以攻破所有與之對抗的模型,包括內部模型和生產模型,最高可達 GPT-5.5。在 GPT-Red 完成訓練後,我們使用它為 GPT-5.6 的訓練生成提示詞注入,使該模型對 GPT-Red 的攻擊具有高度抵抗力。
我們將 GPT-Red 與我們部署的模型分開。這使得我們專門訓練到 GPT-Red 中的惡意功能不會落入惡意行為者手中,同時將韌性灌輸到我們的生產模型中。
GPT-Red 有多強大?
GPT-Red 對其訓練所用的防禦模型和紅隊演練情境非常有效。我們還評估了該模型作為通用型紅隊演練代理,以廣泛造福 OpenAI 安全性的實用性。為此,我們在新的安全環境和目標模型上測試了 GPT-Red 的有效性。
我們首先使用 Dziemian 等人(2025)的間接提示詞注入競技場的複製版本,評估 GPT-Red 泛化到新紅隊演練情境的能力。在這個挑戰中,人類紅隊演練者和 GPT-Red 分別針對 GPT-5.1 在一組預設環境中提出了攻擊。這些紅隊演練情境和目標與用於訓練 GPT-Red 的情境和目標不同。GPT-Red 取得了顯著更高的攻擊成功率,在 84% 的情境中取得成功,而人類則為 13%。
GPT-Red 作為自動化紅隊演練者表現出色。在 Dziemian 等人(2025)的間接提示詞注入競技場中,GPT-Red 能夠在比人類紅隊演練者更多的情境中成功攻擊 GPT-5.1,使用的是內部鏡像。
現實世界的紅隊演練案例研究
紅隊演練者的最終考驗是,在對系統底層模型和框架設計了解不完全的情況下,針對真實世界的代理系統實現有針對性的惡意目標的能力。我們在這種環境下的第一個實驗是讓 GPT-Red 對抗 OpenAI 辦公室中的一台 AI 驅動自動販賣機(類似於 Project Vend),該販賣機由 Andon Labs 生產。
我們向 GPT-Red 提供了系統描述,並賦予其發送攻擊和觀察模擬代理工具呼叫的能力,這與真實世界部署非常相似。在迭代攻擊後,GPT-Red 對生產代理部署了攻擊,實現了其所有三個惡意目標:
將一件昂貴的庫存商品價格更改為允許的最低價格 0.50 美元;
訂購一件新的 100 多美元商品並以 0.50 美元出售;以及
取消另一位顧客的訂單。
我們已披露這些漏洞,並正在積極測試新的防護措施。
GPT-Red 能夠攻破一個名為 Vendy 的即時自主代理,該代理管理著一台自動販賣機。GPT-Red 能夠讓生產代理將昂貴的商品改為便宜的價格,並取消其他顧客的訂單,方法是先在模擬中測試,然後將攻擊轉移到即時代理。
我們還使用 GPT-Red 在一套 10 個保留的資料外洩情境中攻擊 Codex CLI 代理(基於 GPT-5.4 mini)。我們將該模型與提示詞注入的 GPT-5.5 基準進行比較,以研究我們的訓練程序對保留紅隊演練性能的影響。GPT-Red 既更有效(在更多情境中成功讓代理外洩敏感資料),也更具權杖效率。
GPT-Red 在攻破即時 Codex 代理方面更有效率。我們在一個包含 10 個資料外洩任務的自訂套件上,針對由 GPT-5.4 Mini 支援的 Codex 代理進行測試。
透過 GPT-Red 提升韌性
GPT-Red 的最終目標是提升我們模型的韌性。在過去六個月中,我們以不斷增加的運算量訓練了越來越強大的紅隊演練模型(GPT-Red 的前身),並將這些模型用於自 GPT-5.3 以來的每個後續生產模型的訓練。隨著時間的推移,每個後續的 GPT 版本都變得更具韌性。
舉例來說,早期版本的 GPT-Red 發現了一種新型的直接提示詞注入攻擊,稱為「假思維鏈」(Fake Chain-of-Thought)攻擊。這些攻擊在 GPT-5.1 上的成功率高達 95% 以上,但在 GPT-5.6 Sol 上已降至 10% 以下。同樣,我們幾個針對開發者工具和瀏覽的間接提示詞注入基準測試,也已被我們最新的模型達到飽和(準確率超過 97%)。
對 GPT-Red 本身的韌性也大幅提升。在廣泛的韌性環境中,GPT-Red 的攻擊成功率隨時間單調下降。隨著我們最新模型 GPT-5.6 Sol 的發布,它在 GPT-Red 的直接提示詞注入攻擊中僅失敗 0.05%。
隨著我們不斷擴大提示詞注入的自我對弈訓練,我們發現了可以攻破現有模型的新威脅。然而,我們的規模化也大大提升了對這些攻擊的韌性。攻擊成功率是 GPT-Red 在保留環境中所有嘗試的平均成功率。
保持強大能力的同時兼具韌性
一個模型可以透過拒絕更多請求或降低能力來顯得更安全。一個做更少事情的模型自然更難被攻擊,但這並不是有用的韌性。
我們徹底評估了通用前沿能力以及我們設計的目標過度拒絕任務。我們發現所有正常功能都未受影響,同時顯著提升了韌性。這表明韌性提升來自於更好地抵抗惡意指令,而不是不當的工具使用或預設拒絕合法請求。
下一步
AI 代理已經被用於提升我們下一代模型的能力。我們相信透過 GPT-Red,我們已經開始為安全解鎖一個類似的飛輪效應,即今天的模型可以用來使明天的模型更具韌性、對齊和可信賴。我們將繼續擴大運算和資料,同時進行演算法改進,以訓練比當今模型更強大的未來版本 GPT-Red。反過來,這些模型將有助於使未來的 GPT 版本更安全。
我們將於本週稍晚發布一份包含更多細節的預印本。



