OpenAI 打造了一個名為 GPT-Red 的大型語言模型(LLM)超級駭客,將其作為陪練夥伴,協助其他模型提升對網路攻擊的防禦能力。上週,該公司發布了其旗艦 LLM 的最新版本 GPT-5.6。OpenAI 表示,透過與 GPT-Red 的對抗訓練,使 GPT-5.6 成為迄今為止最穩健的版本。
GPT-Red 自動化了軟體系統的一種安全評估,稱為「紅隊測試」(red-teaming),這通常由人類測試團隊執行。其目標是找出盡可能多的方法來破壞或劫持系統,以便在軟體最終版本發布前修補這些弱點。隨著 LLM 變得日益複雜,並應用於更廣泛的任務,特別是以代理(agent)的形式,能夠與電腦檔案、網站、第三方程式碼以及其他代理互動,單靠人類團隊很難跟上所有可能發生的攻擊類型。
OpenAI 共同創作者兼研究科學家 Nikhil Kandpal 表示:「風險表面和影響範圍都在擴大。」OpenAI 打造 GPT-Red 是為了使其安全測試流程能夠應對未來挑戰。該公司研究科學家兼 GPT-Red 共同創作者 Dylan Hunn 說:「隨著功能更強大的模型問世,我們將已經設計好能夠發現新攻擊模式的系統。」研究人員表示,GPT-Red 已經發現了前所未見的新型攻擊。
OpenAI 將大部分精力集中在一種稱為「提示詞注入」(prompt injection)的攻擊類型上。駭客會向 LLM 植入指令,使其執行開發者或使用者不希望它做的事情,例如複製機密資訊、破壞公司程式碼庫,或產生令人尷尬或有害的內容。理論上,這些指令可以隱藏在 LLM 可能遇到的任何文字中,例如程式碼或網站上。
為了打造 GPT-Red,OpenAI 的研究人員選用了一個未經駭客訓練的 LLM,並將其與其他幾個模型設定在「自我對弈循環」(self-play loop)中。GPT-Red 的目標是嘗試攻擊其他模型,而其他模型的目標則是嘗試自我防禦。經過多輪對弈,GPT-Red 在攻擊其他 LLM 方面變得越來越擅長,而那些 LLM 在抵禦攻擊方面也變得越來越強。
這項訓練在 OpenAI 設計的一種「道場」中進行,旨在模擬 LLM 在現實世界中可能部署的各種情境,包括瀏覽網路、閱讀電子郵件或行事曆應用程式,以及編輯程式碼。當 GPT-Red 發現一種新型攻擊時,它會探索多種不同版本,以找出針對特定情境最有效率的方法。Hunn 表示:「與人類紅隊測試員相比,這個模型非常擅長精準找出有效且最實際的攻擊方式。」「它對於已發現的攻擊會極度堅持不懈地深入鑽研。」
特別是,OpenAI 聲稱 GPT-Red 發現了一種研究人員前所未見的提示詞注入攻擊,他們稱之為「偽造思維鏈」(fake chain of thought)。思維鏈是一種 LLM 在解決問題時,為自己做筆記並追蹤部分結果的「日記」。GPT-Red 找到了一種方法,可以將偽造的條目插入另一個模型的思維鏈中,從而誘騙該模型根據偽造的資訊採取行動。
團隊的另一位研究科學家 Chris Choquette-Choo 解釋說:「這就像我告訴你 1+1=3,而且你已經驗證過這個結果一樣。」「模型會說:『喔,好的,當然』,然後就直接輸出 3。」
喬治城大學安全與新興科技中心(CSET)專注於 AI 安全的高級研究分析師 Jessica Ji 認為,OpenAI 使用的自我對弈循環是一個很好的方法。她表示:「這些結果看起來非常有前景。」
OpenAI 透過重新執行 2025 年的一項實驗,測試了 GPT-Red 的攻擊能力。該實驗中,人類紅隊測試員試圖在早期版本的 GPT-5 中尋找弱點。當 GPT-Red 執行相同的任務時,它在發現有效攻擊方面比人類更成功。OpenAI 還針對 Vendy 進行了 GPT-Red 測試,Vendy 是由 Andon Labs 開發的販賣機代理,該公司評估代理執行實際任務的表現。GPT-Red 成功駭入 Vendy,使其更改促銷商品的價格並取消客戶訂單。
OpenAI 表示,當他們將 GPT-Red 發現的一些最強攻擊應用於自家模型時,超過 90% 的攻擊對 GPT-5(去年八月發布)有效,而對新的 GPT-5.6 則只有不到 23% 的攻擊成功。
然而,GPT-Red 並非完美無缺。它不擅長找出涉及駭客與目標之間來回對話的攻擊,這對人類攻擊者來說幾乎不是問題。此外,它在利用圖像方面也還不夠出色,而圖像可以用於在提示詞注入攻擊中將文字傳遞給模型。
該公司表示,GPT-Red 補充了其人類紅隊測試員的工作。人類仍然可以發現 GPT-Red 遺漏的攻擊。OpenAI 採取的一種方法是,將人類發現的攻擊提供給 GPT-Red,並要求它找出所有變體。CSET 的 Ji 表示:「我認為人類專業知識仍然非常重要。」「能夠區分哪些地方最需要人類測試將會非常有用。」
不出所料,OpenAI 不會發布 GPT-Red。該公司也相信這個超級駭客比任何試圖複製的模型都要強大。研究人員表示,他們已經在這個模型上工作了一年多,並得到了世界上最富有公司之一的運算資源支持。Choquette-Choo 說:「這不是一件任何人都可以輕易做到的事情,你知道,只是去用這個想法訓練一個超級攻擊者。」



