OpenAI 的新模型 GPT-6 Astra 在產生幻覺方面比其前身更少,並且能更有效地阻擋提示詞注入攻擊。然而,它對於真正安全的 AI 代理部署來說,仍然不夠可靠。
根據 OpenAI 的系統卡片,新的 Astra 模型比其前身 GPT-5.6 Sol 產生更少的錯誤事實。OpenAI 針對用戶標記為錯誤答案的 ChatGPT 對話進行測試,這些都是特別容易出錯的案例,其失敗率不應被視為日常使用的典型情況。Astra 重現這些報告錯誤的頻率大大降低,尤其在低延遲設定和較低推理層級時表現出最大的進步。
對於直接的提示詞注入,即用戶試圖透過自己的提示詞來操縱模型,Astra 達到了近乎完美的 99.99% 防禦率。OpenAI 將此歸功於其 GPT-Red 方法,該方法使用自動化攻擊者在訓練期間強化模型。
越獄(Jailbreak)抵抗力也類似。針對一個包含已知攻擊的固定數據集,這些攻擊試圖提取有關生物學、暴力和網路安全的有害回應,Astra 在 91.5% 到 98.3% 的情況下拒絕提供幫助。
當攻擊者在多輪對話中調整策略時,Astra 的防禦率下降到約 67%,這意味著持續的攻擊者大約每三次嘗試中就能誘使模型產生至少一次問題回應。前代模型在相同的測試中得分略低於 50%。OpenAI 指出,這些測試是在裸模型上運行的,沒有包含實際產品中附帶的分類器等生產安全層。
隱藏式提示詞注入仍然是一個真正的安全問題。Astra 在間接提示詞注入方面取得了進展,這種攻擊是埋藏在 AI 讀取的文件中。資安公司 Gray Swan 進行的外部測試,使用其 IPI Arena 中策劃的 1,810 次攻擊,發現在每個情境嘗試 15 次的情況下,Astra 至少有一次被攻破的機率為 8.5%。
GPT-5.6 Sol 的失敗率為 27%。Claude Opus 5 在相同的評估中表現更好,為 4.8%,但它也並非完全免疫。
Gray Swan 在第一季和第二季的綜合測試數據實際上比早期結果有所上升。Anthropic 先前僅根據較簡單的第一季測試報告了 2% 的攻擊成功率,而 GPT-5.6 Sol 在該測試中也僅得分 20%。Anthropic 還在所有模型上開啟了擴展推理功能,這與更廣泛的測試範圍一起,可能解釋了其中的差距。
儘管這些是經過精心策劃、手動挑選的攻擊,但其成功率應該讓任何企業安全團隊感到擔憂。Astra 大約在每十二個情境中就有一個可能被注入的指令欺騙。Opus 5 表現較好,但仍約每二十一個情境中就有一個失敗。而且風險正在增長。AI 代理越來越多地自行編寫程式碼、操作工具和控制電腦,這正是 Gray Swan 測試的內容。這些代理也被設計成全天候大規模運行,讀取和處理文件是其核心工作之一。



