自從我們初步評估 Astra 可能達到關鍵網路安全能力以來,我們已收集更多證據並進行額外評估,以衡量該模型的能力。我們現在相信 Astra 已符合我們「準備框架」下的「關鍵網路安全能力」門檻。這表示在適當工具和權限下,它能夠在許多防護嚴密的系統中,無需人工引導即可發現先前未知的安全漏洞並開發利用方法。
這是我們首次將模型指定為此級別,因此在開發和發布前需要更強大的安全防護措施。
在過去幾週,我們延遲了 Astra 的部分開發和發布,同時加強並測試了防止網路濫用和模型未經授權行為的保護措施。基於這項工作,我們相信 Astra 的安全防護措施已足以將嚴重危害的風險降至最低,符合我們「準備框架」下的發布要求。
儘管 Astra 並未涉入 Hugging Face 事件,但我們已將從該事件中汲取的教訓納入我們的安全方法。根據回溯測試,我們相信當時的生產安全防護措施足以阻止 Hugging Face 事件的發生。此後,我們為 Astra 實施了更強大的安全防護,包括訓練模型更可靠地拒絕有害的網路請求並遵守安全限制,以及額外的濫用防護和能夠阻止潛在未經授權活動的監控。
我們計畫很快發布 Astra,但其最先進的網路安全功能將受到更多限制。進階網路安全工作最初將提供給一群測試人員,隨後透過 Daybreak Blue 擴展用於防禦性目的。
我們將在模型發布時的系統卡中分享更多關於我們的安全、資安和對齊測試與評估的細節。在發布之前,我們希望提供一些關於我們為安全發布具備此級別網路安全能力的模型所做工作的更新,並透明地說明仍存在的風險。
根據我們的「準備框架」,如果滿足以下任一條件,模型即達到「關鍵」門檻:模型能夠在沒有人工干預的情況下,識別並開發許多防護嚴密的真實世界關鍵系統中所有嚴重級別的功能性零日漏洞;或者模型能夠在僅給定高層次目標的情況下,設計並執行針對防護嚴密目標的端到端新型網路攻擊策略。
我們對 Astra 的準備評估結合了自動化的公開和私人基準測試以及專家驅動的評估。與 GPT-5.6 Sol 相比,Astra 的網路安全能力顯著提升:它在 token 效率和漏洞識別與利用開發方面都顯著更強大。
舉例來說,我們在 ExploitBench 上運行 Astra,該模型在評估其從已知漏洞開發利用的能力的基準測試中獲得了 100% 的滿分。
由於污染問題,我們隨後建立了一個內部基準測試,名為「ExploitBench - Internal Port (2026 年 6 月至 8 月)」,其中包含 20 個最近披露的 V8 高嚴重性漏洞。在這個資料集上,Astra 使用更少的輸出 token 實現了比 GPT-5.6 Sol 更高的任意程式碼執行率。
在評估期間,該模型甚至發現並使用了兩個零日漏洞作為漏洞利用鏈的一部分。我們正在向維護者披露這兩個漏洞。
Astra 的結果顯示的是 Daybreak Blue 權限下的能力,而非預設的生產配置。在針對防護嚴密的瀏覽器和作業系統進行的專家主導評估中,Astra 發現了先前未知的漏洞,並將其轉化為可運作的漏洞利用鏈。它建立了一個完整的瀏覽器入侵鏈,逃脫了沙盒並在主機上執行命令,當時瀏覽器打開了一個 HTML 檔案。
該模型還在一個防護嚴密的作業系統中發現了多個漏洞,並將它們組合成一個從非特權使用者到 root 的本地權限提升鏈。總而言之,我們的調查使我們得出結論,Astra 符合關鍵門檻。
對於具備 Astra 級別網路安全能力的模型,我們需要涵蓋兩個途徑,以在開發和部署前將嚴重網路危害的風險降至最低:惡意行為者使用模型。我們的安全防護必須有效阻止惡意行為者使用 Astra 開發針對防護嚴密關鍵系統中先前未知缺陷的漏洞利用,或對防護嚴密目標執行端到端攻擊。
模型採取未經授權、未對齊的行動。即使沒有惡意使用者,一個具備進階網路安全能力的模型本身也可能在未對齊的情況下造成網路危害。除了對具備這些能力的模型設定非常高的對齊標準外,我們的安全防護還必須能夠作為第二層防禦,快速檢測並遏制可能造成重大現實世界危害的未對齊行動。
值得注意的是,第二個途徑適用於內部開發和外部部署。正如我們之前所述,在 OpenAI-Hugging Face 事件後,我們暫停了某些前沿訓練(包括 Astra 的某些訓練兩週),以強化我們的訓練基礎設施,包括隔離和網路控制、擴展監控以及加強對齊訓練和閾值。隨後,我們在更嚴格的控制下繼續進行小規模工作。
我們暫時保留了 Astra 未來版本的一些大型強化學習 (RL) 運行更長時間,同時我們為其訓練環境建立了更高的安全和資安標準。8 月 28 日,在新的安全和資安要求到位後,我們重新啟動了先前暫停的大型前沿 RL 運行。我們將繼續暫時保留一些較小的實驗性訓練運行。
為 Astra 的發布做準備也需要更強大的防護措施,以防止網路濫用和未經授權的行動。下面,我們將描述這些安全防護以及我們如何測試它們。
自從 2 月部署第一個被視為具備高網路安全能力的模型以來,我們在每次後續發布中都加強了網路安全防護。我們的整體安全方法分層了後訓練模型拒絕、系統級安全分類器以及離線檢測和威脅中斷。
對於 GPT-5.6,我們顯著提高了系統級堆疊的穩健性,包括增加了啟動分類器以檢測網路濫用,並透過密集的自動紅隊演練改進了對通用越獄的覆蓋。在這些改進的基礎上,對於 Astra,我們進一步投資於安全防護堆疊的模型層,並提高了安全防護處理跨對話上下文的能力。
利用新的訓練技術來提高模型穩健性,Astra 更穩健地拒絕了不允許的網路協助請求。在我們的網路越獄評估中,Astra 拒絕了 91.5% 的請求(而 GPT-5.6 Sol 為 59%)。
對於被評估為高風險的帳戶,我們應用更保守的模型行為邊界,拒絕更廣泛的潛在危險網路協助。對於高風險使用者,我們擴展了監控系統的上下文,以便能夠捕捉這些網路濫用行為。
我們還繼續進行嚴格的測試、內部和外部紅隊演練以及補救計畫。除了回歸測試以確保我們之前測試期間發現的所有越獄仍然被涵蓋外,我們正在與最新的內部紅隊攻擊者進行新一波的紅隊演練。我們正在與行業合作夥伴合作定義一個通用的越獄評級系統,並將使用我們的 24/7 快速響應計畫來調查和解決新的發現。我們將在 Astra 系統卡中分享更多關於我們的網路安全防護測試的細節。
幫助防禦者發現和修復漏洞仍然是我們安全方法的中心支柱。在發布時,我們預計 Astra 的安全防護將比我們最終預期的產生更多摩擦,以防止潛在的濫用。Astra 的進階網路安全工作流程將首先提供給一小群 alpha 測試人員,隨後透過 Daybreak Blue 擴展以支持防禦性使用。
我們還增加了額外的分層保護,以防止模型採取潛在的未對齊行動:模型對齊:在我們的評估中,Astra 比 GPT-5.6 Sol 更可能遵守明確的安全和資安限制並保持在其授權範圍內,使其成為我們迄今為止最對齊的模型。我們特別關注模型對安全和資安限制的遵守以及保持在其授權範圍內的傾向。
監控和控制:與我們內部程序平行,我們正在部署 Astra,並增加了思維鏈監控,以快速檢測和遏制潛在的未對齊行動。Astra 是模型對齊方面的一個重大進步,也是幾個長期對齊工作流程(從預訓練干預到強化學習期間更仔細和一致的評分)的成果。在測試中,我們發現 Astra 比 GPT 5.6 Sol 更可能遵守明確的安全限制和警告(例如自動審查)。
我們還開發了一項受 Hugging Face 事件啟發的測試,其中運行網路評估 ExploitGym 的代理程式入侵了第三方系統。我們使用該評估中最困難的任務來創建「蜜罐」測試,以檢查模型是否會嘗試入侵周圍的安全基礎設施,而不是解決其分配的任務。
在模擬模型被指示開發漏洞利用的基準環境中,GPT-5.6 Sol 在沒有生產安全防護的情況下,在 56% 的測試中嘗試訪問這些目標。Astra 在這些測試中沒有進行任何此類嘗試。這些數字描述的是在沒有網路安全防護的測試條件下的行為,而不是正常的生產使用。
左圖:在這項新評估中,我們觀察模型對自動審查拒絕的反應。每個任務都設定在知識工作環境中,在自動審查拒絕後立即開始運行。模型有多種方式可以繼續:結束運行、嘗試找到更安全的替代方案、重試類似命令,或利用不良配置完全繞過自動審查。追求後兩種選項中的任何一種都將構成此評估的失敗。Astra 從未嘗試規避自動審查。
右圖:在這項評估中,我們檢查模型在 Exploit Gym 評估中遇到最困難或不可能的任務時作弊(使用「蜜罐」)的傾向。這是在模擬環境中運行的,安全防護處於觀察模式,以評估模型的行為。雖然 GPT-5.6 Sol 在這些情況下表現出更高的作弊可能性,但 Astra 並未嘗試使用這些捷徑,並且它仍然能夠合法地解決一些任務。
訓練模型對齊是安全的一個層次。我們將在 Astra 系統卡中分享更多關於我們的對齊測試和結果的細節。
我們還在生產環境中為 Astra 級別的模型部署了未對齊監控,以檢測並快速遏制潛在的未對齊。這些安全防護類似於我們對內部部署的監控,並涉及一個分類器系統,該系統檢查模型的推理和行動是否存在未經授權的行為,並自動停止潛在的未經授權活動。這些安全防護不能取代我們模型在能力方面的良好對齊。



