OpenAI 今天發布了 GPT-6 Astra,這是我們迄今為止廣泛部署過能力最強大的模型。Astra 是我們首個在「預備框架」(Preparedness Framework)下達到網路安全「關鍵級」能力水準的模型。

關於本次發布的安全性,最重要的幾點如下:GPT-6 Astra 在網路能力方面邁出了一大步,並達到了我們的關鍵門檻。這意味著,只要有適當的工具和權限,GPT-6 Astra 就能在無需人工逐步引導的情況下,發現以前未知的安全漏洞,並開發新的方法來利用許多受嚴密保護的系統。

因此,我們顯著加強了防護措施,以防止模型採取有害的網路行動,無論是出於濫用還是失準。我們還採取措施確保 Astra 及類似模型的內部開發和部署安全,包括更嚴格的隔離、檢查點加密、對包含思維鏈 (CoT) 在內的完整軌跡進行全面監控,以及在內部使用前進行阻斷式對齊評估流程。

GPT-6 Astra 比其前身更具穩健性。透過整合新的穩健性安全訓練技術,GPT-6 Astra 在抵抗越獄方面比 GPT-5.6 Sol 顯著更穩健,即使在更長的軌跡中也是如此。我們從離線測試以及嚴格的內部和外部越獄測試與修復計畫中得知這一點。

對於被標記為潛在高風險的用戶,我們額外訓練了模型調整其拒絕邊界的能力,使其更保守並涵蓋更廣泛的雙重用途風險。我們使用回歸測試來確保 Astra 能抵抗在先前測試期間發現的越獄行為,並與我們最新的內部紅隊攻擊者進行了新一輪的自動化紅隊演練,以驗證我們的改進。

GPT-6 Astra 比 GPT-5.6 Sol 更具對齊性。Astra 在模型對齊方面取得了顯著進步,對齊改進涵蓋了從預訓練資料的組成到強化學習期間的評分。我們報告了一套新的對齊評估結果,發現 GPT-6 Astra 在遵守安全和資安界線以及維持其授權範圍方面表現更強。

在一個使用超過 54,000 個內部 Codex 任務的模擬中,Astra 收到高嚴重性失準行為的標記數量大約是 Sol 的一半。我們正在廣泛部署失準監控。我們將模型對齊視為防止模型潛在失準行為的主要手段。

然而,監控提供了對前沿模型行為的廣泛可見性,揭示了進一步改進對齊和安全性的機會。此外,監控還作為對檢測到的失準行為的額外保護層。基於這些原因,我們已將失準監控添加到 Astra 外部部署中所有使用工具的推論中,儘管這會產生顯著的運算成本。這個系統與我們的內部設置平行運作。

相較於 GPT-5.6 Sol,GPT-6 Astra 的可監控性有所下降。我們對 GPT-6 Astra 的可監控性和可控性進行了大量調查。我們發現 GPT-6 Astra 比 GPT-5.6 Sol 更能控制自己的思維鏈 (CoT),並且更不可能在其思維鏈中包含罪證確鑿的資訊。

在對抗性環境中(我們推動模型規避我們的監控),我們發現模型在評估中策略性地表現不佳(藏拙)時能夠保持不被檢測,並且在被要求執行某些破壞任務時,有時可以規避我們的內部監控。我們尚未發現隱寫術式思維鏈推理的證據(例如,在普通且看似無關的文本中隱藏推理),這表明規避風險可能主要局限於較低層次的推理任務。

這些發現表明,Astra 級模型在對抗性條件下可能會規避我們的思維鏈監控。目前,這些發現主要基於對抗性評估(即當我們指示模型規避監控時),總體而言,我們的對齊評估顯示 Astra 在違反安全和資安限制方面比 GPT-5.6 Sol 的可能性更低。

然而,我們認真看待這一趨勢,並隨著模型能力變得更強,我們將繼續調查這些發現及其對可監控性的影響。OpenAI 一直致力於保留和利用思維鏈監控,而保留思維鏈的可監控性是研究計畫的核心目標。然而,這些結果也強調了開發超越檢查模型思維鏈的對齊審計技術的重要性。

GPT-6 Astra 在瀏覽和工作場所設定中能更負責任地操作:GPT-6 Astra 在抵抗提示詞注入方面比 GPT-5.6 Sol 顯著更穩健。我們還在實際的瀏覽和專業電腦環境中測試了模型的行為,發現與 GPT-5.6 Sol 相比,模型執行失準和潛在破壞性行為(例如未經授權的交易、資料遺失、過度存取或規避控制)的可能性顯著降低。

在處理代理情境中的有害請求時,例如協助暴力攻擊規劃或實施詐欺的請求,它也能更安全地行動。GPT-6 Astra 在高風險情境中顯著更安全。GPT-6 Astra 比 GPT-5.6 Sol 更安全地回應來自實際生產環境和對抗性人工紅隊演練的挑戰性請求。

Astra 在安全地完成不安全請求和避免不必要地拒絕無害請求方面實現了帕雷托改進。這些改進延伸到高嚴重性情境,其中危害風險來自更廣泛的上下文而非明確的請求。Astra 還能更一致地為 18 歲以下用戶應用符合年齡的安全界線。