隨著模型能力日益增強,網路安全領域正迅速變化,這既能強化網路防禦,也能以空前的速度和規模發動攻擊。我們對即將推出的模型 Astra 進行了最新的內部評估,結果顯示其在代理式編碼和網路安全方面取得了重大進展。

這些結果,加上專家評估,使我們昨晚得出結論:根據我們的「準備框架」,我們無法排除 Astra 具備「關鍵網路能力」。我們之所以分享這些資訊,是因為我們認為向大眾以及安全與資安社群透明地揭露這種潛在的能力轉變至關重要。

我們於 2023 年 12 月首次發布了「準備框架」,當時模型尚未達到如此程度的生物、化學、網路安全和 AI 自我改進能力。我們建立此框架是為了指導我們識別能力進展,並規劃公司在這些能力出現時應採取的行動。包括 GPT-5.6-Sol 在內的先前模型,在邊界網路能力方面曾被評估為「高」門檻(而非「關鍵」門檻)。

根據我們的「準備框架」,如果一個模型能夠在沒有人為介入的情況下,識別並開發出針對許多強化過的真實世界關鍵系統中所有嚴重程度的功能性零日漏洞攻擊,或者在僅給予高層次目標的情況下,能夠設計並執行針對強化目標的端到端新穎網路攻擊策略,那麼它就達到了「關鍵網路安全」門檻。

儘管我們仍在對此模型進行基準測試和評估,但我們的初步評估顯示其性能足夠強大,目前我們無法排除其達到「關鍵」能力水準。Astra 是一個即將推出的模型,並未參與 Hugging Face 的漏洞利用事件。

因此,我們已擴大防護措施和安全控制的穩健性測試,使其足以應對這些能力的部署。在內部,我們也採取了以下步驟,以確保此模型的進一步開發能夠安全可靠地進行:

我們正在為更高能力模型及相關活動實施更嚴格的安全控制,包括隔離測試環境、限制網路和工具存取、強化模型權重保護與加密、額外的監控與偵測能力,以及沙盒執行。

我們正在暫停涉及 Astra 但尚未符合這些強化安全控制要求的內部活動。我們已對 Astra 的所有代理式應用(包括訓練和評估)實施了全面監控,以偵測風險行為和不一致。監控器會評估模型的「思維鏈」,並觸發安全應變以審查和中斷高風險活動。

我們將與相關政府機構和選定的 AI 安全組織合作,測試此模型的能力。我們將向第三方測試夥伴提供建議的安全控制措施,以便他們安全地執行高風險評估和工作負載。

此框架已引導我們完成了其他能力轉變。2025 年 6 月,當我們的模型在「準備框架」下接近生物學的「高」能力門檻時,我們概述了正在採取的步驟,以強化防護措施、擴大測試、與外部專家合作並部署額外的安全控制。我們在此應用相同的原則。

我們相信,先進的網路能力模型應該幫助防禦者在攻擊者之前識別並解決漏洞。我們致力於與政府、安全機構和公民社會合作,確保 Astra 等模型及其後續模型的邊界能力能夠負責任地廣泛部署,造福全人類。