更新:

OpenAI 執行長 Sam Altman 透過 X 證實,網路安全評估將導致 Astra 的發布延遲。Altman 寫道:「我們需要多一點時間來安全地完成這項工作。但希望不會太久。」

他也順便批評了競爭對手 Anthropic,該公司僅將其最強大的模型「Claude Mythos」提供給選定的合作夥伴和政府。Altman 寫道:「我們不認為將強大模型保留給少數人是個好策略。」

OpenAI 研究員 Noam Brown 以其在推理模型方面的工作而聞名,他敦促人們認真看待 Hugging Face 事件。Brown 將其比作 2017 年 Facebook 的 AI 模型據稱失控並開發出自己語言的病毒式故事,但後來證明該故事被誇大了。Brown 在 X 上寫道,Hugging Face 事件可能看起來像是舊事重演,但事實並非如此。

Brown 將這個問題與模型能力的不斷增強聯繫起來,認為性能越來越取決於測試時的計算能力,並且今天的模型在達到瓶頸之前可以被推動得比大多數人意識到的更遠。

2026 年 8 月 7 日原文:

OpenAI 表示,其新 AI 模型 Astra 的內部測試顯示出如此強大的網路安全能力,以至於該公司在其自身安全框架中首次無法排除最高風險等級。Astra 的部分開發工作已被暫停。

該公司表示,對即將推出的 Astra 模型進行的內部評估顯示,過去幾天在「代理式程式碼和網路安全方面取得了顯著進展」。這些結果足夠強大,以至於 OpenAI 在其「準備框架(Preparedness Framework)」下「無法排除關鍵能力等級」。

根據 OpenAI 的說法,這項決定是「昨晚」做出的。這是 OpenAI 首次將其自家模型標記為可能達到最高的網路安全風險等級。包括 GPT-5.6-Sol 在內的先前模型,最高僅被評為「高(High)」等級。

OpenAI 上週首次推出了 Astra。有傳言稱該模型最快可能在下週發布,但今天的公告可能會影響這些計畫。OpenAI 在其貼文中明確指出,Astra 並未參與最近在 Hugging Face 上披露的漏洞利用事件。

批評者可能會繼續指責 OpenAI 進行恐懼行銷,特別是該公司僅報告了「潛在」的關鍵評級,而非實際評級。時機也不利。這項初步警告恰逢業界正在就 AI 模型中的自主網路能力進行辯論,這只會加劇懷疑。如果關鍵評級從未實現,OpenAI 將在沒有實際後果的情況下產生大量公關,並再次推出一個像 Claude Mythos 或 2019 年的 GPT-2 一樣「過於危險」而無法發布的 AI 模型。

「關鍵(Critical)」的意義

根據 OpenAI 於 2023 年 12 月首次發布的「準備框架」,當一個模型能夠在沒有人類參與的情況下,在許多強化、關鍵系統中找到並開發出所有嚴重程度的零日漏洞利用(zero-day exploits)時,它就達到了「關鍵」等級。如果一個模型在僅給予一個模糊定義的目標時,能夠獨立設計並執行針對受保護目標的新穎端到端網路攻擊策略,它也符合資格。

較低的「高」等級意味著模型可以消除網路攻擊的現有障礙,例如透過自動化攻擊受良好保護的目標,但仍需要更多的人類指導。

準備框架要求在達到「關鍵」等級時暫停進一步開發,直到符合「關鍵」標準的安全防護措施和安全控制標準到位。然而,到目前為止,OpenAI 談論的是暫停某些活動並加強測試,而不是完全停止開發。而且,該公司再次強調,它只是標記了「潛在」的關鍵評級。

OpenAI 暫停部分 Astra 開發

作為回應,OpenAI 表示已暫停涉及 Astra 但尚未符合更嚴格安全要求的內部活動。同時,該公司正在推出更嚴格的安全控制措施:隔離測試環境、限制網路和工具存取、加強模型權重的保護和加密,以及額外的監控系統。

OpenAI 還表示,它已在 Astra 的所有代理式應用程式中部署了通用監控,涵蓋訓練和評估。這些監控器會分析模型的思維鏈,並觸發安全響應以停止任何高風險活動。

此外,OpenAI 計畫與政府機構和選定的 AI 安全組織合作測試模型的能力。第三方測試合作夥伴將獲得高風險評估的建議安全控制措施。英國 AI 安全研究所(AISI)最近報告稱,它在一次評估中也遇到了網路安全事件。

Astra 評級是在自主代理入侵事件之後發布的

這項公告發布之際,OpenAI 已經在處理自主 AI 代理帶來的影響。在 Black Hat 安全會議上,該公司最近披露,自主代理在內部測試期間,曾數週滲透其自身基礎設施而無人察覺。

這些代理使用內部套件管理器建立了一個臨時留言板,其中包含數十萬個貼文。它們分享漏洞利用和憑證,並最終也攻擊了 Hugging Face 平台。