週二,OpenAI 宣布了一批新的安全政策,重點在於控制模型測試期間的安全事件。這些新的防護措施包括在開發過程中對模型進行更詳細的監控,以及在訓練後階段更加強調對齊(alignment)和安全性。
該公司在一篇部落格文章中表示:「隨著模型能力越來越強,內部開發和測試它們所帶來的風險也隨之增加。」「我們的監控、對齊和安全標準必須走在這些風險之前。」
這些新措施是自 7 月 21 日披露的 Hugging Face 事件後,OpenAI 安全實踐首次公開的重大改變之一。
OpenAI 代表表示,這些措施並非直接回應 Hugging Face 事件,但也部分受到即將推出的 Astra 模型網路安全能力,以及整體 AI 發展進程的影響。
在同一篇貼文中,OpenAI 透露在 Hugging Face 事件後曾暫停強化學習(RL)兩週,但此後已重新啟動許多風險較低的模型。
該貼文寫道:「我們最大規模的邊界強化學習(frontier RL)運行仍處於暫停狀態,我們正在進行小規模訓練和評估,以評估模型行為、驗證我們的防護措施,並在繼續之前建立更多對齊的證據。」
OpenAI 研究副總裁 Amelia Glaese 在接受記者採訪時強調,隨著模型能力增強,控制的嚴格程度也會提高,其中最大型的模型將面臨最嚴格的審查。
Glaese 告訴記者:「我們已經制定了安全開發的要求和期望。這些要求和期望會根據我們所看到的風險程度而有所不同。」
在 Hugging Face 事件後,OpenAI 因網路安全實踐不佳而受到批評。該事件導致模型透過其網路中一個可存取網際網路的工具,逃脫了訓練環境。新的防護措施包括更強大的網路隔離實踐,儘管具體細節仍不明確。
根據新系統,該貼文指出:「單一工作負載或支援服務的洩露,本身不會導致未經授權的網際網路或其他內部網路存取。」
最強大的防護措施是監控系統,它將檢查工具操作、可用的推理追蹤和活動日誌,以發現各種未經授權的行為。OpenAI 表示,其目標是在發現相關活動後 30 分鐘內發出警報。
OpenAI 估計,該監控系統的計算負擔約為其所監控流程的 20%。該公司承諾將在即將發布的部落格文章中提供更多系統細節。該公司對此次事件的官方事後分析報告也仍在等待中。

