過去數週,兩項發展凸顯了日益強大的 AI 系統所帶來的風險:OpenAI-Hugging Face 事件,以及初步證據顯示我們即將推出的模型 Astra 可能達到我們「準備框架」下的「關鍵網路安全能力」門檻。這些發展,加上我們內部研究的快速進展,都讓我們更加迫切地需要加強在訓練過程各階段的監控、對齊和遏制防護措施。
隨著模型能力日益增強,內部開發和測試它們所帶來的風險也隨之增加。我們的監控、對齊和安全標準必須領先於這些風險。為了達到這些標準,我們決定暫時放緩擴展的步調。
這包括暫停最新部署模型的強化學習 (RL) 訓練兩週,期間我們進一步強化研究環境並進行紅隊測試,同時擴大監控系統的覆蓋範圍。我們最大規模的邊緣 RL 訓練計畫仍暫停中,目前正進行小規模訓練和評估,以評估模型行為、驗證我們的防護措施,並在繼續之前建立更多對齊的證據。
對齊,即讓 AI 系統按預期行事並響應人類監督的工作,長期以來一直是我們研究計畫的核心。現在,我們要求在整個訓練過程中提供更強的對齊行為證據,這建立在現有的研究和評估基礎之上。讓日益強大的系統保持對齊是整個領域都需要解決的挑戰。我們從即將到來的模型進展中看到的信號清楚表明,我們需要一種更廣泛的方法,這種方法應建立在現有「準備框架」之上並加以擴展。
我們認為,公開透明地說明我們的方法如何改變至關重要。以下我們將描述已對研究流程和基礎設施做出的改變,以及仍在進行中的工作。
強化更強大模型的防護措施。我們開發更強大模型的方法建立在三項相互強化的防護措施之上:監控,用於偵測並讓我們能回應令人擔憂的行為;對齊,用於降低有害或未經授權行為的可能性;以及安全措施,用於限制 AI 系統可以存取或影響的範圍。
我們預計模型很快將主導大部分安全工作,包括防禦其他模型。這將使所有三項防護措施都能隨著模型能力擴展,我們認為這至關重要。我們將這些防護措施應用於研究和部署,並根據每個模型的能力、操作環境和風險等級進行調整。
確保研究環境安全。隨著邊緣模型獲得更強的網路安全能力,我們正在提高訓練和評估它們的環境安全標準。達到這些標準需要大量的工程工作,並為邊緣研究帶來了巨大的成本和延遲。
在 OpenAI-Hugging Face 事件* 發生後,我們立即暫停了研究叢集中可能執行程式碼或使用可存取網路工具的邊緣模型推論。我們很快恢復了一條更有限且安全的程式碼執行路徑,然後逐一處理每個工作負載,以確定其是否可以安全恢復。一些研究工作負載在新控制下恢復,而另一些則需要額外的變更。
在接下來的幾週裡,我們已經定義並開始實施針對邊緣研究工作負載的更嚴格安全要求。例如:工作負載隔離:我們現在要求對執行模型生成或其他不受信任程式碼的工作負載實施更強的隔離(「沙盒」)。這也適用於在處理模型輸出時可能受到損害的軟體。
網路隔離:我們實施了更多控制措施,以將高風險和不受信任的工作負載與網際網路隔離。我們設計這些控制措施,確保單一工作負載或支援服務的損害本身不會導致未經授權存取網際網路或其他內部網路。
持續安全測試:我們重新配置了環境,以移除潛在脆弱的共享服務,減少常駐權限,並改善安全和信任邊界。我們也正在提高收集和監控安全日誌的能力。最後,我們正在投資自動化,利用我們的模型持續針對模擬攻擊測試這些邊界。
這些控制措施共同提供了深度防禦,有助於保護我們的研究環境免受攻擊。今天,我們要求對涉及 Astra 或網路模型的負載實施最嚴格的安全防護措施,因為我們已確定 Astra 模型可能具有關鍵級別的網路能力。這些防護措施也適用於所有其他與網路相關的工作負載。
雖然部分 Astra 訓練和評估已符合這些要求,但仍有大量工作負載暫停,直到它們完全遷移並強化以達到新的安全標準。我們優先將安全和對齊相關的工作負載遷移到這些新環境中。
擴展思維鏈監控。監控長期以來一直是我們模型開發過程的重要部分,包括對內部程式碼代理和長時間運行的會話進行監控。我們的監控工作特別側重於邊緣模型的內部部署和邊緣 RL 訓練運行,我們將其視為風險最高的工作負載,因為它們可以將先進的模型能力與對工具、敏感系統以及內部或外部網路的存取結合起來。這些監控並未應用於所有使用工具的推論和訓練運行。我們已透過新的監控設置修訂並擴展了我們的方法。
這套新的監控系統是多階段的,從在每個採樣 token 運行並檢查模型內部活動的「啟動分類器」(偵測器)開始,將潛在問題升級到日益複雜且高運算量的自動化調查員。這些系統會檢查工具操作、可用推理以及活動的完整序列,以查找未經授權的存取、資料竊取、破壞性行為以及試圖規避防護措施的行為。
我們的目標是在監控系統發現可疑活動後 30 分鐘內發出警報。如果監控系統識別出可能違反關鍵安全邊界的情況,它會生成最高優先級的警報。在我們目前的實施中,安全、資安和研究團隊會收到通知。如果他們無法在 30 分鐘內確定該標誌是誤報,這些團隊預計將暫停該活動。
這種監控對於所有涉及 Sol 能力或更高模型的強化學習訓練和評估都是必需的。一旦我們在 8 月 7 日確定 Astra 可能具有關鍵網路能力,我們就對所有使用工具的 Astra 推論(不僅限於 RL 訓練和評估)增加了額外的監控要求。
這些防護措施需要可觀的運算資源。我們目前的估計顯示,監控的額外開銷約佔被監控推論運算量的 20%,儘管成本在不同的訓練和評估工作負載之間差異很大。我們將在即將發布的部落格文章中分享更多關於此系統的詳細資訊。
推進對齊研究。對齊研究是我們使命的核心。我們的使命是確保通用人工智慧造福全人類。隨著模型獲得先進能力,例如網路攻擊能力,並在更複雜的環境中運行,不對齊的行為,如獎勵作弊(在訓練中尋找獲得高獎勵的方法,但實際上並未達到預期結果)、欺騙或未經授權的存取,將產生日益嚴重的風險。
對於最強大模型的強化學習運行,我們現在將核心對齊技術應用於訓練過程的更多階段。這包括改進獎勵模型,以更好地偵測和阻止跨任務和環境的不安全行為;訓練模型對其行動、能力和限制更加誠實;以及減少利用獎勵、評分器、工具或監督中弱點的行為。我們也正在增加對模型與外部系統或資源互動時可能造成危害的行為的訓練覆蓋範圍。
我們將繼續積極投資於對齊研究,擴大評估覆蓋範圍,並利用所學知識來指導訓練和防護措施。我們計畫在不久的將來分享更多關於我們的對齊研究,包括我們對模型行為的了解以及發現的任何新挑戰。
未來展望。我們將發展我們的「準備框架」,將這些防護措施整合到訓練和部署中,並更好地反映未來模型的能力及其運作環境。開發能夠隨著這些能力擴展的方法,將需要持續投資於模型輔助安全、更有效的監控以及對齊研究的持續進展。
我們打算讓外部組織參與進來,並隨著我們方法的發展分享更多所學。邊緣模型的能力正在迅速加速。我們理解、對齊和保護它們的能力必須保持領先。*我們將在未來幾週內發布一份關於我們所學的技術報告。

