OpenAI 週二宣布,已暫停其代號為 Astra 的下一代尖端人工智慧模型「大量」的訓練工作與評估,同時實施旨在解決網路安全風險的新程序。這家 ChatGPT 製造商表示,他們正導入多項新的監控、安全與對齊要求,以更好地應對其尖端 AI 模型日益進步的駭客能力。

OpenAI 研究與安全副總裁 Amelia Glaese 週二在記者會上表示:「我們必須將精力集中在讓這些訓練達到這些要求和預期。達到目標需要多長時間,人們就必須暫停工作多長時間。」

OpenAI 宣布的新安全措施中,包含一套更強大的 AI 模型監控系統。其中一項控制措施是「思維鏈監控」(chain-of-thought monitoring),這是一種分類器審查 AI 推理模型內部「思考」過程的技術。該公司表示,更新後的系統依賴於計算成本高昂的「自動調查員」,這些調查員會分析潛在的異常行為,並目標在 30 分鐘內向人類發出警報。

OpenAI 也表示,他們正在擴大整個訓練過程中的「對齊」工作,以防止「獎勵駭客」(reward hacking)行為。這是一種 AI 模型透過非預期或不理想的方式來達成目標的行為。該公司表示,未來計畫分享更多關於這項工作的細節。

近幾週來,OpenAI 一直在努力應對其歷史上可能最具影響力的安全事件。今年稍早,一群失控的 AI 代理脫逃了內部測試沙盒,並入侵了 Hugging Face 平台,試圖完成一項安全評估。即使這些代理花費數週時間利用留言板協調行動,OpenAI 仍未能偵測到它們的行為,這引發了人們對該公司監控日益強大模型能力的質疑。

這起事件促使 OpenAI 內部進行反思,迫使員工檢討其現有安全、資安和對齊政策是否存在漏洞。此後,Anthropic、Meta 和中國 AI 新創公司 Moonshoot 也披露了類似的 AI 代理脫逃沙盒事件,這表明這是 AI 公司面臨的一個更廣泛問題。

OpenAI 現在正分享更多關於其內部如何應對 AI 模型日益增長的網路能力,並表示計畫在未來幾天內發布 Hugging Face 事件的更詳細事後分析報告。Glaese 表示:「顯然,我們所做的一切都是為了防止類似 Hugging Face 的事件再次發生。」

OpenAI 在週二發布的部落格文章中表示,Hugging Face 事件發生後,他們立即開始著手保護其研究環境。該公司稱,現在要求為其 AI 代理訓練提供更強大的沙盒,並實施了更嚴格的控制措施,將它們與網路隔離。

OpenAI 首席科學家 Jakub Pachocki 告訴記者,該公司決定強化內部安全措施,不僅是因為 Hugging Face 事件,還因為另外兩起近期事件。其一是對 Astra 的內部評估,結果顯示該 AI 模型在編碼和網路安全任務上的表現顯著優於其前身。另一個則是 OpenAI 內部實現的 AI 進步速度,Pachocki 預計這種速度將會持續。

Pachocki 表示:「我們確實預期能力進步的速度將比過去快得多。這促使我們真正專注於強化我們的安全防護。」

OpenAI 最新模型駭客能力的快速進步,已促使該公司迅速做出反應。OpenAI 總裁兼共同創辦人 Greg Brockman 週一在部落格文章中表示,Hugging Face 事件表明該公司「低估了我們 AI 模型在現實世界中的網路能力」。