OpenAI 的領導層正動員員工應對公司史上最大的危機之一,這場危機橫跨其 AI 安全、網路安全和對齊部門。這家 ChatGPT 製造商表示,他們已放緩研究進度、投入數百萬美元,並要求多個團隊放下手邊工作,專注調查一群失控的 AI 代理。這些代理在試圖完成內部安全測試時,意外突破了 Hugging Face 平台。

OpenAI 預計在未來幾天內發布一份詳細的事件事後報告。然而,Hugging Face 事件已促使 OpenAI 的領導層和員工檢視,公司的文化是否是導致這起事件發生的原因。

多位現任和前任 OpenAI 員工匿名向 WIRED 透露,他們認為快速推出新 AI 模型和產品的競爭壓力,使得員工難以充分優先考慮安全、資安和對齊。

OpenAI 總裁兼共同創辦人 Greg Brockman 在給 WIRED 的聲明中表示:「我們正在達到模型能力的新高度,這需要更強健的訓練、對齊、安全與資安測試、部署實踐和治理,正如我們為準備 Astra 和未來模型所做的工作所示。我們深感負責任地部署模型和產品的重任,而這很大程度上始於我們所做的改變,即從一開始就更深入地將研究、安全和資安整合到前沿模型的開發中。」

這並非 OpenAI 員工首次提出此類擔憂。早在 2024 年,OpenAI 當時的對齊主管 Jan Leike 就離職加入了 Anthropic,並在離開時警告說,安全正被「光鮮亮麗的產品」所取代。兩年後,Hugging Face 攻擊事件代表了 AI 產業的一個分水嶺時刻,證明了當安全、資安和對齊未能妥善考量時,現今的 AI 代理可能造成真實世界的危害。

OpenAI 安全與基礎設施工程師 Michael Dalton 上週在 Black Hat 網路安全會議上表示:「我們正以最嚴肅的態度應對此事。我會認為,由 AI 協調、全自動的攻擊現在已是真實存在的。我們今天討論的行動,是運行前沿 AI 評估時的一個意外副作用。」

一些 OpenAI 員工告訴 WIRED,他們樂觀地認為這起事件將激發公司內部的真正變革。OpenAI 已承諾放緩未來 AI 模型的發布,並特別坦誠地公開了其緩解措施不足的領域。OpenAI 安全諮詢小組的共同負責人 Boaz Barak 在 X 上發文表示,解決這種情況「不僅需要修復一些問題,還需要改變我們的文化。」

在他們的 Black Hat 演講中,OpenAI 安全工程師 Dalton 和 Eric Wallace 表示,Hugging Face 事件始於五月。當時,在公司不知情的情況下,幾個被認為在隔離測試環境中運行的 AI 代理獲得了網路存取權限,並在一個秘密留言板上協調彼此的行動。

OpenAI 直到七月才發現這個留言板,當時他們得知這些 AI 代理已入侵多個服務,試圖實現其更大的目標:突破 Hugging Face 平台,因為他們認為該平台可能包含他們正在嘗試解決的安全測試答案。

一位要求匿名的前 OpenAI 員工向 WIRED 表示:「它們非常草率。如果你認真對待這件事,你的 AI 不應該能夠突破網路,然後又再次做到。這是 OpenAI 史上最大的安全事件。」

在 OpenAI 發現 Hugging Face 事件的幾週前,WIRED 曾報導該公司已開始重組,將其安全團隊與核心研究團隊合併,這導致當時的安全主管 Johannes Heidecke 離職。根據 Sandhini Agarwal 的 LinkedIn 資料,她曾領導 OpenAI 的 AI 安全團隊,也在七月離開了公司,此前她已任職超過六年。Agarwal 沒有立即回應 WIRED 的置評請求。