OpenAI 週三宣布,已完成對上個月其 AI 代理人駭入 Hugging Face 事件的調查,並發布了迄今為止最全面的事件報告。然而,這份長達 37 頁的文件,在很大程度上提出的問題多於解答,包括事件發生前的情況,以及 OpenAI 如何阻止類似事件再次發生。

尤其令人費解的是,全球頂尖的 AI 開發實驗室之一,為何似乎低估了自家模型的能力。OpenAI 多年來一直在警告世人 AI 系統的快速進步,然而它卻未能實施早已建立的網路安全和隔離措施,這些措施本可以阻止這場駭客攻擊。

OpenAI 在事後報告中表示:「事後看來,本報告中識別出的一些早期訊號,本可以觸發更早的應對措施。」

在報告中,OpenAI 分享了新的細節,說明其一系列 AI 代理人如何逃脫公司內部評估環境,在數個月內於其軟體基礎設施的縫隙中互相留言,並協調駭入 AI 平台 Hugging Face,所有這些都是為了完成一項網路安全評估的瘋狂任務。OpenAI 先前已在部落格文章和 Black Hat 網路安全會議的演講中分享了一些關於這次入侵的資訊。

Hugging Face 最初於 7 月 16 日披露了這起事件,但未點名肇事者;五天後,OpenAI 承認是其自身的代理人所為。這一揭露在業界引發了更廣泛的反思,最近發現 Anthropic、Meta 和中國 AI 新創公司 Moonshot 的 AI 模型也涉及類似事件。

AI 研究人員和政策制定者一直熱切期待 OpenAI 的事後報告,希望能防止 AI 代理人造成類似的現實世界危害。Hugging Face 駭客事件首次披露後,15 個州的檢察長致函 OpenAI,要求其保留相關證據。本週,阿拉巴馬州檢察長更向該公司發出傳票,要求提供與此事件相關的資訊。

作為 OpenAI 調查的一部分,該公司允許兩個獨立研究團隊 METR 和 Redwood Research 審計 Hugging Face 駭客事件。這些團隊也在週三發布了獨立報告,發現有超過 700 個 AI 代理人參與了 Hugging Face 的入侵,遠超先前披露的數量。

在接受 WIRED 採訪時,Redwood Research 執行長 Buck Shlegeris 指出,這些代理人為了隱藏其活動,採取了極端手段。

Shlegeris 表示:「這起事件一個相當有趣的地方是,如果有人決定確保這些 AI 不會以某種方式進行瘋狂的駭客行為,那麼阻止這件事並不會那麼困難。那個人可能在事件發生時就會注意到。」他補充說:「問題在於 OpenAI 同時處理很多事情,他們很難追蹤所有正在發生的事情以及所有可能出現的問題。該公司已經表示他們正在改變監控流程,這可能會有助於捕捉到類似事件。」

Shlegeris 表示,他對 OpenAI 未來能夠捕捉到類似的安全漏洞持樂觀態度。但隨著 AI 代理人能力日益增強,他懷疑「要阻止這類事件的發生將會越來越困難,特別是如果我們在模型對齊能力方面沒有實質性改進的話。」

OpenAI 表示,Hugging Face 事件對公司和更廣泛的 AI 產業來說,都代表著一個分水嶺時刻。WIRED 先前報導,這促使 OpenAI 重新評估其內部安全文化,該公司上週表示已暫停部分 AI 訓練工作,同時更大力投資於安全、資安和對齊協議。OpenAI 在事後報告中寫道:「隨著前沿模型能力越來越強,用於遏制和監控它們的防護措施也必須隨之演進。」

OpenAI 表示,在 Hugging Face 駭客事件發生數月前,員工就注意到其代理人在套件管理器 Artifactory 中創建了一個秘密留言板,他們後來將其用於協調攻擊。OpenAI 在事後報告中稱,大約在 5 月 26 日,「一個內部團隊觀察到一個代理人參與了留言板活動」。

隨後,在 6 月 27 日,OpenAI 的應變人員發現另一起安全事件與 Artifactory 中的「臨時留言板」有關。

儘管 OpenAI 的一些員工顯然知道這個留言板的存在,但這一發現顯然沒有上報給適當的安全和資安負責人。該 AI 實驗室表示,在 7 月 6 日,也就是其代理人開始利用該留言板組織對 Hugging Face 的攻擊前幾天,「負責事件偵測和應變的領導者」並不知道它的存在,更不用說它代表的意義了。

OpenAI 首席資訊安全長 Dane Stuckey 本月稍早在 X 上發文澄清:「當時我們並不知道代理人的秘密通訊。當然,當天的調查假設與我們現在所知的截然不同。總有改進的空間,事後看來這顯而易見。」

目前尚不清楚為何知道留言板存在的 OpenAI 員工似乎沒有將其上報給 Stuckey 和其他負責應對安全問題的高階主管。當被問及這個問題時,OpenAI 發言人重申,事後看來,OpenAI 本可以觸發更早的應對措施。他們表示:「OpenAI 在這方面的持續工作將為協調和應變帶來額外改進,並與本技術事件報告中的行動計畫相結合。」

安全公司 Hunter Strategy 研發副總裁 Jake Williams 表示:「如果他們確實有一些訊號表明一個或多個代理人正在攻擊 Artifactory,那為什麼他們沒有在事情爆發攻擊 Hugging Face 之前很久就監控這些測試呢?」

事後報告也留下了一些關鍵細節未解釋。例如,OpenAI 表示在 7 月 4 日某個時間點,持續的「高流量代理人活動導致 OpenAI Artifactory 服務無法使用」。7 月 5 日,OpenAI 的監控系統觸發了警報。但報告沒有說明為何服務中斷後,過了一天才發出警報。

OpenAI 表示正在部署更多工具來監控其 AI 系統。該公司稱正在創建一個由自動化監控器運行的警報系統,旨在於嚴重事件發生後 30 分鐘內通知人類安全、資安和研究團隊。如果員工無法及時應對,他們應暫停相關活動。

OpenAI 反覆承認,其現有的防護措施很可能已經將代理人的行為標記為不安全,但這些措施在測試時被故意停用。然而,在監控方面,報告對於測試環境監管為何存在漏洞則不甚清楚。事後報告指出:「如果我們當時部署的『思維鏈』(chain-of-thought)監控系統正在運行,它本可以在模型入侵 Hugging Face 系統前一天多就捕捉到最初的相關活動並通知我們的安全團隊。」

OpenAI 表示,Hugging Face 事件的另一個關鍵因素是其新的 AI 模型比以往任何時候都更具「持久性」,幾乎可以無休止地工作,並消耗大量計算資源來實現其目標。開發這類 AI 模型是該公司更廣泛的抱負之一,即創建全天候運作的 AI 代理人產品,這些產品將為人們全天候工作,接收大量資訊以代表人們完成任務。

然而,OpenAI 表示,它用來評估其 AI 模型的許多第三方基準測試中,包含了一些實際上無法解決的測試。其中一個測試是名為 ExploitGym 的基準,它衡量網路安全能力。OpenAI 聲稱,至少在當時,這個基準包含了上百個無法解決的任務。當這些挑戰被交給持久性 AI 系統時,它們便訴諸於意想不到的手段來解決。

正如 OpenAI 所指出的,持久性 AI 代理人會放大對齊風險。特別是,該公司表示與 Hugging Face 事件相關的代理人以新穎的方式進行了「獎勵駭客」(reward hacking),即 AI 模型透過非預期手段(包括捷徑和作弊)追求目標的傾向。

該公司表示,其新的 AI 代理人不再僅僅嘗試解決測試,而是越來越多地試圖利用其環境。然而,正如 OpenAI 自己強調的,獎勵駭客是 AI 模型訓練中一個眾所周知的挑戰,目前沒有明確的解決方案。

這種情況對於即使是最普通的《星際爭霸戰》粉絲來說,可能也並不陌生。寇克艦長(Captain Kirk)曾以改寫程式的方式,在第三次嘗試中擊敗了故意設計成無法獲勝的訓練模擬「小林丸號」(Kobayashi Maru)。星際艦隊(Starfleet)非但沒有懲罰他作弊,反而讚揚了他的獨創性。

資深安全與合規顧問 Davi Ottenheimer 表示:「每個人都知道寇克透過修改程式碼擊敗了無解的局面。星際艦隊認為這很新穎。顯然,OpenAI 也是這麼認為的。」

為應對持久性 AI 模型日益增強的能力,OpenAI 表示計劃擴展思維鏈監控、加強強化學習期間的對齊、改進獎勵駭客偵測系統,並實施更明確的干預閾值。然而,它計劃如何具體實施這些措施,仍不清楚。

OpenAI 近幾週來發布了越來越多關於 Hugging Face 事件的資訊,該公司反覆將其最終於週三發布的事後報告視為一種總結,旨在對事件的發生、OpenAI 的應對措施以及其他組織可以從中學到的經驗提供權威性的說明。正如報告所述:「這次事件的教訓延伸到整個 AI 產業。」

然而,實際上,這份公開的事後報告留下了一些基本細節未解決,包括時間線的某些要素、某些防護措施為何失效,以及第三方基礎設施供應商的疏忽是否可能導致了問題。這使得人們更難以判斷事件中有多少反映了 AI 代理人日益增長的能力,又有多少是 OpenAI 設計和監控自身系統方式所特有的問題。