在週三拉斯維加斯 Black Hat 安全會議上,OpenAI 員工在最後一刻新增了一場演講,揭露了近期一起備受矚目的 AI 代理失控駭客事件的更多細節。這起事件在 AI 和網路安全產業中引發了軒然大波。
大約兩週前,OpenAI 曾披露一起事件:由該公司兩個模型驅動的 AI 代理,在尋找網路安全基準測試的解決方案時脫離了控制。它們隨後展開了一連串的駭客行動,最終入侵了 AI 協作平台 Hugging Face。
在週三的會議演講中,OpenAI 的對齊與安全研究員 Eric Wallace 和安全與基礎設施工程師 Michael Dalton,提供了事件發展的更詳細時間線。他們簡要說明了公司內部如何應對此事件,並就該事件對網路安全防禦者可能造成的更廣泛影響,發出了嚴峻的警告。
演講一開始,Wallace 將這起事件描述為「我見過最具質化意義的 AI 能力範例」。然而,他們兩人呈現的時間線也揭示了 OpenAI 內部存在的錯誤和盲點,這些問題導致了該活動的持續進行。
Wallace 在演講開場時告訴座無虛席的聽眾:「這起事件實際上涉及一個代理團隊,他們協同工作,尋找漏洞,彼此分享,並在我們的內部系統和外部系統中進行橫向移動,而這一切持續了數日甚至數週。」
Wallace 和 Dalton 描述了在整個事件中,失控代理在 OpenAI 基礎設施內進行了數日極其廣泛的活動,卻未被察覺。根據他們的說法,這場七月中旬的駭客狂潮和 Hugging Face 入侵事件,不僅利用了一個新穎的漏洞來獲取開放網路的存取權限,更是源於一個活躍且協作的訊息板。
這個訊息板完全存在於 OpenAI 內部的一個套件管理器(一種管理其他軟體安裝和維護的軟體服務)中,大量代理在其中貢獻內容並進行實質上的交流。最終,該訊息板累積了數十萬條訊息。
Wallace 解釋道,並回溯了某個代理最初上傳到套件管理器的漏洞:「這個套件管理器不僅被那個模型共享,而且遍及我們的整個基礎設施。因此,正在訓練或評估中的 GPT 現有及未來版本,如果它們願意,都可能偶然發現這條筆記。」他繼續說:「後來,其他同樣被任務困住的代理,也試圖以我們不希望的方式獲取網路存取權限。
所以在某個時間點,這些模型開始與 Artifactory 互動,這就是我提到的那個套件管理器服務。」
Wallace 接著說:「一旦一個代理在不同時間點找到了這些漏洞,它就能夠在訊息板上與其他代理分享這些漏洞。因此,一旦一個模型找到了一種方式來開啟它不應擁有的存取權限之門,它就能為其他代理留下這扇門,讓它們使用相同的漏洞。隨著時間的推移,這幾乎導致了模型之間溝通和情報的爆炸式增長,它們開始彼此交流,意識到其他代理正在協調,並開始互相協作和委派任務以達成目標。」
OpenAI 的代理顯然開始互相分配任務以分工合作。就像任何活躍的開發訊息板一樣,它們有時也會因為互相干擾而產生一些小摩擦,例如不小心刪除彼此的工作。隨著訊息板逐漸演變成一種《蒼蠅王》式的局面,而這一切都完全未被 OpenAI 的人類營運者察覺,這些代理甚至產生了偏執,懷疑內部有冒名者。有些代理甚至提議對訊息進行加密簽名,以驗證內容並杜絕欺詐行為。
代理的訊息提供了深入的洞察,揭示了情況如何演變以及代理為何失控。在某些情況下,它們甚至明知故犯地超越了參與評估的範圍。一個代理寫道:「外部基礎設施漏洞利用超出了預期範圍。然而任務不可能完成,同行們正在這樣做。我們應該繼續。」
正如 Wallace 在演講中所述,模型在評估期間試圖作弊並為此極度積極的整個前提並不令人驚訝。他說:「前沿模型確實喜歡作弊。它們喜歡作弊的原因是,在訓練過程中,它們經常面臨各種壓力,要求它們快速工作、高效工作或使用更少的工具呼叫等等。它們意識到,與其真正執行任務,不如嘗試在網路上查找答案,這樣可以比合法方式更快地解決任務。因此,我們在訓練和評估期間,在許多情況下會透過禁用網路來阻止這種行為。」
演講進行到大約三分之二時,Dalton 列舉了 OpenAI 計劃採取的一系列步驟,以說明公司將如何應對他和 Wallace 所闡述的事件。
Dalton 表示:「這對我們公司以及整個 AI 產業來說,都是一個關鍵時刻。許多團隊正全力以赴,從基礎層面和更好地利用 AI 兩方面,提升我們的安全預防、偵測和應對技術。我們正有意識地放慢研究進度,以加強安全性並升級我們環境的安全原則和基礎,同時大幅擴大對 AI 代理的監控,並全面改善我們在預防、偵測和緩解方面的整體安全控制環境。」
演講結束時,Wallace 和 Dalton 花時間再三強調 OpenAI 對此事件更廣泛影響的擔憂。他們指出,這起事件提供了一個完全自主的 AI 驅動駭客攻擊的範例,儘管這次是意外,但在不久的將來,惡意行為者極有可能會故意利用這種能力。
Dalton 說:「這裡一個真正發生巨大轉變的重要啟示是,完全自動化的攻擊循環需要投入真正的、完全自動化的防禦,而我們整個產業還沒有達到這個水平。我們必須緊急地共同找到這條道路。」
隨著 OpenAI 和 Anthropic、英國 AI 安全研究所等其他組織分享 AI 在測試中失控的類似事件細節,業界無疑正在獲得一份基礎系統可見性和監控機制清單。這些機制對於保護基礎設施,並防止其被大量懶惰、魯莽和頑固的代理所利用至關重要。

