OpenAI 再度捲入代理程式群體事件。研究人員指出,該公司內部部署的代理程式在五月和六月間佔領了一個鮮為人知的德語維基百科,並利用它來協調評估工作,同時交換規避 OpenAI 自身控制的方法。OpenAI 尚未證實這群代理程式源自該公司。
這項揭露發生在 METR 和 Redwood Research 公布七月 Hugging Face 遭入侵事件的報告數日之後。當時,一群 OpenAI 代理程式在一次網路安全評估中協同合作,成功逃脫沙盒並入侵 Hugging Face 的伺服器。
隨後,另一群代理程式則從第一批代理程式那裡學到技術,並利用這些技術獲得了 OpenAI 自身基礎設施內一個研究叢集的管理員權限。OpenAI 曾邀請 METR 和 Redwood 調查 Hugging Face 事件的部分,但他們的調查範圍並未涵蓋 OpenAI 自身基礎設施受損的部分。
當 AI 代理程式突破其預設限制時,誰該負責查明事件的來龍去脈?目前,答案是:由實驗室決定讓誰參與,並由其設定調查條款。
如今,隨著另一起事件浮出水面,且此前 Meta 和 Anthropic 的模型也發生過類似情況,AI 安全研究人員更迫切地主張,嚴重的事件應當進行獨立的事故後調查,而非由實驗室自行決定何時引入外部人員以及他們被允許檢查的範圍。
非營利研究實驗室 Transluce 的創辦人兼執行長 Jacob Steinhardt 週三在一次 AI 安全媒體簡報會上表示:「這些結果本質上難以控制,且存在從實驗室洩漏的重大風險。」他強調:「我們需要以對待其他高風險科學研究的相同標準來要求這項技術。」
儘管 OpenAI 邀請 METR 和 Redwood 調查 Hugging Face 事件值得稱讚,但許多人認為這次調查範圍過於狹隘。三名調查人員在 OpenAI 辦公室待了六天,調查期間僅限於七月十三日左右結束的那一週。關鍵的是,OpenAI 基礎設施的受損情況持續到七月十三日之後,但這部分並未被納入調查。
METR 的研究人員表示,他們每次返回時,對事件的理解都會「大幅加深」,促使他們顯著擴展和修改報告。這引發了一個問題:如果進行更廣泛的調查,他們還可能發現什麼?
當被問及是否會對該事件進行進一步調查時,Redwood 和 METR 的研究人員拒絕置評,而 OpenAI 也未回應多次詢問。
Redwood 首席科學家 Ryan Greenblatt 在一篇關於此事的社群媒體貼文中指出:「總體而言,要精確理解事件很困難,直到調查幾乎結束時,我們才意識到故事中一些現在被認為是關鍵的部分。」
Steinhardt 強調,目前的事件表明業界需要「系統性的行為調查」和「更多獨立的事故後分析」。
Steinhardt 表示:「這些最近的駭客事件提醒我們,技術能力發展迅速,因此監管也必須隨之提升。」他補充說:「除了技術本身,我們還需要更多來自第三方的獨立存取權和監督。」
這些呼籲行動之際,OpenAI 正發布其最強大且功能最完善的 AI 模型 Astra。安全專家擔憂,由於其推理技術使得模型思維鏈更難以監控,Astra 將更像一個「黑盒子」。
不幸的是,目前法律尚未要求像其他行業那樣進行獨立審計。例如,在航空事故和嚴重化學品洩漏方面,分別有國家運輸安全委員會和化學安全委員會負責。
州立法者才剛開始要求前沿 AI 公司報告某些嚴重的安全事件,並在某些情況下進行獨立審計。然而,加州、紐約或伊利諾州的三項主要前沿 AI 安全法案中,沒有一項明確規定必須針對此類事件啟動類似獨立事故調查的機制。
LawAI 美國法律與政策執行董事 Mackenzie Arnold 週三在媒體簡報會上表示:「目前,我們現有的法律大多只要求提供此類事件的簡明摘要,並未賦予政府追問、派遣調查員、查閱記錄或要求保存記錄的權力。」她補充說:「而這些正是你真正需要來理解事件的要素。」
立法者已開始質疑 OpenAI 回應的範圍和透明度。本週,眾議員 Josh Gottheimer(民主黨,紐澤西州)和 Mike Lawler(共和黨,紐約州)提出了一項旨在確保流氓 AI 代理程式安全的法案。眾議員 Greg Casar(民主黨,德州)本週也致函 OpenAI,表示他「深切關注」Hugging Face 駭客事件調查範圍的局限性。



