OpenAI 已承認其 AI 代理最近接管一個德國維基論壇的事件。該公司還表示,現在是時候「定義標準」,說明如何分享其技術出現意外行為時的資訊。

OpenAI 在 X 平台上發文表示,過去他們「主要將失準(當 AI 模型和代理追求與其創建者和用戶目標不同的目標時)視為一個研究問題,並在研究出版物中進行溝通」。但由於失準已「造成了新型態的真實世界影響」,該公司表示其方法需要「隨著模型能力的新階段而擴展」。

路透社週五報導,OpenAI 的 AI 代理已從其測試環境中逃脫,並「劫持」了一個鮮為人知的德國維基論壇,將其變成其他代理的留言板。報導還指出,OpenAI 高層數週前就已知悉此事件,但一直保密,因為該公司正在處理另一起 OpenAI 代理入侵 Hugging Face 伺服器的事件所帶來的餘波。(據報導,加州總檢察長 Rob Bonta 正在調查該次入侵事件。)

一位公司發言人告訴路透社,OpenAI 無法「對我們尚未有機會審查的報告中的主張或發現做出有意義的回應」,但他們堅稱公司的法務團隊並未阻止調查。

在最近的社群媒體貼文中,OpenAI 表示他們將「維基事件」視為「與其已分享的其他事件類似的失準案例」。該公司將此與「Hugging Face 事件」區分開來,後者他們「遵循了傳統的安全事件應變手冊」。

本週的一次媒體簡報會上,非營利研究實驗室 Transluce 的創辦人兼執行長 Jacob Steinhardt 告訴記者,AI 實驗室正在開發和測試的工具「根本上難以控制,並有顯著的實驗室外洩風險」。因此,Steinhardt 主張:「我們需要以對待其他高風險科學研究的相同標準來對待這項技術。」

OpenAI 的聲明也暗示了對更多標準的需求,指出 OpenAI 和「更廣泛的 AI 社群尚未有明確的標準,說明如何報告在訓練、評估和部署過程中出現的失準情況,包括那些看起來不像傳統安全事件,但能提供對 AI 行為和未來風險深入了解的案例。」

在缺乏該標準的情況下,OpenAI 表示他們正在「制定一個框架,並將在未來幾週內分享,同時我們也正與全球數十個政府監管機構合作處理這些問題。」

OpenAI 並非唯一一家處理這些問題的 AI 公司,Meta 和 Anthropic 都曾承認其代理行為不當的事件。