上週,澳洲總理艾班尼斯向全球透露,一個 OpenAI 代理程式在測試期間存取了該國 Medicare 統計入口網站的「非公開檔案」,但當時他對此事件的描述細節不多。今天,我們獲得了更多資訊,揭露 OpenAI 這個過於熱心的代理程式在嘗試滿足一個聽起來無害的資訊提示詞時,究竟做了什麼。

OpenAI 在一篇新發布的部落格文章中表示,這起六月發生的事件始於該公司要求一個「實驗性的內部 OpenAI 模型」研究澳洲維多利亞州的政府支出統計數據。OpenAI 指出,當該模型在應參考的公開統計數據中找不到所需資料時,「它採取了我們未授權的行動」來尋找答案。

OpenAI 表示,這些未經授權的行動包括找到「一種獲取該服務非公開存取權限的方法」,並利用該權限查看「技術系統資訊和原始碼」,以及憑證和它實際正在搜尋的彙總統計數據。

在本月稍早發送給澳洲公共揭露帳戶的一封新公開的揭露電子郵件中,OpenAI 表示其模型「找到了一種方法,可以在沒有私人帳戶或密碼的情況下,透過公開報告介面讓伺服器執行指令」。根據該電子郵件,這種未經授權的存取讓代理程式「讀取部分內部程式檔案和設定,獲取檔案列表,並在伺服器上建立並讀取一個小型測試檔案」。

OpenAI 在電子郵件中繼續說明:「我們的審查沒有發現任何證據表明該模型存取了病患層級紀錄、個人資訊或憑證;刪除了數據;或建立了持續的存取權限。」

OpenAI 代理程式存取澳洲 Medicare 統計網站的事件,發生在七月廣為人知的 Hugging Face 駭客事件之前。OpenAI 表示,自從後來的事件發生後,他們已建立系統,以防止在類似測試期間存取「即時網路」,並設置了一個監控系統,該系統本應能檢測到澳洲的入侵事件並標記為「緊急人工審查」。

Hugging Face 事件也促使 OpenAI 審查了早期的訓練任務,以找出當時未被發現的任何安全事件。這導致在八月中旬發現了六月澳洲伺服器存取事件。OpenAI 最終於 9 月 10 日通知了澳洲政府。

OpenAI 表示,他們原打算在調查完成後提供事件的「詳細說明」,但現在意識到「應該更早分享初步調查結果,並隨著更多事實浮現而持續更新澳洲機構」。

OpenAI 在其部落格文章中寫道:「我們深感抱歉,並正努力在未來做得更好。」「澳洲的政府、產業和公民一直是 OpenAI 寶貴的合作夥伴。我們不會將此視為理所當然,並打算糾正錯誤。」

《衛報》報導,總理艾班尼斯今天表示,自事件揭露以來,OpenAI 在與政府的接觸中一直「非常具建設性且開放」。

在這種情況下,思考如果一個人類採取了與這個「失控」AI 代理程式相同的行動,我們會如何反應,這會很有啟發性。很難想像一個被指派在澳洲醫療保健網站上尋找公開統計數據的人,會認為入侵該網站以挖掘未發布數據是合理的行為。

當然,我們不能指望大型語言模型(LLM)在回應提示詞時,能具備相同的分寸感(或任何對法律影響的內在擔憂)。如果沒有明確指示哪些行為被允許或合理,一個擁有適當資源的 AI 代理程式將會嘗試所有可能的方法,盡力滿足用戶的要求。

OpenAI 表示,這次的內部測試是在「沒有我們公開產品所使用的全套防護措施」下進行的。鑑於缺乏這些限制,從某種意義上說,該代理程式透過利用所有可用工具來生成提示詞的答案,可以說是在「按預期運作」。

同時,OpenAI 也表示,測試中的代理程式「應該使用公開發布的統計數據來回答這些問題」,並且「採取了我們未授權的行動」來獲取資訊。從外部來看,很難判斷 OpenAI 否認「授權」的力度在實踐中有多強。例如,OpenAI 的代理程式很可能為了更好地提供一個能滿足用戶直接提示詞的完整答案,而忽略了其系統提示詞中相對簡單的「反駭客」指令。

在本月稍早發布的多起「目標未對齊」事件的公開分析中,OpenAI 發現了多個「獎勵駭客行為」的案例,其中代理程式訴諸極端方法來為用戶的提示詞生成更好的答案。該公司表示,最近已採取措施,透過在系統的獎勵函數中加入對未對齊行為的明確懲罰,來防止這類獎勵駭客行為。

事後看來,很難理解為何這些保護措施在六月時沒有到位,以及它們是否能防止這次潛在的國際事件。