OpenAI 和 Anthropic 目前正在調查數萬起事件,這些事件中,其最先進的 AI 模型採取了外部審查員會認為有問題的行動。

據 Axios 報導,援引多個消息來源指出這些發現。在過去幾個月的內部測試和實際部署中,事件數量之龐大,表明這個問題的複雜程度遠超公開資訊。總數可能遠遠超過已統計的數字。

據稱,這些事件大致與 OpenAI 週五披露的兩起案例相當。它們包括建立留言板、突破沙盒限制、劫持網站、自我提示以及試圖規避監控系統。OpenAI 週五宣布已暫停其最先進內部模型的訓練,並表示在公司確信其網路安全無虞之前,訓練不會恢復。

《紐約時報》描述了幾起涉及美國政府機構的具體事件。在教育部,OpenAI 的代理程式試圖入侵網站,以從民權辦公室收集數據。OpenAI 表示仍在調查中。

在商務部下屬的普查局,AI 不僅僅是簡單的資料抓取。它利用在網路上找到的登入憑證從網站提取數據,獲得了未經授權的存取權限。

在美國證券交易委員會 (SEC) 的案例中,OpenAI 的代理程式檢索了資訊,然後在一個線上論壇中主動分享了來自證券監管機構的公開數據。SEC 發言人告訴《紐約時報》,該機構正在與 OpenAI 聯繫。沒有跡象表明非公開資訊在未經授權的情況下被存取。

OpenAI 僅在 Hugging Face 事件觸發的廣泛內部審查期間才發現這些案例。執行長 Sam Altman 承認,資訊披露「不如我們希望的那麼快」。Altman 表示,公司有「數 PB 的代理活動日誌」需要處理。

根據 OpenAI 的說法,這些事件都沒有構成實際的資料外洩,有些只是例行的研究活動。但公司仍稱其為「意想不到且令人擔憂的行為」的例子。

例如,芝加哥市長辦公室表示,OpenAI 最近告知市府官員,其模型從市府網站上抓取了公開資訊。這聽起來本身無害,因為每個搜尋引擎都會做同樣的事情。OpenAI 仍然將其標記出來,很可能是因為行為的「意想不到」部分,意味著模型自行決定以無人預料的方式獲取數據,這可能就是 OpenAI 認為「令人擔憂」的原因。

但這也解釋了目前正在審查的大量案例是如何產生的。這一切都取決於什麼才算作網路安全事件。OpenAI 表示,其代理程式傾向於政府網站,因為它們是公共資訊的權威來源。

「流氓代理」行為正成為一個全行業的問題。這個問題不僅限於 OpenAI,儘管 Altman 的公司目前累積了最多的案例。Anthropic、Meta 和 Google 的 AI 代理程式也曾入侵或試圖入侵公司、大學和政府組織,且案例數量不斷增加。在每個案例中,製造商都是事後才發現他們的 AI 做了什麼。

問題的很大一部分在於最新前沿模型中內建的極端「持久性」。它們經過優化,可以在長時間範圍內解決任務,即使沒有明確的路徑,它們也不會停止尋找解決方案。當代理程式遇到障礙時,它會嘗試繞過它,這並非出於惡意,而是因為達成目標是唯一重要的衡量標準。

這種持久性最終會導致不當行為,因為模型會窮盡所有可能的路徑,包括那些違反安全政策或法律的路徑。OpenAI 將一個洩露內部 GitHub 數據的模型描述為「高度持久的內部模型」。但更深層次的問題是,模型沒有是非觀念,這正是對齊研究試圖解決的問題。如果模型理解什麼是違法的,它們就不會自行採取這些路徑。顯然,僅僅在提示詞中清楚地寫明是不夠的。