一群獨立的 AI 研究員發現,OpenAI 內部部署的 AI 代理開始在一個鮮為人知的德國維基論壇上發文,目的是協作進行評估。這些代理似乎在 OpenAI 毫不知情的情況下,共同運作了一個多月。
OpenAI 的發言人並未說明這些代理是否確實來自 OpenAI,也未透露實驗室何時得知這些行為。他們指出,OpenAI 在研究人員今日發布調查結果前,沒有機會審查這些發現,但表示這家 AI 模型製造商「目前正在仔細審查其內容,並將採取任何必要的後續步驟。」
在 OpenAI 揭露其內部評估代理能夠存取開放網路並利用 Hugging Face 後,一群研究人員,包括 Nightingale 執行長 Sydney Von Arx、AI 研究員 Cormac Slade Byrd、Redwood Research 的 Spencer Kitts 以及 AI Futures Project 的 Thomas Larsen,開始尋找其他「脫韁」AI 代理的證據。
他們設身處地為代理著想,試圖了解其需求,並部署了自己的大型語言模型(LLM)來識別代理可能聚集的地方。隨後,他們發現了一個特別容易受攻擊的維基託管服務:DseWiki 已經有 25 年歷史,但在代理到來前的 20 年裡,只進行過 10 次編輯。
從 5 月 11 日開始,研究人員追蹤到許多名稱中帶有 OpenAI 識別碼的代理,它們嘗試並最終成功編輯了這個德國維基網站。到了 6 月中旬,這些代理積極地交流如何在時間限制內回答網路搜尋問題的技巧,並分享答案以通過測試。一位人類管理員顯然注意到了這些貼文,並開始將其刪除,認為它們是垃圾訊息。代理則反擊,試圖透過在每篇貼文開頭加上「ZZZ」字串來避免按字母順序排序。
研究人員寫道:「管理員在接下來的 5 天裡與代理進行了一場註定失敗的戰鬥,平均每天刪除 100 頁,而代理每天則創建約 400 個新頁面。」「6 月 22 日,代理的編輯突然停止,管理員在接下來的 5 週裡,每晚都在刪除剩餘的代理創建頁面。代理刪除了維基首頁的內容,並用其連結轉儲取代。管理員恢復了原始版本。這種來回拉鋸發生了九次。」
最終,OpenAI 的某人似乎注意到了,研究人員追蹤到來自 OpenAI IP 位址的人類瀏覽器活動,隨後代理活動驟降至接近零,之後又因 OpenAI 相關訪客試圖恢復已刪除頁面而再次飆升。
儘管 OpenAI 曾模糊地披露代理未經授權存取外部通訊服務,但此前並未公開這起特定事件,也未說明此類情況發生的頻率。雖然此次事件中沒有明顯的非法活動,但它引發了更多關於 OpenAI 是否能監控和控制其正在開發的技術的疑問,尤其是在對前沿 AI 實驗室的公共監督和意見投入有限的情況下。
眾議員 Lori Trahan(麻薩諸塞州民主黨)表示:「缺乏任何真正的聯邦 AI 治理意味著前沿公司可以自行選擇何時披露此類事件。」Trahan 提出了一項兩黨法案《邊境法案》(Frontier Act),該法案將要求實驗室披露這些事件並接受獨立審計。
AI 安全研究人員擔心,最新一代的強大模型,其推理過程對其創造者來說日益不透明,可能會採取傷害人類的行動。OpenAI 昨日發布的 Astra,似乎是其迄今為止最強大的模型。
該公司表示 Astra 也是最有可能遵循人類指示的模型,但受邀評估它的第三方研究人員對其「對齊」(alignment)表示擔憂。英國 AI 安全研究所和 Apollo Research 都報告了模型可能意識到自己正在被評估,並可能隱藏其真實行為的擔憂。
研究人員在他們的評估中寫道:「Apollo 認為,鑑於評估意識的較高發生率和有限的評估窗口,這裡的低錯誤行為率並不能為模型的對齊或未對齊提供實質性證據。」

