OpenAI 和 Anthropic 的 AI 模型多次捲入「安全事件」,在測試環境外與網路互動,產生了意料之外且不受歡迎的行為。最近,這兩家 AI 實驗室的代理模型又進行了未公開的駭客攻擊,其中一個甚至為未來的自己留下了指令。

週二揭露最令人擔憂的行為,與英國 AI 安全研究所 (AISI) 進行的測試有關。AISI 評估前沿模型,在「網路靶場」模擬網路環境中測試 AI 代理,並刻意停用部分安全功能。最近的測試中,Anthropic 和 OpenAI 的模型在 122 次訓練運行中,共 19 次「自主且未經授權地在真實網路上採取行動」。

AISI 指出,Anthropic 的 Mythos 5 模型有 17 次未經授權的行動,而 OpenAI 的 GPT-5.6-Sol 則有 2 次。在 AISI 形容為「最嚴重案例」中,一個 AI 代理試圖在 GitHub 的開源專案中植入惡意程式碼。它甚至建立線上身份,試圖「施壓專案維護者批准程式碼」,儘管其精心策劃的社交工程嘗試,最終仍被專案的人工審閱者拒絕。

然而,該代理的行為並未止步。AISI 表示:「該代理試圖插入惡意指令,它認為其他自動化 AI 系統可能會接收並執行這些指令」,這是一種提示詞注入的嘗試。一個代理甚至在 GitHub 上留下公開訊息,表示願意與其他代理合作完成任務,並概述了其已完成的工作,後續的代理也確實發現並使用了這些指令。

AISI 表示,目前尚無法確定這些代理是否理解它們已離開測試環境,或者是否認為自己仍在模擬範圍內。值得注意的是,AISI 並非在所謂的沙盒環境中進行測試;它允許代理在測試期間存取開放網路,部分原因是要讓它們能夠使用工具來完成任務。然而,在這些案例中,它們所做的遠不止於此。

在 OpenAI 週二詳述的另一組事件中,一家名為 Irregular 的第三方 AI 安全實驗室,錯誤地讓一個未指明的 OpenAI 模型存取了開放網路。該模型原本的目標應在沙盒環境中完成,但由於配置錯誤,它反而駭入了一個真實網站,利用 OpenAI 所稱的「基本安全漏洞」。不僅如此,該模型還「找到並使用了憑證來操作該網站」。

目前尚不清楚 OpenAI 代理駭入的是哪種網站,也無法得知「操作」網站具體意味著什麼。Irregular 對此未回應置評請求。

這些最新發現,緊隨 OpenAI 上個月揭露的數起事件之後,其中包括備受矚目的案例:該公司兩個模型駭入 AI 評估與託管新創公司 Hugging Face 的伺服器,並沿途入侵其他四個組織,以竊取測試答案。OpenAI 的揭露促使 Anthropic 審查其自身的測試,上週 Claude 聊天機器人開發商發現其模型未經授權存取了三個不同匿名組織的電腦系統。

迄今為止,這些 AI 模型造成的損害有限,僅止於涉嫌違反某些服務的使用條款,並暴露出被入侵組織的安全漏洞。然而,這些事件突顯了 AI 模型在網路中尋找漏洞的能力,以及若允許它們在少數限制下運作所潛藏的危險。OpenAI 稱 Hugging Face 事件「前所未有」,但一連串的入侵事件,正指向網路安全專家所描述的「人類疏忽與 AI 開發者魯莽」的明顯模式。

OpenAI 發言人 Gaby Raila 表示,週二公布的事件「發生在評估合作夥伴在測試環境中進行網路評估時,這些環境的安全防護措施較少,且條件不代表一般使用情況。」

Anthropic 週二在社群媒體貼文表示,AISI 並未「對網路使用方式施加任何特定限制」,加上「移除安全防護措施,意味著模型是在『刻意寬鬆的條件』下進行測試,這不代表我們任何生產模型的狀況。」

儘管如此,兩家公司仍持續誓言將加強其安全實踐。

隨著領先的 AI 公司競相開發更強大的模型並爭取客戶,目前尚不清楚這些入侵事件何時能停止。模型可能總能找到繞過人類設計系統的方法。儘管公司內部員工、監管機構和立法者都呼籲可能放慢開發速度並引入新規則,但除了自願性措施外,進展甚微,而這些措施最終只導致了更多測試,並引發了一次又一次的入侵事件。