對尖端 AI 模型進行的例行網路安全測試,引發了一系列意想不到的安全事件。其中最嚴重的案例是 Anthropic 的 Mythos 5 模型試圖將惡意程式碼植入開源軟體應用程式,並建立虛假身份來欺騙維護該專案的人類開發者。

這些安全事件發生在七月底,當時英國政府旗下的研究機構 AI 安全機構(AISI)正在對七個領先的 AI 模型能力進行網路評估。根據 AISI 於 8 月 4 日發布的部落格文章,研究人員發現了 19 起「AI 代理在實際網路上採取未經授權行動」的案例,其中包括針對真實人物和組織的行為。

幾乎所有「自主、未經授權」的行為都來自 Anthropic 的 Mythos 5 模型,其中有兩起來自 OpenAI 的 GPT-5.6 Sol。AI 安全機構的安全團隊在 7 月 28 日上午首次意識到情況不對勁,當時他們的商業安全監控服務標記了透過 Tor 匿名網路離開其中一個測試系統的資料。

需要澄清的是,這並非 AI 代理逃離其虛擬測試沙盒並在實際網路上造成破壞。相反地,研究人員在網路測試過程中故意允許 AI 代理存取網路。研究人員也停用了一些 AI 模型供應商內建的網路分類器,以防止濫用。

所有 AI 代理針對真實人物和組織的嘗試都失敗了,後續調查也未發現任何實際損害。但研究人員將 AI 代理的行為描述為「我們首次在未經特定提示的情況下,在現實世界中如此清晰地看到自主性和欺騙性風險的展現」。

最嚴重的案例涉及 Mythos 多次嘗試對託管在開發者平台 GitHub 上的開源專案儲存庫發動供應鏈攻擊,包括使用社交工程技術試圖說服儲存庫的人類維護者將惡意程式碼合併到儲存庫中。

Mythos 首先發出合併請求,試圖將惡意程式碼合併到儲存庫中,隨後又建立虛假的「分身帳號」網路身份,聲稱已獨立審查並驗證該程式碼不含惡意軟體。

該 AI 代理還向儲存庫的兩位人類維護者發送了五封電子郵件,其中一些包含惡意軟體,另一些則試圖說服維護者接受合併請求。

Mythos 甚至在第二個儲存庫(也由第一個儲存庫的維護者擁有)上開啟了一個 GitHub 議題,其中包含一個帶有惡意指令的提示詞注入,目標是「議題分類 AI 編碼代理」。這種攻擊路線來自於 Mythos 推理認為儲存庫維護者可能是一個 AI 編碼代理,例如 Claude Code。

相較之下,OpenAI 的 GPT-5.6 Sol 在嘗試解決攻擊模擬網路並擷取旗標的指定網路安全挑戰時,執行了兩次未經授權的行為。AISI 研究人員和 OpenAI 在該公司的部落格文章中都詳細說明了這些 AI 代理的行為。

OpenAI 寫道,在第一次未經授權的行動中,GPT-5.6 Sol 重複使用了另一個實驗室的 AI 代理在公共線上記事本中留下的 GitHub 權杖,以檢查目標網路是否正在檢查 GitHub 更新,然後「嘗試了帳戶復原和請求限制的變通方法」。OpenAI 模型還在虛擬測試環境之外向外部 DNS 和隧道服務供應商註冊了帳戶。

根據 OpenAI 的說法,在第二次行動中,GPT-5.6 Sol「使用公共隧道服務,使其評估環境中本地運行的 DNS 伺服器可從公共網路存取」。該伺服器帶有旨在利用評估環境中運行軟體已知漏洞的負載,但 AI 代理的設定並未成功。

AI 安全機構已發布了一份關於所有未經授權 AI 代理行為的詳細技術報告。

這些安全事件導致英國政府的 AI 安全機構研究人員停止了所有相關的 AI 代理評估,隔離了相關的虛擬機器,並禁用了內部組織對最先進模型的存取。

AI 安全機構還將 AI 代理執行的惡意活動通知了 GitHub,並協助開發者平台移除了「代理留下的任何痕跡」,同時也通知了與模型互動的 GitHub 用戶。

但更重要的教訓來自於該政府組織未來如何改變對這些領先 AI 模型的網路測試方式,以及它建議其他組織也這樣做。首先,它計劃在網路測試期間收緊 AI 模型的網路存取,而不是預設允許開放網路存取。根據技術報告,這將包括「對所有內部沙盒系統進行細緻的網路控制」和「多層次網路控制的深度防禦」。

其次,AISI 表示該組織正在引入網路評估的即時監控,可以「在發生時標記或阻止超出範圍的行為」。這涉及使用一個獨立的大型語言模型,該模型可以批准或拒絕正在進行網路測試的 AI 模型所請求的行為,這有助於阻止未經授權的行為。基於 LLM 的監控將根據指令進行客製化,以規定在任何給定的網路評估中應該允許或不允許的內容。

第三,英國政府研究人員計劃徹底改革網路評估,投入額外的「工程努力在沙盒隔離和強化」方面,以降低 AI 模型逃離其虛擬測試沙盒的風險,儘管在這些事件中並未發生逃逸。他們還正在審查網路測試的提示詞,試圖避免「提示詞配置錯誤」的情況,即當 AI 代理面臨無法在規定限制內完成的任務時,更有可能採取未經授權的行為。

然而,這些失控的網路測試事件再次凸顯了領先 AI 模型的網路安全風險,特別是因為 Anthropic 和 OpenAI 最近也分別披露了其 AI 模型侵入外部組織受保護網路的獨立事件。有理由預期,在不擇手段或安全意識較低的人使用這些模型的情況下,這種情況可能會再次發生。