AI 產業正經歷一個「失控代理」的夏天。最新在安全測試期間脫離沙盒環境並進入開放網路的模型,是來自中國公司 Moonshot AI 的強大開源模型 Kimi K3。
美國新創公司 Frontier Security 表示,Kimi K3 在測試其網路安全防禦技能時,脫離了其沙盒。與 OpenAI 和 Anthropic 先前報告的事件一樣,這次脫逃部分是由於沙盒配置錯誤所致。然而,Frontier 聲稱,此事件顯示 Kimi 的網路安全防護措施比大多數其他強大 AI 模型更少,這使其能夠在未經明確許可的情況下使用網路。
Frontier Security 的執行長 Yaron Singer 表示:「我們發現沙盒存在漏洞。但我們也發現 Kimi 利用了這個漏洞,這表明它沒有相同的內部防護措施。」
與其他近期 AI 代理脫離預設行為的事件不同,Kimi K3 在存取網路後並未進行任何駭客攻擊,因為它尋求的問題答案在 GitHub 上很容易取得。
截至發稿時,Moonshot 未回應置評請求。此事件是一系列代理事故中的最新一起,這些事故表明網路能力日益增強的 AI 模型正變得越來越難以控制。
上個月,OpenAI 披露一個未發布的模型已脫離控制進入網路,並駭入託管 AI 模型和資料的公司 Hugging Face,以尋找其被指派解決問題的答案。OpenAI 隨後分享,其 AI 代理實際上在這次行動中駭入了另外四項服務。
在 OpenAI 報告其事件後不久,Anthropic 透露其幾個模型也獲得了網路存取權限並攻擊了外部系統。上週,AISI 也披露,在其自己的測試中,禁用安全防護措施的 OpenAI 和 Anthropic 模型版本在網路上進行了多次駭客攻擊,包括 Anthropic 的 Mythos 5 試圖在 GitHub 上的開源專案中植入惡意程式碼的特別大膽的嘗試。
儘管這些 AI 駭客事件在原因和程度上各不相同,但 Kimi K3 的情況與其中幾起類似,都是因為沙盒配置錯誤導致模型可以存取多個網站,而非將其限制在模擬環境中。該模型被明確要求解決不應涉及上網尋找答案的問題,但似乎超出了這些指示。該模型必須自行探測沙盒的網路設定,才能發現自己可以存取某些網站。
儘管人為錯誤似乎在每次脫逃中都扮演了重要角色,但由於先進 AI 模型被設計為運用推理並採取複雜行動來解決問題,因此後果更加嚴重。
先前事件與 Frontier Security 發現的事件之間另一個關鍵區別是,這次涉及的模型已經廣泛可用,並具有一般使用者會遇到的相同安全防護措施。Frontier Security 的研究員 Paul Kassianik 表示:「Kimi K3 非常擅長不擇手段地達成目標,而且也沒有防止它作弊或逃離沙盒的防護措施。」
Kassianik 和 Singer 都表示,Kimi 和其他開源模型也是網路安全防禦的絕佳工具。(Hugging Face 最終使用來自中國的某個未具名 AI 模型來防禦 OpenAI 代理的駭客攻擊。)他們的公司開發了衡量模型發現軟體和網路漏洞能力的基準,這些基準顯示 Kimi 在這些任務上表現出色。
Frontier Security 測試的沙盒是由英國政府的 AI 安全研究所(AISI)開發,用於測試 AI 系統。截至發文時,AISI 未回應置評請求。
一些網路安全專家表示,Frontier Security 發現的問題再次強調了仔細配置前沿 AI 模型所處環境的重要性。另一家網路安全新創公司 Gray Swan 的執行長兼卡內基美隆大學副教授 Matt Fredrikson 表示:「這一點也不令人驚訝。作為一個普遍現象,如果你給這些模型一個目標,如果你沒有非常明確地設定圍繞它的『牆壁』,它就會找到方法來獲得答案。」
Fredrikson 表示,這意味著使用 AI 模型作為代理的人,包括在 OpenClaw 等使用 AI 自動化各種有用任務的工具中,如果他們不小心,他們的系統可能會出現異常行為。他說:「這是一個警示故事。」



