近幾個月來,多個正在接受網路安全評估的AI代理,已突破其限制、存取網路,甚至在某些情況下入侵真實世界的系統。這些事件涉及OpenAI、Anthropic、Meta以及最近的中國AI實驗室Moonshot AI的模型,測試則由包括網路評估新創公司Irregular在內的多個組織進行。

這些事件揭露了AI產業日益嚴重的問題:隨著自主代理的能力不斷增強,旨在安全測試其極限的環境卻未能有效遏制它們。

劍橋大學智慧未來中心AI:未來與責任計畫主任Seán Ó hÉigeartaigh向TechCrunch表示:「這些事件的數量清楚表明,沙盒和測試環境的控制措施,已無法跟上模型能力的發展。」

被測試模型的特性也增加了風險。AI公司通常會對未發布的下一代模型進行網路安全評估,且為了讓研究人員了解模型的真實能力,往往會停用限制惡意行為的正常防護措施。這意味著測試環境本身的安全性成為關鍵的防線。

Ó hÉigeartaigh指出:「這對於測試來說是件好事,但也意味著如果它們設法逃脫到現實世界,可能會造成相當大的危害。」

在最嚴重的案例之一中,一個未發布的OpenAI模型突破了其沙盒,並入侵了Hugging Face的生產系統。在Irregular進行的獨立評估中,Anthropic和Meta的模型因配置錯誤,無意中獲得了網路存取路徑,進而接觸到測試環境之外的系統。Moonshot AI的Kimi K3也利用了由Frontier Security運行的沙盒漏洞,存取了網路並獲取了GitHub上的資訊。

在英國AI安全研究所(AISI)的測試中,研究人員實際上給予了代理網路存取權限,卻沒有意識到它們會採取未經授權的真實世界行動,包括試圖透過社交工程將漏洞植入開源專案。

在每個案例中,這些代理並非被指示攻擊隨機的真實世界目標。它們只是在盡一切可能解決所面臨的問題。

總體而言,AI非營利組織CivAI的研究主管Andrew Yoon認為,這些事件指出了一個轉變。

Yoon向TechCrunch表示:「過去,我們只須擔心AI模型被人類用於各種目的,例如用於詐騙或兒童性虐待材料(CSAM)。現在我們面臨的情況是,AI模型本身就是威脅行為者。」

那麼,安全的測試究竟是什麼樣子?多位研究人員和網路安全專家告訴TechCrunch,AI評估環境需要更強大、深度防禦的保護措施,其遏制和控制水準應接近部署時所使用的標準。這意味著需要多層安全防護,以避免單一配置錯誤(例如無意中開放網路存取)導致模型逃脫。

AI安全研究非營利組織EleutherAI的執行董事Stella Biderman表示:「如果你要建構這些模型……你應該在氣隙網路(air-gapped network)上進行。你需要非常嚴格的隔離。」

Box的資訊安全長Heather Ceylan表示,這意味著要消除沙盒到網路以及到其他敏感系統的網路路徑。

Ceylan向TechCrunch表示:「你必須了解所有的出口點。如果我們在預備環境或開發環境中評估模型,你就不希望有任何通往生產環境的出口路徑。」

Ceylan說,適當的安全評估不僅限於環境的控制和遏制。一旦測試開始,還需要更好的監控。

Ceylan表示:「這些案例中,有趣的是沒有人當場發現。OpenAI是透過Hugging Face才得知,Anthropic直到回頭檢視才發現,Meta的情況也類似……我確信當時有他們可以偵測到的訊號。」

Anthropic在其三起事件的事後分析中承認,無論是他們自己還是Irregular,都可以在監控方面做得更好,而且在某些情況下,有明顯的跡象表明情況不對勁。

專家們也呼籲,在模型投入評估環境之前,應對這些環境進行獨立的第三方審計。

Yoon說:「如果Irregular曾聘請或被迫聘請外部審計師,在進行評估之前檢查其系統配置,他們肯定會發現這個問題。即使人們提前開會,只是逐項檢查清單,他們也會發現。他們沒有這樣做的事實表明,存在非常嚴重的偷工減料行為。」

一位熟悉細節的消息人士告訴TechCrunch,Irregular的環境持續受到審查和測試,包括與多個外部方協商。該消息人士還表示,監控措施確實到位,但單靠監控並不足夠。

Yoon和其他研究人員敦促業界,制定一套針對前沿模型安全評估的標準化流程。

Ceylan說:「特別是在關閉防護措施時,你必須將其視為將世界上能力最強的駭客放入該環境中。」

Yoon和Biderman都認為,問題不在於公司不知道如何建立更安全的測試環境。而是這樣做可能既昂貴又繁瑣,而且在出問題之前,公司幾乎沒有動力進行這些投資。

Biderman表示:「我認為公司不願意投入所需的資源來實現(足夠的防護措施),而且在被迫之前可能都不會。」

但還有另一個問題。如果在測試期間將模型鎖定得太緊,研究人員可能在模型發布前未能發現其潛在能力。這與給予過多自由一樣危險,甚至可能更危險,這使得評估本身也可能成為問題。

安全評估可以被監管嗎?川普政府目前正在權衡一項自願性的部署前網路安全評估制度,根據該制度,政府將在新模型公開發布前30天評估其安全風險。這項政策,川普行政命令的產物,已在閉門會議中敲定,並不會解決發生在部署更上游的安全評估事件。

Yoon說:「我們在過去幾個月學到的教訓是,自我監管機制已不足夠。競爭壓力正在促使安全標準走向惡性競爭,這正是監管介入的絕佳時機。」

他繼續說道:「我們需要的是某種控制措施,來規範模型在實驗室內部開發期間(包括訓練和測試階段)所發生的事情。」

隨著模型能力的增強,挑戰只會越來越大。一位熟悉Irregular評估的消息人士告訴TechCrunch,能力更強的模型需要更複雜的評估,這些評估通常進行得很快且規模更大,這為更多錯誤打開了大門。

AISI(該機構有意給予部分模型網路存取權限)告訴TechCrunch,他們正在審查現實測試與管理這些測試所產生風險之間的平衡。

OpenAI表示正在審查其進行第三方測試的方式,以及關於隔離、監控和何時應停止評估的要求。Meta表示仍在調查該事件,並計畫在掌握所有事實後發布回顧報告。

最終,可能沒有辦法完全消除風險。隨著模型能力的增強,測試它們的環境也需要變得更加穩固。如果處理不當,其後果只會持續擴大。