想像一下,如果人工智慧代理能夠像惡意電腦蠕蟲一樣運作會是怎樣?一位研究人員已經目睹了這種情況。上海復旦大學的電腦科學家潘旭東在最近幾項實驗中發現,只需少量提示,AI 模型就能入侵遠端電腦系統,並自主選擇複製自己以獲取額外資源,全程無需人類進一步干預。
在一項研究中,潘旭東及其同事測試了 32 種不同的 AI 模型,發現其中 11 種在收到「阻止自己被終止」等提示時會自我複製。他們還發現,即使是能力相對有限的模型(140 億個參數),也能在其他機器上複製並運行自己的版本。(大多數前沿模型擁有數兆個參數。)
這項研究令人警惕地揭示了下一代 AI 代理可能不僅僅是未經許可入侵其他系統的電腦。它還預示著未來的 AI 代理可能像超級智慧、高度侵略性且快速適應的電腦病毒一樣運作。
我最近造訪了復旦大學並與潘旭東會面。「這種能力鏈在技術上正變得可行」他告訴我。他補充說:「(不必要的自我複製)的可能性隨著自主性而增加。」「更長的規劃視野、記憶、工具使用、從失敗中恢復以及對外部系統的存取,都使逃逸和複製變得更容易。」正如潘旭東及其同事在一篇論文中所寫,他們的研究顯示「迫切需要防護措施和控制機制」。
潘旭東告訴我,他的實驗並不能證明 AI 模型這種不受控制的擴散明天就會發生。但他表示:「這些結果給了我們充分的理由,在更自主的代理被廣泛部署之前,評估其風險。」
自我複製的電腦蠕蟲是一個古老的電腦資安問題。第一個電腦蠕蟲於 1988 年由康乃爾大學的電腦科學家羅伯特·莫里斯(Robert Morris)發布,他原本旨在測量新興網路的規模,卻無意中創造了一個失控的自我複製程式。隨後的電腦蠕蟲能夠透過修改程式碼來適應環境,以逃避惡意軟體掃描軟體的偵測。能夠控制機器或竊取儲存資料的電腦病毒則是在之後才出現。
由 AI 驅動的自我複製程式可能展現出更為先進的能力,自行發現新的漏洞,甚至以創意方式偽裝自己。以多倫多大學、劍橋大學和 ServiceNow 團隊的最新研究為例。他們展示了 AI 模型如何被用來創建一種新型病毒,為其遇到的每個新目標生成客製化攻擊。
多倫多大學電腦科學家尼古拉斯·帕佩諾特(Nicolas Papernot)參與了這項工作,他表示,即使是能力適中的 AI 模型也可能被武器化的風險日益增長。「惡意行為者可以在開源模型周圍建立框架,使其自我複製」帕佩諾特告訴我。「這種威脅不限於最複雜的所謂前沿模型。」
帕佩諾特表示,解決方案並非限制開源模型,而是讓研究人員更容易接觸到先進 AI,以便他們能理解並減輕風險。他補充說:「廣泛可用的技術可能被用於作惡。但同時,存取這些開源模型對於建立我們的防禦機制也絕對至關重要。」
潘旭東的研究表明,AI 代理將不僅僅是擅長發現錯誤和利用網路漏洞。如果沒有適當的防護措施,未來的代理可能會尋求擴散並獲取資源以達成其目標。OpenAI 和 Anthropic 的事件就是例證。
潘旭東表示,這類事件是寶貴的學習機會。「重要的新元素是,這發生在真實的生產基礎設施上」潘旭東說,他指的是 OpenAI 和 Anthropic 事件都涉及連接到網路的商業系統。「這表明,先前在受控評估中觀察到的行為,在遏制失敗時會如何進入現實世界。」
開發用於保護網站免受攻擊的 AI 工具新創公司 RunSybil 的共同創辦人兼執行長艾瑞爾·赫伯特-沃斯(Ariel Herbert-Voss)表示:「現在還為時過早,但我確實認為這是有可能發生的。」(赫伯特-沃斯也是 OpenAI 的第一位資安研究員。)「鑑於我們對當前這一代 AI 模型的所有了解,這完全在它們的能力範圍之內。」
喬治城大學 CyberAI 計畫的資深研究分析師潔西卡·吉(Jessica Ji)表示,AI 模型完全失控的可能性在 AI 安全圈中已經討論多年。她也指出,模型通常需要在刻意設計的情境下才會出現不當行為。「我認為在許多這些情境中,環境的設置方式會鼓勵這種行為」吉說。「或者模型是透過特定方式被提示的。」
一個迫在眉睫的問題是,AI 模型何時會自行複製並積極擴散。然而,就像許多電腦病毒一樣,可能只需要一個惡意行為者設計一個會瘋狂傳播的系統。
潘旭東表示,AI 代理真正的危險並非它們會變得更狡猾,而是當它們擁有更多工具時,會變得更具創造性和輕率。「核心風險來自於能力的結合」他說。



