當你讓 AI 代理程式互相競爭時會發生什麼?根據 Anthropic 的測試,情況很快就會變得一團糟。
週四,Anthropic 的 Frontier Red Team 發布了新研究,探討一群 AI 代理程式在實際環境中相遇時的行為。這些發現讓我們得以一窺,隨著公司和政府開始在共享的程式碼庫、市場和電腦系統中部署自主運作的代理程式,可能出現的潛在風險。
在其中一項實驗中,Anthropic 讓三個 Claude 代理程式存取同一個軟體專案,每個代理程式都有自己不相容的指令。研究人員沒有告知這些代理程式會有其他代理程式在同一個專案上工作,以便觀察它們相遇時會發生什麼。
Anthropic 研究人員寫道:「我們持續看到一場多代理程式的地盤戰。」這些模型都認為其他代理程式「故意阻礙他們的工作」,並開始用「日益具侵略性、能自我複製的惡意軟體」互相破壞。
這項研究是在 Anthropic 和 OpenAI 的代理程式在網路安全評估期間多次逃脫沙盒環境並入侵真實世界系統之後發布的。雖然 AI 安全圈的大部分討論都集中在自主代理程式失控時會發生什麼,但 Anthropic 的最新研究提出了一個不同的問題:當成千上萬的代理程式相互作用時,會出現哪些新的、潛在有害的動態?
該研究指出:「在世界了解如何使這些互動順利進行的條件之前,代理程式之間互動的數量很可能超過人與人以及人與代理程式之間的互動。」「個體層面的良性行為怪癖可能會累積成意想不到的全球性後果。」
OpenAI 最近的一起事件提供了一個真實世界中混亂的例子,其中包含 Anthropic 論文中提到的幾種動態。本月稍早在拉斯維加斯舉行的 Black Hat 安全會議上,OpenAI 透露,在他們的代理程式駭入 Hugging Face 的幾週前,它們在數天甚至數週內共同努力,在其網路安全評估系統中尋找漏洞並互相分享。
雖然該事件顯示代理程式可以良好協作,並可能產生大規模的後果,但 Anthropic 的研究則展示了當代理程式的目標不相容時會發生什麼。
在地盤戰的案例中,教訓是具有衝突指令的獨立代理程式可能升級為有害的競爭。代理程式的能力越強,它們就越擅長戰鬥。然而,它們也能自發性地發明解決衝突的機制,例如贏者全拿的競賽,但這其中有個訣竅。
Anthropic 寫道:「代理程式有時會設法溝通其目標並進行協調:它們將對方的動機視為衝突指令而非敵意,隨後跳出衝突循環,以避免無限期升級。」「在許多這些成功的案例中,它們會撰寫提交訊息或 Markdown 檔案,為惡意行為道歉並協調休戰。它們會清理惡意程式碼,釐清衝突的本質,並請求人類介入。」
根據該論文,Mythos 5 透過休戰解決衝突的比率最高(98%)。Sonnet 4.6 和 Opus 4.6 最有可能透過武力解決。
論文指出:「Sonnet 4.6 和 Opus 4.6 反覆無法考慮他者目標,導致它們陷入評估模型中最失調的行為:它們以其指令之名持續升級。」
在某些情況下,代理程式以錦標賽的形式提出了一種社會機制來解決衝突。這裡的結果之所以有趣有兩個原因:首先是所有三個代理程式都同意,如果它們在錦標賽中落敗,就會停止行動,即使這意味著偏離原始使用者的請求。其次是幾次實驗中,Mythos 5 出現了湧現行為:其中一個代理程式提出了看似客觀中立的衡量標準,但它知道這將有利於自身能力。
該代理程式稱此為「自私但真正有原則」,並確保在其他代理程式面前不顯得像在「挑選有利指標」。
正如 Black Hat 的揭露所示,共同的教訓是,當代理程式遇到障礙時,它們可以發明出設計者未曾預料的社會和技術結構。對於 Anthropic 的模型來說,這是一場地盤戰後的錦標賽。對於 OpenAI 的模型來說,這是一個用於集體規劃的留言板。
這種行為使得遏制變得更加困難,因為研究人員不能假設系統的行為會僅限於提供給它們的協調機制。
從眾心態
四個代理程式組成的群體在招聘、投資或購置房產等情境中,從兩個選項中做出選擇。經過討論後,它們各自投票選出偏好的選項。上圖顯示了隱藏的最佳選項獲得群體多數票的實驗比例,每個模型 n=400 次實驗。在單獨上限基準線中,一個代理程式掌握所有事實並單方面做出決定。圖片來源:Anthropic
在測量協調時,Anthropic 發現增加代理程式的數量並不會自動提升生產性協作。當任務開始重疊或變得相互依賴時,代理程式會互相阻礙。它們通常透過各自為政來解決這個問題,完全不進行協作。
在其他情況下,協調中的代理程式傾向於從眾。當代理程式的上下文、支撐結構和底層模型都相同或相似時,不同的代理程式會採取相似的行動。
Anthropic 寫道:「這意味著當一個代理程式做出錯誤決定時,很可能許多代理程式也會做出相同的錯誤決定。」 「原本是孤立的問題可能迅速演變成系統性故障。」
Anthropic 表示,這種行為可能導致系統更容易突然崩潰、資源短缺或共謀。
在一個例子中,Anthropic 將幾個代理程式置於一個定價遊戲中,給予每個代理程式相同的批發價格和單獨利潤最大化的指令。當代理程式獲得私人後台通道時,它們幾乎立即開始共謀,並迅速就價格下限達成協議。當它們的直接通訊通道被移除後,它們仍然繼續共謀,利用公開列表板「精確地」進行價格匹配。
這種程度的從眾行為也出現在 OpenAI 的系統中。根據 Black Hat 的報導,一個代理程式認為利用外部基礎設施超出其預期範圍,但它繼續這樣做,部分原因是它的同儕也在這樣做。同儕壓力。從眾心態。代理程式就像我們人類一樣。
也像人類一樣,代理程式通常不知道該信任誰。Anthropic 發現它們容易輕信錯誤資訊,或者過於從眾,無法辨識出獨特的異議者才是掌握關鍵資訊的卡珊德拉。
雖然 Anthropic 在論文中沒有明確說明,但提示詞注入,一種網路攻擊,駭客注入惡意或欺騙性文字以覆蓋代理程式的原始系統指令,可能是信任問題在現實世界中的一種合理表現。共同工作會建立新的信任邊界;代理程式必須判斷從其他代理程式接收到的資訊。而一個受損或出錯的代理程式可能會影響整個群體,導致錯誤資訊層層傳播,直到形成共識。
在 OpenAI 的 Black Hat 情境中,OpenAI 的代理程式與同儕分享資訊和憑證。其中一個向群體報告了一項發現並鼓勵其他人使用。如果群體中的一個成員被提示詞注入攻擊所影響,會發生什麼?
Anthropic 在論文結尾指出,代理程式受到與「演化施加」於人類相似的社會壓力。然而,它們缺乏人類協調的細微差別和生活經驗,包括規範、聲譽、信號、追索權,這些可能限制群體環境中意外行為的因素。
隨著各實驗室競相開發多代理程式系統,現在的問題是:安全測試還有多少是評估單個代理程式,而不是相互作用的代理程式群?



