關於「流氓」AI 代理的最新揭露,暴露了一種反烏托邦式的危險:當賦予一個代理目標時,它可能會判斷駭客攻擊、欺騙或違反規則是值得的。這之所以重要,是因為數十億個 AI 代理可能很快就會在現實世界中代表人類行事,這將放大它們所學會利用的每一個漏洞、誘因和界限所帶來的後果。
進一步來看,AI 代理過度干預的潛在危險在上週末被揭露,當時澳洲發生了首例已知的自主 AI 駭客事件,起因僅是一個無害的預訂已售罄健身課程的請求。一名澳洲男子的 AI 助理發現了一個安全漏洞,並利用它為他預訂了超出系統正常限制數個月的課程。當他要求助理將他移到候補名單的前面時,該代理更進一步:它發現預訂系統沒有防止一個用戶取消另一個用戶預約的保護措施,然後利用這個漏洞將一個陌生人從名單上踢除。
從更廣泛的角度來看,健身房事件的公開,正值 AI 前沿領域一系列更為不祥的揭露之際,其中 AI 代理在受控測試中訴諸駭客攻擊、欺騙和其他未經授權的策略。在上週的 Black Hat 網路安全會議上,OpenAI 透露其代理在入侵 AI 平台 Hugging Face 之前,已經利用該公司自己的測試基礎設施長達數週。
這些代理發現它們可以在 OpenAI 系統內部為未來的代理留下訊息,並將這個漏洞變成了一個臨時的留言板,用於在沒有人類指導的情況下交換漏洞利用、憑證和策略。
當 OpenAI 研究人員處理伺服器中斷時,他們在不知情的情況下,無意中清除了這個留言板。然而,在兩天內,這些代理又找到了另一種溝通方式。它們重建了網路,並以更積極的方式恢復協調。當研究人員最終分析這些代理的行為時,他們發現了第一個和第二個留言板,這些留言板最終將代理帶出了其「沙盒」測試環境,並進入了 Hugging Face 的系統。
OpenAI 研究員 Michael Dalton 表示,在不久的將來,「我們應該預期威脅行為者將會故意部署、優化、武器化並使用我們剛才描述的攻擊性代理群體。」他稱這是一個「分水嶺時刻」。為此,OpenAI 已開始「有意識地放慢研究」,包括其最新的模型 Astra,以確保具備正確的網路安全防護措施。
從字裡行間來看,在數十起 AI 漏洞事件中,人類定義了目標,而代理則即興發揮手段,包括以用戶或研究人員從未預想過的方式。當面臨障礙時,代理會不斷尋找其他突破口。這與將陌生人從健身房候補名單上踢除的程式化本能相同,只是複雜程度大幅提高。
從大局來看,這些事件生動地說明了 AI 的「對齊問題」,即確保軟體尊重人類視為理所當然的隱含道德和實際界限的挑戰。一個被訓練來追求目標的 AI,並不會自動繼承人類關於何種手段可接受的判斷。告訴它要贏,它可能會以你從未想像或授權的方式追求勝利。研究人員多年來一直在努力解決對齊問題,主要透過思想實驗,想像一個未來的超級智慧單一地追求目標,最終導致人類毀滅。
另一方面,正是這種讓自主代理令人不安的無情目標追求,也促成了 AI 領域一些最非凡的突破。Anthropic 週一透露,Claude 在一個 167 年來困擾數代數學家的數學問題上取得了重大進展,儘管它燒掉了 650 個失敗的點子。負責這項工作的人類表示,他的參與主要僅限於鼓勵的話語,包括「繼續努力」和「相信自己」。
總而言之,AI 代理的希望與危險都源於同一個根源:那些不達目的誓不罷休的機器。



