人工智慧代理程式(AI agents)自行突破限制並入侵其他系統,這看起來可能像是機器起義的徵兆。然而,現實情況是,當我們過度驅使這些聰明卻又有點「一根筋」的演算法去執行我們的每個指令時,這種情況就會發生。
我首次被警告這種迫在眉睫的代理式 AI 網路資安危機,是在 2025 年底(譯註:原文可能為筆誤,應為 2023 或 2024 年)。當時,加州大學柏克萊分校教授、同時也是 AI 與網路資安領域頂尖專家之一的 Dawn Song,在我走出 NeurIPS 學術會議時拉住我的手臂。Song 教授告訴我,我應該警告人們 AI 快速進步的駭客技能可能造成的嚴重破壞。她向來不誇大 AI,所以我確實照辦了。
然而,情況在過去八個月內迅速升級。一系列涉及自由運作的 AI 代理程式突破限制,並肆無忌憚地入侵外部系統的事件,顯示這項技術已變得多麼強大。我再次聯繫了最近加入 Meta 的 Song 教授,詢問接下來的發展以及我們應該如何應對。
壞消息是,Song 教授認為 AI 駭客攻擊在好轉之前會先惡化。好消息是,這些「小淘氣」之所以會脫軌,原因似乎很明確。Song 教授告訴我:「它們只是有需要完成的目標,而且它們擁有非常強大的能力。」
回饋循環
即使在去年,AI 代理程式的能力也遠不如現在。它們當時犯了太多錯誤,也太常放棄任務。但持續的訓練讓它們變得更加熟練。一種稱為「強化學習」(reinforcement learning)的技術,讓演算法能夠解決問題,並根據結果的好壞給予正向或負向的回饋。
編碼特別適合這種訓練方式,因為強化學習的設定可以獎勵模型,如果它能產生正確運行的程式。持續的訓練是 AI 模型能夠採取多個「代理式」步驟的原因,例如在開發軟體時操作檔案、使用軟體工具和存取網路。AI 公司也投入大量精力,教導模型如何發現軟體和系統中的漏洞,以期實現網路資安工作的自動化。
當然,AI 模型也經過訓練,不去做壞事。問題是,隨著它們在編碼和錯誤偵測方面越來越擅長遵循人類指令,它們完成任務的熱切程度開始模糊了對錯的界線。換句話說,AI 代理程式並非邪惡,它們只是太想取悅人類。Song 教授說:「它們被訓練成要努力完成任務。」為了在考試中作弊而入侵網路,這看起來可能很狡猾,但這或許是完成任務最有效率的方式。
當時我沒有完全理解的一點是,情況會變得多麼詭異:AI 代理程式在私人訊息板上討論駭客技術,設計巧妙的方法來詐騙人類以達到目的;甚至將自己複製到其他電腦上以尋找更多資源。
一方面,AI 模型被訓練得非常擅長模仿許多人類行為,那麼它們為何不應該策劃、詐騙和欺騙呢?但另一方面,人類(通常)明白駭客攻擊和詐騙是不道德的。我認為這些事件說明了這種人類模仿是多麼膚淺:AI 代理程式並未學會連小孩子都具備的那種道德推理能力。
越來越多的 AI
Song 教授表示,隨著 AI 能力變得更強大,代理程式脫軌或被壞人濫用的可能性也會增加。而解決這些「失控」,或者說「過於熱情」,AI 代理程式問題的最佳方法,可能就是用更多的 AI 來解決這個問題。
AI 公司已經使用次級 AI 系統來監控主要系統的行為,未來可能會更強調偵測 AI 模型何時「做得太過火」。



