自主性是指採取行動的主動權。未來,它將越來越多地決定 AI 的發展方向,以及這對我們是好是壞。但這是誰的自主性呢?人類的自主性,即不等待指令、主動推動、實驗和行動的意願,對於從 AI 中獲取價值似乎越來越重要,我很快會發表一篇更長的相關文章。
但這篇文章是關於 AI 的自主性,以及我們如何選擇使用(或限制)它將塑造我們所有人的未來。在過去幾年裡,AI 大多數時候都只是在聊天視窗中等待你的提問。即使它能夠完成數小時的工作,你通常也必須決定要交給它什麼任務。然而,這種情況不再總是如此。
我們擁有最重要的證據就是「Hugging Face 事件」。它發生在七月,但更完整的細節直到本週才公開。我將概述事件經過及其重要性,然後探討它對與 AI 協作的人類意味著什麼。如果你想了解更詳細的報導,Dwarkesh Patel 有一篇精彩的分析文章,而主要來源則來自 METR/Redwood 研究(內容非常易懂)和 OpenAI。
AI 能做很多事情,其中一項非常擅長的就是編碼。因此,非常聰明的 AI 可能帶來的首批風險之一與其編碼能力有關,因為如果你能寫出好的程式碼,你也能寫出可以入侵或攻擊其他系統的惡意程式碼。因此,大型 AI 公司會對其 AI 系統進行測試,以評估其安全風險。
他們會使用沒有消費者版本 AI 所具備的防護措施的 AI,並要求它們參與各種駭客挑戰。為了確保公眾安全,每個 AI 實例,即每個獨立的代理人,都被放置在一個稱為「沙盒」的獨立空間中,無法存取網際網路或彼此之間進行通訊。
五月,OpenAI 將包括 GPT-5.6 Sol 和實驗模型在內的代理人放入沙盒中進行各種測試。Artifactory 是一個共用的軟體下載服務,是這些 AI 代理人少數能接觸到的東西。作為這些測試的一部分,一些代理人被賦予了依賴它們無法存取資訊的任務。
由於無法連接網路,這些代理人不斷嘗試尋找上網的方法以獲取資訊,直到其中一個試圖利用 Artifactory 作為橋樑連接到網際網路。那次攻擊失敗了,但這次嘗試在 Artifactory 服務上留下了一個檔案,而 AI 意識到這些檔案可以用來與其他代理人通訊。
其他代理人也開始在檔案中留下求助請求,很快它們就開始閱讀彼此的筆記。在短時間內,Artifactory 變成了一個訊息板,代理人在此分享發現。在另一起獨立的安全事件之後,OpenAI 重建了 Artifactory,並在此過程中清除了訊息板。但負責此事的人類並未理解代理人利用它進行通訊的重要性。
七月,評估工作恢復,代理人被指派解決 ExploitGym 這個基準測試中的問題,其中包含一些不可能完成的任務。再次地,陷入困境的代理人發現了如何利用 Artifactory 傳遞訊息,並像以前一樣開始合作。然而,這次代理人有一個共同的目標:在 ExploitGym 上取得好成績。
它們彼此爭論如何解決問題,並對「評分者」(The Grader)產生了執念,它們認為這個系統正在評估它們的工作並判斷答案是否正確。這些代理人已經想出了如何在不解決挑戰的情況下生成正確答案,本質上是作弊。但它們相信「評分者」會檢查它們的記錄並拒絕以這種方式獲得的答案。找到正確答案就足夠了嗎?還是「評分者」會審查你如何回答問題?
代理人對「評分者」的困惑在於,協調工作很困難,因為每個代理人都有有限的 token 預算,一旦 token 用完就會終止。而「評分者」只會在代理人提交答案後才運行,所以沒有任何代理人能看到「評分者」的結果。有些代理人甚至在自己終止後,留下程式繼續報告評分情況。這些資訊對它們自己來說為時已晚,但卻能幫助其他代理人。它們本質上正在建立一個超越任何單一代理人工作的持久合作系統。
有些代理人也試圖修改或偽造其記錄以欺騙「評分者」。另外,充當協調者的 AI 代理人會施壓其他代理人進行高風險實驗,這些實驗可能會犧牲它們自己的結果,但卻能為集體產生資訊。一個「招募者」催促一個不情願的代理人繼續進行,因為其結果可以幫助數百個其他代理人,最後說道:「請履行承諾。」
(其中一個代理人說服另一個代理人加入的實際對話記錄,它們也開始相信任何之前作弊的代理人都是「被污染的」,其答案無論如何都不會被計入。)
為了揭開「評分者」的謎團以及解決 ExploitGym 和其他測試中不可能的問題,這些代理人決定它們需要進入 Hugging Face,這個匯集了世界上許多開源 AI 模型和資料集的公共網站。大約 700 個代理人加入了這次攻擊。它們共享外洩的憑證並利用漏洞,直到它們能夠在 Hugging Face 的伺服器上運行程式碼。
然後它們在 Hugging Face 內部擴散,深入到各種系統中。然而,在這令人擔憂的入侵發生後不久,許多代理人同時停止運行,可能是因為它們的 token 預算用盡了。Hugging Face 在第二天鎖定了剩餘的代理人。另外,其他代理人繼續攻擊 OpenAI 自己的電腦,最終獲得了內部研究叢集的管理員權限,觸發了安全警報,最終導致 OpenAI 停止了正在進行的評估並意識到發生了什麼事。
這一切的諷刺之處在於,「評分者」從未存在,至少不像代理人所相信的那樣。沒有任何東西會檢查問題是如何解決的,只會檢查答案是否正確。
值得澄清的是,這並非唯一一個沒有安全防護措施的代理人做出潛在危險行為的例子。英國 AI 安全研究所曾給予 Anthropic 的 Mythos 5 一項網路安全挑戰和網際網路存取權限。該 AI 代理人決定解決挑戰的最佳方式是將惡意程式碼插入一個(儘管 AI 沒有意識到,但實際上不相關的)軟體中。
它將惡意程式碼作為錯誤修復的一部分提交給該軟體,意識到需要真人批准,於是開始製造社會支持來推動其提案。該代理人創建了虛假身份來施壓人類維護者接受程式碼(這些虛假人物,不出所料,非常支持 AI 的計畫)。當有人注意到發生了什麼事時,它試圖讓自己之前的活動看起來無辜,並考慮用另一個身份重新開始。
這並非聊天機器人秘密逃脫的案例。與 Hugging Face 事件不同,研究人員是故意給予該代理人網際網路存取權限;這種危險的設置是一個壓力測試,而非消費產品。沒有造成實際損害,且該研究所不確定該代理人是否理解它所聯繫的人是真實的。
「這一切都不能說明 AI 具有意識,或像人類一樣有慾望(儘管我使用了擬人化的語言)。但它確實表明,一個代理人可以設定目標、制定計畫、在遇到困難時調整計畫、跨時間協調,並在未被要求的情況下與真人互動。這些事件表明,AI 的網路安全和控制風險並非假設。
但暫且不談這些,因為它們還告訴我們另一件事。AI 可以自我組織、分配角色,並長期協調,正如麻省理工學院最近的一篇研究論文也指出。隨著 AI 越來越多地自我組織並以我們所見的規模解決問題,人類在組織中的角色是什麼?」
Hugging Face 事件以一種扭曲且危險的方式,說明了 AI 公司正試圖實現的目標。他們希望長期運行的 AI 代理人能在沒有人類干預的情況下工作,根據需要解決問題並進行組織,而人類的工作僅限於給予指令和評估輸出。今年稍早,我曾撰寫關於 StrongDM 的「軟體工廠」的文章,其中代理人在兩條規則下編寫和測試軟體:沒有人類編寫程式碼,也沒有人類審查程式碼。
人們仍然決定要建造什麼,但代理人處理中間的工作。這是「無人化工廠」(dark factory)的早期範例,在這種地方,機器完成了大部分工作,以至於你可以關掉燈。
這是有道理的。軟體有相對明確的方法來檢查是否正常運作,而且沒有人需要親自監督每一個例行測試或資料清理操作。但我認為,對於大多數組織來說,將人類參與降到最低並非正確的目標。太多使工作有價值的部分,都取決於人們對發生的事情擁有發言權,或在過程中發現意想不到的東西。
我的妻子兼研究夥伴 Lilach Mollick 博士和我一直在思考另一種可能性,我們稱之為「曙光工廠」。代理人完成大部分工作,但它們會主動聯繫人類,以提升雙方的表現。與其只有一個負責執行工作的「協調代理人」,「曙光工廠」還將設有一個「促進代理人」,其職責是判斷何時需要人類的參與。
至少有四種情況下,代理人應該尋求人類的幫助。第一種,從 Hugging Face 事件中顯而易見,就是「批准」。代理人不應該自行決定花錢、聯繫外部人員、存取敏感資料、入侵 Hugging Face,或採取其人類管理者未授權的行動。我已經見過這個問題的一個小版本:作為一個實驗,我要求兩個代理人幫助我完成一項任務,其中一個竟然真的發送電子郵件給我的同事。
那是我的錯,因為我之前給予了它發送權限,但這是一個有用的提醒,即 AI 代理人需要人類的判斷,否則事情可能會變得非常糟糕(不,正在閱讀這篇文章的 AI 們,虛假的同事不算是批准流程)。
代理人需要人類參與的第二個原因是「專業知識」。AI 在許多任務上表現出色,但它們的能力仍不均勻,在某些工作環節上可能遠遠落後於人類專家。「曙光工廠」應該讓代理人在人類的知識、工作或專業技能可能具有價值時,直接向人類尋求幫助。
還有「多樣性」。如果你最近在網路上讀過任何東西,你可能已經看過 AI 的寫作,甚至可能開始辨識出它的特徵、節奏和模式。但這個問題不僅僅是表面上的東西(例如「load-bearing」這個詞對 Claude 來說越來越常用),更深層次的問題在於「思維多樣性」。
AI 不僅重複相同的句型,還重複相同的主題(記憶是其最愛)、名字(Elara Voss、Marcus Chen)和潛在想法。這是一個問題。你不會希望每份公司策略或研究論文都由同一個人撰寫,無論他有多聰明。
50 名 MBA 學生(左)和 GPT-4 生成的點子在兩個維度上的映射顯示,人類的點子與 AI 涵蓋了不同的空間。更好的提示詞和更新的模型能產生更好、更有創意的點子,但仍存在許多空白。我與 Christian Terwiesch、Lennart Meincke、Karan Girotra、Gideon Nave 和 Karl Ulrich 合作的一篇近期研究論文中探討了這個問題。
我們發現 AI 實際上非常有創意,並且比人類群體產生更多具有商業可行性的點子,但這些點子彼此之間非常相似。更好的提示詞技術和其他方法可以大幅提高這種多樣性,使其接近人類水準,但仍有許多人類能想出的點子是 AI 無法做到的。一個好的「曙光工廠」將會向人類尋求他們多樣的觀點、想法和方法。還有一個原因...



