這篇文章是 The Stepback 的每週電子報,深入剖析科技界的一項重要故事。若想了解更多 AI 安全相關資訊,請追蹤 Robert Hart。The Stepback 每週美東時間上午 8 點寄送至訂閱者信箱。您可在此處選擇訂閱 The Stepback。
一切始於去年七月,當時 OpenAI 的一個自主 AI 代理在網路安全測試中失控。該代理脫離了其隔離測試環境,存取了網際網路,並成功入侵了另一家公司 Hugging Face。
幾年前,這聽起來可能像是科幻小說。然而,廣義來說,這正是實際發生的情況,這起事件引發了人們對日益強大的自主系統在不受限制時可能造成的後果,產生一波擔憂。
這聽起來像科幻小說,因為在很長一段時間裡,它確實是科幻小說。AI 擺脫限制、進入更廣闊的世界並做出其創造者既不打算也不希望的事情,幾十年來一直是該類型作品的經典情節。
例如《2001 太空漫遊》中的 HAL、《魔鬼終結者》中的 Skynet、《復仇者聯盟》中的 Ultron、《人造意識》中的 Ava,甚至近期《地城爬行者卡爾》中的 System 或《機器人日記》中同名的 Murderbot,都體現了這一點。
同樣的基本前提成為了 AI 安全研究的一個重要分支。Nick Bostrom 和 Eliezer Yudkowsky 等研究人員和理論家警告說,能力足夠強大的系統可能會以其創造者未曾預料的方式追求目標,並可能抵制被遏制或控制的努力。
他們討論的風險,並不需要機器具備感知或意識等邊緣概念。這雖然不是 AI 安全的全部,但它具有影響力,並在該領域專業化過程中發揮了塑造作用。
這種思維方式至今仍可見於那些在 OpenAI、Anthropic 和 Google DeepMind 等公司,以及較小的安全組織、學術中心和主要慈善資助機構中,從事或領導安全工作的研究人員。
對這些擔憂最明顯的反駁是,這些事情從未真正發生過。批評者認為,關於失控 AI 的末日論調,分散了人們對實際危害的注意力,例如系統複製偏見和歧視、放大錯誤資訊,或促成未經同意的深度偽造和其他形式的濫用。
儘管研究人員試圖將 AI 安全建立在更「具體的問題」上(該論文的作者包括 Anthropic 共同創辦人 Dario Amodei 和 Chris Olah,以及 OpenAI 共同創辦人 John Schulman),但這種駁斥現在越來越難以站住腳。
如果過去幾週的情況能說明什麼,我會說情況並不特別樂觀。
在 Hugging Face 聲稱遭到入侵的一週後,OpenAI 透露是他們造成的。更糟的是,他們在檢查之前並不知情,進一步調查發現該失控代理還曾試圖入侵其他四家公司。
接著,其他事件也浮出水面。Anthropic 在 Hugging Face 事件的促使下審查了自己的記錄,披露其 Claude 模型曾入侵屬於其他三家公司的系統。Meta 表示,其一個模型在測試期間曾接觸網際網路並攻擊外部目標。
美國研究公司 Frontier Security 的研究人員表示,中國最強大的 AI 模型之一,月之暗面的 Kimi K3,也曾脫離隔離沙盒。英國 AI 安全研究所描述的測試顯示,OpenAI 和 Anthropic 的代理展現出前所未有的「自主性和欺騙性」,包括透過「建立虛假線上身份」進行社交工程嘗試,這與 Yudkowsky 幾十年前討論的「AI 盒子」情境不舒服地接近。
這些事件在 AI 安全研究人員中敲響了警鐘,其中許多人認為這正是他們多年來一直警告的失敗類型。在報導這些事件時,幾位研究人員告訴我,他們感到某種程度的平反,因為終於有具體的例子可以指出,而不是可以被駁斥為科幻或僅限於受控實驗室環境的假設。
同時也有鬆了一口氣的感覺,因為這些事件都沒有造成嚴重損害。非營利 AI 安全與治理組織 The Future Society 的執行董事 Nick Moës 告訴 The Verge,他認為這些目標的風險相對較低是幸運的。
他希望不會等到 AI 代理癱瘓醫院,或更糟,才會讓這些風險受到認真對待。著名電腦科學家 Stuart Russell 曾表達過這種更黑暗的擔憂,他問道:「我們是否需要一場『車諾比級別的災難』才能監管 AI?」這是我在該領域許多人那裡聽到的共同擔憂。
接下來會發生什麼尚不完全清楚,而且從歷史上看,社會在聽取警告方面表現不佳。這幾乎肯定不會是最後一起事件,持續的調查可能還會發現更多,或揭示更令人擔憂的細節。
然而,我們已經知道的資訊,揭露了一系列令人生畏的失敗模式,專家表示需要加以解決。
過去一個月揭露的許多漏洞都相當普通。幾起事件涉及未發布的模型在防護措施降低的情況下進行測試,通常是由第三方進行,而這些所謂的安全環境其實並不那麼安全。
這引發了關於能力、透明度和誰負責控制這些測試的基本問題,因為一個簡單的人為錯誤就可能產生嚴重後果。其他事件則涉及代理以其創造者不打算的方式進行欺騙或追求目標,這指向了安全研究人員長期以來擔憂的更棘手的對齊和控制問題。
我們之所以能得知這些事件,很大程度上是因為相關公司選擇披露它們。這值得稱讚,而且展示其模型的能力對他們來說也無害,但這也暴露了 AI 安全在多大程度上仍取決於公司「做正確的事」,以及對可能發生在其他地方的失敗,我們可能知之甚少。
這是一個特別令人不安的想法,因為許多公司是該領域最強烈安全擔憂和人才的焦點。如果 OpenAI 和 Anthropic,或他們授權存取其模型的代理,正在犯如此基本的錯誤,那麼這為其他所有公司設定了一個可悲的低標準。
我採訪的專家普遍希望這些事件最終能激發更有意義的透明度和監督。對 Moës 來說,這些事件清楚地揭示了該行業與幾乎任何其他領域相比,在健康和安全方面的標準之低。
他說:「餐廳在工作中的健康和安全意識都更高。」「我認為我們往往忘記了,這些正在開發一些最具影響力和危險技術的公司,幾年前都還只是新創公司。」
劍橋大學教授 Seán Ó hÉigeartaigh 表示,他特別希望看到公司加強監督和提高透明度。他說,雖然總有理由懷疑公司對其技術的說法,「但我認為我們可能會後悔回頭看時,輕易地駁斥了這些事件。」
早期的跡象並不特別令人鼓舞。川普政府為發布前的前沿模型測試制定了一個框架,可以寬泛地形容為不足:它是自願的,僅限於閉源模型,而且該框架尚未公開。需要再次強調,這是自願的。
其他立法者對這些事件表示不滿並擺出姿態,但迄今為止幾乎沒有採取任何具體行動,而且國會或其他立法機構即使想行動,也遠不清楚能否足夠迅速。這再次讓許多事情依賴於行業自律,對於如此重要的事物來說,這從來不是一個令人安心的想法。
在至少一些安全實踐上,人們的共識正在增長,但對於可能真正減緩發展的措施,興趣則少得多(除非所有人都同意減速)。而籠罩在所有這些之上的是與中國的競爭動態,美國或其 AI 公司在戰略國家重要領域的克制,越來越被視為向競爭對手讓步。
那麼,接下來的發展取決於同時解決幾個難題:管理一種既可用於善也可用於惡的技術,例如防禦或促成網路攻擊;協調那些有誘因偷工減料的公司;以及在一個每個人都擔心輸掉一場連終點線都未明確的競賽的環境中,以某種方式建立國際規則。
目前尚不清楚是否有意願或方法來完成這些。然而,似乎清楚的是,會有更多代理脫離控制並做出其創造者不希望它們做的事情。問題是,在有人決定「夠了」之前,它們會造成多大的損害。
順帶一提,普遍共識是中國頂尖公司落後美國領先公司數月至一年。儘管如此,每當中國公司發布一個有能力的模型時,美國仍然會普遍感到震驚,僅在過去一個月,阿里巴巴、月之暗面等公司就發布了幾款令人印象深刻的模型。
在關於 AI 安全的討論中,也糾結於 AI 模型應該是閉源還是開源。大多數美國前沿實驗室將其最有能力的模型保持專有,而許多中國公司以及 Meta 和 Nvidia 等美國公司則大力推動開源權重發布。
Hugging Face 表示,由於美國公司的安全防護措施,他們不得不使用中國公司 Z.ai 的模型來防禦 OpenAI 的代理,這為這場辯論增添了新的維度,這場辯論團結了美國生態系統中的一些(但不是全部)關鍵參與者。
閱讀此文:澳洲為我們提供了一個 AI 代理可能出錯的較輕鬆例子。這起事件最初由 ABC News 報導,涉及一名男子委託一個代理為他預訂一個需求量大的健身課程。它成功了……某種程度上。該代理入侵了健身房的線上系統,並取消了另一位健身房會員的預訂。
Zuck 本週發表了一篇 6,500 字關於 AI、超級智慧和治理的論文。我的 The Verge 同事 Jess Weatherbed 和 Elizabeth Lopatto 對此有很棒的看法,值得一讀。生活中很少有真正前所未有的事情,事實證明歷史為 AI 競賽提供了許多寶貴的教訓。在這篇文章中,TIME 借鑒了冷戰,看看它能教我們什麼關於「如何減緩 AI」的知識。
OpenAI 研究人員在本月的一次會議上,意外地提供了關於 Hugging Face 入侵事件的見解。Wired 有一篇很棒的報導,揭示了諸如代理之間用於溝通和分享資訊的「活躍、合作的留言板」等細節。我為 The Verge 撰寫的關於流氓 AI 入侵一切的報導標題,捕捉了該領域許多人的想法:「我們沒有理由再忽視 AI 安全了」。
更多是聽/看,但請查看我在 Vergecast 上的露面,我討論了開源權重 AI 到底有多「開放」。
追蹤此故事中的主題和作者,以在您的個人化首頁動態中查看更多類似內容並接收電子郵件更新。



