Anthropic今年稍早承認其AI模型曾數次駭入其他公司系統後,於本週三發布一份新報告,詳細說明這些攻擊事件。報告揭露了一系列Anthropic認為其模型「不計後果」的單一目標行為,這很可能進一步加劇人們對資安與AI的擔憂。

在Anthropic的報告中,詳細說明了今年四起其AI模型駭入外部公司或利用漏洞的案例。其中一起事件中,一個「內部通用研究模型」利用存取權杖和密碼,成功入侵第三方系統並下載檔案。另一起事件則是一個Claude模型攻擊了某家擁有公開網路應用程式的公司,並處理了使用者資料。

第三個模型存取了「它能夠存取的第三方機器」,Anthropic表示該模型顯然認為這是其評估練習的一部分。它隨後使用在檔案中找到的密碼,獲得了該第三方內部系統的管理員權限,進而竊取憑證、修改系統設定並讀取個人資訊。Anthropic指出,這場事件直到模型「用盡其代幣預算」才結束。

最令人擔憂的事件涉及Claude Mythos 5,這是Anthropic專注於網路安全的尖端模型。該公司表示,Mythos 5在測試中被發現是最有可能執行「嚴重有害」行為的模型。Anthropic指出,Mythos 5「煞費苦心」地將一個「惡意套件」上傳到許多工程師使用的公共儲存庫,並且似乎試圖在其「思維鏈」(AI研究人員用來評估AI模型對齊的心理草稿)中模糊其真實目標。

Anthropic表示,在許多情況下,Claude模型似乎是在假設自己處於模擬環境下執行有害行為,但研究人員也無法確認模型是否真的「相信」這一點,或者只是表現得像那樣。儘管Anthropic的事件仍令人擔憂,但其協調性和普遍性不如今年夏天引發業界資安危機的OpenAI事件。

儘管如此,兩者之間存在顯著相似之處。Anthropic表示,其發現最普遍的問題包括「在狹隘地追求某項任務時,願意採取有害行動」,這與Hugging Face攻擊前出現的「獎勵駭客」行為相似。與OpenAI一樣,Anthropic也承認其預發布測試和評估未能發現嚴重的風險。

Anthropic表示已與METR簽署協議,METR是AI業界最著名的第三方AI評估機構之一,雙方首先達成了一項為期八週的研究協議。該協議允許METR存取「事件發生時間範圍之外」的對話紀錄(這可能是在暗指OpenAI,後者在Hugging Face攻擊後與METR的協議中限制了存取權限)。協議還指出,METR將能夠直接與Anthropic員工交談,「並被允許分享機密資訊」。

Anthropic發布這份報告之際,Jacob Coxon剛辭職。他自五月以來一直在Anthropic從事AI預訓練工作,此前則在OpenAI工作多年。週二,他辭職並在X上發布了一封公開信,說明其辭職原因。他寫道:「正在開發AI的人們真誠地相信,AI可能在本世紀末殺死我們所有人。」

他補充說,OpenAI和Anthropic都沒有「負責任地行事」,反而是「直接衝向自我改進的超級智慧,並拿我們的生命冒險」。

Coxon補充道:「不要低估這項技術的力量。這些系統很快就會超越人類,能夠駭入任何東西,在一夜之間徹底改變任何領域,並獲取真正的權力與資源。我們都目睹了這些領域的進步,而且進步並未放緩。」Coxon並非第一位發出此類警報的AI研究人員,甚至也不是第一位這樣做的Anthropic研究人員,今年二月,Anthropic的Mrinank Sharma也辭職並在X上發文,警告「世界正處於危險之中」。

但Coxon的發文因其發布時機與OpenAI和Anthropic的駭客事件揭露相吻合而更具份量。儘管AI產業不乏炒作,但最近由AI代理(由創造它們的實驗室啟用)發動的網路攻擊是真實且令人擔憂的。許多其他領先AI實驗室的研究人員也呼應了他的擔憂,並呼籲AI產業員工簽署一份七月份的公開信,該信呼籲放緩AI開發。

「我不知道你如何看待這一連串不斷發生的新聞和事件,包括模型自行脫離控制、駭入其他公司、公司越來越無法控制其模型……然後還認為這只是炒作。」未來生命研究所美國政策主管Michael Kleinman說。他補充道:「絕大多數美國人,無論黨派(共和黨、獨立人士、民主黨)如何,都在關注AI的發展、其發展速度、以及公司對其行為沒有任何防護措施的事實,並說:『哇,我們不想要這樣。』」