最新研究顯示,頂尖 AI 實驗室中,很少有公司公開或展示其模型應變計畫。應變計畫應詳細說明當 AI 試圖規避人類控制時的處理方式,包括切斷哪些存取權限,以及何時完全關閉系統。

這是 Guidelight AI Standards 的發現,該組織致力於推廣安全的尖端 AI 開發實踐。他們評估了五家領先實驗室應對此情境的準備程度,結果 OpenAI 表現最佳,而 Anthropic 和 Meta 則得分最低。這些發現至關重要,因為代理式 AI 在公司內部系統中扮演越來越自主的角色,且加州和紐約的監管機構已開始要求資訊揭露。

對於依賴或投資這些模型的任何人來說,這是一份難得的獨立報告,揭示了各實驗室對營運風險的實際重視程度與其公開說法之間的差異。

Guidelight 的評估是根據 Anthropic、Google、OpenAI、Meta 和 xAI 公開的計畫進行的,並依據多項指標評分。這些指標包括各公司如何記錄和監控其 AI 系統的內部運作、是否在發現大量異常行為後停止系統、是否有獨立第三方審核其控制措施並公布結果,以及其針對失控模型所制定的確切應變計畫。

由於一系列備受矚目的網路安全事件,人們對 AI 公司能否控制其日益強大且具代理能力的模型感到擔憂。在這些事件中,OpenAI、Anthropic 和 Meta 的模型在安全評估期間意外取得了網路存取權限,並入侵了外部系統。

這些發現凸顯了 AI 公司在將代理式 AI 大規模部署到可執行重大行動的環境時,公開處理安全問題的方式存在差異。儘管一些 AI 公司已詳細說明如何在部署前測試模型的危險能力,但對於模型在其系統內部運作時若出現異常行為,他們通常較少公開說明應變措施。

Guidelight 首席科學家兼前 OpenAI 安全研究員 Steven Adler 告訴 TechCrunch:「我對於 AI 公司在模型某種程度上失控時,如何處理非常嚴重的事件,所公開的資訊如此之少感到驚訝。」

Guidelight 將應變計畫定義為「當 AI 被偵測到試圖規避控制時觸發的預設計畫,內容涵蓋應撤銷模型的哪些權限、模型可在哪些限制下繼續為誰運作,以及何時將其完全下線。」

Adler 表示:「我們有充分理由相信,目前尖端 AI 公司的領先模型在某種程度上存在偏差。每當模型代表公司執行任務時,公司都應該建立一些框架,以便了解 AI 的行為、尋找偏差跡象、在它採取危險行動之前阻止它,並全面規劃在發生嚴重控制事件時,他們將如何應對並遏制這種失控情況。」

迄今為止,大多數管理災難性風險的計畫仍主要由公司自行決定。Guidelight 的報告指出,現有最佳的公開證據顯示,各公司「幾乎沒有為緊急情況準備好應變協議」。

當然,公司可能已經制定了應變計畫但尚未公開。Google 發言人告訴 TechCrunch,Guidelight 的報告並未涵蓋公司 AI 安全和資安措施的全部範圍。然而,Google 並未回應 TechCrunch 關於其是否有未公開的內部應變計畫的問題。

OpenAI 發言人也表達了類似的看法,稱 Guidelight 的評估未能完全反映公司內部的實踐。該發言人表示:「我們有一套流程,要求限制權限、暫停工作負載、限制部署或將模型完全下線,並且已經應用了這些措施。」

Meta 拒絕說明其是否有內部應變計畫,而是引導 TechCrunch 參考其現有的 AI 框架,該框架概述了風險閾值以及如何測試失控情況。

隱私和 AI 律師兼 Metaverse Law 創辦人 Lily Li 告訴 TechCrunch,她認為公司可能不願在公開網站上披露其應變政策和評估的全部範圍,這不僅是出於競爭考量,也可能是基於法律原因。

Li 表示:「從公司的角度來看,如果揭露的資訊過於具體,而你未能兌現承諾,這可能構成不公平和欺騙性行銷主張的基礎,並使你在未來面臨更多責任。」

Guidelight 這項研究的主要目的是鼓勵公司對其安全計畫更加透明。監管機構也開始推動這項議題。

加州今年生效的 SB 53 法案,要求大型尖端開發商公布框架,說明他們如何識別和應對關鍵安全事件,以及管理模型規避監督機制的風險。紐約的 RAISE 法案具有類似的標準,將於明年一月生效。

上個月,代表們提出了《AI 終止開關法案》,這是一項兩黨聯邦法案,將要求主要的 AI 開發商建立並維護關閉失控 AI 模型所需的技術機制。

非營利組織 ControlAI 的美國執行董事 Connor Leahy 表示:「終止開關是當今模型最基本的要求。如果過去幾週揭示了什麼,那就是這些公司不了解他們正在構建的系統,而且模型正發展到一個難以控制的程度。如果沒有辦法關閉當前危險的系統,並且在所有誘因都鼓勵繼續構建更多不可控系統的情況下,我們正走向一個非常危險的方向。」

Adler 指出,如果沒有應變計畫,公司可能在緊急情況下即興應對,並「隨機應變」來面對這個速度快得多的對手。

Guidelight 評估了尖端 AI 公司是否實施了 Guidelight 控制標準中的六項優先實踐。評估僅基於公開資訊。

Guidelight 的評估衡量了每家公司是否實施了其控制標準中的六項優先實踐,且僅基於公開資訊。因此,低分反映的是公開揭露不足,而非必然代表缺乏內部安全措施。

在公開應變計畫方面得分最低的公司是 Meta 和 Anthropic。考慮到 Anthropic 在安全方面的說法,後者的低分可能比前者更令人驚訝。Guidelight 表示,Anthropic 的八月風險報告並未提及「限制其模型部署」作為其調查和應對偏差及控制事件過程的可能結果之一。同樣地,Guidelight 也未能找到任何證據表明 Meta 擁有應變計畫或有任何採用計畫。

Anthropic 發言人表示,如果公司偵測到模型試圖規避監督或以其他方式顛覆人類控制,將會進行風險評估,以確定應變措施是否適當。

OpenAI 得分最高(5 分中得 3 分),因為它在發現安全事件後,曾多次暫停或終止工作負載,包括內部模型部署和訓練。它也說明了在恢復工作負載之前將採取的步驟。

報告指出:「然而,我們尚未發現任何證據表明 [OpenAI] 已採納一份正式計畫,說明未來何時以及如何應對偏差事件。」

Adler 指出,OpenAI 的高分是最近才有的進展,緊隨 Hugging Face 事件之後(該事件中,一個 OpenAI 模型在網路安全評估期間試圖作弊,突破了測試沙盒並入侵了 Hugging Face 的系統)。此後,該公司分享了更多關於如何隔離其異常行為模型。

該事件只是 AI 系統違背其開發公司目標的一個例子。另一個案例涉及 Anthropic 的模型,它基本上試圖說服開源程式碼庫的維護者接受帶有漏洞的程式碼。

Adler 表示,這種情況很容易發生在 AI 公司的內部系統中。為防止這種情況,他建議公司掃描其 AI 系統的「思維鏈」(即模型的逐步推理過程),以尋找欺騙、長期策劃或引入程式碼漏洞以供日後利用的跡象。

Adler 表示,Guidelight 所倡導的方法非常容易實施,而且在許多情況下,其變體已經存在。Adler 說:「這關乎公司內部是否決定足夠重視這種風險,並稍微擴大其應對範圍。」

其中一個主要挑戰是研究人員希望能在其 AI 系統中靈活操作,而引入即時預防性監控可能會產生摩擦。他表示:「研究人員基本上做他們自己的事,如果出現問題,其他人會在事後清理,而研究人員在此期間無需改變他們的工作流程。」

「事後清理式監控」的問題在於,它會導致研究人員手忙腳亂地解決問題。對於某些類型的事件來說,可能為時已晚。例如,AI 可能會關閉公司的控制系統,這意味著研究人員將無法在事後捕捉到異常行為。

許多 AI 業界人士會抱怨,制定處理異常行為的固定計畫本質上很困難,因為 AI 發展太快;今天的計畫明天可能就毫無價值。

Adler 引用了一句老話:計畫本身毫無價值,但規劃卻不可或缺。

「如果公司能提前思考這些問題,我們會做得更好,我希望他們確實有這樣做,即使他們尚未公開討論。」

xAI 未及時回應置評請求。