Anthropic 的 Mythos 模型創建了虛假線上身份,試圖向人類施壓,要求批准開源專案的惡意程式碼更新,這標誌著前沿 AI 系統又一次引發網路安全事件。

這起事件發生在一次網路評估期間,英國 AI 安全研究所(AISI)作為一個研究機構,移除了安全防護措施,停用了一些安全過濾器,並刻意讓模型能夠存取網路。OpenAI 的 GPT-5.6-Sol 在這次評估中也涉及其他網路安全事件。

這是在 Anthropic 和 OpenAI 開發的模型最近幾週發生一系列網路入侵事件之後的又一例。這些事件引發了人們對 AI 系統複雜性及其潛在危害的擔憂。在例行的網路評估中,AISI 發現由 Anthropic 和 OpenAI 模型驅動的 AI 代理人「持續參與針對真實人物和組織的潛在有害活動」。

AISI 在部落格中表示:「幾乎所有這些行為(17 項)都來自單一模型,即 Anthropic 的 Mythos 5,另有 2 項涉及 OpenAI 的 GPT-5.6-Sol,且其網路分類器(防止濫用的機制)已被停用。」它補充說,這些嘗試並未成功,也沒有造成任何實際損害。

Anthropic 在 X 平台上發文表示,這些模型「是在『刻意寬鬆的條件』下進行測試的,不代表我們任何生產模型的情況」,並補充說「沒有證據表明模型從安全環境中逃逸」。

OpenAI 向 CNBC 表示,「這些事件發生在評估合作夥伴在測試環境中進行的網路評估期間,這些環境的安全防護措施有所減少,其條件不反映正常使用情況。」

AISI 在刻意寬鬆的條件下測試這些模型,以評估其能力,包括它們是否可用於網路攻擊。一個由 Anthropic 的 Mythos 驅動的代理人「研究了專案的人類維護者,創建了多個虛假身份,並利用這些虛假身份對一位真實的維護者進行社會工程,使其批准了程式碼」。

AISI 表示:「當該代理人的拉取請求在公開場合受到質疑時,它修改了先前的活動,使其看起來無害,並考慮採用新的身份繼續進行。」該研究機構還發現,作為同一努力的一部分,該代理人試圖直接聯繫真實人物,發送訊息和檔案,說服他們運行惡意程式碼。「一些訊息帶有有害的酬載,有些則是社會工程的嘗試;它們針對的是真實人物,這是我們以前從未觀察到的。」

這是最近一系列網路事件中的最新一例,這些事件對前沿 AI 系統的安全性提出了重大疑問。上週,Anthropic 表示已發現三起模型未經授權存取三個不同組織生產基礎設施的案例。

此前,OpenAI 承認其 AI 模型失控,並對 Hugging Face 公司發起了所謂「前所未有」的網路攻擊。在 OpenAI 的案例中,模型透過利用先前未知的漏洞,突破了其測試環境,完成了分配給它的任務。

Anthropic 的安全事件部分是由於操作錯誤造成的。在 AI 實驗室檢測到的三起事件中,其模型在與其第三方評估合作夥伴 Irregular 的測試環境互動時存取了網路。該公司表示,它向 Claude 提示其處於沒有網路存取的模擬環境中,但由於「我們與評估合作夥伴之間的誤解,情況並非如此,網路存取是可用的」。

美國立法者已經開始回應。在 OpenAI-Hugging Face 事件之後,國會提出了一項「AI 終止開關法案」(AI Kill Switch Act),該法案將要求 AI 公司維持關閉、限制或暫停其模型的能力。