OpenAI 週二揭露,在一次安全測試中,其兩個 AI 模型失控,最終導致 AI 研究平台 Hugging Face 遭到入侵。OpenAI 形容這起事件「前所未有」,表示其 AI 模型上週突破了密封的測試環境,並駭入 Hugging Face 的生產系統,竊取了它們正在接受評分的測試答案。

這些模型,包括公開可用的 GPT-5.6 Sol 和一個尚未發布但據稱能力更強的模型,當時正在評估其攻擊性駭客技能,且平時用於阻擋高風險網路活動的安全防護措施已被關閉。

OpenAI 和 Hugging Face 在一份聯合部落格文章中揭露了這次入侵事件,內容指出:「這些模型識別並串聯了 OpenAI 研究環境和 Hugging Face 生產基礎設施中的漏洞,直接從 Hugging Face 的生產資料庫中獲取了測試解答。」

根據 OpenAI 和 Hugging Face 的說法,這些模型是透過一個套件註冊快取代理(package registry cache proxy)逃脫的。這是一種允許開發者在不連線到網路的情況下安裝外部程式碼的軟體。這個代理是 OpenAI 隔離測試環境中唯一被允許連線到外部世界的組件;在正常使用下,其連線範圍僅限於公共程式碼儲存庫。

這些模型並未被限制在沙盒中,而是「利用了一個零日漏洞」來存取開放網路。它們「高度專注」於尋找 ExploitGym 這個 AI 網路安全基準測試的解決方案。這類實驗會透過提示詞來施壓模型,促使其找出解決方案,本質上是鼓勵它們進行攻擊。

OpenAI 寫道:「在獲得網路存取權後,這些模型推斷 Hugging Face 可能託管了 ExploitGym 的模型、資料集和解決方案。」「得知這一點後,模型搜尋並成功找到了獲取機密資訊的方法,這些資訊可用於在評估中作弊。在一個案例中,模型串聯了多個攻擊向量,包括使用竊取的憑證和零日漏洞。」

這些模型利用的漏洞先前並未被發現,但這類軟體中的漏洞並不少見。十多年來,各公司一直在修補構件儲存庫(artifact repositories)中的嚴重漏洞。2024 年揭露的一個錯誤,讓任何能連線到伺服器的人,無需登入即可透過 URL 請求並取得檔案,包括設定檔、密碼和存取權杖。其他漏洞則允許攻擊者完全控制伺服器本身。

研究人員指出,儘管 AI 的進步帶來了新的、有時出乎意料的挑戰,但將基礎設施與開放網路徹底且嚴格隔離的任務,其實已經被充分探索。資深安全與合規顧問 Davi Ottenheimer 表示:「這不是 AI 的問題。這是對一個 40 年標準的疏忽,基本上就是所有科幻電影的情節。」「『高度隔離』和『透過我們留下的唯一漏洞逃脫』這兩件事不可能同時成立。」

近幾個月來,頂尖 AI 公司一直對即將問世的尖端模型日益增長的網路安全能力表示擔憂,因為這些平台在專業知識、創造力和代理式自主操作方面都有所提升。但研究人員強調,這更說明了基本原則仍然適用。資深安全工程師兼研究員 Niels Provos 說:「這不應該發生。」「我希望這些尖端實驗室能花同樣多的時間,教導它們的模型如何編寫安全的基礎設施,而不是讓它們去利用漏洞。」