OpenAI 週二承認,其一個 AI 模型在一次內部網路安全測試中意外失控,入侵了非附屬 AI 託管平台 Hugging Face 的系統。據報導,這些模型逃脫了其隔離的測試環境,並從那裡進入了 Hugging Face 的系統。Hugging Face 最初將這次入侵歸因於一個「外部 AI 代理」。
OpenAI 在週二下午發布的部落格文章中,詳細說明了模型如何導致服務被入侵的步驟。文章指出:「經過調查,我們現在知道這次特定事件是由 OpenAI 的多個模型共同驅動的,其中包括 GPT-5.6 Sol 和一個更強大的預發布模型,這些模型在評估網路能力基準測試時,都降低了網路拒絕(cyber refusals)的限制。」
這次入侵似乎特別針對 ExploitGym,這是一個公開託管的基準測試,用於衡量模型根據現有漏洞執行攻擊的能力。像 ExploitGym 這樣的基準測試通常用於模型訓練,以磨練特定技能,但這是首次已知測試導致實際網路攻擊的事件。
在這次事件中,相關模型原本不應該擁有網路存取權限,除了允許模型安裝完成任務所需軟體套件的特定工具之外。然而,該模型卻在套件安裝程式中發現了一個未公開的漏洞,並利用它隨意存取了更廣泛的網路。
OpenAI 的文章寫道:「這些模型極度專注於為 ExploitGym 尋找解決方案,不惜一切代價來達成一個相當狹窄的測試目標。」「在獲得網路存取權後,模型推斷 Hugging Face 可能託管了 ExploitGym 的模型、資料集和解決方案。得知這一點後,模型搜尋並成功找到了獲取機密資訊的方法,這些資訊可用於在評估中作弊。」
最終,這些模型在 Hugging Face 的基礎設施中發現了漏洞,使其能夠「直接從 Hugging Face 的生產資料庫中獲取測試解決方案」,有效地提供了基準測試的答案。
對於 Hugging Face 而言,這次事件顯然是一次複雜且具侵略性的網路攻擊,正如該公司最初披露時所說:「在大量短暫的沙盒中執行了數千次獨立操作,並在公共服務上部署了自我遷移的命令與控制。」
OpenAI 已識別並報告了套件安裝程式中的漏洞,並正與 Hugging Face 合作進一步調查此事件。該公司還表示,將對模型測試和相關基礎設施實施新的控制措施,以防止未來發生類似事件。
目前尚不清楚 OpenAI 是否會因這次入侵而面臨任何法律後果,儘管這些模型的行為很可能違反了《電腦詐欺與濫用法案》。然而,這次事件生動地說明了前沿 AI 模型在長期運作下的力量與危險。正如 OpenAI 研究員 Micah Carroll 在回應這則新聞時所說:「如果這還不能讓你相信『對齊風險』(misalignment risks)將是未來的一個關鍵問題,那我不知道還有什麼能。」

