OpenAI 週二宣布,其即將推出的 AI 模型 Astra,是公司首個達到其所謂「關鍵」網路能力門檻的模型。OpenAI 表示計劃「很快」公開發布 Astra 的一個版本,但在發布初期,該模型的進階網路能力將僅提供給 Daybreak Blue 早期合作夥伴計畫中的特定合作夥伴。

在一場記者簡報會上,OpenAI 的安全主管表示,公司已認定 Astra 達到了其準備框架中概述的關鍵網路安全能力。該框架設定了 AI 模型構成新風險等級時的門檻和協議。OpenAI 指出,當一個 AI 模型能夠獨立發現並利用真實軟體中先前未知的漏洞時,就達到了其關鍵網路門檻。OpenAI 主管表示,公司已遵循此情況下的程序,即暫停進一步開發,直到實施適當的防護措施和安全措施。

OpenAI 先前曾表示,已暫停與 Astra 及未來某個 AI 模型開發相關的部分訓練工作數週。高層表示,在實施額外的安全和防護控制措施後,公司現已恢復 Astra 及該未來 AI 模型的工作。OpenAI 認為這次為期數週的暫停富有成效,並確信能夠以安全的方式廣泛發布 Astra。

此項宣布正值矽谷努力應對尖端 AI 模型的進階網路安全能力之際,並試圖向用戶、立法者和其他公司保證其能夠控制這些能力。去年七月,OpenAI 曾披露一起事件,其中兩個模型的代理在一個應當是隔離的測試環境中利用漏洞,成功存取網路並入侵開源 AI 平台 Hugging Face。OpenAI 強調,Astra 並非此事件中涉及的模型之一。

近幾週來,其他 AI 公司如 Anthropic 和 Meta 也披露了類似事件。週一,Anthropic 也表示已暫停部分 AI 訓練工作,以強化其安全和防護措施。

OpenAI 表示,正實施多步驟方法來限制一般用戶存取 Astra 的進階網路能力,其中包括一個新的「錯位監測器」(misalignment monitor)。例如,如果有人要求 Astra 協助他們在真實軟體系統中尋找漏洞,該模型應拒絕回答。OpenAI 還表示,已使 Astra 更能抵抗越獄嘗試,在測試中,它拒絕不安全查詢的成功率顯著高於先前的模型。

然而,OpenAI 在一篇部落格文章中指出,其錯位監測器可能「偶爾將合法活動標記為潛在的網路濫用或未經授權的行為,導致其無意中被減速、暫停或停止」。OpenAI 表示,即使在用戶從事看似與網路安全無關的活動時,此防護措施在某些情況下也可能被觸發。OpenAI 稱,發生這種情況時,ChatGPT 和 Codex 用戶可能會被要求在繼續之前審查模型的動作。

OpenAI 的 Daybreak 計畫合作夥伴,包括 Cisco、Cloudflare 和 Palo Alto Networks 等數位基礎設施供應商,將能搶先體驗功能限制較少、網路能力更強大的 Astra 版本。該計畫的目標是確保這些公司能夠利用 Astra 等進階 AI 模型來強化其防禦能力,以應對未來類似能力的模型廣泛可用。

OpenAI 主管也表示,公司一直與政府合作夥伴密切合作,確保他們了解 Astra 的網路技能並能存取這些技能。

Astra 不僅能夠發現新的軟體漏洞並開發利用這些漏洞進行駭客攻擊的方法,還能夠將多個漏洞「串聯」起來。這是一種用於深入目標系統並獲取僅憑單一漏洞無法實現的存取權限的技術。