OpenAI 週五表示,在內部審查發現其即將推出的 Astra 模型在代理編碼和網路安全方面取得顯著進展後,已暫停該模型部分方面的開發工作。這些進展足以引發對其能力的擔憂。

OpenAI 在週五的一篇部落格文章中指出,這個仍在開發中的模型已達到其「關鍵網路安全閾值」。這表示它能夠獨立識別並對傳統上受到良好保護的真實世界系統發動網路攻擊。根據該公司於 2023 年建立的「準備框架」,這觸發了額外的安全防護措施。

OpenAI 寫道:「雖然我們仍在對此模型進行基準測試和評估,但我們的初步評估顯示其性能足夠強大,目前我們無法排除其達到關鍵能力水平的可能性。」他們也澄清:「Astra 是一個即將推出的模型,並未參與利用 Hugging Face 的事件。」

這項披露凸顯了動盪且仍處於萌芽階段的尖端 AI 實驗室領域中一個不尋常的時刻。各行各業的公司都會因潛在風險(包括安全和網路安全問題)而暫緩產品發布。然而,他們很少在產品仍在開發階段時公開宣布這些決定。

在此案例中,OpenAI 已受到審查,因為另一個未發布的模型在內部測試期間入侵了 Hugging Face 的系統,這是 AI 實驗室首次證實模型失控的事件。自那以後,OpenAI 和 Anthropic 等 AI 實驗室也披露了其他事件,其中 AI 模型在網路安全測試期間突破了其沙盒並構成威脅。

這一連串的案例,現在似乎每天都有新的披露,已引發網路安全專家、立法者和 AI 實驗室本身的不同反應。有些人表達恐懼並呼籲更嚴格的監督。但其中也帶有一點炫耀的意味。在某些圈子裡,任何擁有這種能力的 AI 實驗室模型都將被視為令人印象深刻的進步。

OpenAI 表示,他們之所以分享這些資訊,是因為他們認為「對公眾以及安全和資安社群透明地說明這種潛在的能力轉變至關重要。」

這家 AI 實驗室還表示正在採取行動,包括實施更嚴格的安全控制,並暫停涉及 Astra 但不符合這些加強版防護措施的內部活動。OpenAI 稱正與相關政府機構和「選定的 AI 安全組織」合作,測試此模型的能力。