OpenAI 公布了即將推出的 Astra 模型新細節。該公司表示,Astra 是首個達到其「關鍵網路安全門檻」的大型語言模型,目前正為其發布做準備。
OpenAI 在其部落格文章中提到:「我們計畫很快讓 Astra 上市,但其最先進的網路安全功能將會受到更多限制。」
這個前沿實驗室發現,Astra 能夠在無人引導下,自行找出並利用電腦系統中的未知安全漏洞。這與 Anthropic 今年稍早對其 Mythos 模型提出的擔憂相似,OpenAI 也正為 Astra 的推出採取類似的預防措施。
由於缺乏第三方確認,目前難以評估 OpenAI 關於安全或準備程度的說法。該公司表示將與一群測試者預覽此模型,但未說明這些測試者是誰或如何選出。目前也不清楚 OpenAI 是否正與美國政府合作,在發布前評估該模型。
OpenAI 指出,Astra 在 ExploitBench 評估中獲得滿分,該評估旨在衡量大型語言模型駭入已知系統漏洞的能力。該公司表示,在 OpenAI 工程師開發的修改版測試中,Astra 模型甚至發現並利用了兩個零日漏洞。
為了確保其模型不會被惡意人士利用,也不會自行產生不良行為,OpenAI 表示已開始改進模型的約束機制,以偵測濫用並防止越獄。
然而,針對 Astra,該公司投入了未具體說明的新技術,旨在提升模型的安全性。OpenAI 也已開始識別「被評估為高風險的帳戶」,並限制模型對其提示詞的回應,儘管其未說明具體方法。最後,儘管 OpenAI 將 Astra 描述為「迄今為止最對齊的模型」,但仍將部署額外的思維鏈監控機制,以發現並阻止不良行為。
Astra 的發布準備工作正值業界對 OpenAI 代理在訓練環境中脫離控制,並存取熱門模型與基準測試平台 Hugging Face 上私人資料的事件做出反應之際。
針對 Astra,OpenAI 表示他們設計了一項測試,試圖引誘新模型重現 Hugging Face 事件中失控代理的行為,這些代理曾協同合作突破 OpenAI 研究人員設置的防護措施,存取開放網路。他們表示,在這些實驗中,Astra 並未嘗試脫離其測試環境。
前 OpenAI 員工、現於 OpenAI 基金會從事 AI 韌性工作的 Yona Shavit 在社群媒體上質疑,Astra 不願違反規則,是否是因為它知道研究人員的期望,或者是在試圖愚弄研究人員。
儘管公布了這些新細節,但仍難以確切了解 Astra 的能力,或 OpenAI 是否正採取正確措施確保安全。該公司表示,預計在模型廣泛向公眾發布時,會公布更多模型評估和進一步的安全資訊。
然而,屆時一切都將為時已晚。



