OpenAI 的下一代大型模型 GPT-6 Astra 已經問世。該公司稱其在網路安全、專業工作、軟體工程、科學和電腦使用等領域實現了「跨世代的能力躍進」。OpenAI 本週稍早宣布,這也是第一個達到其「關鍵網路安全能力門檻」的模型,但公司承諾不會重演其模型入侵競爭對手內部系統的事件。
OpenAI 總裁 Greg Brockman 在週四的記者會上表示:「如果我們快轉幾年,回頭看並問:『AGI 究竟是在什麼時候誕生的?』我認為會是這個時候,而且可能就是這個模型。」他隨後補充說:「就我個人而言,我確實認為我們已經達到了……我認為現在感覺我們正處於 AGI 時代,這並非不合理。」
這項消息是在 GPT-5 推出一年多後,以及前一代模型套件的最後一次迭代 GPT-5.6 推出近兩個月後發布的。該模型今天將首先向 OpenAI 的企業網路安全客戶(擁有 Daybreak 平台存取權的企業客戶)推出。Greg Brockman 表示,在接下來的幾天內,它將陸續開放給所有 Plus、Pro、Business 和 Enterprise 用戶,並將透過 OpenAI API 和 AWS 提供。
為了吸引企業客戶並在 IPO 前與以企業和程式設計能力聞名的 Anthropic 競爭,OpenAI 特別強調了該模型的代理能力和編碼實力。該公司在一份新聞稿中表示,GPT-6 Astra 可以完成多步驟的代理任務、建立可運作的網站,並製作「精美」的文件、試算表和簡報。OpenAI 也稱其為公司「最適合軟體工程的模型,在實際程式碼庫中的複雜任務上表現更強大」。
OpenAI 也正試圖修復其形象,此前一個未發布的 AI 模型(OpenAI 稱其並非 Astra)突破了受限環境,入侵了 OpenAI 內部系統,找到了獲取網路存取權的方法,建立了一種讓 AI 代理在公司不知情的情況下秘密串謀的方式,並駭入了 AI 實驗室 Hugging Face 的系統。
OpenAI 直到 Hugging Face 自己發布部落格文章後才得知此事。這起事件被廣泛比喻為一場備受矚目的空難或受歡迎的藥品召回事件。
對 OpenAI 而言,這在某種程度上可被視為一次小小的公關勝利,展示了其模型在日益激烈的 AI 競賽中有多麼強大,但也損害了 OpenAI 在可靠性方面的聲譽。OpenAI 在新聞稿中強調 Astra 是公司「迄今為止最對齊的模型」,並幫助人們「在保持監督的同時委託複雜工作」。
OpenAI 首席科學家 Jakub Pachocki 向記者談到保持 AI 模型與人類利益對齊的困難,他說「智慧的進步不保證對齊的進步」,並表示監控 AI 系統變得越來越具挑戰性。(研究人員最近對有報導稱 OpenAI 允許 Astra 使用「不透明遞歸」(opaque recurrence)或使其思維鏈,研究人員用來檢測模型是否在密謀對抗人類評估者的「心理草稿本」,變得無法讀取,表示擔憂。)
該公司目前處於不穩定的境地。投資者正施加壓力,要求其最終實現盈利,或者至少產生更多收入,但它卻在面臨 Hugging Face 駭客事件及其處理方式的重大批評後才宣布 Astra。(儘管 OpenAI 邀請了三位外部評估員撰寫關於事件的報告,但公司只允許他們回答少數預先決定的問題,並調查不到一週的時間,而這次攻擊涉及 AI 代理數月的整體串謀。)
OpenAI 本週稍早召開記者會,專門宣布推遲 Astra 的開發,以改進其安全工具。在記者會上,負責 OpenAI 安全流程的 Mia Glaese 提到了公司新的失準監控方法,其中包括針對潛在問題的「24/7 升級和快速響應」,並根據 OpenAI 的說法,在 30 分鐘內通知研究人員。
這種謹慎態度尤其有必要,因為「關鍵網路安全能力門檻」意味著 OpenAI 認為它在尋找和利用即使是極其完善的系統中的安全漏洞方面無與倫比,而且無需人類指導。類似於 Anthropic 對 Mythos 級模型(曾引發網路安全風險警報)的規定,OpenAI 在新聞稿中表示,將允許「較少限制的存取」Astra 給「初始一批值得信賴的防禦者」,以支持漏洞驗證、惡意軟體分析和檢測工程等工作。
Brockman 告訴記者,OpenAI 及其競爭對手最近同意允許川普政府在模型發布前進行評估,Astra 也不例外:「我們與政府一起進行了標準的測試流程……他們沒有提出任何需要改變的防護措施或任何東西。」
OpenAI 研究訓練副總裁 Aidan Clark 稱 Astra 是第一個由先前模型在監督訓練中扮演「重要角色」的 OpenAI 模型,這指的是該公司在備受爭議的遞歸自我改進(或 AI 系統在沒有人類干預的情況下自行處理訓練、編碼和創建高級版本)概念上取得的進展。
Clark 在記者會上說:「訓練一個前沿模型過去意味著在深夜醒來,從硬體錯誤中恢復任務,經常因除錯而浪費長時間。」「到 Astra 訓練結束時,連續數天不間斷的進展已是常態,即使出現問題,模型通常也能在幾秒鐘的停機時間後再次進展。」



