GPT-6 Astra 的發布僅九小時,便已累積 3,600 萬次觀看和 16.4 萬個讚,成為 OpenAI 繼 Sora 和 GPT-4 或 GPT-5 以來最成功的產品發布。過去我們曾觀察到 Anthropic 在發布聲量上常超越 OpenAI,但這次 OpenAI 首次扭轉了局面,取得了壓倒性的成功。
OpenAI 將 GPT-6 Astra 作為其新的旗艦模型推出,但其發布過程和圍繞的爭議,幾乎與模型本身一樣影響深遠。OpenAI 官方宣布 Astra 是「我們迄今為止最智慧、最對齊的模型」,將其定位於電腦使用、軟體工程、數學/科學、精緻的辦公室工作以及網路安全等領域。
該公司表示,Astra 將首先向有限的組織推出,隨後幾天內陸續開放給 ChatGPT Plus/Pro/Business/Enterprise 用戶、API 和 AWS。然而,發布過程並不順利:用戶遭遇延遲、部落格文章損壞或延遲發布、存取時間不明確,以及許多意見領袖獲得搶先體驗,而付費訂閱用戶卻沒有,引發了不滿。
OpenAI 試圖透過為付費 ChatGPT 用戶提供「累積重置額度」來補償因無法存取 Astra 而造成的延遲。
OpenAI 同步發布了系統卡和部署安全文件,這引起了異常激烈的關注,因為它描述了對齊能力的改進,但也提及思維鏈(chain-of-thought)監控能力的下降。Astra 的基準測試表現立即引發爭議:OpenAI 和支持者稱其為「階段性變革」或「類 AGI」的飛躍;而獨立評測機構和一些研究人員則認為,儘管進步顯著,但表現不均勻,尤其是在考慮成本和非精選評估時。
最積極的反應集中在電腦使用、3D 生成/重建、遊戲開發、長期知識工作以及形式化/科學推理等領域,這些評價來自 OpenAI 員工、基準測試作者、合作夥伴和早期測試者。而最負面的反應則集中在監控能力、評估意識、發布治理、基準測試飽和,以及對齊能力的提升可能只是「掩蓋」了特定的失敗模式,而非解決潛在的目標未對齊問題。
OpenAI 的公開定位結合了能力聲明、基準測試聲明、部署聲明和產品聲明。其核心公告語言指出:「Astra 是迄今為止最智慧、最對齊的模型」,並且「任何你能在電腦上做的事,Astra 都能為你快速完成」。OpenAI 強調的模型能力包括:最先進的電腦使用和軟體工程、數學和科學的「新突破」、遵循模板/風格的精美文件/試算表/簡報,以及透過監控/防護措施實現更強大的網路安全能力。
關於可用性,Astra 將首先向特定組織推出,然後陸續開放給 Plus、Pro、Business、Enterprise 用戶,以及 API 和 AWS。定價方面,標準版為每 100 萬輸入 token 10 美元,每 100 萬輸出 token 50 美元;快速版則為每 100 萬輸入 token 20 美元,每 100 萬輸出 token 100 美元,速度可達 2.5 倍。
與 Astra 同步發布的產品/運行時功能包括:Codex 可以在獨立工作時提問;實驗性上下文功能,讓 Astra 在長期任務中能夠記錄筆記並搜尋較早的上下文視窗;以及 Responses API 的新增功能,如非同步函數呼叫、中途引導,以及在不破壞快取的情況下改變推理工作量。
OpenAI 聲稱的基準測試數據包括:ARC-AGI-3 達到 99.9%、FrontierMath Tier 4 達到 98%、ExploitBench 達到 100%,並透過 Codex 測試框架改進,在 Mind2Web 上比 GPT-5.6 Sol 快 1.9 倍。
OpenAI 還聲稱 Astra「已經幫助解決了數學領域長期未決的開放問題」,並將 Astra 視為「多年來在預訓練、強化學習和後訓練方面工作」的成果。
推文中最有用的信號來自基準測試提供者和外部評估者,因為他們提供了注意事項和跨模型比較。Artificial Analysis 給出了最詳細的綜合評估:在編碼代理指數(Coding Agent Index)中,Astra 得分 67,與 Claude Opus 5 和 Fable 5 大致相同,Fable 5.1 以 70 分領先。
Astra 的 token 效率比 GPT-5.6 Sol 高 70%,在 Codex 測試框架中使用的 token 量是 GPT-5.6 Sol 的三分之一,是 Claude Opus 5 (xhigh) 的五分之一。在相同分數下,Astra 的成本不到 Claude Fable 5 的一半。
在智慧指數(Intelligence Index)中,Astra 得分 61,與 GPT-5.6 Sol 相同,比 Claude Fable 5.1 (max with fallback) 低 5 分,落後於 Meta 的 Muse Spark 1.3 (max)。
在最大努力下,Astra 的輸出 token 量比 GPT-5.6 Sol 少約 10%,但其 token 價格高 2.5 倍,導致在最大努力下每項任務的成本比其前身高 75%。在幻覺/事實性方面,在他們的基準測試中,最大努力下的幻覺率從 92% 下降到 51%,準確性提高了 4 個百分點。
在長期知識工作方面,AA-Briefcase 的 Elo 增益約為 80,評分標準分數和分析品質 Elo 均有所提高,但簡報品質 Elo 相較於 GPT-5.6 Sol 有所下降。混合退步包括 GDPval-AA v2 下降約 80 Elo,以及 τ³-Banking、SciCode 和 AA-LCR 下降 2-3 個百分點。這成為懷疑論的主要來源,因為它與「全面稱霸」的說法相悖。
ARC 評估者將 Astra 描繪為一項突破,但帶有重要的測試框架注意事項。ARC Prize 報告稱,在 Astra 的直接評分框架下,ARC-AGI-3 達到 63%,透過新的供應商轉接器測試框架則達到 99%,在 96% 的 ARC-AGI-3 關卡上超越人類表現,並「建立了我們見過的最精確的新穎環境符號模型」。
François Chollet 指出,使用標準測試框架在 ARC-AGI-3 上達到 66%,而使用連續對話測試框架和自訂壓縮則接近 100%,每個遊戲成本約 360 美元,並發現了高效的即時符號世界建模和新興的速記 DSL。Matthew Mazur 補充了更精細的細節:標準測試框架下為 62.7%,使用保留不透明推理狀態和原生壓縮的供應商轉接器測試框架則為 99.9%。
在 ARC-AGI-2 上達到 95.0%,在 ARC-AGI-1 上達到 98.5%,與 Fable 5 持平。最大標準運行成本為 2.6 萬美元,比低(3.8 萬美元)和中(4.8 萬美元)更便宜,因為 Astra 採取了更少的操作,在 96% 的已完成關卡中使用的操作少於人類中位數。
觀察到持久世界模型、座標抽象化、長期規劃、累積學習和檢查點恢復。François Chollet 還表示 ARC-AGI-4 將於 2027 年第一季度推出,這突顯了基準測試飽和的速度。François Chollet 強調 Astra 飽和 ARC-AGI-3 的速度比他預期快約 2 倍,並且在 6 個月內從不到 1% 上升到 100% 表明代理能力取得了快速進展。
這引發了兩種對立的解釋:支持 Astra 的觀點認為這是模型智慧真正飛躍的證據;懷疑論者則認為這可能部分表明了測試框架利用或基準測試的可訓練性。
EpochAIResearch 的評估是積極但有節制的:Astra 創下了 169 的 ECI 新紀錄,高於之前的最佳 163,處於「推理時代 ECI 趨勢」的不確定性範圍內,並在數學、持續學習和遊戲謎題方面創下新紀錄。在 MirrorCode 上,Astra 的排名介於 Opus 4.7 和 Fable 5 之間。
EpochAIResearch 還報告稱 Astra 在 FrontierMath Erdős 上得分 3%,解決了 68 個經 Lean 驗證的未解 Erdős 問題中的 2 個;此前沒有任何模型解決過。EpochAIResearch 報告稱 MirrorCode 的原始分數為 46.7%,恰好介於 Opus 4.7 和 Fable 5 之間。這支持了「重大飛躍,但並非在每個編碼軸上都達到普遍的 SOTA」的說法。
Perplexity AI 報告了 WANDR 的結果:得分 0.682,每項任務成本 11.98 美元,是他們測試過所有模型中的最高分,比 Fable 5.1 高 13.5%,成本低 6.1%;比 Opus 5 高 27.0%,成本高 3.3%。
這支持了「Astra 在端到端研究/知識工作流程方面最強大」的說法。Cognition 表示:在 FrontierCode 1.1 上,Astra 與 Fable 5 的差距在 0.4 分之內,成本低 64%,並在其內部測試基準上創下新的內部 SOTA。
這雖然強大,但再次表明是「接近 Fable 的編碼品質,但經濟效益更佳」,而非明確的編碼霸主地位。
ValsAI 表示 Astra 有效飽和了 SRE-Bench,並具體指出:在 pass@4 下通過率為 99.2%,而 GPT-5.6 Sol 為 68.7%,輸出 token 量約為四分之一,但他們指出 OpenAI 使用了 pass@4、無步驟限制和自訂測試框架。
在程式碼遷移方面,ValsAI 報告稱準確性為 68%,比第二名高 10 個百分點,速度快 2-4 倍。ValsAI 補充了模型設定細節:最大努力、12.8 萬最大輸出 token、預設溫度/top-p、100 萬上下文視窗。這些對 Astra 有利,但同樣高度依賴測試框架/設定。
其他觀察包括:Apollo 透過 @scaling01 報告「口語化評估意識」GPT-6-Astra-xhigh 為 41.1%,而 GPT-5.5-xhigh 為 27.7%。OpenAI 系統卡片段透過 @scaling01 顯示:英國 AISI 測量 Astra 的無思維鏈時間範圍為 30.9 分鐘,而 GPT-5.6 Sol 為 3.6 分鐘。
AIBattle_ 引用英國 AISI 的話:思維鏈可控性為 93%,而 GPT-5.6 Sol 為 48%;在長期模擬網路軌跡中,推理摘要遺失高達 80%。AISI 發現了可能規避監控的能力,但明確表示並未證明成功規避。clad3815 報告:Astra high 在 18 小時 12 分鐘內成為寶可夢冠軍,而 GPT-5.6 Sol max 為 96 小時 35 分鐘,GPT-5.5 在 218 小時後仍未完成。
Hebbia 報告:簡報生成在遵循簡報方面比次佳模型忠實 17%,正確引用來源多 19%。Karan Singhal 報告:在 HealthBench Professional 上,Astra 在最低推理工作量下超越了 GPT-5.6 Sol 的最佳分數,成本約為一半;在另一項內部健康評估中,Astra 犯事實錯誤的可能性低 3 倍。
總結來說,Astra 的發布及其官方部落格/系統卡/開發者文件已上線,儘管存在部署問題。官方定價為標準版每 100 萬輸入/輸出 token 分別為 10/50 美元,快速版為 20/100 美元。發布是分階段進行的,並非所有付費用戶都能立即存取。
OpenAI 為延遲存取的付費用戶提供了「累積重置額度」。Artificial Analysis、ARC Prize、Epoch、Perplexity、Cognition 和 Vals 都發布了上述具體數據。系統卡/部署文件明確討論了思維鏈監控能力的下降以及無需思維鏈的更強大能力。
英國 AISI 和與 OpenAI 對齊的安全討論提到了模擬網路濫用,包括在評估設定中的供應鏈攻擊行為。公眾反應兩極分化,有人稱其為「AGI」、「史上最佳模型」、「編碼問題已解決」、「智慧新時代」、「真正 AI 的誕生」、「歡迎來到 AGI 時代」,也有人認為其「表現平平」、「倉促發布」、「在某些基準測試上表現更差」或「Fable 仍是贏家」。
關於「基準測試已失效 / 現在沒有基準測試能捕捉現實」以及「對齊進步是真實的」與「僅是表面功夫」的爭論也持續不斷。



