儘管 Meta Superintelligence Labs 推出了令人驚豔且具競爭力的 Muse Spark 1.1 模型,甚至首次整合到 Meta 模型 API 中,這在平日足以成為頭條新聞。然而,它不幸地與 OpenAI 的主力前沿模型發表撞期。
數週前在政府批准前預告的 GPT-5.6,推出了三種新尺寸:Sol、Terra 和 Luna,分別對應太陽、地球和月亮,以區別於 Claude 模型更具文學性的命名方式。此外,還新增了「ultra」超高努力程度設定,號稱是「我們最高能力設定,能協調多個代理在平行工作流中更快完成複雜任務」。
「max」設定讓 GPT-5.6 有比「xhigh」更多的時間進行推理、探索替代方案、執行檢查並修正其方法。而「ultra」更進一步,預設協調四個代理平行運作,以更高的 token 使用量換取更強的結果,並在要求嚴苛的任務上實現更快的完成時間。在多個基準測試中,GPT-5.6 均以更低的成本實現比 Fable 或 Opus 更高的效能。
「Terra」的表現略優於 Fable 5,而「Luna」則超越 Opus 4.8;兩者都約在三分之一的時間內完成任務,輸出 token 量約為一半,估計成本約為四分之一。GPT-5.6 還在 Terminal‑Bench 2.1 和 DeepSWE 上創下新的最先進成果,這些測試評估複雜的命令列工作流程和真實程式碼庫中的長期工程任務。
此外,在電腦使用、簡報/文件生成和科學研究方面也有難以量化的改進,但這些都應被認真看待。正如我們在四月預測的,今天新推出的 ChatGPT Work 和 Codex 桌面應用程式更新,可能是 OpenAI 超級應用程式策略的倒數第二步(最後一個未解的問題是代理瀏覽器將如何發展……)。
這是 2026 年 7 月 8 日至 9 日的 AI 新聞。我們檢查了 12 個 Reddit 子版塊、544 個 Twitter 帳號,但沒有進一步的 Discord 資訊。AINews 網站允許您搜尋所有過往的報導。提醒您,AINews 現已成為 Latent Space 的一個專區。
您可以選擇訂閱或取消電子郵件頻率!OpenAI 推出了一個新的 GPT-5.6 三模型系列,同時也擴展了其周邊的產品堆疊。
OpenAI 透過 @OpenAI 和 @OpenAIDevs 宣布,GPT-5.6 Sol、Terra 和 Luna 將陸續在 ChatGPT、Codex 和 API 上推出。在 ChatGPT 中,Plus、Pro、Business 和 Enterprise 用戶可以透過中等或更高努力程度的設定來使用 GPT-5.6 Sol,而 Pro 和 Enterprise 用戶則可以選擇 GPT-5.6 Pro,以在複雜任務中獲得最高品質的結果。
API 定價引入了分級方案:Sol 每百萬輸入/輸出 token 分別為 5 美元/30 美元,Terra 為 2.5 美元/15 美元,Luna 為 1 美元/6 美元,並首次增加了快取寫入定價,同時保留了 90% 的快取讀取折扣,此資訊來自 @ArtificialAnlys。
OpenAI 將這個系列模型定位為一個性價比階梯:Sol 是旗艦/最高上限的模型,Terra 提供類似 GPT-5.5 的能力但成本更低,Luna 則是速度最快/成本最低的大量處理選項,此資訊來自 @OpenAIDevs。
這次發表還包含多項重要的應用層變革:ChatGPT Work,一個結合 Codex 和 ChatGPT 的全新桌面應用程式;Sites beta;程式化工具呼叫功能;以及 Responses API 中的多代理(multi-agent)測試版,這些資訊來自 @OpenAI 和 @OpenAIDevs。
OpenAI 的官方訊息強調了強大的代理/程式碼生成效能、更好的成果品質以及改進的經濟效益。Sam Altman 在發表文章中稱其為「顯然是我們生產過最好的模型」,並附上發布部落格連結,此資訊來自 @sama。Altman 也強調了企業經濟效益:「5.6 Sol 在每任務成本方面邁出了一大步」,此資訊同樣來自 @sama。
Greg Brockman 表示,目標是「任何目標效能水準下的最佳價格」以及最高的上限,此資訊來自 @gdb。
OpenAI 聲稱 GPT-5.6 Sol 在 Agents’ Last Exam 中創下 53.6 的新高分,以 13.1 分擊敗 Claude Fable 5 adaptive;在中等推理能力下,它以約四分之一的估計成本擊敗 Fable 11.4 分,而 Terra 和 Luna 也以約十六分之一的成本超越 Fable,此資訊來自 @OpenAI。
OpenAI 表示,GPT-5.6 提升了簡報、文件和試算表等成果的品質,其輸出可匯出到現有的企業工具中,此資訊來自 @OpenAI。
OpenAI 將 GPT-5.6 定位為處理複雜任務推理以及在 ChatGPT Work 內部根據模板、參考檔案和偏好風格生成材料的最先進模型,此資訊來自 @OpenAI。OpenAI 還表示,GPT-5.6 是其在網路安全和生物相關任務上能力最強的模型,某些 API 呼叫在雙重用途領域可能會被阻止或暫停以進行額外的安全審查,此資訊來自 @OpenAIDevs。
OpenAI 強調了其在電腦使用方面的更佳效能:速度更快、token 效率更高、支援多步驟任務中的批次處理和平行操作,以及畫中畫(picture-in-picture)監控功能,此資訊來自 @OpenAIDevs。
獨立評估普遍將 Sol 定位為接近或達到前沿水準,尤其是在程式碼代理工作負載方面,但也提出了一些注意事項。@ArtificialAnlys 報導指出,GPT-5.6 Sol (max) 在其智慧指數(Intelligence Index)上獲得 59 分,比 Claude Fable 5 (max) 低 1 分,但每任務成本約為 Fable 的三分之一。
在相同的分析中,Terra 和 Luna 在智慧指數上分別獲得 55 和 51 分,其每任務成本比 Sol 分別低約 50% 和 80%,此資訊來自 @ArtificialAnlys。Artificial Analysis 表示,Sol 在程式碼代理指數(Coding Agent Index)上以 80 分領先,超越 Fable 5 和 Opus 4.8,並且在他們的測試中,Sol 的每任務成本也比兩者都低,此資訊來自 @ArtificialAnlys。
它還指出,Sol 定義了智慧與輸出 token 的新帕累托前沿(Pareto frontier),而 Terra 和 Luna 則不在該前沿上,此資訊來自 @ArtificialAnlys。Artificial Analysis 發現 GPT-5.6 在 AA-Omniscience 方面比 GPT-5.5 有輕微改進,但幻覺率高於 GPT-5.5 max,此資訊來自 @ArtificialAnlys。
它報導了與 Claude Fable 5 相似的 GDPval-AA v2 效能,表明在經濟價值任務上具有可比的能力,此資訊來自 @ArtificialAnlys。
@ValsAI 將 GPT-5.6 在 Vals Index 和 Vals Multimodal Index 上排名第二,表示 Fable 5 在多個基準測試中仍領先,但 GPT-5.6「顯然屬於同一級別」。Vals 還表示,Sol 在 CyberBench 和 Excel Modeling Benchmark 上排名第一,並在 Legal Research Bench、ProofBench、SWE-bench 和 Terminal-Bench 2.1 上也位居榜首,同時補充說 Fable 在 CyberBench 上幾乎有 100% 的拒絕率,此資訊來自 @ValsAI。
@arcprize 表示,GPT-5.6 Sol 在 ARC-AGI-3 上獲得 7.8% 的分數,是第一個成功擊敗 ARC-AGI-3 遊戲的經過驗證的前沿模型。@GregKamradt 指出在 ARC-AGI-2 上達到 92.5%,稱其為最先進(SOTA),同時成本比三個月前的 GPT-5.5 Pro 低一個數量級。
@ArtificialAnlys 後來報導,GPT-5.6 Sol (max) 在 CritPt(一個未發表研究級物理問題的基準測試)上領先 Claude Fable 5 約 4 分。
@llama_index 表示,ParseBench 的首日結果顯示 GPT-5.6 在處理文字和表格方面表現良好,但在圖表和版面配置上仍有不足,並且 Luna 比 Sol 便宜約 6 倍,而性能下降幅度輕微。@jerryjliu0 也表示,ParseBench 顯示 GPT-5.6 在表格/文字/圖表/版面配置方面與 GPT-5.5 相比沒有高層次的變化,強調在複雜文字版面、圖表轉錄和來源元素邊界框方面存在持續的弱點。
GPT-5.6 的技術核心不僅在於其原始能力,更在於推理編排和 token 效率。OpenAI 推出了三個模型層級,並提供多種推理努力程度;用戶討論了 Light、Medium、High、Extra High、Ultra 等設定,形成了一個龐大的配置矩陣,此資訊來自 @rasbt。
OpenAI 在 Responses API 中增加了程式化工具呼叫(Programmatic Tool Calling)和多代理(Multi-agent)測試版功能,這表明對協調工具使用和代理分解提供了更明確的支援,此資訊來自 @OpenAIDevs。根據 @sama 和 @gdb 的說法,OpenAI 的應用層現在以 Codex 作為新 Work 產品的核心。
多篇文章強調平行代理/子代理是主要的效能槓桿;@aidan_mclau 明確提到用戶可以增加 5.6 子代理的數量。@LiorOnAI 總結了可能的驅動因素包括自適應推理、平行代理、程式化工具使用和更高的 token 效率。
Artificial Analysis 報導稱,Sol max 在每個智慧指數任務中約使用 15k 輸出 token,而 GPT-5.5 為 16k,並且在可比的智慧水準下,比 Opus 4.8、GLM-5.2 和 Gemini 3.5 Flash 使用更少的 token,此資訊來自 @ArtificialAnlys。
@OpenRouter 表示,早期測試發現 5.6 模型在 token 效率上更高,降低了成本和任務完成時間。
桌面/應用程式層帶來了 Chrome 擴充功能、改進的應用程式內瀏覽器、經過驗證的網站、持久的多分頁會話、檔案下載以及更緊密的跨裝置交接功能,此資訊來自 @OpenAIDevs。Sites 進入付費用戶測試版,為 GPT 建立的應用程式提供託管、儲存和可選的身份驗證功能,此資訊來自 @OpenAIDevs。
這是這次發表中最具爭議的技術聲明,但其解釋幾乎立即引發了討論。多個帳號轉發了 OpenAI 聲稱 GPT-5.6 Sol 自主後續訓練(post-trained)了 GPT-5.6 Luna 的說法,此資訊來自 @scaling01、@tejalpatwardhan 和 @dejavucoder。
這項聲明引發了關於 RSI(遞歸式自我改進)/自動化研究的猜測;@tenobrus 表示,如果屬實,這將是自動化研究時間表上「相當大的更新」。
@eliebakouch 將其描述為 OpenAI 要求 Sol「使用 10 萬個 GPU」來後續訓練 Luna 進行實驗。@gdb 表示,其對加速工程工作流程的影響很容易被忽視,並強調 OpenAI 希望這被視為不僅僅是行銷花招。然而,質疑的澄清很快浮現:@nikolaj2030 詢問這是否真的意味著 Sol 完成了一個小型受控的後續訓練任務,修改配置、編輯排程檔案並啟動運行,而不是對 Luna 進行端到端的真實世界後續訓練。
@nrehiew_ 也以類似方式解讀了截圖:Sol 可以從高層次想法到編輯配置和啟動實驗,但並非完全擁有 Luna 的端到端後續訓練。@scaling01 認為,可能發生的情況是模型在現有的 OpenAI 強化學習基礎設施之上實施了「LLM 作為評審」的評分器、獎勵塑造邏輯或小型訓練配置,而不是自主的端到端研究或訓練系統。
@scaling01 明確表示,我們應該將這些聲明與字面意義上的自主端到端後續訓練或研究區分開來,因為模型目前仍無法做到這一點。為了平衡這種質疑,@aidan_mclau 表示,他讓 5.6 端到端執行整個強化學習運行是常規操作,這表明即使不是完全自主的研究,也存在有意義的內部工作流程自動化。
技術觀察者普遍的共識並非 Sol 獨立發明和訓練了 Luna,而是 GPT-5.6 現在可能能夠在成熟的內部基礎設施中執行模型改進工作流程中重要的部分。OpenAI 還利用內部使用數據來證明 GPT-5.6 顯著改變了研究人員的產出。@scaling01 強調 OpenAI 聲稱自今年年初以來,每位研究人員的實驗產出翻了一倍。
@eliebakouch 引用 OpenAI 的話說,活躍研究人員的平均每日輸出 token 量是 GPT-5.5 內部測試期間最高水準的兩倍多。@eliebakouch 轉述的另一項 OpenAI 數據顯示,在六個月內,用於內部程式碼推理的研究運算份額增長了 100 倍,而內部代理 token 使用量增加了約 22 倍。
@FakePsyho 將這些發展與 OpenAI 在頂級程式設計競賽中的表現聯繫起來,描述接近 GPT-5.6 加上客製化工具的系統,如何決定性地擊敗了頂尖的人類競爭者。
這進一步推動了更廣泛的 RSI/自動化研究討論,特別是那些將長期程式碼生成和啟發式優化視為模型改進能力代理指標的人。這次模型發表也同時是產品策略的重新定位:OpenAI 正從「聊天機器人」轉型為「工作作業系統」(work OS)。
OpenAI 推出了 ChatGPT Work,這是一個由 Codex + GPT-5.6 驅動的代理,能夠跨應用程式和檔案執行操作,持續處理任務數小時,並將目標轉化為完成的工作,此資訊來自 @OpenAI。Work 可以從文件、Slack、Notion、Microsoft 365 和 Google Drive 中獲取上下文,並生成簡報、文件、試算表、儀表板和視覺化內容。


