在有限預覽後,我們正式推出 GPT-5.6 系列模型,供大眾使用。這個系列包括我們的全新旗艦模型 Sol,以及適用於日常工作的平衡模型 Terra,和最具成本效益的模型 Luna。
GPT-5.6 Sol 在智慧和效率方面樹立了新標準,在程式編碼、知識工作、網路安全和科學等領域取得了最先進的成果。它以更少的代幣和更低的預估成本,超越了先前及競爭的尖端模型。
這意味著每單位花費能獲得更強大的效能:以相同的預算完成更多工作,或以更低的總成本獲得相似的結果。我們還推出了一種加速最嚴苛工作的新方式:ultra 是我們最高能力的設定,它能協調多個代理程式在平行工作流中,更快地完成複雜任務。
更強大的電腦使用能力和設計判斷力,使 GPT-5.6 Sol 成為我們迄今最完善的協作者,幫助它檢查、精煉並交付可立即使用的成果。
我們訓練 GPT-5.6 以從每個代幣中獲得更多有用的工作。在「代理程式期末考」(Agents’ Last Exam)這項評估 55 個領域中長期專業工作流程的測試中,GPT-5.6 Sol 創下 53.6 的新高,超越 Claude Fable 5(自適應推理)13.1 分。
即使在中等推理能力下,它也以約四分之一的預估成本擊敗 Fable 5 達 11.4 分。這種效率也延伸到較小的模型,這對於使智慧更普及和更實惠至關重要:GPT-5.6 Terra 和 GPT-5.6 Luna 以約十六分之一的成本超越 Fable 5。
在「人工分析智慧指數」(Artificial Analysis Intelligence Index)這項衡量代理工作、程式編碼、科學推理和一般能力的廣泛指標中,GPT-5.6 Sol 在最大推理能力下,與 Fable 5 僅差一分,同時以約一半的預估成本,在 61% 更短的時間內完成任務。
GPT-5.6 推出時配備了我們迄今最堅固的防護措施,旨在有效抵禦惡意且具適應性的濫用,同時不廣泛限制合法工作。在全面上市之前,我們對模型和防護措施進行了迄今最廣泛的評估期,結合了人工紅隊測試和大規模自動化測試。
在預覽期間,我們與專業組織和值得信賴的合作夥伴密切合作,對防禦措施進行壓力測試,並在更廣泛推出前加強防護。最終的系統將模型中訓練的保護層與即時檢查、監控以及根據信任和風險校準的存取權限結合起來。
GPT-5.6 Sol 是我們迄今為止最好的程式編碼模型。在「人工分析程式編碼代理指數」(Artificial Analysis Coding Agent Index)上,GPT-5.6 Sol 在最大推理能力下創下 80 的新高,比 Fable 5 高出 2.8 分,同時使用的輸出代幣少於一半,耗時少於一半,成本約減少三分之一。
這項優勢延伸到整個系列:Terra 的表現略高於 Fable 5,而 Luna 則超越 Opus 4.8;每個模型都以約三分之一的時間、約一半的輸出代幣和約四分之一的預估成本完成任務。它還在 Terminal-Bench 2.1 和 DeepSWE 上創下新的最先進成果,這些測試評估複雜的命令列工作流程和真實程式碼庫中的長期工程。
「人工分析程式編碼代理指數」是一個獨立的程式編碼代理效能指數,涵蓋實作、終端機使用和真實程式碼庫。
GPT-5.6 可以編寫和執行輕量級程式,這些程式能夠協調工具、處理中間結果、監控進度並在工作展開時選擇下一步行動。這使得需要大量工具的任務能以更少的代幣、更少的模型往返次數和更少的指導來推進。
Responses API 中的「程式化工具呼叫」(Programmatic Tool Calling)無需開發人員編寫每個步驟的腳本,或將每個工具回應傳回模型,而是可以過濾大量中間資料,僅保留重要內容,並在過程中調整其工作流程。對於需要投入更多時間和運算資源的問題,GPT-5.6 可以超越這個高效的預設設定。
「max」設定讓 GPT-5.6 比「xhigh」有更多的時間進行推理和探索替代方案、執行檢查並修改其方法。「ultra」更進一步,預設情況下協調四個代理程式平行工作,以更高的代幣使用量換取在嚴苛任務中更強大的結果和更快的完成時間。
下圖比較了 ultra 的預設四代理程式設定與單代理程式基準在 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 上的表現;BrowseComp 和 SEC-Bench Pro 也顯示了 16 代理程式的配置。
在所有三項評估中,增加平行代理程式將分數-延遲曲線向上和向左移動,在更短的時間內達到更強大的結果。在 API 中,開發人員可以使用 Responses API 中的多代理程式測試版來建立類似 ultra 的體驗。
GPT-5.6 在設計判斷力方面實現了質的飛躍。只需高層次的指示,GPT-5.6 就能創建出雅緻、符合人體工學且功能強大的介面。其更強大的電腦使用能力使其能夠檢查和精煉渲染結果,而不僅僅是生成底層程式碼或內容。
因此,它可以在交回工作之前發現視覺和功能問題並進行最終潤飾。GPT-5.6 的前端能力還能將自然語言請求轉化為 ChatGPT Work 中精美的互動式解釋和視覺化內容。
GPT-5.6 為專業任務提供了更好的結果。它能從您的文件和日常工作流程(如 Slack、Notion、Microsoft 365 和 Google Drive)中獲取雜亂的上下文,並將其轉換為專家級、可共享的成果。
GPT-5.6 在知識工作方面的實力體現在涵蓋長期專業分析、瀏覽、工具使用和電腦使用的評估中。GPT-5.6 Sol 在 BrowseComp 上創下 92.2% 的新高,在 OSWorld 2.0 上創下 62.6% 的新高;在 OSWorld 上,它超越了 Opus 4.8,同時使用的輸出代幣減少了 85%。
在這裡,每單位花費的效能提升延伸到整個 GPT-5.6 系列。Luna 以不到一半的預估成本幾乎達到 GPT-5.5 的峰值效能,而 Terra 則以更低的成本超越了它。
BrowseComp:GPT-5.6 Sol 在 BrowseComp 上取得了新的最先進成果,該測試包含代理瀏覽任務。
GPT-5.6 Sol 提高了簡報、文件和試算表的品質,產生了更精美、更準確的輸出。它可以從零開始創建完全可編輯的簡報,將提示詞和來源材料轉化為具有強大佈局、層次結構和設計的連貫視覺敘事。
當遵循模板和參考簡報時,這種改進尤為明顯。GPT-5.6 可以推斷簡報的設計系統,佈局、排版、間距、顏色和重複的內容模式,包括嵌入在投影片母版中的規則,並將這些慣例一致地應用於新材料。
在這個例子中,當被要求根據參考文件更新數字時,GPT-5.5 的輸出缺少母版投影片中的關鍵組件,而 GPT-5.6 更忠實地遵循了參考結構。
GPT-5.6 還能創建更精美的文件和試算表。它更忠實地遵循複雜的參考格式,這對於可重複的知識工作活動非常重要。它能更精確地處理方程式和財務模型,並更好地利用排版、間距、層次結構以及頁面或工作表佈局。
早期測試 GPT-5.6 的客戶發現知識工作輸出在各領域都有所改進。
GPT-5.6 是我們迄今最強大的網路安全模型,以顯著更少的代幣實現了尖端效能。在 ExploitBench2 上,該測試衡量從達到易受攻擊程式碼到任意程式碼執行的進度,它得分 73.5%,而 GPT-5.5 在相似的輸出代幣預算下為 47.9%。
在 ExploitGym3 上,該測試要求代理程式將真實世界的漏洞轉化為可運行的漏洞利用程式,它幾乎使 GPT-5.5 的峰值通過率翻倍,在兩小時限制內從 15.1% 提高到 24.9%;在六小時內,它達到 33.7%。
在 SEC-Bench Pro 上,該測試評估複雜軟體上的概念驗證生成,它得分 71.2%,而 GPT-5.5 在改進的延遲下為 45.8%。GPT-5.6 支援重要的防禦任務,例如安全程式碼審查、修補、威脅建模和藍隊作業。
OpenAI Daybreak 網路安全信任存取計畫中符合資格的個人和組織,可以透過更精確的防護措施,在授權環境中進行驗證工作,以存取其更多的防禦能力,包括漏洞分類和驗證、惡意軟體分析、檢測工程和修補驗證。
ExploitBench:逐步建立更強大的 V8 漏洞利用程式;GPT-5.6 相較於 GPT-5.5 有顯著提升。此基準測試的延遲估計不可靠,因此未顯示延遲圖表。
GPT-5.6 Sol 在科學研究方面也顯示出廣泛的進步。在生命科學評估中,GPT-5.6 在真實世界的生物學、生命科學研究工作流程和化學方面,相較於 GPT-5.5 展現了 Pareto 改善。
GeneBench Pro:長期基因組學和定量生物學分析;GPT-5.6 以更少的代幣和更少的時間達到更強大的結果。Claude Fable 5 未包含在內,因為它不回答進階生物學問題,並拒絕了此評估中的大多數問題。
GPT-5.6 是我們迄今為止加速 AI 研究最強大的模型。在 OpenAI 內部,研究人員在整個開發循環中使用它:診斷故障、優化訓練系統、運行實驗和解釋結果。我們在 GPT-5.6 的內部測試期間已經看到了這種加速和更強的採用。
平均而言,每位活躍研究人員的每日輸出代幣量是 GPT-5.5 觀察到的最高水平的兩倍多。這種工作方式正迅速成為標準。在過去六個月中,用於內部程式編碼推論的研究運算份額增長了 100 倍,而內部代理代幣使用量約增長了 22 倍。
這些採用指標本身並不能衡量研究進度,但它們顯示了 AI 輔助在研究以及銷售、行銷、使用者營運、財務等其他團隊中增長的速度有多快。為了直接衡量這種能力,我們開發了一套基於真實 AI 研究任務的內部評估套件,包括調試研究系統、優化核心和訓練配方、運行機器學習實驗以及改進另一個模型。
綜合 RSI 能力:在一系列衡量遞歸自我改進進度的評估中,我們觀察到 GPT-5.6 Sol 相較於 GPT-5.5 有 16.2 分的改進,全面加速了內部研究。
隨著模型能力的提升,我們加強了安全堆疊,以便先進智慧能夠保持廣泛有用,同時對高風險用途施加更嚴格的審查。對於 GPT-5.6,我們建立了迄今為止最堅固的安全系統,根據每個模型的能力進行校準,並由比以往任何時候都更多的運算能力提供支援。
GPT-5.6 模型在生物學和網路安全方面都比我們早期的模型更強大,但在這兩個類別中都沒有跨越「關鍵」閾值。在網路安全方面,我們的測試表明 GPT-5.6 更擅長發現和修復漏洞,而不是可靠地對強化目標執行自主的端到端攻擊,這為防禦者提供了在漏洞被利用之前加強系統的機會。
在生物學方面,我們的測試表明 GPT-5.6 可以支援合法研究,但未提供創建、工程或合成高度危險新型威脅所需的端到端能力。這兩個領域本質上都是雙重用途的。在網路安全中,可以幫助攻擊者利用漏洞的相同能力,也可以幫助防禦者找到它、重現它並建立可靠的修復方案。
因此,過度阻擋本身會產生安全風險。它可能會阻止防禦者測試系統和部署補丁,而惡意行為者則繼續使用其他模型,包括越來越強大的開源模型以及既有工具。有效的防護措施會考慮上下文和可能性。



