OpenAI 的新旗艦模型 GPT-5.6 Sol 宣稱在代理編碼方面領先 Anthropic 的 Claude Mythos,並在網路安全方面與之匹敵。目前,其存取權限仍僅限於少數合作夥伴。
OpenAI 發表了 GPT-5.6 Sol,這是一系列旨在與 Claude Mythos 系列競爭的新一代模型。應美國政府的明確指示,此有限預覽版僅透過 API 和 Codex 開放給選定的合作夥伴。此前,美國政府曾將 Anthropic 的 Mythos 級模型 Fable 5 下架。
OpenAI 對此不滿之情溢於言表。「我們不認為這種政府存取流程應該成為長期的預設模式。它讓使用者、開發者、企業、網路防禦者以及需要這些工具的全球合作夥伴無法使用到最好的工具。」
GPT-5.6 也帶來了新的分層命名方案,與 Claude 的命名方式非常相似。數字(x.6)代表世代,而 Sol、Terra 和 Luna 則是可獨立演進的永久性能層級。Sol 是旗艦模型,Terra 的性能與 GPT-5.5 相當但成本減半,Luna 則是預算選項。此外,還有用於更深層次推理的「max」模式,以及將複雜任務分配給平行運行的子代理的「ultra」模式。
Sol 在代理編碼方面超越 Claude Mythos
OpenAI 的基準測試數據顯示,Sol 在代理編碼方面領先 Anthropic 的 Claude Mythos 5。在 Terminal-Bench 2.1 上,Sol 獲得 88.8 分,Sol Ultra 達到 91.9 分,而 Claude Mythos 5 則為 88 分,Fable 5 以 84.3 分落後。
GPT-5.6 Sol Ultra 在 Terminal-Bench 2.1 編碼基準測試中以 91.9% 的成績位居榜首。Claude Mythos 5 獲得 88.0%,而 Google 的 Gemini 3.1 Pro Preview 則以 70.7% 墊底。
Sol 在生物學領域也展現了進步。在用於基因組學和定量生物學的 GeneBench v1 基準測試中,它擊敗了 GPT-5.5(最佳情況下為 30% 對 22%),同時消耗更少的 tokens。
OpenAI 表示,在 ExploitBench 測試中,Sol 在尋找和利用 Google V8 JavaScript 引擎中的真實安全漏洞並執行完整程式碼方面,其表現與 Mythos Preview 相當,但輸出 tokens 僅為後者的約三分之一。
在 ExploitBench 上,GPT-5.6 Sol 在約 150,000 個輸出 tokens 的情況下,與 Anthropic 的 Mythos Preview 表現相當。Mythos 5 仍以約 80% 的成績領先,但缺乏可比較的效率數據。
在 ExploitGym(由加州大學柏克萊分校研究人員與 OpenAI 及其他實驗室共同建立的基準測試)中,所有三款 GPT-5.6 模型都隨著推理工作的增加而表現更好。這表明透過更多運算資源進行擴展仍有空間。Claude 在此基準測試的數據尚未公布。
OpenAI 稱 Sol 是其迄今為止最強大的網路安全模型,但將其定位為防禦者而非攻擊者。該公司表示,該模型在發現和修復漏洞方面表現更佳,而非獨立執行完整的端到端攻擊。Mythos 在不同的基準測試中實現了這一點。
在對 Chromium 和 Firefox 的測試中,Sol 發現了錯誤和利用原語,但從未產生自主的完整鏈式漏洞利用。OpenAI 表示,GPT-5.6 Sol 在其「準備框架」(Preparedness Framework)中仍低於「網路關鍵」(Cyber Critical)門檻。
定價、可用性與七月在 Cerebras 上的發布
每百萬 tokens 的費用,OpenAI 對 Sol 收取輸入 $5 和輸出 $30,Terra 為輸入 $2.50 和輸出 $15,Luna 則為輸入 $1 和輸出 $6。該公司還改進了其提示詞快取系統,引入了明確的快取中斷點和至少 30 分鐘的保證生命週期。快取寫入的費用是常規輸入價格的 1.25 倍,而快取讀取仍享有 90% 的折扣。
由於 Sol 在多項基準測試中以更少的 tokens 達到或超越競爭對手,因此每項任務的實際成本可能低於前幾代模型。這將扭轉 AI 模型每次發布都變得更昂貴的趨勢(這是近期常見的批評),並彌補其相對於更便宜的中國模型的競爭劣勢。
Sol 預計將於七月在 Cerebras 上線,處理速度最高可達每秒 750 tokens。



