OpenAI 正式推出 GPT-6.1 Sol,這是 GPT-6 Sol 的升級版。它在代理式程式碼撰寫、電腦操作和專業工作方面的智慧程度,幾乎與 GPT-6 Astra 匹敵,但標準輸入和輸出 token 價格僅為 Astra 的五分之一。

快取輸入的成本僅為每百萬 token 0.10 美元,比標準輸入價格便宜 95%,也比 GPT-6 Sol 的快取輸入價格低 50%。這讓開發者有更多空間來建構和運行能夠跨請求重複使用上下文的強大代理。

GPT-6.1 Sol 在多項任務中展現更強大的能力,為重要的日常工作提供了能力與成本之間的新平衡。它在複雜的專業任務上,從撰寫和偵錯程式碼到理解文件和執行多步驟商業工作流程,都比 GPT-6 Sol 有顯著提升。

在多項評估中,GPT-6.1 Sol 以大幅降低的成本,接近 GPT-6 Astra 的效能表現。

在 DeepSWE v1.1 基準測試中,該測試評估實際程式碼庫中的複雜軟體工程任務,GPT-6.1 Sol 以大約五分之一的成本,達到與 GPT-6 Astra 相同的表現。同時,它在較低的推理工作量和成本下,超越了 GPT-6 Sol 的最佳分數 6.4 個百分點。

在 GDP.pdf 測試中,該測試衡量模型使用包含表格、圖表、示意圖和細節文字的複雜 PDF 文件,回答專業問題的準確性。在所有測試的推理設定下,GPT-6.1 Sol 的得分高於 Opus 5.5 搭配備援機制,且每項任務的成本不到其一半。

它也以大約五分之一的每項任務成本,接近 GPT-6 Astra 最先進的效能。在 GDP.pdf 中,模型必須回答來自金融、醫療保健、法律以及其他七個專業領域的複雜 PDF 文件相關的真實世界提示。

在 AutomationBench 測試中,該測試衡量代理是否能正確完成多步驟商業工作流程。在中等推理工作量下,GPT-6.1 Sol 的得分比 Opus 5.5 高出 2.2 個百分點,成本約為其三分之一。

在相同的設定下,該分數也比 GPT-6 Sol 提高了 4.8 個百分點。AutomationBench 1.0.6 測試 AI 代理在銷售、行銷、營運、支援、財務和人資等領域,使用 47 種工具執行端到端工作流程。Claude Fable 5.1 的數據低估了其實際成本,因為它省略了約 40% 任務中發生的備援成本。

GPT-6.1 Sol 在需要與電腦應用程式互動的任務上也取得了顯著進展。在 OSWorld 2.0 的離線資料集上,該資料集評估代理在要求嚴苛的電腦使用工作流程中的表現,GPT-6.1 Sol 在最大推理工作量下,以不到一半的成本,超越 GPT-6 Sol 七個百分點。

它在最大推理工作量下,與 Astra 的分數僅差 2.1 個百分點,而每項任務的成本約為其七分之一。

在 Terminal-Bench Science 0.1 測試中,該測試評估包括資料分析、模擬和定理證明在內的科學工作流程。GPT-6.1 Sol 在最大推理工作量下,以不到一半的每項任務成本,將 GPT-6 Sol 的分數提高了一倍以上。

在最大努力下,GPT-6.1 Sol 的平均每項任務成本為 5.47 美元,而 Opus 5.5 為 23.21 美元,Astra 為 23.80 美元,以超過 75% 的低成本提供了強大的科學能力。GPT-6 Astra 在所有測試模型中仍以 68.1% 的分數位居榜首,應適用於最困難的科學研究任務。

GPT-6.1 Sol 也提升了在困難提示下的事實準確性。它相較於 GPT-6 Sol 最大的事實準確性改進,體現在低推理工作量時,將包含事實錯誤的回應比例從 11.4% 降低到 7.7%,約減少了 32%。

在所有測試的推理設定下,其錯誤率與 GPT-6 Astra 僅差 1.9 個百分點以內,而每項任務的成本不到其五分之一。此評估衡量的是在使用者標記了先前模型錯誤的去識別化對話中,包含至少一個事實錯誤的答案比例。這些刻意設計的困難提示並不代表典型使用情況。

在我們的對齊評估中,GPT-6.1 Sol 相較於 GPT-6 Sol 有了顯著改進,使其更接近 GPT-6 Astra。GPT-6.1 Sol 對於其限制更具透明度,並且在尊重使用者意圖和安全限制方面更為可靠。

在具挑戰性的評估中,它在關於損壞搜尋工具的透明度、尊重明確限制以及在代理任務中避免未經授權的結果方面,顯示出比 GPT-6 Sol 更低的失敗率。我們沒有觀察到任何繞過自動安全審查員的嘗試,這與 GPT-6 Astra 和 GPT-6 Sol 的表現一致。完整細節可在 GPT-6.1 Sol 系統卡附錄中找到。這些評估是刻意測試具挑戰性的情況,並不衡量典型使用中的失敗率。

GPT-6.1 Sol 即日起開放給所有 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用戶使用。GPT-6.1 Sol 尚未在 Chat 中提供。

開發者也可以透過 OpenAI API 以 gpt-6.1-sol 的名稱存取它。其標準 API 價格為每百萬輸入 token 2 美元,每百萬快取輸入 token 0.10 美元,以及每百萬輸出 token 10 美元。在未來幾天內,我們還將推出 GPT-6.1 Sol Ultrafast,其 token 生成速度比 Codex 中的標準速度快上 8 倍。