GPT-5.6 模型家族為 AI 代理的價格效能樹立了新標準,大幅降低了尖端代理效能的成本,同時也拓展了技術的可能性。本指南將展示新創公司如何運用更智慧的模型選擇以及新的 API 控制功能,例如推理連續性、多代理協調和程式化工具呼叫,以更低的成本打造出更快速、更強大的代理。
自 GPT-5 以來,每一代模型都致力於以更少的代幣處理更長程的任務。GPT-5.6 延續了這一趨勢:在底層框架幾乎不變的情況下,提供更強大的代理效能和更低的成本。整體成本效益的提升,還伴隨著在較低推理負擔下更高的準確度。例如,在 Agents’ Last Exam 測試中,GPT-5.6 Sol 在「低」推理設定下,表現優於 GPT-5.5 在「高」推理設定,且底層框架保持不變。
我們在實際生產測試中也看到了類似的成功案例,新創公司透過降低推理工作量,在各種工作流程中實現了顯著的成本改善。
在模型選擇方面,過去對於長程任務而言,升級到旗艦模型並使用最高的推理設定通常是最佳選擇。這主要是因為這些模型在處理較長上下文和工具呼叫方面,明顯優於成本最佳化模型。然而,GPT-5.6 家族改變了這一點:透過更多的測試時運算,Luna 和 Terra 通常能達到與 GPT-5.4 和 5.5 相似的效能,同時成本卻顯著降低。
以 BrowseComp 中的任務為例,這是一個基於搜尋的基準測試,旨在評估模型搜尋冷門事實的能力。三個月前,GPT-5.5 (Extra High) 在此基準測試中獲得 84.36% 的分數,總成本為 33.27 美元。而 GPT-5.6 Luna (Extra High) 推出時,以 1.33 美元的成本達到了幾乎相同的效能,得分為 84.04%。此後我們已進一步調降價格,您可以閱讀更多關於我們最新降價的資訊。
較小的 5.6 家族模型非常適合處理大量工作負載、對延遲敏感的互動,以及代理工作流程中的重複步驟。舉例來說,如果您經營一家法律科技新創公司,需要在代理分析之前解析手寫備忘錄,現在您可以改用 Terra 或 Luna 進行資料擷取,而不是為整個使用案例都採用尖端模型,從而實現顯著的成本節省。
除了讓 GPT-5.6 開箱即用時表現更佳,我們還為 Responses API 引入了新的基本功能,以釋放進一步的效能提升。我們透過三項互補的架構調整,對 GPT-5.6 進行了端到端訓練,使代理能夠更有效率地運作:
重複利用已完成的工作:透過允許推理在模型回合之間持久化,並使用原生壓縮來縮短長時間的對話,模型可以在更長的任務週期中保持工作的一致性,而不會混淆或需要重新建構先前的上下文。
適時的平行分解:使用原生的多代理協調功能,可以在多個平行工作流中協調多個代理,從而更快地完成複雜任務。
將確定性工作轉移到程式碼中:利用程式化工具呼叫功能,在模型上下文視窗之外過濾、彙總和編排工具輸出,將模型代幣保留用於判斷,從而降低成本、延遲並減少上下文腐蝕。
這些功能結合使用時,效果可能非常顯著。例如,在 ARC-AGI-3 測試中,GPT-5.6 Sol 在標準框架下得分為 13.3%。然而,在啟用保留推理和壓縮後,分數躍升至 38.3%,同時輸出代幣量減少了約 6 倍。模型本身沒有改變,但效能卻提升了近三倍。您可以點擊此處閱讀更多關於我們 ARC-AGI-3 框架調查的資訊。
程式化工具呼叫:代理工作流程通常涉及兩種工作:需要判斷的任務,以及主要涉及移動、過濾和組合資料的工作。當一個代理檢索 100 份文件,按日期過濾並識別相關交易時,模型不應在其上下文視窗中對每個中間結果進行推理。程式化工具呼叫讓 GPT-5.6 能夠編寫 JavaScript 來編排工具、平行執行獨立呼叫,並在上下文視窗之外處理其輸出。模型因此可以專注於需要智慧的任務:進行判斷。
多代理:在複雜且可平行處理的任務中,將行動和推理分派給多個代理工作流,可以加快任務完成速度並提升智慧。在這些設定中,主代理負責協調子代理並將任務委派給它們。子代理會平行地追求各自的目標,最終將其輸出傳回給主代理進行最終整合。團隊可以透過在 Responses API 中啟用多代理功能來原生利用多代理。這也是 ChatGPT 中「ultra」能力設定的運作方式。
儘管 GPT-5.6 對於適當的子代理數量以及何時生成它們有著很強的判斷力,但多代理行為仍具有高度可控性。指導模型何時呼叫子代理,可以提高僅在額外代幣支出能帶來更好效能的情況下才生成代理的可能性。
提示詞快取:在整個模型家族中,提示詞快取的存活時間 (TTL) 已延長至至少 30 分鐘,並且現在可以在模型的上下文視窗內確定性地設定快取斷點。這使得新創公司能夠顯著提高其快取命中率。
除了設定快取斷點之外,持續使用適當的 prompt_cache_key 可以增加請求落在與先前處理相同前綴的推理引擎上的可能性,從而降低延遲。
結論:從這些範例中可以看出,建構代理的經濟效益已發生巨大變化。過去在每個步驟都需要尖端模型的使用案例,現在可以透過使用較小的模型、調整推理工作量以及做出高效的架構選擇,以更低的成本實現相似或更優異的結果。我們期待看到各位的創新成果!



