OpenAI 今日正式推出其最新大型語言模型 GPT-6 Astra,目前已向部分組織開放,並將在未來幾天內陸續提供給所有 ChatGPT Plus、Pro、Business 和 Enterprise 用戶,同時也將透過 OpenAI API 和 AWS 平台提供。

作者表示尚未親自試用,因此暫無太多評論。

GPT-6 Astra 的 API 定價將與 Claude Fable 5 和 5.1 相同,輸入每百萬 token 收費 10 美元,輸出每百萬 token 收費 50 美元。這顯然是 OpenAI 用來與 Claude Fable 競爭的產品,根據 OpenAI 自行報告的基準測試,Astra 在大多數項目上都超越了 Fable。

最令人印象深刻的是,Astra 在最近(三月發布)的 ARC-AGI 3 基準測試中取得了 99.9% 的高分。然而值得注意的是,Fable 5 尚未公布其結果,且 ARC-AGI 部落格指出,Astra 的 99.9% 分數是使用 OpenAI 客製化的「Provider Adapter harness」以 19,000 美元的成本達成,而使用預設的 ARC-AGI harness 則以 26,000 美元獲得 62.7% 的分數。

這個 Provider Adapter harness 能夠在請求之間保留不透明的推理狀態,並對較長的對話進行壓縮,讓模型可以重複利用之前的工作成果。

鑑於近期 Hugging Face 事件,Astra 在安全任務方面的表現毫不意外地非常出色。它在 ExploitBench 上獲得 100%(GPT-5.6 Sol 為 78.5%),在 ExploitGym 上獲得 42.4%(Sol 為 30.3%),並在 SRE-Bench 二進位逆向工程測試中,四次嘗試內達到 99.2% 的分數,遠高於 Sol 的 68.7%。

Astra 在長上下文處理方面也表現更佳:在 OpenAI 的八針基準測試中,它在 256K 至 512K token 範圍內達到 100%,在 512K 至 1M token 範圍內達到 96.3%。OpenAI 可能已經克服了長上下文處理中一個持續存在的挑戰。

然而,它並非在所有方面都取得勝利。Artificial Analysis 指出,在他們的「智慧指數」(Intelligence Index)中,Astra 仍然被 Fable 超越。GPT-6 Astra 在該指數中與 GPT-5.6 Sol 並列 61 分,比 Claude Fable 5.1(含回溯機制時的最高分)低 5 分,也落後於 Meta 新發布的 Muse Spark 1.3(最高分)。

但在他們的「程式碼代理指數」(Coding Agent Index)中,Astra 表現更佳。在最大努力下,GPT-6 Astra 的成本與 GPT-5.6 Sol(最大努力)大致相同,但指數分數高出 2 分。就每個任務而言,該模型以相同的分數,成本不到 Claude Fable 5 的一半。

一旦作者獲得存取權限,將會撰寫更多關於 Astra 的文章。該模型推出後的 API 標籤將是 gpt-6-astra。