2026 年 9 月 22 日

昨天是 Grok 4.7 (pelicans) 和 MiMo v2.6 Flash/Pro (更多 pelicans) 的發布。今天 Anthropic 推出了 Claude Opus 5.5,大約一小時後 OpenAI 也發布了 GPT-6 Sol 和 GPT-6 Luna。雖然需要一些時間才能全面了解這些新模型,但這是到目前為止我的初步印象。

GPT-6 Sol 和 Luna 的價格是其 GPT-5.6 對應版本的一半。GPT-5.6 Luna 已經是我最喜歡用於應用程式的模型,因為它兼具卓越性能和極低價格。令人驚訝的是,GPT-6 Luna 的價格又比它便宜了一半,而 GPT-6 Sol 相較於 GPT-5.6 Sol 也有類似的降幅。

以下是今天的價格格局:其中,GPT-6 Luna 的輸入價格為每百萬權杖 $0.10,輸出為 $0.50,而其前身 GPT-5.6 Luna 則為 $0.20/$1.20。Grok 4.7 的價格是 $2/$6。GPT-6 Sol 的輸入價格為 $2,輸出為 $10,與 GPT-5.6 Terra 相同,而 Claude Opus 5.5 則為 $4/$20,與 GPT-5.6 Sol 舊價相同。

最高階的 GPT-6 Astra 和 Claude Fable 5.1 則均為 $10/$50。

請注意,GPT-5.6 預計在 11 月漲價 25%,因此 GPT-6 的價格是這些模型促銷價格的一半。(GPT-5.6 Terra 的定價與 GPT-6 Sol 相同,這使得使用 Terra 的任何理由都消失了。)

這種競爭性定價的影響難以言喻。Grok 4.7 的定價為 $2/$6,不到 GPT-5.6 Sol 價格的一半,但現在與 GPT-6 Sol 的輸入價格相同,輸出價格也更接近。GPT-6 Luna 以 $0.10/$0.50 的價格成為 OpenAI 迄今發布的最便宜模型之一,僅次於性能更弱的 GPT-4.1 Nano ($0.10/$0.40,2025 年 4 月) 和 GPT-5 Nano ($0.05/$0.40,2025 年 8 月)。

我為 GPT-6 Luna 和 GPT-6 Sol 渲染了 pelicans 圖像,然後將它們與 GPT-5.6 的 pelicans 圖像一起放入比較網格中。我喜歡你可以立即看出 5.6 系列選擇了更大膽、更明亮的顏色,而 6 系列則更為柔和。我仍然認為 GPT-6 Astra 在最高設定下產生了最好的 pelican 圖像。

Claude Opus 5.5 也進行了降價。Opus 5.5 似乎解決了人們對 Opus 在溝通風格方面最大的抱怨。Thariq Shihipar 表示:「Opus 5.5 是根據您的回饋而誕生的。它溝通清晰,每個權杖的成本比 Opus 5.0 更便宜,同時擁有 Fable 5.1 的智慧,權杖效率非常高,並且適用於各種努力程度。」

它在 Blender 方面的表現也據說更好。我期待著測試它的實際性能。Opus 4.5、4.6、4.7、4.8 和 5 都共享相同的價格:輸入每百萬權杖 $5,輸出每百萬權杖 $25。5.5 版本降價了 20%,變為輸入每百萬權杖 $4,輸出每百萬權杖 $20。

快取讀取的價格下降了 60%。這對於較長的代理式對話來說意義重大,因為其中 90% 以上的輸入權杖都是以快取權杖的價格處理的。Opus 5.5 的新價格與 GPT-5.6 Sol 的價格相同,但這是 OpenAI 將 Sol 價格砍半之前的定價。

GPT-6 Astra 和 Claude Fable 5.1 的定價都是輸入每百萬權杖 $10,輸出每百萬權杖 $50。目前的價格戰影響的是次一級的模型。Anthropic 表示 Sonnet 5.5 和 Haiku 5.5 即將推出。考慮到目前的 Haiku 4.5 是 $1/$5,而最新的 GPT-6 Luna 僅為其十分之一的價格 $0.10/$0.50,Haiku 能否在低階市場重拾價格競爭力將會很有趣。

Claude Opus 5.5 在「最大」思考模式下過度思考導致崩潰。在我的「生成一隻騎自行車的 pelican 的 SVG」測試中,Claude Opus 5.5 在「最大」思考模式下未能返回回應!它一開始稱這是「一個經典的測試請求」,然後非常、非常努力地思考它正在做什麼:

這是一個經典的測試請求,所以我打算規劃一隻構圖精良的 pelican,擁有其獨特的喙和喉囊,騎著一輛帶有正確車輪、車架和踏板的自行車,背景是簡單的天空和地面。[...] 驗證脛骨長度約為 95.2,足夠接近。現在我正在計算從臀部到膝蓋到腳踝的近腿路徑,然後勾勒出腳放在踏板上的形狀,使用線條和曲線勾勒出腳跟、腳趾尖和鞋底輪廓的路徑,使其自然地落在 y=478-494 附近的踏板表面上。

[...] 我喜歡魚突出地從籃子裡伸出來,pelican 盯著它,這是一個值得保留的有趣細節。我也確認了眼睛位置靠近喙基部符合典型的 pelican 解剖結構,並考慮給它一個稍微快樂的表情。[...] 遠腿正確地顯示為從車架後面經過,所以我正在檢查鏈輪齒並確認圖層順序,遠曲柄臂應該大部分被座管和鏈輪遮擋。

我正在確定最終 SVG 的寬度和高度屬性以及 viewBox,以確保正確縮放,並注意到沒有文字,因此不需要字體系列。[...]

我非常期待看到這隻 pelican... 但它卻停了下來。Opus 5.5 的最大輸出權杖限制為 128,000(其他 Claude 模型也是如此),它在推理 SVG 時就達到了這個限制!我第二次嘗試也得到了相同的結果。這讓我覺得「最大」模式實際上毫無用處,如果它在一個簡單的 SVG 提示詞上都會過度思考到崩潰,我不會相信它在處理更有趣的工作時不會這樣做。

(這兩次失敗每次都花了我 $2.56,耗時近 20 分鐘。)Fable 5.1 在「最大」模式下沒有過度思考,並給了我從任何 Anthropic 模型中見過最好的 pelican 圖像。這是 Opus 5.5 的 pelicans 圖像,不包括 5.5 最大模式。我還建立了一個比較網格,將它們與 Opus 5、Fable 5.1 和 Sonnet 5 的 pelicans 圖像進行比較:

現在,通過比較不同模型供應商繪製騎自行車的 pelican 的能力來判斷它們的優劣可能沒有太大意義(如果曾經有過的話),但我仍然發現使用它們來比較同一模型家族在不同推理水平下的表現很有價值。我現在在 Codex 和 Claude Code 中將 GPT-6 Sol 和 Claude Opus 5.5 作為我的預設模型。

我已將 agent.datasette.io 上的 Datasette Agent 演示升級為使用 GPT-6 Luna,它在 SQL 查詢以及為 Datasette Apps 構建 HTML 和 JavaScript 方面似乎既快速又稱職。