一位參與 GPT-5.5 早期測試的 NVIDIA 工程師表示,失去它的感覺就像失去了一隻手臂。Every 執行長 Dan Shipper 稱其為第一個具有「嚴謹概念清晰度」的編程模型。Pietro Schirano 則觀察到它在約 20 分鐘內,一次性將數百個前端變更合併到一個也已大幅變動的主分支中。

這些並非隨意的印象,而是每天使用 AI 進行開發的人所發出的,他們聽起來確實感到驚訝。GPT-5.5 於 2026 年 4 月 23 日發布,而 Codex 則在一週前的 4 月 16 日獲得了大規模的桌面更新。OpenAI 在同一個月內發布了這兩項產品,網路為此瘋狂了約 48 小時,隨後抱怨聲也開始出現。

GPT-5.5 的實際面貌簡而言之,GPT-5.5 是 OpenAI 自 GPT-4.5 以來首次發布的全面重新訓練基礎模型。介於 4.5 和 5.5 之間的所有版本都只是增量更新,而這次是一個全新的基礎。

其基準測試結果表現強勁,在 Terminal-Bench 2.0 上達到 82.7%,OSWorld-Verified 上為 78.7%,SWE-Bench Pro 上為 58.6%,以及在 Expert-SWE(一個人類平均完成時間為 20 小時的內部評估)上達到 73.1%。然而,基準測試有時會說謊,所以更重要的是以下這些。

GPT-5.5 在相同的 Codex 任務上,比 GPT-5.4 少用了 40% 的 token。儘管它是一個更大、更智慧的模型,但其每 token 延遲與 GPT-5.4 相同。這絕非小事,而是真正能改變你工作方式的效率提升。

這個模型甚至協助建構了服務自身的基礎設施。OpenAI 利用 Codex 和 GPT-5.5 來優化其在 NVIDIA GB200 和 GB300 系統上的推論堆疊。其中一個成果是客製化的負載平衡啟發式演算法,將 token 生成速度提升了超過 20%。這是一個奇怪且遞迴的細節,大多數報導都忽略了。

Codex 桌面應用程式更新在 GPT-5.5 發布前一週,OpenAI 推出了一項重要的 Codex 更新,但因眾人都在等待新模型而幾乎未受關注。然而,這項更新的重要性超乎人們想像。

以下是變更內容:背景電腦使用功能,Codex 代理現在可以在背景看到你的螢幕,並用自己的游標點擊和輸入。多個代理可以在你的 Mac 上平行工作,而不會阻礙你自己的操作。

應用程式內瀏覽器功能,你可以在網頁上直接評論,為 Codex 提供精確指令,專為前端和遊戲開發迭代而設計。透過 gpt-image-1.5 進行圖像生成,可以在同一個工作流程中建立模型、遊戲素材和產品視覺效果。

記憶預覽功能,Codex 會記住之前會話中的偏好設定、修正和上下文。新增了 90 多個外掛程式,包括 Atlassian Rovo、CircleCI、GitLab Issues、Microsoft Suite、Neon、Render 等。支援 SSH 遠端開發盒,可以直接連接到遠端機器。自動排程功能,Codex 可以為自己排定未來的任務,並自動喚醒以繼續執行長時間運行的任務。

Codex 桌面應用程式於 2026 年 2 月 2 日在 macOS 上推出,Windows 版本則於 3 月 4 日推出。這次 4 月 16 日的更新是首次真正的擴展,使其作為一個完整工作流程工具,能與 Claude Code 和 Cursor 競爭。

價格問題是每百萬輸入 token 5 美元,每百萬輸出 token 30 美元,這恰好是 GPT-5.4 價格的兩倍。Reddit 用戶立即注意到了這一點。

在 r/theprimeagen 上,一個有 40 多條評論的討論串指出了價格翻倍的問題。有人在 r/codex 上詢問這些改進是否值得價格上漲,而最熱門的回覆直言不諱:「這就是為什麼我仍然使用 gpt-5.3-codex 作為我的骨幹模型,目前為止性價比最高。」

OpenAI 的論點是,40% 的 token 使用量減少可以抵消更高的每 token 價格。如果你的確使用了更少的 token,這個數學計算是成立的。然而,如果你的工作量隨著工具的改進而擴大,以填滿模型所提供的任何預算,那麼這個計算就不成立了,而這通常是使用更好工具時會發生的情況。GPT-5.5 Pro 的價格甚至更高:輸入 30 美元,輸出 180 美元,這不是打錯字。

網路對模型發布的誤解每次有前沿模型發布時,都會上演相同的循環。洩漏消息浮出水面,代號被浪漫化,人們說服自己下一個模型將在一夜之間改變一切。

然後模型發布了,熱門評論分裂成「這就是一切」和「這什麼都不是」。GPT-5.2 發布時也發生了同樣的情況,當時也受到了類似的炒作。四個月後,它在 LMArena 排行榜上跌至第 15 位,落後於 GPT-5.1 和 Claude 4.5。

那些用它開發出真正產品的人並不在乎排名,而那些只關注排名的人則轉向了下一個模型。GPT-5.5 很可能也會遵循相同的軌跡。真正的問題不在於它是否在 Terminal-Bench 上以 0.7 分擊敗 Claude Opus 4.7。真正的問題是,具備電腦使用、記憶和背景代理功能的 Codex 桌面應用程式,是否能改變開發者度過早晨的方式。

代號「Spud」的反彈在內部,GPT-5.5 的代號是「Spud」。圍繞這個代號的炒作變得荒謬。r/accelerate 上的用戶將其與 Anthropic 的「Mythos」相提並論,並將其視為 GPT-6。

然後它發布了,反應一分為二。在 r/singularity 上,一篇題為「GPT 5.5 帶來的大模型感受」的貼文獲得了 70 多條評論,其中最主要的觀點是人們對其在實際應用中表現出的顯著提升感到真正驚訝。

在 r/vibecoding 上,有人說:「我理解這種炒作,但 Opus 仍然有一些未反映在基準測試中的特點。」最誠實的看法來自 r/accelerate 上的一位用戶:「這被炒作成 GPT-6,而不是 0.1 的改進。許多人都是這樣認為的。請大家保持更高的標準。」該討論串在發布後僅 21 小時內就獲得了 20 多條評論。

一位數學教授在 11 分鐘內建構了代數幾何應用程式波蘭數學助理教授 Bartosz Naskrecki 給 Codex 一個簡單的提示詞,要求它建構一個代數幾何應用程式。該應用程式能夠視覺化二次曲面交點,並使用計算黎曼-羅赫定理將所得曲線轉換為 Weierstrass 模型。

它成功了,只花了 11 分鐘。他還用穩定的奇點視覺化和精確可重複使用的係數擴展了它。他表示,更大的轉變不在於任何單一應用程式,而是 Codex 現在可以協助實作以前需要專用工具才能完成的客製化數學視覺化和電腦代數工作流程。

這是一個具體且專業的細節,但它展示了這個技術的實際發展方向。OpenAI 還聲稱,內部版本的 GPT-5.5 發現了一個關於非對角 Ramsey 數的新證明,後來在 Lean 中得到了驗證。Ramsey 數是組合數學中的核心概念之一,這個領域的成果既罕見又技術困難。如果這項成果屬實,那它將是一個真正的研究貢獻,而不僅僅是一個編程技巧。

真實情況是 GPT-5.5 表現出色,可能是目前用於代理編程和複雜任務執行的最佳模型。然而,代號「Spud」的炒作與實際產品之間的落差,讓那些期待典範轉移的人感到不滿。

在 Anthropic 和 Google 大力推動競爭性定價之際,API 價格翻倍使得價值討論比基準測試圖表顯示的更為複雜。如果你是 ChatGPT Plus 訂閱者,你可以用相同的每月 20 美元價格獲得它,這是一個划算的交易。

但如果你透過 API 大規模運行它,你需要仔細計算 token 節省是否真的能彌補價格上漲。Codex 桌面應用程式的更新則是較少被提及的重點,包括背景電腦使用、記憶和自動排程等功能。

這些基礎設施才是讓模型在日常工作流程中真正有用的關鍵。沒有這些,GPT-5.5 就只是一個更智慧的 API 端點。我仍在思考那位 NVIDIA 工程師的話:「失去 GPT-5.5 的存取權限,感覺就像我的肢體被截肢了一樣。」也許他誇大了,也許沒有。但沒有人對 GPT-5.4 說過類似的話。