Anthropic 作為史上成長最快的公司,長期以來一直將超越 OpenAI 視為目標。儘管過去幾個月有許多不確定因素,讓其超越 OpenAI 的時機受到質疑,但今日 Anthropic 正式公布其年化營收已達 470 億美元(去年十二月為 90 億美元),並證實其 H 輪融資已募得 650 億美元,投前估值達 9000 億美元(其中包括來自 Amazon 等超大規模雲端供應商的 150 億美元),這使其在運算能力和非程式碼基準測試之外的各方面,至少暫時領先 OpenAI。
為慶祝此里程碑,Anthropic 也發布了 Claude Opus 4.8,據廣泛報導,此版本修復了社群在 Opus 4.7 發布後發現的許多問題。值得注意的是,它在幾乎所有具經濟效益的基準測試中都達到了最先進水平,甚至認同 Google 的說法,即 Gemini 3.5 Flash 優於 Gemini 3.1 Pro。
然而,或許更具長期意義的是 Claude Code 中大規模平行的「動態工作流程」(Dynamic Workflows)功能,也被稱為 ultracode。Jarred Sumner 曾利用它在六天內將 Bun 從 Zig 重寫為 Rust,程式碼量高達 75 萬行。此功能是一個研究預覽版的協調系統,Claude 會規劃工作並生成數百個平行子代理來處理大型任務。
Anthropic 表示,這筆 650 億美元的 H 輪融資由 Altimeter、Dragoneer、Greenoaks 和 Sequoia 領投,資金將用於資助研究並擴大 Claude 不斷增長的需求容量。公司披露其年化營收已超過 470 億美元,主要歸因於企業部署和日常使用。
關於產品,Claude Opus 4.8 被定位為 Opus 4.7 的更新版,具有「更敏銳的判斷力」、「對自身進度更誠實」以及「能夠獨立工作更長時間」的特性,價格維持不變。Anthropic 工程師指出,4.8 版本是回應 4.7 版本使用者回饋的成果,包含「許多修復」,並在理解細微差別和對話自然度方面有所提升,同時在程式碼編寫和知識工作方面表現更強。
獨立評估普遍證實 4.8 版本相較於 4.7 有顯著改進,尤其在長期代理程式碼編寫和知識工作方面。然而,對於這是一個開創性的飛躍,還是主要追趕 OpenAI 的 GPT-5.5 系列,各方反應不一。
值得一提的是,4.8 版本在「誠實度」和「校準」方面有顯著提升。多位 Anthropic 員工和外部測試人員表示,模型更願意承認其不知道的內容、標記自身程式碼中的缺陷、避免粉飾不確定的進度,並停止錯誤地暗示任務已完成。這解決了 Claude 先前在程式碼生成方面雖強,但在自我監控方面表現不佳(例如程式碼審查中的誤報、過於自信的進度摘要和「懶惰」或過早截斷任務執行)的問題。
根據 Artificial Analysis 的具體規格,Opus 4.8 支援 100 萬個 token 的上下文視窗,輸入和輸出 token 的定價分別為每百萬 $5 和 $25。社群也指出,Opus 4.8 的快速模式(Fast mode)比以前快 2.5 倍,便宜 3 倍。
儘管 4.8 版本比 4.7 更高效,但在某些工作負載上,它並非總是比 OpenAI 的模型更具推論效率,例如仍有使用者抱怨「token 消耗量仍被 GPT-5.5 碾壓」。
在基準測試方面,Opus 4.8 表現出色,例如 SWE-Bench Pro 達到 69.2%,比 GPT-5.5 高出 10 個百分點;APEX-SWE 的 Pass@1 達到 45.3%,領先 GPT-5.3 Codex 近 4 個百分點。
在 Artificial Analysis Intelligence Index 中,4.8 版本也以 61.4 分領先 GPT-5.5 xhigh。此外,長期上下文處理能力也有所提升,100 萬個 token 的 Opus 4.8 在某些評估中幾乎與 GPT-5.5 的 256K token 表現相當。
然而,也有一些謹慎的觀點。例如,有評論認為 Opus 4.8 僅是「小幅升級」,Anthropic 仍在「追趕 OpenAI 而非引領潮流」。此外,「動態工作流程」雖然強大,但在實際應用中可能會消耗大量 token 並快速耗盡配額。在誠實度方面,儘管 Anthropic 聲稱其幻覺率顯著低於 Google/OpenAI 的同類模型,但也有觀察指出 Opus 4.8 在超過 100 次測試中,對提示詞注入(prompt injection)的穩健性並未改善。
投資者對此次融資的訊息傳達,主要圍繞企業採用和營運執行。Altimeter 形容 Claude 正成為「整個企業的預設作業系統」,並讚揚 Anthropic 在性能和安全性方面的結合。此次巨額融資也被視為 Anthropic 擴大運算能力和部署規模的直接嘗試,以支持其高推論需求的長期代理工作負載。

