我們繼續探討 Transformer 替代方案系列。
在本週 AI 焦點部分,我們討論了 Opus 4.8。
本週的觀點探討了 Google、NVIDIA、Microsoft、OpenAI 和 Anthropic 等公司在 AI 技術堆疊中不同領域的所有權所帶來的策略差異。
過去兩年,AI 榮景是關於未來的論辯,體現在基準測試和投資條款清單中;本週,它已轉變為關於當下的論辯,體現在實際營收上。
從基礎層面開始。Anthropic 推出了 Claude Opus 4.8,同時披露其正朝首次營運獲利邁進,預計第二季營收約 109 億美元,季增約 130%,並完成了一輪 650 億美元的融資。請仔細思考這點:一個仍在進行前沿模型訓練的實驗室,正接近營運獲利能力。「實驗室本質上無法獲利」這個支撐所有看跌論點的假設,其承重牆已然倒塌。
Anthropic 對模型本身的描述令人耳目一新,稱其為「溫和但實質的改進」,代理式程式編寫能力從約 64% 提升至約 69%,工具輔助推理從約 55% 提升至約 58%,價格與 4.7 版本相同。有趣的部分在於基準測試之下。有三個重要的變化。
首先是「努力控制」,讓你可以調整模型在每個任務上思考的強度,這是一種對運算與品質權衡的明確治理,而每個代理建構者過去都透過提示詞技巧來解決這個問題。其次是「動態工作流程」:Claude Code 的一項功能,模型會規劃一個大型任務,啟動平行子代理來處理各個部分,驗證其輸出,然後回報,搭配的 Messages API 現在允許在執行中即時編輯訊息陣列,而不會破壞提示詞快取,因此你可以在不中斷並重新啟動的情況下引導長時間任務。
第三是「誠實作為可測量能力」:4.8 版本讓自身程式碼中的缺陷未經標記地溜走的可能性比 4.7 版本低約四倍,並且更容易揭示自身的不確定性。將這些功能疊加起來,你就能得到模型無人看管地運行數小時後真正重要的東西:它會規劃、平行處理、檢查自己的工作,而且,因為你無法閱讀每一個差異,它被訓練成不信任自己。它在執行所有這些任務時也會大量消耗 token。
接著觀察資金流向,因為它告訴你計價單位現在是 token。OpenRouter 以 13 億美元的估值募得 1.13 億美元,做的事情幾乎簡單到令人尷尬:在 400 多個模型之間進行路由,並收取約 5% 的推論支出。其每週吞吐量在六個月內從 5 兆個 token 成長到 25 兆個 token,成長了五倍。
這不是預測;這是一個計量器。Cognition 以 260 億美元的估值募得 10 億美元,公告中隱藏著一句話,應該會重新調整你的預設判斷:Cognition 內部提交的程式碼中,有 89% 現在是由 Devin 編寫的,高於去年 12 月的 13%。
年化營收在一年內從 3700 萬美元成長到 4.92 億美元。自主軟體工程不再是演示,而成為預設的程式碼提交者。
Snowflake 在公開市場上完成了閉環。產品營收成長 34%,財測上調,股價在單一交易日上漲約 36%,其中兩個關鍵指標是一筆 60 億美元的 AWS 運算交易,以及收購 Natoma,一個用於管理代理存取的 MCP 平台。資料層正在圍繞著「消耗」而非「查詢」的代理進行重新定價。
整個技術堆疊,模型、路由器、代理、底層基礎設施,正匯聚成一種商業模式:按 token 收費,因為 token 就是工作。
這正是教宗良十四世選擇發表他的第一份通諭《Magnifica Humanitas》的時刻,該通諭與 Anthropic 的 Chris Olah 一同呈現。拋開神學層面,這個論點是對該領域應嚴肅看待的工程學批判:技術從來都不是中立的,因為它繼承了建造者和資助者的動機,而危險不在於惡意,而在於靜默的去中介化,決策一點一滴地從人類手中滑落,透過一次次的委託提交。
將這兩個事實結合起來。Cognition 的 89% 就是通諭論點的指標化重述。讓經濟運轉的計量器,也正是衡量我們交出了多少判斷力的計量器。看漲的理由和道德的考量,正在讀取同一個數字。
飛輪不再只是一張投影片。它已呈現在損益表上。懸而未決的問題是,它正在優化什麼。
AI 實驗室:CMU & Amazon
摘要:為了解決評估 AI 代理能否準確將非正式程式意圖轉化為正式規範的挑戰,研究人員引入了 VERUS-SPECBENCH 基準測試和 VERUS-SPECGYM 代理環境。透過擴展執行機制,針對官方測試和對抗性「駭客」測試生成的規範,該研究揭示即使是能夠生成正確程式碼的模型,規範自動形式化仍然非常脆弱。
AI 實驗室:清華大學、NVIDIA、多倫多大學 & Vector Institute
摘要:Gamma-World 提出了一個可擴展的生成式多代理世界模型,透過利用用於置換對稱身份的 Simplex 旋轉代理編碼和用於高效跨代理通訊的稀疏中心注意力機制,超越了傳統的單代理模擬。透過條件式師生蒸餾和 KV 快取串流,該框架實現了 24 FPS 的即時、響應動作的運行,並在虛擬遊戲和實體機器人環境中保持強大的一致性。
AI 實驗室:哈佛大學 & MIT
摘要:雙向演化搜尋 (BES) 透過將前向候選演化與後向目標分解相結合,克服了稀疏驗證訊號和狹窄自迴歸擴展的限制。透過重新組合軌跡片段以擺脫狹窄的機率分佈,並根據細粒度子目標進行評分,BES 在複雜邏輯推理和開放式問題解決任務上顯著優於現有的開源框架。
AI 實驗室:Meta AI
摘要:MobileMoE 推出了一系列活躍參數少於十億的稀疏混合專家 (MoE) 語言模型,專為智慧型手機等邊緣設備的高效部署進行優化。在新型設備端擴展法則的指導下,並由客製化的融合 MoE 核心支援,這些模型在實現最先進性能的同時,與具有相似記憶體佔用的密集型基準模型相比,預填充和解碼速度顯著加快。
AI 實驗室:Google DeepMind
摘要:Gemini Embedding 2 是一個原生的多模態嵌入模型,無需依賴中間轉錄,即可將文字、圖像、音訊和視訊輸入無縫映射到單一、統一的表示空間。該模型透過多任務設定下的大規模對比學習進行訓練,在單模態、跨模態和多模態檢索基準測試中建立了新的最先進性能,同時在各種企業和專業領域中展現強大的零樣本泛化能力。
摘要:MiniMax-M2 系列推出了一個高效的 2299 億參數稀疏混合專家模型,每個 token 僅激活 98 億個參數,專為複雜、長週期的代理工作流程而設計。透過利用代理驅動的資料管線、名為 Forge 的專用強化學習系統,以及自主自我演化能力,該模型在程式編寫、深度搜尋和推理基準測試中達到前沿水準的表現,同時保持最小的運算足跡。
Anthropic 發布了其旗艦模型的新版本,具備強大的代理和程式編寫能力。
1. Anthropic 在 H 輪融資中募得 650 億美元,投後估值達 9650 億美元,Anthropic 在 H 輪融資中募得 650 億美元(由 Altimeter、Dragoneer、Greenoaks 和 Sequoia 共同領投),投後估值達 9650 億美元,並披露本月初年化營收已突破 470 億美元,同時引入 Micron、Samsung 和 SK hynix 作為策略性記憶體/儲存合作夥伴,加上先前承諾的 150 億美元超大規模雲端服務商投資(包括 Amazon 的 50 億美元)。
2. AI 程式編寫新創 Cognition 募得 10 億美元,投前估值達 250 億美元,AI 軟體工程師 Devin 的開發商 Cognition 募得超過 10 億美元(由 Lux Capital、General Catalyst 和 8VC 領投),投後估值約 260 億美元,在八個月內估值翻倍,年化營收達到 4.92 億美元。
3. Robinhood 允許 AI 代理交易股票,Robinhood 推出了測試版的代理式交易和代理式信用卡,讓客戶可以透過 MCP 將第三方 AI 代理連接到獨立的資金帳戶,以自主交易股票和進行購買。
4. OpenRouter 估值翻倍至 13 億美元,這家多模型 AI 推論路由新創公司在 Alphabet 旗下 CapitalG 領投的 B 輪融資中募得 1.13 億美元,估值約 13 億美元,比一年前翻了一倍多,其每週流量從 5 兆個 token 成長到 25 兆個 token。
5. Hark 完成 7 億美元 A 輪融資,Brett Adcock 神秘的 AI 新創公司募得 7 億美元,投後估值達 60 億美元(由 Parkway Venture Capital 領投),旨在打造一款具備專有多模態模型和客製化硬體的「通用」代理式 AI 助理,首批模型預計於 2026 年夏季推出。
6. Mistral 與 Airbus 和 BMW 簽約,Mistral AI 擴展到製造業的「實體 AI」領域,宣布與 Airbus(飛機設計、飛行安全、國防/太空)和 BMW 的「大型工業模型」碰撞模擬計畫建立合作夥伴關係,並在法國設立新的資料中心。
7. MiniMax 在新模型發布前銷售額翻倍,這家中國 AI 開發商的年化營收在兩個月內翻倍,達到至少 3 億美元,主要由其 M2.7 模型和企業用戶五倍的增長所驅動,預計將推出下一個旗艦模型。

