[AINews] 推論轉折點 - Latent.Space。正如我們今年稍早報導的「世界模型」(World Models),未來幾週我們將在播客中發布一系列關於 CPU 運算/沙盒產業的短篇迷你系列,現在是時候解釋原因了。近日:Noam Brown:「推論運算是一種戰略資源,目前被低估了。」

Sam Altman:「在很大程度上,我們現在必須成為一家 AI 推論公司。」單獨來看,這些評論可能只是對 GPT 5.5 模型成功發布的正常反應,似乎不足為奇。但在其背景下,它們標誌著一個非常值得注意的反應,如果您尚未極度重視,親愛的讀者,您可能應該被提醒。

今天這篇評論文章的直接觸發點是 Intel 執行長 Lip-Bu Tan 的第一季財報電話會議,他在會中提供了數據,說明 CPU(而非 GPU)運算需求的增長。顯然,Intel 執行長有明顯的動機來宣傳 CPU 需求,但這不代表他是錯的。我們在 SemiAnalysis 播客中也報導了這一趨勢(為便於閱讀已編輯):Doug: 我們正處於 COVID 疫情五年到六年更新週期的確切時間點。

所以在 2020-2021 年,你購買了大約數千億美元的 CPU。所以我們正處於這些晶片的自然生命週期末期。通常你會對所有這些晶片進行大規模更新,但現在發生的情況是,每個人都盡可能地把所有預算都投入到 GPU 上……每個人都盡可能地節省每一分錢,主要投資於 AI,而對 CPU 只進行維護性資本支出。

諷刺的是,在所有這些 Claude Code 相關的事情發生時,軟體將在哪裡運行?在 CPU 上。所以我認為我們將看到利用率的增加,以及強化學習(RL)實際上被大量用於 RL 訓練環境的事實。你必須模擬軟體,這會使用大量的 CPU。所以雖然不像 GPU 那樣是數量級的增長,但這是一個如此巨大的趨勢,我們實際上可能會因為這個更新週期而看到 CPU 短缺。

swyx: 是的,是的。還有一般的生產代理模型也是如此。你知道,即使是 RLM 也需要運算,OpenClaw 需要更多的運算,而且這只是不同的斜率,但方向是一致的。Doug: 它仍然是上升的斜率。是的,而且要明確的是,這個斜率在過去兩年裡一直存在大規模的投資不足。

以及我們對 NVIDIA GTC 黃仁勳主題演講的報導:[50:41] 最後,AI 能夠進行生產性工作,因此推論的轉折點已經到來。AI 現在必須思考。為了思考,它必須進行推論。AI 現在必須行動。為了行動,它必須進行推論。AI 必須閱讀。為了做到這一點,它必須進行推論。

它必須推理。它必須進行推論。AI 的每個部分,每次它必須思考、它必須推理、它必須行動、它必須生成語句,它都必須進行推論。現在已經遠遠超過訓練階段,它已經進入推論領域,所以推論的轉折點已經到來,此時所需的語句量和運算量大約增加了 10,000 倍。

現在,當我將這些與過去兩年運算需求增加了 10,000 倍,而使用量可能增加了 100 倍的事實結合起來時。人們聽我說過,我認為過去兩年運算需求增加了 100 萬倍。這是我們所有人的感受。這是每個新創公司的感受。這是 OpenAI 的感受。

這是 Anthropic 的感受。如果他們能獲得更多的容量,他們就能生成更多的語句。他們的收入就會增加。更多的人可以使用它。AI 就能變得更先進、更聰明。我們現在正處於這種正向的飛輪系統中。我們已經達到了那個時刻。推論的轉折點已經到來。除了 CPU 需求之外,推論轉折點也導致 GPU 工作負載發生了前所未有的重塑。

預填充/解碼分離(Prefill/Decode disaggregation)現在已成為常態,Nvidia 收購 Groq、Intel 與 Sambanova 合作,甚至 Amazon 也加入了類似 Cerebras 的行列,而 OpenAI 和 Cognition 之前也曾與 Cerebras 達成協議。

AI Twitter 回顧。程式碼代理模型成為平台:Codex、Cursor SDK 和 VS Code 的升級。OpenAI 正在將 Codex 從一個程式碼工具轉變為一個通用的工作介面:今天最強的產品信號不僅是使用熱情,更是其在持久上下文、工具、整合和團隊部署方面能力的穩步擴展。

OpenAI 強調 Codex 除了程式碼之外,還可用於更廣泛的知識工作任務,如研究綜合、試算表和決策追蹤(OpenAI);並為符合條件的商業/企業客戶推出了Codex 專用席位,截至六月底免收席位費(OpenAIDevs);還增加了 Supabase 等整合(coreyching)和一個可將實作計畫轉化為 FigJam 白板的 Figma 外掛程式(OpenAIDevs)。

社群貼文也指出應用程式伺服器使用和更豐富的代理模型工作流程(gdb, aiDotEngineer)。性能優化正從模型延遲轉向代理迴圈系統工程:OpenAI 表示,將 Codex 風格的工作流程轉移到Responses API 上的 WebSocket 模式,可以在工具呼叫之間保持狀態溫暖,並減少重複工作,從而使代理模型工作流程的速度提高高達 40%(OpenAIDevs, reach_vb, pierceboggan)。

VS Code 也推出了一系列並行的優化:跨工作區的語義索引、跨儲存庫搜尋、聊天會話洞察、技能上下文、Copilot CLI 的遠端控制,以及一個旨在改進提示詞、技能和指令的提示詞/代理模型評估擴充功能(pierceboggan, pierceboggan, code)。

這條主線表明,程式碼代理模型的使用者體驗現在主要由記憶體、檢索、執行環境品質和工具協調所主導,而不僅僅是原始模型智慧。Cursor 正在明確地進行平台化佈局:新的 Cursor SDK 暴露了與 Cursor 相同的執行時、執行環境和模型,可用於 CI/CD、自動化和產品內嵌代理模型(cursor_ai, starter projects, customer examples)。

這值得注意,因為它將 Cursor 從基於席位的 IDE 產品轉變為可程式化的代理模型基礎設施,@kimmonismus 很好地捕捉了這種框架。綜合 Codex 應用程式伺服器和 VS Code 執行環境的工作,該類別顯然正在趨向於無頭代理模型執行時 + 可程式化執行環境 + 基於使用量的經濟模式。

代理模型執行環境工程、LangGraph/Deep Agents 和生產代理模型操作。執行環境正在成為一流的優化層:多個貼文都集中在一個觀點上,即單獨的模型品質不足以決定生產性能;模型周圍的執行環境通常決定了生產性能。最清晰的研究範例是代理模型執行環境工程(Agentic Harness Engineering),它透過可復原的組件、精簡的執行證據和可證偽的預測,使執行環境的演進變得可觀察。

報告的成果:Terminal-Bench 2 pass@1 在十次迭代中從 69.7% 提高到 77.0%,超越了人類設計的 Codex-CLI 基線(71.9%),同時還能跨模型家族轉移,並將 SWE-bench Verified 上的語句使用量減少了 12%(omarsar0)。

關於 HALO 的相關工作描述了使用追蹤分析來修補執行環境故障的遞歸自改進代理模型,聲稱