今年稍早,Amazon Web Services (AWS) 的領導層向工程師發布了一項新指令:他們必須不惜一切代價節省 CPU 週期。據報導,由於 AI 工作負載對該公司的雲端基礎設施造成壓力,AWS 的 CPU 伺服器容量等待時間急劇增加。

這個問題似乎讓 AWS 措手不及,而且原因充分。AI 熱潮導致 GPU 需求激增,隨後記憶體也跟進。CPU 大多被排除在外,因為其相對缺乏平行處理能力,使其不適合 AI 模型推論,即向使用者運行和提供大型語言模型 (LLM) 的過程。但代理式 AI 系統的興起,允許 AI 模型自主運作並呼叫子代理,正在改變這種局面。

Moor Insights & Strategy 的副總裁兼首席資料中心分析師 Matt Kimball 表示,2026 年 CPU 需求激增,其中很大一部分歸因於代理式 AI。「擁有這種代理式工作負載是一回事,假設它產生 100 個代理。

如果我要在整個企業中推廣,這 100 個將變成數萬、數十萬甚至數百萬個代理。」Kimball 說道。「你會看到代理產生子代理,進行應用程式介面 (API) 呼叫,並透過 [Anthropic 的] 模型上下文協定與更多代理進行通訊。」

AI 代理需要使用電腦,而電腦需要 CPU。

Kimball 的評論部分指的是「工具使用」,這是 LLM 存取網路、開啟桌面檔案以及通常使用各種軟體來完成任務的簡稱。經過工具使用訓練的 LLM 會學習如何呼叫其他軟體。雖然 LLM 的推論仍主要在 GPU 或類似的 AI 加速器上執行,但 LLM 進行的工具呼叫通常會推送到 CPU。

Intel 資深研究科學家 Souvik Kundu 解釋說:「代理式 AI 任務的許多組成部分本質上是基於 CPU 的工作。」「CPU 負責解析輸出、判斷要呼叫哪個工具、進行 API 呼叫或運行程式碼、收集結果並將其回饋。」AMD 運算與企業 AI 副總裁 Madhu Rangarajan 也提出了類似的說法,稱「在我們的測試中,實際代理式 AI 管線中的八個階段有七個完全在 CPU 上運行。」

例如,一個負責編程軟體的 LLM 很可能會進行工具呼叫,將程式碼寫入檔案、移動或替換檔案、下載所需的套件,並在 LLM 認為完成後建構軟體。Kundu 與喬治亞理工學院的研究人員共同撰寫了一篇關於代理式 AI 優化的論文。他們發現,當 LLM 推論在 GPU 上執行時,CPU 通常處於閒置狀態;反之,當工具呼叫在 CPU 上執行時,GPU 通常處於閒置狀態。

為了優化這一點,Kundu 和他的同事提出了排程優化方案,可以在持續負載下將端到端延遲(代理式工作負載開始到結束的時間)縮短高達 1.8 倍。這是一個開始,但這些改進仍在追逐一個不斷變化的目標。代理式系統以機器速度產生工作,並在運行過程中倍增。OpenAI 無意中對 Hugging Face 的攻擊顯示,其模型每小時發出多達 300 次動作,而單一代理可以產生自己的子代理進行工具呼叫。

還有一個重要的複雜因素,隨著模型變得更加複雜,可能會增加 CPU 的工作負載:安全防護機制。

Kundu 表示,對代理動作的安全和政策檢查通常是檢查語法和日誌檔案的特定規則。防護機制也可能使用小型模型(參數少於十億)來分析任務複雜性或意圖。儘管它們可以在 GPU 上執行,但通常不會,因為它們體積小且需要最小化延遲,因此工作仍保留在 CPU 上。

(圖表顯示:增加可用的 CPU 數量可顯著降低 Llama-8B 在較長序列長度下的回應延遲。)

Tokenization 增加了瓶頸。

喬治亞理工學院的博士生 Euijun Chung 最近與人合著了另一篇論文,其發現補充了 Kundu 的工作。Chung 和他的合著者發現,當伺服器擁有的 CPU 核心太少時,它在向 GPU 分派工作方面會落後。這會導致 GPU 在等待指令時停滯。

除此之外,該論文還觸及了 LLM 工作負載的另一個關鍵要素:Tokenization。

Tokenization 是 LLM 推論的關鍵第一步。它將文本轉換為模型可以處理的整數 token ID。與大多數 LLM 推論所需的矩陣運算不同,Tokenization 是分支多、依賴資料的循序字串操作。儘管可以透過分塊文本來實現平行化,但它不像 LLM 推論的主體那樣大規模平行。

小型提示詞的 Tokenization 是一個相對微不足道的任務,即使是入門級 CPU 也不會感到吃力。然而,一個進行工具呼叫的代理式模型必須解析並 Tokenization 呼叫的結果。「如果你有一個持續的序列,比如說 100,000 個 token,而工具結果有 1,000 個 token,tokenizer 將不得不再次 Tokenization 整個序列。

而且你必須在每次代理式工具呼叫時進行 Tokenization。」Chung 說道。這既增加了 Tokenization 的頻率,也增加了涉及的 token 數量。Chung 表示,未來 Tokenizer 有可能找到方法來緩解這個問題,但對於現代 LLM 推論來說,這仍然是一個問題。

該論文發現,時間到第一個 token 的延遲(模型產生其回覆第一個詞所需的時間)會隨著序列長度的增加而顯著增加。擁有更多核心的 CPU 可以減少這個問題。在較長序列長度的測試運行中,增加 CPU 核心數可以將時間到第一個 token 的延遲減少約 1.5 倍到 7 倍。

由於測試硬體的限制,Chung 和他的同事只能測試較小的模型,例如阿里巴巴的 Qwen 3-30B 和 Meta 的 Llama 3.1-70B。他推測,由於大型模型對 GPU 的整體需求更高,它們的瓶頸可能不會那麼劇烈,但也預計代理式 AI 將把 token 長度推到遠超他和合著者測試的範圍。

「如果你考慮像 Anthropic 的 Claude 這樣的模型,你可以輕易達到 500,000 甚至一百萬個 token」Chung 說。「在代理式 AI 的世界裡,平均序列長度將會不斷增長,所以我預計這個問題在未來的工作負載中會變得更糟。」

CPU 緊縮才剛開始嗎?

Amazon 對 CPU 資源使用的限制是 Kundu 和 Chung 發現的問題在現實世界中具有相關性的幾個指標之一。Intel 的伺服器 CPU 已經銷售一空,至少到今年年底都是如此。AMD 已將其伺服器 CPU 預測翻倍。Arm 和 Qualcomm 都宣布了旨在加速代理式 AI 的新 CPU。

甚至 Nvidia 也優先考慮其用於代理式 AI 的基於 Arm 的 CPU Vera,它是 Nvidia Vera Rubin 平台的一部分。

Kimball 表示,這些發展清楚表明 AI 產業越來越重視 CPU 性能。他認為需求激增是「絕對的證明」,表明 CPU 現在被視為代理式 AI 系統的關鍵部分。

不幸的是,這可能導致更廣泛的 CPU 短缺和價格上漲,就像 GPU 和記憶體已經發生的情況一樣。「你已經在某種程度上看到了 CPU 緊縮。當你審視市場上的限制時,它甚至會滲透到消費領域。」Kimball 說道。他補充說,儘管 Intel 新的 18A 生產製程增加了該公司在客戶端領域的銷售額,但 Intel 仍削減了客戶端 CPU 的生產,轉而支持伺服器 CPU。Kimball 認為這是一個跡象,表明 CPU 製造商將追逐利潤。