根據 OpenRouter 的數據顯示,AI 代理程式的工作負載比單純的聊天請求多消耗 15 倍的 token。這是為什麼呢?想像一下,當一個 AI 代理程式為投資決策研究一家公司時會發生什麼事。該代理程式會查詢金融資料庫、搜尋新聞和文件,並呼叫子代理程式進行同業比較和模型估值,然後將所有資訊整合為一份建議。

代理程式和子代理程式會持續進行推理,直到任務完成為止,這導致了 token 需求的增加。每一步驟中,累積的 token 都會成為下一個步驟的輸入,因此長上下文處理對於 AI 代理程式的效能至關重要。

同樣的模式也適用於所有 AI 代理程式的應用案例,從軟體開發到客戶服務,再到深度研究。隨著 AI 代理程式在各行各業投入生產,運行這些代理程式的基礎設施需要有效率地滿足其 token 需求。

最新測量的效能數據顯示,NVIDIA Vera Rubin NVL72 系統在 AI 代理程式工作負載上,每百萬瓦的吞吐量比 NVIDIA GB300 NVL72 高出多達 30 倍。NVIDIA 使用 SemiAnalysis AgentX 工作負載測量了這些推論吞吐量數據,該工作負載包含實際的 AI 代理程式編碼會話記錄,並保留了實際的上下文增長、工具呼叫和子代理程式生成。

對於電力受限的 AI 工廠而言,這直接意味著在相同的能源消耗下,可以完成 30 倍的 AI 代理程式工作。這些 Vera Rubin NVL72 的初步成果,證明了 NVIDIA 加速創新的步伐。隨著持續的軟體優化,Vera Rubin NVL72 和 GB300 NVL72 的效能都將持續提升。

Vera Rubin NVL72:每百萬瓦吞吐量提升 30 倍,token 成本降低 35 倍。AI 代理程式的工作負載與聊天或文件摘要截然不同,後者的輸入和輸出序列通常介於 1K 到 8K 個 token 之間。

在 AI 代理程式的會話中,上下文會隨著步驟累積,輸入 token 數量可能達到數十萬個,且不同請求的輸入和輸出長度差異很大。因此,效能測量必須演進,以捕捉完整的代理程式工作流程,而非單一的推論請求。以下結果反映了在實際 AI 代理程式編碼軌跡上測量的效能。

在 SemiAnalysis AgentX 中,NVIDIA Blackwell 平台在多個 AI 代理程式模型上展現了領先的效能,包括 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5 和 DeepSeek V4 Pro。

例如,GB300 NVL72 在 DeepSeek V4 Pro 模型上的每百萬瓦吞吐量比 NVIDIA Hopper 架構高出 15 倍,為客戶運行 AI 代理程式工作負載提供了高效能基礎。這一飛躍反映了更大規模的 GPU 擴展領域和協同設計軟體在提供顯著更佳推論效率方面的優勢。

Vera Rubin 進一步擴展了這項優勢,將整個帕累托曲線的效能提升,在 DeepSeek V4 Pro 模型上,每百萬瓦的吞吐量比 GB300 NVL72 高出多達 30 倍。這些使用 SemiAnalysis AgentX 工作負載測量的初步結果,目前正等待 SemiAnalysis 審查,尚未反映 Vera CPU 在工具呼叫方面的效能。

NVIDIA DSX MaxLPS 技術管理 GPU、機架和工作負載層級的功耗,可在相同的百萬瓦預算內配置多達 40% 的 GPU,進一步提升 AI 工廠規模的每百萬瓦吞吐量。每百萬瓦吞吐量也直接影響每個 token 的生產成本。

Vera Rubin NVL72 的每百萬個 token 成本比 GB300 NVL72 低了 35 倍,這使得它能夠大規模、持續地運行 AI 代理程式,滿足客戶各種工作負載的需求。對於電力受限的 AI 工廠而言,每百萬瓦吞吐量決定了 AI 工廠的營收,而每百萬個 token 的成本則決定了該營收的利潤率。

為 AI 代理程式規模化而生的極致協同設計。現代推論優化涵蓋了一系列技術,這些技術對於 AI 代理程式尤其關鍵。NVIDIA Vera Rubin NVL72 透過平台各層次的極致協同設計,實現了所有這些技術及更多功能,從而帶來了數倍的效能提升。

解耦服務將上下文處理(預填充)與回應生成(解碼)分開,使兩者可以獨立擴展。速率匹配同步預填充 GPU 和解碼 GPU 生成 token 的速度,以最大化效率。大規模專家平行化將混合專家模型中的專家子網路分佈在擴展 GPU 領域中。

分散式 KV 快取將記憶體擴展到整個擴展 GPU 領域,而 KV 快取卸載則將較不活躍的上下文分層到主機和儲存,使先前處理的上下文無需重新計算即可存取。KV 感知路由將傳入請求導向已持有相關快取上下文的 GPU,減少長時間會話中的冗餘計算。MegaMoE 等融合 CUDA 核心將許多計算和 GPU 間通訊操作合併為單一執行通道,使 GPU 保持活躍而非等待數據。

NVIDIA Rubin GPU 增強的第五代 Tensor Cores 和第三代 Transformer Engine 加速了推論的預填充和解碼階段。NVFP4 量化將模型權重壓縮至 4 位元精度,減少記憶體佔用並提高吞吐量,同時不犧牲輸出品質。

NVL72 擴展領域是 Vera Rubin 和 Grace Blackwell 的核心架構,它實現了高頻寬和低延遲的 GPU 間通訊,這對於大規模專家平行化和分散式 KV 快取等技術至關重要。

專為此擴展領域設計的 NVIDIA NVLink 互連技術和 NVLink Switches,現已發展到第六代,提供比現成乙太網路替代方案高 10 倍的封包速率和低 3 倍的延遲。NVIDIA 的軟體堆疊,涵蓋了優化的 CUDA 核心、NVIDIA TensorRT LLM 等推論運行時,以及 NVIDIA Dynamo 等服務框架,與硬體協同設計,以實現推論優化。

雖然上述結果反映了當前 Vera Rubin NVL72 的效能,但完整的平台是一個七晶片架構,還包括 NVIDIA Vera CPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX 和 ConnectX-9 SuperNIC,所有這些都是專為大規模部署 AI 代理程式的 AI 工廠而設計。

極致協同設計也延伸到 NVIDIA 與其合作夥伴的共同工程。Vera Rubin 已全面投入生產,並正在整個生態系統中擴展。欲了解更多關於 NVIDIA Vera Rubin 平台的資訊。