隨著企業從 AI 試點專案邁向生產級 AI 工廠,基礎設施的決策重心已從晶片峰值規格轉變為每 token 的成本。這意味著要考量在每美元、每瓦特的預算下,以及在所需的延遲目標內,能提供多少有用的 token。

輝達的完整推論軟體堆疊與其 GPU、CPU、網路和系統共同設計,並透過廣泛的開源生態系強化,持續提升硬體效能。在 NVIDIA Blackwell 平台上,該軟體堆疊僅在一個月內,就已將 DeepSeek V4 模型上的 token 成本降低高達五倍。

SemiAnalysis InferenceX 的結果比較了 NVIDIA GB300 NVL72 系統搭配 SGLang 和 NVIDIA Dynamo 推論框架時的 token 成本與互動性。

領先企業和推論服務供應商已在 Blackwell 平台上,看到 NVIDIA 推論軟體堆疊所帶來的複合價值:

Baseten 利用 NVIDIA TensorRT-LLM 開源函式庫,在 Blackwell GPU 上為 DeepSeek V4 Pro 提供推論服務,處理推理、程式碼生成和長上下文工作負載。他們應用專有的執行時最佳化,每秒可提供多達 50% 的 token。

Cognition 正在使用 NVIDIA Dynamo 推論框架來管理推論 GPU,為其團隊提供一個現成的路徑,以擴展強化學習工作負載,而無需從頭建構基礎設施。

Deep Infra 利用 NVIDIA 推論軟體堆疊,從第一天起就在 Blackwell 上高效能地提供領先的開源模型服務,其中包括 DeepSeek V4。

DigitalOcean 協助 Hippocratic AI 在 Blackwell GPU 上使用 NVIDIA 推論軟體,更快、更高效地提供醫療保健 AI 服務。這使得推論吞吐量增加了 30%,同時在千萬次病患呼叫中,首次回應時間仍保持在半秒以內。

Together AI 在 Blackwell 上使用 NVIDIA TensorRT-LLM,協助 Cursor 加速從模型最佳化到生產端點的過程,以實現其即時程式碼編寫體驗。

軟體為何對推論經濟學至關重要

傳統的網路、搜尋和軟體即服務(SaaS)工作負載相對可預測:使用者可能會載入頁面、重新整理動態消息或更新業務記錄。這些請求通常遵循相似的軟體路徑,從資料庫讀取或寫入,並透過增加更多相同伺服器來擴展。

代理式 AI 則有所不同。

代理式 AI 執行分散式、有狀態的工作流程,這些工作流程橫跨資料中心的 LLM、工具、記憶體、安全性、網路和加速運算。

代理程式可以進行推理、規劃、呼叫工具、啟動專業子代理,並在多輪工作流程中管理龐大的上下文。它們將單一請求轉化為分散式運算問題,可能涉及數百個子代理、數千個任務和多個大型語言模型,並在 GPU、CPU、DPU 和儲存系統上運行。

軟體堆疊決定了這種複雜性是會導致容量浪費,還是能實現更低的每 token 成本。

更低的每 token 成本來自於將個別最佳化轉化為系統級效能。NVIDIA 的推論軟體堆疊透過連接三個層次來實現這一點:

生產營運層:協調分散式服務、編排、自動擴展和記憶體管理,確保推論能在正確的運算和儲存資源上運行。

應用加速層:高效能地運行模型,同時為開發者提供調整和客製化的空間,利用執行時最佳化,例如運算與通訊重疊以及核心融合。

基礎設施存取層:公開 NVIDIA GPU、網路、記憶體和系統功能,而無需開發者直接管理每個裝置指令集或資料傳輸協定。

NVIDIA 軟體堆疊涵蓋模型服務、執行時排程、核心、通訊函式庫和硬體感知最佳化,隨著各層次的改進相互疊加,能實現快速的效能提升和更低的服務成本。

當這些層次作為一個系統協同運作時,個別的最佳化會產生複合效應。

分離式服務、透過 NVIDIA NVLink 互連技術實現的大規模專家平行化、NVFP4 精度和多 token 預測,各自都能帶來顯著的增益。結合起來,它們可將吞吐量提高達 20 倍。

下圖顯示了結果。在生產環境中實現這種增益是複雜的,需要整個推論堆疊的協調,從生產營運和模型執行時,到核心、通訊函式庫和硬體存取。NVIDIA 的推論軟體堆疊旨在使這些層次協同運作,讓每個最佳化都能在其他最佳化的基礎上進一步提升。

堆疊軟體最佳化可產生複合效能增益,透過分離式服務、大規模專家平行化(Large EP)、NVFP4 和多 token 預測(MTP),將 NVIDIA Blackwell 每 GPU 的 token 吞吐量從基準提高達 20 倍。

開源放大完整堆疊優勢

同樣的完整堆疊基礎也透過開源生態系得到放大。現今許多最廣泛使用的開源 AI 框架和推論專案都是原生建構於 NVIDIA CUDA 之上,這意味著新的研究和軟體最佳化從第一天起就能在 NVIDIA GPU 上以領先的效能運行。

PyTorch 是一個領先的例子。PyTorch 於 2016 年推出時即原生支援 CUDA,並與 NVIDIA 的架構共同演進,讓開發者可以直接透過熟悉的框架存取 Tensor Cores、Transformer Engine 和 NVFP4 等創新技術。

當 DFlash 推測解碼(可在現有硬體上提供高達 15 倍的吞吐量)或 FastVideo(可在不到五秒內生成 1080p 影片)等突破性技術整合到 PyTorch 中時,它們可以立即在 NVIDIA 平台上運行,幫助 AI 工廠將研究進展轉化為更低的 token 成本。

NVIDIA 和 PyTorch 的共同開發有助於將新的 AI 軟體創新帶給開發者,隨著 PyTorch 的普及,將 CUDA 原生技術的進步轉化為生產效能。

同樣的開源動能也是為何當 DeepSeek V4 這樣的新一代開源模型發布時,vLLM 和 SGLang 等領先的推論框架能為 NVIDIA Blackwell 架構提供「零日部署」方案,使模型能在數百萬個 Blackwell GPU 上運行。

這也是 DeepSeek V4 在 Blackwell 上的效能,透過 vLLM 和 SGLang 框架在大約一個月內提升高達五倍,將 token 成本削減至約原先五分之一的原因。

SemiAnalysis InferenceX 的結果比較了 NVIDIA GB200 NVL72 系統搭配 vLLM 和 NVIDIA Dynamo 推論框架時,在相同互動性下的 token 吞吐量。

這就是開源的飛輪效應:更多的開發者最佳化 CUDA 原生推論路徑,更多的生產部署回饋到生態系中,而每一次軟體改進都會增加交付的 token 輸出,同時隨著時間降低每 token 的成本。

欲了解軟體如何倍增硬體效能,請參考這集關於 token 經濟學的 NVIDIA AI Podcast 和推論解決方案頁面。