NVIDIA Vera Rubin 平台正式登場,將引領兆級規模的 AI 運算。
Vera Rubin NVL72 的生產正在加速,其機架系統已在 CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作夥伴處運行。Vera Rubin 的供應鏈橫跨 30 個國家、超過 350 個工廠據點,是迄今為止為滿足客戶運算需求而建立的最大、最成熟的機架級供應鏈。
Vera Rubin 平台從晶片到電網都經過精心打造,旨在提供每瓦最高的效能和最低的代幣成本。CoreWeave 在 DeepSeek-R1 上的首次基準測試結果證明了一切:其每百萬瓦的吞吐量比 Grace Blackwell NVL72 高出 10 倍,直接命中對電力受限的 AI 工廠而言最重要的指標。
實現這一切的關鍵在於七個晶片和五個機架托盤之間的極致協同設計,包括 Vera Rubin NVL72、Vera CPU 機架、Groq 3 LPX、Spectrum-6 SPX 和 Vera BlueField-4 STX。這些元件被設計為一個單一系統,而非由現成的獨立產品組裝而成。
NVIDIA Vera CPU 是其核心。它重新定義了 AI 工廠 CPU 的可能性,專為代理時代設計和打造。其客製化的 Olympus 核心提供兩倍的單執行緒效能、三倍的核心間頻寬,以及比競爭晶片設計低 40% 的記憶體延遲,使其成為處理最重要的代理式工作負載時最有效率的單執行緒 CPU。
在網路方面,該平台的第六代 NVLink 擴展技術在複雜工作負載下,提供比現成乙太網路高出兩倍以上的吞吐量、三倍低的延遲和十倍高的封包速率。對於橫向擴展,Spectrum-X Ethernet 結合了 102.4T Spectrum-6 交換機系統、1.6T ConnectX-9 SuperNICs、自適應路由、進階擁塞控制、遙測和開放作業系統支援,實現比現成乙太網路高 1.6 倍的 RDMA 頻寬。
全球領先的 AI 基礎設施建構者,包括 CoreWeave、Microsoft、SpaceXAI 和 Tesla,都是首批採用 Spectrum-6 交換機以加速其 AI 工廠的客戶。NVIDIA Photonics 採用共同封裝光學元件進行橫向擴展,這是業界首款量產的此類交換機,與可插拔收發器相比,功耗降低五倍,平均故障間隔時間 (MTBI) 提高十倍,CoreWeave、Lambda 和 OCI 都是首批採用者。
Spectrum-XGS Ethernet 將效能擴展到多個站點,提供 1.9 倍的多站點吞吐量,因為兆級規模的 AI 並非單一建築物就能解決的問題。NVLink Fusion 更將 NVIDIA 基礎設施平台開放給第三方 XPU,讓合作夥伴能在經過驗證的 NVLink 擴展堆疊和生態系統上,更快地將產品推向市場。
NVIDIA 三代機架級協同設計,打造出 Vera Rubin NVL72 系統,其托盤內沒有纜線、風扇或軟管,將運算托盤的組裝時間從數小時縮短至一分鐘。45 攝氏度的液體冷卻入口溫度設計,實現了無需冷卻機的乾式冷卻器運作。對於新的 AI 工廠,這種較高溫度的乾式冷卻與閉環液體冷卻系統結合,每年每百萬瓦可節省數百萬加侖的水。
Vera Rubin 正在為歐洲的 AI 基礎設施提供下一代效能。它是 Microsoft 和 Mistral 新擴大合作夥伴關係的基礎,將尖端 AI 帶到該地區,結合開放的歐洲模型與雲端和客戶控制的環境,使政府和受監管行業能夠以自己的方式採用。
這項合作夥伴關係的基礎是一項新的數十億美元協議,重點是擴大歐洲的 AI 基礎設施。Mistral 正在增加其 GPU 容量,利用數千個最新的 NVIDIA Vera Rubin GPU,為客戶提高 AI 運算可用性,並提供一個用於訓練、推論和大規模部署的共享平台。
NVIDIA Vera Rubin 正在全面投產。這款機架級 AI 超級電腦整合了七個協同設計為一個系統的新晶片,將為下一代 Mistral Compute 和 Microsoft 的歐洲 AI 基礎設施提供動力,利用數萬個 GPU。歐洲希望擁有世界上最強大的 AI,在其自己的法律下運行,接近本土,並完全在其控制之下。
而且標準不斷提高:代理式系統消耗的代幣可能比傳統 AI 應用程式多達 15 倍,這使得高效基礎設施成為戰略重點。滿足這一期望不僅需要運算能力:還需要能夠有效擴展,同時滿足區域對資料控制、治理、彈性和戰略自主權的要求的 AI。Vera Rubin 為歐洲的開放模型生態系統提供了運算基礎。其全堆疊架構結合了加速運算、網路和軟體,使模型和代理從訓練到生產都能高效運行。
Microsoft、Mistral 和 NVIDIA 共同在公有雲、雲端連接和完全離線的私有雲環境中提供主權就緒的 AI,將開放模型的靈活性與大規模運行所需的基礎設施結合起來。Mistral Medium 3.5 和 OCR 4 現已在 Microsoft Foundry 中提供,Mistral 模型也已整合到 Microsoft Copilot Studio 中。
透過 Azure Local 和 Foundry Local,客戶可以在雲端和客戶控制的環境中使用相同的模型、工具和操作模式。
政府機構可以將 AI 應用於敏感工作流程。醫療保健和金融服務組織可以在區域要求內進行部署。製造商可以在現場處理資料以加快決策。與 NVIDIA GB200 NVL72 相比,Vera Rubin NVL72 每百萬瓦可提供高達 10 倍的代幣,每百萬代幣的成本僅為十分之一,在相同的功耗下提供更多智慧。
主權 AI 不應迫使組織在創新、經濟和控制之間做出選擇。憑藉 Vera Rubin 作為運算基礎,以及 Microsoft 和 Mistral 提供主權雲端基礎設施和開放的歐洲模型,歐洲可以同時追求這三者。請閱讀 Microsoft 和 Mistral 的新聞稿以獲取更多詳細資訊。
CoreWeave 與 NVIDIA 攜手採用極致協同設計,在 Vera Rubin NVL72 上實現了數量級的效能飛躍。與 CoreWeave 等合作夥伴的密切合作,對於將新一代 NVIDIA 加速運算引入 AI 工廠至關重要。經過數月的共同工程工作,CoreWeave 成為第一個啟動並驗證 Vera Rubin NVL72 的 AI 雲端服務商,現在正分享來自實際硬體的首批測量效能數據。
CoreWeave 在 Vera Rubin NVL72 上運行了 DeepSeek-R1 基準測試,與 Grace Blackwell NVL72 相比,每百萬瓦每秒代幣數提高了 10 倍。每百萬瓦代幣數是決定 AI 基礎設施能否盈利擴展的指標。
更多的每百萬瓦代幣數意味著在相同的電力預算下獲得更多智慧,或以顯著更少的電力運行相同的工作負載。Jane Street 等 AI 實驗室和企業將利用 Vera Rubin 平台在 CoreWeave 雲端上擴展其 AI 工廠。
DeepSeek R1 的專家混合 (MoE) 架構使得大規模的全對全 GPU 通訊成為關鍵要求:每個代幣都必須在分散式專家子網路中路由。Vera Rubin NVL72 的 260 TB/s 全對全 NVLink 6 網路消除了這一限制,使整個機架能夠作為一個統一的加速器運行。
CoreWeave 是首批部署 NVIDIA Spectrum-X Ethernet SN6600-LD 作為 Vera Rubin NVL72 交換網路的客戶之一。CoreWeave 採用基於 102.4 Tb/s Spectrum-6 交換晶片並具備液冷設計的產品,部署了高密度交換機機架,每個機架提供 1.64 Pb/s 的頻寬,比上一代氣冷交換機的容量高出 100%。
CoreWeave 還提供一個完全無阻塞、多平面、多軌道的脊葉式網路,連接 Vera Rubin NVL72 GPU,且沒有超額訂閱問題。
Google Cloud A5X 執行個體由 NVIDIA Vera Rubin NVL72 和 Google Virgo Network 提供動力,用於資料中心橫向擴展網路。圖片來源:Google Cloud。NVIDIA Vera Rubin NVL72 正在為 Google Cloud 的首個 A5X 執行個體提供動力,該執行個體現已為倫敦新創公司 Ineffable Intelligence 啟用並運行。
Ineffable Intelligence 正在開發新一代智慧「超級學習者」系統,這些系統透過經驗持續學習,以在所有領域發現新的突破。Ineffable Intelligence 的代理直接從與其環境的互動中學習,而不是從靜態資料集中學習。
Ineffable 並非使用大型語言模型,而是透過強化學習開發「超級學習者」系統,在持續模擬、大規模並行的環境中產生經驗,並迅速將這些經驗轉化為策略更新和評估。
這些緊密耦合的學習迴圈對運算、記憶體頻寬和互連提出了極高的要求,需要能夠以極大規模和極低延遲運行的基礎設施。Ineffable Intelligence 共同創辦人 Lasse Espeholt 表示:「下一個研究時代需要下一代硬體。我們很榮幸能與 NVIDIA 和 Google Cloud 的團隊合作,他們讓我們能夠提早使用 Vera Rubin。
兩個團隊的支持無與倫比;我們幾乎立即就能開始運行,並且已經在為我們的超級學習者測試基礎設施。」
NVIDIA Vera Rubin NVL72 專為此類代理式訓練而設計,提供可預測的延遲、高利用率以及比上一代系統顯著更高的每美元智慧,使其成為大規模強化學習的理想平台選擇。在 Google Cloud Next 上發布的 Google Cloud A5X 執行個體,是基於 NVIDIA Vera Rubin NVL72 機架級系統構建的裸機執行個體,與上一代相比,每代幣的推論成本降低高達 10 倍,每百萬瓦的代幣吞吐量提高 10 倍。
A5X 採用 NVIDIA ConnectX‑9 SuperNICs 結合下一代 Google Virgo 網路,實現單一站點可擴展至數萬個 NVIDIA Rubin GPU,以及跨多站點配置近百萬個 GPU 的叢集,為客戶提供統一、AI 優化的堆疊,用於訓練、微調和服務尖端、開放、代理式和物理 AI 模型,同時優化效能、成本和永續性。
這種基礎設施旨在幫助解鎖下一代強化學習系統,以在超級學習和超級智慧方面取得突破。
DeepInfra 的基準測試結果顯示,NVIDIA Vera CPU 的速度是其他 CPU 的兩倍以上,並且可以支援更多的並行 AI 代理。雲端平台 DeepInfra 是 NVIDIA 開放 AI 生態系統的早期參與者,它獨立設計並運行了使用其生產 AI 代理基礎設施的基準測試。
DeepInfra 每週處理近 5 兆個代幣,其中約 30% 由代理式系統驅動。其雲端平台專為高吞吐量 AI 推論而建。
基準測試顯示,在相同服務品質下,它支援多達 1.6 倍的並行 AI 代理,並且比替代 CPU 快 2.2 倍的協調速度,同時提高了基礎設施利用率和成本效益。這些結果表明,NVIDIA Vera CPU 提供了生產代理式 AI 所需的成本效益、低延遲和高吞吐量。隨著 AI 代理承擔更複雜的推理、規劃、工具使用和資料移動,CPU 效能變得越來越重要。



