代理式 AI 的時代已經來臨,但要實現其潛力,僅有好的模型是不夠的。它還需要快速的硬體、安全的執行環境、反應靈敏的資料層,以及針對長時間推理進行微調的模型。NVIDIA 和 Microsoft 正在將這一完整的堆疊帶給 Windows 裝置、Azure 雲端和地端部署的開發者。

在 Microsoft Build 大會上,NVIDIA 創辦人暨執行長黃仁勳透過台北的直播,與 Microsoft 董事長暨執行長 Satya Nadella 的主題演講連線,討論雙方擴大的合作夥伴關係,內容包括:適用於 Windows 的 NVIDIA RTX Spark 和 DGX Station、NVIDIA GPU 加速的 Microsoft Fabric、Microsoft Foundry 上的 NVIDIA 開放模型、GitHub Copilot 中採用 NVIDIA OpenShell 的安全執行環境,以及下一代由 NVIDIA 驅動的 AI 工廠。

為代理重新構想 Windows:從 RTX Spark 到適用於 Windows 的 DGX StationNVIDIA 和 Microsoft 正在為 AI 代理時代重新構想 Windows PC。透過 RTX Spark 筆記型電腦和小型桌上型電腦,以及適用於 Windows 的 DGX Station 桌邊 AI 超級電腦,開發者可以在 Windows 上原生建構、微調和執行代理。

RTX Spark 是一個新的開始,它驅動著全球首批專為個人代理打造的 Windows PC,提供 1 petaflop 的 AI 效能、高達 128GB 的統一記憶體、全天電池續航力,以及在不插電情況下仍能提供完整的 AI 和繪圖效能。這些系統整合了 NVIDIA 超過 30 年的創新技術,包括 CUDA、RTX、DLSS 和 TensorRT,將於今年秋季由 Microsoft Surface、ASUS、Dell、HP、Lenovo 和 MSI 等廠商推出。

適用於 Windows 的 DGX Station 是最強大的桌邊 AI 超級電腦,用於在 Windows 企業應用程式和工作流程上建構及執行代理。它搭載 NVIDIA GB300 Grace Blackwell Ultra Desktop Superchip,提供高達 748GB 的一致性記憶體和 20 petaflops 的 FP4 效能,可運行高達 1 兆參數的尖端模型,以支援全時運作的企業代理。

預計 ASUS、Dell、GIGABYTE、HP、MSI 和 Supermicro 將於第四季推出相關系統。這兩款產品都運行 NVIDIA OpenShell,這是一個為自主代理設計的安全執行環境。欲了解更多資訊,請參閱這篇 Microsoft 部落格文章:「NVIDIA RTX Spark 加速 Windows PC 的強大新篇章」透過 Microsoft Foundry 上的 NVIDIA 開放模型,為企業規模的代理式工作流程提供動力代理式 AI 運行於模型系統之上。

透過 Foundry Agent Service 中託管的 NVIDIA、Anthropic 和 OpenAI 模型,以及 Hermes 特殊代理,企業可以在 Azure 上實現代理式系統,並具備內建的身份識別和治理功能。Anthropic 的 Claude 模型現在可以在 Azure 上的 NVIDIA GB300 Blackwell Ultra 系統上原生運行,並將於未來幾週內向客戶提供。

NVIDIA Nemotron 3 Ultra 是一個新的開放式尖端推理模型,適用於編碼、研究和企業工作流程中的長時間運行代理,本月已在 Foundry 受管運算上推出,同時還有用於語音辨識的 Nemotron 3.5 ASR 和 Nemotron 3.5 Content Safety。

開發者可以將 Nemotron 與尖端模型和本地模型結合使用,為每個工作流程優化成本和品質。NVIDIA 在 Foundry 上的開放模型組合現在涵蓋了代理式 AI、實體 AI 和科學 AI。NVIDIA Cosmos 3 是首個用於實體 AI 的完全開放全能模型,它帶來了視覺推理、世界模擬和動作生成功能。

NVIDIA Earth-2 AI 氣象模型可透過 Microsoft Planetary Computer Pro 和 Foundry 取得,用於企業預測和風險分析。NVIDIA Agent Toolkit 和 NVIDIA NemoClaw 藍圖為開發者提供了一個開源平台,用於在 Foundry 上建構生產級代理。

NVIDIA CUDA-X 函式庫,包括 cuDF、cuOpt、AI-Q 和 NeMo,現在可作為領域特定技能供代理使用。欲了解更多資訊,請參閱此 Build 分組會議:「使用 Microsoft Foundry 上的 NVIDIA Nemotron 模型編排特殊代理。」

加速 AI 時代的企業資料倉儲資料驅動代理式 AI,而快速存取資料至關重要。NVIDIA 加速運算現已整合到 Microsoft Fabric Data Warehouse 中,Microsoft 的內部基準測試顯示,在處理高併發工作負載時,SQL 執行速度比 CPU 驅動的基準快上 6 倍,比其他三家領先的雲端資料倉儲供應商快上 7 倍。

企業資料層現在可以跟上 AI 代理持續查詢和推理資料的速度,這是 NVIDIA 和 Microsoft 多年來從研究到生產深度工程協作的成果。欲了解更多資訊,請參閱這篇 Microsoft 部落格文章:「Microsoft Build 2026:使用 Microsoft Fabric 和 Microsoft Databases 建構代理式應用程式」推進實體 AI 和自主系統實體 AI 是代理的下一個前沿領域。

Microsoft 正在將 NVIDIA 的開源實體 AI 技能和工具與 Azure 及其 Physical AI Toolchain 整合。開發者將獲得一個統一平台,由 Cosmos 3 的混合式 Transformer 架構驅動,用於模擬、訓練和部署自主系統,包括能夠感知、推理、規劃和在實體世界中行動的機器人、自駕車和工業系統。

Cosmos 3 在視覺推理、世界生成和動作生成的關鍵基準測試中,於開放模型中排名第一。透過 NVIDIA RTX PRO 6000 Blackwell Server Edition 和 Nemotron 模型增強 Azure Local 和 Foundry Local代理式 AI 正在超越雲端。

Microsoft 正在將 Azure Local 上的 Foundry Local 引入 NVIDIA RTX PRO 6000 Blackwell Server Edition 平台。搭配 NVIDIA Nemotron 開放模型系列,企業可以在資料所在地運行高效能 AI 工作負載,無論是在地端、混合式還是主權環境中,都能兼顧效能和治理。

Azure Local 上的 Foundry Local 現在支援多節點部署和 vLLM 執行環境,可針對製造、能源、主權資料中心和其他延遲敏感情境擴展推論。欲了解更多資訊,請參閱這些 Microsoft 部落格文章:「透過 Foundry Local 和 Azure Local 釋放實體 AI 的可能性」、「使用 Azure Local 上的 Foundry Local 擴展地端 AI」透過 NVIDIA OpenShell 將安全代理開發引入 GitHub Copilot隨著代理從編碼輔助轉向自主執行,它們需要具備真實能力,但又無需真實憑證。

NVIDIA OpenShell 現已整合到 GitHub Copilot 中,解決了這個問題:每個代理都在自己的沙盒容器中隔離運行,並且每個對外呼叫都會在存取檔案、網路或憑證之前,根據政策進行評估。政策以程式碼形式編寫,在儲存庫中進行版本控制,並可即時更新。

OpenShell 是基於 Apache 2.0 授權的開源專案,與模型無關,並可跨越地端、混合式和雲端環境。欲了解更多資訊,請參閱此 Build 閃電演講:「使用 GitHub Copilot 和 NVIDIA OpenShell 實現安全代理工作流程。」

威斯康辛州 Fairwater AI 工廠啟用,並通過 NVIDIA Vera Rubin 驗證Microsoft 位於威斯康辛州的 Fairwater AI 工廠現已提前啟用,將數十萬個 NVIDIA Grace Blackwell 系統作為單一 AI 工廠運行,並與喬治亞州的一個類似 AI 工廠連接,以提供可擴展的分散式 AI 系統,支援最嚴苛的尖端模型。

透過在電力、散熱、NVIDIA Spectrum-X 乙太網路和新的多路徑可靠連接 (MRC) 傳輸協定方面的聯合工程,Microsoft 的 Fairwater AI 資料中心設計正在優化 token 經濟學。此外,Microsoft 已驗證 NVIDIA Vera Rubin 平台,該平台現已全面投入生產,可在 Azure 資料中心進行部署。

Vera Rubin 無需改裝即可與 Blackwell 並行運作,每兆瓦可提供高達 10 倍的推論吞吐量,並將每個代理式 token 的成本降低一個數量級。內建的 NVIDIA Confidential Computing 在代理進行大規模推理時保護模型和資料。

NVIDIA Dynamo 推論框架將這些優勢擴展到軟體層面,加速 AKS 上的模型冷啟動,並透過 NVIDIA Grove 實現 Kubernetes 原生分散式推論編排。欲了解更多資訊,請參閱這篇 Microsoft 部落格文章:「在 AKS 上使用 NVIDIA Dynamo-Grove 擴展多節點 LLM 推論 (第四部分)」探索 Microsoft Build 大會上 NVIDIA 的所有議程、演示和實作實驗室。