在CVPR大會上,NVIDIA發表了全新的實體AI代理技能,協助研究人員和開發者加速自駕車、機器人與視覺AI系統的開發。
實體AI研究的核心挑戰不僅僅是開發更強大的模型,而是圍繞這些模型建立完整的工作流程,重建真實世界場景、生成邊緣案例情境、訓練策略、評估行為並快速迭代。目前,這些步驟分散於不同的工具中,減緩了實驗進度,因為研究人員難以將它們整合起來。
本週稍早,NVIDIA宣布推出NVIDIA Cosmos 3,這是實體AI的開放前沿模型,也是全球首個整合視覺推理、世界與動作生成的全能模型。該世界基礎模型在實體AI的核心開放模型公開排行榜上表現領先,為實體AI開發提供了核心能力。NVIDIA實體AI技能與Cosmos、NVIDIA函式庫和模擬框架結合,協助研究人員比以往更快地從模型能力轉向可擴展的端到端工作流程。
推進自駕車研究超越記錄里程
對於自駕車研究人員而言,問題在於駕駛的「長尾效應」,罕見的互動、不尋常的道路幾何、光線變化和邊緣案例行為,這些都難以重複收集,但對於訓練和驗證至關重要。
透過NVIDIA自駕車技能,研究人員和開發者可以指派AI代理來自動化從車隊資料重建場景並生成合成情境的工作流程。神經重建技能協助AI代理將車隊擷取的資料轉化為可編輯的3D場景,用於模擬和合成資料生成,而包括NVIDIA Omniverse NuRec、InstantNuRec、Harmonizer和HiGS加速渲染器等技術則有助於加速重建、提升場景真實感並生成新視角。
InstantNuRec 實現從影像快速進行 3D 高斯道路場景重建,無需針對每個場景進行最佳化。
對於自駕車研究人員而言,可重複模擬有助於改變條件、比較系統反應並發現超越真實世界資料所能捕捉的情境中的故障模式。
NVIDIA AlpaGym 是一個開源的閉環強化學習框架,透過將策略部署和高擬真模擬與代理技能連接起來,並擴展至數千個GPU,協助研究人員完成設定、部署和評估。NVIDIA OmniDreams 是一個動作條件式生成世界模型,將照片級真實感渲染加入模擬循環,即時生成直接響應策略動作的攝影機畫面。
NVIDIA 還透過其迄今為止最強大的開放駕駛基礎模型,推進自駕車研究:NVIDIA Alpamayo 2 Super,一個開放的 320 億參數推理視覺語言動作 (VLA) 模型,可在完整的駕駛堆疊中進行推理、規劃和行動,以實現更安全、可擴展的 Level 4 開發和部署。
推進真實世界的視覺AI系統
對於視覺AI研究而言,瓶頸在於創建足夠的受控範例,以研究當視覺條件、物體狀態或時間事件改變時,模型如何表現。零樣本異常檢測、合成異常生成和少樣本缺陷識別等工作都遇到了相同的資料瓶頸。
視覺檢測新技能可在不同表面生成多種罕見缺陷。
新的NVIDIA Metropolis技能正協助研究人員和開發者使用AI代理生成合成視覺情境,包括異常、增強資料並支援偽標籤。這些技能受益於Cosmos 3的混合變壓器架構,該架構使用推理變壓器分析觀察結果並將指令傳送給生成塔,有助於擴展基於物理的虛擬世界。
建立高精度視覺檢測模型的研究人員可以使用缺陷影像生成技能,利用真實影像在不同表面創建不同缺陷的範例。該工作流程結合了用於模擬的NVIDIA Isaac Sim、用於協調和視覺語言推理的Cosmos 3和NVIDIA OSMO,讓研究人員能夠創建罕見的視覺案例並評估模型是否正確響應。
新的 NVIDIA Metropolis VSS Blueprint 技能可從大量影片資料中提取洞察。
對於影片AI代理,NVIDIA Metropolis 影片搜尋與摘要 (VSS) 藍圖、NVIDIA TAO 和影片增強技能有助於從大量影片資料中提取洞察、微調模型並自動化建構與評估循環。這為研究人員提供了一種更可重複的方法來開發推理視覺AI代理,這些代理能夠檢測事件、對複雜場景進行推理、總結活動並發送警報。
透過代理就緒的模擬工作流程擴展機器人學習
教導機器人導航或操作等技能歸結為迭代。對於研究人員而言,瓶頸在於建立足夠的受控環境和策略部署,以了解機器人行為如何根據任務、設定和實體而變化,這項工作通常意味著手動將模擬環境、任務變體、策略訓練和評估拼接在一起。
NVIDIA Isaac Sim 6.0 包含代理友善的技能和連接器,有助於自動化工作流程。
透過NVIDIA機器人學技能,研究人員可以指派AI代理,利用NVIDIA Omniverse函式庫、Isaac Sim和Isaac Lab框架,自動化場景準備、模擬和機器人學習中最常見的開發步驟。代理可以協助在Isaac Sim中啟動模擬會話、編寫場景、控制模擬、擷取資料和驗證環境,而Isaac Lab技能則支援強化學習設定、訓練、評估和客製化環境開發。
新的 NVIDIA Isaac 移動技能自動化導航工作流程。
專業技能將該工作流程擴展到移動和操作。Isaac移動技能支援導航工作流程,涵蓋場景搜尋、USD轉換、環境註冊、殘差強化學習和策略評估,而專業的Isaac Lab代理工作流程則有助於模擬到模擬 (sim-to-sim) 和模擬到真實 (sim-to-real) 任務,例如環境建構、物理調整、除錯和效能分析。
對於醫療保健機器人學,Cosmos-H-Surgical-Simulator 透過生成逼真的手術機器人資料用於策略訓練和評估來推進研究。透過直接從真實手術資料學習,而不是手動設計的物理模型,它有助於縮小模擬到真實的差距,支援自主手術任務的開發。
Cosmos 3 可以進一步協助生成合成資料和場景變體,然後透過特定實體的行為和環境資料支援後訓練,用於從抓取放置到靈巧操作的任務。
NVIDIA 在 CVPR 的研究成果
NVIDIA的技術,包括GPU、開放模型、模擬框架和CUDA加速函式庫,在大多數被接受的CVPR 2026論文中被引用,並被卡內基美隆大學、史丹佛大學、加州大學柏克萊分校、清華大學和北京大學等全球領先的研究實驗室和機構採用。
NVIDIA研究人員將在6月3日至7日於丹佛舉行的CVPR大會上,展示電腦視覺、實體AI、自主系統、神經渲染、生成式AI和機器人學領域的研究成果。
NVIDIA在CVPR的參與還包括有助於衡量實體AI進度的開放研究挑戰:
AI城市挑戰賽,一項針對智慧城市應用的頂級電腦視覺競賽,現已邁入第十年。
PAI-AV 推理挑戰賽,一個新的開放基準,評估VLA模型使用因果鏈標籤解釋駕駛決策的程度。
AlpaSim 閉環端到端駕駛挑戰賽,一個新的開放基準,在真實世界重建情境的閉環模擬中測試自動駕駛策略。
作為 Cosmos 3 資料集發布的一部分,來自新機器人模擬資料集的範例影片網格。
NVIDIA 還透過用於訓練、微調和評估的資料集,擴展實體AI背後的研究基礎設施。NVIDIA Physical AI Dataset 在 Hugging Face 上的下載量已超過 1500 萬,而NVIDIA Isaac GR00T X Embodiment Sim 已成為下載量最大的機器人學資料集之一。
新發布的資料集包括GRAIL(包含約50小時的人形物體互動資料)以及用於訓練Cosmos 3的六個合成影片資料集,涵蓋機器人學、物理、數位人類、自動駕駛、倉儲安全和空間推理。
供應狀況
NVIDIA實體AI代理工具和技能現已透過GitHub開放提供。
用於合成資料生成的代理技能和工具,神經重建、影片增強、缺陷影像生成,也可在NVIDIA Brev上作為Physical AI Launchables即時試用,這些是預配置環境,捆綁代理技能和工具,以實現更快的合成資料生成和評估。Launchables在託管的NVIDIA H100 Tensor Core GPU上運行,並為研究人員提供免費試用點數。
了解更多NVIDIA在CVPR的資訊,並探索NVIDIA研究在實體AI、電腦視覺和自主系統方面的工作。開始使用Isaac GR00T和NVIDIA機器人學工具。



