NVIDIA 全新開源世界基礎模型 Cosmos 3,整合了視覺推理、多模態生成與動作預測能力,旨在協助機器人、自駕車及視覺 AI 代理在現實世界中能「先思後行」。現實世界瞬息萬變。為了自主運作,實體 AI 系統,包括機器人、自駕車 (AV) 和智慧空間,不僅需要理解它們所見、以及造成這些現象的原因,更要能預測接下來可能發生的事。
在倉庫中,機器人可能會遇到從未見過的物件配置。在道路上,自駕車可能需要對突然從停放車輛間走出的行人做出反應。而在工廠裡,安全系統必須預測堆高機的行進方向,而不僅僅是偵測到它的存在。在現實世界中捕捉並重現這些情境,既緩慢又昂貴,而且往往難以大規模重複。
NVIDIA Cosmos 3 正是為了解決這個循環而生。這款全新世界基礎模型,於 COMPUTEX 期間的 NVIDIA GTC Taipei 上發表,在單一模型中結合了視覺推理與跨文字、影片、圖像、環境聲音及動作的多模態生成能力,旨在協助開發者建立具備物理情境的世界資料。
Cosmos 3 賦能感知、預測與行動。深入了解 Cosmos 3 的混合式 Transformer 架構如何讓推理區塊首先解讀場景中發生的事情,然後利用生成區塊運用該情境來創建具有物理基礎的輸出,從合成影片到機器人任務資料。為真實世界機器人任務生成動作資料Cosmos 3 是一個通用型基礎模型,透過多樣化資料訓練,使其對場景、運動和機器人動作之間的關係有廣泛的理解。
它是一個具備原生動作生成能力的「全能模型」(omnimodel),這表示它可以產生數值化的動作資料,例如關節角度、夾爪位置和軌跡點,來描述機器人應如何移動以完成任務。為了學習,機器人需要的資訊不只是場景的圖像或影片。例如,對於夾取放置任務,它們需要動作訊號來引導如何在環境中觸及、抓取、移動和放置物件。
開發者可以微調 Cosmos 3,使其機器人專精於特定的實體型態、攝影機佈局、工作空間或任務。NVIDIA GEAR 團隊正利用 Cosmos 3 開發影片動作模型,協助具身代理(embodied agents)學習如何在遊戲、模擬和真實世界機器人環境中進行推理、移動和行動。
語音提示詞:把所有香蕉放到盤子上。Agile Robots 正在開發人形機器人及其他實體型態(如 Thor 3 或 FR3),以自主、精確且高效地處理工業任務。該公司正利用 Cosmos 3 生成動作條件式機器人資料,用於其策略開發,以大規模創建多樣化的任務軌跡。
提示詞:用雙臂拿起核心電線並放入垃圾桶。Cosmos 3 Nano 經過後訓練的策略在 RoboLab 中表現領先,該平台用於在模擬環境中測試語言引導任務的策略,並在 RoboArena 中比較 DROID 機器人在真實世界環境中的策略。對智慧城市與動態空間進行推理Cosmos 3 能夠對場景進行推理,識別哪些物件正在移動、路徑可能在哪裡交叉,以及未來可能發生的狀態。
然後,它可以生成詳細的描述、預測場景變化或情境變體,協助開發者在工業和基礎設施環境中的視覺 AI 代理中連結理解、預測和警報功能。使用 Cosmos 3 進行推理的機器人動作規劃軌跡。對於交通系統、工廠、倉庫和公共空間而言,這意味著影像系統可以協助解讀隨時間變化的活動、發現異常,並為操作員提供關於複雜環境中發生情況的更豐富情境資訊。
Linker Vision 利用 NVIDIA 的實體 AI 和數位分身技術,建構智慧城市和工業解決方案。作為工作流程的一部分,它正運用 Cosmos 的視覺語言推理能力,分析即時攝影機串流、理解空間情境、提取有價值的洞察,並對數千個影像來源進行根本原因分析。
Linker Vision 利用由 Cosmos 驅動的視覺 AI 優化城市營運。Cosmos 3 在 VANTAGE-Bench(測試智慧基礎設施場景理解)和 TAR 挑戰賽(測試交通異常推理)中,是排名最高的開源視覺語言模型。生成罕見、長尾情境隨時間演變碰撞和長尾邊緣案例是準備人形機器人、機械手臂機器人甚至手術機器人應對真實世界最重要的範例之一,但它們難以安全、重複且大規模地捕捉。
Cosmos 3 作為一個影片基礎模型,可以協助生成物理上合理(physically plausible)的影片序列,以教導真實世界如何隨時間變化。對於實體 AI 開發者而言,這些生成的範例可以支援合成資料工作流程和未來狀態預測,與真實世界的駕駛資料並行,即使條件逐幀演變。
圖像轉影片提示詞:一場高速賽車活動,一輛車輛正在多個蜿蜒的彎道中行駛。Cosmos 3 的變體在 Artificial Analysis 的開源權重排行榜上名列第一。Cosmos 3 也在 Physics-IQ、R-Bench 和 PAI-Bench 等世界生成基準測試中名列前茅。
開始使用 Cosmos 3開發者可以在 build.nvidia.com 上試用 Cosmos 3,從 Hugging Face 下載開源模型,利用 GitHub 上的資源客製化模型並生成合成資料,並透過 NVIDIA NIM 微服務進行部署。
憑藉 Linux Foundation 的 OpenMDW 1.1 授權,開發者可以在單一、以模型為中心的授權下,將 Cosmos 模型材料應用於各種實體 AI 工作流程。此授權使得訓練、修改、貢獻、重新分發和部署包括權重、架構、文件、資料集、基準測試和程式碼在內的資源變得更加容易。相關新聞



