現實世界廣闊無垠,實體 AI 系統若要在其中運作,需要理解場景如何變化、預測接下來可能發生什麼,並判斷一個動作將如何影響世界。
機器在工廠、倉庫、醫院等邊緣環境中運作。為了理解並在這些環境中行動,它們需要模型能在記憶體受限的系統上,提供資料中心級別的效能。
今天,我們在 Hugging Face 的 Cosmos 3 儲存庫上發布 NVIDIA Cosmos 3 Edge。這是一個擁有 40 億參數的開放世界模型,能幫助機器人與視覺 AI 代理理解周遭環境、即時推理,並在邊緣裝置上生成機器人動作。
該模型可在 NVIDIA 邊緣電腦上提供記憶體高效、高吞吐量的推論,包括 NVIDIA RTX PRO GPU、NVIDIA DGX、NVIDIA GeForce RTX™ GPU,以及 NVIDIA Jetson 系列,包括最新發布的 Jetson T2000 和 T3000 模組。
Cosmos 3 Edge 被設計為一個緊湊的開放模型,可作為小型視覺語言模型(VLM),提供一流的吞吐量和準確度,並實現即時推論。
作為一個後訓練的世界動作模型(WAM),Cosmos 3 Edge 以機器人控制解析度(640x360 觀察)運作,在 NVIDIA Jetson Thor 上每次推論能提供即時推理並生成 32 個動作,同時實現 15 Hz 的即時控制。
在同等規模(40 億參數)的模型中,Cosmos 3 Edge 在 VANTAGE-Bench 的視覺分析方面排名第一,在機器人策略學習方面達到最先進水平,為智慧基礎設施和機器人技術樹立了新標竿。
什麼是世界模型?
世界模型學習環境如何隨時間變化。它代表物體、運動、空間關係以及動作的影響。
想像一個機器人伸手去拿一個物體。識別物體只是第一步。機器人還必須了解物體在哪裡、其夾爪如何移動、接觸時可能發生什麼,以及哪個動作最有可能成功完成任務。
世界模型幫助機器人推理這些關係。它可以預測動作的視覺結果、推斷導致變化的動作,或生成動作以產生期望的結果。Cosmos 3 Edge 將這些功能整合在一個模型中,並在裝置上運行。其共享表示使實體 AI 系統能夠理解當前的世界狀態、模擬可能的未來,並將這些未來與動作連結起來。
兩個 Transformer 塔,一個共享表示
Cosmos 3 結合了兩個 Transformer 塔:自迴歸塔處理視覺和文字標記以進行理解和推理;擴散塔處理視覺、音訊和動作標記以進行預測、生成和神經模擬。
這兩個塔維護獨立的正規化層和多層感知器。它們共享多模態注意力層,這些層將語言、影片、音訊和動作的資訊對齊。這種設計允許模型在生成輸出之前對場景進行推理。
根據任務的不同,Cosmos 3 可以從自迴歸塔產生推理標記,或從擴散塔產生去噪影片和動作標記。注意力模式也適用於每種類型的資訊。語言使用因果注意力,其中每個標記都關注其之前的標記。擴散標記更廣泛地關注可用上下文,支持連貫的預測和生成。這些組件共同為模型提供了對正在發生什麼、接下來可能發生什麼以及動作如何影響結果的共同表示。
動作的共同表示
實體系統以不同的方式描述動作。車輛可能透過自我姿態和運動來表示動作。攝影機使用攝影機運動。機器人手臂使用其末端執行器的姿態,而手或夾爪還需要表示抓取狀態。
Cosmos 3 將這些不同的實體映射到一個共同的動作表示中。動作被編碼為緊湊的幾何向量,捕捉平移、旋轉和操控狀態。這在控制和世界的視覺結構之間建立了直接連結。
模型可以將像素的變化與物理運動、空間關係和控制輸入相關聯。因此,生成的影片不僅僅是視覺預測。它可以表示世界預計如何響應動作而變化。這為開發人員提供了基於運動、控制和因果關係的訓練資料。
策略模式
作為一種策略,Cosmos 3 預測一個動作及其預期的視覺結果。該模型可以生成系統應該做什麼,並模擬接下來可能發生什麼。這將世界模型直接連結到機器人策略訓練和評估。
輸入當前狀態,輸出動作和視覺結果。這些模式使一個模型能夠學習因果關係和策略。動作可以在模型中雙向流動,允許 Cosmos 3 Edge 預測動作的效果或從其效果推斷動作。
我們還發布了 Cosmos 3 Edge Policy (DROID):這是一個機器人操控策略,經過 DROID 資料集後訓練,用於夾取放置任務,並附帶後訓練腳本。開發人員可以使用一小組 H100 或 NVIDIA DGX Station,高效地微調 Cosmos 3 Edge 以適應其目標工作負載,然後部署到 NVIDIA 邊緣和加速運算平台。
後訓練樣本以提高效能
除了基礎模型之外,我們還發布了參考後訓練檢查點和訓練配方,以幫助開發人員為自己的應用程式調整和優化 Cosmos 3。Cosmos 3 是一個開放的世界基礎模型平台。隨著模型使用高品質、特定領域的資料進行後訓練,其在專業應用中的準確性將持續提高。
Cosmos 作為使用開放框架構建領域適應世界模型的起點。後訓練使開發人員能夠在保持輸出品質的同時提高模型效能。為了展示此工作流程,我們還發布了 Cosmos 3 Super 4 步蒸餾檢查點以及後訓練腳本,為 64B 模型提供更快的參考實作,幫助開發人員將 Cosmos 適應其自己的領域並實現更好的下游效能。
Cosmos 3 Super 4 步(文字轉圖像和圖像轉影片):這些是分佈匹配的蒸餾檢查點和腳本,可將擴散從 35-50 個去噪步驟減少到僅 4 個,提供高達 25 倍的推論速度,同時保持圖像和影片的品質和保真度。這些範例作為開發人員可以建構的參考實作。
使用開放訓練腳本,您可以為自訂機器人策略後訓練 Cosmos 3 Edge,或蒸餾 Cosmos 3 Super 以實現針對您應用程式量身定制的更快圖像和影片生成。
試用 Cosmos 3 Edge
下載模型:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos 3 Edge 透過共享的世界表示連結了理解、預測、模擬和動作。開發人員可以將其部署在更靠近感測器的裝置上。該模型可用作推理器或動作生成器。使用開放的 Cosmos 框架來自訂和專門化模型。
查看 Cosmos 3:https://huggingface.co/collections/nvidia/cosmos3
未來展望
我們將繼續推進 Cosmos 3 在實體 AI 領域的發展,即將在互動式世界生成、駕駛場景模擬和機器人策略方面進行改進。我們還投資於更快的推論和更高效的後訓練,涵蓋更廣泛的硬體,減少建構下游模型所需的時間和計算。
這包括使用 vLLM 等開放推論和優化框架優化 Cosmos 3 檢查點,更多優化和開發人員工具即將推出。



