NVIDIA Cosmos 3 隆重登場,即日起可在 Hugging Face 上取得。Cosmos 3 代表著實體 AI 世界基礎模型(WFMs)的一大躍進:它是一個單一、統一的通用模型,將世界生成、物理推理和行動生成整合於一個模型中。開發者不再需要處理不同的模型和推論管線,Cosmos 3 一應俱全。

無論您是為機器人、自動駕駛車輛或智慧空間進行開發,Cosmos 3 都能為您提供模擬和理解物理世界的基礎。本次發布包含以下內容:Cosmos 3 Super 和 Cosmos 3 Nano 模型,附有模型卡和授權資訊,可在 Hugging Face 上取得。

Cosmos 3 與 Diffusers 整合,用於生成管線。用於在您自己的資料上訓練 Cosmos 3 的後訓練腳本(可在 GitHub 上取得)。針對實體 AI 的開放式合成資料生成(SDG)資料集。第一節:Cosmos 3 有何新功能?

相較於先前的 Cosmos 版本,Cosmos 3 最大的改變在於它是一個基於 Transformer 混合(MoT)架構的通用模型。過去,開發者必須使用不同的模型來處理不同的功能,例如世界生成(Cosmos Predict)、受控生成(Cosmos Transfer)、場景理解(Cosmos Reason)和策略生成(Cosmos Policy)。

Cosmos 3 將所有這些功能整合到一個單一模型中,能夠在一次統一的前向傳播中進行推理並生成不同的模態。這表示您現在可以透過一個模型完成所有這些任務:從文字、圖像、影片或行動輸入生成真實且符合物理邏輯的影片世界。推理運動、因果關係和空間關係等物理特性。

根據當前狀態預測未來的影片和行動序列。為何這對實體 AI 至關重要Cosmos 3 有助於建構能夠理解真實世界的實體 AI 系統。它不僅處理像素和標記(tokens),還能理解運動、因果關係、物理和行動。無論您是訓練機器人摺疊衣物、建構自動駕駛模擬,還是為倉庫安全情境生成合成訓練資料,Cosmos 3 都是專為這些應用場景設計的基礎模型。

Cosmos 3 為機器人夾取放置應用場景生成的影片。Cosmos 3 為長尾駕駛情境生成的影片。使用 Cosmos 3 進行圖像到影片生成,用於倉庫安全資料。Cosmos 3 在自動駕駛應用中的思維鏈推理。架構Cosmos 3 建構於 MoT 骨幹網路之上,可在單一統一架構中處理所有模態,文字、圖像、影片、音訊和行動。

每種模態首先由專用編碼器進行編碼(ViT 用於視覺理解,VAE 用於視覺/音訊生成,以及用於行動的領域感知向量),然後投影到共享的表示空間中。輸入序列被分為兩個子序列:一個是透過下一個標記(token)預測來處理推理和理解的自迴歸(AR)子序列,另一個是透過迭代去噪來處理生成的擴散(DM)子序列。

AR 和 DM 標記在每個 Transformer 層中使用獨立的參數集,但透過聯合注意力進行互動,這使得單一模型能夠在作為 VLM、影片生成器、正向/逆向動力學模型或機器人策略之間無縫切換,而無需任何架構更改。模型版本本次發布的 Cosmos 3 包含兩種模型尺寸,針對不同的部署情境進行了最佳化:Cosmos 3 Nano – 這是一個 160 億參數的模型(80 億用於推理器,80 億用於生成器),針對高效推論進行了最佳化。

Cosmos 3 Nano 設計用於工作站級運算,例如 RTX PRO 6000 GPU,並可在 Hugging Face 的 nvidia/Cosmos3-Nano 取得。Cosmos 3 Super – 這是一個 640 億參數的模型(320 億用於推理器,320 億用於生成器),專為大規模合成資料生成(SDG)和研究而設計,可在 NVIDIA Hopper 和 Blackwell GPU 上運行。

Cosmos 3 Super 可在 Hugging Face 的 nvidia/Cosmos3-Super 取得。第二節:Cosmos 3 功能Cosmos 3 透過單一統一模型支援多種輸入和生成模態:輸入模態 | 輸出模態 | 應用文字 | 圖像 | 影片 | 影片 | 影片模型文字 | 影片 | 文字 | 視覺語言模型 (VLM)行動 | 圖像 | 文字 | 影片 | 正向動力學模型文字 | 影片 | 行動 | 逆向動力學模型圖像 | 文字 | 影片與行動 | 策略模型提示詞指南對於影片生成,我們建議使用敘述性段落形式的詳細提示詞。

例如:影片開始於一輛車在多車道高速公路上行駛的視角,天空晴朗湛藍。道路兩旁是茂密的綠樹,營造出寧靜的環境。前方可見數輛車輛,包括一輛顯眼的白色半掛卡車和各種小客車,它們保持著穩定的速度。高速公路有多條車道,由混凝土護欄分隔,場景沐浴在明亮的陽光下,顯示著晴朗的一天。

隨著影片的進展,前方車道突然出現大量碎片。由於幾乎沒有時間避開,自車不得不駛過碎片並繼續前進。當自車駛過散落的物體時,發生了明顯的顛簸。這是從車內拍攝的第一人稱視角,捕捉了前方的道路和周圍的環境。對於行動生成,提示詞應簡潔並提供空間參考。例如:將鍋子放在紫色物品的左側。

此影片是從第一人稱視角拍攝場景。在 GitHub 上的提示詞指南中,可以找到提示詞升級範本以及編寫高品質提示詞的最佳實踐。第三節:將 Cosmos 3 與 Diffusers 搭配使用Cosmos 3 已與 Hugging Face Diffusers 函式庫整合,只需幾行程式碼即可輕鬆使用世界生成管線。

您可以透過 Cosmos3OmniPipeline,經由熟悉的 DiffusionPipeline 運行 Cosmos 3。這樣做的目標是實現 Cosmos 3 的無縫採用,並與您現有的管線整合。讓我們看看使用 Cosmos 3 Nano 模型進行單幀圖像生成的文字轉圖像範例:import torchfrom diffusers import Cosmos3OmniPipelinepipe = Cosmos3OmniPipeline.from_pretrained("nvidia/Cosmos3-Nano", torch_dtype=torch.bfloat16, device_map="cuda")prompt = ("A medium shot of a modern robotics research laboratory with white walls and a gray floor. ""A robotic arm with a metallic finish is mounted on a clean white workbench, its gripper positioned ""above a row of small colored objects. A laptop and neatly arranged tools sit beside the robot. ""A large monitor on the wall behind displays a software interface. The scene is brightly lit by ""overhead fluorescent lights.")result = pipe(prompt=prompt, num_frames=1, height=720, width=1280)result.video[0].save("cosmos3_t2i.jpg", format="JPEG", quality=85)這是 Cosmos 3 Nano 模型根據給定提示詞生成的圖像:文件中也包含文字轉影片、圖像轉影片等更多範例。

您可以在 Cosmos 3 Diffusers 文件中找到相關資訊和 API 用法。第四節:實體 AI 資料集作為 Cosmos 3 發布的一部分,NVIDIA 正在發布一系列合成資料生成(SDG)資料集,以幫助實體 AI 社群訓練和評估世界基礎模型。

這些資料集由 NVIDIA 各團隊生成,並可在 Hugging Face 上取得。資料集 | 領域 | 描述Embodied-Robot-Scenes | 機器人學 | 合成機器人模擬資料Physical-Interaction-Scenes | 物理學 | Isaac Sim 物理模擬資料Spatial-Reasoning | 推理 | 具身空間推理資料Digital-Human-Scenes | 人體運動 | 合成人體運動資料Autonomous-Driving-Scenarios | 駕駛 | 駕駛模擬資料Warehouse-Operations-Scenes | 倉庫安全 | 倉庫環境資料第五節:Cosmos 框架Cosmos 框架是一個用於訓練和服務像 Cosmos 3 這樣的世界基礎模型的端到端框架。

您可以在此找到推論和後訓練腳本,以及用於開發的代理技能。Cosmos 3 後訓練Cosmos 3 開箱即用,能夠理解並生成用於機器人、自動駕駛車輛和智慧空間的世界影片和行動,但某些應用可能需要針對特定資料集進行進一步的後訓練才能獲得最佳結果。

我們鼓勵針對不同的機器人、環境和任務對 Cosmos 3 進行後訓練,請查閱儲存庫中的後訓練指南。代理技能該儲存庫還附帶代理技能,可讓開發變得快速簡便。這些技能有助於驗證需求,並設定具有依賴項的環境。您也可以使用它們來了解儲存庫結構和範例、撰寫優質提示詞,或運行推論和後訓練腳本。

第六節:資源閱讀 Cosmos 3 技術部落格,了解 Cosmos 3 的功能、效能、後訓練以及使用 NIM 微服務進行部署的資訊。Cosmos 3 GitHubCosmos 3 NIM microservicesCosmos CookbookCosmos PageCosmos 3 Technical PaperDiffusers Cosmos Documentation致謝Cosmos 3 是 NVIDIA 許多團隊和人員之間出色合作的成果,其中包括 -Adeline Aubame, Aditya Mahajan, Aigul Dzhumamuratova, Akash Gokul, Akul Santhosh, Aleksandr Efitorov, Alex Sotelo, Alexander Schwarz, Alperen Degirmenci, Amol Fasale, Andrew Tham, Ankur Handa, Arihant Jain, Arslan Ali, Artur Zolkowski, Aryaman Gupta, Asawaree Bhide, Ashkan Mirzaei, Ashley Chow, Ashna Khetan, Atharva Joshi, Barnaby Simkin, Benedikt Falk, Brett Hamilton, Carlos Casanova, Chaeyeon Chung, Charles Zhou, Chen-Hsan Lin, Chen-Hsuan Lin, Chhavi Nijhawan, Chieh-Yun Chen, Chintan Shah, Chris Helvig, Chris Pruett, Cindy Zha, Cyrus Hogg, Dahjung Chung, Dan Blick, David Wehr, Dawid Majchrowski, DeLesley Hutchins, Delin Qu, Dennis Lynch, Diego Garzon, Dima Zhylko, Durra Mohsin, Egor Krivov, Ekram Mukbil, Eric Cameracci, Fangyin Wei, Fengzhe Zhou, Francesco Ferroni, Freya Li, George Kurian, Gwanghyun Kim, Haaland Hao Liang, Hai Loc Lu, Hans Yang, Hao Liang, Hao Wang, Hesam Rabeti, Hugo Hadfield, Hyejin Moon, Itai Zadok, Jayjun Lee, Jeana Choi, JF Lafleche, Jiangran Lyu, Jiaojiao Fan, Jiaxiang Tang, Jibin Varghese, Jim Fan, Jingyi Jin, Jinwei Gu, Jon Allen, Joshua Bapst, Joyjit Daw, Julia Kiczka, Julian Ouyang, Kaichun Mo, Kayley Ting, Ke Ding, Kedi Wu, Kevin Brady, Kirill Motkov, Kristen Rumley, Krzysztof Tomala, Liang Feng, Liangkai Zhang, Ling Li, Louis Marcoux, Maciej Bala, Madison Huang, Magdalena Dadela, Mahesh Patekar, Marco Di Lucca, Marilyn Reeb, Mark Carlson, Martin Antolini, Mateusz Sieniawski, Matt Cragun, Meredith Price, Michael Huang, Miguel Guerrero, Miguel Martin, Min Shi, Ming-Yu Liu, Mohammad Harrim, Morteza Ramezanali, Mukesh Beladiya, Nalin Dadhich, Naomi Eigbe, Nathan Hayes-Roth, Nicole Drumheller, Nikhilesh Joshi, Omar Laymoun, Paris Zhang, Paula Ramos, Pawel Morkisz, Peter Gambrill, Pooya Jannaty, Pooya Khaloo, Pranjali Joshi, Qi Wang, Qianli Ma, Qiao Wang, Qing Miao, Qizhi Chen, Rahul Heinrich Steiger, Raju Wagwani, Robert Denomme, Rodrigo Vieira Del Monte, Roy Anthony, Ruqing Xu, Ryan Bernard, Ryan Ji, Saeid Motiian, Sandip Bhaskar, Sandra Skaff, Santanu Dutta, Saurav Kumar, Sehwi Park, Sergiy Fefilatyev, Shangkun Sun, Shangru Li, Shilin Zhu, Shreyas Misra, Shun Zhang, Shuran Song, Simon Yuen, Simon Zhang, Slawek Kierat, Smita Ithape, Soha Pouya, Sophia Huang, Stefanie Manzinger, Steven Baughman, Suneel Indupuru, Sunil Srinivasa, Sunny Kim, Tavish Chen, Thabang Ngazimbi, Thomas Volk, Tianwei She, Tiffany Cai, Ting-Chun Wang, TJ Galda, Tolou Tavakkoli, Tomasz Kornuta, Trung Pham, Tsung-Yi Lin, Vanni Brighella, Varun Praveen, Wei-Cheng Tsen