NVIDIA Nemotron 3 Nano Omni 是一個全新的全模態理解模型,專為真實世界的文件分析、多圖像推理、自動語音辨識、長篇影音理解、代理式電腦使用以及通用推理而建構。它將 Nemotron 多模態產品線從強大的視覺-語言系統,擴展到更廣泛的文字 + 圖像 + 視訊 + 音訊模型。
Nemotron 3 Nano Omni 在 MMlongbench-Doc、OCRBenchV2 等複雜文件智慧排行榜上提供同類最佳的準確度,同時也在 WorldSense 和 DailyOmni 等視訊與音訊排行榜上領先。它在 VoiceBench 的音訊理解方面達到最高準確度,並在 MediaPerf 上被評為最具成本效益的開源視訊理解模型。
在底層,它結合了 Nemotron 3 混合式 Mamba-Transformer 專家混合 (Mixture-of-Experts, MoE) 骨幹網路,以及 C-RADIOv4-H 視覺編碼器和 Parakeet-TDT-0.6B-v2 音訊編碼器。
該架構旨在保留精細的視覺細節、增加原生音訊理解能力,並可擴展至極長的密集圖像、文件、視訊和混合模態推理的多模態上下文。其訓練方法採用分階段的多模態對齊和上下文擴展,接著是偏好優化和多模態強化學習。相較於其他替代方案,Nemotron 3 Nano Omni 在多模態應用案例中,可提供高達 9 倍的吞吐量和 2.9 倍的單流推理速度。
可在 HuggingFace 下載 BF16、FP8 和 NVFP4 檢查點。有關模型架構、訓練方法、資料管線和基準測試的更多資訊,請閱讀完整的 Nemotron 3 Nano Omni 報告。Benchmark highlightsNemotron 3 Nano Omni 在 Nemotron Nano V2 VL 的基礎上,大幅提升了視覺能力,並新增了全新的音訊和影音整合功能,同時在許多領域也超越了另一個開源全模態模型 Qwen3-Omni。
| 任務 | 基準測試 | Nemotron 3 Nano Omni | Nemotron Nano V2 VL | Qwen3-Omni 30B-A3B || --- | --- | --- | --- | --- || 文件理解 | OCRBenchV2-En | 65.8 | 61.2 | - || | MMLongBench-Doc | 57.5 | 38.0 | 49.5 || | CharXiv reasoning | 63.6 | 41.3 | 61.1 || 圖形使用者介面 (GUI) | ScreenSpot-Pro | 57.8 | 5.5 | 59.7 || | OSWorld | 47.4 | 11.0 | 29.0 || 視訊理解 | Video-MME | 72.2 | 63.0 | 70.5 || 視訊 + 音訊理解 | WorldSense | 55.4 | - | 54.0 || | DailyOmni | 74.1 | - | 73.6 || 語音互動 | VoiceBench | 89.4 | - | 88.8 || 自動語音辨識 (ASR) | HF Open ASR (越低越好) | 5.95 | - | 6.55 |Efficiency highlights與其他具有相同互動性的開源全模態模型相比,Nemotron 3 Nano Omni 在多文件應用案例中提供 7.4 倍的系統效率,在視訊應用案例中則提供 9.2 倍的系統效率。
圖 1. 在固定的每用戶互動閾值下(每秒/每用戶的 token 數),各模型在多文件和視訊應用案例中維持的總系統吞吐量。What Nemotron 3 Nano Omni is designed for總體而言,Nemotron 3 Nano Omni 旨在處理五類工作負載:1. Real-world document analysis這不僅僅是關於光學字元辨識 (OCR)。
該模型適用於長篇、複雜且高價值的文件,其理解能力取決於版面配置、表格、圖表、公式、章節結構和跨頁參考。例如合約、技術論文、報告、手冊、多頁表單或合規文件包。該模型可以處理超過 100 頁的文件。2. Automatic Speech RecognitionNemotron 3 Nano Omni 包含強大的語音理解能力,可在多樣化的音訊條件下實現高品質的轉錄。
它能處理具有不同說話者、口音和背景噪音的長篇音訊。這些功能可以整合到更廣泛的工作流程中,使語音內容能夠被轉錄、分析,並與其他模態結合,用於摘要、問答和跨模態推理等任務。3. Long audio-video understanding許多企業和開發者工作流程依賴於混合的音訊和視覺證據:帶旁白的螢幕錄影、培訓視訊、帶投影片的會議、教學課程、產品演示、客戶支援錄影以及長篇視訊檔案。
Nemotron 3 Nano Omni 旨在聯合推理這些輸入。4. Agentic computer useNemotron 3 Nano Omni 模型經過專門訓練,用於代理式電腦使用,使其能夠協助圖形使用者介面 (GUI) 環境中的任務。
其功能包括解釋螢幕截圖、監控使用者介面的狀態、將其推理建立在螢幕視覺內容上,並協助動作選擇或工作流程自動化。5. General multimodal reasoning該模型不僅僅是為了感知而設計。它擅長於需要跨長上下文視窗、多種模態以及結構化或半結構化證據來綜合資訊的推理密集型任務。
它可以執行多步驟推理、進行計算,並連結來自文字、圖像、表格和其他輸入的訊號,以得出連貫且有充分依據的答案。Model architecture and key innovationsNemotron 3 Nano Omni 採用統一的編碼器-投影器-解碼器設計。
其語言骨幹網路是 Nemotron 3 Nano 30B-A3B,搭配 C-RADIOv4-H 視覺編碼器和 Parakeet-TDT-0.6B-v2 音訊編碼器。這些特定模態的編碼器透過輕量級投影器連接到大型語言模型 (LLM) 骨幹網路。
圖 2. NVIDIA Nemotron 3 Nano Omni 30B-A3B 的模型架構。A hybrid Mamba-Transformer-MoE backbone for long multimodal context該模型的骨幹網路交織了三個關鍵組件:23 個 Mamba 選擇性狀態空間層,用於高效的長上下文處理;23 個 MoE 層,包含 128 個專家、top-6 路由和一個共享專家,以提供條件容量;以及 6 個分組查詢注意力層,以保持強大的全局互動和表達能力。
Nemotron 3 Nano Omni 在統一的設計中結合了狀態空間模型、注意力機制和 MoE,在保持強大推理性能的同時,對於長篇多模態上下文仍具實用性。Dynamic resolution for dense documents, charts, and screens在視覺方面,Nemotron 3 Nano Omni 以原生長寬比的動態解析度處理取代了 v2 模型中使用的平鋪策略。
每張圖像可以使用可變數量的 16 x 16 圖像塊表示,每張圖像最少 1,024 個視覺圖像塊,最多可達 13,312 個。對於方形圖像,這分別相當於 512 x 512 和 1840 x 1840 解析度。這種靈活性對於處理高解析度、複雜的視覺輸入至關重要,例如大量 OCR 的文件、財務表格、投影片、研究圖表、螢幕截圖和 GUI 版面配置,特別是當需要同時理解精細細節和整體結構時。
Conv3D temporal compression for video對於視訊,Nemotron 3 Nano Omni 使用專用的 Conv3D tubelet 嵌入路徑。它不是獨立嵌入每個影格,而是在 ViT 之前將每對連續影格融合為一個「tubelet」,將語言模型需要處理的視覺 token 數量減半。這使我們能夠將數量加倍。



