在多步驟的 AI 代理工作流程中,檢索能力至關重要。不良的檢索可能導致代理獲取不相關的上下文、重複查詢、浪費 token 預算,並將雜訊帶入後續的推理步驟。

今天,我們發布 NVIDIA Nemotron 3 Embed,這是一系列開放且可商用的嵌入模型,旨在提升檢索品質,同時為開發者提供實用的部署選項,以支援生產級的 RAG(檢索增強生成)、AI 代理檢索、程式碼檢索和代理記憶體等應用。

此系列包含三款開放模型,它們在準確性與效率曲線之間實現了最先進的檢索表現。其中,一個 8B 模型在 RTEB 排行榜上名列第一,另有高效的 1B 版本專為生產規模部署而設計。

Nemotron-3-Embed-8B-BF16 作為旗艦嵌入模型,在 RTEB 上排名第一,最適合精準關鍵檢索和高風險企業級 RAG 應用。Nemotron-3-Embed-1B-BF16 則是一款高效率模型,適用於對成本和延遲敏感的生產檢索服務。

而 Nemotron-3-Embed-1B-NVFP4 是一個 Blackwell 優化的硬體加速版本,專為超高吞吐量和大規模基礎設施設計,具有更小的記憶體佔用。

除了 RTEB 的優異表現,Nemotron 3 Embed 還為企業級檢索部署引入了一套生產就緒的功能。這些功能包括開放權重、資料集和訓練配方,讓團隊能夠檢查、調整、微調並在自己的基礎設施上部署檢索模型。

它支援 32k 的上下文視窗,能夠對長文件、大型程式碼上下文和多輪代理歷史進行檢索,同時減少截斷。此外,它還支援多語言和程式碼檢索,適用於全球企業資料、技術文件和多檔案程式碼儲存庫。

NVIDIA NVFP4 效率提供了一個 Blackwell 優化的 4 位元部署路徑,實現高吞吐量檢索和更小的記憶體佔用。NVIDIA NeMo AutoModel 的微調和蒸餾配方,則支援團隊根據自己的資料進行領域適應和模型壓縮。它還實現了生態系即時整合,可立即在 Hugging Face 上使用,可作為 NVIDIA NIM 微服務部署,並受 vLLM 支援,也可透過領先的 AI 雲端和推論合作夥伴存取。

我們從三個面向評估 Nemotron 3 Embed:檢索品質、下游代理效率和部署權衡。8B 模型確立了此模型系列的品質上限,而 1B BF16 和 NVFP4 版本則將相同的檢索導向設計帶入成本更低、吞吐量更高的部署環境。

我們首先在 RTEB 上評估這些模型,其中 Nemotron-3-Embed-8B-BF16 排名第一。我們也使用平均 NDCG@10 在 ViDoRe V3 Text、MMTEB Retrieval 和 LongEmbed 上測試了這些模型。

Nemotron-3-Embed-8B-BF16 在 RTEB 上排名第一,RTEB 得分為 78.5%,MMTEB Retrieval 得分為 75.5%。Nemotron-3-Embed-1B-BF16 將 8B 模型的大部分檢索品質帶入更小的部署規模。

它在 RTEB 上得分 72.4%,相較於其 1B 前身 (llama-nemotron-embed-vl-1b-v2) 錯誤率降低了 27%;在 MMTEB Retrieval 上得分 71.0%,錯誤率降低了 28%。

為了評估在 AI 代理環境中的檢索能力,我們使用由 Nemotron 3 Ultra 驅動的搜尋代理,並改變檢索系統所使用的嵌入模型。更優質的檢索能更早地返回相關證據,幫助代理避免重複搜尋、不必要的推理回合以及額外的上下文檢查。

我們比較了在 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 上,每次查詢的平均檢索準確度與預估的下游代理 token 成本。圖 3 顯示,更強大的檢索能力可降低下游代理的 token 成本。更準確的檢索器能更早地返回相關證據,這有助於代理以更少的重複搜尋和推理回合完成任務。

在這些評估中,Nemotron 3 Embed 模型提升了 AI 代理檢索的極限,其中 8B 模型在 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 上,同時實現了最高的平均檢索準確度和最低的預估下游 token 成本。

對於高吞吐量的部署,團隊通常會選擇較小的嵌入模型來滿足延遲和成本目標。Nemotron-3-Embed-1B-NVFP4 旨在透過在 NVIDIA Blackwell 架構上使用原生的 NVFP4 加速,縮小服務效率與檢索品質之間的差距。

該模型將線性層的權重和激活量化為 NVFP4 以實現高效推論,並使用量化感知蒸餾 (QAD) 來幫助恢復長輸入序列的準確性。Blackwell 上的 NVFP4 為高吞吐量、低延遲的檢索服務提供了比 BF16 高達兩倍的吞吐量。NVFP4 版本在減少記憶體佔用的同時,保留了 BF16 檢索準確度的 99% 以上。

對於生產規模的檢索系統,服務堆疊還需要在實際請求負載下,針對不同的輸入序列長度和硬體目標,保持其效率。為了讓 Nemotron 3 Embed 能夠在今日的企業規模中高效運行,我們也為 1B 模型發布了優化的 NVIDIA NIM 微服務。

如圖 5 所示,基於 Rust 的 Nemotron 3 Embed NIM 在 NVIDIA GB200 和 RTX PRO 6000 GPU 上,於 256 和 1024 的 ISL(輸入序列長度)下,其效能與 vLLM 檢查點相當或更優。

Nemotron-3-Embed-8B-BF16 透過將其因果解碼器轉換為雙向編碼器,以實現全序列檢索,從而改編了 Ministral-3-8B-Instruct-2512 的骨幹模型。該模型透過對網路來源和合成文本對的混合資料進行對比式預訓練,然後在法律、金融、醫療、商業和教育等多領域的精選多語言檢索資料集上進行微調。

這個 8B 模型作為旗艦嵌入模型,而來自相同開發線的早期 8B 教師檢查點則用於蒸餾出高效的 1B 版本。

1B 模型並非從頭開始訓練的小型檢索器。我們首先將雙向適應配方應用於 Ministral-3-3B-Instruct-2512 骨幹模型,建立 3B 檢索器基礎,然後透過兩輪的結構化剪枝和蒸餾進行壓縮。

首先,3B 父模型使用 NVIDIA ModelOpt 的 mcore_minitron 神經網路架構搜尋引擎壓縮到 2B 的中間規模。NAS 管線在嚴格的參數預算下,搜尋了隱藏層寬度、FFN 大小、注意力頭數和深度,以識別出適用於檢索工作負載的高效架構。

隨後,將產生的 2B 中間模型從一個 8B 教師檢查點進行蒸餾,以恢復排序準確度。我們在多語言、領域內檢索資料混合集上,使用了結合餘弦距離損失和均方誤差損失的方法,以使學生模型的嵌入與教師模型對齊。

相同的序列,即 ModelOpt 結構化剪枝後接 8B 教師模型蒸餾,再次重複,將 2B 中間模型壓縮至最終的 1.14B 嵌入模型。最終訓練採用了漸進式的兩階段上下文擴展排程:

階段一:專注於 1024 token 上下文長度的廣泛多語言對齊,以重建父模型的核心檢索行為。

階段二:將上下文長度擴展到 4096 token,並增加了長上下文合成和推理資料集,幫助 1B 模型在更長的輸入中保持區分性召回。

Nemotron 3 Embed 模型在企業級應用中已獲得合作夥伴的積極評估。Automation Anywhere 的首席 AI 與開發長 Adi Kuruganti 表示,Nemotron 3 Embed 在問答方面表現出色,有望進一步提升企業代理的準確性和可靠性。

Boomi 的產品管理資深副總裁 Mani Gill 也指出,Nemotron 3 Embed 模型在 AI 代理檢索應用案例中展現強大效能,1B 和 8B 兩種版本提供靈活性,以平衡品質、延遲和部署要求。IBM 在基於 watsonx.data 建立的概念驗證中,評估新的 NVIDIA Nemotron Embed 模型,並看到了有前景的早期成果。

Mem0 的產品經理 Rudraj Mehta 提到,Nemotron-3-Embed-1B 在其內部測試中表現優異,開放權重和微調配方讓他們能夠將模型適應於記憶體文本並自行提供服務。Palantir 正與 NVIDIA 合作,評估 Nemotron 3 Embed 在為終端客戶執行邊緣檢索工作負載方面的部署。

ServiceNow 正在評估 NVIDIA Nemotron Embed,以在其文件中進行檢索,並持續關注領域內微調以提高其檢索準確性。turbopuffer 也將 Nemotron 3 Embed 整合到其原生嵌入服務中,使開發者能夠使用。