建構 AI 代理(agent)極具挑戰,因為現實世界並不像基準測試(benchmark)那樣可預測。一個無法從損壞的 API 呼叫或未曾見過的工作流程中恢復的代理,並非真正的代理,而只是一個具備工具的自動完成器。要從後者進化到前者,關鍵在於資料問題,這包括軟體工程追蹤記錄、工具使用失敗、多步驟推理、資訊檢索、安全性、使用者模擬、工作流程執行,以及最終的實體世界互動。這正是 NVIDIA Nemotron 開放資料產品的應用所在。

NVIDIA 最近強調,開放模型如何推動 AI 研究,並在熱門的國際機器學習會議(ICML)上嶄露頭角,近 145 篇論文引用了 Nemotron 模型和資料集。合成資料(synthetic data)在這個生態系統中扮演著重要角色:Nemotron-CC 利用合成資料來增強流行的 Common Crawl 資料集,用於模型預訓練。

Nemotron-CC-MATH 則利用合成數學問題來提升推理能力。Nemotron Pretraining 是一個廣泛的資料集,涵蓋了通用、程式碼、數學和合成資料,總計數兆個 token。NVIDIA 發布開放資料集的部分原因,是希望與社群共同學習,以擴展這些多樣化的應用。

開放模型權重固然重要,但對於代理而言,權重僅是故事的一部分。模型的可重現性(reproducibility)也取決於其背後的資料集、策展選擇、訓練配方和評估方法。代理的行為需要是可檢視的。如果一個模型會呼叫工具、執行工作流程、檢索資訊並跨系統行動,開發者就需要理解塑造這些行為的資料。開放資料使代理行為變得可檢視且可解釋,而合成資料則是實現這一目標的關鍵環節。

NVIDIA 應用深度學習研究副總裁 Bryan Catanzaro 最近指出:「每家公司都圍繞著一個『秘密』而建立」,這可能是一個競爭對手所沒有的工作流程、語料庫或客戶模式。這些秘密讓 AI 變得有用,但公司不應輕易洩露它們。合成資料提供了一種方式,讓團隊在不暴露底層來源的情況下,保留有用的訊號。

Bryan 也談到要培養一個多元且參與性強的 AI 生態系統,讓各種類型的公司、研究人員、政府和社群都能做出貢獻。這不僅僅是一種價值主張,更是一種資料主張。如果每個模型都從相同的狹窄資料池中學習,那麼當這些模型開始感覺千篇一律時,我們不應感到驚訝。

困難之處在於,最有用的資料通常存在於無法或不願直接發布的組織內部。每個人都能從更豐富的共享資料層中受益,但沒有人願意率先放棄讓自己獨特的東西。開放發布的合成資料,是改變這種現狀的一種方法。

作為 Nemotron 開放資料的一部分,我們已經發布了超過 10 兆個預訓練 token 和數百萬個涵蓋多個領域及資料形式的後訓練樣本。這龐大的資料量難以理解,而原始資料集表格的幫助不大。為了更容易探索 Nemotron 後訓練資料的實際內容,我們建構了 Nemotron Post-Training v3 Prompt Atlas:這是一個互動式視覺地圖,每個點代表一個提示詞(prompt)樣本,這些樣本取自 Nemotron v3 後訓練集合,並按比例抽樣以反映資料混合的真實分佈。

色彩疊加和篩選器讓您可以根據資料集、管線階段、領域或工具使用情況來重新組織地圖。由於語義相似的提示詞會聚集在一起,您可以放大到特定區域,例如程式碼演算法、安全性、數學、代理行為,檢視代表性範例,並利用這些訊號來策展資料、建構評估或理解模型為何會以特定方式運作。

代理還需要理解它們所支援的對象,這使得「資料品質」成為一個在地而非普遍的問題。一個在英文網路資料上訓練的毒性分類器,可能會錯過韓語或日語中的敵意訊息,因為這些語言中的攻擊性通常體現在禮貌程度而非明顯的詞彙上。訊號相同,但語境不同。團隊已經開始以這種方式為代理建立基礎。

Nemotron-Personas 就是解決這個問題的一種嘗試:它利用在地化的合成人物誌(synthetic personas),捕捉人口的多樣性和複雜性。Nemotron-Personas 使用 NVIDIA 最先進的複合式 AI 工具 NeMo Data Designer 進行合成資料生成,並反映官方的區域人口統計和地理統計數據。

其目標並非重現真實人物,而是在某種程度上幫助開發者測試他們的系統是否能反映其聲稱服務的使用者、語言、地區和職業。上個月在巴黎的 VivaTech 大會上,我們推出了該系列中的第十個國家,現在已代表超過 24 億人口。當品質是在地化時,只有了解該地區的人才能建構它,包括區域研究人員、母語人士、主題專家以及能夠與您一同檢視和修正的利害關係人。這就是公開學習:不是孤立地發布資料,而是協作建構資料。

合成資料需要作為資料來源系統的一部分來整合。這其中存在權衡。它能降低風險,但並不能消除對基礎化、資料譜系、策展、評估和人類判斷的需求。一個有用的思考方式是「合成閾值」(synthetic thresholds):即資料不再能被視為純粹真實的點。

這條界線不總是顯而易見的。真實的工作流程、人類回饋、模型生成的追蹤記錄、模擬使用者和合成標籤都可能相互交織。解決之道並非假裝合成資料是虛假或無害的,而是要記錄哪些是生成的、哪些是基礎化的、哪些是經過審查的,以及這些資料旨在測試什麼。隨著越來越多的 AI 系統在人工資訊上進行訓練,我們需要更好的共享習慣來檢視、記錄這些技術,並公開討論它們。

在不同情境下,品質的定義也各不相同。推理資料需要更困難的問題和更清晰的追蹤記錄。人物誌資料需要分佈保真度(distributional fidelity)和在地化審查。代理工作流程則需要任務多樣性、失敗涵蓋範圍和恢復路徑。這個領域目前仍更像是一門工藝而非公式。

這就是開放方法之所以重要的原因。合成資料不僅僅是生成更多範例,更是關於提出更好的問題,並讓原本無法同桌協商的各方得以合作:公司無需洩露其秘密,政府無需損害隱私,研究人員也無需等待可能永遠不會到來的許可。AI 中稀缺的資源並非 token,而是組織之間的信任。合成資料是我們建立這種信任的少數工具之一。

我們在 2026 年 7 月 7 日星期二舉辦了一場關於「開放資料為何重要」的直播,邀請了傑出的專家小組。這場直播值得一看,同時也歡迎查閱 Hugging Face 上的 Nemotron 資料集。若要隨時掌握 NVIDIA Nemotron 的最新資訊,請訂閱 NVIDIA 新聞,並在 LinkedIn、X、YouTube 和 Discord 上的 Nemotron 頻道追蹤 NVIDIA AI。

您可以在 Hugging Face 上存取開放的 Nemotron 模型,並在 build.nvidia.com 上找到 NIM 微服務和開發者範例的集合。