編者按:這篇文章是《Into the Omniverse》系列的一部分,該系列重點介紹開發人員、3D 專業人士和企業如何利用 OpenUSD 和 NVIDIA Omniverse 的最新進展來轉變他們的工作流程。
視覺 AI 代理正成為一種實用的方式,能自動將來自實體世界的影像資料轉化為工廠、城市、倉庫和運輸系統中的營運智慧。
隨著越來越多的 AI 工作負載轉移到資料生成地點附近,這種轉變正在加速。Gartner 預計,到 2028 年,超過三分之二的企業管理資料將在資料中心或雲端之外產生和處理;到 2029 年,全球超過三分之二的企業將部署邊緣 AI,這比 2025 年的 10% 大幅增加 (1)。
然而,更多的邊緣資料並不會自動產生更多智慧。根據同一份 Gartner 報告,高達 90% 的現有邊緣資料未經處理。
要將這些資料轉化為有用的行動,需要視覺 AI 代理能夠理解影像、適應真實世界條件,並將洞察力連結到營運工作流程。這些代理通常在攝影機、機器和感測器附近運行,模型必須滿足延遲、功耗、成本和連線能力要求,同時適應特定場域的條件。
為了建構這些代理,開發人員需要可重複的方法來生成訓練資料、微調模型,並在邊緣和雲端環境中部署代理式影像應用程式。
NVIDIA Metropolis 的代理技能和藍圖為開發人員提供了可重複使用的工作流程,以在整個生命週期中建構、操作和優化視覺 AI 代理。
在模擬和合成資料方面,Universal Scene Description (OpenUSD) 提供了一個通用框架,用於描述、組合和重複使用 3D 世界。NVIDIA Omniverse 函式庫基於 OpenUSD 建構,可協助團隊建立模擬、合成資料生成和數位分身工作流程,以建模真實世界環境,並擴展情境覆蓋範圍,涵蓋照明、天氣、交通模式、攝影機角度、遮擋和罕見事件等條件。
隨著組織邁向自主視覺代理,經常會出現三個挑戰:
資料不足導致準確度停滯:視覺 AI 代理需要發現罕見缺陷、異常事件和不斷變化的環境。例如,在製造業中,檢測模型可能在常見的刮痕或凹痕上表現良好,但卻難以處理訓練資料中未出現的新髮絲裂紋。
缺乏微調專業知識:一旦團隊發現性能差距,改進模型很少是簡單的交接。微調需要標註資料集、訓練配置、實驗追蹤、評估,以及關於目標用例是否有改進的決策。許多建構視覺 AI 代理的組織沒有大型內部機器學習團隊來快速管理這個過程,尤其是在許多站點、產品或攝影機視圖中。
複雜且耗時的代理組裝工作流程:部署視覺 AI 代理不僅僅是運行推論。開發人員必須將影像管線、AI 模型、中繼資料、嵌入、索引、搜尋、警報、報告和系統整合串聯起來。為特定環境客製化該工作流程會顯著增加時間並需要專業知識。如果沒有 OpenUSD 的共享場景描述層,團隊通常每次條件或部署站點改變時,都必須從頭開始重建 3D 環境。
視覺 AI 代理的完整生命週期方法
NVIDIA 的代理技能和藍圖,與基於 OpenUSD 的模擬和合成資料生成工具 NVIDIA Omniverse,以及用於模型開發和影像 AI 部署的 NVIDIA Metropolis 結合使用,為開發人員提供了這些工作流程關鍵部分的可重複使用起點:
缺陷影像生成 (Defect Image Generation) 技能有助於創建合成缺陷資料。影像資料增強 (Video Data Augmentation) 技能有助於擴展情境覆蓋範圍。NVIDIA TAO 技能可實現模型微調。NVIDIA 影像搜尋與摘要 (VSS) 技能有助於將影像理解轉化為可部署的工作流程,用於警報、報告、串流管理等。
開發人員無需從頭開始重建每個步驟,而是可以使用這些可重複使用的工作流程來更快地生成資料、改進模型和部署視覺 AI 代理。
視覺檢測:生成生產線缺乏的資料
在製造業中,工廠在預防缺陷方面越成功,就越難以收集足夠的缺陷範例來訓練下一個檢測模型。
Roboflow 正在將 NVIDIA Defect Image Generation 技能和 NVIDIA Cosmos 世界基礎模型整合到其視覺 AI 平台中,為 Corning 等客戶在真實訓練資料稀缺時生成合成缺陷影像,實現近乎完美的檢測性能,同時顯著減少日常人工影像審查的需求。
在與 Corning 光纖製造工程團隊進行的基準測試中,一個僅用八張真實缺陷影像訓練的模型,並透過 NVIDIA Defect Image Generation 技能生成的合成資料進行增強,在最具挑戰性的缺陷類別上達到了 95% 的平均精確度 (average precision) 和完美的召回率 (recall)。
這一性能超越了僅使用真實資料訓練的基準模型,有效地將一個多季度的檢測專案壓縮到短短幾天內完成。
觀看合成資料生成工作流程如何協助開發人員創建訓練和改進實體 AI 模型所需的資料:
智慧城市:從影像分析到自主營運
大規模城市營運顯示了為什麼視覺 AI 代理需要連接的工作流程,而不僅僅是推論。Linker Vision 正在使用 NVIDIA Metropolis Blueprint for VSS 建構智慧城市 AI 系統,以加速在城市基礎設施中部署影像推理代理。在此工作流程中,VSS 技能可以協助將常見的影像 AI 任務(如搜尋、摘要、警報、報告和串流管理)打包成可重複使用的代理可執行工作流程。
基於 OpenUSD 的 NVIDIA Omniverse 數位分身有助於建模城市環境,並測試視覺 AI 系統如何應對不同的交通模式、天氣條件、緊急事件和基礎設施變化。Linker Vision 使用 NVIDIA Cosmos 進行影像資料增強,並使用 NVIDIA TAO 進行 Cosmos 模型微調。
在高雄,Linker Vision 使用 VSS 藍圖將開發工作量減少了 85%,並將事件回應時間縮短了高達 80%。其更新的 AI-GRID 擴展基於這種方法,結合 NVIDIA NemoClaw 藍圖實現安全的代理式 AI,支援城市和交通環境中的自主影像推理。
工業營運:即時推理工作流程
在工業環境中,挑戰不僅僅是檢測影像畫面中出現的內容。團隊需要能夠做到以下幾點的代理:
理解工作是否正確執行。將執行情況與標準操作程序進行比較。在缺陷向下游移動之前產生洞察力。
在 Foxconn,DeepHow 的 Live Standard Operating Procedure (SOP) Verification 代理使用 NVIDIA Metropolis VSS 藍圖作為影像搜尋、摘要和分析的代理式影像工作流程層。NVIDIA Cosmos 提供推理能力,協助代理在上下文中解釋複雜的人類活動和工作序列,例如組裝步驟是否正確執行以及是否按照預期順序進行。
該解決方案已用於 NVIDIA GB300 伺服器生產線,將首次通過良率提高了 3%,在關鍵 SOP 步驟的微動作理解方面達到了 99% 的任務級準確度,並透過協助團隊更早發現問題來減少重複工作。
要了解開發人員如何建構和部署影像分析 AI 代理,請觀看此關於使用 NVIDIA VSS 技能與程式碼代理的技術演練。
探索 NVIDIA 代理技能和藍圖,以建構、操作和優化影像分析 AI 代理。
來源:Gartner,《Predicts 2026: Physical AI Pushes I&O to the Edge》,2026 年 3 月 3 日。Gartner 是 Gartner, Inc. 和/或其附屬公司的商標。



