本週四(7 月 23 日)於洛杉磯舉行的 SIGGRAPH 大會上,與會者將能探索領先的圖形研究、神經渲染、模擬和 AI 如何改變人類與機器創造和理解世界的方式。

NVIDIA 的主題演講於今日(7 月 20 日)太平洋時間下午 3:45 舉行,NVIDIA AI 研究與工程主管 Neil Ashton、Edward Liu 和 Ming-Yu Liu 將討論由 AI 構建的神經渲染技術、世界模型和 AI 模擬方法。

以下是 NVIDIA 及其合作夥伴在 SIGGRAPH 大會上展示的最新成果:

  • Model Context Protocol 連接將代理式 AI 帶入內容創作。
  • 全新的 Synthetic Video Detector NIM 微服務。
  • Cosmos 3 Edge 開放世界模型,用於本地實體 AI。
  • NVIDIA NemoClaw 在配備 NVIDIA Agent Toolkit 的 DGX Station 上運行。
  • 虛擬世界和實體 AI 的研究突破。

AI 代理擴展創意工具至數百萬用戶

領先的創意應用程式正在開放 Model Context Protocol (MCP) 連接,讓 AI 代理能夠在場景、鏡頭、時間軸、資產和編輯等工具中協同工作,同時創作者仍能掌握控制權。

二十多年來,NVIDIA 技術從 GPU 加速的視埠和 CUDA 驅動的效果,到 NVIDIA RTX PRO 光線追蹤、AI 降噪、神經渲染和即時模擬,都協助加速了藝術家、工作室和開發人員用來創建世界遊戲、電影、電視節目和廣告內容的 DCC 工具。

MCP 正在開啟加速創意的下一個篇章:應用程式不僅變得更快,它們也變得「代理就緒」。

從加速到行動

透過 MCP 連接的工具,藝術家或技術總監可以要求 AI 代理檢查場景中是否有遺失的紋理、標記不一致的色彩管理、準備匯出變體、為每日審查生成預覽影片,或根據管線規則驗證鏡頭,同時將創意決策權保留在人類手中。

NVIDIA 平台不僅加速了視埠、渲染、模擬和 AI 效果,現在也能為專業創作者設計的系統提供本地代理、模型推論和多應用程式工作流程。

NVIDIA RTX PRO 工作站、DGX Spark 和 DGX Station 系統旨在將加速的 AI 效能更貼近藝術家、開發人員和工作室管線。在本地運行模型和代理有助於提高響應速度,減少對外部服務的依賴,並將敏感的創意資料保留在受控環境中。

NVIDIA Agent Toolkit 也支援 MCP 整合,包括用於連接遠端 MCP 伺服器的 MCP 用戶端,以及用於向任何 MCP 用戶端發布工具的 MCP 伺服器。

創意生態系統邁向代理就緒

在整個創意生態系統中,創意應用程式和平台正在公開 MCP 連接或 MCP 就緒的工作流程,讓 AI 代理能夠更紮實地存取實際的生產情境。

Adobe 正在 Firefly、Express 和 Creative Cloud 中擴展其創意代理,為 AI 助理體驗提供動力,讓創作者能夠描述他們想要的結果,而助理則協調多步驟工作流程。Adobe 還透過 Adobe 連接器將其專業級創意工具帶到第三方 AI 平台,無論人們在哪裡創作和工作,都能擴展其創意能力。

對於開發人員,Adobe 提供了 Adobe Express Developer MCP Server,使 AI 編碼助理能夠使用官方文件和應用程式介面 (API) 構建 Adobe Express 附加元件。

Canva 旗下的 Affinity 推出了一個用於 Claude 的 AI 連接器,它使用 MCP 將自然語言自動化直接引入 Affinity。設計師可以要求 Claude 處理重複的生產任務,例如重新命名圖層和畫板、調整資產大小和重新格式化以適應多個通道、應用批量編輯、優化向量路徑以及準備交付檔案。

除了個別任務,Claude 還可以幫助用戶構建可重複使用的腳本和根據其工作流程量身定制的自定義功能,從而減少生產開銷,讓創意專業人士有更多時間專注於設計。

Blender 透過 Blender Lab 提供輕量級 MCP 伺服器,為 Blender 的 Python API、文件和複雜設置提供自然語言介面。對於獨立藝術家和工作室來說,Blender 提供了一個很好的範例,說明開放的創意工具如何在不改變創意重心情況下實現代理存取。

Boris FX Silhouette 現在包含一個 MCP 伺服器,讓 AI 助理可以直接在您的專案中工作。使用 Silhouette 的 FX Scripting API 作為一流的 MCP 工具,助理可以檢查專案、構建節點樹、編輯形狀和關鍵影格,以及渲染影格。

新的偏好設定面板透過安裝 MCP 套件、生成即貼即用的用戶端配置以及測試連接來簡化設定。互動式線上模式連接到您的活動會話,而離線模式則運行無頭實例,用於自動化、批次處理和大規模工作流程。

Foundry Griptape 原生支援 MCP,提供專為專業 VFX 管線設計的 AI 編排。這種整合使工作室能夠安全地管理多個 AI 模型和代理,同時保持必要的追溯性和創意控制。透過與 Blender 和 Foundry Nuke 等工具整合,Griptape 自動化了重複的生產任務,例如清理、遮罩繪畫和品質控制,同時確保藝術家在創意過程中始終擁有最終指揮權。

SideFX 透過其新的 APEX Script 工作流程將 MCP 支援引入 Houdini 22。AI 助理可以存取精選的 APEX Script 語法、函數、文件和範例集合,幫助藝術家生成和完善程序性角色綁定程式碼。SideFX 的初始實施側重於 APEX Script 和角色綁定,而社群開發的 MCP 伺服器則為代理與 Houdini 互動提供了更廣泛的方式。

Unreal Engine 最近宣布能夠透過 MCP 將 AI 用戶端連接到 Unreal Editor,從而實現 AI 工作流程,可以透過標準化協定與編輯器功能互動。對於遊戲開發人員、虛擬製作團隊和即時藝術家來說,這為能夠對場景、資產和專案狀態進行推理的助理打開了大門。

在 SIGGRAPH 上,了解 NVIDIA RTX PRO 和 DGX 系統如何將本地 AI 代理更貼近創意工作。

NVIDIA AI for Media 協助新聞編輯室偵測合成影片

每天,影片將世界各地最重大的新聞呈現在眼前,從跨大陸的突發新聞,到重塑社群的事件,再到團結全球人民的時刻。在全天候運作的新聞週期中,值得信賴的影片是人們了解正在發生什麼、理解其重要性並保持聯繫和更新的媒介。

因此,公眾對影片的信任比以往任何時候都更加重要。在 SIGGRAPH 大會上,NVIDIA 宣布推出 Synthetic Video Detector NVIDIA NIM 微服務,作為 NVIDIA AI for Media 平台的一部分,將 AI 輔助的偵測訊號引入編輯和媒體工作流程。

NIM 微服務逐影格分析影片,以產生其是否包含合成內容的分類器分數。編輯團隊可以使用該分數來優先審查片段、標記或隔離可疑素材,或將其升級進行更深入的分析。

該微服務不是取代既定的驗證實踐,而是為時間敏感的決策提供另一個訊號,幫助團隊快速行動,同時保護編輯標準並確保公眾信任。

Synthetic Video Detector 在新聞編輯室和社群影片工作流程中常見的壓縮、調整大小、裁剪和重新編碼步驟後仍然有效。在 NVIDIA 測試中,該模型在未壓縮影片上的準確度高達 92%,在 15% 壓縮下為 87%,在 50% 壓縮下為 82%。

NIM 微服務可以在 NVIDIA RTX 系統上以低至 22 毫秒的速度處理 1080p 影片,在 NVIDIA L40 GPU 上約為 30 毫秒。

在影片所在處部署偵測功能

組織可以將 NIM 微服務部署在敏感影片的擷取、儲存或分發位置附近,包括內部部署、邊緣、混合和經批准的氣隙環境中。這種靈活性有助於團隊維持對影片資料、存取和操作的控制。

合作夥伴的採用已經幫助 Synthetic Video Detector 從模型能力轉變為可部署的媒體基礎設施。Wowza 正在透過 Wowza Video Intelligence Framework 嵌入該微服務,將即時合成影片偵測引入其在全球 170 多個國家/地區超過 35,000 個部署中使用的直播工作流程。

這種規模很重要,因為許多最容易受到合成媒體風險影響的組織,包括廣播公司、政府機構、金融機構和關鍵基礎設施營運商,也面臨著嚴格的資料駐留、安全和操作控制要求。

透過將 Synthetic Video Detector 與客戶已經使用的影片基礎設施層配對,Wowza 可以幫助在擷取和串流操作附近提供 AI 輔助驗證,讓團隊能夠即時標記可疑影片,同時將敏感素材保留在其自己的環境中。

試用 NVIDIA Synthetic Video Detector NIM 微服務。

NVIDIA Cosmos 3 Edge 現已開放,將尖端世界模型帶到邊緣 GPU,實現本地實體 AI

實體 AI 系統依賴世界模型來感知、推理和預測物理環境。但現實世界是廣闊、不可預測且不斷變化的。

無論是機器人導航倉庫還是攝影機網路監控工廠車間,實體 AI 系統都需要了解當前正在發生什麼、推斷接下來可能發生什麼,並足夠快速地採取行動以產生影響。到目前為止,在邊緣提供此類尖端 AI 通常意味著犧牲模型能力以換取部署效率。

現在可用的 NVIDIA Cosmos 3 Edge 有助於消除這種權衡。這個 40 億參數的全能模型針對記憶體效率部署和 NVIDIA Jetson、NVIDIA RTX PRO 和 NVIDIA DGX 系統以及 GeForce RTX GPU 上的高吞吐量進行了優化。

作為 NVIDIA Cosmos 3 的擴展,這個緊湊的世界基礎模型可以理解和生成文字、圖像、影片、環境聲音和動作。其混合式 Transformer 架構可在裝置上實現物理基礎的即時視覺分析和機器人動作。

Cosmos 3 Edge 在邊緣提供尖端實體 AI,在 VANTAGE-Bench 中,其視覺分析成功率在其參數類別中排名第一,並透過後續訓練實現了最先進的機器人學習。

機器人、自動駕駛車輛和智慧基礎設施上的裝置端實體 AI

開發人員可以使用 NVIDIA DGX Station 桌上型 AI 超級電腦對 Cosmos 3 Edge 進行專有機器人與感測器資料的後續訓練,以構建專門的世界動作模型,然後將其部署在 NVIDIA Jetson Thor 上,用於即時機器人控制策略,包括操作或移動。

Agile Robots、Doosan Robotics、Siemens 和 Skild AI 等合作夥伴正在評估 Cosmos 3 Edge 用於機器人工作流程。

對於自動駕駛車輛,Cosmos 3 Edge 支援在資源受限的硬體上進行道路場景理解、交通推理、物體意圖預測和策略模型蒸餾。該模型可以用作汽車策略模型蒸餾的學生骨幹,包括與 NVIDIA Alpamayo 視覺語言動作模型結合使用。