隨著人工智慧從聊天機器人轉向自主代理,開源模型正滿足市場對於 AI 運行地點、部署方式及演進過程的全面控制需求。

NVIDIA 今日擴展其 Nemotron 3 模型家族,推出 Nemotron 3.5 Lightning,這是同類模型中針對長時間運行的代理式 AI 工作負載,效率最高的模型。此次發布繼 Nemotron 3 Nano 之後,展現了 NVIDIA 致力於持續改進開源模型以提升準確性和速度的承諾。

Nemotron 3.5 Lightning 是一個擁有 300 億參數的專家混合模型,專為大型多代理系統中的專業任務而建構,有助於創建更智慧、更高效的代理式應用程式。

此外,NVIDIA 也發布了 NeMo Switchyard,這是一個用於熱門代理工具內部智慧路由的開源函式庫。企業可以根據自身特定需求,利用它來建構路由器。部署後,NeMo Switchyard 能夠智慧地將每個請求導向最適合且最有能力的模型,而無需開發人員重寫其應用程式。

Nemotron 3.5 Lightning 與 NeMo Switchyard 結合,讓 AI 的部署方式、運行地點及操作效率獲得更大的控制權,涵蓋個人電腦、工作站、資料中心及雲端環境。

Nemotron 3.5 Lightning 以一個小型、可客製化的開源模型,為高流量的代理式工作流程提供前沿級別的智慧。

常駐型代理需要模型系統

現代代理式系統,即常駐型代理,正日益以模型系統或模型集成的方式運作,其中不同的模型專精於不同的任務。

NVIDIA Nemotron 開源模型正是為此架構而設計。像 Nemotron 3 Ultra 或 GPT-5.6 這樣的前沿推理模型可以規劃和協調工作流程,而 Nemotron 3.5 Lightning 等較小的專業模型則能執行程式碼審查、工具使用、安全警報監控和回答帳單問題等特定任務。

Nemotron 3.5 Lightning 驅動高流量專業任務

NVIDIA Nemotron 3.5 Lightning 是一個完全可客製化的開源模型,專為驅動常駐型代理的高流量任務而建構。它是在 Nemotron 聯盟成員的貢獻下開發的,這些成員提供了評估方法、推論軟體和資料集,以幫助推進該模型。

該模型提供高達 4 倍的輸出速度,相較於同類其他模型,代理式任務完成速度提升 30%。由於它是開源且可客製化的,Nemotron 3.5 Lightning 可以透過 NVIDIA NeMo 輕鬆地使用組織自身的領域資料、工具和工作流程進行後續訓練,以提高專業任務的準確性。

PinchBench 基準測試顯示,Nemotron 3.5 Lightning 在代理式任務完成方面提供更快的速度,並達到與同類其他模型相比的前沿級別準確性。

各行各業的 AI 領導者正在為其工作負載客製化 Nemotron 3.5 Lightning,例如 CrowdStrike 用於網路安全,Harvey 與 Trajectory 用於法律服務,以及 CodeRabbit 與 Baseten 用於程式碼審查,這些都有助於提高特定領域代理式任務的準確性。

此外,Lila Sciences 正協助提升物理和生命科學領域代理式任務的推理能力,而 Fastino Labs 則客製化了該模型,並在軟體開發、金融和醫療保健工作負載中看到了領先的準確性。

企業已客製化 Nemotron 3.5 Lightning,以在其代理式工作流程中的專業任務中實現領先的準確性。

Nemotron 3.5 Lightning 也賦予組織對隱私和部署的控制權。它可以在本地 AI 系統上運行,包括 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson,幫助用戶最大化現有基礎設施投資,或擴展到邊緣 AI 設備、NVIDIA RTX PRO 工作站、資料中心和雲端環境,以應對企業用例。

對於需要快速回應的高流量專業任務,Nemotron 3.5 Lightning 可以在本地或內部部署運行。

此外,與每次 Nemotron 發布一樣,NVIDIA 會在許可範圍內公開盡可能多的訓練資料和技術,這有助於追溯、審計和訓練其他模型。除了 Lightning,NVIDIA 還發布了 Nemotron-RL-Agentic-Terminal-Pivot,這是一個代理式強化學習資料集,用於對其進行後續訓練以實現程式碼代理功能。

透過模型路由實現更高效的 AI 應用

有些模型更適合程式設計,有些用於推理,有些用於輕量級任務,還有一些則經過優化可在本地運行,以提高隱私和效率。如果客戶僅依賴一個預設模型,他們可能會過度花費或犧牲品質;如果手動管理路由,則會變成整合工作,進而減慢部署速度。

NVIDIA NeMo Switchyard 是一個用於 AI 代理的模型路由開源函式庫。這項技術會根據特定需求,自動將提示詞路由到代理工作流程中每個步驟最適合且最有效率的模型。代理應用程式開發人員可以透過不同的路由演算法來調整或修改路由器,以符合他們優先考量,例如品質、延遲和成本要求。在模型系統中,企業可以創建具有改進代幣經濟效益的強大 AI 代理。

內部基準測試顯示,NeMo Switchyard 在保持前沿級別準確性的同時,將任務完成成本降低到僅使用 Opus 4.8 的近三分之一。

NVIDIA 內部基準測試顯示,NeMo Switchyard 在保持前沿級別準確性的同時,將任務完成成本降低到僅使用 Opus 4.8 的近三分之一。

NVIDIA 正與 AI 生態系統中的合作夥伴合作,將智慧模型路由功能整合到開發人員已使用的工具和平台中。

Boomi 評估了 Switchyard 的五種路由能力,實現了 100% 的領域路由準確性,將 59% 的流量導向速度快 5 倍的微調模型,並將後續輪次延遲降低了 21%。

Cadence 透過使用 ChipStack AI Super Agent 進行形式驗證用例,將效率提高了 9.9%。

Classmethod 內部正在使用 NeMo Switchyard 運行 opencode 和 Fireworks 工作負載,初步測試顯示在保持品質的同時,成本降低了 27%。

Cognition 將 NVIDIA NeMo Switchyard 分階段路由器整合到 Devin Desktop 中供 NVIDIA 內部使用,在 FrontierCode Main 上實現了接近前沿的性能,同時相較於將所有請求路由到單一基礎前沿模型,平均成本降低了 28%。

Kong 透過 Kong AI Gateway 原生提供 NeMo Switchyard 的路由功能。

LangChain 藉由 NeMo Switchyard,在 145 個多輪 Deep Agents 任務中,僅將 7% 的呼叫路由到前沿模型,以 6% 的準確性權衡,實現了 74% 的成本降低。

LiteLLM 正在將 NeMo Switchyard 作為外掛程式添加到其代理層中,以便開發人員無需更改現有堆疊即可獲得這些優勢。

Nous Research 將 NeMo Switchyard 整合到 Hermes 中,為開發人員提供易於配置的路由系統,以提高代理效率。

Ramp 在 Ramp SWE-Bench 中使用 NeMo Switchyard,在匹配前沿模型性能的同時,將成本降低了 58%,運行時間縮短了 33%。

Siemens 正在進行基準測試,以提高其 Fuse EDA AI Agent 的效率。

Nemotron 3.5 Lightning 可在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上作為 NVIDIA NIM 微服務獲取,並透過廣泛的 NVIDIA 雲端合作夥伴、後續訓練平台、推論平台和雲端服務供應商生態系統提供。NeMo Switchyard 已在 GitHub 上發布,並即將在合作夥伴平台上推出。