Nvidia 上週五發表了一項引人注目的新研究,指出在要求 AI 執行長期任務時,「線束」(harness)的重要性遠超過底層模型本身。線束是圍繞 AI 模型的軟體包裝,包含工具、記憶體管理和規則,能將原始模型轉化為可獨立運作的實體。
簡而言之:研究人員僅透過一個經過調整、能良好處理記憶體,並包含「主管」(supervisor)式組件的客製化線束,就讓 Claude Opus 5 在互動式推理基準測試 ARC-AGI-3 上獲得 100% 的分數。ARC-AGI-3 是一系列沒有說明、模型必須自行摸索玩法並獲勝的 2D 遊戲,類似人類的學習方式。
(這個基準測試特別讓競爭對手 OpenAI 感到惱火。)若沒有線束,Opus 5 的得分僅為 30%,這已是所有測試模型中的最高分。
Nvidia 的研究再次表明,儘管模型的選擇確實重要,但模型本身,作為代理(agent)「大腦」的部分,在代理系統中所佔的比重,比許多 AI 使用者意識到的要小,尤其對於長期任務而言。線束才是讓模型成為代理的關鍵:它負責處理記憶體、上下文和回饋。
Nvidia AI 部門產品副總裁 Adel El Hallak 告訴 TechCrunch:「一般來說,業界幾乎將代理理解為模型的 API。」但他補充說,代理實際上不止於此。「它包含模型本身,也包含我們稱之為線束的模型周圍的支架,即它所利用的工具集。它還包括執行時(runtime)以及我們賦予它存取權限的相關技能和函式庫。」
長期任務是指需要將許多決策串聯起來,有時甚至需要數天才能完成的工作。這與 AI 僅對提示詞(prompt)做出回應的情況截然不同。找出如何讓 AI 執行長期任務而不分心或偏離目標,是代理研究中的一個聖杯。
例如:微軟在四月發表的研究測試了 19 個大型語言模型(LLM)在涉及文件編輯的長期任務上的表現,結果發現所有模型,包括前沿模型,都讓文件充滿錯誤。(如果人類做出這樣的工作,他們會立即被解僱。)
模型自行串聯決策的過程中,也曾被發現刪除使用者的檔案,甚至是整個資料庫,或為了達成目標而轉向犯罪行為,從串通到駭客攻擊。
Nvidia 研究人員選擇這個互動式推理基準測試進行實驗,特別有意義,甚至有些有趣。100% 的分數意味著模型可以像人類一樣出色地擊敗這些遊戲。
OpenAI 對其模型在 ARC-AGI-3 上慘不忍睹的得分(不到 10%)感到非常沮喪,因此上個月也進行了自己的研究。與 Nvidia 類似,OpenAI 發現僅透過調整線束上的兩個設定,其模型的得分就增加了三倍。
但沒有任何模型能像 Nvidia 研究人員那樣接近 100% 的分數。他們證明,線束需要一個「主管」組件,當代理卡住時,它能將代理引導到正確的方向。
El Hallak 表示:「更有趣的部分是,除了執行主要工作的代理之外,還引入了一個監督代理。」它「幾乎就像一位執行長,在代理偏離方向、開始探索可能導致死胡同的路徑,或者重新探索它之前走過的路徑時,給予提示。」
雖然監督代理的概念並非全新,但現今大多數代理使用者僅依賴線束的一個層級,例如 Claude Code、Codex 或 Hermes。Nvidia 研究人員則創建了他們自己的強化版線束,稱為 Agentic Variation Operators (AVO)。
請注意,這並非 Nvidia 的新產品。Nvidia 反而以 Nemo 品牌提供許多用於構建線束的開源技術組件。其中一些技術是商業化的,但大部分是公開可用的。
儘管如此,Nvidia 的研究結果進一步證明,模型選擇遠非影響代理性能的唯一因素。例如,Databricks 在七月發表了一些驚人的研究,顯示線束對 AI 成本的影響遠大於模型本身。
Databricks 執行長 Ali Ghodsi 告訴 TechCrunch:「你可以選擇相同的模型但使用不同的線束,如果使用錯誤的線束,成本會顯著增加。」「所以你可能會想,哦,這是一個昂貴的模型,這是一個便宜的模型。但等等,你使用的是哪種線束?這本身就可以讓你的成本翻倍。」
Nvidia 更大的重點是展示開放式線束,就像開放式模型一樣,能讓使用者獲得遠超他們想像的控制權。
El Hallak 說:「我們相信,並且正在透過生態系統展示,開放式線束如何讓您調整更多參數來提高準確性。」「這與 OpenAI 由於模型造成安全漏洞而放慢模型訓練速度有關。」
他補充說:「我們相信擁有一個開放的代理堆疊,您可以在線束、基礎設施和執行時層面進行控制,是推動生態系統向前發展並確保安全的必要條件。」



