近年來,大型語言模型(LLM)多代理系統因其協作解決複雜問題的能力而受到廣泛關注。然而,這些系統儘管活動頻繁,卻常在任務中失敗。
機構:賓州州立大學(Penn State University)、杜克大學(Duke University)、Google DeepMind、華盛頓大學(University of Washington)、Meta、南洋理工大學(Nanyang Technological University)和俄勒岡州立大學(Oregon State University)。
共同第一作者為賓州州立大學的 Shaokun Zhang 和杜克大學的 Ming Yin。
近年來,大型語言模型(LLM)多代理系統因其協作解決複雜問題的方法而受到廣泛關注。然而,這些系統儘管活動頻繁,卻常在任務中失敗。這讓開發者面臨一個關鍵問題:哪個代理在何時對失敗負責?在龐大的互動日誌中篩選以找出根本原因,感覺就像大海撈針,既耗時又費力。
這對開發者來說是常見的困擾。在日益複雜的多代理系統中,由於代理協作的自主性以及冗長資訊鏈,失敗不僅常見,而且極難診斷。如果沒有辦法快速識別失敗的來源,系統的迭代和優化就會停滯不前。
為了解決這項挑戰,賓州州立大學和杜克大學的研究人員,與包括 Google DeepMind 在內的多個機構合作,提出了「自動化失敗歸因」(Automated Failure Attribution)這一新穎的研究問題。他們為這項任務建構了第一個基準資料集 Who&When,並開發和評估了多種自動化歸因方法。這項工作不僅突顯了任務的複雜性,也為提升大型語言模型多代理系統的可靠性開闢了一條新路徑。
這篇論文已被頂級機器學習會議 ICML 2025 接受為 Spotlight 演講,其程式碼和資料集現已完全開源。
研究背景與挑戰
大型語言模型驅動的多代理系統在許多領域展現了巨大潛力。然而,這些系統很脆弱;單一代理的錯誤、代理之間的誤解,或資訊傳輸中的失誤,都可能導致整個任務的失敗。
目前,當系統失敗時,開發者通常只能依賴手動且低效的除錯方法:手動日誌挖掘:開發者必須手動審查冗長的互動日誌以找出問題根源。依賴專業知識:除錯過程高度依賴開發者對系統和手頭任務的深入理解。
這種「大海撈針」式的除錯方法不僅效率低下,也嚴重阻礙了系統的快速迭代和可靠性提升。迫切需要一種自動化、系統化的方法來精確定位失敗原因,有效彌合「評估結果」與「系統改進」之間的鴻溝。
核心貢獻
這篇論文在解決上述挑戰方面做出了幾項開創性貢獻:
1. 定義新問題:這篇論文首次將「自動化失敗歸因」正式化為一項特定的研究任務。這項任務的定義是識別導致任務失敗的「負責代理」和「決定性錯誤步驟」。
2. 建構首個基準資料集 Who&When:這個資料集包含了從 127 個大型語言模型多代理系統中收集的廣泛失敗日誌,這些日誌是透過演算法生成或由專家手工製作,以確保真實性和多樣性。每個失敗日誌都附有細緻的人工標註,包括:Who:對失敗負責的代理。When:發生決定性錯誤的具體互動步驟。Why:對失敗原因的自然語言解釋。
3. 探索初步的「自動化歸因」方法:利用 Who&When 資料集,該論文設計並評估了三種不同的自動化失敗歸因方法:
All-at-Once(一次性):此方法向 LLM 提供使用者查詢和完整的失敗日誌,要求它一次性識別負責代理和決定性錯誤步驟。儘管成本效益高,但在長語境中可能難以精確定位錯誤。
Step-by-Step(逐步):此方法模仿手動除錯,讓 LLM 依序審查互動日誌,在每個步驟做出判斷,直到找到錯誤。它在定位錯誤步驟方面更精確,但成本較高且有累積錯誤的風險。
Binary Search(二分搜尋):這是前兩種方法之間的折衷策略,它重複將日誌一分為二,使用 LLM 判斷哪個區段包含錯誤。然後它遞迴搜尋已識別的區段,在成本和性能之間取得平衡。
實驗結果與關鍵發現
實驗在兩種情境下進行:一種是 LLM 知道多代理系統試圖解決的問題的真實答案(With Ground Truth),另一種是它不知道(Without Ground Truth)。主要使用的模型是 GPT-4o,但也測試了其他模型。對 Who&When 資料集上這些方法的系統性評估產生了幾個重要見解:
還有很長的路要走:目前的方法遠非完美。即使是表現最好的單一方法,在識別負責代理方面的準確度也僅約 53.5%,而在精確定位錯誤步驟方面更只有 14.2%。有些方法的表現甚至比隨機猜測還差,突顯了這項任務的困難度。
沒有「一體適用」的解決方案:不同的方法擅長解決問題的不同方面。All-at-Once 方法在識別「Who」(誰)方面表現較好,而 Step-by-Step 方法在確定「When」(何時)方面更有效。Binary Search 方法則提供了中等的性能。
混合方法展現潛力但成本高昂:研究人員發現,結合不同方法,例如使用 All-at-Once 方法識別潛在代理,然後應用 Step-by-Step 方法找出錯誤,可以提高整體性能。然而,這會顯著增加計算成本。
最先進模型也面臨挑戰:令人驚訝的是,即使是像 OpenAI o1 和 DeepSeek R1 這樣最先進的推理模型,也認為這項任務具有挑戰性。這突顯了自動化失敗歸因的固有難度,它需要比傳統任務更高層次的推理能力。
明確推理的重要性:研究顯示,在 All-at-Once 和 Step-by-Step 方法中,提供要求 LLM 解釋其推理過程的明確提示詞,可以提高性能。
上下文長度是限制因素:研究還揭示,隨著失敗日誌的上下文長度增加,所有歸因方法的性能都會下降,對識別錯誤步驟的準確性影響更為顯著。
未來展望:為更可靠的多代理系統鋪路
「自動化失敗歸因」是多代理系統開發生命週期中的關鍵組成部分。它有潛力將「哪裡出錯以及誰該負責」的難題,從一個令人困惑的謎團轉變為一個可量化、可分析的問題。透過在評估和改進之間建立橋樑,我們最終可以創建出更可靠、更智慧、更值得信賴的多代理系統。


