這是 Synced 的「分享我的研究」專欄,歡迎學者們與全球超過200萬的AI愛好者分享他們的研究突破。除了技術進展,分享我的研究也呼籲分享研究背後有趣的故事和令人興奮的研究想法。認識作者參與機構:賓州州立大學、杜克大學、Google DeepMind、華盛頓大學、Meta、南洋理工大學和俄勒岡州立大學。

共同第一作者為賓州州立大學的 Shaokun Zhang 和杜克大學的 Ming Yin。近年來,大型語言模型(LLM)多代理系統因其協作解決複雜問題的能力而受到廣泛關注。然而,這些系統即使活躍運作,也常在任務中失敗。這讓開發者面臨一個關鍵問題:哪個代理在何時導致了故障?

在龐大的互動日誌中篩選以找出根本原因,就像大海撈針一樣,既耗時又費力。這對開發者來說是常見的困擾。在日益複雜的多代理系統中,故障不僅普遍,而且由於代理協作的自主性和冗長的信息鏈,診斷起來異常困難。如果無法快速識別故障來源,系統的迭代和優化將停滯不前。

為了解決這個挑戰,來自賓州州立大學和杜克大學的研究人員,與包括Google DeepMind在內的機構合作,提出了一個新穎的研究問題:「自動化故障歸因」。他們為此任務構建了首個基準數據集Who&When,並開發和評估了多種自動歸因方法。

這項工作不僅突顯了任務的複雜性,也為提升LLM多代理系統的可靠性開闢了新途徑。這篇論文已被頂級機器學習會議 ICML 2025 接受為 Spotlight 演講,其程式碼和數據集現已完全開源。研究背景與挑戰由LLM驅動的多代理系統在許多領域展現出巨大潛力。

然而,這些系統是脆弱的;單一代理的錯誤、代理之間的誤解或信息傳輸的失誤都可能導致整個任務的失敗。目前,當系統發生故障時,開發者通常只能依賴手動且低效的除錯方法:手動日誌挖掘:開發者必須手動審查冗長的互動日誌以找出問題根源。依賴專業知識:除錯過程高度依賴開發者對系統和當前任務的深入理解。

這種「大海撈針」式的除錯方法不僅效率低下,也嚴重阻礙了系統的快速迭代和可靠性提升。迫切需要一種自動化、系統化的方法來精確定位故障原因,有效彌合「評估結果」與「系統改進」之間的鴻溝。核心貢獻本論文為解決上述挑戰做出了幾項開創性貢獻:1. 定義新問題:本論文首次將「自動化故障歸因」形式化為一個特定的研究任務。

此任務的定義是識別導致任務失敗的負責故障代理和關鍵錯誤步驟。2. 構建首個基準數據集:Who&When:此數據集包含從127個LLM多代理系統收集的廣泛故障日誌,這些日誌是透過演算法生成或由專家手工製作,以確保真實性和多樣性。

每個故障日誌都附有細緻的人工標註,內容包括:_Who(誰):負責故障的代理。_ _When(何時):發生關鍵錯誤的具體互動步驟。_ _Why(為何):故障原因的自然語言解釋。_3. 探索初步的「自動歸因」方法:利用 Who&When 數據集,本論文設計並評估了三種不同的自動故障歸因方法:一次性歸因(All-at-Once):此方法向LLM提供用戶查詢和完整的故障日誌,要求其一次性識別負責故障的代理和關鍵錯誤步驟。

儘管成本效益高,但在長上下文中可能難以精確定位錯誤。逐步歸因(Step-by-Step):此方法模仿手動除錯,讓LLM依序審查互動日誌,在每個步驟進行判斷,直到找到錯誤。它在定位錯誤步驟方面更精確,但成本較高且存在錯誤累積的風險。二分搜尋(Binary Search):作為前兩種方法的折衷,此策略重複將日誌一分為二,利用LLM判斷哪個區段包含錯誤。

然後它會遞迴搜尋已識別的區段,在成本和性能之間取得平衡。實驗結果與主要發現實驗在兩種設定下進行:一種是LLM知道多代理系統試圖解決問題的真實答案(With Ground Truth),另一種是不知道(Without Ground Truth)。

主要使用的模型是 GPT-4o,但也測試了其他模型。對 Who&When 數據集上這些方法的系統評估產生了幾個重要見解:仍有長足進步空間:目前的方法遠非完美。即使是表現最好的單一方法,在識別負責代理方面的準確度也僅約 53.5%,而在精確定位錯誤步驟方面更是只有 14.2%。

有些方法的表現甚至比隨機猜測還差,突顯了這項任務的難度。沒有「一勞永逸」的解決方案:不同的方法在問題的不同方面表現出色。一次性歸因方法在識別「Who(誰)」方面表現較好,而逐步歸因方法在確定「When(何時)」方面更有效。

二分搜尋方法則提供了中等的性能。混合方法展現潛力但成本高昂:研究人員發現,結合不同方法,例如先使用一次性歸因方法識別潛在代理,然後應用逐步歸因方法找出錯誤,可以提高整體性能。然而,這會顯著增加計算成本。最先進模型也面臨挑戰:令人驚訝的是,即使是像 OpenAI o1 和 DeepSeek R1 這樣最先進的推理模型,也認為這項任務具有挑戰性。

這突顯了自動化故障歸因的固有難度,它需要比傳統任務更高層次的推理能力。明確推理的重要性:在一次性歸因和逐步歸因方法中,提供明確的提示詞要求LLM解釋其推理過程,結果顯示能提升性能。上下文長度是限制因素:研究還揭示,隨著故障日誌的上下文長度增加,所有歸因方法的性能都傾向於下降,尤其對識別錯誤步驟的準確性影響更為顯著。