實際世界中的查詢往往模糊、不完整,甚至完全錯誤。在漫長的推理鏈中,任何未解決的模糊性都會累積並將代理程式引導至錯誤的道路。如果模型在早期節點選擇了錯誤的實體,它會繼續以清晰的語法搜尋,但卻完全錯過了實際目標。
當搜尋代理程式在未澄清模糊性時選擇猜測,錯誤就會在整個推理鏈中層層傳遞,最終產生錯誤的答案。
DiscoBench 包含 211 個任務,涵蓋 11 個知識領域,包括電玩遊戲、體育、音樂、電影、科學和政治,總共有 463 個模糊點。每個任務都分為多個檢查點。在每個檢查點,代理程式可以在三種行動中選擇:繼續搜尋、向使用者尋求澄清,或提供答案。
該框架會檢查每個檢查點的搜尋是否明確,並從任務成功率到成本效益等四個指標組來評估代理程式。
研究人員定義了四種模糊性:描述可能匹配多個實體、適用於不同的時間段或版本、允許有多個有效的排名或評估標準,或者包含直接的事實錯誤。該資料集主要以中文撰寫,以反映中文網路上的典型搜尋模式。
當代理程式提出有用的後續問題時,一個基於 LLM 的使用者模擬器會釋出預設線索,幫助縮小搜尋範圍。所有搜尋查詢都透過代理程式搜尋引擎 Tavily 執行,而 Gemini 3 Flash 則作為模擬器。
該流程首先在第一階段建立清晰的多跳問題,然後在第二階段注入有針對性的模糊性和區分線索。
該團隊測試了過去六個月內發布的 11 個模型,包括 Claude Opus 4.7、GPT 5.4、Gemini 3.1 Pro Preview、Doubao Seed 2.0 Pro、DeepSeek V4 Pro、Kimi K2.6、GLM 5.1、Qwen3.6 Max、MiniMax M2.7 和 Hunyuan 3.0 Preview。
在沒有明確提示可能存在模糊性的情況下,Doubao Seed 2.0 Pro 的端到端準確度最高,達到 43.1%。Gemini 3.1 Pro 以 40.8% 緊隨其後,Claude Opus 4.7 則為 39.8%。較弱的模型如 MiniMax M2.7 和 Qwen3.6 Max 分別僅達到 16.1% 和 12.3%。
更多的搜尋呼叫並不會帶來更高的準確度。Claude Opus 4.7 經常進行搜尋,但其表現仍落後於 Gemini 3.1 Pro 和 Seed 2.0 Pro。
個別步驟分數與整體結果之間存在差距。例如,Claude Opus 4.7 正確解決了 57% 的檢查點,但端到端準確度卻只有 39.8%。單一未解決的模糊性就足以導致整個推理鏈崩潰。
作者們也測試了「引導模式」,在此模式下,系統提示會明確告知代理程式注意模糊性並在有疑問時提出後續問題。此模式旨在展示模型無需自行判斷問題是否不明確時所能達到的上限。
綜合十個模型來看,端到端準確度從 28.6% 上升到 33.7%。偵測 F1 分數則大幅躍升,從 45.3% 達到 64.9%。提示主要幫助模型發現模糊性,但並未真正幫助它們成功完成研究。對於 Claude Opus 4.7 而言,即使檢查點通過率更高,其在引導提示下的端到端準確度甚至略有下降。
行為分析顯示,先搜尋再提問("SearchThenAsk")的模型平均成功率為 93.4%。直接猜測而不提問("DirectGuess")的模型成功率降至 56.5%。重複搜尋但仍猜測而非提問("SearchHeavyGuess")的模型表現更差,僅為 51.9%。作者指出,重複搜尋表明模型可能已經發現了模糊性,但卻從未將其轉化為與使用者的互動。
這種模式也解釋了為何更多的工具呼叫並不會帶來更好的結果。Claude Opus 4.7 搜尋的頻率比大多數其他模型更高,但在準確度方面仍落後於 Gemini 3.1 Pro 和 Doubao Seed 2.0 Pro。如果代理程式從未提出正確的問題,那麼更努力地搜尋也無濟於事。
發現模糊性與提出好問題是兩種不同的技能。
Qwen3.6 Max 的偵測 F1 分數僅為 16%,在一般設定下每個任務平均只提出 0.07 個後續問題。然而,當它提問時,94.7% 的問題在事實上是正確的,並且 89.5% 的問題能推動進度。MiniMax M2.7 提問的頻率高得多,但其後續問題的成功率僅為 60.7% 至 66.5%。
一個有用的研究代理程式需要這兩種技能:辨識何時該提問,以及如何構建問題以實際推動搜尋進度。
模型最容易偵測到事實錯誤,而實體和標準的模糊性則難以發現。
事實錯誤最容易被偵測到,因為它們在研究過程中會產生直接的矛盾。實體和標準的模糊性則較難處理,因為多個看似合理的候選者或不明確的評估標準可以同時存在,而沒有任何明顯的矛盾。
如果沒有搜尋工具,受測模型的表現會大幅下降。Doubao Seed 2.0 Pro 的準確度從 43.1% 降至 2.4%,Gemini 3.1 Pro 則從 40.8% 降至 19.9%。DiscoBench 無法僅憑模型儲存的知識來解決。
同時,當問題中的模糊性被移除時,模型的表現會大幅提升,準確度根據模型不同可跳升 26.8 到 40.2 個百分點。作者們總結,未來的搜尋代理程式除了檢索和推理能力外,還需要具備將搜尋不確定性轉化為使用者互動的機制。
其他近期研究也證實了當前搜尋代理程式在研究方式上的基本弱點。一項研究發現,在 BrowseComp 等基準測試中領先的模型,往往只是確認它們已知的事實。在專為知識截止日期之外的事實設計的 LiveBrowseComp 測試中,所有系統的表現都下降了 25 到 40 個百分點。
Halluhard 基準測試也顯示,具備網路搜尋功能的 Claude Opus 4.5 在約 30% 的情況下會產生幻覺,主要發生在驗證引用來源內容時。
Anthropic 在其最新的模型更新 Claude Opus 4.8 中解決了這個問題。該模型據稱能更頻繁地標記不確定性,並且其程式碼中未註解的錯誤比前一代減少了約四倍。Perplexity 則嘗試了不同的方法,透過「Search as Code」讓模型將其搜尋工作流程寫成 Python 程式,而非呼叫預建的 API。



