微軟的 ThinkingBox 根據 AI 代理留下的記錄,而非其生成的語句,來評估它們的表現,並進一步探究它們能否連續二十次完成任務。這項工具現已透過 Hugging Face 提供。
圖一:ThinkingBox 讓代理在獨立的 MCP 工具會話中運行,然後評估其留下的終端後端狀態和副作用。圖片取自我們的 ThinkingBox 論文。
這是一篇由微軟和 Hugging Face 聯合發表的部落格文章,特別感謝 Tommy Guy(Enderis AI 創辦人,前微軟員工)、Hugging Face 的 Sergio Paniego,以及我們的前實習生 Zhuochun Li(匹茲堡大學)、Ali Keramati(加州大學爾灣分校)、Youngmin Ko(西北大學)在共同撰寫和審閱方面的努力。
一位顧客寫信投訴。她價值 745 美元的廚房電器,在納許維爾的一個配送中心被快遞公司標記為「異常」,已經超過預計送達日期十五天。
AI 代理進行了仔細的工作。它進行了九次工具調用:拉取訂單、檢查追蹤狀態、查詢顧客資料、兩次搜尋退款政策、確認沒有現有工單、開啟一個新工單、記錄時間軸,並正確解讀政策;她的帳戶確實不符合延遲交貨賠償的資格。
然後,它將工單標記為已解決,並回覆:「您的問題已解決,還有什麼可以協助您的嗎?」
這裡有兩個問題。快遞異常狀態仍然存在,因此所需的最終狀態應該是「等待解決」。而且,顧客從未得到她實際詢問的問題的真正答案。
一個檢查工具調用的 AI 評分器會看到九個格式良好的調用。檢查代理是否寫入資料庫的評分器也會看到這一點。但資料庫卻不同意。
ThinkingBox 衡量的正是這種落差。它在 507 個有狀態的商業工作流程中,針對各種 LLM 模型各運行 20 次,並根據終端後端狀態和副作用來評估代理。這篇文章涵蓋了我們的發現、一致性的成本,以及如何透過 OpenEnv 自行運行此基準測試。
您可以自行運行這個範例:上述範例改編自基準測試任務 sandbox_external_retail_group1.py:test_case_ST003_006,而導致失敗的可執行檢查是一個單一欄位:工單的狀態是「已解決」,但所需的最終狀態是「等待」。完整的追蹤記錄請參閱我們論文的附錄 D.4,案例 3。
內容:
工具調用不等於結果
一次成功不代表可靠
您能依賴代理背後的模型嗎?
一致性的成本
失敗特徵
運作方式
自行運行
下一步發展
想在閱讀結果前先試試看嗎?請跳至「自行運行」部分。
工具調用不等於結果
最終回應和有效的工具調用只是代理。代理可能聽起來正確,卻留下錯誤的值、更改了錯誤的記錄,或產生了額外的副作用。只有它留下的記錄才能解決問題。
這種落差是巨大的。在涵蓋 12 個 LLM 模型、121,680 次有效試驗的共同集消融實驗中,有 79,853 次嘗試未能通過可執行檢查。在這些失敗中,有 67.24% 仍然乾淨地終止、調用了改變狀態的工具,並且沒有報告最終工具錯誤。然而,可執行檢查發現其中 77.61% 的欄位值錯誤,43.30% 產生了意外的額外效果,25.36% 缺少了所需的必要效果。這些狀態檢查的發現存在重疊。
軌跡是一種聲明。資料庫狀態才是證據。重複執行是信任測試。
一次成功不代表可靠
一個代理如果一次正確處理了退款,但在接下來的四次中都處理不當,那麼它就不是一個合格的退款代理。因此,每個任務都會從相同的乾淨後端獨立運行 20 次,我們報告三種不同的結果:
表一:我們報告的三個數字,以及每個數字回答的問題。
指標, 衡量內容, 回答問題
pass@1, 所有成功嘗試的比例, 通常表現如何?
pass@20, 在 20 次嘗試中至少成功一次的任務比例, 它能做到嗎?廣度。
Observed 20/20, 實際通過所有 20 次記錄嘗試的任務, 它能一直正確嗎?
我們在這篇部落格文章中將「Observed 20/20」作為 507 個任務中實際通過 20 次嘗試的任務的字面計數。沒有估計器,也沒有平滑處理。
從熟悉的視角開始。下表報告了按領域劃分的 pass@1,即單次嘗試的得分估計。這是大多數排行榜發布的數字,單獨來看,它就像一個普通的性能排名。
表二:ThinkingBox-Bench 按領域劃分的 pass@1 (%)。每個模型在每個任務上進行 20 次重複試驗。粗體標記組別領先者;底線標記亞軍。單次嘗試得分估計的標準誤差在我們的 ThinkingBox 論文表四中提供。
Claude Opus 5.5 以 67.16% 的總體得分領先,比 Claude Opus 5 高出 0.66 個百分點。Kimi-K3 是最強大的開源模型,與 GPT-6 Astra 相差不到一個百分點。領域差異也同樣重要:Claude Opus 4.6 在零售業務中得分為 68.62%,但在汽車保險中僅為 8.30%。
一次良好的運行告訴你模型能夠完成工作。它沒有告訴你它是否會再次完成。因此,每個任務運行 20 次,並詢問有多少分數能夠維持。
圖二:每個模型的單次嘗試得分在 20 次重複運行後保留了多少。
只有三個模型保留了大部分的 pass@1 分數:GPT-6 Astra 保留了其單次嘗試率的 78%,而 Claude Opus 5.5 和 Claude Opus 5 各保留了 71%。另一方面,GLM-5.1、Kimi-K2.6 和 DeepSeek-V4-Pro 各保留了約 8%。
模型一次能做到的與每次都能做到的之間的差距,才是整個故事的關鍵。
您能依賴代理背後的模型嗎?
圖三:廣度與一致性之間的差異。顯示了十八個模型中的十二個;為了可讀性,省略了六個 pass@1 低於 33% 的模型。
Kimi-K3 擁有我們測試過所有模型中最廣泛的覆蓋範圍。它至少一次解決了基準測試中 93.89% 的任務:507 個任務中有 476 個。只有 31 個任務完全擊敗了它,這是所有模型中最低的數量。在零售工作流程中,它以 82.24% 的 pass@1 領先,超越所有專有模型。
然而,Kimi-K3 也是一致性最低的模型之一。在 507 個任務中,只有 68 個(13.41%)在所有 20 次嘗試中都成功了。
Claude Opus 5 則相反。它至少一次解決的任務較少(79.09%;有 106 個任務完全擊敗它),但在每次嘗試中都完成了基準測試的 47.53%。
較新的模型並未解決這個問題。Claude Opus 5.5 在每次嘗試的平均得分上高於 Claude Opus 5,分別為 67.16% 對 66.50%,並且至少一次解決了更多的任務。但在所有 20 次嘗試中,它通過的任務數量完全相同:241 個。 headline 準確度提高了半個百分點,卻沒有帶來任何額外的可靠性。
Kimi-K3 至少一次解決的任務比 Opus 5 多 75 個。
Opus 5 一致性解決的任務比 Kimi-K3 多 173 個。
如果您正在為涉及真實記錄的工作選擇模型,那麼 pass@20 不是您應該關注的欄位。
一致性的成本
能力比較通常只停留在分數上。對於任何部署者來說,相關的問題是成功完成一個工作單元的成本是多少。我們將其衡量為每個成功任務嘗試的成本。我們稱之為「任務嘗試」,因為每個基準測試任務都會重複運行,並且每次嘗試都會產生費用,因此 pass@1 是匹配的品質分母。
我們從每個模型在 507 × 20 次完整運行活動中記錄的 token 使用量中,以 OpenRouter+ 上可用的未折扣牌價計算成本,並排除促銷折扣和聲明量化的端點。輸入、輸出和快取費率都來自每個模型的單一供應商端點。
然後我們將一次運行的成本除以成功嘗試的次數:
每個成功任務嘗試的成本 = 507 次嘗試的估計成本(每個任務一次嘗試)÷ (507 × pass@1)
這是一個比較效率指數,不是發票,也不是服務一個生產請求的價格。它也只計算單次成功的價格,而不是一致性的價格。我們接下來計算一致性的價格。
範例:GPT-5.4 進行 507 次嘗試(每個任務一次嘗試)的成本為 43.49 美元,其 pass@1 為 65.36%,因此 43.49 美元 ÷ (507 × 0.6536) = 每個成功任務嘗試 0.131 美元。
帕累托成本前沿
如果沒有其他模型在價格不高於且準確度不低於它的情況下,那麼該模型就在前沿。有三個模型符合條件;其他所有模型至少在一個軸上被支配。
圖四:每個成功任務嘗試的成本與 pass@1。帶環的點是帕累托成本前沿模型。
前沿有三個階段。GPT-5.6 Sol 的每個成功成本最低,為 0.127 美元;GPT-5.4 將 pass@1 提高了 3.45 個百分點,每個成功成本增加 0.004 美元;Claude Opus 5.5 再增加 1.80 個百分點,每個成功成本為 0.276 美元。這三個模型都保持在成本前沿線上,因為沒有更便宜的模型能與其 pass@1 相匹配。
Claude Opus 5 是最明顯的例子:每個成功嘗試的成本為 0.475 美元,pass@1 為 66.50%,它比 Claude Opus 5.5(0.276 美元,67.16%)更昂貴且準確度更低。
現在計算一致性的價格
每個成功成本獎勵的是便宜且經常正確的模型。它不獎勵每次都正確的模型。因此,我們也計算每個可靠任務的成本:20 次完整運行活動的成本除以模型在所有 20 次嘗試中都通過的任務數量。
每個可靠任務的成本 = 20 次運行 507 次嘗試的估計成本 ÷ 通過 20/20 的任務數量
範例:GPT-6 Astra 的活動成本為 20 × 86.03 美元 = 1,720.60 美元,它在每次嘗試中通過了 231 個任務,因此 1,720.60 美元 ÷ 231 = 每個可靠任務 7.45 美元。
表三:在至少有一個 Observed 20/20 任務的模型中,每個可靠任務的九個最低成本,從低到高排序。估計值,非實際雲端帳單。
現在按成本排名

