在我們上一篇文章中,比較了 ALTK-Evolve 與 ACE,並展示了如何提供代理的自我蒸餾指引,是每次任務檢索少量,還是注入整個指引集,會影響準確性和成本。這篇文章則回溯到更早的問題:你應該給它多少記憶體?

為代理配備代理記憶體聽起來很簡單:從它過去的工作中提煉經驗,將其重新放入上下文,更多的經驗應該意味著更好的性能。然而,事情並非總是如此。當我們將評估擴展到八個模型時,從 30B 密集模型到前沿專有系統,一個發現脫穎而出:

代理記憶體不是一個可以簡單開啟的功能。它是一個需要根據模型進行校準的「劑量」。

TL;DR

ALTK-Evolve 讓代理能夠從自己的過去軌跡中學習:它提煉出可重複使用的指引,並在推論時將其注入,無需更新權重,也無需人工標註。

正確的劑量因模型層級而異:具有潛力的強大模型需要完整的指引集,而較弱的模型則最適合精簡的核心指引加上每次任務的檢索,至於已經飽和的模型則沒有顯著的性能提升。

精選檢索既可以是最準確的,也是最便宜的選項:gpt-oss-120b 在任務完成率上提升了 +16.1 個百分點,而代幣成本僅增加了 +5%,在生產環境中,提示詞快取甚至能讓完整的指引集保持經濟實惠。

關鍵洞察:劑量取決於能力

並非每個模型都能從相同數量的記憶體中受益。在涵蓋各種能力的八個模型中,我們觀察到三種重複出現的模式:

具有潛力的強大模型需要完整的指引集,包括所有指引,甚至罕見的邊緣案例經驗。它們有能力吸收並應用所有這些指引。DeepSeek-V3.2 (671B MoE) 在獲得其完整的自我挖掘指引集後,任務完成率提升了 +9.5 個百分點。

較小或較弱的模型會被大量的指引集淹沒。對於這些模型,一個緊湊、高信賴度的核心指引,加上每次任務檢索少量任務相關的指引,效果最好。gpt-oss-120b (117B MoE) 透過這種選擇性方法獲得了 +16.1 個百分點的提升,而完整的指引集提升較少,且成本增加了約 50% 的代幣。

已經飽和的模型沒有顯著的性能提升。我們稱之為飽和模式,這個標籤描述了我們觀察到的現象,而非已證實的原因。模型可能已經接近其在這些任務上的上限,指引可能沒有解決其剩餘的失敗問題,或者它可能沒有有效應用這些指引。GLM-5 (745B MoE) 在我們的測試中就屬於此類。

決定模型屬於哪種模式的因素,不僅僅是參數數量。基準測試的潛力、上下文視窗大小、架構、指引品質和任務分佈似乎都影響著模型的表現,而分離這些因素是正在進行的工作。無論如何,實際的啟示是:正確的記憶體劑量取決於模型,而且我們可以對其進行校準。

學習發生在模型周圍,而非模型內部

這裡的「記憶體」並非指重播過去的對話記錄。它指的是一套指引集,從代理自身過往軌跡中提煉出的成功策略、應避免的錯誤和邊緣案例。這個學習循環很直接:

代理嘗試任務並產生軌跡。ALTK-Evolve 從其成功和失敗的運行中提取行為指引。它將這些指引整合為一個可重複使用的集合。在推論時,代理會收到完整的指引集或其中與任務相關的精選部分。

沒有模型權重被更新。學習循環改變的是代理可用的指引,而非底層模型,這正是它易於採用且在我們測試的所有八個模型中都具備可移植性的原因。

跨越不同模型的結果

我們在 AppWorld 上進行了評估,這是一個包含 585 個多步驟任務(168 個 test_normal + 417 個 test_challenge)的基準測試,涵蓋 9 個模擬應用程式(日曆、訊息、支付等)。任務以兩種方式評分:代理是否完全完成每個任務(TGC,任務目標完成率),以及情境的每個變體是否都通過(SGC,情境目標完成率,一個更嚴格、全有或全無的標準)。完整的定義在附錄中。

我們比較的「三種配置」

由於任何記憶體研究中令人困惑的部分是上下文視窗中實際包含的內容,我們預先定義了這些配置。兩種記憶體配置都來自相同的指引集,該指引集僅從 AppWorld 的訓練分割中挖掘一次(透過上述循環)。它們之間的區別僅在於該指引集的交付方式,完整的指引集在每個 ReAct 步驟中注入所有內容,而精選檢索則提供選定的子集,絕非指引的產生方式,且從未將測試分割數據用於構建它。

  • 基準線 (Baseline):無記憶體,代理的原始狀態。
  • 完整指引集 (Full guideline set):每個挖掘出的指引,在每個 ReAct 步驟中注入。
  • 精選檢索 (Curated retrieval):這些指引中固定、高信賴度的核心部分,加上為每個任務檢索的少量任務相關指引(固定部分 + 變動部分)。

模型挖掘的指引數量取決於其自身能力,因此我們根據策略(「完整指引集」與「精選檢索」)報告配置,而非原始計數,因為原始計數在不同模型之間不可比較。

三種模式,一覽無遺

來自八個模型掃描的代表性模型,以 test_normal 上的任務完成率 (TGC) 衡量:

圖 1 顯示了三種觀察到的模式中的代表性模型。條形圖顯示了基準線與最佳記憶體配置在 AppWorld test_normal 上的 TGC;x 軸從 40% 開始,以便使差異顯而易見。單獨的 TGC 低估了更大的 SGC 增益,請參閱下表中的 SGC 欄位。

下表列出了更嚴格的 SGC 指標,其中增益通常更大:

  • gpt-oss-120b (117B MoE):屬於「較弱 / 選擇性」模式,基準線 TGC/SGC 為 39.9 / 21.4,最佳記憶體配置下 TGC/SGC 達到 56.0 / 37.5,採用「精選檢索」配置,TGC 提升 +16.1,SGC 提升 +16.1。
  • DeepSeek-V3.2 (671B MoE):屬於「強大且有潛力」模式,基準線 TGC/SGC 為 79.8 / 64.3,最佳記憶體配置下 TGC/SGC 達到 89.3 / 80.4,採用「完整指引集」配置,TGC 提升 +9.5,SGC 提升 +16.1。
  • Claude Opus 4.6:屬於「強大且有潛力」模式,基準線 TGC/SGC 為 90.5 / 87.5,最佳記憶體配置下 TGC/SGC 達到 94.6 / 94.6,採用「完整指引集」配置,TGC 提升 +4.1,SGC 提升 +7.1。
  • GPT-5.5:屬於「強大 (接近上限)」模式,基準線 TGC/SGC 為 92.3 / 82.1,最佳記憶體配置下 TGC/SGC 達到 95.2 / 89.3,採用「完整指引集」配置,TGC 提升 +2.9,SGC 提升 +7.2。
  • GLM-5 (745B MoE):屬於「飽和」模式,基準線 TGC/SGC 為 87.5 / 80.4,最佳記憶體配置下 TGC/SGC 達到 87.5 / 80.4,採用「完整指引集」配置,TGC 提升 0.0,SGC 提升 0.0。

閱讀 SGC 欄位,更嚴格的指標通常比 TGC 變動更大,DeepSeek 的 SGC 從 +9.5 個百分點的 TGC 增益躍升至 +16.1 個百分點,因為良好的指引特別有助於代理清除情境的每個變體,而不僅僅是平均情況。而且這種效果並未在範圍頂端消失:GPT-5.5 和 Opus 在 TGC 上都接近上限,但 SGC 仍分別獲得 +7.2 和 +7.1 個百分點的增益。只要模型還有剩餘的失敗模式可以解決,記憶體就會持續帶來回報。

最便宜的記憶體策略也可能是最好的

一個實際的考量是:注入完整的指引集會增加每個 ReAct 步驟的輸入,因為指引在每個回合都會重新發送。以下是我們觀察到的情況:

下表顯示了每個任務的平均代幣使用量,累積在代理步驟中,並與無記憶體的基準線進行比較。

  • DeepSeek-V3.2:採用「完整指引集」配置,基準線代幣/任務為 148K,記憶體配置下為 263K,開銷為 +78%。
  • gpt-oss-120b:採用「完整指引集」配置,基準線代幣/任務為 110K,記憶體配置下為 166K,開銷為 +51%。
  • gpt-oss-120b:採用「精選檢索」配置,基準線代幣/任務為 110K,記憶體配置下為 116K,開銷為 +5%。

有兩個重點:

精選檢索能將成本維持在接近基準線的水平。對於較弱的模型,選擇性方法在準確度上勝出,同時也在成本上佔優勢,這兩者兼得(gpt-oss-120b 在 +5% 的代幣成本下,TGC 提升了 +16.1 個百分點)。這裡更好的性能並不需要更高的推論成本。

記憶體並不會讓推理循環爆炸式增長。DeepSeek 在使用記憶體時的 ReAct 步驟數量與不使用時大致相同(平均約 18-19 步),因此增加的成本是輸入代幣的膨脹,而非更長的軌跡。

在生產環境中,真正的效率槓桿是提示詞快取:指引集的靜態部分在不同步驟中是相同的,可以被快取,大幅降低實際成本。針對快取優化的提示詞設計,保持共享指引集前綴的穩定性,使其可快取,是值得投入工程的。我們也假設上下文視窗大小扮演著一個角色:具有較大視窗的模型可能更有效地吸收完整的指引集,而上下文較小的模型則從保持注入內容緊湊的檢索中受益更多。我們尚未進行控制實驗來分離這個因素。

記憶體應該被校準,而不僅僅是累積

這項研究的啟示並非是將代理所學到的一切都給予它。而是給予它實際能夠利用的經驗量。

對於較弱的模型,這意味著一個緊湊的核心指引加上一些任務特定的經驗,這巧合地也是最經濟的選項。

對於具有潛力的強大模型,這意味著保留完整的指引集,並透過提示詞快取在生產環境中保持其成本效益。

對於飽和的模型,這意味著在更好地理解其剩餘的失敗模式之前,不花費額外的上下文。

總體而言,這些增益是真實存在的,自動化、無洩漏,且無需人工標註,但前提是劑量必須與模型匹配。

下一步

這是一個起點,而非終點:

  • 學習型選擇器:我們目前的檢索是透過餘弦相似度對指引進行排序,但我們已證明這並不能完美預測哪些指引對特定任務有幫助。訓練一個基於結果訊號的選擇器是自然的下一步。
  • 針對非常弱模型的記憶體:在最低能力基準線以下,自我蒸餾缺乏足夠的訊號。針對非常弱模型的教師蒸餾記憶體是我們正在探索的另一個問題。
  • 超越 AppWorld:這些結果已在 AppWorld 上驗證,這是一個嚴格的多步驟基準測試,但僅此一個。更廣泛的代理基準測試和實際部署正在進行中。
  • 隔離上下文視窗:如上所述,我們希望進行控制實驗,將上下文視窗大小與原始能力分開。

您可以試用 ALTK-Evolve 函式庫,其中包含此處使用的提取、整合和檢索管道,或閱讀完整的技術報告以了解完整的方法和消融研究。

附錄:理解評估指標

AppWorld 任務透過兩個指標進行評分,兩者都以百分比表示(越高越好):

  • TGC,任務目標完成率 (Task Goal Completion):代理完全且正確完成的個別任務的比例。這是「是否完成任務」的關鍵數字。
  • SGC,情境目標完成率 (Scenario Goal Completion):一個更嚴格、全有或全無的指標。每個情境都包含同一任務的幾個變體(相同請求但數據、措辭或邊緣條件不同)。SGC 僅在代理成功完成每個變體時才將情境計為通過。它衡量的是可靠性,一個大多數時候都能解決任務但在一個變體上失敗的代理,在 TGC 上會得分,但在 SGC 上則不會。