ABBEL 與傳統遞迴式摘要的概觀。在 ABBEL 中,信念狀態取代了完整的互動歷史,成為代理模型的工作上下文,而信念評分則透過監督每個信念狀態的內容來提升效能。
隨著任務範圍擴大,大型語言模型(LLM)的上下文視窗無法無限擴展。雖然自我摘要能產生簡潔、可解釋的上下文,但卻會帶來顯著的效能成本,尤其是在高品質資料稀缺的人類輔助領域,例如協作程式碼生成。為了解決這個問題,我們提出了 ABBEL:一個將摘要資訊內容以自然語言信念狀態形式隔離並監督的框架。
為了讓語言模型能有效協助日益複雜的任務,例如軟體開發,它們必須能夠與我們進行數百甚至數千步驟的互動。對於這類長程任務,將整個互動歷史保留在上下文視窗中是不切實際的。迄今為止採用的啟發式方法是生成摘要,有時也稱為上下文壓縮。例如,Cursor 最新的模型 composer 2.5 在訓練期間使用壓縮來提升效能。
此外,Grandcode 是第一個在線上程式碼競賽中持續擊敗所有人類競爭者的系統,儘管它使用了最新的高效注意力模型 Qwen 3.5-397B,但仍認為有必要採用上下文摘要。
然而,壓縮存在一個問題。儘管在基準測試中效能差距看似不大,但像 Cursor 這樣的模型服務供應商仍建議用戶在任務執行過程中,避免對其程式碼助手使用壓縮功能。
為了理解原因,請參考下方圖 1,它比較了在 Combination Lock(一個類似 Wordle 的遊戲,最多允許 16 次猜測)中,上下文摘要模型與完整上下文模型在強化學習微調過程中的效能。儘管兩種模型類型在訓練過程中都有所改進,但摘要模型始終未能彌補與完整上下文模型之間的差距。
讓模型在完成任務的同時進行自我摘要,會增加學習問題的複雜性。雖然這通常可以透過更多資料訓練來解決,但在實際互動情境中觀察到的效能下降,很可能源於我們難以有效建立和使用人類模擬器來生成高品質的訓練環境。因此,在有限且混亂的多輪互動軌跡中,模型學習摘要的能力越好,對下游用戶的效益就越大。
為了解決學習效率低下的問題,我們將摘要生成任務獨立出來。我們從遞迴貝葉斯估計中汲取靈感,將摘要表述為信念狀態,並定期提示模型根據新資訊更新這些信念。
接著,我們提取並監督信念狀態的內容(圖 2,信念評分)。信念評分可以被視為增加一個輔助強化學習任務,它使用旨在捕捉良好信念特徵的啟發式方法作為獎勵。例如,對於程式碼任務,一個好的啟發式方法可能是「越短越好,但越接近能夠重建 git diff 越好」,因此平衡這些因素將產生一個良好的信念。
在難以定義良好啟發式方法的領域,我們提出了一種通用的自動編碼器啟發評分函數,它將當前的語言模型 πθ 視為歷史資訊的編碼器和解碼器,而信念狀態則作為編碼。我們根據當前模型 πθ 能多好地利用每個信念 bt+1 來重建最新的觀察 ot,來對其進行評分:
公式 1:重建評分目標。其中 bt+1 是更新後的信念,ot 是最新的觀察,at 是剛採取的動作,bt 是先前的信念,pI 是任務提示詞,πθ 是當前模型。評分越高,表示信念保留了重建最新觀察所需的資訊。
CollabBench 上的協作程式碼生成
我們在人類驅動的輔助程式碼生成領域展示了信念評分的實用性,並使用了 Sweet-RL 的 CollabBench 環境。
我們發現,使用通用的基於重建的信念評分函數,我們將與完整上下文模型之間的效能差距縮小了約 50%,並且與沒有信念評分的摘要模型相比,訓練步驟減少了 50%。訓練後,ABBEL 仍比完整上下文設定顯著減少記憶體使用量,這可從峰值上下文 token 長度(Peak Tokens)衡量。
Combination Lock 遊戲
此外,在 Combination Lock 遊戲中,我們證明了 ABBEL 結合利用領域知識的信念評分器(透過計算歷史中有用的統計數據並檢查它們是否可以從信念狀態中重建),能夠實現比完整上下文(FULL CTX)模型更高的學習效率。
多目標問答
在第三個環境,即多目標問答(來自 MEM1 Zhang et al., 2025,這是一項在典型遞迴摘要的修改版本中執行端到端優化的近期工作),我們透過展示峰值信念長度懲罰(更多細節請參閱論文)顯著減少了記憶體使用量,且效能下降極小,證明了將信念狀態與推理隔離的實用性。這與通常在懲罰推理長度時觀察到的情況不同。
管理長上下文的其他解決方案涉及不同的權衡,值得根據部署系統的需求加以考慮。上下文壓縮方法生成密集的表示,雖然計算效率高,但犧牲了人類可理解性。針對特定環境的手動設計摘要提示詞和修剪策略,需要專業人類知識,並且不允許代理模型將「記住什麼」作為其決策策略的一部分來學習。
將長上下文處理到外部記憶體儲存中,供代理模型或子代理模型查詢的方法是互補的,因為它們可能受益於透過摘要訓練來更好地創建下一個上下文。我們還想指出在通用遞迴摘要領域的一些令人興奮的工作,這些工作專注於數學、信念生成推理、使用類似於我們通用信念評分器的自動編碼目標的蒸餾摘要模組進行競爭性程式碼生成,以及向摘要添加連續特徵。
透過將明確的信念狀態用作多步驟互動的資訊瓶頸,可以實現更多可能性。您可以根據動作對信念狀態的影響來獎勵它們,以引導探索;傳輸明確的信念狀態以改善代理模型之間的溝通;甚至透過直接修改代理模型決策所依據的記憶體來提高用戶可控性。
某些形式的資訊,例如一個人的外貌,僅靠文字無法很好地表示。一個持續學習的系統也必須捕捉這類資訊。此外,如果我們希望系統學習用一種全新的語言進行溝通,或者玩一種全新的遊戲比世界上任何人都好,那麼在對話或遊戲生命週期中累積的技能必須以高度壓縮的形式儲存,本質上扮演模型權重本身的角色。
更強大的系統可能會結合多種形式的記憶體,其中上下文的內容可能對應於工作記憶,而其他方法則用於短期和長期記憶。如何實例化這些其他形式的記憶體,例如透過測試時訓練、適配器記憶體、連續上下文記憶體或其組合,提出了一個令人興奮的挑戰。
致謝
我們衷心感謝 Alane Suhr 和 Kartik Goyal 對本研究的指導,以及 Ethan Mendes、David He、Jitesh Jain 和 Nicholas Tomlin 對本貼文早期草稿的評論。我們還要感謝 MEM1 的作者們的電子郵件往來,以及分享了我們認為特別有見地的私人審閱者回饋。
引用
如果 ABBEL 對您未來的研究有所啟發,請引用我們的研究!以下是一些進行類似研究的建議!



