在這篇文章中,我將介紹一種基於「替代」範式,分而治之,的強化學習 (RL) 演算法。與傳統方法不同,此演算法_不_基於時間差分 (TD) 學習(後者存在擴展性挑戰),並且能很好地擴展到長時程任務。
!圖片 1_我們可以基於分而治之來進行強化學習 (RL),而非時間差分 (TD) 學習。
## 問題設定:離策略強化學習我們的問題設定是離策略強化學習。讓我們簡要回顧一下這代表什麼。強化學習中有兩類演算法:在策略強化學習 (on-policy RL) 和離策略強化學習 (off-policy RL)。在策略強化學習意味著我們_只能_使用當前策略收集的新數據。
換句話說,每次更新策略時,我們都必須丟棄舊數據。PPO 和 GRPO 等演算法(以及一般的策略梯度方法)屬於此類。離策略強化學習意味著我們沒有這種限制:我們可以使用_任何_類型的數據,包括舊經驗、人類示範、網路數據等等。因此,離策略強化學習比在策略強化學習更通用和靈活(當然也更困難!)
。Q學習是最著名的離策略強化學習演算法。在數據收集成本高昂的領域(_例如_,機器人學、對話系統、醫療保健等),我們通常別無選擇,只能使用離策略強化學習。這就是為什麼它是一個如此重要的問題。截至 2025 年,我認為我們已經有相當不錯的方法來擴展在策略強化學習(_例如_,PPO、GRPO 及其變體)。
然而,我們仍然沒有找到一個能夠很好地擴展到複雜、長時程任務的「可擴展」_離策略強化學習_演算法。讓我簡要解釋一下原因。## 價值學習的兩種範式:時間差分 (TD) 和蒙地卡羅 (MC)在離策略強化學習中,我們通常使用時間差分 (TD) 學習(_即_,Q學習)來訓練價值函數,其貝爾曼更新規則如下:Q(s,a)←r+γ max a′Q(s′,a′),問題在於:下一個價值 Q(s′,a′) 中的誤差會透過自舉傳播到當前價值 Q(s,a),並且這些誤差在整個時程中_累積_。
這基本上就是為什麼 TD 學習難以擴展到長時程任務的原因(如果您對更多細節感興趣,請參閱這篇文章)。為了緩解這個問題,人們將 TD 學習與蒙地卡羅 (MC) 回報混合。
例如,我們可以使用 n 步 TD 學習 (TD-n):Q(s t,a t)←∑i=0 n−1 γ i r t+i+γ n max a′Q(s t+n,a′)。在這裡,我們對前 n 步使用實際的蒙地卡羅回報(來自數據集),然後對剩餘的時程使用自舉價值。
這樣,我們可以將貝爾曼遞迴的次數減少 n 倍,從而減少誤差累積。在 n=∞ 的極端情況下,我們恢復了純粹的蒙地卡羅價值學習。雖然這是一個合理的解決方案(並且通常效果良好),但它非常不令人滿意。
首先,它沒有_從根本上_解決誤差累積問題;它只是將貝爾曼遞迴的次數減少了一個常數因子 (n)。其次,隨著 n 的增長,我們會遇到高變異數和次優性問題。因此,我們不能簡單地將 n 設定為一個大值,而是需要針對每個任務仔細調整它。是否有從根本上解決這個問題的不同方法?
## 「第三」範式:分而治之我的主張是,價值學習中的_第三_範式,分而治之,可能為離策略強化學習提供一個理想的解決方案,使其能夠擴展到任意長時程的任務。!圖片 2_分而治之以對數方式減少貝爾曼遞迴的次數。
分而治之的核心思想是將一個軌跡分成兩個等長的區段,並結合它們的價值來更新整個軌跡的價值。這樣,我們(理論上)可以_對數方式_(而非線性方式!)減少貝爾曼遞迴的次數。此外,它不需要像 n 一樣選擇超參數,而且不像 n 步 TD 學習那樣必然會遇到高變異數或次優性問題。
從概念上講,分而治之確實具備了我們在價值學習中想要的所有優點。因此,我長期以來一直對這個高層次的想法感到興奮。問題是,直到最近,如何將其付諸實踐一直不明朗。## 一種實用演算法在與 Aditya 共同領導的近期研究中,我們在實現和擴展這個想法方面取得了有意義的進展。
具體來說,我們成功地將分而治之的價值學習擴展到高度複雜的任務(據我所知,這是第一個這樣的研究!),至少在強化學習的一個重要類別,_目標導向強化學習_中。目標導向強化學習旨在學習一種策略,使其能夠從任何狀態到達任何其他狀態。這提供了一個自然的分而治之結構。
讓我來解釋一下。其結構如下。我們首先假設動力學是確定性的,並將兩個狀態 s 和 g 之間的最短路徑距離(「時間距離」)表示為 d∗(s,g)。那麼,它滿足三角不等式:d∗(s,g)≤d∗(s,w)+d∗(w,g) 對於所有 s,g,w∈S。
在價值方面,我們可以將這個三角不等式等效地轉化為以下_「遞移性」_貝爾曼更新規則:V(s,g)←⎧⎩⎨⎪⎪⎪⎪⎪⎪⎪⎪⎪⎪γ 0 γ 1 max w∈S V(s,w)V(w,g)if s=g,if(s,g)∈E,otherwise 其中 E 是環境轉移圖中的邊集,V 是與稀疏獎勵 r(s,g)=1(s=g) 相關聯的價值函數。
直觀地說,這意味著我們可以使用兩個「較小」的價值:V(s,w) 和 V(w,g) 來更新 V(s,g) 的價值,前提是 w 是最短路徑上的最佳「中點」(子目標)。這正是我們一直在尋找的分而治之價值更新規則!### 問題然而,這裡有一個問題。
關鍵在於,在實踐中如何選擇最佳子目標 w 尚不明確。在表格設定中,我們可以簡單地列舉所有狀態來找到最佳 w(這本質上是弗洛伊德-沃爾歇爾最短路徑演算法)。但在具有大型狀態空間的連續環境中,我們無法做到這一點。基本上,這就是為什麼以前的研究難以擴展分而治之的價值學習,儘管這個想法已經存在數十年(事實上,它可追溯到 Kaelbling (1993) 在目標導向強化學習中的第一項工作,有關相關工作的進一步討論,請參閱我們的論文)。
我們工作的主要貢獻是為這個問題提供了一個實用的解決方案。### 解決方案這是我們的關鍵想法:我們將 w 的搜索空間_限制_在數據集中出現的狀態,特別是那些在數據集軌跡中位於 s 和 g 之間的狀態。此外,我們不搜索最佳的 argmax w,而是使用期望分位數迴歸計算一個「軟」argmax。
具體來說,我們最小化以下損失:E[ℓ 2 κ(V(s i,s j)−V¯(s i,s k)V¯(s k,s j))],其中 V¯ 是目標價值網路,ℓ 2 κ 是帶有期望分位數 κ 的期望分位數損失,期望值取自隨機採樣數據集軌跡中所有滿足 i≤k≤j 的 (s i,s k,s j) 三元組。
這有兩個好處。首先,我們不需要搜索整個狀態空間。其次,我們透過使用「更軟」的期望分位數迴歸,而不是最大值運算子,來防止價值高估。我們將此演算法稱為遞移強化學習 (TRL)。請查看我們的論文以獲取更多詳細資訊和進一步討論!
## 它運作良好嗎?您的瀏覽器不支援此影片標籤。_人形迷宮_您的瀏覽器不支援此影片標籤。_拼圖_為了驗證我們的方法是否能很好地擴展到複雜任務,我們直接在 OGBench(一個用於離線目標導向強化學習的基準測試)中一些最具挑戰性的任務上評估了 TRL。
我們主要使用了人形迷宮和拼圖任務中最困難的版本,這些任務具有大型的 10 億級數據集。這些任務極具挑戰性:它們需要在多達 3,000 個環境步驟中執行組合複雜的技能。!圖片 3_TRL 在極具挑戰性的長時程任務上取得了最佳效能。
結果相當令人興奮!與不同類別(TD、MC、準度量學習等)的許多強大基線方法相比,TRL 在大多數任務上都取得了最佳效能。!圖片 4_TRL 與最佳的、單獨調整的 TD-n 表現相當,且無需設定 n。
這是我的最愛圖表。我們將 TRL 與不同 n 值(從 1(純 TD)到 ∞(純 MC))的 n 步 TD 學習進行了比較。結果非常出色。TRL 在所有任務上都與最佳 TD-n 表現相當,且無需設定 n!這正是我們從分而治之範式中所期望的。
透過遞迴地將軌跡分割成更小的軌跡,它能夠_自然地_處理長時程任務,而無需任意選擇軌跡區塊的長度。該論文包含許多額外的實驗、分析和消融研究。如果您感興趣,請查看我們的論文!
## 未來展望?在這篇文章中,我分享了我們新的分而治之價值學習演算法,遞移強化學習的一些有前景的結果。這僅僅是旅程的開始。還有許多開放性問題和令人興奮的方向值得探索:也許最重要的問題是如何將 TRL 擴展到目標導向強化學習之外的常規、基於獎勵的強化學習任務。
常規強化學習是否會具有我們可以利用的類似分而治之結構?我對此相當樂觀,因為至少在理論上,任何基於獎勵的強化學習任務都可以轉換為目標導向任務(參見這本書的第 40 頁)。
另一個重要的挑戰是處理隨機環境。目前版本的 TRL 假設確定性動力學,但許多現實世界的環境是隨機的,主要由於部分可觀察性。為此,「隨機」三角不等式可能會提供一些線索。實際上,我認為 TRL 仍有很大的改進空間。
例如,我們可以找到更好的方法來選擇子目標候選(超越來自同一軌跡的那些),進一步減少超參數,進一步穩定訓練,並使演算法更加簡化。總體而言,我對分而治之範式的潛力感到非常興奮。我仍然認為強化學習(甚至機器學習)中最重要的問題之一是找到一個_可擴展的_離策略強化學習演算法。
我不知道最終的解決方案會是什麼樣子,但我確實認為分而治之,或者說一般的遞迴決策,是實現這一聖杯的最有力候選者之一(順帶一提,我認為其他強勁的競爭者是 (1) 基於模型的強化學習和 (2) 帶有一些「魔法」技巧的 TD 學習)。事實上,其他領域的幾項近期工作已經展示了遞迴和分而治之策略的潛力,例如捷徑模型、對數線性注意力和遞迴語言模型(當然,還有快速排序、線段樹、快速傅立葉變換等經典演算法)。
我希望在不久的將來看到可擴展離策略強化學習方面取得更多令人興奮的進展!### 致謝



