本次新版本旨在閉合機器人學習循環:策略能夠在行動前預想未來,獎勵模型能判斷機器人是否成功,部署 CLI 能將失敗轉化為訓練資料,並提供六個新的模擬基準測試來全面衡量這些進展。此外,它還帶來了深度感測、由 VLM 驅動的資料集註釋、自訂影片編碼、透過 HF Jobs 進行雲端訓練,以及更精簡的安裝流程。

LeRobot v0.6.0 引入了能學習預想未來的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),一系列新的視覺語言動作模型(VLA)(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),以及全新的獎勵模型 API(Robometer、TOPReward)。

它還推出了六個在 lerobot-eval 下統一的全新模擬基準測試,具備 DAgger 風格人機協作修正的 lerobot-rollout CLI,支援 FSDP 訓練和 HF Jobs 上的雲端訓練。資料集獲得了深度支援、自動語言註釋管線、自訂影片編碼,以及高達兩倍的資料載入速度,所有這些都建立在更精簡的安裝基礎上。

機器人學界正在探討一個重要問題:世界模型是否真的能幫助機器人策略?v0.6.0 為 LeRobot 帶來了三種策略,以協助解答這個問題。每種策略都在訓練過程中學習預想未來,並各自採取不同的方法來維持這種想像的成本效益。

VLA-JEPA 教導一個緊湊的 VLA(基於 Qwen3-VL-2B 建構)在學習行動的同時,於潛在空間中預測未來:在訓練期間,一個 JEPA 世界模型必須根據模型自身的行動來預期即將到來的影格。其訣竅在於,該世界模型在推論時會消失,因此您可以在零額外推論成本下獲得世界模型的監督。Hub 上提供了三個隨時可用的檢查點,包括一個用於微調的 DROID 預訓練基礎模型。

LingBot-VA 更進一步:它是一個自迴歸的影片-動作模型,能逐塊地共同預測未來的影片和動作,並將真實觀察結果回饋以保持其想像的基礎。您甚至可以儲存機器人想像的內容,並與實際發生的情況進行比較。推論可在單一 24–32 GB GPU 上運行。請查閱文件和論文以了解技術細節。

FastWAM 在其論文標題中提出了一個問題:世界動作模型是否需要在測試時進行未來想像?它將一個約 50 億參數的影片生成專家與一個緊湊的動作專家配對在單一網路中,因此模型實際上學會了「夢想」自己的執行過程。在推論時,它完全跳過「夢想」階段,直接對動作塊進行去噪。您可以從 lerobot/fastwam_base 進行微調,並在文件中閱讀更多內容。

我們將 NVIDIA GR00T 的整合升級至 GR00T N1.7,這是 NVIDIA 跨實體基礎模型的最新開放版本。N1.7 將先前的 VLM 替換為 Cosmos-Reason2-2B(基於 Qwen3-VL 建構),並提供一個流匹配動作頭。

我們的整合已針對 NVIDIA 原始的 Isaac-GR00T 實作進行了同等性測試:相同的輸入,相同的輸出。Flash-attention 現在是可選的,因此只需 pip install 'lerobot[groot]' 即可使用,並且您可以直接載入 NVIDIA 發布的檢查點。

GR00T N1.7 在 LeRobot 中取代了 N1.5。如果您需要 N1.5,請將 lerobot 版本固定為 0.5.1。

MolmoAct2 是 Allen Institute for AI 的視覺語言動作模型,現已移植到 LeRobot 中,涵蓋了完整的生命週期:微調(完整或 LoRA)、評估和真實機器人部署。內建校準修正的現成檢查點意味著您可以在 SO-100/101 上進行零樣本運行。

推論在 bf16 精度下約需 12 GB 記憶體,而 LoRA 微調則可在單一 24 GB GPU 上進行。請參閱 MolmoAct2 文件以獲取完整的部署指南。

EO-1 是一個在交錯視覺-文字-動作資料上預訓練的 VLA,現已加入 LeRobot:它採用 Qwen2.5-VL-3B 骨幹網路和流匹配動作頭,由論文作者之一貢獻。您可以使用標準的 lerobot-train 工作流程,並設定 --policy.type=eo1 來訓練它。詳細資訊請參閱文件和論文。

Multitask Diffusion Transformer 策略將 TRI 大型行為模型的方案引入 LeRobot:這是一個約 4.5 億參數的擴散變換器,以 CLIP 視覺和語言嵌入為條件,因此一個模型可以透過自然語言學習多個任務。它支援擴散和流匹配兩種目標,並且規模足夠小,您可以自行訓練。請參閱文件。

VLA 不必龐大。EVO1 將其策略壓縮至 0.77 億參數,採用 InternVL3-1B 骨幹網路和流匹配動作頭,規模足夠小,可以在中等 GPU 上進行微調並即時運行。它開箱即用,支援兩階段微調和即時分塊(Real-Time Chunking)。請參閱 EVO1 文件和論文。

成功檢測和進度估計是機器人學習循環中缺失的環節,v0.6.0 為它們提供了歸宿。LeRobot 現在擁有一個統一的獎勵模型 API(lerobot.rewards),與策略 API 相呼應,透過一個介面提供四個獎勵模型,HIL-SERL 獎勵分類器、SARM,以及兩個新增的模型:

Robometer 是一個預訓練的通用獎勵模型:將 lerobot/Robometer-4B 指向任何 LeRobot 資料集,它就能根據原始影片和語言指令來評估任務進度和成功率,無需進行特定任務的訓練。它基於 Qwen3-VL-4B 建構,並透過超過一百萬條機器人軌跡的資料集進行軌跡比較訓練。

TOPReward 實現了完全零樣本學習:完全不需要獎勵權重。它包裝了一個現成的 VLM(Qwen3-VL),並根據軌跡影片和任務指令讀取「True」這個詞元的對數機率。任何有能力的 VLM 都可以成為獎勵函數。這兩個模型都附帶標註腳本,能將每影格的進度曲線寫入您的資料集,以便進行獎勵感知行為複製(RA-BC)、資料集品質檢查和進度疊加影片。請查閱 Robometer 和 TOPReward 的文件。

錄製不再受限於單一硬編碼的編解碼器。新的 --dataset.rgb_encoder.* 選項公開了完整的編碼介面(編解碼器、品質、像素格式、GOP、預設值),而 vcodec=auto 會探測 NVENC、VideoToolbox、VAAPI 和 QSV 等硬體編碼器,然後才回退到預設的軟體 AV1 編碼器。對於現有資料集,一個指令即可重新編碼所有內容。詳細資訊請參閱影片編碼文件。

插入 Intel RealSense,設定 use_depth: true,LeRobot 就能端到端地錄製深度圖:以毫米為單位捕捉,壓縮成緊湊的 12 位元深度影片流,與您的 RGB 攝影機並行,並在訓練時解碼回物理單位。深度圖在錄製期間和 lerobot-dataset-viz 中即時呈現,並支援 SO-100/101、Koch、OpenArm、reBot、Unitree G1 等多種平台。

您的資料集不再是每個情節一個任務字串。LeRobot 資料集現在原生支援儲存豐富的語言註釋(帶時間戳的子任務、計畫、記憶、修正、語音和每攝影機的 VQA 對),而新的 lerobot-annotate CLI 會使用一個觀看您情節的 VLM 自動填入這些註釋。

隨後,一個 YAML 配方層會在取樣時將這些註釋渲染成聊天風格的訓練訊息:這正是未來長程、會說話的機器人策略將會訓練的資料。您可以透過 HF Jobs 擴展其規模,並閱讀註釋管線文件以了解更多資訊。

影片資料集的訓練現在開箱即用,速度提升高達約兩倍:多攝影機影格並行解碼,資料載入器工作者傳輸緊湊的 uint8 影格(程序間記憶體減少 4 倍),並且持久性工作者在不同訓練週期中保持解碼器快取活躍。載入大型資料集的子集(episodes=[...])從數分鐘縮短到數毫秒(在我們的基準測試中從 275 秒降至 0.06 秒)。取樣現在也具有確定性和可恢復性,因此中斷的訓練可以精確地從上次取樣點重新開始。

v0.5.0 將 LeRobot 定位為 VLA 的評估中心;v0.6.0 則透過六個新的模擬基準測試使其成為現實,所有這些都可以透過相同的 lerobot-eval CLI 運行,每個基準測試都附有文件頁面、Docker 映像檔,以及在 CI 中經過煙霧測試的 SmolVLA 基準檢查點:

LIBERO-plus 透過約一萬個 LIBERO 的擾動變體,從照明、攝影機視角到重新編寫的指令等七個軸向,對 VLA 進行壓力測試。它能告訴您策略何時失效。

RoboTwin 2.0 涵蓋了 SAPIEN 上 50 個雙手操作任務,具有大量的領域隨機化,並在 Hub 上提供了超過 10 萬條隨時可訓練的軌跡。

RoboCasa365 涵蓋了在移動機械臂上,於 2,500 個程序生成廚房中的 365 個廚房任務,是我們產品線中最大的任務範圍。

RoboCerebra 透過在語言基礎的中間指令下,連結 3 到 6 個子目標的情節來評估長程行為,並附帶一個包含 6,660 個情節的資料集。

RoboMME 是一個記憶力測試:您的策略能否計算重複次數、追蹤隱藏物體並模仿示範程序?它包含 4 個記憶套件中的 16 個任務。

VLABench 測試操作中的知識和推理能力,從物理問題到像端到端沖泡咖啡這樣的複合任務。