機器人日益整合到各行各業,從工業製造到日常生活,凸顯了對先進導航系統日益增長的需求。然而,當代機器人導航系統在多樣且複雜的室內環境中面臨重大挑戰,暴露出傳統方法的局限性。為了解決「我在哪裡?」「我要去哪裡?」「我怎麼去?」這些基本問題,抖音(ByteDance)開發了 Astra,一種創新的雙模型架構,旨在克服這些傳統導航瓶頸,並實現通用型移動機器人。
傳統導航系統通常由多個、較小且通常基於規則的模組組成,以處理目標定位、自我定位和路徑規劃等核心挑戰。目標定位涉及理解自然語言或圖像線索,以在地圖上精確定位目的地。自我定位要求機器人確定其在地圖中的精確位置,這在倉庫等重複性環境中尤其具有挑戰性,傳統方法通常依賴人工地標(例如 QR code)。路徑規劃進一步分為用於粗略路線生成的全局規劃,以及用於即時避障和到達中間路徑點的局部規劃。
儘管基礎模型在整合較小模型以處理更廣泛任務方面展現出潛力,但最佳模型數量及其有效整合以實現全面導航仍是一個懸而未決的問題。
抖音的 Astra 在其論文「Astra:透過分層多模態學習實現通用型移動機器人」(網站:https://astra-mobility.github.io/)中詳細介紹,解決了這些局限性。遵循系統 1/系統 2 範式,Astra 具有兩個主要子模型:Astra-Global 和 Astra-Local。
Astra-Global 處理目標定位和自我定位等低頻任務,而 Astra-Local 管理局部路徑規劃和里程計估計等高頻任務。這種架構有望徹底改變機器人在複雜室內空間中的導航方式。
Astra-Global:用於全局定位的智能大腦
Astra-Global 作為 Astra 架構的智能核心,負責關鍵的低頻任務:自我定位和目標定位。它作為一個多模態大型語言模型(MLLM)運作,擅長處理視覺和語言輸入,以實現地圖中的精確全局定位。其優勢在於利用混合拓撲語義圖作為上下文輸入,使模型能夠根據查詢圖像或文字提示詞準確定位。
這個穩健定位系統的建構始於離線建圖。研究團隊開發了一種離線方法來構建混合拓撲語義圖 G=(V,E,L):
- V(節點): 關鍵幀,透過輸入影片的時間降採樣和 SfM 估計的 6 自由度(DoF)相機姿態獲得,作為編碼相機姿態和地標參考的節點。
- E(邊): 無向邊根據相對節點姿態建立連接,這對於全局路徑規劃至關重要。
- L(地標): Astra-Global 從每個節點的視覺數據中提取語義地標資訊,豐富地圖的語義理解。這些地標儲存語義屬性,並透過共視關係連接到多個節點。
在實際定位中,Astra-Global 的自我定位和目標定位能力利用從粗到精的兩階段過程進行視覺語言定位。粗略階段分析輸入圖像和定位提示詞,檢測地標,與預建地標地圖建立對應關係,並根據視覺一致性篩選候選對象。精細階段隨後使用查詢圖像和粗略輸出從離線地圖中採樣參考地圖節點,比較它們的視覺和位置資訊,直接輸出預測姿態。
對於基於語言的目標定位,模型解讀自然語言指令,利用地標的功能描述識別地圖中的相關地標,然後利用地標到節點的關聯機制定位相關節點,檢索目標圖像和 6 自由度姿態。
為了賦予 Astra-Global 穩健的定位能力,團隊採用了細緻的訓練方法。他們以 Qwen2.5-VL 作為骨幹,結合了監督式微調(SFT)和群組相對策略優化(GRPO)。SFT 涉及用於各種任務的多樣化數據集,包括粗略和精細定位、共視檢測和運動趨勢估計。
在 GRPO 階段,使用基於規則的獎勵函數(包括格式、地標提取、地圖匹配和額外地標獎勵)來訓練視覺語言定位。實驗表明,GRPO 顯著提高了 Astra-Global 的零樣本泛化能力,在未見過的家庭環境中達到 99.9% 的定位準確度,超越了僅使用 SFT 的方法。
Astra-Local:用於局部規劃的智能助手
Astra-Local 作為 Astra 高頻任務的智能助手,是一個多任務網路,能夠高效生成局部路徑並從感測器數據準確估計里程計。其架構包含三個核心組件:一個 4D 時空編碼器、一個規劃頭和一個里程計頭。
4D 時空編碼器取代了傳統移動堆疊的感知和預測模組。它始於一個 3D 空間編碼器,該編碼器透過視覺轉換器(ViT)和 Lift-Splat-Shoot 處理 N 個全向圖像,將 2D 圖像特徵轉換為 3D 體素特徵。這個 3D 編碼器透過 3D 體積可微分神經渲染進行自監督學習。
4D 時空編碼器隨後在 3D 編碼器的基礎上構建,將過去的體素特徵和未來的時間戳作為輸入,透過 ResNet 和 DiT 模組預測未來的體素特徵,為規劃和里程計提供當前和未來的環境表示。
規劃頭基於預訓練的 4D 特徵、機器人速度和任務資訊,使用基於 Transformer 的流匹配生成可執行軌跡。為了防止碰撞,規劃頭整合了遮罩式 ESDF 損失(歐幾里得有符號距離場)。這種損失計算 3D 佔用地圖的 ESDF,並應用 2D 真實軌跡遮罩,顯著降低碰撞率。實驗證明,與其他方法相比,它在分佈外(OOD)數據集上的碰撞率和總體分數方面表現優越。
里程計頭使用當前和過去的 4D 特徵以及額外的感測器數據(例如 IMU、車輪數據)預測機器人的相對姿態。它訓練一個 Transformer 模型來融合來自不同感測器的資訊。每個感測器模態都由一個特定分詞器處理,與模態嵌入和時間位置嵌入結合,輸入到 Transformer 編碼器中,最後使用 CLS token 預測相對姿態。
實驗表明,里程計頭在多感測器融合和姿態估計方面表現出色,顯著提高了旋轉準確度並減少了整體軌跡誤差。
實驗驗證
在多樣化的室內環境(倉庫、辦公室、家庭)中進行了大量實驗,以全面評估 Astra 的性能。
Astra-Global 的多模態定位能力透過各種實驗得到驗證,證明其在處理文字和圖像定位查詢方面表現優越。對於目標定位,它根據文字指令(例如「找到休息區」)準確識別匹配的圖像和姿態。與傳統視覺地點識別(VPR)方法相比,Astra-Global 在以下方面展現出顯著優勢:
- 細節捕捉: 與 VPR 依賴全局特徵不同,Astra-Global 精確捕捉房間號碼等細節,防止在相似場景中出現定位錯誤。
- 視角穩健性: 基於語義地標,Astra-Global 即使相機視角大幅變化也能保持穩定定位,而 VPR 方法通常會失敗。
- 姿態準確度: Astra-Global 利用地標空間關係選擇最佳匹配姿態,顯示出比傳統 VPR 顯著更高的姿態準確度(1 公尺距離誤差和 5 度角度誤差內),在倉庫環境中提高超過 30%。
Astra-Local 的規劃頭和里程計頭經過了徹底評估。規劃頭使用基於 Transformer 的流匹配和遮罩式 ESDF 損失,在 OOD 數據集上的碰撞率、速度和總體分數方面優於 ACT 和擴散策略等方法。這凸顯了遮罩式 ESDF 損失在降低碰撞風險方面的有效性。
里程計頭的性能在多模態數據集上進行評估,包括同步圖像序列、IMU、車輪數據和真實姿態。與雙幀 BEV-ODOM 基線相比,Astra-Local 的里程計頭在多感測器融合和姿態估計方面具有顯著優勢。整合 IMU 數據顯著提高了旋轉估計準確度,將整體軌跡誤差降低到約 2%。進一步納入車輪數據增強了尺度穩定性和估計準確度,驗證其卓越的多感測器數據融合能力。
Astra 對未來發展和應用具有重大前景。其部署可擴展到更複雜的室內環境,如大型購物中心、醫院和圖書館,在這些環境中,它可以協助精確的產品定位、高效的醫療用品運送和書籍整理等任務。
然而,仍存在改進空間。對於 Astra-Global,儘管當前地圖表示在資訊損失和 token 長度之間取得平衡,但它們可能偶爾缺乏關鍵的語義細節。未來的工作將專注於替代地圖壓縮方法,以優化效率同時最大化語義資訊保留。此外,當前單幀定位在特徵稀疏或高度重複的環境中可能會失敗;未來的計劃包括主動探索機制和時間推理,以實現更穩健的定位。
對於 Astra-Local,提高對分佈外(OOD)場景的穩健性至關重要,這需要增強的模型架構和訓練方法。重新設計備用系統以實現更緊密的整合和無縫切換也已列入計劃,以提高系統穩定性。此外,整合指令遵循能力將使機器人能夠理解並執行自然語言指令,擴展其在動態、以人為中心的環境中的可用性,並促進更自然的人機互動。


