本文由 X Square Robot 贊助。大型語言模型為人工智慧提供了一套可行的「食譜」:在廣泛數據上預訓練大型模型,隨之而來的是通用能力。然而,機器人學卻沒有這樣的食譜。長期以來,機器人系統都是由獨立的感知、規劃和控制部分組裝而成,這些部分很少能累積成機器人可以從一項任務轉移到另一項任務,或從一台機器轉移到另一台機器的智慧。具身 AI 的核心問題是找到等效的食譜,而該領域尚未就其內容達成共識。

中國具身 AI 公司 X Square Robot 做出了異常明確的押注。他們認為,這個食譜是一個整合式堆疊,涵蓋機器人學習的數據、用於預測物理世界變化的世界模型,以及結合感知、規劃、推理和決策以生成可執行機器人行為的動作模型。該公司還認為,這個堆疊應該以開放的方式建構和發布。X Square Robot 分享了他們將機器人帶入真實家庭的願景。

維繫這個堆疊的是一小組原則,而非單一的總體模型。

首先,機器人數據的基本單位是「互動」,而非「軌跡」;一次示範只有在如預期般改變世界時才算成功,而不僅僅是因為關節移動了。其次,預訓練應該產生可用的能力,而不僅僅是後續微調的初始化。第三,行為模型應該圍繞物理事件而非固定時間切片來建構。這些原則使得各層之間相互依存,因為訓練動作模型的相同機器人無關數據,也以結構化的方式餵給世界模型。

不過,值得精確說明的是,該公司將世界模型和動作模型描述為互補但獨立的模型家族,它們共享一個程式碼庫。兩者都位於其更廣泛的「世界統一模型」(World Unified Model)之中,該模型被視為一個將視覺、語言、動作和物理預測結合訓練的架構。

對於 X Square Robot 團隊而言,通用型機器人最大的限制之一是互動數據的成本和品質,而非模型參數的數量。為了解決這個問題,該公司建構了其通用操作介面(UMI)數據收集系統 QUANXTA Zero Series。它透過讓人們穿戴帶有雙夾具的裝備來收集示範,而不是透過遠端遙控機器人。

這種方法本身並不新穎,並且建立在既有的機器人無關數據採集方法之上。使其脫穎而出的有兩個工程選擇。X Square Robot 強調數據品質控制,記錄軌跡並在真實機器人上重播,只有那些實際完成任務的才算有效。

第一個是品質控制,這是最獨特的部分。系統並非直接接受記錄的軌跡,而是運行一個閉環檢查,其中最顯著的步驟是物理重播。一部分軌跡會在真實機器人上重播,只有那些實際完成任務的才被視為有效。這使得有效率成為一個可測量的量,而非假設。例如,一個夾具過早關閉幾分之一秒,在數據中看起來仍然像一次抓取,但它卻把物體推開了,因此不應被歸類為有效。一個較小但乾淨的數據集可能比一個較大但嘈雜的數據集更有價值。

第二個選擇是如何結合低成本的人類數據和稀缺的機器人數據。該公司在大量機器人無關示範上進行預訓練,以建立通用表示,然後添加少量真實機器人數據作為特定機器動態的錨點。他們報告稱,這種方法能以大約 20 倍的較低收集成本達到與純機器人數據集相當的性能,這主要得益於穿戴式裝備比遠端遙控設置便宜得多。

最終的數據集是刻意與模型無關的,格式化以同時餵給動作模型和世界模型。不過需要注意的是,最強的結果是在該公司自己的機器人和數據收集管道上測量的。更廣泛的獨立測試將有助於在更廣泛的環境中確認並擴展這些有前景的結果。

在開發其世界模型 WALL-WM 時,X Square Robot 採取了差異化的方法。大多數動作模型從當前圖像和指令預測固定長度的運動片段。這很方便,但它將行為分割成固定持續時間的窗口,因此邊界是由經過時間決定的,而不是由一個動作結束和下一個動作開始決定的。

WALL-WM 則將「以動作為基礎的語義事件」作為其單位:一個連貫的行為片段,例如伸取、抓取或放置,這些都可以用語言命名、在影片中看到並作為動作執行。

WALL-WM 的設計反映了一個特定的考量,即不丟棄大型影片模型已知的信息。為此,一個文字轉影片模型與一個新初始化的動作網路耦合,該網路從影片特徵中讀取而不覆寫它們,從而保留了視覺先驗知識。從這個單一過程中,它提供了兩種模式。事件模式以可變長度片段運行,適用於長時間範圍的推理,而固定長度模式則產生控制器所需的穩定、即時輸出。

這使得 WALL-WM 介於主流的基於片段的動作模型和純影片世界模型之間,既保留了世界模型的預測特性,又能產生可執行的控制。

在一系列實驗中,該公司依賴於一種比大多數測試更具體的泛化測試。一個在有限數據集上訓練的模型,在未見過的環境中針對長時間範圍任務進行評估,據報導,在其真實機器人基準測試中,其表現優於已在相關數據上進行微調的基準模型。如果這個結果成立,那將是一個有意義的成果。目前,它是在該公司自己的基準上測量的。隨著程式碼的發布,更廣泛的社群將有機會在更多環境中測試、重現和在此基礎上進行開發。

動作層承載著兩個相關聯的想法。第一個是該公司為其視覺-語言-動作模型 Wall-OSS-0.5 設定的要求:預訓練模型應在任何任務特定微調之前,就能在真實機器人上運行。其興趣點不在於分數,而在於其背後的設計。該模型同時訓練三個目標,即離散動作標記(discrete action tokens)、語言基礎(language grounding)和連續動作生成。

它讓梯度流經所有這些目標,而不是像一些競爭設計那樣凍結網路的一部分。這也是一種更嚴格的方法,因為它報告了未經微調的行為,例如接近、抓取和恢復,包括在訓練中未包含的可變形任務上。

第二個想法是動作介面本身,稱為 X-Tokenizer。大多數將連續運動轉化為離散標記的系統,會產生語言模型無法解釋的程式碼。X-Tokenizer 將標記化重新定義為學習一個語義介面,因此頂層程式碼代表動作的意圖,而底層程式碼則攜帶更精細的細節,所有這些都與語言模型自身的特徵對齊。

一個有用的結果是穩定性。對動作添加噪音幾乎不會移動意圖程式碼,這使得一個標記器可以在不同機器人之間重複使用而無需重新調整。生產動作模型中使用的標記器是這種方法的相關變體。這兩個想法共同賦予了動作層一種相當強大的能力:可遷移性。

具身 AI 堆疊的未來。X Square Robot 押注其獨特的三層方法,每一層都專注於解決問題的關鍵部分,將使其在其他具身 AI 堆疊中脫穎而出。用於數據品質的物理重播步驟既不常見又合理。將世界模型重新定義為圍繞事件,並以一個骨幹同時服務於推理和控制,這是一種真正獨特的方法。而可部署的預訓練標準與設計為語義介面的標記器相結合,賦予了動作層非凡的連貫性。

下一個階段將帶來更廣泛的驗證。目前的大部分證據來自 X Square 自己的機器人和基準測試。隨著世界模型程式碼的公開,以及社群開始測試、重現並在此基礎上進行開發,這些報告的能力將在更多機器人、任務和環境中得到檢驗。

X Square Robot 最近的幾輪融資反映了類似的信心。該公司的估值已攀升至超過 200 億人民幣(約 29 億美元),這表明投資者越來越將數據基礎設施、基礎模型和可擴展的訓練系統視為具身 AI 的長期差異化因素。

X Square Robot 的下一步計畫。為了更深入了解其未來計畫,以下與 X Square Robot 團隊的問答將進一步探討該公司的技術、策略和願景。

問:從技術角度來看,現在為何是投入這個堆疊的正確時機?最近有什麼以前不可能的事情變得可能了?答:這並非單一突破,而是多個趨勢同時成熟。基礎模型為我們提供了視覺、語言和動作的共享表示,因此我們可以在一個框架內建模機器人所見、被要求做什麼以及其動作如何改變世界,而不是將其視為獨立的感知、規劃和控制模組。

運算和基礎設施終於足以支持長時間範圍、多具身數據的大規模預訓練。同樣重要的是,我們意識到數據而非模型大小,才是通用機器人的真正瓶頸,稀缺的是多樣化、高品質、可重現的互動數據。而且,世界建模已變得實用。有用的問題不再是如何預測幾秒鐘的影片,而是如何理解動作如何改變物體、接觸和任務狀態。兩年前,這些要素是獨立存在的。今天,它們已足夠成熟,可以作為一個系統協同工作。

問:您的數據系統使用穿戴式 VR 裝備和客製化夾具來捕捉示範,而不是遠端遙控機器人。標準的遠端遙控有什麼問題?答:遠端遙控是圍繞控制機器人而建構的。它迫使操作員在機器的運動學、延遲和視角範圍內工作,導致示範更慢、更僵硬、多樣性更差。我們則圍繞捕捉人類技能來建構我們的系統。

操作真正關乎接觸、時機、手指協調和恢復,而不僅僅是手部移動的路徑,而穿戴式裝備可以在行為被壓縮到特定機器人之前記錄這些。它也打破了遠端遙控昂貴的擴展法則,即每個示範都需要一台機器人。人們可以獨立於任何機器人生成豐富的數據,而關鍵特性是這些示範仍然可以透過模型在實體機器人上重播和執行。