本文由 DAIMON Robotics 贊助。今年四月,總部位於香港的 DAIMON Robotics 發布了 Daimon-Infinity,該公司稱其為全球最大的全模態機器人資料集,專為實體 AI 設計,具備高解析度觸覺感測能力,涵蓋從家庭衣物摺疊到工廠組裝線製造等廣泛任務。
此專案獲得中國及全球合作夥伴的共同支持,包括 Google DeepMind、西北大學 (Northwestern University) 和新加坡國立大學 (National University of Singapore)。此舉標誌著 DAIMON 的一項關鍵戰略計畫,這家成立兩年半的公司以其先進的觸覺感測器硬體而聞名,其中最引人注目的是一種單色、基於視覺的觸覺感測器,能在指尖大小的模組中整合超過 110,000 個有效感測單元。
憑藉其高解析度觸覺感測技術和分佈式實驗室外資料收集網路(每年可產生數百萬小時的資料),DAIMON 正在建立包含大量觸覺感測資料的大規模機器人操作資料集。為了加速實體 AI 在現實世界的部署,該公司也開源了 10,000 小時的資料。DAIMON Robotics 的共同創辦人兼首席科學家王煜教授 (Prof. Michael Yu Wang) 率先提出了「視覺-觸覺-語言-動作」(Vision-Tactile-Language-Action, VTLA) 架構,將觸覺提升到與視覺同等重要的模態。
這項策略的幕後推手是 DAIMON 的共同創辦人兼首席科學家王煜教授。王教授在卡內基美隆大學 (Carnegie Mellon) 獲得博士學位,師從 Matt Mason 學習機器人操作,隨後創立了香港科技大學 (Hong Kong University of Science and Technology) 的機器人研究所。
作為 IEEE 會士和 IEEE Transactions on Automation Science and Engineering 的前任主編,他在該領域深耕近四十年。他的目標是解決機器人操作中「不靈敏」的問題,因為目前的機器人操作主要依賴主流的「視覺-語言-動作」(Vision-Language-Action, VLA) 模型。
他和他的團隊率先提出了「視覺-觸覺-語言-動作」(VTLA) 架構,將觸覺提升到與視覺同等重要的模態。我們與王教授討論了觸覺回饋如何改變靈巧操作,資料集計畫如何望能增進我們對機器人手在自然環境中運作的理解,以及他預見觸覺機器人將在何處(從中國的飯店到便利商店)首次進入現實世界。
Daimon-Infinity 是全球最大的全模態實體 AI 資料集,擁有百萬小時級的多模態資料、超高解析度觸覺回饋、來自 80 多個真實場景和 2,000 多種人類技能的資料等等。
資料集計畫 本月,DAIMON Robotics 與多家領先的學術機構和企業共同發布了最大、最全面的機器人操作資料集。為何選擇現在發布資料集,而不是繼續專注於產品開發?這將對實體智慧產業產生什麼影響?DAIMON Robotics 成立至今已近兩年半。
我們一直致力於開發高解析度、多模態觸覺感測裝置,以感知機器人手(特別是其指尖)與物體之間的互動。我們的裝置已變得相當穩健,並被廣大用戶群體接受和使用,包括學術和研究機構以及領先的人形機器人公司。隨著實體 AI 的不斷發展,資料的關鍵作用已日益明確。
資料稀缺仍然是機器人學習的主要瓶頸,特別是缺乏實體互動資料,這對於機器人在現實世界中有效運作至關重要。因此,資料品質、可靠性和成本已成為研究和商業開發中的主要考量。這正是 DAIMON 的優勢所在。我們的視覺觸覺技術能夠捕捉高品質、多模態的觸覺資料。
除了基本的接觸力,它還記錄變形、滑動和摩擦、材料特性和表面紋理,從而實現對實體互動的全面重建。憑藉我們在多模態融合方面的專業知識,我們開發了一個穩健的資料處理流程,將觸覺回饋與視覺、運動軌跡和自然語言無縫整合,將原始輸入轉換為機器學習模型可用的訓練資料集。
認識到業界普遍存在的資料缺口,我們將大規模資料收集不僅視為我們獨特的競爭優勢,更視為對廣大社群的責任。透過建立和開源資料集,我們旨在提供推動實體 AI 所需的高品質「燃料」,最終加速通用機器人基礎模型在現實世界的部署。機器人產業競爭激烈,許多團隊都選擇專注於資料。
DAIMON 正在發布一個大型且高度全面的跨實體、基於視覺的觸覺多模態機器人操作資料集。你們是如何實現這一點的?我們擁有一支專門的內部團隊,致力於擴展我們的能力,包括建立硬體裝置和開發我們自己的大型模型。儘管我們是一家相對較小的公司,但我們的核心觸覺感測技術和創新的資料收集範式使我們能夠建立大規模資料集。
我們的方法是擴大我們的產品範圍。我們建立了全球最大的分佈式實驗室外資料收集網路。這個輕量級且可擴展的系統不依賴集中式資料工廠,而是允許在各種現實世界環境中收集資料,使我們每年能夠產生數百萬小時的資料。「為了推動整個實體 AI 領域的進步,我們已向廣大社群開源了 10,000 小時的資料集。」
,DAIMON Robotics 共同創辦人兼首席科學家王煜教授。這個資料集正與全球多家機構共同開發。他們在開發過程中扮演了什麼角色?資料集將如何使他們的研究和產品受益?除了中國的團隊,我們的合作夥伴還包括來自大學的領先研究團隊,如西北大學和新加坡國立大學,以及 Google DeepMind 和中國移動等頂級全球企業。
他們決定與 DAIMON 合作,有力證明了我們富含觸覺資料的資料集的價值。在參與的公司中,有些已經建立了他們自己的模型但現在正在整合觸覺資訊。透過在研究、製造和其他現實世界場景中部署我們的資料收集裝置,他們幫助我們收集高度實用、應用驅動的資料。
反過來,我們的合作夥伴利用這些資料來訓練針對其特定用例的模型。此外,為了推動整個實體 AI 領域的進步,我們已向廣大社群開源了 10,000 小時的資料集。配備 Daimon 的視覺觸覺感測器,夾爪能精確感測接觸並控制力道,以拾取脆弱的蛋殼。
從 VLA 到 VTLA:為何觸覺感測改變了局面 目前機器人領域的主流範式是「視覺-語言-動作」(VLA) 模型,但您的團隊提出了「視覺-觸覺-語言-動作」(VTLA) 模型。為何有必要整合觸覺感測?它能讓機器人實現什麼,哪些任務在沒有觸覺回饋的情況下可能會失敗?
多年來,我們一直致力於讓通用機器人能夠執行操作任務,特別是靈巧操作,不僅僅是強力抓取或握持物體,而是操作物體並使用工具對零件施加力和運動,我們看到這些機器人被應用於家庭和工業組裝環境。眾所周知,觸覺資訊對於提供接觸狀態的回饋至關重要,以便機器人能夠引導其手和手指執行可靠的操作。
沒有觸覺感測,機器人會受到嚴重限制。它們難以在黑暗環境中定位物體,如果沒有滑動檢測,它們很容易掉落像玻璃這樣的易碎物品。此外,無法精確控制力道常常導致操作任務失敗,甚至在嚴重情況下造成物理損壞。很自然地,VLA 方法需要增強以整合觸覺資訊。
我們擴展了 VLA 框架以整合觸覺資料,創建了 VTLA 模型。我們的觸覺感測器還有一個額外的好處,它是基於視覺的:我們捕捉指尖表面變形的視覺圖像。我們以時間序列捕捉多個圖像,這些圖像編碼了接觸資訊,從中我們可以推斷出力和其他的接觸狀態。這與 VLA 所基於的視覺框架非常吻合。
以視覺圖像格式呈現觸覺資訊,使其自然地適合整合到 VLA 框架中,將其轉變為 VTLA 系統。這就是關鍵優勢:基於視覺的觸覺感測器在像素層面提供非常高的解析度,這些資料可以整合到框架中,無論是端到端模型還是其他類型的架構。DAIMON 以其基於視覺的觸覺感測器而聞名,該感測器可整合超過 110,000 個有效感測單元。
技術:單色視覺觸覺感測 您和您的團隊多年來一直深入研究基於視覺的觸覺感測,並開發了世界上第一個單色視覺觸覺感測技術。您為何選擇這條技術路徑?一旦我們開始研究觸覺感測器,我們就了解了我們的需求。我們想要能夠密切模仿我們指尖皮膚下所擁有的感測能力的感測器。
生理學研究充分證明了人類指尖的能力,知道我們觸摸了什麼、是什麼材料、力如何分佈,以及在我們大腦控制手部時它是否移動到正確的位置。我們知道在機器人手的指尖上複製這些能力將大有幫助。當我們調查現有技術時,我們發現了許多類型,包括帶有三色光學元件的基於視覺的觸覺感測器和其他更簡單的設計。
我們決定將這些技術的優點整合到一個工程上穩健的解決方案中,使其在不過於複雜的情況下運作良好,同時將成本、可靠性和靈敏度保持在令人滿意的範圍內,最終開發出單色視覺觸覺感測技術。這本質上是一種工程方法,而非純粹的科學方法,因為已經存在大量的基礎研究。
隨著人們日益認識到觸覺資料的必要性,所有這些都將齊頭並進。DAIMON 的視覺觸覺感測器捕捉高品質、多模態的觸覺資料。
去年,DAIMON 推出了一款多維度、高解析度、高頻率的視覺觸覺感測器。與傳統觸覺感測器相比,其核心優勢在哪裡?它可能改變哪些產業?我們感測器的主要特點是分佈式力測量的密度以及我們可以在指尖區域捕捉到的變形。我相信我們在感測單元密度方面擁有最高的密度。
這是一個非常重要的指標。另一個是動態性:頻率和頻寬,我們能多快地檢測力變化、傳輸訊號並即時處理它們。其他重要方面主要與工程相關,例如可靠性、漂移、軟表面的耐用性以及對磁性、光學或環境因素干擾的抵抗力。越來越多的研究人員和公司正在認識到觸覺感測的重要性並採用我們的技術。我相信觸覺感測的進步將把整個社群和產業提升到更高的水準。我們的一個潛在



