對於依賴輔助裝置的人來說,每一秒都至關重要。日常環境中充滿不可預測的狀況,例如孩子突然衝過人行道、路緣突然出現,或是鑰匙掉落,都需要立即反應。透過在裝置上直接處理攝影機影像和感測器資料,也就是邊緣運算,能讓機器人移動平台成為反應靈敏的工具。這些工具必須在人們生活的各種動態環境中保持穩健和一致。
然而,在有限的電池供電硬體上部署 DINOv3 和 SAM 等強大 AI 模型,帶來了重大的工程挑戰。實際部署必須考量電池續航力、散熱、不穩定的網路連線,以及嚴格的尺寸和重量要求等實際因素。
但如果使用者無法利用這些新的機器人系統來執行日常活動,克服這些限制就毫無意義。這些新方法讓使用者能更自然地與機器人互動,利用周遭環境作為情境,讓工程師和使用者都無需設計和操作複雜耗時的介面。結合自然語言和影像資料來查詢使用者和機器人周遭環境,並提供更直接的指令,能直接減少使用者執行撿起桌上杯子等簡單動作所需的認知負荷和情境切換次數。
RAMMP 團隊已將這項功能整合到他們的第一個原型中。他們利用基於 DINO 開發的工具,讓機器人能查詢影像感測器,偵測自動門按鈕、杯子和路緣/地面,以提供導航輔助。隨著這項功能準備好進行實際測試,工程師們正專注於語音和觸控輸入,讓使用者能選擇並與周遭特定物體互動。除了確保模型輸出準確性和時間一致性的現有挑戰外,這也帶來了確保使用者提示詞和輸入在不同情況下都能穩健且可預測的額外挑戰。
DINOv3 作為裝置的緊湊高效「視覺大腦」,是一個通用基礎模型,可以在其上疊加針對特定任務的輕量級模組,例如物體偵測或移動追蹤,從而實現視覺資料的重複利用並節省電力。
在機器人系統開發過程中應用這兩種模型時,工程師會針對邊緣裝置優化模型,減少記憶體佔用,在適當時使用較低精度,並以適合實際條件的格式進行部署。這確保了使用者能獲得可靠的即時操作。透過在實用解析度和高效批次處理下運行,這兩種模型即使在機器人移動平台和機器手臂使用的緊湊型電池供電硬體上,也能保持快速和可靠,有時會犧牲一點邊界精度和/或特徵細節,以換取使用者在移動中所需的即時速度和穩定性。這種精度與實用性之間的平衡是該專案理念的核心。
RAMMP 專案的幕僚長 Sivashankar Sivakanthan 表示:「對於輔助機器人來說,性能不僅僅以基準準確度來衡量,而是以系統能否在日常生活中不可預測的環境中可靠運行來衡量。」他補充:「在裝置上運行 DINOv3 和 SAM 等模型,才能實現使用者可以信任的即時感知,而無需依賴網路連線或犧牲安全性。」
RAMMP 的感知系統建立在 RF-DETR 之上,這是一個使用 DINOv2 嵌入進行微調的輕量級偵測模型。訓練資料透過 SAM 自動標註,使團隊能夠快速生成高品質的標註,涵蓋輔助裝置在現實世界中遇到的各種角度、高度、背景和光照情況。資料增強和多視角策略進一步確保了不同視角之間的一致性。最終成果是一個智慧、適應性強的系統,提供更安全、更自信的移動能力。
透過將 SAM 的標註能力與 DINOv2 豐富的視覺表示結合到微調後的 RF-DETR 模型中,RAMMP 實現了即時 360 度環境感知和自適應物體偵測。



