隨著 AI 助理從簡單的文字介面演進為多模態夥伴,我們正看到其轉向更主動、情境化的輔助。近期創新如 Project Astra 和 Gemini 3.1 Flash Live 已允許使用者即時討論周遭物理環境,通常利用視覺邊界框疊加來識別攝影機畫面中的物體。

然而,這些疊加在 2D 螢幕上非常有效,但轉換到 Android XR 等沉浸式平台時,卻帶來了獨特的挑戰:我們如何超越平面使用者介面,創造真正具身、具空間意識的對話?

為彌補這一差距,我們在 CHI 2026 發表了 AgentHands,這是一個將語音同步手勢帶入 3D 世界的研究原型。在人類溝通中,我們的手不只是指向;它們還描述形狀、模仿動作並強調重點,所有這些都與我們的聲音同步。透過利用延伸實境 (XR) 的空間理解能力,AgentHands 重現了這種自然的協同作用。

延續我們在 Human I/O 和 Sensible Agent 方面的先前研究,AgentHands 進一步賦予 AI 代理具表現力、同步的手勢,將抽象的口頭指令轉化為直觀的實體演示,使關於周遭環境的對話更加自然和引人入勝。

為具身手勢代理在 XR 中的分類,我們首先與 Google 的 XR 和人機互動 (HCI) 專家進行了一項形成性研究,以確定在 3D 環境中,什麼樣的虛擬手勢是「清晰易懂」的。我們將這些見解提煉成一個多維度分類法,定義了代理應如何運用手勢來將對話定位於使用者的物理空間中。

手部使用與手勢:選擇單手或雙手,並從手勢庫中選擇,例如表示「小心」的掌心或模仿握持工具的「圓柱形握法」。空間性:利用 XR 的深度來確定手勢應存在的位置。它們可以是空中用於一般對話,錨定在物體上用於識別特定部分,或相對於使用者用於社交提示。

時間動態與視覺效果 (VFX):XR 中的手勢不只是靜態姿勢;它們包括「傾倒」或「描繪」等動畫動作。我們還利用 XR 獨特的視覺層,添加效果,例如紅色光暈來表示高溫警告。

AgentHands 的核心創新在於其能夠將大型語言模型 (LLM) 的高階推理映射到精確、即時的物理動作,這些動作與代理的「語音」和使用者的 XR 環境相匹配。我們引入了以下關鍵步驟來構成 AgentHands 的工作流程。

環境感知:系統始於一個輕量級的物體註冊模組。透過眼動追蹤和場景重建,使用者可以快速「標記」物品,例如蘭花或筆記型電腦,建立一個帶有 3D 邊界框的空間註冊表,供代理參考。

手勢事件庫:我們建立了一個手勢行為庫,涵蓋三個語義類別:a) 指示性手勢用於參考,b) 象徵性手勢用於描繪動作或形式,以及 c) 表達性手勢用於傳達社交提示和情感。

嵌入手勢的推理:當使用者提出問題時,後端 LLM 會生成一個包含內聯 GestureEvents 的回應。每個事件都附著於特定的觸發詞,並根據分類維度編碼手勢行為的基本元素。

同步 XR 執行:XR 頭戴裝置上的本地解析器協調文字轉語音 (TTS) 播放與動畫引擎。透過使用詞級時間戳,代理的手勢與口語同步執行語音同步手勢,提供清晰、富有表現力的空間參考。

透過整合這些模組,AgentHands 在語言意圖和物理動作之間建立了一座無縫的橋樑。該系統將標準的 LLM 輸出轉化為豐富的多模態表現,其中代理生成的回應透過語音和空間精確的動作來呈現,使得複雜的指令能夠在使用者環境中發生的確切位置進行演示。

應用情境:我們展示了這些具身手勢,結合 XR 的空間感知,如何增強我們對物理環境的理解。互動式教學:在蘭花照護情境中,代理不只是說「檢查根部」;它會將手移到植物底部,並在解釋氣生根功能時勾勒出其輪廓。

技術操作指南:對於 3D 列印機的操作,代理可以演示導航控制旋鈕和選擇文件所需的精確「轉動和點擊」序列,使複雜的物理介面步驟變得直觀。

生活陪伴:代理可以作為健康教練,與您的身體選擇互動。例如,代理可以透過握住使用者手部並施加視覺效果來執行互動式「警告」手勢,以提醒使用者注意不健康的行為。

使用者研究:為評估這些手勢的影響,我們進行了一項受試者內研究 (N = 12),將 AgentHands 與純語音基準線進行比較。兩種條件都使用相同的研究員編寫的口頭內容,確保唯一的差異是具身手勢及其同步手勢的存在。參與者完成了兩項平衡日常照護與技術操作的程序性任務。

蘭花照護任務:使用者學習識別植物部位(氣生根、莖)並執行多步驟照護活動,包括目標澆水和正確施肥。3D 列印機操作任務:使用者被引導識別噴嘴和列印平台等硬體組件,然後執行開啟設備、插入 SD 卡和導航控制面板的工作流程。

結果:結果證實,XR 與語音同步手勢的結合對於空間定位互動非常有效。我們分析了多個關鍵溝通有效性指標的數據。空間定位顯著提升:參與者發現定位特定物體和識別代理所指方向顯著更容易 (p < 0.05)。指向手勢在代理說出「這個」時及時「落地」,消除了純口頭指令中常見的猜測。

複雜動作理解增強:所需活動被評為更容易遵循 (p < 0.05)。一位參與者指出:「只有當代理展示了抬起手勢時,我才意識到我需要抬起蘭花讓水排出。」顯著的安全提示:當警告與手勢提示和視覺效果結合時,效果顯著更好。在 3D 列印機任務中使用的「灼燒」效果被評價為「非常令人印象深刻」,確保使用者確實注意到了熱噴嘴的風險。

認知負荷降低:參與者發現指令更容易理解和記憶。質性回饋表明,手勢感覺像是一個「引導我的夥伴」,將體驗從基於工具的搜尋轉變為融合的、具身化的對話。

結論與未來方向:AgentHands 代表了 AI 系統不僅分析我們的世界,而是在其中動態運作的未來邁出了一步。透過利用語音同步手勢和 XR 的空間能力,將對話定位於物理運動中,我們可以降低複雜任務的認知負荷,並使空間運算更易於存取且以人為本。

隨著我們繼續為 Android XR 生態系統開發,我們正在探索如何使這些手勢更加個人化,適應使用者的慣用手或學習他們特定的空間習慣,以創造更無縫的人機協作。

致謝:本研究主要由 Ziyi Liu 在 Google 擔任學生研究員期間進行,作為多個團隊聯合合作的一部分。我們衷心感謝主要貢獻者 David Li、Zhongyi Zhou 和 David Kim 的支持,以及 Adarsh Kowdle、Guru Somadder 和 Shahram Izadi 的策略指導和周到審閱。