随着 AI 助手从文本界面向多模态交互演进,Project Astra、Gemini 3.1 Flash Live 等项目已支持用户实时讨论摄像头画面中的物体,但主要依赖二维屏幕上的视觉边界框叠加。据 Google Research 介绍,其发表于 CHI 2026 的研究原型 AgentHands 尝试解决向 Android XR 等沉浸式平台迁移时的挑战,通过协同语音手势(co-speech gestures)让 AI 代理在三维空间中用双手描述形状、模拟动作并强调重点。
手势分类体系
研究团队与 Google 内部的 XR 及人机交互专家开展了一项形成性研究,归纳出决定虚拟手在三维环境中“可读性”的多维分类体系:
- 单手或双手与手势形态:选择使用一只手或两只手,并从手势库中调用特定形态,例如用手掌表示警告,或用圆柱形握姿模拟持握工具。
- 空间定位:利用 XR 的深度信息确定手部位置——悬空用于一般对话,锚定到具体物体以标识部件,或相对于用户位置传递社交信号。
- 时间动态与视觉特效:手势包含“倾倒”“描边”等动画动作,并可叠加 XR 特有的视觉层,例如用红色光晕表示高温警告。
工作流程
AgentHands 的核心是将大语言模型的高层推理映射为与语音和用户 XR 环境匹配的实时物理动作。该流程由四个模块组成:
- 环境感知:轻量级物体注册模块结合眼动追踪和场景重建,让用户快速标记物品(如兰花或笔记本电脑),生成带三维边界框的空间注册表供代理引用。
- 手势事件库:构建涵盖三类语义的手势行为库——指示类(deictic)用于指向参照物,图标类(iconic)用于描绘动作或形状,表达类(expression)用于传递社交信号和情绪。
- 嵌入手势的推理:用户提问后,后端 LLM 生成的回复内嵌 GestureEvents。每个事件绑定特定触发词,并按分类体系维度编码手部行为的原语。
- 同步 XR 执行:XR 头显端的本地解析器利用词级时间戳协调文本转语音播放与动画引擎,使代理双手的动作与语音严格同步。
应用场景
研究展示了三组具身手势与 XR 空间感知结合的演示:
- 交互式辅导:在兰花养护场景中,代理不仅口头提示“检查根部”,还会将手移动到植物基部,一边讲解气生根功能一边勾勒其轮廓。
- 技术操作指引:针对 3D 打印机操作,代理可演示导航控制旋钮和选择文件所需的“旋转并点击”序列。
- 生活陪伴:作为健康教练时,代理可通过握住用户的手并叠加视觉特效发出互动式警告,提醒避免不健康行为。
用户研究结果
团队开展了一项被试内研究(N=12),将 AgentHands 与纯语音基线进行对比。两种条件下的口述内容由研究人员统一编写,唯一变量是具身双手及其同步手势的存在与否。参与者分别完成了兰花养护和 3D 打印机操作两项程序性任务。
结果显示,XR 与协同语音手势的结合在空间锚定交互中具有显著效果:
- 空间定位显著提升:参与者更容易找到代理提及的具体物体和方向(p < 0.05)。当代理说出“这个”时,指向手势恰好落在目标上,消除了纯语音指令常见的猜测。
- 复杂动作更易理解:所需操作步骤被认为更易于跟随(p < 0.05)。有参与者表示,“只有当代理做出抬起手势时,我才意识到需要把兰花抬起来让水排干”。
- 安全提示更醒目:配合手势和视觉特效的警告更为有效,3D 打印机任务中使用的“灼烧”特效被评价为“令人印象深刻”,确保用户注意到喷嘴高温风险。
- 认知负荷降低:定性反馈显示,参与者认为指令更易理解和记忆,双手的存在让体验从工具式搜索转变为“伙伴引导”式的具身对话。
该项目主要由 Ziyi Liu 在担任 Google 学生研究员期间完成,属于跨团队联合协作成果。研究团队表示,后续将在 Android XR 生态中探索手势个性化,例如适配用户的惯用手或学习其特定空间习惯。
