继上周发布 Gemini 3.8 Live 之后,Google DeepMind 推出了 Gemini 3.8 Live with Live Avatar。该功能将接近实时的视频生成与原生语音对话模型结合,使 AI 代理能够同时处理视觉与音频输入,以动态的虚拟形象进行聆听、观察和表达。
多模态对话与异步工具调用
Live Avatar 具备精确的口型同步、自然的面部表情以及流畅的对话轮换能力。在交互过程中,它可以同时接收视觉和音频信息,并生成带有表现力的音视频回应。
除视觉呈现外,该功能依托 Gemini 的推理能力支持异步工具调用。Live Avatar 能够在后台触发工具请求并获取数据,同时保持前台对话不中断。例如在酒店入住登记场景中,系统可以在继续与客人交谈的同时完成信息核验等复杂任务。
覆盖 97 种语言的语音同步
Live Avatar 内置原生多语言语音到语音同步机制。它可根据当前使用的语言动态调整口型和面部表情,并在 97 种语言之间无缝切换,不会降低视频保真度或产生视觉漂移。
品牌定制与透明度保障
组织可使用预设的多样化虚拟形象库,也可基于高质量参考图像生成完全动画化、可响应的自定义形象,同时保留参考图像的外观特征、品牌风格或角色身份。据 Google DeepMind 介绍,自定义形象创建功能目前仅通过企业白名单开放。
在安全层面,Live Avatar 生成的所有音频和视频输出均嵌入了 SynthID 水印。这种不可感知的水印直接织入媒体内容,使 AI 生成的内容保持可检测性,以减少错误信息和错误归因的风险。
Gemini 3.8 Live with Live Avatar 即日起在 Gemini Enterprise 中可用。

