继上周发布 Gemini 3.8 Live 与仍处于私有预览阶段的 Gemini 3.8 Live Extended Thinking 之后,Google Cloud 宣布 Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 中正式可用(GA)。该功能此前曾在 Google Cloud Next 2026 上首次预览,现已具备企业级生产条件。
核心能力
Gemini 3.8 Live 提供原生语音到语音(speech-to-speech)基础,Live Avatar 则为网页、移动端和交互式终端上的对话式视频代理增加视觉呈现。两者结合后支持以下能力:
- 视频化身:可生成带唇形同步的视频化身;自定义化身功能目前仅通过白名单开放。
- 流畅对话:原生语音到语音架构可在不丢失对话上下文或后端事务的前提下更自然地处理打断。
- 工具调用:模型能够在继续对话的同时于后台执行工具和 API 调用,先确认请求再等待任务完成。
- 多语言支持:理解并使用 97 种语言,支持自动语言检测。
- 实时视觉理解:可同时处理实时摄像头画面、屏幕共享与音频输入。
该版本目前提供美国和欧盟端点,支持预配置吞吐量、企业合规与严格数据治理。
安全与透明度机制
为防止身份滥用,客户可从预置的精选化身库中部署,自定义化身的创建需经过严格的企业白名单与验证流程。所有生成的音频和视频流均嵌入不可感知的 SynthID 水印,以确保 AI 生成内容可被识别与验证。
应用示例与客户实践
Google Cloud 展示了三个演示场景:通过系统指令、单张参考照片和音频样本逐步创建交互式自定义化身;在保险理赔受理场景中结合实时视频理解,由用户口述并展示损失画面,系统自动填写理赔记录并在后台核查保单;以及使用 Agent Development Kit(ADK)定义代理、管理运行器与会话内存,无需传统语音转文本管道即可将实时音频流接入 Gemini Live API。
多家企业已基于该模型构建应用:
- Cox Automotive 为 Autotrader 打造了 AI 购物助手,利用实时屏幕高亮和工具调用能力引导用户完成车辆搜索、比较与融资。其首席产品官 Marianne Johnson 表示,消费者越来越倾向于用自然语言描述需求,而非操作筛选菜单。
- Equal AI 首席执行官 Akhilesh Damaraju 称,其个人 AI 每天处理超过一百万通实时电话,覆盖九种印度语言,Gemini 3.8 Live 改善了打断处理、多语言对话和工具调用可靠性。
- Salesforce Agentforce 产品副总裁 Bob Van Osten 提到,Salesforce AI Research 正与 Google 合作,将实时多模态能力与 Agentic AI 结合。
- Specs 软件工程师 Eric Walsh 表示,团队对语音活动检测(VAD)更新和整体延迟改善印象深刻。
除 Gemini 3.8 Live 外,针对需要模块化音频能力的应用,Google Cloud 还提供 Gemini 3.5 Transcribe、Gemini 3.5 Live Translate、Gemini 3.8 Flash-Lite TTS 和 Gemini 3.8 Flash TTS 等模型。企业客户可通过 Gemini Enterprise 试用,或通过 Gemini Live API 文档进行集成。

