据 Google AI 博客信息,Gemini 3.8 Live 与 3.8 Live Extended Thinking 已上线 Gemini API 和 Google AI Studio,面向开发者构建实时语音应用。同期提供的还有上月发布的专用语音转文本模型 Gemini 3.5 Transcribe。
Gemini 3.8 Live 的对话与执行能力
Gemini 3.8 Live 是原生语音到语音模型,能够在维持对话流的同时执行任务。其 Extended Thinking 版本支持可配置的深度推理,可在后台处理复杂的多步骤任务,同时在主对话中进行响应或叙述进展。根据 Artificial Analysis 的 Speech-to-Speech 排行榜,该版本排名第一。
这两个模型通过 Live API 提供,主要能力包括:
- 异步函数调用:在后台执行 API 和工具调用的同时,继续向用户流式传输音频响应。
- 视觉上下文:将对话建立在实时视觉输入之上,使智能体能够结合用户的语音和所见内容进行理解。
- 字母数字精度:准确解析确认码、索赔编号和技术数据。
- 多语言支持:覆盖 97 种以上语言,并保持口音一致性。
- 增量内容更新:将实时音频与结构化数据合并,返回上下文感知的响应。
定价方面,音频输入为每分钟 0.005 美元,音频输出为每分钟 0.018 美元。开发者也可通过 Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel 以及 Vision Agents 等集成合作伙伴接入,由后者处理实际部署中的媒体流基础设施。
Gemini 3.5 Transcribe 的转录特性
Gemini 3.5 Transcribe 是专用语音转文本模型,支持 85 种以上语言。根据 Google 公布的数据,其流式模式平均词错误率(WER)为 4.0%,非流式模式为 2.6%。
该模型具备以下功能:
- 自动语码转换:无需手动配置即可处理句内和句间的语言切换。
- 自定义词汇偏置:通过传入最多 1,000 个术语的 custom_vocabulary 列表,将识别导向特定领域术语、不常见行话、公司名称和专有名词。
- 智能转录模式:输出带有结构化格式、自我修正并去除填充词的 polished 文本。
除实时场景外,开发者还可通过 Interactions API 转录最长 1 小时的音频文件,获取结构化时间戳和说话人标签。适用场景包括亚秒级字幕生成、呼叫中心智能体和实时音频分析。
音频套件的其他模型
除上述新模型外,Gemini API 中还包含其他音频相关能力:支持 70 多种语言的语音到语音翻译模型 Gemini 3.5 Live Translate、高度可配置的语音生成模型 Gemini 3.1 Flash TTS,以及生产级音乐生成模型 Lyria 3.5。开发者可在 ai.studio/live 试用这些模型,或从 GitHub 获取示例应用。

