Google DeepMind 宣布向 Gemini 系列新增两款文本转语音(TTS)模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS。这两款模型将语音生成从静态预设转向可动态定制的工作流,用于游戏、有声书、播客、配音以及交互式语音代理等场景。
两个版本的定位差异
Gemini 3.8 Flash TTS 侧重深度创意指导与角色声音设计,允许开发者使用自然语言提示词从零构建全新声音,并对语速、方言切换和语气词等表演细节进行逐行控制。
Gemini 3.8 Flash-Lite TTS 面向高吞吐量和成本效率优化,适用于大规模配音、音频内容批量生产以及对语调、节奏有精细控制需求的语音代理。
这两款模型加入已有的 Gemini Audio 产品线,此前该系列已包含 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。
声音创建与控制能力
在声音库方面,Flash TTS 将可用原创声音从 30 个扩展至 2000 多个,覆盖 100 余种语言和方言,包括墨西哥西班牙语、魁北克法语和苏格兰英语等区域变体。用户可通过自然语言描述角色、口音和声音特征来生成定制声音;即将推出的“声音重混”功能则允许对现有声音的音色、音高、语速和口音进行微调。
声音复制功能仅需 30 秒音频样本即可重建一致的声音档案,前提是用户拥有该声音的使用权。
在表演控制上,两款模型均支持逐行导演:用户可编写舞台指示或使用自然语言脚本提示来控制每一句的交付方式。模型能够在数小时的连续长音频中维持音质、自然节奏和角色音色,减少说话人漂移。此外,原生双说话人场景调度允许在单一脚本中无缝处理多轮对话并保持声音分离,还支持添加非语言提示和主动倾听式插话以增强对话真实感。
基准测试表现
根据 Google 公布的数据,Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 中以 71.4 分位列总体第一,并在口音建模(60.8 分)中领先。在 Hume AI 的总体质量指数中,Flash TTS 和 Flash-Lite TTS 分别排名第一和第二。相较于 Gemini 3.1 Flash TTS,新模型在长篇内容和双说话人剧本控制等用例上有明显提升。在 Voice Arena 的盲测人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言中位居前列。
安全机制与透明度
声音复制系统要求用户提供声音所有者的口头同意录音,且该录音必须与参考说话人匹配后才能创建声音。Gemini Audio 模型生成的每段音频都会嵌入 SynthID 水印,这种不可感知的水印直接织入音频输出,使 AI 生成的语音保持可检测性。相关内容还附带 C2PA 凭证。
可用性与集成
自即日起,开发者可通过 Gemini API 和 Google AI Studio 使用这两款模型。企业版 API 访问将在后续推出。面向普通用户,Flash TTS 已集成至 Gemini Notebook,Flash-Lite TTS 则进入 Google Vids。
Agora、LiveKit、Pipecat、Vercel 等开发平台已支持接入,Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 正在集成最新 TTS 模型用于全球配音、区域口音本地化和规模化对话语音代理。
需要注意的是,通过 AI Studio 使用声音复制功能目前在伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度不可用。

