据 Google AI 博客文章介绍,该公司的技术与产品目前已支持超过300种语言的日常交互,使用者超过70亿人,占全球人口的86%。自2006年推出 Google Translate 以来,其支持语言已从最初的少数几种扩展至如今的250多种。
从文本翻译到原生音频理解
传统的语音识别系统通常遵循“音频转文字、处理文字、再合成音频”的多步流程。这种方式会丢失语气、节奏、情绪以及语码转换(如 Spanglish 或 Hinglish)等真实交流特征。为此,Google 转向训练模型直接处理原始音频。
- Gemini 3.5 Live Translate:支持70种语言、2000多个语言对的实时语音翻译,能够捕捉语码转换和情绪线索。
- Gemini 3.5 Transcribe:将原始音频转换为格式化文本,在嘈杂环境或复杂术语场景下工作,并驱动 Android Gboard 上的 Rambler 功能,可去除填充词、修正语法标点,并支持通过语音指令编辑或在语言间无缝切换。
- 1000种语言计划:目标是支持全球使用人数最多的1000种语言。其 Universal Speech Model 基于1200万小时音频训练,利用跨语言迁移学习,将数据丰富语言中学到的模式应用于低资源语言。
面向低资源语言的开放数据合作
由于互联网内容高度集中于少数主导语言,为让 AI 理解代表性不足的语言,Google 采取了本地化数据采集策略:
- WAXAL:与 Makerere University 和 Digital Umuganda 等机构合作构建的大规模开放语音数据集,覆盖撒哈拉以南非洲27种语言,涉及26个以上国家超过1亿使用者。
- Project Vaani:与印度科学研究所(IISc)及 Bhashini 合作,以地区而非语言为锚点收集数据,目前已从超过15.5万名说话者处采集逾3万小时、涵盖109种语言的语音。
- Amplify Initiative:联合四大洲20所大学及1600多名本地专家,贡献了1.5万个多模态数据点。
此外,新工具 Language Explorer 可交互式可视化 LinguaMeta——全球最大的开源语言数据存储库,持续映射超过7000种口语、书面语和手语。
离线翻译与功能机适配
对于超过30亿缺乏稳定互联网接入的人口,Google 开发了 TranslateGemma。这是一组基于 Gemini 构建的轻量级开源翻译模型,覆盖55种语言,可直接在设备端高效运行,无需连接云端或互联网。
针对低资源地区仍在使用功能机的数亿用户,Google 支持 Viamo 组织推出了“Ask Viamo Anything”(AVA)语音 AI 助手,将 Gemini 的能力引入标准功能机。AVA 已在卢旺达完成试点,并利用 Gemini 回答了超过200万个问题。
无障碍设计与本地发音
在手语识别方面,Sign Language-to-Text(SL2T)模型已基于50多种手语训练,可为 Gboard 和 Pixel 11 上的 Live Transcribe 提供手语转文字听写功能,首发支持美国手语(ASL)转英语。
在本地发音细节上,Google 在新西兰与毛利语专家合作,改进了 Google Maps 中的地名发音,并将符合文化习惯的发音直接整合进文本转语音模型中。
目前,这些语言技术已嵌入 Search、Android、Chrome、YouTube、Google Play 等九个平台,连接超过50亿用户。

