发布概况与模块化架构设计
2026年10月6日,Google DeepMind宣布开源多模态嵌入模型EmbeddingGemma 2,采用Apache 2.0许可协议,模型权重已在Hugging Face和Kaggle开放下载。嵌入模型作为将各类内容转化为数值向量的基础原语,可确保语义相近的内容在向量空间中彼此靠近,是现代搜索、推荐系统和检索增强生成(RAG)管道的核心支撑。相比2025年9月发布且下载量已突破2000万次的第一代纯文本模型,EmbeddingGemma 2打破了单模态限制,正式将适用范围拓展至跨模态领域。
EmbeddingGemma 2基于Gemma 4架构打造,总参数量为7.4亿(740M)。该模型采用了模块化结构设计,核心包含一个由1.3亿参数Transformer和1.4亿参数Embedder构成的2.7亿参数文本主干网络,同时配备了可选的1.7亿参数视觉编码器和3亿参数音频编码器。此外,该模型拥有8K Token的上下文窗口,支持处理长达数分钟的音频或视频文件,并适配超过100种语言。
统一向量空间与性能基准表现
EmbeddingGemma 2原生支持将文本(含代码)、图像、音频和视频映射至统一的768维共享向量空间。Google宣称,该模型是10亿参数以下性能最佳的多模态嵌入模型,在MTEB(海量文本嵌入基准)和MAEB(海量音频嵌入基准)中均处于领先水平,并在图像、视频和音频任务上匹配或超越了体积更大的专用模型。根据官方模型卡披露的测试数据,其MTEB代码检索得分由第一代的68.76提升至78.68(提升约14%),而多语言文本得分则与前代基本持平(61.36对61.15)。
媒体分析指出,Google重点推介代码检索能力的跃升,明确表明其旨在吸引构建代码智能体(Coding Agents)的开发者群体。同时,分析机构explainx.ai指出,以往开发者在构建多模态检索时往往需要维护独立的文本、图像和语音处理管道,而EmbeddingGemma 2的推出是Google尝试用单一轻量模型替代原有复杂技术栈的举措。
端侧轻量运行与离线隐私优势
该模型针对消费级硬件的端侧推理进行了专门优化。Google在Pixel 11 Pro上的实测数据显示,运行纯文本权重时活动RAM占用约为191 MB,运行完整多模态模型时RAM占用约为567 MB。模型还原生集成了俄罗斯套娃表示学习(MRL),允许将输出向量弹性截断至512、256或128维。Google表示,截断至256维时多模态检索仍能保持约95%的质量,同时可削减最高达6倍的存储成本;此外,该模型还可充当超低延迟的端侧决策引擎,在无需训练数据或微调的情况下于数毫秒内完成零样本意图路由。
在应用落地方面,Google AI Edge提供了交互式示例工具,包含可通过文本或语音查询精准定位视频特定场景的“视频片段查找器”(Video Moments Finder)。SiliconANGLE在报道中强调了该模型的本地离线与隐私优势,例如应用可在完全不把数据传出手机的前提下,通过语音备忘录直接匹配视频对应片段;SiliconANGLE还进一步分析认为,EmbeddingGemma 2与Gemma 4共享文本分词器及音频编码器,两者协同部署构建端侧RAG系统时具备显著的内存复用优势,所需内存远低于运行两套互不相关的异构模型。

