模型发布与核心定位
2026年10月4日,Google 在 Hugging Face 平台正式发布了名为 google/DiarizationLM-Gemma-4-E4B-v1 的开源模型,并采用了 Apache 2.0 许可证。 该模型构建了一个大型语言模型(LLM)框架,专门用于对自动语音识别(ASR)和说话人分离(Speaker Diarization)的输出结果进行后处理、纠错与性能优化。
架构设计与微调配置
在架构方面,该模型基于 Google 的 Gemma 4 E4B 基础模型构建,拥有 40 亿(4B)密集参数,全模型共包含 42 层,隐藏层大小为 2560,并采用了 5:1 的滑动窗口与全局注意力混合机制。 微调过程中,模型在 8 块 Google Cloud TPU v5p 芯片上完成优化,训练过程总计 10,000 步,全局批大小为 8,并应用了秩 r = 256 的 LoRA 适配器。
解决长独白身份漂移痛点
该模型在 4 个经典的说话人分离基准语料库上进行了训练,分别为 Fisher English、Callhome American English、ICSI Meeting Corpus 以及 AMI Meeting Corpus。 据了解,早期的相关模型仅在 2 人电话数据上训练,当应对 4 人以上的会议场景时,极易因长独白而出现“说话人身份漂移”问题。
据法国 AI 媒体 ActuIA 报道,该模型的前代版本具备 80 亿参数且基于 Llama 3 构建,此前仅能理解双人电话对话场景。
为了有效克服身份漂移问题,该模型在微调中引入了“保持局部性的 Oracle 监督”方法,在纠正词汇轮次边界和后台反馈的同时,确保在长独白中牢固保留声学说话人锚点。
性能表现与边缘部署支持
在具体表现方面,据 ActuIA 报道,在 Fisher 数据集上,错误归因给说话人的词汇比例已降至 2.99%;在 Callhome 数据集上降至 4.92%;而在 ICSI 和 AMI 会议数据集上,性能则分别提升了 0.6 和 0.79 个百分点。
为了便于实际落地部署,模型的 LoRA 权重已被直接合并入 16 位(bfloat16)基础权重中,并序列化为 4 位 GGUF 格式(包含 Q4_K_M 和 Q4_0),旨在全力支持在边缘设备上实现本地离线运行。

