日本电信运营商 KDDI 推出了面向消费者的检索增强生成(RAG)应用 Buffmee。该服务以“帮助你成长的 AI”为理念,基于超过 100 种书籍、杂志和网络媒体来源,帮助用户搜索信息、总结要点并探索个性化的学习与兴趣领域。通过在回答中引用来源,Buffmee 试图缓解用户对信息可靠性的顾虑。
在开发过程中,KDDI 与其开发合作伙伴 KDDI iret、Google Cloud Consulting 及专业 AI 工程师协作。团队需要将大量专有内容接入系统,但面临延迟问题,难以达到目标响应时间,同时需要确保结果不产生幻觉。
自动化评估替代人工测试
传统手动测试无法应对庞大的内容库规模。开发团队使用 Gemini Enterprise Agent Platform Evaluation Service 设计了系统化评估流程,引入 LLM-as-a-Judge 和 Rule of Hundreds 等自动化评估框架。团队导入文档语料库,构建了数百项自动化评估测试,并建立基准数据集来衡量各用例的回答可靠性。这一过程使 groundedness(基于事实的准确性)得分提升了 25%。
性能瓶颈识别与优化
为提高响应速度,团队使用了 BigQuery Agent Analytics 和 Agent Development Kit (ADK) 日志分析代理。通过分析实际生产日志,团队发现技能划分方式以及高度复杂的多页系统提示词膨胀会影响首字时间(TTFT)。据此,团队优化了系统提示词,包括内联集成技能并重新审查子代理路由,在不牺牲准确性的前提下实时解决了深层堆栈瓶颈。
最终,KDDI 将应用总响应延迟降低了 38%,达到了目标响应性能,TTFT 改善了近 18%。
四项核心技术实践
为实现上述结果,团队落地了四项技术实践:
- 转向二元评估:针对关键指标,从模糊的 1–5 分评分改为二元的“通过(1)/失败(0)”系统,减少方差和噪声,提高自动化评估准确性。
- 策略性内容采样:未按全量文档逐一评估,而是按文件格式(网络文章、EPUB、PDF、结构化数据)和媒体构成(纯文本、图片为主或混合)两个维度对语料库分类。从难度网格的每个单元格中选取代表性样本,在保持测试覆盖面的同时将评估工作量减少了 75%。
- 基于产品判断设定阈值:产品负责人结合随机抽样的回答与自动评分进行校准,确定符合用户体验要求的发布标准,而非仅依赖工具的默认参数。
- 将庞大提示词拆分为 ADK Skills:超过 800 行的系统提示词可能导致大模型注意力分散和延迟增加。团队按功能将提示词拆分为 ADK Skills,动态加载所需逻辑以优化响应时间。
KDDI AI 产品部门的 Shunya Onoda 表示:“我们的愿景是构建一个平台,让内容一旦接入就能立即作为可用的 RAG 系统运行。”
