跨会话无状态与上下文膨胀成痛点
大语言模型在跨会话运行时本质上是无状态的。随着企业级 AI 智能体越来越多地被用于多天工作流和长周期任务,构建可靠的长期记忆系统已成为 AI 工程领域的核心挑战。
针对现有的处理手段,Google Cloud 官方指出,传统的“上下文填充”会导致 token 成本成倍增加,使简单提示词的响应时间拖延至 30 秒以上,并引发模型出现“迷失在中间”的退化现象;而基于大语言模型的“滚动摘要”在几轮压缩后容易将重要细节作为背景噪音过滤,导致智能体破坏先前设定的约束。
物理动静分离:构建四种互补记忆类型
为解决大语言模型的跨会话无状态问题并支持长周期工作流,Google Cloud 提出了一种面向企业级 AI 智能体的双层记忆架构,在物理层面上将短期活跃会话与长期持久事实分开存储。
该架构将智能体记忆划分为四种互补类型,包括短期缓冲区记忆(Buffer)、摘要记忆(Summary memory)、情景记忆(Episodic memory)以及实体与规则记忆(Entity & rule memory)。
在具体分工上,短期会话缓冲区采用 Memorystore for Valkey,通过 token 边界的滑动窗口在内存中缓存活跃对话轮次,以防止关系型数据库出现写放大和表膨胀;长期持久记忆则采用 AlloyDB AI(AlloyDB for PostgreSQL),用于跨会话存储重要事实、用户偏好和情景记忆,提供事务完整性以及跨关系型数据和向量的混合检索能力。
数据库内嵌计算与官方效能声明
AlloyDB AI 具备事务性库内自动嵌入能力(ai.initialize_embeddings),并支持在数据库中直接运行自动提取和压缩查询,使用 SQL 公用表表达式结合 ai.generate 将较旧的情景条目合并为摘要。
在性能指标方面,Google Cloud 官方宣称短期会话缓冲区支持亚毫秒级、高吞吐量的查询,AlloyDB AI 自动生成向量嵌入的速度最高可达每秒 3,000 个;官方还声明该双层架构在维持关键数据和企业护栏的同时最高可减少 70% 的 token 支出,并配套提供了名为“AlloyDB Agent Memory Codelab”的实践教程供开发者部署。
架构演进趋势与后续观察
分析指出,该方案反映出云数据库厂商正针对智能体化(Agentic)工作负载优化产品线,通过在数据库层直接集成向量生成和大模型摘要能力,减少数据在外部服务间的搬运,从而降低架构复杂度和延迟。
不过,目前关于亚毫秒级延迟、每秒 3,000 个嵌入以及最高减少 70% token 支出的数据均来自 Google Cloud 官方声明,具体测试基准与负载类型尚未明确,且缺乏第三方独立机构的实际评测数据;此外,该架构深度绑定 Google Cloud 生态组件,其在多云或本地部署环境中的适用性仍有待进一步观察。

