数十年来,数据库工程的核心挑战始终是如何在不影响记录系统的前提下扩展 OLTP 工作负载。从 Exadata 将查询卸载到横向扩展存储层,到 Azure SQL Hyperscale 使用共享块服务器扩展读取副本,再到 Aurora 将日志应用卸载至分布式存储节点,现有架构在规模、延迟和隔离性之间至少需要妥协一项。
但在 AI Agent 时代,这些妥协变得不可接受。Agent 工作负载是动态生成的,无法预先审查,必须与关键业务系统隔离;同时,Agent 推理循环需要低延迟访问完整数据库引擎能力,以及前所未有的弹性——可能在数秒内要求单个数据库提供上千个计算节点,并在一分钟内完成任务后释放。
Agent 数据库架构的三项基本原则
Google Cloud 认为,真正面向 Agent 的数据库架构必须同时满足三项原则:
- 隔离:Agent 必须通过不与主集群共享数据库组件的数据路径,以亚秒级新鲜度读取实时生产数据。这是贯穿存储层的物理分离,而非配额限制。
- 延迟:操作型工作负载要求亚毫秒级块 I/O,即使缓存未命中而回退到远程存储,也必须在亚毫秒内完成,不能出现数量级的性能断崖。
- 规模:数据库计算节点必须能在数秒内启动、扩展至数千个、短时间运行并在任务完成后自动缩容至零。预配置资源在 Agent 场景下不可行。
这三项原则必须同时成立,Agent 才能直接对实时运营数据进行推理而不危及生产稳定性。
AlloyDB 的全栈工程实现
AlloyDB 的新架构基于 Google 的数据、AI 和基础设施栈进行了垂直整合。
在存储层,AlloyDB 构建于 Colossus 之上。Colossus 是支撑 Google Search、YouTube、Gmail、Spanner 和 Bigtable 的 EB 级分布式存储系统。数据库节点打开 Colossus 流时,授权和元数据解析仅在创建流时发生一次,后续每次读取都通过优化网络协议直接到达持有数据的磁盘,实现全数据范围的亚毫秒级延迟。单个 Colossus 集群可为一个 AlloyDB 数据库提供最高 15 TB/s 聚合吞吐量和每秒 2000 万次查询,无需预配置带宽。同时,AlloyDB 为 Agent 分配独立的 Colossus 存储段,确保 Agent I/O 与生产数据路径物理分离。
在网络层,计算与存储通过 Jupiter 数据中心网络连接。单个 Jupiter fabric 连接超过 10 万台服务器,提供 13 Pbps 的对分带宽,使 Agent 节点可以在集群中灵活调度,随着节点池从零扩展到数千,底层互联容量可吸收流量增长而不产生放置瓶颈。
在计算层,Agent 通过 Model Context Protocol(MCP)连接到 AlloyDB 的 Agent 池。每个 Agent 节点是一个运行在轻量级安全 microVM 中的完整 AlloyDB for PostgreSQL 数据库引擎实例,彼此之间以及与专用主集群之间完全隔离。节点根据 Agent 请求按需配置,任务完成后自动停止。按秒计费意味着使用一千个节点数十秒的突发任务仅按实际消耗收费。Agent 节点直接读取 Colossus,获取亚秒级新鲜度的生产状态,并可利用完整的 PostgreSQL 引擎能力,包括点查、索引遍历、向量搜索、全文搜索、空间搜索、列式扫描以及跨 lakehouse 的联邦查询。
现有架构为何无法同时满足三项原则
传统独立副本(shared-nothing storage)满足隔离和延迟,但扩展需要配置新副本并重新加载数百 GB 甚至 TB 级存储,耗时数小时,无法匹配秒级 Agent 突发需求,且静态配置的资源在任务结束后持续产生闲置成本。
解耦式共享存储服务器架构满足延迟,但由于所有副本从同一组存储服务器读取,Agent I/O 与生产 I/O 直接争用,破坏隔离性;同时总存储 I/O 带宽受限于预配置的存储层,增加计算节点只会加速存储饱和与限流。
对象存储加共享块服务器的新兴架构通过块服务器缓存热数据恢复延迟,但缓存未命中时回退到对象存储会产生数十毫秒延迟。由于副本与生产共享块服务器,隔离性被破坏,I/O 也无法随突发扩展。
据 Google Cloud 公布的测试,在一项使用商业可用共享块服务器架构的评估中,对超出 DRAM 容量的数据集运行并发索引查找,添加至 8 个读副本时吞吐量提升不足 2 倍,在 4 个副本时达到峰值后因共享块服务器带宽饱和而下降,主数据库吞吐量下降超过 75%。
性能测试结果
在 AlloyDB 的同类测试中,使用独立 Agent 节点而非传统读副本,从 1 个节点动态扩展到 10 个节点时,吞吐量从 3900 QPS 线性增长至 4.1 万 QPS;继续扩展两个数量级至 1000 个节点时,性能保持近线性增长。具体表现为:
- 从 1 个扩展到 1000 个 Agent 节点期间,主集群性能无可测量影响。
- 聚合吞吐量动态扩展 773 倍,达到 300 万 QPS,在 1000 个计算节点上驱动 Colossus 超过 800 万 IOPS。
- 在另一项跨 2100 个 Agent 节点运行并发全表扫描的基准测试中,聚合扫描吞吐量超过 1 Tbps。
AlloyDB PostgreSQL for agents 目前已开放预览。

