2025年1月至9月期间,Google Cloud 对其 Data Cloud 产品线进行了多轮更新,重点围绕流式数据处理、开放表格式支持、AI Agent 集成以及数据库和编排工具的能力增强展开。
流式数据与事件处理
Pub/Sub 单消息转换(SMT)现已正式支持对 Gemini Enterprise Agent Platform 模型进行 AI 推理。该功能可对传入的事件流实时应用推理,将模型预测结果附加到事件中,供下游 BigQuery 或 BigTable 等系统处理,目前处于正式发布(GA)状态。
Managed Service for Apache Kafka 的 PostgreSQL Source Connector 也已 GA,支持从 Cloud SQL for Postgres、AlloyDB 及自建 PostgreSQL 数据库低延迟捕获变更并写入 Kafka。同期上线的合成数据生成器工具可在数分钟内向集群发送模拟数据,用于快速测试。
Dataflow 批处理作业新增了暂停失败(pause-on-failure)功能,允许在作业失败前保留状态,处理外部问题后恢复执行而不丢失已完成的工作。此外,Dataflow 管道更新现支持停止并替换模式,并可为 drain 操作设置超时限制以控制成本。
BigQuery 与数据分析
原 insertAll 流式 API 已更名为 BigQuery Storage Write API (REST)。这一无状态 JSON-over-HTTPS 端点为 Serverless Web 应用、IoT 遥测和 AI 日志记录提供了轻量级替代方案,现有用户无需更改代码即可无缝过渡。对于高吞吐量持续管道,gRPC 版本仍是推荐标准。
BigQuery 连续查询现已在预览版中支持有状态处理,用户可在流式查询中直接使用 JOIN、聚合和窗口函数,例如计算30分钟平均值,为下游应用和 AI Agent 提供更丰富的实时信号。同时,BigQuery Graph 也进入预览阶段,提供大规模图分析能力。
在连接性方面,Google 自建的 BigQuery ODBC 和 JDBC 驱动程序均已进入预览版,为应用程序和 Java 应用提供直接的高性能连接。
开放表格式与存储层
Lakehouse 托管表(基于 Apache Iceberg)已进入预览版并在控制台可用。通过使用 Google 托管的 Iceberg 表,用户可消除 BigQuery 与开源引擎之间维护重复数据管道和复杂同步逻辑的开销。该统一表格式支持原生多引擎读写互操作,允许在单一共享存储层上跨不同分析工具并发执行 DML/DDL 操作,内置的自动化表管理可处理压缩和分区调优等后台任务。
AI Agent 与对话式分析
Google Cloud 在多个数据产品中推进了 AI Agent 集成。BigQuery Studio 中的 Gemini 助手已从代码辅助工具升级为具备上下文感知的分析伙伴。BigQuery Conversational Analytics 允许用户使用自然语言分析数据,智能代理可直接在 BigQuery Studio 中生成、执行并可视化答案。
Conversational Analytics 能力也扩展至 Looker Embedded 环境,使用户能够将自然语言体验嵌入自定义应用中。Looker 还引入了自助式 Explores,允许用户将自有数据引入语义层进行即时分析。
在数据库层面,AlloyDB、Spanner、Cloud SQL、Bigtable 和 Firestore 现已支持托管和远程 MCP(Model Context Protocol),使 AI 模型能够连接日常使用的数据库工具来规划和解决复杂问题。
数据库与编排工具增强
Firestore Enterprise 版本引入了管道操作,新引擎包含超过一百项新查询功能、无索引查询和新索引类型,并提供内置迁移工具。
Cloud SQL 推出了自动扩缩读取池功能,允许通过单一读取端点访问多个只读副本,并根据实时需求动态调整读取能力。Cloud SQL for SQL Server 则进入 Microsoft Entra ID 集成的公开预览阶段,支持集中身份管理和多因素认证。
Managed Service for Apache Airflow 发布了 Airflow 3.1 GA 版本,新增 AI 驱动的代理式故障排查、用于自定义代理集成的托管 Airflow MCP Server,以及声明式 YAML 编排管道。Cloud Composer 3 中集成了 Gemini Cloud Assist 调查功能,可自动分析失败任务的日志和元数据以识别故障模式并提供修复建议。
