依托Spanner底座构建无服务器托管目录
Google Cloud宣布其Lakehouse运行时目录(Lakehouse runtime catalog)正式全面可用(GA)。这是一项由Spanner数据库提供底层支持的无服务器元数据注册表服务。
在标准兼容性上,该运行时目录原生实现了Apache Iceberg REST Catalog规范,同时支持传统的Hive Catalog接口。
应对开放格式演进与AI代理并发挑战
随着企业加速采用湖仓一体架构并标准化使用Apache Iceberg等开放格式,行业对具备高扩展性与高可用性的托管目录提出了刚性需求,以妥善维护表指针并处理原子提交。
分析表明,传统纵向扩展关系型数据库在高并发负载下面临CPU、内存与连接数的物理极限,而横向扩展系统往往受困于最终一致性。与此同时,AI代理(AI agents)的兴起带来了海量重复的小型查询,这要求托管目录在超大规模下必须同时保障原子性、一致性与高并发能力。
实现零数据复制与跨云联邦互操作
通过将元数据发现与计算引擎解耦,该目录使BigQuery、Managed Spark以及各类开源引擎等兼容Iceberg的引擎能够即时发现并查询已注册的数据表。
该目录具备“零数据复制”(zero data copy)特性,表定义可直接指向Cloud Storage、AWS S3和Azure Blob Storage等底层对象存储中的现有数据,无需重写或迁移底层数据。
在跨云协作方面,该服务支持双向跨云目录联邦,能够通过凭据分发和OIDC令牌交换访问Databricks Unity、Snowflake Horizon及AWS Glue中的数据,让企业打破分析壁垒,直接将Google AI能力应用于驻留在AWS与Azure上的数据。
安全凭据分发与Etsy迁移实践
在安全机制上,该目录充当安全网关并支持凭据分发(credential vending),通过生成短期令牌,免除查询引擎直接持有广泛存储凭据的安全隐患。
在业务落地验证方面,电商平台Etsy已将其目录迁移至Lakehouse运行时目录。经Etsy工程团队与第三方平台DataHub证实,Etsy通过就地连接数据,将数据管道查询速度提升了60%。

