2026年9月30日,Google Cloud 发布9月份 AI 基础设施和编排更新汇总,重点提升 Agent 工作负载的扩展性。面对大型模型权重加载及隔离环境初始化的冷启动挑战,本次更新覆盖了运行时沙盒、状态快照及配套基础设施等环节。
在运行时方面,Google Cloud 开源了专为自主 Agent 设计的执行运行时 GKE Agent Substrate。据 Google 官方介绍,该运行时具备原生零信任内核与网络隔离,宣称能以比标准容器运行时高10倍的密度运行沙盒,支持每秒超500次挂起与恢复激活,且恢复延迟低于500毫秒。此外,GKE 现已内置缩容至零(scale-to-zero)功能,通过支持 KEP-2021 与 Autoscaling Metric 的 HPA 机制实现。
针对水平扩展时的长初始化耗时,新推出的 GKE Pod snapshots 功能支持保存包含 CPU 与 GPU 内存及文件系统更改的工作负载完整运行状态;新副本可按需直接从快照恢复执行,跳过大型模型加载过程。据 Google 发布的基准测试数据,该功能可将 AI 推理启动延迟缩减最高89%,在官方测试中,70B 与 8B 参数模型的加载耗时分别为37秒和15秒。
围绕跨平台迁移与底层算力,Google Cloud 开源了 GKE agentic migration 插件,结合 LLM 推理与本地模型上下文协议(MCP)服务器,将 AWS EKS 基础设施代码和 Kubernetes 清单转换为 GKE 登陆区;官方表示该工具通过强制离线验证并以 Pull Requests 形式应用变更,以降低传统迁移摩擦并防范模型幻觉。底层计算方面,专为高内存及 I/O 密集型负载设计的 M4N 虚拟机系列正式全面可用(GA),官方称其最高可达 26:1 内存比率和 100 万 IOPS;存储优化的 Z4D 虚拟机系列也已正式全面可用,其裸金属实例则处于预览阶段。

