AI 工作负载的资源获取——尤其是加速器供应——正成为行业普遍挑战。当部署方案绑定特定类型的加速器时,资源短缺可能直接拖慢进度。为此,Google Cloud 提出“弹性算力”(fluid compute)思路:根据可用资源灵活设计部署方案,而非锁定单一硬件。
由于不同加速器(GPU 或 TPU)的后端网络组件配置并不相同,选择合适的计算资源后,还需匹配对应的网络架构。
六种算力获取方式
确定目标工作负载和首选硬件(例如使用 A4 VM 中的 NVIDIA B200 GPU 运行私有 LLM 推理)后,若首选资源不可用,可通过以下途径获取算力:
- Dynamic Workload Scheduler(Flex-start VM):将工作负载排队,直到所需加速器节点同时可用后统一配置,以非抢占模式运行最长七天。
- Dynamic Workload Scheduler(日历模式):可提前 1 至 90 天预留加速器容量,并保证起止时间,适用于计划内的预训练和基准测试。
- Future reservations:保证从指定未来日期起,在特定可用区获得承诺的硬件访问权。
- Flex reservations:提供短期承诺窗口,用于锁定稀缺加速器节点,无需多年期合约。
- 动态节点自动配置与 ComputeClasses:在 GKE 中,通过 ComputeClasses 定义多系列回退列表,集群可在主资源池受区域限制时自动尝试配置替代加速器类型。
- Spot VMs:以大幅折扣提供剩余算力,适用于容错且支持检查点的批处理任务。
四类网络配置
加速器的网络组件因选型而异,Google Cloud 目前支持四种主要配置。
标准网络
适用于 NVIDIA T4(N1 系列)、NVIDIA L4(G2 系列)、单节点和多节点 NVIDIA A100(A2 机器系列),以及 Cloud TPU v3 和 Cloud TPU v5e(单主机/独立切片)。节点通过主 VPC 网络,使用 gVNIC 基于标准 TCP/IP 通信。该架构可在 Google Cloud 各计算环境间便捷移植,适合分布式数据预处理、解耦流水线阶段、独立推理副本和使用标准 VPC 路由及网络策略的计算机视觉工作负载。
加速 GPU 网络(TCPX/TCPXO 与 RoCEv2)
分布式训练和多节点推理需要专用多轨网络结构来处理大规模参数交换和集合通信。
GPUDirect-TCPX 与 TCPXO 结构支持 NVIDIA H100(A3 High VM,4 轨)和 NVIDIA H100 Mega(A3 Mega VM,8 轨)。其架构使用定制的 GPUDirect-TCPX(4 个专用 VPC)和 GPUDirect-TCPXO(8 个专用 VPC)卸载引擎,在标准以太网基础设施上实现高吞吐多轨 GPU 通信,无需原生 RDMA 硬件。这些多 VPC 拓扑可通过 Cluster Toolkit 的预置蓝图部署。
**RoCEv2 结构(VM 与裸金属)**支持 NVIDIA H200(A3 Ultra VM)、NVIDIA B200(A4 VM)、NVIDIA GB200 NVL72(A4X VM)和 NVIDIA GB300(A4X Max 裸金属)。RoCEv2 运行在附加于专用区域网络配置文件的独立 RDMA VPC 上:VM 实例使用 ZONE-vpc-roce 配置文件,裸金属实例使用 ZONE-vpc-roce-metal 配置文件。该专用 VPC 严格隔离于 GPU 通信,包含直接映射到加速器 NIC 的子网;后端采用轨道对齐设计,支持巨型帧(MTU 8896),可提供无阻塞的多太比特带宽并最大限度减少跨轨干扰。在 GKE 上部署时,托管 DRANET 可自动配置额外网络并分配驱动,将 RDMA 网络接口映射到 GPU,随后可通过标准 Kubernetes 资源声明在工作负载 Pod 中直接使用。包括 RDMA VPC、MTU 调优和 DRA 驱动在内的完整堆栈,均可通过 Cluster Toolkit 自动化蓝图部署。
TPU 网络
适用于 Cloud TPU v4、v5p、v5e(多主机 Pod 切片)、v6e(Trillium)和 TPU7x(Ironwood)。
在 TPU Pod 或切片内部,芯片通过专用的超低延迟光链路直接通信,组织成 2D 或 3D 环形网格(ICI),完全绕过传统网络栈。在 TPU v4 和 v5p SuperPod 中,软件可重构的光电路交换机(OCS)能够动态改变物理网络拓扑、绕过故障托盘并在无需人工重新布线的情况下配置自定义大小的加速器切片。
Cloud TPU v6e 及更高版本引入了原生多 NIC 架构:工作节点将标准 Kubernetes 管理流量隔离在主 VPC 上,同时使用为高吞吐 TPU 数据和跨切片通信配置的辅助专用 VPC。在 GKE 上部署时,同样可使用 DRANET 自动配置网络和驱动。对于超出单个 TPU 切片规模的模型,Cloud TPU Multislice 利用这些专用多 NIC 路径,通过 Jupiter 数据中心网络将多个独立的 ICI 网格互联。
Cloud Run
支持 Cloud Run GPU 服务上的 NVIDIA L4(G2 系列)和 NVIDIA RTX PRO 6000(Blackwell)。通过 Direct VPC Egress,无服务器容器可直接绑定到私有 VPC 网络,实现亚分钟级 IP 分配,从而安全、低延迟地访问内部数据湖、数据库和私有 API,无需经过公共互联网或使用旧版连接器 VM。

