运行现代 AI 工作负载时,性能与成本之间常存在冲突。大语言模型需要加载大量文件,并可能同时服务数千个要求即时执行代码的 AI Agent。如果每个组件都以“冷启动”方式完成完整的数据加载流程,漫长的初始化时间往往迫使企业超额配置基础设施以满足扩展需求。
为此,Google Cloud 推出了 Google Kubernetes Engine(GKE)Pod 快照功能。该功能允许保存工作负载的运行状态(包括 CPU 和 GPU 内存),并在需要时按需恢复。根据 Google Cloud 公布的基准测试,GKE Pod 快照可将 AI 推理启动时间缩短最多 89%,在 37 秒内加载 700 亿参数模型,在 15 秒内加载 80 亿参数模型。
消除模型加载的线性扩展惩罚
冷启动问题对 AI 工作负载尤为突出。推理服务器必须完成初始化,再将数 GB 的模型权重下载并加载到 GPU 显存中,这一过程通常需要数分钟。在传统模式下,集群中每新增一个副本都必须独立下载模型权重并将其加载到加速器内存;对于数百亿参数的模型,这一步骤往往占据了启动时间的绝大部分。
借助 Pod 快照,初始化过程只需执行一次以创建初始快照。GKE 会捕获包含 CPU 和 GPU 内存的完整加载状态,并将其持久化存储在高吞吐量的 Cloud Storage 中。当工作负载需要扩容时,新副本直接从该状态恢复,完全绕过初始化阶段。这种速度使平台团队能够从昂贵的超额配置策略转向按需自动扩缩容,在满足服务水平目标的同时显著降低空闲 GPU 成本。
优化 Agent 工作流与沙箱环境
在 Agent 工作流中,智能体通常将代码执行和计算机操作委托给隔离的沙箱。为隔离不可信的、由 LLM 生成的代码和命令,每个用户或离散工作流都需要一个独立沙箱。在这种场景下,启动延迟和空闲沙箱都会导致严重的资源过度配置与利用率不足。
Pod 快照可同时应对这两个挑战:
- 为改善启动延迟,可对初始 Agent 沙箱环境拍摄一次快照,后续用于快速初始化新沙箱。
- 为减少空闲沙箱,可在沙箱闲置时将其挂起并释放全部计算资源,待需要时近乎即时地恢复。
AI 照片编辑平台 Retake(由 Codeway 开发)在 GPU 工作负载上曾面临显著的性能瓶颈。Codeway 首席 DevOps 工程师 Ahmet Furkan Çomak 表示,Retake 最初为 A3 H100 GPU 上的编译产物构建了一套复杂的自定义缓存层,将启动时间降至 1 分钟,但带来了沉重的维护负担且限制了激进的自动扩缩容。采用 GKE Pod 快照替换该方案后,启动延迟被压缩至 8 秒,使其能够即时动态启动 H100 执行特定的微调或推理任务,并在完成后立即关闭,大幅降低了空闲 GPU 成本。
声明式配置与更广泛的适用场景
GKE Pod 快照通过 Pod 快照 CRD 进行声明式策略定义,开发者可指定需要拍摄快照的 Pod 以及数据存储位置,系统负责端到端的存储生命周期管理。
快照可以在工作负载的任何阶段触发:既可以在启动时使用工作负载信号触发,也可以在 Pod 生命周期中按需触发。此外,用户可设置快照保留策略以优化成本,选择从最近一次快照恢复的默认行为,或在部署新 Pod 时指定特定快照。
尽管主要应用场景集中在 AI 推理和 Agent 沙箱,但该功能并不局限于特定工作负载。任何具有较长初始化阶段的应用,例如复杂 Java 应用、游戏服务器或遗留单体架构,均可使用 Pod 快照加速启动。

