据 OpenRouter 数据,代理式 AI(Agentic AI)工作负载消耗的 token 数量是简单聊天请求的 15 倍。当 AI Agent 执行投资研究等任务时,会持续查询数据库、调用子代理进行对比分析并综合结果,上下文在多步推理中不断累积,使长上下文处理能力成为性能关键。
实测性能与能效表现
NVIDIA 公布的早期测量数据显示,Vera Rubin NVL72 系统在代理式工作负载上的每兆瓦吞吐量可达 GB300 NVL72 的 30 倍。该数据使用 SemiAnalysis AgentX 工作负载测得,该基准保留了真实代理式编程会话中的上下文增长、工具调用和子代理生成过程。对于电力受限的 AI 工厂,这意味着在相同能耗下可处理 30 倍的代理式工作量。
在成本层面,Vera Rubin NVL72 每百万 token 成本可比 GB300 NVL72 降低至多 35 倍。作为参照,GB300 NVL72 在 DeepSeek V4 Pro 模型上的每兆瓦吞吐量已达到 Hopper 架构的 15 倍。上述 Vera Rubin NVL72 测试结果目前尚待 SemiAnalysis 审核,且未包含 Vera CPU 在工具调用方面的性能表现。NVIDIA 表示,随着软件持续优化,Vera Rubin NVL72 与 GB300 NVL72 的性能均将继续提升。
此外,NVIDIA DSX MaxLPS 技术可在 GPU、机架和工作负载层面管理功耗,在相同兆瓦预算内支持多部署 40% 的 GPU。
面向代理式规模的协同设计
为应对代理式 AI 中数十万级输入 token 的累积特征,Vera Rubin NVL72 采用多层软硬件协同设计:
- 分离式服务将上下文处理(prefill)与响应生成(decode)解耦,各自独立扩展。
- 速率匹配同步 prefill GPU 与 decode GPU 的 token 生成速度。
- 大规模专家并行在混合专家模型中将专家子网络分布到扩展 GPU 域。
- 分布式 KV 缓存跨 GPU 域扩展内存,并将低活跃上下文卸载至主机和存储,避免重复计算。
- KV 感知路由将请求定向至已缓存相关上下文的 GPU。
- MegaMoE 等融合 CUDA 内核将多项计算与 GPU 间通信合并为单次执行。
硬件方面,Rubin GPU 配备增强型第五代 Tensor Core 和第三代 Transformer Engine;NVFP4 量化将模型权重压缩至 4-bit 精度以降低显存占用。第六代 NVLink 互连与 NVLink Switch 的数据包速率达到通用以太网的 10 倍,延迟降至三分之一。
Vera Rubin 平台采用七芯片架构,除 Rubin GPU 外还包括 Vera CPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX 和 ConnectX-9 SuperNIC。NVIDIA 表示,Vera Rubin 已进入全面量产阶段。
