NVIDIA 超大规模与高性能计算副总裁 Ian Buck 在圣克拉拉会议中心举办的 AI Infra Summit 上介绍了 AI 工厂效率的最新进展。据 NVIDIA 称,今年参会人数超过 8000 人,去年为 3500 人。随着 Agentic AI 推动新工作负载对基础设施提出更高要求,衡量标准正从峰值性能转向经验证的每兆瓦 Agentic Token 产出。
电网灵活负载与功耗动态管理
Emerald AI 与 NVIDIA 联合硅谷电力公司(Silicon Valley Power)演示了商业 AI 工厂的灵活负载项目。该系统响应了来自电网的数百个需求信号,同时保护 AI 工作负载性能。Emerald AI 计划使用 NVIDIA DSX Flex 软件,根据实时电网信号和混合能源动态调整能耗,在预定义的工作负载层级内自动降低低优先级任务功率并在需要时恢复。
AI 云服务商 Lambda 发布了基于 NVIDIA Blackwell 服务器的 DSX MaxLPS 验证结果。MaxLPS 持续监控 GPU 与机架功耗并动态重新分配容量。Lambda 在原本分配给 16 个全功率节点的预算内运行了 19 个节点,集群 Token 吞吐量从约每秒 400 万提升至 500 万,每瓦性能提高 23%。NVIDIA 表示,对于下一代 Vera Rubin NVL72 AI 工厂,DSX MaxLPS 在合适的部署环境中可在相同兆瓦预算下支持最多增加 40% 的 GPU 容量,Token 吞吐量提升最高可达 35%,无需新增电力线路。
Groq 3 LPX 与 AgentX 基准测试
针对 Agentic AI 中链式推理和工具调用带来的延迟与上下文增长问题,NVIDIA 推出 Groq 3 LPX,为 Vera Rubin 平台增加确定性超低延迟推理能力。据 NVIDIA 公布的数据,在 2 万亿参数以上模型的长上下文场景中,Vera Rubin 与 Groq 3 LPX 组合平台每兆瓦 Token 吞吐量可达 GB200 NVL72 的 35 倍;在 100K 上下文的 Qwen 3.8 27B 工作负载上,Groq 3 LPX 达到每用户每秒 2529 个输出 Token。
SemiAnalysis AgentX 基准测试基于真实 Agentic 编程会话记录,保留上下文增长、工具调用延迟和子代理生成过程。NVIDIA 表示,Vera Rubin NVL72 在 DeepSeek V4 Pro 模型上的每兆瓦吞吐量可达 GB300 NVL72 的 30 倍,每百万 Token 成本降低最高 45 倍。该性能来自 NVL72 扩展域、第六代 NVLink 互连、第五代 Tensor Core 上的 NVFP4 精度以及包含 TensorRT LLM 和 Dynamo 的推理栈协同设计。NVIDIA 称 Vera Rubin 已全面量产并在生态系统中扩展。
Vera CPU 合作伙伴测试数据
多家初创公司在会上公布了基于 NVIDIA Vera CPU 的测试结果:
- Perplexity 在其 SPACE 安全沙盒平台上测得沙盒启动速度提升 1.9 倍。
- ClickHouse 在 ClickBench 分析数据库基准中称 Vera 是其迄今测量到的最快机器。
- DeepInfra 的多项基准显示编排步骤延迟降低 2.2 倍。
- Prime Intellect 发现 Vera CPU 在并行负载增加时仍能保持高带宽和低且一致的内存延迟。
- Redpanda 报告延迟降低 5.5 倍、吞吐量较其他 CPU 提高 73%。
- Starburst 查询吞吐量达其他 CPU 的 3 倍。
- Kinetica 分析查询性能较传统 CPU 快 2.7 倍。
Daytona 也在 Agentic 工作负载中使用了 Vera CPU,并表示获得了显著的执行性能提升。
NVLink 6 多层容错架构
当 AI 工厂扩展至数十万 GPU 规模时,瞬态错误、信号衰减和硬件故障成为不可避免的挑战。NVIDIA NVLink 6 采用多层弹性架构:物理层通过定制前向纠错、物理层重试和通用物理层恢复维持无损结构;网络层利用基于信用的流量控制、动态路由和链路重平衡将故障限制在局部,防止级联阻塞影响整体吞吐量。
此外,Amazon 的 Annapurna Labs 正与 NVIDIA 合作开发 NVHBM 定制高带宽内存技术,d-Matrix 则将 NVLink Fusion 平台与其 Raptor XPU 集成。Pinterest 正在使用 Blackwell 平台和 Dynamo 推理软件将对话式 AI 引入视觉发现功能。

