NVIDIA 于 Hot Chips 大会期间宣布,其面向智能体(Agentic AI)工作负载的机架级推理系统 NVIDIA Groq 3 LPX 已进入全面量产阶段。该系统作为 Vera Rubin NVL72 平台的扩展组件,旨在解决智能体系统在推理和工具调用过程中产生的解码延迟问题。
Groq 3 LPX 的推理架构与性能
Groq 3 LPX 被设计为与 Vera Rubin NVL72 协同工作的低延迟推理加速器。在这一架构中,Rubin GPU 负责大规模上下文处理,LPX 则专门加速对延迟敏感的解码任务。据 NVIDIA 介绍,这种 GPU 与 LPU 联合计算模型各层的方式,可消除传统架构中速度与吞吐量之间的权衡。
根据 Artificial Analysis 运行开源智能体模型 Gemma 4 31B 的基准测试数据,Groq 3 LPX 在 10 万 token 长上下文场景下实现了每秒 3,400 个输出 token,速度为最接近替代平台的 4 倍。一个机架级部署最多可包含 256 个通过芯片直连互连的 LP30 加速器。
Spectrum-X Multiplane 与 Scale-In 网络更新
在网络层面,NVIDIA 展示了 Spectrum-X Multiplane 技术。该技术将每台服务器的网络连接拆分为多个独立路径(平面),每个平面运行轻量级两层网络,从而避免增加第三网络层级带来的延迟和成本。NVIDIA 表示,该方案可将网络扩展至 51.2 万颗 GPU。在八平面拓扑中,若单一平面发生故障,网络仍可维持约 90% 的总带宽,硬件恢复速度比软件负载均衡快 11 倍。
配套的 SN6000 系列交换机基于 102.4Tb/s 的 Spectrum-6 以太网 ASIC,ConnectX-9 SuperNIC 支持每颗 GPU 最高 1,600Gb/s 的连接速率。Spectrum-XGS Ethernet 还可将多数据中心连接为单一超级工厂,使跨站点 NCCL 集合通信加速 1.9 倍。
NVIDIA 同时推出了 Scale-In 基础设施,由 BlueField-4 处理器和 DOCA 软件平台驱动,通过 Spectrum-X 以太网连接。Scale-In 将传统的南北向接入网络转化为统一的加速基础设施域,提供多租户网络、高性能存储访问、硅内安全和实时可观测性,且基础设施处理独立于主机计算资源。
NVLink Fusion 支持定制芯片接入
NVLink Fusion 允许超大规模云厂商和 AI 公司将定制 XPU 与 CPU 接入 NVIDIA 的扩展网络体系。该平台包含第六代 NVLink、NVLink Switch 以及用于 XPU 与 CPU 间低功耗连接的 NVLink-C2C。通过 MGX 生态系统,采用方可共享机架空间、网络、散热和供电系统,并根据供应情况调整 GPU 与 XPU 的比例。
合作伙伴采用进展
多家企业已宣布基于 Vera Rubin 平台的部署计划:
- Nebius 成为首家采用 Groq 3 LPX 的 AI 云服务商,将其加入 Nebius Token Factory 以提升推理性能。
- CoreWeave 已将 Spectrum-X Multiplane 投入生产环境,用于连接 Vera Rubin 机架。
- SpaceXAI 宣布将在下一代智能体 AI 架构中使用 NVIDIA Vera CPU,覆盖从地面数据中心到轨道卫星的场景,用于加速编排、工具调用、代码执行等 CPU 密集型任务。
