AI 工厂的经济性由每秒生成的 token 数、每瓦 token 产出、单 token 成本以及设备利用率和正常运行时间决定。这意味着 AI 基础设施需要作为完整工厂来设计和建造,而非简单堆叠独立加速器。对于正在开发定制 XPU 的超大规模云厂商和 AI 原生公司而言,挑战不仅在于芯片本身,还涉及横向与纵向扩展网络、机架级架构、生产级软件以及供应商生态。
NVIDIA 推出的 NVLink Fusion 旨在让定制 XPU 直接接入 NVIDIA 已有的 AI 基础设施平台,使开发者将精力集中在核心创新上,其余部分则复用成熟技术。
第六代 NVLink 提供的高速纵向扩展
运行万亿参数模型、混合专家(MoE)架构和 Agentic AI 等现代工作负载时,如果纵向扩展网络无法匹配计算速度,利用率会下降,单 token 成本随之上升。NVLink Fusion 将 XPU 纳入 NVIDIA NVLink 纵向扩展域。第六代 NVLink 可在 72 个 XPU 的域内提供高带宽、低延迟网络。据 NVIDIA 介绍,其端到端延迟比基于商用以太网的替代方案低 3 倍,数据包速率高出 10 倍。未来的 NVLink 路线图配置可支持最多 1,152 个加速器的域以及共封装光学器件。
此外,NVLink Fusion 包含 NVLink-C2C 接口,用于将 XPU 连接至 NVIDIA Vera CPU 或其他生态合作伙伴的 CPU,能效可达 PCIe 接口的 6 倍,有助于消除 Agentic 系统中控制与计算之间的瓶颈。
MGX 机架架构与供应链复用
将 XPU 从设计转化为数据中心部署涉及高速接口集成、网络方案验证、计算与交换托盘设计、机架散热与供电验证,以及复杂供应商管理。NVLink Fusion 采用者可复用 NVIDIA MGX 机架级架构,以及与 Vera Rubin NVL72 等系统相同的供应链。制造合作伙伴负责设计与集成,MGX 供应商提供机架、散热、供电及新兴 800 VDC 设计的构建模块。
QCT 暨广达电脑产品与解决方案负责人 Jack Luoh 表示,借助 Vera Rubin NVL72,生产线上的系统构建自动化率已接近 100%,而如果 XPU 采用 NVLink Fusion,这些投资大部分可以直接复用。
该平台保持垂直整合与水平开放。采用者可选择性地加入 NVIDIA Rubin GPU、Vera CPU、共封装光学交换机、ConnectX SuperNIC、BlueField DPU、Mission Control 软件,以及 Vera Rubin NVL72、Vera CPU Rack、LPX、STX 和 SPX 等整机架方案。
统一架构降低设施规划风险
AI 工厂的电力采购、设施设计、散热、机架布局和网络架构规划通常远早于最终加速器选型完成。如果数据中心锁定单一芯片,可能带来进度风险。不同工作负载可能偏好 XPU、GPU、CPU 或 LPU 等不同加速器,GPU 系统也可能与半定制系统并行用于训练、后训练、推理、检索和服务。
联发科数据中心与计算业务群企业高级副总裁兼总经理 Vince Hu 表示,客户可以先使用 NVIDIA GPU 部署机架级方案,再以不同节奏推进自有 XPU 的开发。NVLink Fusion 通过统一架构实现这一点:基于 XPU 和 GPU 的系统可以共享机架空间、网络、散热、供电和管理系统。运营商可以在确定最终芯片组合之前推进建设,并根据工作负载需求、芯片供应和业务优先级重新分配算力。
数字孪生与全液冷机架运维
NVLink Fusion 与 NVIDIA DSX AI 工厂参考架构对齐,对建筑、电力、散热、计算和网络进行协同设计。NVIDIA Omniverse DSX AI Factory Blueprint 提供数字孪生和开放参考设计,支持合作伙伴在部署前对吉瓦级 AI 工厂的设施与技术进行联合建模。
在机架层面,参考计算托盘采用 100% 液冷设计,无风扇、线缆或软管,并支持在不影响机架其余部分运行的情况下移除托盘。NVLink Switch 托盘同样为液冷设计,支持维护期间持续运行。
软件层面,NVIDIA NCCL 用于分布式工作负载,Dynamo 和 NIXL 用于解耦,Mission Control 用于集群管理、遥测和调试,帮助运营商将混合 AI 基础设施作为协调系统运行。
