今年八月一个高温傍晚,硅谷电力公司(Silicon Valley Power)向一座 AI 工厂发出调整用电量的信号。NVIDIA 合作伙伴 Emerald AI 的 Conductor 平台接收到电网状态信息后,自动按预定义的工作负载优先级重新调度计算任务:低优先级作业让出资源,高优先级推理服务继续运行,工厂功耗在一分钟内从四兆瓦降至三兆瓦,全程无需人工干预。
据 Emerald AI 创始人 Varun Sivaram 介绍,这是该平台首次在数千块 NVIDIA GPU 上部署。此后,硅谷电力已向该工厂发送超过 200 次需求信号,均成功执行。这座位于圣克拉拉的工厂正参与硅谷电力的 Flexible Load Interconnect Program——首个将 AI 工厂作为可调度资源对待的商业电网项目。
固定功率预算下的吞吐量提升
在同日举行的 AI Infra Summit 上,NVIDIA 超大规模与高性能计算副总裁 Ian Buck 将 AI 工厂效率作为基础设施主题演讲的核心。云服务商 Lambda 公布了 DSX MaxLPS 在 NVIDIA HGX B200 GPU 服务器上的首次验证结果。
Lambda 在一个五机架、19 节点的集群上运行该软件。DSX MaxLPS 监控 GPU 和机架级功耗,并根据训练与推理不同的用电特征在节点间重新分配余量。测试显示,在与 16 个节点满载运行相同的功率预算内,19 个节点的集群 Token 吞吐量从约每秒 400 万提升至 500 万,增幅 24%,每瓦性能提升 23%。
Lambda 云服务总裁 Dave Ward 表示,这一概念验证意味着可以突破固定功率预算的限制,回收原本闲置的容量。根据 NVIDIA 的预测,在合适的部署环境中,DSX MaxLPS 可使下一代 Vera Rubin NVL72 AI 工厂在同一兆瓦预算下支持最多 40% 的额外 GPU 容量。
DSX Flex 与电网协同
圣克拉拉工厂运行的 Emerald AI Conductor 并非 DSX Flex 的正式安装,但验证了该概念在商业规模上的可行性。随着平台成熟,Conductor 将集成至 DSX Flex。
首个专门的 DSX Flex 商业部署将落地弗吉尼亚州马纳萨斯,为一座 96 兆瓦的 Vera Rubin AI 工厂提供支持。该设施位于 NVIDIA AI 工厂研究中心,建立在此前跨越两大洲的五次演示基础之上。
800V 直流供电架构
为支撑更高密度的加速计算机架,NVIDIA 正在将 800V 直流供电架构纳入 DSX 参考设计。随着 AI 工厂规模扩大,传统低压供电路径会增加转换复杂度和配电限制,800V 架构旨在减少转换环节、提高供电效率。
整厂优化逻辑
NVIDIA 创始人兼 CEO 黄仁勋曾表示,“一吉瓦的工厂永远不会变成两吉瓦的工厂”。当系统触及物理上限时,单点优化空间有限——更快的 GPU 可能受限于网络等待,不当的资源配置会使电力闲置,GB200 NVL72 机架的直接液冷系统需处理约 120 千瓦热量后才能将电力用于计算。
NVIDIA DSX 平台覆盖网络、散热、水效和设施设计,提供建设前使用的 DSX Sim 仿真工具、运行阶段的 DSX OS 与 DSX Exchange,以及经验证的 DSX 参考设计,使建设者无需从零开始规划。其核心指标是每消耗一兆瓦电力能产出多少有效计算工作。

