NVIDIA报告DSX AI工厂平台的早期生产结果,展示了扩展部署的能力。
英伟达于2026年9月15日发布了其DSX AI工厂平台的初步生产结果,包括Lambda的一项验证,该验证在固定功率预算内实现了24%更高的令牌吞吐量,以及在其Eos AI工厂运行的电网需求响应部署。这些公告与AI基础设施峰会在圣克拉拉的开幕相吻合,该峰会于9月15日至17日在圣克拉拉会议中心举行,预计参加人数超过8,000人。英伟达超大规模和高性能计算副总裁伊恩·巴克以AI工厂效率为核心发表了题为《推进代理AI时代的基础设施》的主题演讲,Lambda的验证结果也在同一天发布。
Lambda的成果代表了DSX MaxLPS在英伟达HGX B200 GPU服务器上的首次验证。这家GPU云服务商为超过10,000位客户提供服务,从AI原生初创公司到超大规模服务商应有尽有,在一个五机架、19节点的集群上运行了该软件。通过在与16个节点全功率运行相同的功率预算内运行19个节点,Lambda实现了24%的集群范围令牌吞吐量提升,从大约400万令牌每秒上升到500万令牌每秒,同时每瓦性能提高了23%。Lambda云服务总裁戴夫·沃德表示:"通过我们的概念验证,我们相信我们已经突破了固定功率预算的限制。英伟达DSX MaxLPS为回收搁浅容量并将其转化为实际使用铺平了道路,在相同占地面积内实现了显著更高的计算密度。"
DSX MaxLPS监控GPU和机架级功率消耗,并根据工作负载类型在节点间重新分配可用功率裕度,恢复静态供应遗留的容量。训练和推理对功率的需求不同;该软件可在同时运行两者的AI工厂中优化分配。根据英伟达的预测,在合适的部署环境中,DSX MaxLPS可在相同的兆瓦功率预算内为下一代Vera Rubin NVL72 AI工厂提升高达40%的GPU容量。
英伟达在2026年5月31日的台北GTC大会上发布了DSX平台,将开源软件库、API、参考设计、英伟达计算平台和合作伙伴技术整合为一个AI工厂设计、部署和运维的单一平台。该套件包含DSX参考设计、DSX Sim、DSX OS、DSX MaxLPS、DSX Flex和DSX Exchange,涵盖验证的架构、模拟、开放模块化运维软件、功率管理、电网信号协调和安全数据交换。云合作伙伴CoreWeave、Crusoe、Firmus、IREN、Lambda、Nebius、Nscale和Yotta Data Services已在部署DSX Sim、DSX MaxLPS和DSX OS,而包括戴尔科技、HPE、联想和超微在内的制造商正在构建支持DSX的系统。英伟达创始人兼首席执行官黄仁勋直接阐述了功率约束:"一个吉瓦工厂永远无法成为两个吉瓦工厂。"DSX为基础设施建设者提供了一份完整的手册来模拟、验证和运营AI工厂。
9月15日的发文表明,DSX正在将800 VDC功率架构纳入其参考设计,目的是降低转换复杂性、提高功率传输效率并支持更密集的加速计算机架。运行直接液体冷却的GB200 NVL72机架产生大约120 kW的热量,这些热量必须在功率到达计算部分之前被移除。英伟达定位DSX Sim用于第一个机架安装之前,DSX OS和DSX Exchange用于工厂运行时,以及DSX参考设计作为经过验证的起始架构。
在8月的一个傍晚,当温度和空调负荷激增时,圣克拉拉市政公用事业公司硅谷电力向一个AI工厂发送了一个信号,要求调整功率消耗。翠宝AI的Conductor平台执行了预定义的工作负载层次结构:优先级最低的任务让步,高优先级推理继续运行,功率从4兆瓦自动下降到3兆瓦,无需操作员参与。翠宝AI创始人兼首席执行官瓦伦·西瓦拉姆在Zoom上见证了这一时刻,约有40名观察者参与,包括他的旧金山团队、数据中心工程师和公用事业工作人员。他的产品主管曼西·沙阿将这一时刻比作SpaceX火箭发射。自那以后,硅谷电力向该工厂发送了超过200个需求信号,Conductor每次都在一分钟内做出响应。
该设施是英伟达在圣克拉拉的Eos AI工厂,作为硅谷电力灵活负载互联计划的参与者运营——这是第一个旨在将AI工厂视为可调度资源的商业电网公用事业计划。圣克拉拉装置早于DSX Flex本身推出;翠宝AI Conductor正在随着平台成熟而集成到DSX Flex中。硅谷电力和翠宝AI于2026年4月21日宣布了该试点,第一个地点在运行英伟达AI工作负载的先进GPU数据中心以商业、多兆瓦级规模运营。硅谷电力电力公用事业主任尼科·普罗科斯表示,该试点将评估保护可靠性和经济性的实用工具,同时支持未来负载增长的灵活规划。
首个专用DSX Flex商业部署将是在英伟达位于弗吉尼亚州曼纳萨斯的AI工厂研究中心的96兆瓦Vera Rubin AI工厂。翠宝AI表示曼纳萨斯项目计划与数字房产、EPRI和PJM互联组织合作,计划于2026年晚些时候推出。