Meta和Oracle采用Nvidia Spectrum-X以太网连接其超大规模AI工厂,在最大GPU集群中标准化Nvidia网络产品。
在开放计算项目峰会上,Nvidia宣布Meta Platforms Inc.和Oracle Corp.将采用其Spectrum-X以太网络平台,这是一个为AI工作负载量身定制的系统,可将数百万个图形处理器连接成一个统一的架构。与为AI改造的传统以太网解决方案不同,Spectrum-X从头开始工程设计,以处理大规模AI工作负载的通信模式——大规模全对全GPU同步、低延迟消息传递和易拥塞流。该公司声称相比常规以太网,其AI通信的网络性能高1.6倍,这一飞跃直接转化为更少的GPU空闲时间和更高的训练和推理吞吐量。
Meta将Spectrum-X集成到其Facebook开放交换系统(FBOSS)和Minipack3N交换机中,这标志着开放网络的一个关键时刻。Meta网络工程副总裁Gaya Nagarajan表示:"Meta的下一代AI基础设施需要行业前所未有规模的开放且高效的网络。"通过将Spectrum-X以太网与FBOSS相结合,Meta将开放的、可编程的控制平面与AI优化的物理基础设施相配对,以实现可预测的、无拥塞的性能,同时保持其分解网络模型的灵活性。
Oracle云基础设施采取了一种侧重于规模的补充方法。Oracle正在使用Spectrum-X来构建由即将推出的Nvidia Vera Rubin架构驱动的千亿级AI工厂。Oracle云基础设施执行副总裁Mahesh Thiagarajan表示:"通过采用Spectrum-X以太网,我们可以以突破性的效率互联数百万个GPU。"Spectrum-X的跨规模功能(SpectrumXGS)使Oracle能够将多个数据中心甚至跨国的集群连接到一个逻辑AI系统中。
Spectrum-X的架构将提供51.2 Tbps吞吐量的Spectrum4以太网交换机与BlueField-3 SuperNIC和DPU相结合,这些组件卸载并保护网络服务,使GPU可以专注于计算。它支持400 Gbps RDMA over converged Ethernet,用于更快的GPU间通信和安全的多租户环境。作为Nvidia全栈战略的一部分,Spectrum-X与DOCA、Cumulus Linux、Pure SONiC、NetQ、AI Enterprise和AI Workbench集成,用于开发、部署和运营可视性。
网络已悄然成为AI时代的事实上的操作系统。行业共识正在围绕一个新现实形成:AI的性能前沿已从计算转向连接。网络现在扮演了操作系统曾经扮演的整合角色——跨云、边缘和数据中心编排、调度和同步分布式资源。