英伟达Grace Blackwell Ultra超级芯片系统在GPU云提供商CoreWeave首次生产部署。
戴尔向领先的AI云服务提供商CoreWeave交付了业界首批基于英伟达GB300 NVL72平台的系统。CoreWeave已与其数据中心托管提供商Switch部署了基于Blackwell Ultra的集群。戴尔与CoreWeave的初期推出涉及配备72个英伟达Blackwell Ultra GPU、36个基于Arm的72核Grace CPU和36个BlueField DPU的戴尔集成机架(每个机架)。
每个GB300 NVL72机架可提供1.1 ExaFLOPS的密集FP4推理性能和0.36 ExaFLOPS的FP8训练性能,相比GB200 NVL性能提升50%。每个GB300 NVL72机架配备20 TB的HBM3E和总共40 TB的RAM。这一新型机架级解决方案采用英伟达的Quantum-X800 InfiniBand交换机和ConnectX-8 SuperNIC进行横向扩展连接,速度最高可达14.4 GB/s,是之前的两倍。这些为最大化训练和推理性能而设计的密集型系统因单个GPU高达1,400W的极端功耗而采用液冷技术。
戴尔表示:"英伟达GB300驱动解决方案的交付不仅仅是一个里程碑。这反映了我们的客户和合作伙伴对我们专业知识的持续信任。通过在一个屋檐下无缝集成计算、网络和存储,并通过集成和部署服务进行微调,我们帮助客户以前所未有的速度和规模向前发展。"戴尔指出,这些机架级系统已组装和测试,设计用于快速安装和部署以供生产使用。这是戴尔和CoreWeave第二次在业界之前部署英伟达最新AI GPU平台。
该部署将使CoreWeave能够增强其云平台,以处理更先进的大语言模型训练、推理过程和推理。随着CoreWeave采用更多基于GB300 NVL72的机架,提供给其客户的总性能将增加。戴尔和CoreWeave在部署首批GB200 NVL72机器约七个月后部署了GB300 NVL72机架,这表明云服务提供商对英伟达更高性能的Blackwell Ultra系统需求强劲。