NVIDIA Blackwell平台在MLPerf Training 6.0全项基准中获胜新GB300交付1.6倍速度提升
NVIDIA宣布在MLPerf Training 6.0中取得压倒性成果,这是最新的经同行评审的AI训练性能行业基准。NVIDIA Blackwell平台在所有类别中领先,是唯一在全部七个基准上提交结果的平台,在每个基准上都实现了最快的训练时间。
该基准轮次引入了两个新的混合专家预训练工作负载,反映了MoE架构日益增长的重要性:DeepSeek-V3 671B和GPT-OSS-20B。大规模MoE训练需要全对全通信,将令牌跨GPU路由到正确的专家子网络,NVIDIA通过NVLink的带宽优势解决了这一挑战。
NVIDIA在GB200 NVL72和GB300 NVL72机架级系统上提交了结果,其中第五代NVLink交换机将72个GPU连接到统一的计算和内存池中。GB300 NVL72的训练速度比GB200 NVL72快高达1.6倍,这是由更高的计算密度、NVFP4精度训练、扩展的内存容量和增加的功率上限所驱动的。
NVIDIA实现了破纪录的规模:在GB200 NVL72系统上为DeepSeek-V3 671B配置8,192个GPU,这是迄今为止最大规模的Blackwell基础提交,以及在Llama 3.1 405B上配置5,120个GPU。该公司还强调了用于预训练其5500亿参数Nemotron 3 Ultra模型的NVFP4训练方法。
十九个生态系统合作伙伴参与其中,包括Microsoft Azure、Google Cloud、CoreWeave、Dell Technologies、Fujitsu等。客户案例展示了现实世界的影响:Cohere在GB200上实现了3倍更快的训练速度,Thinking Machines Lab在GB300上看到了2倍的速度提升,Nebius托管的Higgsfield将训练时间减少了30%,同时服务2200万用户,每天生成600多万件AI内容。Midjourney在Blackwell集群上训练了其v8图像生成模型,并正在为即将推出的项目扩展Blackwell Ultra。