英伟达Vera Rubin计算架构重新定义GPU设计的效率和规模。
代理型AI正在推动关键技术供应商重新思考运行快速扩展自主系统所需的计算架构。6月,CoreWeave Inc.和Nvidia Corp.宣布了Nvidia Vera Rubin NVL72在CoreWeave Cloud上的首次启动和验证——这是一种根本不同的基础设施方法,旨在提供一个工作负载能够持续推理、以不可预测方式扩展并全天候生产运行的环境。
该系统包含72个Rubin GPU、36个Vera CPU和单个机架内260 TB/秒的NVLink 6带宽——据CoreWeave产品和工程执行副总裁Chen Goldberg介绍,这超过了整个全球互联网使用的数据带宽。"世界正在从向AI提问转变为让AI持续大规模完成任务而不中断,"Goldberg表示。"代理正在编写代码、运行实验并执行多步推理循环。这正是Vera Rubin的设计目的。"
Vera Rubin NVL72设计用于支持大规模推理、持久推理会话和需要超出原始GPU密度的生产AI工作负载。Nvidia的先进芯片架构使CoreWeave能够提供多种系统解决方案,包括液体冷却、机架控制、网络和安全多租户操作。
CoreWeave的液体冷却解决方案Valvey实时监控流速、温度、压力和泄漏检测。"我们可以在亚秒级时间尺度控制单个阀门,"Goldberg解释道。"如果检测到任何泄漏,我们会立即采取行动。"
一款新的统一机架控制设备Racky将电源、冷却和环保传感器汇总到标准化管理界面。据CoreWeave首席技术官Peter Salanki介绍,这允许每个Vera Rubin机架作为云资源而非定制一次性构建进行管理。"它收集来自GPU本身的遥测数据、来自电源系统的遥测数据、泄漏传感器和建筑管理系统的数据,将所有这些整合在一起,"Salanki表示。
在单个机架中配置多个CPU和GPU时,通信变得尤为重要。此次公告包括多路由和多层面网络,支持Nvidia Quantum-X800 InfiniBand以及Nvidia Spectrum-X Ethernet和RDMA over Converged Ethernet(RoCE)。"这个机架级系统的巧妙之处在于,它允许您扩展内存、计算和所有的架构,使GPU 1可以与GPU 72以完全相同的速度通信,"Nvidia产品负责人Dion Harris表示。"这为您提供了一种非常一致、可靠的方式来扩展整个机架的工作负载。"
CoreWeave利用Nvidia BlueField-4 DPU(数据处理单元)实现安全的多租户AI云操作,提供更快的数据访问和更低的延迟。BlueField-4允许租户在整个Vera Rubin计算平台上运行工作负载,同时保持控制和安全。"我们将所有这些整合在一起,并通过验证流程确保Vera CPU与Rubin芯片、ConnectX NIC和BlueField-4 DPU兼容,"CoreWeave产品总监Harshdeep Banwait表示。
为了实现机架级平台,CoreWeave从其合作伙伴生态中汲取资源。Dell通过其高性能PowerEdge XE9812服务器提供了架构支撑。"随着AI模型以万亿参数规模扩展,上下文窗口包含数百万个令牌,计算密度的重要性将不断增长,"Dell高级副总裁兼首席技术官Ihab Tarazi表示。"所有真正重要的新模型都是万亿参数模型。它们不再适合8路GPU标准服务器。它们真正需要NVL72 GPU系统。"
CoreWeave的验证凸显了在生产环境中支持代理型AI推理性能的必要性。推理市场近年来呈指数增长,为Vera Rubin以前所未有的成本和性能水平支持培训和大规模推理提供了机遇。"全新的工作负载正在随之而生,"CoreWeave产品高级副总裁Corey Sanders表示。
这些新工作负载由代理型AI采用的增加所驱动,CoreWeave已采取一系列措施建设支持该技术的云基础设施。这包括在2025年收购AI模型开发公司Weights & Biases Inc.。此后,新的Weights & Biases代理型AI工具已被添加到CoreWeave平台。"第一次,Weights & Biases内部有一个代理帮助AI用户训练模型和构建AI应用程序,"CoreWeave的Weights & Biases创始人兼首席技术官Shawn Lewis表示。"W&B Launch将Weights & Biases工具包连接回基础设施,允许代理启动实验到CoreWeave基础设施,而无需人工干预。"