CoreWeave已在Livingston设施成功上线多机架NVIDIA Vera Rubin NVL72集群。
新泽西州利文斯顿,2026年9月16日 —— CoreWeave, Inc. 今日宣布在 CoreWeave Cloud 上成功部署多机架 NVIDIA Vera Rubin NVL72 系统,在一个专为智能体 AI(agentic AI)优化的扩展集群中部署了数百个 NVIDIA Rubin GPU。该公司还推出了 CoreWeave AI Object Storage 的两大新功能:跨区域写入加速和全新的归档层(Archive tier)。这些功能将关键数据保留在靠近 GPU 的位置,确保持续的生产力并加速 AI 开发循环。
多机架 Vera Rubin NVL72 集群使训练和推理任务能够同时跨越数百个 Rubin GPU 运行。这种架构对于对数据访问延迟高度敏感的多步骤智能体工作负载尤为重要;延迟会在重复的模型调用和工具交互中累积。跨区域写入加速消除了即使在多个地理区域操作时的等待时间。通过本地写入数据并在后台将其复制到另一个区域,智能体的中间状态、检索到的上下文和输出能够以推理的速度移动。GPU 不会停滞,开发循环也不会中断。
“CoreWeave 是首家验证并上线 Vera Rubin NVL72 的 AI 云提供商,证明了这种先进的机架级架构可以作为可靠的高性能云服务运行,”CoreWeave 产品与工程执行副总裁 Chen Goldberg 表示,“通过多机架 Vera Rubin,我们将数百个 Rubin GPU 连接为一个单一的扩展集群。对于构建智能体 AI 的客户而言,这意味着更大的规模、更快的迭代以及更高的生产力,因为模型和智能体在不断学习和改进。”
使用多机架 NVIDIA Vera Rubin NVL72 扩展智能体 AI 需要将硬件统一为一个连贯的系统。单个 NVIDIA Vera Rubin NVL72 机架将 72 个 Rubin GPU 与 36 个 Vera CPU、NVIDIA NVLink 6、ConnectX-9 SuperNICs 和 BlueField-4 DPUs 配对。通过多机架部署,CoreWeave 使用 NVIDIA Spectrum-X 以太网网络将包含数百个加速器的机架统一为一个单一的扩展集群。此配置提供了训练更大模型、服务更苛刻的推理工作负载以及大规模运行强化学习的能力。实现这一目标需要在每一层进行精确的工程整合——包括计算、网络、存储、冷却、电源、固件和软件——使其作为一个协调的系统运行。
CoreWeave 通过三种关键方法将多个机架作为统一系统上线:自动化机架生命周期控制、从组件到系统的性能验证,以及与 GPU 同步扩展网络。机架作为需要连接和验证的硬件到达,但 CoreWeave Mission Control 通过机架生命周期控制器(Rack LifeCycle Controller)自动化设置流程,协调硬件检测、固件更新、验证、供电和冷却。Racky 负责机架控制,而 Valvey 执行冷却动作。性能验证结合了 NVIDIA 现场诊断和全机架工作负载测试,将每项结果与既定基线进行比较。凭借多年的实际经验,该公司确保只有符合严格系统级性能阈值的机架才能投入生产,从而保证最佳的 GPU 性能。网络扩展通过为每个 Rubin GPU 配备两个 NVIDIA Connect X-9 SuperNICs 来实现,在多平面、多轨道路径上为每个 GPU 提供 1.6 Tb/s 的连接能力。这支持在非阻塞结构中每条轨道约 128,000 个 GPU,允许在不重新设计底层结构的情况下集成额外的机架。
AI 性能取决于数据移动速度能否跟上计算扩展的速度。CoreWeave AI Object Storage Local Object Transport Accelerator (LOTA) 通过在每个 CoreWeave Kubernetes Service 节点上进行托管缓存,将数据拉近 AI 工作负载。这提供了与本地 NVMe 驱动器相匹配的读取速度,并将延迟降低了传统存储集群的 8 倍。LOTA 为每个 GPU 提供高达 7 GB/s 的吞吐量,并随着集群扩展线性增长,有效消除了网络瓶颈并加速 AI 训练。
“我们的数据集跨越多个区域,我们承担不起因跨区域检索延迟而导致训练计划被动的风险,”Cohere 内部基础设施总监 Cécile Robert-Michon 表示,“CoreWeave AI Object Storage 为我们提供了跨区域的统一数据集足迹,读取缓存在本地,因此没有任何内容在网络等待。这是在围绕数据规划与直接训练之间的区别。”
新功能现在允许客户在两个区域运行工作负载,同时避免跨区域写入延迟并降低长期存储成本。检查点现在可以在区域内本地写入,最接近可用的计算资源。数据以本地延迟写入,同时在后台迁移到第二个远程区域。这对于计算分布在多个区域但数据集中在一处的组织特别有益,特别是那些在训练作业期间写入检查点的组织。跨区域写入功能最大限度地减少了停机时间,并使 CKS 集群能够不间断地继续训练。由于应用程序与单个存储桶交互,因此无需更改代码,无论源区域如何,权限和保留规则的功能都相同。这通过消除为关键 AI 工作负载手动复制或移动数据的需求,简化了运营。
保留关键数据更长时间也变得更加具有成本效益。团队经常删除有价值的数据——例如接近成功的运行的检查点、重现结果所需的数据集,或者可能在几个月后被引用的模型版本。新的归档层以较低成本的存储满足了这一需求,专门用于归档数据。它不收取检索、提前删除或直接从归档层读取的费用。
CoreWeave 始终提供行业领先的性能,这在 MLPerf 基准测试结果中得到了证明,其在推理和训练方面均打破了记录。该公司是唯一一家在 SemiAnalysis ClusterMAX 1.0 和 2.0 中获得最高铂金排名的 AI 云,并在 Artificial Analysis 进行的独立推理基准测试中,凭借 Moonshot AI 的 Kimi K2.6 和 Kimi K2.7 Code 获得了推理速度和性价比的第一名。
关于 CoreWeave
CoreWeave 是 AI 的基础云。由先驱为先驱打造,CoreWeave 提供了一整套技术、工具和团队平台,使创新者能够以创新的步伐前进,自信地构建和扩展 AI。CoreWeave 受到领先 AI 实验室、初创企业和全球企业的信赖,通过结合卓越的基础设施性能和深厚的技术专业知识,成为突破创新的倍增器。CoreWeave 成立于 2017 年,于 2025 年 3 月在纳斯达克完成公开上市(股票代码:CRWV)。欲了解更多信息,请访问 www.coreweave.com。