2026年9月17日星期四
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

CoreWeave已成功上线多机架英伟达Vera Rubin NVL72集群,并在Coreweave AI Object Storage平台推出了新功能。

证明了Vera Rubin NVL72在超大规模下的可扩展性,为智能体AI工作流提供了实现快速迭代所需的分布式存储与计算密度。
行业媒体Slicast · 2026年9月16日 UTC 13:20 · 美国 · 来源: marketscreener.com
重要度 90

CoreWeave, Inc. 宣布在 CoreWeave Cloud 上运营部署多机架 NVIDIA Vera Rubin NVL72 集群,将数百个 NVIDIA Rubin GPU 集成到一个专为代理式 AI(agentic AI)设计的横向扩展架构中。该公司还推出了 CoreWeave AI Object Storage 的两大新功能——跨区域写入加速和全新的归档层(Archive tier),确保这些工作负载所依赖的数据与 GPU 保持紧密耦合。这些多机架 Vera Rubin NVL72 配置使得训练和推理任务能够同时跨越数百个 Rubin GPU 运行。

单个 NVIDIA Vera Rubin NVL72 机架将 72 个 Rubin GPU 与 36 个 Vera CPU 配对,并配备 NVIDIA NVLink 6、NVIDIA ConnectX-9 SuperNICs 以及 NVIDIA BlueField-4 DPUs。为支持分布式工作负载,CoreWeave 引入了跨区域写入加速功能,消除了跨多个地理区域操作时的延迟问题。当作业在本地写入数据时,CoreWeave 会在后台异步将其复制到次要区域。这确保了代理的中间状态、检索到的上下文和输出能够以推理速度推进。

多机架 Vera Rubin NVL72 部署利用 NVIDIA Spectrum-X 以太网网络,将多个机架中的数百个加速器统一为一个单一的横向扩展集群。该架构提供了训练更大模型、处理更复杂推理工作负载以及大规模执行强化学习的能力。实现这一目标需要在每一层进行精确的工程整合——包括计算、网络、存储、冷却、电源、固件和软件——使其作为一个单一协调的系统运作。CoreWeave 通过自动化机架生命周期控制来编排这种集成。

机架抵达后需要进行物理连接和严格验证。CoreWeave Mission Control 通过机架生命周期控制器(Rack LifeCycle Controller)自动化设置流程,该控制器协调硬件检测、固件更新、验证、电力分配和热管理。在此框架内,Racky 负责机架级控制,而 Valvey 执行冷却操作。性能验证涵盖从单个组件到全系统基准测试的各个层面。CoreWeave 结合 NVIDIA 现场诊断与全面的整架工作负载测试,仔细地将每项指标与既定基线进行比较。凭借多年的实际运营经验,公司在任何机架投入生产前确保其就绪状态。

只有满足这些严格系统级阈值的机架才能进入生产阶段,从而保证最佳的 GPU 性能。网络扩展与计算增长紧密对齐:每个 Rubin GPU 配备两个 NVIDIA ConnectX-9 SuperNICs,在多平面、多轨道路径上为每个 GPU 提供 1.6 Tb/s 的横向扩展连接能力。这种无阻塞的网络结构支持每条轨道约 128,000 个 GPU。此外,模块化拓扑允许在不重新设计网络结构的情况下集成额外机架以实现扩展。

CoreWeave AI Object Storage LOTA(本地对象传输加速器)通过在每台 CoreWeave Kubernetes Service 节点上实施托管缓存,进一步优化了 AI 工作负载的数据邻近性。LOTA 提供的读取速度与本地 NVMe 驱动器相当,与传统存储集群相比延迟降低了 8 倍。它为每个 GPU 提供高达 7 GB/s 的吞吐量,并随着集群扩展线性扩展,有效消除了网络瓶颈并加速了 AI 训练周期。

新推出的跨区域写入功能使客户能够在两个区域之间分布工作负载,同时规避跨区域写入延迟并降低长期存储成本。检查点现在在拥有可用计算的区域内本地写入,允许数据以本地延迟被摄入,同时异步迁移到次要远程区域。此功能最大限度地减少了训练暂停,使 CKS 集群能够保持连续运行。由于应用程序与单个逻辑桶交互,因此无需修改代码,且无论源自哪个区域,权限和保留策略均保持一致。这通过消除对关键 AI 工作负载手动传输或复制数据的需求,简化了运营流程。

归档层是一种专为不常访问的数据设计的成本优化存储类,具有零费用的检索、提前删除或标准读取费用。CoreWeave 继续提供行业领先的性能,这在 MLPerf 基准测试结果中得到了证明,其在推理和训练方面均创下纪录。它仍然是唯一在半分析公司(SemiAnalysis)ClusterMAX 1.0 和 2.0 中均获得最高白金排名的 AI 云提供商,并在 Artificial Analysis 进行的独立基准测试中,凭借 Moonshot AI 的 Kimi K2.6 和 Kimi K2.7 Code 获得了推理速度和性价比的第一名。

阅读原文
CoreWeave已成功上线多机架英伟达Vera Rubin… · Slicast