2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达在Hot Chips 2026上详细展示了其BlueField-4 DPU的重大升级及规模缩减网络架构。

这推动了数据中心解耦架构的演进,直接影响超大规模企业和新兴云厂商如何为下一代AI训练集群互联GPU节点。
行业媒体Slicast · 2026年8月26日 · 全球 · 来源: ServeTheHome
重要度 85

Hot Chips 2026 大会上,英伟达(NVIDIA)展示了 BlueField-4 处理器,这是其数据中心处理单元(DPU)的第四代产品。该公司将 DPU 定位为更广泛论点中的关键组成部分,该论点认为代理式 AI(agentic AI)代表了迄今为止最复杂的计算工作负载。通过集成 CPU、GPU 和网络基础设施,BlueField-4 使代理能够高效执行观察、推理和行动循环。

BlueField-4 运行在英伟达的 Vera Rubin 平台内,该公司将其描述为一个跨越五个机架中七款芯片的全栈 AI 工厂。除了 Vera CPU 和 Spectrum-6 交换机外,DPU 作为协同设计元素直接嵌入到每个 Vera Rubin 系统中。这标志着战略上的转变:从将 DPU 视为可选的 PCIe 扩展卡,转变为使其成为架构的基础层。随着超大规模运营商以巨大规模部署机器,将 DPU 直接嵌入英伟达 AI 工厂设计与行业对集成数据中心基础设施的需求相一致。

英伟达的网络策略分为不同的层级。Scale-up(向上扩展)由 NVLink 管理,允许多个 GPU 在租户内部作为一个单一系统运行,确保流量到达更广泛的网络之前节点内的 GPU 利用率持续最大化。Scale-out(向外扩展)利用 ConnectX 和 Spectrum-X 交换机将数据中心统一为单个计算单元。Scale-in(向内扩展)处理主机与更广泛数据中心之间的流量,通常涉及多个租户和应用。最后,Storage-Scale(存储级扩展)解决 AI 工作负载的高性能数据访问问题。

为解决 Scale-in 的性能问题,英伟达推出了 BlueField-4 Spectrum-X Scale-in 网络,这是一个针对混合代理工作负载优化的端到端解决方案。初步基准测试突出了存储访问的改进:与标准现成以太网相比,Spectrum-X 以太网提供 5 GB 文件 1.5 倍、10 GB 文件 1.4 倍以及 50 GB 文件 1.3 倍的更快访问速度。

现代 DPU 需要强大的网络加速与稳健的计算能力相结合。BlueField-4 结合了 ConnectX-9 级网络与 Grace CPU 级核心,以处理控制平面任务、加密和高吞吐量存储 I/O。这与早期为通用计算设计的云 DPU 形成鲜明对比,后者将 DPU 视为可替换的附加组件。代理式 AI 要求 fundamentally 不同的基础设施层级,特别是在带宽方面。虽然传统云 DPU 的运行速度在 200 Gb/s 范围内,但专注于 AI 的 BlueField-4 可提供 7 Tb/s 的聚合带宽。此外,旧式卡片依赖 PCIe 插槽,而 BlueField-4 则在系统层面进行工程设计。

BlueField-4 的硬件规格包括采用 1.7 GHz 时钟频率的 64 个 Arm Neoverse V2 核心的 Grace CPU、275 GB/s 的 LPDDR5 带宽,以及支持 800G 以太网(通过 200G PAM4 SerDes)的 ConnectX-9 网络。该架构包含行内加密和 PCIe Gen6 x16 主机链路。1.7 GHz 的核心频率似乎低于在 GB300 AI 系统和之前的 Grace 服务器中观察到的配置,这可能反映了对降低功耗包络的有意优化,特别是考虑到此配置中仅有 64 个 Arm 核心处于活动状态。性能比较表明,这些 V2 核心将显著优于较早的架构,如使用 N2 核心的 Xsight Labs E1 DPU。

Vera Rubin 平台提出了极端的带宽需求。每个计算托盘需要 7 Tb/s 的聚合网络带宽,由四个 1.6 Tb/s 的 GPU Scale-out 链路加上路由至 DPU 的 800 Gb/s Scale-in 连接构成。英伟达认为,如果没有 DPU 掌控数据路径,端到端的 GPU 网络安全和租户隔离将无法实现。虽然传统方法可以隔离 Scale-in 流量,但 Scale-out 流量仍然暴露在外。此外,非 DPU 架构会倍增功耗消耗,因为每个 NIC 都需要专用的 CPU、内存子系统和连接管理——导致与在主机前部署 BlueField-4 相比,功耗高出约 4 倍。

BlueField-4 通过 Astra 解决了这些挑战,提供 7 Tb/s 的 CSP 级安全和管控能力。通过掌控数据路径,DPU 强制执行零信任策略并以线速收集遥测数据,而不影响主机资源。管理功能利用专用链路,消除了在每个 ConnectX-9 接口上放置 BlueField-4 的需要。纸面指标证实,随着 NIC 数量的增加,测量的带宽遵循理想的线性扩展,加密和虚拟化的 Scale-out 流量在多太比特聚合中保持安全并受到监控。虽然博通(Broadcom)等竞争对手展示了详细的性能视图,但 BlueField-4 占据了一个明显不同的性能类别,与 Thor Ultra 等设备相比。

现场演示展示了在 Vera Rubin 系统中运行的 7 Tb/s 平台级 DPU,说明了 BlueField-4 如何监控所有 ConnectX-9 NIC 及其相关流量。对于 GPU 存储访问,在 BlueField-4 Grace 变体上运行的 NVMe over Fabrics 使用八个核心即可提供 1.6 Tb/s 的带宽,并使用十六个核心实现 2000 万次 IOPS,从而将数据传输到 GPU 的速度提高了一倍。在 CPU 方面,DPU 通过硅内策略执行为代理式安全提供了透明保障。DOCA Flow、DOCA Vault 和 DOCA Argus 将文件、对象、处理器和网络上下文映射在一起,以代理速度维持策略执行。该架构还保持对小数据包流量的线速转发和安全检查,防止控制平面在微小帧下崩溃。

Storage-Scale 功能将代理上下文扩展到分层内存地图中。利用 DOCA MEMOS,系统实现了 3.2 Tb/s 的存储访问,通过将键值上下文从 GPU HBM 移动到系统内存再到本地和网络存储,实现了 10 倍的 IOPS 和 5 倍的效率。目前,英伟达将“BlueField-4” designation 应用于集成 Grace 的单 ConnectX-9 变体,涵盖具有不同 ConnectX-9 实现的单双 Vera 配置。行业反馈表明,采用不同的命名法(如 BlueField-4G 和 BlueField-4V)将提高这些配置的清晰度。

英伟达将 BlueField-4 定位为首款 AI 原生 DPU,涵盖 Scale-up、Scale-out、Scale-in 和 Storage-Scale 领域。该架构标志着有意义的演变:DPU 从外围附加卡转变为 AI 工厂的可信前端。通过利用比前几代强大得多的 CPU,BlueField-4 提供了必要的余量来管理安全性和存储工作负载,而早期的迭代难以支持这些负载。这一结果代表了数据中心基础设施设计的实质性代际飞跃。

阅读原文