Broadcom在Hot Chips 2026上公布了Thor Ultra 800GbE网卡的性能细节,凸显其在下一代AI集群网络中的作用。
博通在 Hot Chips 2026 大会上登台,展示了专为人工智能(AI)和高性能计算(HPC)网络架构设计的 Thor Ultra 以太网网卡(NIC),这是一款 800GbE 适配器。继今年早些时候该系列产品首次发布后,此次会议对其底层架构进行了详细剖析。博通将 Thor Ultra 纳入其全面的以太网战略中,涵盖机架内的规模扩展(scale-up)、跨机架的规模延伸(scale-out)以及数据中心间的规模互联(scale-across)。每个层级都需要一套统一的网卡功能:高带宽、增强的远程直接内存访问(RDMA)、低延迟、服务质量(QoS),以及虚拟化、安全性、精确计时、遥测和诊断能力。此次演讲安排在 NVIDIA 计划于同一环节稍后进行的框架概述之前,为与会者提供了自然的对比语境。
Thor Ultra 将 PCIe Gen6 x16 主机接口与八个端口的 100G MAC、256 个 SR-IOV 虚拟函数以及八条 100G SerDes 通道相结合。它通过硬件卸载支持 RoCEv2、无状态包处理和内联加密。其增强型 RoCE 实现支持超过 64,000 个队列对,并与 TruFlow 引擎及 BroadSAFE 安全框架集成。博通强调了相较于上一代 Thor 架构的多项代际进步。关键创新包括具有乱序放置功能的包喷洒技术、超越传统 Go-Back-N 协议的可靠性机制、简化的可编程拥塞控制,以及通过多平面连接实现的端口密度翻倍。
该芯片采用 5nm 工艺制造,拥有 24 亿个晶体管,封装尺寸为 27×27 毫米,最大功耗为 40–42W。芯片裸片上可见发送和接收缓冲区、嵌入式 CPU 子系统以及负责大部分增强型 RoCE 工作负载的类 P4 可编程引擎。正如演示期间所指出的那样,芯片照片突显了现代网络硅片中集成的前所未有的复杂性。博通提供符合 OCP NIC 3.0 标准和标准 PCIe 形式的 Thor Ultra,可配置为单个 OSFP112 连接器或双 QSFP112 连接器。OSFP112 接口支持灵活的通道配置:800G、双 400G、四 200G 或八 100G,允许运营商在不同端口密度下部署单一板卡设计。支持的线缆包括 DAC、LPO、AEC 和光收发器,不含光模块时板卡功耗高达 50–55W。
数据包流水线架构将职责划分为由固件/PCIe 管理的线程和可编程引擎。发送和接收线程管理工作队列、传输和拥塞控制、可编程调度以及平面管理。与此同时,类 P4 的可编程引擎执行可定制的数据包处理任务。增强型 RoCE 功能集利用多路径路由将数据包喷洒至多达八个不同的平面。乱序放置确保 RDMA 响应得到高效处理,同时保持发送和原子操作的严格顺序。可靠交付通过选择性确认(SACK)和否定确认(NACK)机制配合自动重传来实现。每包路径选择利用包含放置元数据的头部信息。选择性确认位图跟踪每个队列对的已接收数据包,使接收方能够在按顺序传递消息之前对数据段进行重新排序。
拥塞控制以基于接收方信用的拥塞控制作为 eRoCE 的基础。接收方向活跃发送方分配信用,使用推测性信用以实现快速的线速初始化,并监控 ECN、流量修剪和 CSIG 遥测数据。自定义算法通过类 P4 匹配动作引擎实现。该架构使用的是“类 P4”匹配动作引擎而非原生 P4,这一区别在简报中被特别指出。对于 GPU 和 XPU 架构,Thor Ultra 实现了利用 `dma-buf` 在网卡和 GPU 内存之间进行本地点对点 DMA 的对等内存路径,而 eRoCE 则处理远程数据传输。软件栈将 RoCE 用户库置于用户空间,将 RoCE 驱动程序置于内核空间。多租户功能集成了标准的现代网卡特性,包括细粒度的 QoS 策略和强大的虚拟化支持。
精确计时功能支持 IEEE 1588 PTPv2,具备纳秒级数据包时间戳和精确时间测量能力。每秒脉冲(PPS)输入/输出、专用的时间平面以及外部 TCXO 输入同步物理硬件时钟(PHC),确保 AI 和 HPC 系统之间的紧密同步。为了进一步了解网络计时实现情况,Slicast 最近在某大型超大规模厂商的网络实验室拍摄了视频,专门的分析报告计划于 9 月初发布。硬件安全性始于硅层面,包括基于 FUSE 的信任根、ROM 引导加载程序以及经过身份验证的固件更新。通过 SPDM 进行设备认证以及基于 PSP 的加密/解密完成了安全架构。全面的健康监测包括芯片和光组件温度跟踪、眼图分析、系统诊断、崩溃和核心转储收集,以及与 DMTF 和 OCP 规范一致的标准合规管理能力。
Linux 内核栈将功能分离为 `bng_re` RoCE 驱动程序和 `bng_en` NIC 驱动程序。在其之上是 `libbng_re` 用户空间库,所有这些都建立在标准的 `libibverbs` 和 `rdma-core` 接口之上。对等内存和直接集合操作通过 verbs 提供程序和 xCCL 插件与 NCCL、RCCL 和 MPI 集成。该架构依赖于上游的 `dma-buf` 对等内存模型,确保应用程序代码无需修改。在 Keysight CyPerf 基准测试平台上的独立验证——此前曾用于测试 NVIDIA ConnectX-8 C8240 800G 双 400G 网卡(在 PCIe Gen5 服务器上达到 800 Gbps)——代表了第三方验证的逻辑下一步。
博通在 Gen5 GPU 平台上展示了初步的集合通信基准测试结果。在两个节点上的测试中——每个节点配备八个 Gen5 GPU,并通过十六条 400G 链路进行 16 个等级的通信——`all_reduce` 吞吐量达到 383.93 GB/s,`reduce_scatter` 吞吐量达到 380.23 GB/s,接近理论上的 400 GB/s 上限。`alltoall` 操作记录为 84.62 GB/s,这一结果与其固有的较高通信开销一致。总体而言,大多数基准测试操作的总线带宽超过了线速率的 96%。TCP 性能是在配备 512 GB DDR5-8000 内存的 Gen6 CPU 平台上使用 iperf3 测量的。单向吞吐量在 16 个并行流中达到 791 Gbps,占 800G 链路容量的 98.9%。双向流量聚合约为 1.51 Tbps,吞吐量在链路饱和前随流数增加几乎呈线性增长。RDMA 写入基准测试显示,单向吞吐量饱和在 781 Gbps,而双向吞吐量达到 1,558 Gbps——约占 1.6 Tb/s 聚合容量的 97.6%,约为单向速率的两倍。在 32 KB 消息大小下,单向性能达到线速率的约 88%,在 128 KB 时缩小至距峰值吞吐量仅 3% 以内。
博通强调,这一代解决的建筑挑战——包括多路径、RoCE 增强功能(如可靠性和乱序放置)以及可编程拥塞控制——从根本上植根于数据包处理流水线。本次演讲涵盖了从物理硅片裸片到 Linux 软件工具链的 Thor Ultra 全栈。该架构明确设计为面向 AI 规模延伸的系统级解决方案,展示了硅片、软件和管理框架之间的协同整合。随着 Thor Ultra 的发布,博通将自己定位为直接与 NVIDIA 的 ConnectX-8 和 AMD 的 Vulcano 竞争 800G 网卡市场的参与者。数据路径针对增强型 RoCE 或 MRC++ 协议进行了优化,而集成的 QoS 和虚拟化功能促进了 XPU 和 CPU-as-a-Service 部署。全面的安全性、管理能力和精确计时确保了分布式系统之间的稳健同步。在近一年前的 OCP Summit 2025 上进行初步硬件预览之后,本次会议深入探讨了备受期待的 Thor Ultra 内部设计和性能特征。