2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达在Hot Chips 2026上展示了CUDA与RISC-V控制器及NVLink Fusion系统的集成方案。

该进展提升了大规模GPU集群的低延迟管理平面能力,优化了AI推理与训练场地的运营效率。
行业媒体Slicast · 2026年9月2日 · 全球 · 来源: ServeTheHome
重要度 70

Hot Chips 2026大会上,英伟达登台详细阐述了RISC-V与其GPU生态系统的集成方案。尽管周日教程环节期间对多项RISC-V演示的初步报道有所滞后,但本报告综合了关键的架构披露信息。值得注意的是,本次演讲有别于英伟达在Hot Chips大会上的其他展示,采用了专为教程格式设计的独特开场序列。

该演示围绕两大核心平台展开:CUDA和NVLink Fusion。每个平台都为宿主机CPU定义了特定的角色,英伟达概述了RISC-V处理器必须满足的要求,以及将其软件栈扩展至RISC-V所带来的机遇与挑战。作为并行计算平台推出的CUDA自2006年以来一直是英伟达构想将RISC-V整合到其更广泛计算架构中的核心。

CUDA应用程序将工作负载划分为CPU和GPU软件模块。计算密集型功能在GPU上进行并行化处理,而顺序操作则在宿主机CPU上执行。这种宿主机侧的软件栈本质上复杂且异构,它在CUDA库、驱动程序、开发工具以及针对目标架构定制的第三方软件之上,混合了仅CPU组件和CUDA加速组件。目前,英伟达在宿主机侧支持Intel和AMD的x86处理器,以及基于Arm的CPU。

为了让RISC-V CPU运行CUDA工作负载,英伟达指出了既定的服务器相关规范。RVA23配置文件和RISC-V启动与运行时服务规范解决了应用层问题,而更广泛的RISC-V服务器SoC和平台规范则定义了系统级要求。二进制兼容性是主要目标;RVA23配置文件保证了关键扩展的存在,使软件能够在不同的RISC-V处理器上运行,无需采用最低公分母方法。尽管人们普遍认为RISC-V是碎片化的,但RISC-V国际组织仍在发布重大和次要更新,明确区分了强制性和可选的新扩展。

ACPI是这些平台要求的一个具体示例。UEFI论坛在2025年5月批准的ACPI 6.6中增加了对RISC-V的支持,随后在2025年8月发布了RISC-V启动与运行时服务规范。这些标准在一年多前正式确立,凸显了平台成熟的快速步伐。

CUDA工作负载严重依赖于宿主机和设备内存之间的数据移动。典型的操作包括从宿主机到设备的传输、内核执行、从设备到主机的传输以及中间的CPU处理。为了优化这一点,英伟达强调PCIe一致性是关键的特有CUDA要求,并指出它已被大多数甚至所有现代服务器CPU所采用。基于硬件的PCIe I/O一致性消除了频繁的缓存刷新和无效化操作,简化了软件栈并降低了延迟。

PCIe点对点通信代表了另一个CUDA特有的要求。在多GPU配置中,GPU可以直接将数据写入另一个GPU的设备内存,并通过标志向宿主机发出信号,从而绕过通过宿主机内存的不必要复制。这种能力解释了即使在十年前,在GPU部署中观察到的非传统服务器架构的原因。

Vera Rubin平台体现了英伟达的全栈AI工厂方法,通过跨越七款芯片和五个机架的共同设计进行工程构建。从Vera CPU和Rubin GPU到网络、存储和扩展 fabric,再到物理机架基础设施,这一架构已证明足够基础,在整个会议中被反复引用。

在NVL72机架内,英伟达将72个GPU的L1域整合为完全铜互连拓扑。每个计算托盘包含安装在NVLink Fusion小芯片上的GPU,搭配两个Vera CPU以及连接处理器与加速器的片对片(C2C)链路。虽然英伟达基于Arm指令集的Grace和Vera CPU驱动此配置,但其底层平台设计远远超出了单一ISA的范围。

NVLink Fusion允许定制硅片无缝集成到英伟达的AI平台中。定制CPU通过NVLink C2C连接到XPUs,为每个加速器提供高带宽连接,同时在整个机架范围内保持统一的L1域。在定制CPU内部,英伟达详细介绍了C2C接口集成,其中NVLink C2C PHY提供了高带宽、CHI一致的CPU到GPU链路。这种架构允许CPU和GPU在统一内存模型下访问内存。

NVLink Fusion CPU继承了所有CUDA先决条件,并引入了额外的需求。英伟达强调了支持约88条PCIe通道的高速C2C互连,以及包括用于网络的DOCA和用于多GPU通信的NCCL在内的专用软件生态系统。这些规格很少在公开论坛上讨论,使得这部分内容尤为引人注目。SiFive被明确指出为英伟达在NVLink Fusion CPU方面的基于RISC-V的合作伙伴。

英伟达最后倡导RISC-V在下一代服务器平台中的作用。作为一种由多家供应商支持的开放标准,RISC-V结合标准化的核心功能和可定制的扩展,扩大了服务器CPU的选择范围,与x86和Arm并列。“英伟达在其平台中有RISC-V的计划”,演示文稿确认了这一点。值得注意的是,英伟达已经在当前系统中使用RISC-V用于较低级别的控制器,尽管本次会议特别关注的是宿主机处理器的集成。

总体而言,这些架构细节说明了英伟达如何设想RISC-V在CUDA和NVLink Fusion生态系统中的定位。该公司的路线图明确将RISC-V定位为服务器CPU市场中可行的第三种选择。从符合RVA23到NVLink Fusion集成的已发布要求,将决定RISC-V服务器硅片必须提供的性能和功能集,以符合未来GPU平台的资格。虽然更广泛的部署可能仍需两代时间,但行业共识确认,RISC-V进入高性能服务器计算是不可逆转的趋势。

阅读原文