2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达在Hot Chips 2026上详述即将推出的Vera服务器CPU架构,每芯片配备88个核心,旨在支持下一代机架级部署。

高核心数服务器CPU将缓解密集GPU集群的主机端瓶颈,改善工作负载编排并降低PCIe开销。
行业媒体Slicast · 2026年8月25日 · 全球 · 来源: ServeTheHome
重要度 84

2026年Hot Chips大会上午开幕CPU会议的第三场也是最后一场演示中,英伟达登台发布了其下一代服务器CPU——Vera。Vera基于全新的Olympus CPU核心架构打造,是一款拥有88个核心的自研Arm架构服务器处理器。它是英伟达即将推出的Vera Rubin AI系统的关键组成部分,代表了该公司在服务器CPU市场扩大影响力的最雄心勃勃的努力,旨在通过一款专业化且功能强大的处理器争取更大的市场份额。此次发布紧随上月发布的Vera/Olympus白皮书之后。

从宏观层面来看,Vera被设计为一款现代高性能处理器,优先考虑每周期指令数(IPC)而非单纯的核数。该芯片集成了八个128位LPDDR5X内存控制器,并配备了NVLink-C2C接口,旨在与英伟达的Rubin GPU无缝配对。该接口还支持连接其他NVLink-C2C实现或第二个Vera处理器,以构成双插槽(2P)纯CPU配置。作为英伟达Grace CPU的后继者——后者曾驱动Grace Hopper和Grace Blackwell两代产品——Vera在所有指标上均实现了显著进步。英伟达将其开发背景框定为人工智能代表迄今为止最复杂的计算工作负载这一现实。AI并非单一查询,而是跨越多种工具和计算类型的完整工作流程,因此需要对整个堆栈进行优化,而非仅针对单一用例。

Vera Rubin的开发经历了极端的软硬件协同设计,涵盖了NVL72、LPX3和Bluefield机架等架构。在过去一年中,英伟达频繁展示了性能前沿——即令牌吞吐量与用户交互性之间的权衡。虽然高批处理能最大化令牌生成,但会降低响应速度。Vera Rubin旨在将这一前沿向外扩展,提升吞吐量与交互性之间的最佳平衡点。在较高的交互水平(以每秒每用户令牌数衡量)下,Vera Rubin提供的总吞吐量可达Grace Blackwell的30倍,尽管结果仍取决于沿性能曲线的位置;Grace Blackwell在较早的阈值处就出现了性能崩溃。对于需要超越独立Vera Rubin配置能力的部署场景,英伟达现在提供Groq LPX3机架。这些系统利用Groq专用的解码加速硬件进一步延伸性能曲线,从而实现极高的交互率而不发生降级。英伟达报告称,Groq LPX3上的长上下文解码速度是当前公共服务的四倍。

Vera背后的设计理念反映了服务器CPU经济学的根本转变。传统的服务器设计历来倾向于出租大量较弱的核心,但AI工作流需要更高的单线程性能。因此,英伟达优先采用针对延迟关键型操作优化的超高IPC架构。在智能体系统中,自主代理在不同任务间快速切换,缩短完成时间可直接加速后续操作——这种场景天然受益于如Vera这样的高IPC设计。英伟达将智能体工作负载作为一个引人注目的用例加以强调,指出在智能体框架内运行的无头浏览器与传统交互式浏览器相比,表现出截然不同的性能特征。总体而言,英伟达将Vera定位为通过五项关键创新区别于传统服务器CPU的产品:高IPC、能效、海量数据移动能力、安全及机密计算功能以及全面的I/O带宽。在重负载下的确定性性能仍是其宣传的核心焦点。

Olympus CPU核心在英伟达最近的白皮书中首次详细披露,集成了大量的片上资源。每个核心都配备巨大的缓冲区、一个10宽解码前端以及相应的大型执行后端以消耗解码后的指令。虽然针对智能体工作负载进行了优化,但Olympus并非仅限于智能体用途。英伟达采用了静态划分的空间多线程技术,而非在线程间动态共享资源。这种方法提供了与传统同时多线程(SMT)相当的性能,同时显著降低了对线程争用和资源噪声的敏感性。在使用映射到代表性智能体和数据处理工作负载的SPEC CPU 2026精选子集进行的基准测试中,英伟达报告称,智能体代理的性能提升了约1.8倍,数据处理代理提升了1.5倍,并明确指出这些数据代表代理指标而非详尽的基准测试结果。

内存子系统的选择严格遵循能效约束,使得LPDDR5X成为最终选择。由于光罩尺寸限制,英伟达无法在单个单体晶圆上制造Vera。相反,该处理器采用多芯片模块方法,由六个晶圆组成:一个单体计算核心晶圆与分别处理内存和I/O功能的Chiplet相结合。所有组件均位于同一个中介层上。系统I/O晶圆提供96条PCIe/CXL通道,而NVLink-C2C则促进与Rubin GPU或双插槽配置中的次要Vera处理器的高速链接。

机密计算是Vera及其配套的Rubin架构的另一项基础优先级。英伟达设计了涵盖整个机架的全栈机密计算解决方案,确保在与兼容软件平台(如英伟达的DOCA生态系统)一起部署时具备防篡改操作能力。实现这一目标需要在CPU、GPU和网络接口控制器之间进行密集的协同设计。在此架构中,GPU验证来自CPU的传入请求,利用每核心加密密钥来维持安全完整性。为了支持与最关键的数据中心资产的集成,Vera集成了96条PCIe和CXL通道,利用这些通道直接连接到英伟达ConnectX网络接口卡。

Vera将作为NVL72平台的一部分以及独立的Vera服务器提供。英伟达及其合作伙伴生态系统将提供机架级系统和独立服务器单元。演示最后,团队对工程团队的成就表示认可,特别是成功过渡到自研CPU核心。这一架构转变使英伟达能够实现其确切的性能目标,同时在定制硅芯片设计方面展示了扩展的能力。

阅读原文