2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

NVIDIA推广Vera Rubin作为更便宜代理AI的成本最优训练GPU,强调后训练和微调而非原始模型训练。

NVIDIA将Vera重新定位为后训练工作马,而非旗舰训练芯片;承认市场从模型规模训练转向部署成本优化。
行业媒体Slicast · 2026年7月18日 · 美国 · 来源: Techgenyz
重要度 67

能体AI需要与传统生成式AI根本不同的模型开发方法。与模型响应单一提示不同,智能体系统必须追求目标、持续适应环境变化、使用多种工具并从中途失败中恢复。这种持续适应使得后训练——即初始预训练后优化模型的阶段——不再是一次性的最后步骤,而是持续的工作负荷。随着工具每周变化、生产环境中的边界情况不断出现,后训练周期从实时反馈源源不断地进行,使其成为智能体时代的核心计算需求。

NVIDIA的方法专注于最大化每美元的智能,这个指标位于传统的每令牌成本之上。虽然每令牌成本反映了运营效率,但每美元的智能解决了更广泛的问题:构建和持续维护一个值得部署的模型需要花费多少?改进每令牌成本直接改进了每美元的智能,任何模型能力的进步也是如此。

后训练通常依赖强化学习,其中模型对任务进行尝试(前向传递),获得奖励分数,并通过反向传递更新其权重。在数百万次平行尝试中,这个过程开发出真正的智能——编码能力、多步骤规划、工具使用和错误恢复——这些是仅通过预训练无法提供的。大规模来说,这需要编排数千个平行环境、验证奖励并在加速器间同步更新的权重。

NVIDIA的Nemotron 3 Ultra展示了这种方法能够实现的成果。这个开源权重、5500亿参数的混合专家模型使用监督微调、强化学习和蒸馏方法进行了训练。在SWE-bench(一个标准现实世界编码基准)上,它达到了71.7%,成功为来自开源项目的大约十分之七的真实软件缺陷生成了修复,每个修复都针对项目自己的测试套件进行了验证。

Vera Rubin平台进一步推进了这一步,用前代Blackwell GPU数量的四分之一训练最大规模的模型。它从端到端设计用来为智能体后训练优化每美元的智能:增加每次迭代的rollout数量、扩展平行环境、实现永不停止的持续后训练周期。

早期采用者展示了具体的益处。Prime Intellect的Lab在NVIDIA Blackwell上持续后训练前沿模型,并集成了Vera CPU用于低延迟、节能高效的强化学习。在现实的RL沙箱工作负荷上,Prime Intellect观察到Vera相比其他x86架构的每CPU吞吐量高约30%。Perplexity在数百个GPU上运营异步RL后训练堆栈,采用基于RDMA的权重传输,在训练和推理节点间同步万亿参数模型用时不到两秒;它已在NVIDIA GB200 NVL72系统上部署了后训练的Qwen3 235B模型。Collective AI通过其AI Native Cloud平台上的API和SDK提供后训练即服务——包括监督微调、强化学习和直接偏好优化——现在正准备采用Vera Rubin平台。

阅读原文