2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

后训练成为智能AI系统的持续核心工作负载而非一次性完成步骤

英伟达官方——路线图/产品的第一手确认。
官方披露Slicast · 2026年8月4日 · 美国 · 来源: NVIDIA Blog

像精英运动员在比赛间隙不断磨练技能一样,智能体AI模型必须随着环境变化、边界情况出现和工具改变而不断适应。与回应提示词的生成模型不同,智能体模型必须规划、使用不同工具并从运行过程中遇到的问题中恢复。

后训练是在原始数据初始训练后对模型进行优化的阶段,不再是一次性完成的步骤。它是持续的,因为智能体模型运行的环境变化很快。智能体使用的工具可能一周一周地改变,生产环境中出现的边界情况是任何测试集都未曾预料到的。每次部署都会带来自己的代码库、策略和环境。后训练运行从生产环节循环返回,随着新问题浮现,创造了一种运行永不停止的新计算模式。计算占用量的增长不是因为单次运行更大,而是因为运行是持续的。

后训练的目标是通过最大化持续学习循环中每个前向和反向传播的产出,来最大化每美元的智能。前向传播或推理,以每个令牌的成本衡量。后训练是构建智能的地方。在预训练中,模型学习预测下一个令牌,这给予它流畅性但不是智能。后训练是它学习编写代码、规划多步任务、使用搜索工具和在出现问题时恢复的地方。因为没有答案键可以记忆,只有奖励,模型通过强化学习技术学习。当给定一个任务时,它写出一个尝试,被评分,然后这个教训在数百万次尝试中更新模型的权重,直到智能增长。

每个令牌的成本衡量运营产出,而每美元的智能衡量模型智能的投资是否得到回报。两者是嵌套的,而不是竞争的。降低每个令牌成本的AI基础设施也降低了构建到模型中的每一点智能的成本,而构建的每一点智能都提高了推理工厂提供的每个令牌的价值。

NVIDIA Nemotron 3 Ultra是一个开源权重的5500亿参数混合专家模型,提供可验证的基准和完全公开的后训练方法。它在SWE-bench verified上获得71.7%的分数,这是一个标准的真实编码基准,其中它为来自开源项目的十分之七左右的真实软件错误产生了有效的修复,每一个都根据项目自己的测试进行了验证。

NVIDIA Blackwell平台降低了每次运行的成本,使得智能体时代所需的频繁后训练在经济上可行。NVIDIA Vera Rubin平台进一步扩展了这一点,用Blackwell代的GPU数量的四分之一训练最大的模型。它被共同设计以最大化每美元的智能,用于智能体后训练负载,具有更多每次运行的展开、更多正在进行的环境和永不停止的后训练周期。

Prime Intellect在NVIDIA Blackwell上持续后训练前沿开源模型,并使用NVIDIA Dynamo进行推理编排。有了Vera Rubin,Prime Intellect计划扩展强化学习环境并加速训练到推理的迭代循环。Prime Intellect已经优化了其沙箱基础设施以与NVIDIA Vera CPU集成,与替代x86架构相比,平均每个CPU提供30%更高的吞吐量。

Perplexity的强化学习后训练堆栈在数百个NVIDIA GPU上异步运行,具有基于RDMA的权重转移引擎,可在两秒内跨训练和推理计算节点同步万亿参数模型。Together AI在其AI Native Cloud平台上提供后训练服务,包括监督微调、强化学习和直接偏好优化,计划利用Vera Rubin平台。

阅读原文