2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

NVIDIA Blackwell全栈推理软件一月内降低DeepSeek V4令牌成本5倍

英伟达官方——路线图/产品的第一手确认。
官方披露Slicast · 2026年6月30日 UTC 15:00 · 美国 · 来源: NVIDIA Blog

组织从AI试点项目转向生产级AI工厂时,基础设施决策已从关注芯片峰值规格转向关注每令牌成本:即以每美元、每瓦特为单位,在满足所需延迟目标的前提下能交付多少有用令牌。

NVIDIA的全栈推理软件与NVIDIA GPU、CPU、网络和系统共同设计,并由广泛的开源生态系统强化,不断改进硬件性能。在NVIDIA Blackwell平台上,仅在一个月内,该软件栈已将DeepSeek V4模型的令牌成本降低了最多5倍。

领先的公司和推理服务提供商已经看到NVIDIA推理软件栈在Blackwell上的复合价值。传统网络、搜索和软件即服务工作负载相对可预测,用户通过类似的软件路径加载页面或更新记录。但代理可以推理、规划、调用工具、启动专业子代理,并在多轮工作流中管理庞大上下文,将单个请求转化为分布式计算问题,可以跨越数百个子代理、数千个任务和多个大语言模型,运行在GPU、CPU、DPU和存储系统上。软件栈决定了这种复杂性是转化为浪费容量还是更低的每令牌成本。

更低的每令牌成本来自于将单个优化转化为系统级性能。NVIDIA的推理软件栈连接三个层次,使其作为统一系统工作,单个优化形成复合效应。分离式服务、通过NVIDIA NVLink互连技术的大规模专家并行、NVFP4精度和多令牌预测各自都能带来显著收益。结合起来,它们将吞吐量提高最多20倍。在生产环境中捕获这些收益需要跨越整个推理栈进行协调,从生产运营和模型运行时到内核、通信库和硬件访问。

相同的全栈基础由开源生态系统进一步放大。PyTorch于2016年推出时具有本地CUDA支持,与NVIDIA架构共同演进,使开发者能通过熟悉的框架直接访问Tensor Cores、Transformer Engine和NVFP4等创新。当DFlash投机解码(在现有硬件上提供高达15倍的吞吐量)或FastVideo(在不到五秒内生成1080p视频)等突破性技术进入PyTorch时,它们可以立即在NVIDIA上运行。

当DeepSeek V4等前沿开源模型发布时,vLLM和SGLang等领先推理框架已为NVIDIA Blackwell架构准备好第一天部署方案,使该模型可在数百万Blackwell GPU上访问。约一个月内,DeepSeek V4在vLLM和SGLang框架上的Blackwell性能提高了最多5倍,将令牌成本降低到约之前水平的五分之一。这个开源飞轮意味着更多开发者优化CUDA原生推理路径,更多生产部署向生态系统反馈信息,每次软件改进都增加交付的令牌输出,同时随着时间推移降低每令牌成本。

阅读原文
NVIDIA Blackwell全栈推理软件一月内降低DeepSeek V4令牌成本5倍 · Slicast