2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达声称推理软件将AI令牌成本降低5倍,通过软件栈与专用推理芯片竞争。

如果英伟达软件获得采用,会削弱纯推理加速器需求;挑战初创公司利润。
行业媒体Slicast · 2026年6月30日 UTC 16:02 · 美国 · 来源: blockchain.news
重要度 78

NVIDIA的综合推理软件栈正在改变AI生产经济学,在其Blackwell GPU平台上仅一个月内就将token成本削减了高达5倍。这一突破出现在企业将焦点从峰值硬件规格转向在成本、功耗和延迟约束下最大化token效能之际。

这一性能飞跃的核心是NVIDIA的全栈方法,整合了TensorRT-LLM库、Dynamo推理框架和CUDA优化运行时。例如,知名推理服务提供商Baseten利用NVIDIA的工具在长上下文工作负载上将token吞吐量提升了50%。同时,Deep Infra和Together AI也取得了类似成果,通过NVIDIA开源生态系统支持大规模部署复杂大语言模型。

包括启用NVLink的系统在内的Blackwell GPU正成为AI推理的骨干。通过结合分散服务、大规模专家并行和NVFP4等精度增强,NVIDIA的栈在单个优化叠加时可提供高达20倍的吞吐量改进。这个分层系统确保效率收益覆盖生产运营、应用加速和硬件访问等全方位。

与传统Web和SaaS工作负载不同,代理型AI涉及跨多个大语言模型、工具和内存系统的分布式有状态工作流。每个请求可能触发数百个子代理和数千个任务,使推理本质上变得复杂。作为NVIDIA栈的一部分,Triton推理服务器通过优化从Kubernetes集群到云原生设置的异构环境部署来解决这一问题。

对于开发人员,开源生态系统放大了这些优势。像PyTorch这样原生经过CUDA优化的框架,使推测解码或多token预测等创新能够立即部署。这意味着加快了突破的应用速度,也降低了生产AI系统的token成本。

NVIDIA在AI推理中的主导地位与更广泛的市场趋势相一致。截至2026年第一季度,NVIDIA领导154亿美元的数据中心以太网交换市场。其集成栈在企业从训练AI模型过渡到大规模部署推理系统时提供了竞争优势。AI工厂现已将成本和效率置于优先地位,而NVIDIA从硅芯片到软件垂直整合优化的能力使其成为领军者。

NVIDIA对推理经济学的关注可能对其市场地位和企业AI基础设施部门产生长期影响。随着token效率成为AI采用的关键指标,NVIDIA在推动成本下降中的角色可能进一步巩固其主导地位。展望未来,NVIDIA的路线图包括对Blackwell及下一代GPU平台的进一步优化。大规模部署AI的开发人员和企业可能会持续依赖NVIDIA的软件,确保对其硬件和生态系统解决方案的持续需求。

阅读原文
英伟达声称推理软件将AI令牌成本降低5倍,通过软件栈与专用推理芯片竞争。 · Slicast