英伟达发布Dynamo操作系统,专为AI基础设施计算优化。
# Nvidia推出Dynamo推理套件
英伟达在本周举行的GPU技术大会上发布了Dynamo——一个开源推理套件。首席执行官黄仁勋将其描述为"人工智能工厂的操作系统"。黄仁勋以历史上引发产业革命的发电机做比喻,他解释道:"发电机是启动上一次产业革命的第一个工具。这是能源的产业革命——水进来,电出来。"该框架旨在优化推理引擎(如TensorRT LLM、SGLang和vLLM),使其能够在大量GPU上以尽可能快速和高效的方式运行。
大语言模型的输出性能分为两类:预填充和解码。预填充由GPU的浮点矩阵数学加速器处理输入提示的速度决定,较长的提示相应地需要更长的时间。解码代表GPU在响应用户提示时生成token的速度。内存带宽对解码性能至关重要——具有8TB/s内存带宽的GPU生成token的速度是具有3.35TB/s的GPU的两倍以上。当为更多用户提供较大的模型,且具有更长的输入和输出序列时,挑战会加剧,因为大型模型通常分布在多个GPU上,这会显著影响性能和吞吐量。
分布方法决定了系统在黄仁勋所称的性能曲线上的位置。黄仁勋解释说:"在帕累托前沿下方有数百万个我们可以配置数据中心执行的点。我们可以以多种不同的方式并行化、分割和分片工作。"一种配置可能为数百万个并发用户服务,每个用户仅10个token每秒,而另一种配置则仅服务数千个并发请求,但能够快速生成数百个token。找到个人性能和最大吞吐量之间的最优平衡是Dynamo提供的关键功能。
Dynamo包括一个GPU规划器,根据需求确定有多少加速器应专用于预填充和解码,同时将这些任务分解到不同的加速器上。该框架具有提示路由功能,将重叠的请求定向到特定的GPU组以最大化键值缓存命中率,另外还包括用于GPU间数据流的低延迟通信库,以及将KV缓存数据在HBM、系统内存和冷存储之间移动以最大化响应能力的内存管理子系统。对于运行Llama模型的Hopper系统,英伟达声称Dynamo有效地将推理性能提高了一倍;对于更大的Blackwell NVL72系统,该公司声称启用该框架后,DeepSeek-R1相比Hopper有30倍的性能优势。
虽然为英伟达的硬件和软件栈进行了优化,但Dynamo设计用于与包括vLLM、PyTorch和SGLang在内的流行服务库集成,允许拥有AMD或Intel加速器的异构计算环境中的用户继续使用他们现有的推理引擎。该框架可在任何英伟达GPU上运行,回溯至Ampere架构,使仍在运行A100的用户能够受益于新软件。英伟达已在GitHub上发布了Dynamo说明文档,并将其作为容器镜像提供。