NVIDIA将Groq 3 LPX推理加速器投入全面生产,与Vera Rubin平台配合交付
NVIDIA正在围绕其所称的"AI工厂"重塑AI基础设施战略,这是一个统一的系统,其中计算、网络和推理作为集成整体协同工作,而不是优化的组件各自独立运行。该公司宣布Vera Rubin NVL72机架级系统正在扩展配备NVIDIA Groq 3 LPX,这是一款专为智能体系统中的令牌生成而专门设计的推理加速器。
根据运行Gemma 4 31B开源智能体模型的Artificial Analysis基准测试,Groq 3 LPX在100,000令牌的长上文使用场景中交付每秒3,400个输出令牌,实现了比最接近的替代平台快4倍的性能。该加速器现已投入全面生产。
行业采纳已在进行中。Nebius成为首个采用Groq 3 LPX的AI云,在其Token Factory产品中将其与Vera Rubin集成,帮助开发者大规模构建高度交互式智能体和实时AI体验。CoreWeave正在生产环境中部署Spectrum-X Multiplane,通过并行交换机连接多个Vera Rubin机架,以提供高带宽、扁平和无损的AI网络。SpaceXAI宣布计划围绕NVIDIA Vera Rubin构建其未来AI架构,从NVIDIA Vera CPU开始处理CPU密集型的智能体工作,包括编排、工具使用、代码执行、数据处理和模拟。
AI基础设施的转变反映了市场需求的根本变化。随着AI从训练转向推理和智能体应用,推理已成为新的前沿。智能体系统生成更多令牌,处理大得多的上下文窗口,并日益与其他AI系统协作以解决复杂问题。解码延迟已成为新的性能挑战——当AI智能体推理、使用工具并与其他系统交互时,它们一次生成一个令牌的响应,微小的延迟在复杂的工作链中倍增。
NVIDIA Groq 3 LPX与Vera Rubin NVL72共同设计,使Rubin GPU处理大规模上下文处理,而LPX加速延迟敏感的解码工作负载。其设计目标是更快、更可预测的令牌生成,帮助AI工厂实现响应式推理和更高的基础设施效率。在规模部署中,LPU队列可通过直接芯片到芯片链接连接,机架级Groq 3 LPX部署能够包含256个LP30加速器,创建NVIDIA所称的为现代AI工厂构建的高效推理引擎。