Google Cloud和Nvidia构建了整合GPU、网络和软件的AI工厂超级堆栈,优化大模型训练推理。
**Nvidia与Google深化合作 打造全栈式AI工厂**
Nvidia公司和Google LLC在这家搜索巨头的年度Cloud Next活动中深化了长期合作关系,创建了一个全栈式"人工智能工厂",集成了Google的AI超级计算机基础设施与Nvidia最新解决方案,包括Blackwell、开源模型以及代理AI和物理AI工具。这一宣布扩大了Google对Nvidia加速计算堆栈的分发,同时客户获得了从AI实验到大规模部署的更快、风险更低的路径。Nvidia和Google Cloud已经共同开发加速云堆栈约十年,从早期的K80/P100 GPU实例开始,逐步演进为AI超级计算机架构。
Google已悄然建立了世界上最大的加速基础设施部署之一,在全球数据中心部署了超过一百万个Nvidia GPU,服务于内部产品和Google Cloud服务。这一规模具有两个主要意义。首先,它缩短了部署时间——因为骨干网络、供应链和数据中心基础设施已经以GPU为中心,每一代新GPU(如Hopper、Blackwell和Vera Rubin)的推出速度更快,这些加速器迅速出现在面向客户的SKU(如A3/A5X和DGX Cloud)中。其次,AI工厂应该有充足的容量:支撑AI超级计算机概念的多租户、大规模集群允许企业在数万个Nvidia GPU上快速启动大型语言模型和代理工作负载,无需定制基础设施工程。
Nvidia的横向广泛可编程性与Google的AI超级计算机战略完美契合,因为两者都致力于构建密集的、软件定义的超级计算机,而非通用云基础设施即服务。虽然TPU等专门加速器和其他专用集成电路功能强大,但相比之下其适用范围较窄。Nvidia跨行业、多云的布局对需要向全球任何客户交付软件的企业很有吸引力,对于Google Cloud来说,与Nvidia的对齐扩大了其AI基础设施对客户的吸引力——这些客户需要一个中立、可移植的加速平台,而非将其锁定在单一云或架构上的专有堆栈。
对于客户而言,这一合作关系的核心是通过降低采用AI的组织障碍来减少风险、缩短价值实现时间,使基础设施团队、数据科学家和应用团队共享一个经过实战验证的通用平台。Google-Nvidia堆栈为企业提供了构建AI工厂和云规模集群的参考设计,用于训练、微调、推理和仿真,企业可以作为服务消费,或使用类似构建块在本地模拟。IT领导者不必再猜测哪个地区或实例类型在十八个月后仍将大规模可用——Google正在将Nvidia标准化为默认加速器架构,与其张量处理单元相辅相成。
Google在过去十年中一直处于Amazon Web Services和Microsoft Azure之后,但与Nvidia的合作为其在AI领域带来了领先地位:一个为代理AI和物理AI优化的共同设计AI超级计算机,将Google的Nvidia驱动超级计算机转化为企业和初创公司可以实际购买的产品。凭借与Nvidia十年的合作关系和当今最广泛的Blackwell实例范围,Google在AI时代的关键时刻为客户提供了多样化选择。