2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页资本市场报道
资本市场 · 报道

谷歌在Gartner AI基础设施魔力象限领先,表现基础设施部署能力、云平台广度和生态系统成熟度。

市场领先排名验证超规模厂商基础设施投资并影响企业客户多年AI平台采购周期。
研究机构Slicast · 2026年7月10日 UTC 19:45 · 美国 · 来源: Indiatimes
重要度 50

歌被《Gartner》评为其首份“AI基础设施魔力象限”中的领导者,在“执行能力”方面获得最高评级,并在“愿景完整性”方面位居最远端。这一认可凸显了谷歌云致力于提升其AI基础设施能力,特别是为开发和部署大规模AI模型及基于代理的系统提供支持的承诺。

该评估突出了谷歌广泛的基建开发,这些系统最初是为其自有产品(包括Gemini、YouTube和Search)设计的。据该公司称,目前其AI栈已被十分之九的前沿AI实验室使用,知名客户包括Citadel Securities和梅赛德斯-奔驰。

为进一步巩固其AI基础设施,谷歌最近推出了两代新的张量处理单元(TPU):用于训练的TPU 8t和用于推理的TPU 8i。TPU 8t支持单个超级集群(superpod)内高达9,600个芯片的连接,其每个集群的计算性能几乎是前代的三倍。专为推理工作负载设计的TPU 8i配备了288 GB的高带宽内存和384 MB的片上SRAM,有效将内存容量提升至前代的三倍。

谷歌继续保持与英伟达的合作,通过谷歌云交付基于GPU的系统,并计划在Nvidia Vera Rubin平台可用时推出由该平台驱动的A5X实例。该公司还在扩大对开源编排和推理软件的投资,包括llm-d和vLLM,同时推出TorchTPU,以帮助PyTorch开发者以最小的代码修改迁移工作负载。

Gartner还认可了谷歌的AI超算机(AI Hypercomputer),这是一种统一架构,将硬件、网络、存储和软件整合为一个连贯的环境,用于AI训练和推理。随着AI基础设施支出的持续增加,谷歌指出,客户越来越优先考虑成本效益和资源利用率。

在存储方面,谷歌报告称,Managed Lustre——利用C4NX实例和Hyperdisk Exapools——现在可提供10 TB/s的带宽。与此同时,Rapid Buckets可每秒处理高达2,000万次对象存储操作,显著改善了大规模训练运行的检查点和恢复过程。

另一个关键组件是Virgo Network,它可以在单个训练集群中跨多个数据中心位置互连超过100万个TPU,或者扩展至96万个GPU而不降低性能。对于模型服务,Google Kubernetes Engine (GKE) Inference Gateway结合了路由、缓存以及通过llm-d实现的解耦服务,据报道可将吞吐量提高多达40%,同时将服务成本降低多达30%。

谷歌的平台旨在支持云、边缘和本地环境中的AI工作负载。通过Cluster Director和Google Kubernetes Engine,训练工作负载可扩展至13万个节点。GKE Agent Sandbox可为每个集群每秒配置多达300个沙箱,动态调整容量以匹配需求并减少空闲计算成本。此外,Cross-Cloud Network和Cloud WAN利用谷歌覆盖超过1,000万公里光纤电缆并延伸至200多个国家和地区的全球私有骨干网,促进跨不同环境的分布式企业和AI运营。

此次获得Gartner的这一认定,正值主要云服务提供商和半导体制造商争夺支撑生成式AI和代理系统的市场主导地位之际。该领域的需求已从单纯关注原始计算能力,转向硅片、网络、存储、编排软件和运营效率的整体结合。谷歌在魔力象限中的地位验证了其AI基础设施的综合方法,并强化了其对定制硅片作为基础竞争优势的战略重视。

阅读原文
谷歌在Gartner… · Slicast