2026年9月16日星期三
AI 基础设施 · 新闻与分析
首页头条报道
头条 · 报道

AWS推出AI Factories(托管计算服务),同时推出Trainium3和Nvidia GB300等新芯片。

AWS在芯片和托管服务中的垂直整合加剧竞争,重塑云堆栈基础设施标准化。
行业媒体Slicast · 2025年12月2日 UTC 12:00 · 全球 · 来源: siliconangle.com
重要度 85

马逊云科技公司宣布推出一套全面的人工智能基础设施解决方案,旨在在云端和大规模私有AI领域占据主导地位。宣布内容包括AWS AI工厂的推出、由新型Trainium3芯片驱动的Amazon EC2 Trn3 UltraServers的正式发布,以及配备英伟达最新Blackwell架构GB300 NVL72平台的P6e-GB300 UltraServers的推出。这些解决方案涵盖主权内部部署、下一代定制AI加速器,以及AWS目前提供的最先进的英伟达GPU实例。

AWS AI工厂在客户现有的数据中心内直接提供专属的、全栈AWS AI基础设施,结合英伟达加速计算、AWS Trainium芯片、高速低延迟网络、能效基础设施和核心AWS AI服务(包括Amazon Bedrock和Amazon SageMaker)。该平台主要面向政府机构和受监管行业构建,运作方式类似于私有AWS地域,为计算、存储和AI服务提供安全的低延迟访问,同时确保严格的数据主权和监管合规。客户可以利用自己的设施、电力和网络连接,而AWS负责部署、运维和生命周期管理,该解决方案大大加快了通常需要数年的部署周期。AWS强调了与英伟达围绕该平台的深化合作,包括对Grace Blackwell和未来Vera Rubin GPU架构的支持,以及对Trainium4中英伟达NVLink Fusion互连的未来支持。英伟达超大规模和高性能计算部门副总裁兼总经理Ian Buck表示:"大规模AI需要全栈方法——从先进的GPU和网络到优化数据中心每一层的软件和服务。与AWS携手,我们正在直接向客户环境交付所有这些功能。"

由新型3纳米Trainium3 AI芯片驱动的Amazon EC2 Trn3 UltraServers现已正式发布。Trn3系统可在单个UltraServer中扩展至144个Trainium3芯片,相比Trainium2可提供高达4.4倍的计算性能、4倍的能效提升和近4倍的内存带宽。UltraServers专为代理AI、混合专家模型和大规模强化学习等下一代工作负载而设计,配备AWS自主设计的网络,可实现亚10微秒的芯片间延迟。在使用OpenAI Group PBC的开放权重模型GPT-OSS进行的测试中,AWS客户相比上一代实现了每芯片吞吐量提高3倍和推理响应时间快4倍。包括Anthropic PBC、Karakuri Ltd.、Metagenomi Inc.、Neto.ai Inc.、Ricoh Company Ltd.和Splash Music Inc.在内的客户已报告训练和推理成本下降高达50%。AWS还展示了Trainium4预览版,预期将在FP4和FP8性能及内存带宽方面实现重大提升。

AWS推出了新型P6e-GB300 UltraServers,采用英伟达GB300 NVL72平台,使其成为Amazon EC2中提供的最先进的英伟达GPU架构。这些实例在AWS上提供最高的GPU内存和计算密度,针对万亿参数AI推理和生产环境中的高级推理模型。P6e-GB300系统运行在AWS Nitro系统上,与Amazon Elastic Kubernetes Service等服务紧密集成,使客户能够安全高效地部署大规模推理工作负载。

阅读原文
AWS推出AI Factories(托管计算服务),同时推出Trainium3和Nvidia… · Slicast