2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

AMD Instinct MI350P 144GB HBM3E GPU在数据中心集群中广泛部署,成为H100推理工作负载的流行替代方案。

MI350P采用验证AMD的推理势头;尽管软件生态不成熟,但由于可用性和成本,标志着客户愿意从NVIDIA多元化。
行业媒体Slicast · 2026年7月18日 · 全球 · 来源: ServeTheHome
重要度 72

AMD Instinct MI350P在过去两个月的主要技术贸易展上成为常见身影,亮相戴尔科技峰会、HPE Discover、台北国际电脑展2026等多个展会。这款加速器自推出以来引起了广泛关注,随着其知名度提升,推动其应用的技术优势也变得愈加明朗。

比较PCIe GPU规格仍然存在挑战,因为制造商通常以不同格式发布各异的指标。在当今可用的三个主要选项——MI350P、NVIDIA的H200 NVL和NVIDIA的RTX Pro 6000 Blackwell Server Edition——中,每一款都呈现出不同的权衡。

内存容量是MI350P的主要优势之一。虽然H200 NVL在技术规格上提供144GB,相比之下MI350P为141GB,但更重大的差异在于代际设计理念。H200 NVL采用Hopper架构,而MI350P搭载更现代的工程设计。在Blackwell方面,NVIDIA的RTX Pro 6000 Blackwell Server Edition提供96GB的GDDR7容量。NVIDIA优先推行这款产品,因为Blackwell架构无需依赖供应严重受限的HBM3E内存。RTX Pro 6000包含用于混合工作负载的RT核心,但在专注于内存容量和带宽的推理工作流中,采用紧凑数值格式时,这款卡存在明显的性能权衡。

MI350P在低精度数值格式中展现优势。Hopper架构问世早于FP6和FP4优化浪潮,Blackwell卡缺乏公开的FP6性能数据。Hopper完全缺少专用低精度硬件支持,而MI350P在FP4和FP6规范下都显示出可量化的性能收益。使比较更加复杂的是,稀疏性能数据往往主导已发布的规范,尽管大多数实际工作负载在密集约束下运行,峰值数据与实际交付性能差异显著。

MI350P的优势特别体现在MXFP6执行中,其性能介于FP8和FP4之间,同时实现显著的内存效率。即使在FP4规范下,该卡也优于竞品。用FP4或FP6替代FP8进行推理,能够在卡的内存空间内装入实质上更多的数据。

视频解码能力对处理图像和视频源而非仅文本的工作负载意义重大,尽管各制造商的规范页面在文档标准上差异较大。

MI350P的设计体现了务实的工程选择。它在概念上源自MI350X,提供OAM形式因子MI350X大约一半的计算能力、内存和功耗。AMD显然认识到市场对PCIe加速器的需求,但判断完整的MI350X功耗超出标准PCIe CEM卡形式因子的限制。解决方案是在PCIe MI350P上以半倍规模实现MI350X架构。

当前三款PCIe GPU卡都采用600W被动冷却设计运行。与NVIDIA产品相同,MI350P将电源连接器放置在卡的前边缘,与I/O挡板相对。与H200 NVL一样,MI350P不配备视频输出接口。

这些加速器已开始在整个行业的已部署系统中出现,建立了早期的市场势头。

阅读原文