AMD Instinct GPU系列在超大规模数据中心部署中与英伟达产品竞争市场份额。
英伟达在2024年主导了人工智能基础设施市场,根据Omdia的估计,其Hopper GPU在12个最大客户中的出货量增长超过三倍,达到超过200万块。然而,该公司面临来自AMD Instinct MI300系列日益激烈的竞争。Omdia估计,微软在2024年作为全球最大的云计算或超大规模客户购买了约581,000块GPU,其中六分之一由AMD生产。在最热情地采纳AMD刚推出一年的加速器的Meta公司,AMD占GPU出货量的43%,达173,000块,而英伟达为224,000块。与此同时,在Oracle公司,AMD占这家数据库巨头163,000块GPU出货量的23%。在Omdia追踪的四个供应商——微软、Meta、Oracle和TensorWave——中,MI300X的出货量总计327,000块。
AMD的增长特别值得注意,因为其MI300系列加速器仅在市场上存在了一年,此前主要用于高性能计算应用,如橡树岭国家实验室的1.35艾字节浮点运算/秒Frontier超级计算机。"他们去年通过HPC领域证明了这些GPU的有效性,我认为这很有帮助,"Omdia云和数据中心研究总监Vladimir Galabov告诉The Register。"我确实认为市场渴望英伟达的替代方案。"MI300X提供了实质性的技术优势,包括AI工作负载的浮点性能提高1.3倍、内存带宽提高60%以及容量比H100高2.4倍。每块GPU配备192GB的HBM3——每个单独服务器可启用1.5TB的显存——使得Meta的Llama 3.1 405B等大型模型可以在单个节点上运行,而H100在全分辨率下缺乏必要的内存。MI300X提供5.3 TBps的内存带宽,而H100为3.3 TBps,H200为4.8 TBps,理论上能够更快地服务更大的模型。即使英伟达的Blackwell开始送达客户,AMD的MI325X仍保持每块GPU 256GB的容量优势,而其更强大的MI355X(计划于明年晚些时候推出)将达到288GB。
微软和Meta已倾向于选择AMD的加速器来部署数千亿乃至数万亿参数规模的大型前沿模型。这一势头反映在AMD的业绩指导中,该指导意见季度环比持续改善,AMD现在预期Instinct在2024财年将创造50亿美元的收入。根据Galabov的说法,"AMD执行力强。它与客户沟通良好,善于透明地谈论自身的优势和劣势。"展望未来,如CoreWeave这样新兴的GPU数据中心代表了潜在的增长驱动力,一些公司特意围绕英伟达替代方案构建商业模式——TensorWave是一个显著的例子。
除了AMD对英伟达的挑战外,云提供商和超大规模企业正在部署大量自定义AI芯片。Omdia估计,Meta的自定义MTIA加速器在2024年达到150万块出货量,而亚马逊下单采购了900,000块Inferentia芯片。谷歌订购了约100万块TPU v5e和480,000块TPU v5p加速器,这些TPU被用于训练其专有的Gemini以及开源的Gemma语言模型。此外,亚马逊还订购了约366,000块Trainium芯片,这些芯片已重新调优以适配训练和推理工作负载。虽然Inferentia和MTIA主要针对推荐系统等传统机器学习任务而非大型语言模型设计,但这些自定义芯片部署反映了整个行业向多样化AI基础设施发展的更广泛趋势。