AMD的Arcturus CDNA数据中心GPU配备7680个核心。
AMD的Radeon Instinct Arcturus GPU采用CDNA架构,已被Rogame发现,准备瞄准数据中心服务器市场。这款计算优化的GPU设计旨在为数据中心提供最高性能的计算能力。AMD的下一代HPC和AI GPU已与消费端芯片分别设计,Arcturus GPU专供数据中心市场使用。AMD在其Radeon CDNA架构路线图中确认,所有基于CDNA的GPU将专门为HPC和数据中心市场设计,而Radeon RDNA GPU将为消费者部分提供支持。
AMD的Arcturus GPU最初在2018年泄露,早于该公司推出任何7nm GPU之前。Radeon VII和Navi系列于2019年推出,均采用7nm GPU,其中Navi针对大众消费市场。这一新架构代表了一个战略转变,为企业和消费应用开发独立的产品线,使AMD能够独立优化各个细分市场。
Arcturus GPU的规格包括相比Vega增加的缓存和翻倍的计算单元。新的Radeon Instinct卡预期会支持XDLOPs、快速打包数学、新向量ALU和BFloat16等数据中心特定功能。之前的Radeon Instinct MI100原型板采用Arcturus-XL芯片,额定功耗为200W,配备32GB HBM2 VRAM,频率约为1000–1200 MHz。发现的一块基于Arcturus CDNA GPU的测试板提供120个计算单元,共7,680个流处理器,GPU时钟速度为878 MHz,SOC时钟为750 MHz。该变体还配备1200 MHz的HBM2内存,配合4096位总线,可提供约1.2 TB/s的带宽,性能可与Aquabolt相媲美。AMD和NVIDIA都可能采用更快的HBM2E "Flashbolt"标准,可提供高达1.8 TB/s的带宽。
测试板上的878 MHz时钟速度相对较低,而过去的变体可达1334 MHz,产生约13.5 TFLOPs的FP32计算能力——低于Radeon Instinct MI60和之前原型上实现的21 TFLOPs。第一代CDNA GPU预期能达到约25 TFLOPs FP32。根据NVIDIA Ampere GPU的泄露信息,预计今年晚些时候发布,NVIDIA在计算性能方面可能占上风,其下一代Tesla 7nm GPU系列的推测性能可达近36 TFLOPs的FP32和18 TFLOPs的FP64计算能力。
AMD对CDNA的既定重点是数据中心市场中的性能、效率、功能和可扩展性,用专门为高性能计算、机器学习和HPC应用优化的GPU替代传统GCN架构。第一代CDNA GPU将采用第二代Infinity架构,并利用ROCm(Radeon Open Compute Platform)为数据中心提供动力,具有关键优化和增强的可扩展性。第二代Infinity架构将在单个节点中实现4–8路GPU连接,允许新的Radeon Instinct板相互协调工作。AMD已展示了以具有竞争力的价格提供有竞争力的FLOPs的能力,这可能是Arcturus背后的战略。虽然发布时间尚未确认,AMD暗示将在今年晚些时候发布首款Radeon Instinct产品,采用其第一代CDNA架构。