Qualcomm推出搭载AI250和AI350加速器的HBC近存储AI架构,相比HBM带宽功耗比提升6倍,相比片上SRAM容量提升200倍。
内存墙仍然是许多AI工作负载的主要性能瓶颈。虽然高带宽内存(HBM)被广泛采用,但往往不足够,因为计算能力的增长速度超过内存带宽的增长速度。周三,高通推出了其高带宽计算(HBC)近内存架构,旨在突破内存墙,为特定AI工作负载实现线性性能扩展。
高通的方案很直白:该公司将AI加速器从片上系统(SoC)中分离出来,并将其直接放在LPDDR DRAM堆栈下方。HBC加速器通过硅通孔与LPDDR堆栈连接,提供最大的带宽和容量,无需昂贵的HBM内存或先进的封装工艺。虽然高通未披露HBC提供的实际带宽,但该公司声称与HBM相比能效功率提高6倍,与片上SRAM相比容量提高超过200倍。
"我们已将AI加速器从XPU中分离出来,并将XPU直接放在DRAM堆栈下方,"高通数据中心业务执行副总裁兼总经理Tony Pialis表示。"这非常重要,因为它赋予我们SRAM的性能优势与堆叠内存的密度和容量。实际上,与HBM相关的拥堵问题消失了。对行业的价值在于功耗更低、热量更少,以及消除HBM解决方案所用的昂贵硅中介层。我们还可以在单个计算设备中使用标准封装部署多个HBC堆栈,这带来了显著的性能/成本优势。"
在逻辑电路上或其相邻位置放置DRAM并非新技术;所有主要DRAM制造商都曾试验过近内存计算架构,但都未获得广泛采用。最近,无晶圆厂ASIC设计服务公司GUC推出了其DRAM-on-Logic(DoL)技术,该技术在逻辑电路顶部放置1-4层DRAM,实现约5 TB/s的内存带宽,性能优于某些HBM3E子系统,且无需昂贵的先进封装或HBM3E堆栈。
由于高通未披露实际性能数字,与GUC产品的直接比较仍然困难。关于HBC的一个重要警告是,高通尚未披露HBC加速器实际执行什么任务。理论上,它可以是任何东西:特定于变换器的近内存引擎、通用张量核心阵列,或用于AI推理或训练的预处理逻辑。
高通的HBC路线图包括以下里程碑:AI200加速器将于今年晚些时候推出,采用LPDDR5X,每机架提供43 TB RAM。其继任产品AI250将使用第一代HBC,提供AI200带宽的18倍。AI300将采用第二代HBC,提供AI300带宽的54倍。