SambaNova通过定制硅架构突破内存墙,解决AI推理瓶颈。
AI推理正日益面临内存和系统级约束,而非算术能力的短缺。为解决这一问题,SambaNova设计了其SN40L可重构数据流单元(RDU),将数据流与SRAM、HBM和DDR内存集成在一起。该架构在最大限度地减少数据移动和机架需求的同时,支持大型基础模型和专业模型的集合。SambaNova与Cerebras、Groq以及GPU进行的对比突显了行业正在发生的转变:竞争的核心已从单纯的峰值计算能力转向利用率、内存容量、部署密度和系统效率。
生成式AI的迅速扩张推动加速器设计者追求更高的计算目标,然而推理性能越来越取决于系统向计算单元输送数据的效率。内存带宽、容量、互连、模型切换和软件调度现在决定了组织实际利用了多少硅片资源。
SambaNova专门针对这些约束设计了SN40L RDU。该设计并未将内存视为次要子系统,而是集成了数据流、编译器控制的算子融合以及三级加速器内存层次结构。该公司声称,这种架构可以使用更少的处理器和更小的数据中心占地面积来执行大型模型,同时保持BF16/FP32精度。
SambaNova使用Llama 3.1模型将其推理性能与Cerebras、Groq和基于GPU的服务进行基准测试。对于Llama 3.1 405B模型,该公司报告称每位用户每秒输出129个令牌(TPS)。值得注意的是,在SambaNova提供的对比中,Cerebras和Groq均不支持该特定模型。
使用70B变体进行的比较揭示了更深层的架构差异。SambaNova使用了16个SN40L芯片。根据其分析,Cerebras需要四个WSE-3晶圆,共计336个芯片才能达到445 TPS。SambaNova估计,Groq依靠576个LPU达到250 TPS,并指出每个LPU仅包含230 MiB的SRAM。
这些数据源自SambaNova的内部分析和假设,不应被视为独立的、同等条件下的系统基准测试结果。然而,它们有效地说明了SambaNova向客户提出的核心架构前提:推理效率最终由提供有用应用吞吐量所需的硬件数量决定。
**三个内存层级解决瓶颈**
SN40L的内存架构构成了这种方法的基础。每个插槽集成了520 MiB的分布式片上SRAM、64 GiB的共封装HBM以及多达1.5 TiB的直接附加DDR DRAM。系统将不同的工作负载分配给每个内存层级。
SRAM直接在计算单元旁边提供高带宽。HBM存储正在执行的模型和频繁访问的数据。DDR提供足够的容量,以便在加速器附近容纳更大的模型集合和检查点。SambaNova指出,SN40L节点可以将模型从DDR传输到HBM,速度超过1 TB/s。
这种配置直接应对了一个日益增长的推理挑战。虽然HBM提供了巨大的带宽,但其有限的容量限制了处理器可以驻留的大型模型或专家的数量。将权重卸载回主机内存会引入延迟并消耗PCIe带宽。直接附加的DDR提供了一个关键的中间容量层级,消除了迫使每个模型进入昂贵的HBM的需求。
SN40L采用台积电5nm工艺制造,采用2.5D CoWoS芯片封装, housing两个可重构数据流Die以及HBM。每个插槽通过1,040个模式计算单元(PCU)提供638 BF16 TFLOPS的性能。另外1,040个模式内存单元(PMU)提供分布式内存和地址生成功能。
PCU管理脉动和数据流计算,而PMU存储张量、参数、元数据和中间结果。这些资源通过可重构数据流网络互联,该网络利用了可编程向量、标量和控制织物。
**编译器集成作为架构的一部分**
SambaNova将大量的操作责任转移到软件中。其编译器将模型转换为数据流图,并将操作分布在去中心化的计算和内存资源上。编译器可以将操作合并为大型融合内核,并构建将在片上保留中间数据的流水线。
这一策略直接提高了操作强度——即系统中每传输一个字节所执行的计算比率。
SambaNova使用Monarch FFT基准测试展示了这种影响。在没有内核融合的情况下,工作负载每字节实现39.5次操作(OPB)。结合GEMM0、乘法和转置操作后,这一数字增加到102.6 OPB。完全的空间融合将该指标推高至410.4 OPB。
图1. SN40L将数据流计算与三级内存相结合。
主要好处是减少了对外部内存的流量。传统加速器可能拥有巨大的算术能力,但由于数据饥饿,其中很大一部分处于闲置状态。通过提高操作强度,该架构使得更多处理可以在已经驻留在处理器内的数据上进行。
SambaNova表示,其编译器可以将整个Llama 3.1 8B解码器融合到一个单一的数据流内核中,允许重复执行而无需持续的核启动开销。对于独立软件供应商(ISV)而言,这将优化工作重心从手写内核转向编译器指导的映射。
**专家组合重塑模型托管**
SambaNova通过专家组合(CoE)框架扩展了其架构。CoE不仅仅依赖单一的单体模型,而是整合了独立开发的专业模型,并配有一个路由机制,根据传入请求选择最佳的专家。
该公司概述了Samba-CoE,这是一个由150个Llama-7B专家组成的系统, collectively超过1万亿个参数。该架构将这些专家存储在DDR中,将路由器保持在HBM中,动态地将选定的专家加载到HBM中,并在其中执行。
这种方法强化了三级内存层次结构的实用性。DDR充当大型本地模型存储库,而HBM则作为高速工作集。运行时优先将频繁访问的模型保留在HBM中,当需要额外容量时,应用最近最少使用(LRU)淘汰策略。
对于企业AI而言,这种能力变得越来越重要。组织可能会部署数十或数百个专业模型,而不是将所有任务都路由到单个大型语言模型中。涵盖编码、工程、金融、客户服务、翻译、计算机视觉和利基领域的应用都可以利用定制模型,同时共享底层基础设施。
**基础设施效率作为主要指标**
SambaNova的价值主张最终超越了每秒原始令牌数。该公司敦促客户评估有用吞吐量与硅片面积、机架密度、内存容量、功耗和部署复杂性之间的关系。
随着推理从实验性工作负载转变为生产基础设施,这一区别对首席信息官(CIO)来说意义重大。一项在基准测试中名列前茅但需要显著更多的机架、网络、内存或电力的处理器,可能会导致部署可行性降低。硅架构师也面临着相同的方程:如果内存和互连无法维持,额外的计算能力会产生递减的回报。
SambaNova的竞争主张仍需在多样化的工作负载、并发级别、延迟目标、软件生态系统和总系统功耗方面进行独立验证。与此同时,包括Groq、Cerebras、Nvidia和其他加速器供应商在内的竞争对手仍在快速推进其自身的架构和软件堆栈。
尽管如此,SN40L突显了AI硬件的一个关键趋势。虽然算术吞吐量仍然至关重要,但应用性能越来越多地由内存放置、编译器优化、模型驻留、互连效率和机架级利用率决定。
AI推理正在将行业讨论从孤立的芯片规格转向整体系统设计。SambaNova设计了SN40L以顺应这一转变。通过集成数据流执行、三级内存层次结构、编译器控制的融合和动态模型管理,该架构将内存墙视为跨越硅片和软件的跨领域挑战。最终,现实世界的生产部署将揭示这种方法在减少成本、功耗和不同企业工作负载的基础设施需求方面的有效性。
**编辑评估**
SambaNova解决了真正的AI基础设施瓶颈:处理器需要足够的内存带宽和容量,以保持高成本计算资源的充分利用。SN40L的SRAM-HBM-DDR层次结构和数据流编译器代表了一种连贯的解决方案。其最引人注目的优势可能源于部署密度,而非原始的令牌吞吐量。涵盖功耗、并发、延迟、软件成熟度和总拥有成本的独立测试最终将定义其市场地位。
转折点。对内存容量、模型驻留、编译器调度和系统足迹的架构重点标志着AI基础设施的更广泛变化。行业多年来一直强调加速器计算;推理使得持续利用变得日益重要。随着企业部署专业模型集合,这可能标志着一个转折点。