2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

SambaNova的AI推理优化技术可显著限制超规模厂商AI资本支出,降低推理工作负载计算需求。

如果推理效率突破减少10-30%数据中心功耗和芯片需求,训练基础设施资本支出可转向其他优先级。
行业媒体Slicast · 2026年7月10日 UTC 14:42 · 美国 · 来源: Jon Peddie Research
重要度 60

SambaNova已经将AI基础设施的讨论焦点从简单地部署更大的GPU集群转向最大化现有硬件的效率。新的基准测试结果表明,其第五代可重配置数据流单元(RDU)与英伟达H200 GPU配合使用,在特定工作负载上实现了比仅使用GPU系统更高的推理吞吐量。通过将提示词处理与令牌生成分离,该方案使企业能够保持现有GPU基础设施的生产力,同时将解码操作委托给专用加速器。如果生产部署的性能与演示结果相匹配,组织可以降低推理成本,同时延长已安装AI系统的使用寿命。

多年来,AI行业追求一个单一目标:部署更大的GPU集群。每一代新技术都增加了计算性能、内存带宽、功耗和成本。这一战略适合训练基础模型,在基础模型中,原始浮点性能决定了大规模数据集转化为可用模型的速度。然而,推理呈现出不同的经济学特性。

一旦模型投入生产,为数百万用户提供服务取决于提示词处理、内存管理、上下文处理和持续的令牌生成,而不是取决于峰值计算能力。这一转变促使AI基础设施供应商重新思考系统架构,而不是简单地添加更多GPU。

SambaNova认为异构推理代表了AI基础设施演进的下一个阶段。在2026年RAISE峰会上,该公司展示了其所谓的基于异构架构的高端推理平台。该配置将一个包含四个GPU的英伟达H200机架(用于计算密集型预填充阶段)与一个配备16个第五代RDU的SambaRack SN50配对(专用于解码操作)。这扩展了首次在COMPUTEX展示的异构蓝图,其中英伟达B200 GPU处理预填充,而SambaNova SN40加速器执行解码。最新配置用新的SN50替换了SN40,并针对新兴的代理AI工作负载。

由Artificial Analysis进行的独立基准测试使用MiniMax M2.7模型报告显示,在短上下文工作负载上的解码性能达到每秒850个令牌,而在长上下文推理上超过每秒450个令牌。早期的基准测试披露报告约为每秒763个令牌。较新的结果反映了对SN50平台的持续优化,同时为MiniMax推理建立了新的性能基准。

推理自然分为两个不同的操作。预填充阶段处理提示词、执行矩阵计算并生成键值缓存——这是GPU因其高度并行的特性而擅长的工作。解码遵循根本不同的模式:每个输出令牌取决于先前的令牌,这使得内存带宽和数据移动比峰值算术吞吐量更为重要。SambaNova专门为推理管道的这一部分设计了其RDU架构。该系统不是替换GPU,而是为每个处理器分配其最高效执行的工作负载。

对于云提供商和企业运营商来说,这种区分从根本上改变了基础设施经济学。现有的H200 GPU集群继续处理计算密集型预填充工作,而SN50系统提供专用的解码容量。组织可以在不替换整个GPU安装的情况下提高推理吞吐量。

基准测试不仅揭示了更高的令牌生成率,还突出了SambaNova底层的数据流架构。传统GPU架构强调由越来越大的内存系统支持的大规模并行执行。相反,SambaNova专注于通过重叠通信与计算并使活跃数据更接近执行资源来减少数据移动。该公司主张持续推理更多地取决于架构效率,而不是公布的峰值FLOPS。

SN50代表SambaNova的第五代可重配置数据流单元,替代了2024年推出的SN40L。根据该公司说法,新处理器将FP16性能提高了约2.5倍,同时将FP8吞吐量提高了约5倍,达到约1.6 PFLOPS FP16和3.2 PFLOPS FP8。虽然这些数字仍然低于英伟达最新Blackwell级GPU的理论峰值性能,但SambaNova辩称峰值规格很少直接转化为生产推理性能,因为内存移动、同步开销和利用率通常决定了实际性能。

内存架构体现了这一理念。每个SN50集成了432 MB的片上SRAM、64 GB的HBM2E(提供约1.8 TB/s的带宽)和256 GB至2 TB的DDR5内存。SambaNova有意保留HBM2E而不是采用更新的内存技术,理由是成本更低且供应可用性更好。更大的DDR5池允许模型和键值缓存在几毫秒内在内存层之间移动,支持快速模型切换,同时保持高利用率。

SambaNova加入了越来越多拥抱解聚推理的公司。英伟达通过其NVL72系统引入了这一概念,通过为预填充和解码工作负载分配不同的GPU资源,后来在收购Groq工程团队后扩展了该战略。AMD、AWS、Cerebras和几个新兴加速器公司已推出类似的架构。业界越来越认识到,没有单一的处理器架构能在AI推理的每个阶段都提供最优效率。对于运营数十万个加速器的超大规模云提供商来说,适度的利用率改进直接转化为更低的运营成本和更高的服务容量。

也许SambaNova最有力的论证集中在已安装的基础设施而不是新硬件上。大多数企业已经在英伟达加速器上进行了大量投资,其中许多加速器尽管有更新的GPU一代存在,仍然能够提供可观的计算能力。SambaNova不是鼓励替换,而是提议延长其使用寿命。现有的H100和H200集群继续执行预填充,而SN50机架执行解码。企业无需购买完整的替代GPU集群即可获得更高的推理吞吐量。与许多需要液冷的下一代AI系统不同,SambaNova的SN50机架保持风冷并适应现有数据中心基础设施。因此,评估AI扩展的首席信息官可以增加推理容量,而无需进行昂贵的设施升级。

SambaNova最近加强了其财务状况和行业伙伴关系。该公司完成了作为更广泛的10亿美元F轮融资一部分的3.5亿美元融资第一期关闭,估值约为110亿美元。General Atlantic领导了这次融资,Intel Capital、Vista Equity Partners、Cambium Capital和其他几个机构投资者参与其中。Intel的参与回应了关于该公司打算收购SambaNova的猜测;相反,Intel选择了专注于异构AI基础设施的多年工程合作伙伴关系。该合作通过联合硬件-软件优化将Intel Xeon处理器与SambaNova RDU相结合,旨在实现企业AI部署。Intel将Vector Core Compute确定为首批部署合作伙伴之一,而Together AI将成为早期大规模商业客户。对于Intel来说,该合作伙伴关系在先前数据中心GPU和Gaudi倡议成效有限之后,将其AI基础设施战略扩展到GPU之外。

SambaNova将今天的16个RDU系统仅视为开始。未来的配置将扩展到128个,最终扩展到256个RDU,通过交换互连连接,每个加速器提供约2.2 TB/s的双向芯片间带宽。这些更大的系统针对AI代理、编码助手、检索增强生成、企业搜索和其他生产推理工作负载,其中延迟、吞吐量、利用率和每个生成令牌的成本决定了盈利能力。

该架构还解决了一个新兴挑战:企业AI越来越依赖定制模型。部门、客户和应用程序通常需要单独的模型而不是共享一个基础模型,这降低了加速器利用率,因为每个模型占用宝贵的内存资源。SambaNova的大型DDR5内存池允许模型和键值缓存在内存层之间快速移动,使基础设施提供商能够在适应模型专业化的同时保持更高的利用率。

阅读原文
SambaNova的AI推理优化技术可显著限制超规模厂商AI资本支出,降低推理工作负载计算需求。 · Slicast