2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

SambaNova + NVIDIA H200平台在MiniMax推理中基准测试763 tokens/秒;演示异构计算可行性。

混合CPU-GPU架构第三方验证;证明单片GPU堆栈的替代方案在真实推理工作负载上具有竞争力。
行业媒体Slicast · 2026年7月8日 UTC 20:19 · 全球 · 来源: The Register
重要度 71

Intel对SambaNova的投资似乎正在获得回报。本周,这家AI芯片初创公司公布了基准测试结果,展示了其最新一代AI加速方案,该方案将英伟达GPU与自有加速器相结合,性能远超仅使用GPU的推理平台。

Artificial Analysis的测试发现,SambaNova在2月发布的SN50系列加速器在MiniMax M2.7短上下文长度(10,000输入token)下达到了763个token/秒——比竞争对手的仅GPU推理服务快数倍。在较长的上下文长度下,该平台可维持超过450个token/秒的性能。

这一性能来自于在异构计算平台中结合了4块英伟达H200 GPU与16个SN50可重构数据流单元(RDU)。计算密集型的预填充阶段(即处理提示词和生成键值缓存)在H200上运行,而内存带宽受限的解码阶段在16个SN50加速器上运行。

将预填充与解码分离已成为降低代码助手等长时间运行AI应用token成本的关键。英伟达率先采用了这一方法,推出了NVL72机架系统,改变预填充与解码GPU的比例,并在今年春季GTC大会上展示的基于Groq的LPX机架中进一步扩展了这一方法。此后,AMD、AWS、Cerebras等公司相继推出了分离式或异构推理平台。

SambaNova的目标是向客户展示如何通过将其系统用作解码加速器来延长老旧GPU集群的生命周期。一个关键优势是:其风冷系统可以部署在现有数据中心中,而英伟达最新的Rubin GPU则需要液冷。

该公司计划展示使用128个乃至最终256个加速器的更强大配置,以展示其在高吞吐量下保持高token生成速率的能力——这是GPU单独难以实现的,也是英伟达去年收购Groq的关键因素。

这些结果出现在SambaNova与Intel宣布Vector Core Compute将首批部署GPU + RDU解决方案之后一个月,TogetherAI是其首个大规模客户。

新芯片的产能爬坡需要大量资本投入,但对于SambaNova的第五代芯片来说,融资不应该是问题。本周三,该公司完成了由General Atlantic领导的10亿美元F轮融资的首轮成交,估值达到110亿美元。

阅读原文
SambaNova + NVIDIA H200平台在MiniMax推理中基准测试763… · Slicast