2026年9月27日星期日
AI 基础设施 · 新闻与分析
首页 › 芯片与硬件 › 报道
芯片与硬件 · 报道

谷歌TPU在使用DeepSeek开源vLLM框架运行Kimi模型时,性能比英伟达GPU快57%。

验证了替代加速器在成本竞争力的大规模模型推理中的有效性;对英伟达推理阶段的市场主导地位提出质疑。
行业媒体Slicast · 2026年9月26日 UTC 07:12 · 中国 · 来源: 量子位
重要度 70

16个Google TPU v7运行Kimi K3模型,达到每秒709个token——比Nvidia的GB200快57%(后者为每秒452个token)。

这项成果的背后是Inferact,一家新近成立的推理初创公司,而非人们可能预期的月之低语智能(Kimi的创造者)或谷歌(TPU的制造商)。Inferact的创始团队由原vLLM开发者组成,他们进行了由a16z和Lightspeed领投的1.5亿美元A轮融资(参与方包括真格基金、Sequoia和Altimeter),估值8亿美元。

这项突破基于一种名为megakernel(大核)的技术——一种推理核,将传统上分开调度的数百个小程序融合成单个大型程序。通过消除上下文切换开销并利用TPU独特的片上内存架构,megakernel将内存带宽利用率推向硬件的理论最大值。结合DeepSeek的DSpark推测解码框架,Kimi K3上实现了每秒709个token的性能,且该实现现已开源。

**相同硬件,不同结果**

Inferact在相同条件下对16个TPU v7 Ironwood和16个GB200进行了基准测试——两者都运行Kimi K3,都使用vLLM推理引擎,仅芯片和核实现有所不同。TPU以压倒性优势胜出:每秒709个token对阵452个,优势达57%。

由DeepSeek开发的DSpark通过让小模型快速预测候选token,然后进行大模型批量验证来加速推理。Inferact在TPU上实现了这条管道,实现了接受长度为6(每次猜测平均验证6个token),单步解码延迟约8.5毫秒。

不使用推测解码的情况下,差距进一步扩大。在批大小为1时,TPU达到每秒249个token,而GB200为127个——差距近乎2倍。在批大小为8时,TPU达到每秒865个token,而GB200达到636个。在使用四个TPU的Qwen 27B上,Inferact达到每秒1,515个token,相应的GB200配置为695个。

速度优势来之不易,精度没有损失。使用贪心解码验证,TPU上的Kimi K3在GPQA-Diamond上得分94.4%,在GSM8K上得分97.2%——与GPU结果相同。

**硬件规格的悖论**

57%的性能差距无法用芯片的原始规格来解释。TPU v7的HBM带宽为7,380 GB/s;GB200更高,达8,000 GB/s。然而带宽较低的芯片却提供了更高的吞吐量——这种反转指向软件而非硅片。

传统推理工作流将计算分散到数百个独立核中,每个核处理狭隘的操作。在核之间的转换中,会积累空隙,内存带宽处于闲置状态。CUDA Graphs和Nvidia的PDL技术缩小了这些差距,但核边界仍然存在。

Megakernel完全消除了这种边界。对于Kimi K3的92个MoE层,Inferact将所有92个编译成单个Pallas程序——单个函数调用执行完整的前向传递。没有边界,跨层权重预取变得无缝:当第N层计算其MoE操作时,第N+1层的注意力权重已经从主内存预取到片上缓存。计算和数据移动重叠;内存带宽很少闲置。

TPU的架构启用了这种方法。每个TPU v7 TensorCore搭载64 MiB的VMEM片上内存,完全由软件控制——工程师精确决定何时加载什么数据以及何时释放空间。这个容量可以容纳当前层的计算数据和下一层的预取权重。GPU架构(Blackwell)在152个SM中分配约38 MiB的片上内存,采用自动硬件调度,这样的精细编排空间较少。

Inferact用Pallas(Google的低级TPU编程语言,相当于Nvidia GPU的CUDA)手工编码了megakernel。TPU的默认XLA编译器擅长单层优化,但92层协调为自动调度找到最优路径提出了过多的决策分支。通过在Pallas中手工编写完整管道,工程师控制了每个数据移动决定。次要好处是:编译时间从30多分钟降至90秒以下,实现了快速迭代——核更改在约90秒内验证。

目前,megakernel针对Kimi K3的架构进行了自定义优化;其他模型架构需要单独适配。Inferact已表示计划将megakernel支持扩展到其他模型架构。

**vLLM的创造者转向TPU**

Inferact由原vLLM开发者于2025年11月创立——这支团队将Nvidia GPU推理推向了显著地位。他们于1月正式推出,立即证明TPU推理现在超过了GPU。

vLLM是开源推理引擎的重量级应用:它支持500多种模型架构,拥有2000多名社区贡献者,为Meta、Google和Character.ai提供生产推理动力。

首席执行官Simon Mo是原vLLM项目维护者和伯克利EECS毕业生,曾在Anyscale工作。联合创始人Woosuk Kwon启动了整个vLLM项目,持有Ion Stoica指导下的伯克利计算机科学博士学位,他撰写了PagedAttention——一种解决GPU内存碎片化的算法,仍是vLLM的核心创新。首席科学家Kai You是清华大学特等奖学金获得者,主导了vLLM的分布式推理能力。

这项TPU megakernel工作来自Inferact和Google Cloud的联合工程协作,旨在使TPU成为一流的vLLM目标。所有优化将贡献给开源社区;tpu-megakernels存储库代表了这一伙伴关系的第一个公开成果。

阅读原文
谷歌TPU在使用DeepSeek开源vLLM框架运行Kimi模型时,性能比英伟达GPU快57%。 · Slicast