分析显示,与英伟达加速器相比,Google的TPU每美元推理性能高出多达50%。
半导体研究机构 SemiAnalysis 发布了针对谷歌第七代定制 AI 芯片 TPUv7 Ironwood 的首份第三方推理基准测试报告。在同等条件下,Ironwood 的每美元性能比英伟达(Nvidia)的 B200 和 B300 高出高达 50%,这标志着谷歌正式进入与英伟达在 AI 推理芯片市场的直接竞争。
该报告以 Qwen3.5 397B FP8 模型为基准,在聚合服务模式(aggregate serving mode)下将 Ironwood 与英伟达的 B200 和 B300 进行了对比。在每位用户每秒 100 个 token 的交互吞吐量下,Ironwood 的推理成本约为每百万 token 0.181 美元,分别比 B200 的 0.222 美元和 B300 的 0.276 美元低约 19% 和 34%。
在低并发、高交互的场景中,这一优势更加明显。在每位用户每秒 20 个 token 的交互速率下,Ironwood 每芯片的总吞吐量达到每秒 9,364 个 token,超过了 B200 的 8,903 和 B300 的 8,925——吞吐量领先约 5%。结合更低的每芯片小时成本,Ironwood 每美元生成的 token 数比 B200 多 50.4%,比 B300 多 96.0%。
在端到端延迟方面,Ironwood 也保持了强劲的竞争力。在中位响应时间为 20 秒时,其每百万 token 的成本降至约 0.098 美元,分别优于 B200 的 0.106 美元和 B300 的 0.132 美元,幅度分别约为 8% 和 25%。
然而,基准测试结果并非一边倒。在中位响应时间围绕 30 秒的狭窄区间内,B200 仍能提供更优的每美元性能。此外,由于 Ironwood 目前缺乏原生的 FP4 计算支持,英伟达在 FP4 精度工作负载中仍占据优势。
| 指标 | Ironwood | B200 | B300 |
|---|---|---|---|
| 每百万 token 成本(100 tokens/sec 交互) | $0.181 | $0.222 | $0.276 |
| 每芯片吞吐量(20 tokens/sec 交互) | 9,364 tokens/sec | 8,903 tokens/sec | 8,925 tokens/sec |
| 每美元 token 优势(vs B200/B300) | — | +50.4% | +96.0% |
| 每百万 token 成本(20-sec 中位响应) | $0.098 | $0.106 | $0.132 |
*注:数据源自 SemiAnalysis 测试报告;基准模型为聚合服务模式下的 Qwen3.5 397B FP8。*
根据谷歌的内部总拥有成本(TCO)计算,在高并发条件下,Ironwood 的每美元性能优势显著扩大。在 256 个并发请求下,其对 B200 的优势达到 76.7%,对 B300 的优势延伸至 130.2%。不过,SemiAnalysis 警告称,这些效率提升伴随着延迟惩罚:在 256 并发时,Ironwood 的首 token 平均时间(TTFT)上升至 5.41 秒,而 B200 为 3.75 秒,B300 为 2.40 秒。
在非等效比较场景中——具体而言,当 GB300 NVL72 利用解耦服务(disaggregated serving),而 TPUv7 依赖聚合服务时——GB300 在中程端到端延迟区间仍保持约 30% 的每美元性能优势。SemiAnalysis 预测,一旦 TPUv7 的解耦服务优化完全实施,这一差距将会缩小。
**软件栈突破:TorchTPU 取代 TorchAX**
长期以来,外部化谷歌 TPUs 的主要瓶颈在于软件栈。此前,外部开发者被迫通过 TorchAX 将 PyTorch 模型转换为 JAX 执行——这一工作流程在底层优化、分页注意力机制以及与 vLLM 架构的兼容性方面面临诸多挑战。
新的 TorchTPU 框架通过利用 PyTorch 的 PrivateUse1 后端扩展点,直接将 TPU 暴露为原生 PyTorch 设备,从而解决了这一问题。开发者现在可以使用 `.to("tpu")` 调用,同时保留熟悉的分布式训练接口,如 DDP、FSDP2 和 DTensor。在编译期间,TorchDynamo 和 AOTAutograd 生成 FX 计算图,由 TorchTPU 将其降低为 StableHLO。随后,XLA 将这些代码编译为 TPU 可执行代码,而底层的 Pallas 内核继续处理性能关键操作。
这一架构转变具有重大的实际意义:vLLM 和 SGLang 现在可以重用大量上游模型代码、调度逻辑和 API 结构,无需在 PyTorch 和 JAX 之间进行跨框架重建。SemiAnalysis 报道,Inferact、RadixArk 和 Red Hat 正在积极与谷歌合作,确立 TorchTPU 作为 vLLM 和 SGLang 的一等支持后端。
目前处于私有测试阶段的 TorchTPU 计划于十月的 PyTorch 会议上开源。在对 Qwen3.5 397B 模型进行初步适配后,谷歌打算将支持扩展到 Kimi K3、GLM5.3 以及其自身的开源 Gemma4。SemiAnalysis 预计,一旦一组核心模型得到优化,集成额外模型的边际成本将大幅下降,这可能使 TPUs 能够在 vLLM 和 SGLang 上实现 Day 0 支持。
**内核优化与硬件架构**
为了实现这些性能指标,谷歌工程团队在 TPU 推理内核上部署了广泛且有针对性的优化。关于注意力并行性,TPU 后端引入了 8 路注意力数据并行(DP8)和 8 路专家并行(EP8)的混合配置支持,以适应 Qwen3.5 的分组查询注意力(GQA)层——该层具有 32 个查询头,但仅有 2 个键值头。这种方法有效地消除了不必要的 All-to-All 通信开销。
通信优化包括将专家 ID 和路由权重合并到统一的 All-Gather 操作中,这在 DeepSeek-V3 测试中将每层的延迟降低了约 80 微秒——相当于在 58 层的前向传播中节省了约 4.64 毫秒。此外,ReduceScatter 集体操作被迁移到 SparseCore 执行,并与双缓冲技术配对,以实现计算和通信的无缝流水线处理。在 8k1k 工作负载下,这些调整在 64 到 512 的并发级别上带来了 4.1% 到 14.2% 的吞吐量提升。
在混合模型状态管理中,将循环状态存储精度从 FP32 降级为 BF16,在保持向量内存(VMEM)内 FP32 算术精度的同时,将高带宽内存(HBM)占用率减半。这一调整使 512 并发下的 1k8k 吞吐量提高了 15%。同时,对 KV 缓存页面布局的优化使可用页面数量从 5,141 增加到 10,283,导致在 128 并发下的 8k1k 测试中吞吐量增加了 16.5%,并将中位 TTFT 削减了 95%。
SemiAnalysis 将谷歌的推理成本优势归因于其芯片、互连网络和编译器之间的紧密协同设计,而非依赖原始的单芯片计算扩展。打破了 TPU v4 和 v5p 时代的 MegaCore 架构,TPUv7 Ironwood 集成了两个通过高带宽片间接口链接的独立计算裸片。每个芯片包含两个 TensorCores 和四个第三代 SparseCores,提供的前一代 Trillium 约六倍的 HBM 容量,并首次引入原生 FP8 硬件支持。
对于矩阵乘法单元,Ironwood 使用了一个 256×256 的脉动阵列,能够每个周期执行 65,536 次乘加运算——是前代 128×128 设计的四倍。然而,这种架构对模型张量形状施加了严格限制:维度必须填充至 256 的倍数,否则矩阵单元(MXU)利用率会下降。例如,在 Llama 3 8B 中,注意力头测量为 128 维,Ironwood 上双重注意力矩阵乘法的 MXU 利用率上限仅为 50%。
关于芯片互连,Ironwood 保留了 3D 环面拓扑。其基本构建块由排列成 4×4×4 立方体的 64 个芯片组成,可以通过光电路交换机(OCS)扩展为由 9,216 个芯片组成的超级集群,提供 42.5 FP8 exaflops 的聚合计算能力。片间互连(ICI)网络独立于主机 CPU 运行,允许芯片之间直接交换激活值和梯度,并在整个集群中提供接近 NVLink 级别的带宽。
**外部客户与竞争格局**
Anthropic 承诺购买超过一百万个 TPUs,成为谷歌最大的外部 TPU 客户,预计到 2029 年其使用量将超过 DeepMind 的内部消耗。SemiAnalysis 预测,随着关键优化——包括解耦预填充/解码(PD Disaggregation)和推测解码——的推出,TPUv7 的竞争力将进一步增强,使其能够在整个性能谱系中与英伟达的 GB200 和 GB300 NVL72 相抗衡。
谷歌新宣布的第八代 TPU 架构标志着训练和推理的战略分离,为每种工作负载引入了专用芯片:用于训练的 TPU 8t 和用于推理的 TPU 8i。TPUv8i(代号 Boardfly)放弃了 3D 环面拓扑,转而采用基于高基数交换机(high-radix switches)的扁平分层网络。在 1,024 到 1,152 个芯片的部署规模下,该架构将网络直径从约 16 跳减少到约 7 跳——降幅超过 50%——这显著抑制了混合专家(MoE)路由和多轮代理工作负载中的尾部延迟。TPUv8i 还提供了 19.2 Tb/s 的 ICI 带宽和 384 MB 的片上 SRAM。