SemiAnalysis播客讨论AI推理芯片竞争格局,包括谷歌TPU v7、Vera Rubin架构和Groq、Cerebras、SambaNova等厂商。
根据InferenceX的数据,开源推理服务目前利润非常丰厚。根据其利润估算器,在GB300 NVL72机架上以60%利用率服务Kimi K3——计入Moonshot的30%许可费后——可产生约40-50%的利润率。该团队主张即使30-40%的利用率仍保持盈利。这一评估基于AgentX基准,该基准回放从SemiAnalysis员工自身基础设施捕获的实际代理编码会话,其中理论缓存命中率超过98%,而DRAM卸载在高吞吐量运行点可恢复其中的20-30%。
**N-gram层与内存带宽限制**
N-gram层是对HBM稀缺性的一种共设计应对方案。与其让transformer的每一层都构建令牌序列的含义不同,2-gram和3-gram令牌嵌入在训练时学习、存储在哈希表中,并在推理时查找。这种机制有效地"免费"创建了层——模型停止花费参数来记忆词义,转而在堆栈早期更快地实现下一令牌预测。DeepSeek的消融实验表明,在某个中间点(既有n-gram层又有MoE层)而不是任一极端处,损失最小化,且早期和晚期隐藏状态之间的KL散度随n-grams而缩小,表明模型更早地确立了含义。
推理时,n-gram输入仅是令牌ID,支持与其他计算重叠的异步检索。这产生了一个放置权衡:n-gram层在模型早期最有帮助,但将其放在第一层会留下无法与检索重叠的空间。Qwen 3.8 Flash Next在第二层放置n-gram,以便DRAM或SSD检索器有时间返回结果,而V4.1 Flash在第一层放置,重叠空间较少。卸载使用统一虚拟寻址将n-gram移入CPU固定主机内存。美国和中国实验室之间的架构差异反映了底层硬件限制:美国实验室优化HBM带宽而非容量(因为容量限制尚未被强加),而中国实验室已经被迫面对,特别是考虑到Ascend 950的国产高带宽内存(带宽低于可出口HBM)。美团的LongCat团队声称同时在开发n-gram,提示这一技术代表了对容量限制的收敛响应。
**AgentX基准与KV缓存卸载**
AgentX用代理编码流量的系统级回放取代了早期的芯片级基准。工作负载遵循以下模式:代理工具发送消息,模型调用工具,工具输出被追加,不断增长的消息流在每一轮被重新发送,因为模型是无状态的。对于百万令牌上下文模型,KV缓存存储变成了严重瓶颈。数据集由拦截SemiAnalysis员工代理编码会话的代理捕获,经后处理以移除错误请求,然后针对运行开源推理的真实服务器回放。回放跟踪中的理论缓存命中率超过98%。
在B300 vLLM上,在每秒40-60令牌的高吞吐量范围内,卸载变得高度相关——离线批推理或具有数百个并发代理会话的强化学习展开——其中DRAM卸载在仅HBM之外恢复了20-30%的额外缓存命中率。堆栈使用Nixl进行KV传输、vLLM进行KV卸载到CPU、纯DRAM卸载,以及Dynamo路由器。数据集中的P50请求包含近100,000个输入令牌。
**利润率与TCO建模**
InferenceX的TCO模型分解每小时加速器成本——数据中心、电力、芯片——并将其与OpenRouter定价数据和InferenceX吞吐量及并发数字相结合,以估计利润。在GB300 NVL72最优服务配置上,Kimi K3产生约40.70%的利润率,而DeepSeek V4.1 Flash显示某些配置无利润。在60%利用率且Moonshot 30%许可费的情况下,利润率达到约50%,即使在30-40%利用率下盈利也能维持。拥有私有配置的推理提供商应超过这些开源基础的数字。随着计算定价调整,这些利润率预期会趋于正常。
**TPU v7成本竞争力**
TPU v7(谷歌现通过其自有云购买)位于B200和B300的成本-每令牌帕累托曲线底部,外部TCO约为每百万令牌1.21美元。近期的TPU超级内核工作带来了大幅性能提升,进一步改进预期。结构性论证关乎外部化:当谷歌从将所有TPU分配给内部工作负载转向对外销售大份额时,这推动了开源生态系统改进,包括用原生Torch后端替代现有中间表示链的TPU本地支持。历史上,TPU固定大小的脉动阵列对较小模型造成填充和浪费,且因TPU主要是内部使用,许多模型围绕这一限制构建,而开源则不然。TPU部署在新云——首次在GCP外的托管——代表可能的降价发展。
**Vera Rubin性能**
在DeepSeek V4 Pro上,Vera Rubin在提供商实际服务的交互范围内提供约3倍的更好性能,相当于在相同延迟下3倍更多的并发用户,对应的利润增加反映在利润估算器中。前一代(HGX H100/H200至GB200/GB300)引入了ARM CPU、扩展NVL交换机、新的400G/800G网络,以及具有新FP4数据类型的SM100修订版。Vera Rubin在物理和软件支持上更为递进。8高配置和降低VRAM反映了对内存带宽而非单个GPU容量的优先级,扩展网络允许在更多GPU间分散模型以使用额外内存带宽。真正新颖的项目是LUTB,一条硬件加速查找表量化路径,在PTX和开源Triton分支中确认,使用3位密钥查找8位表值。