在Hot Chips 2026大会上,Oxmiq Labs展示了针对AI计算工作负载的高带宽互连与HBM的对比分析。
Oxmiq Labs 在 Hot Chips 2026 大会上展示了其在 AI 计算领域的 HBF(高带宽闪存)技术,主张将高带宽闪存作为 AI 推理的专用容量层级。该演示文稿概述了三个等级的 HBF 硬件规格,最大用户带宽从 0.384 TB/s 扩展至 3.072 TB/s,UCIe 数据速率从 8 GT/s 提升至 32 GT/s。在 16-high 堆栈配置下,容量最高可达 512 GiB。Oxmiq 的核心论点是,在同等成本下,HBF 提供的容量是 HBM 的八到十六倍。
在更广泛的内存技术格局中,Oxmiq 使用 alpha 和 beta 对技术进行映射,其中 beta 追踪成本,alpha 追踪带宽。在此框架下,HBF 占据了一个独特的容量利基市场,而非作为 HBM 的低成本替代品。这一区别在考察模型架构时变得至关重要。大型混合专家(MoE)模型在批处理大小和每秒令牌数方面与稠密模型的工作方式不同。MoE 架构引入了一个子阶段,在该阶段较小的批处理将完整模型保留在内存中,从而允许较低的带宽。
Oxmiq 围绕每令牌成本重新构建了推理经济学,认为真正的衡量标准取决于内存如何通过带宽来持有和输送数据。该公司在同一成本范围内评估了三种部署配置:仅 HBM 基线、全 HBF 设置以及 2x HBF 与 6x HBM 的混合方案。这些选项以峰值带宽换取扩展容量。虽然 HBM 基线实现了 22 TB/s 的峰值带宽和 288 GB 的容量,但全 HBF 配置的峰值带宽降至 12.8 TB/s,同时将容量扩展至 4 TB。
使用 72-GPU 机架进行的模拟具体展示了这些权衡。在以解码为主的 Kimi-K2 1T 模型运行中,采用 FP4 精度,输入为 1M 令牌,输出为 1K 令牌,Oxmiq 发现与等效 HBM 机架相比,HBF 提供了约 14 倍的容量,而带宽仅为原来的约 0.6 倍。性能随上下文长度变化显著。在短上下文(256-by-256)场景下,HBF 在低批处理大小下具有成本优势,但会留下 85% 的“死容量”。扩展到长上下文工作负载(1M 令牌输入,1K 输出)则改变了优势方向;只要带宽需求保持较低,容量优势依然存在,一旦超出此范围,HBM 将重新占据优势。
在混合部署中,HBM 可充当热专家缓存。由于专家在不同查询中的流行度趋于平缓,缓存主要在低批处理大小或相似查询分组时产生回报。一项初步模拟绘制了每令牌的机架美元成本与单服务器容量的关系图,证明每吉字节成本较低并不等于每令牌成本较低。这一数学分析阐明了 HBF 可行性的边界和最佳部署区域。跨批处理大小的相同权衡映射显示,HBM 在机架规模上保持优势,而 HBF 最符合优先考虑每节点容量的部署。针对单个服务器内带宽与容量划分的次要分析进一步强调,将内存与部署规模相匹配的重要性不亚于每吉字节的标价。
实施 HBF 引入了特定的软件要求。最佳带宽需要 64 KB 的访问块,且该内存表现出在 85 摄氏度下约 24 小时的上电数据保持时间,这需要主机管理生命周期处理。由于 HBF 是读优化且写受限的,数据放置成为一个由软件驱动的挑战。Oxmiq 审查了推理引擎生态系统,涵盖 vLLM 和 SGLang 等生产框架,以及 TensorRT-LLM 和 AWS Neuron 等厂商优化堆栈。该公司确定 vLLM 为生产默认值及 HBF 集成的主要焦点。
分析 Kimi-K3 等模型时,Oxmiq 指出,约 93% 的字节由总计 1.45 TB 的 MoE 专家权重组成。因此,HBF 最适合用于 MoE 专家池和 KV 缓存卸载,而 HBM 则保留注意力权重和频繁访问的热数据。在 vLLM 内部,Oxmiq 提出了一种插件,用 HBF 替换用于 KV 缓存和 MoE 专家池的主机 CPU 固定内存。配备四个 HBM 堆栈和四个 HBF 堆栈的 GPU 将实现 2.2 TB 的总内存,峰值带宽约为 17.4 TB/s,大幅超越当前的卸载能力。
Oxmiq 将稀疏注意力模型(如 DeepSeek Sparse Attention 和 Compressed Sparse Attention)视为 HBF 的有力候选者,因为它们与低带宽、高容量工作负载相契合,尽管采用情况仍取决于模型设计。该公司还强调专家并行性是关键用例。廉价的 HBF 容量减少了对广泛 EP 分片的需求,并最小化了 all-to-all 通信。与其在八个 GPU 之间分割专家并产生层间流量,两个节点可以将专家本地存储在 HBF 中。
Oxmiq 总结认为,HBF 并非通用替代品,而是一种专为推理工作负载狭窄细分领域量身定制的专用容量工具。它在带宽需求较低的场景中表现卓越,例如运行小批量的 MoE 模型配合长上下文稀疏 KV 缓存。这种审慎的观点与许多 HBF 推广者的乐观叙事形成对比,提供了更为平衡的视角。最终,将内存架构与工作负载特征及部署规模相匹配,比单纯的每吉字节原始成本指标更为重要。在 HBF 变得广泛实用之前,强大的分配器和放置策略将是必不可少的。现代 AI 原生编码工具可能会加速这些缺失软件组件的开发,使其实施负担轻于以往。