芯片与硬件 · 报道
SK Hynix将近存储反量化架构集成至自定义HBM用于LLM推理。
HBM供应商添加定制逻辑以降低推理成本;超越原始带宽的架构差异化。
行业媒体Slicast · 2026年7月13日 UTC 19:42 · 美国 · 来源: Semiconductor Engineering
重要度 60SK海力士研究人员发表了一篇技术论文,介绍了StreamDQ,这是一种加速人工智能推理的新型方法。该论文题为《StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration》,提出了一项轻量级架构增强,能够在内存子系统中实现即时反量化,用于高吞吐量、大批量大语言模型推理。
StreamDQ架构实现了显著的性能提升,对混合精度GEMM操作达到了高达7.08倍的加速和90.23%的能耗降低。通过在内存附近而非计算核心处执行反量化,该方法解决了量化大语言模型推理中的关键瓶颈——带宽受限的内存操作一直是吞吐量的限制因素。