2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

DeepSeek最近关于其AI系统中高效HBM使用的声明正在压低三星电子和SK海力士的估值。

中国AI公司展示了存储效率竞争力,挑战了超大规模云厂商关于无限HBM需求的假设;对存储供应商利润率造成了竞争压力。
行业媒体Slicast · 2026年9月12日 UTC 04:39 · 美国 · 来源: | NeoTeo
重要度 70

星电子股价在2026年9月11日于首尔交易所下跌3.5%,SK海力士股价下跌2.2%,原因是有报道称DeepSeek的AI模型需要更少的高带宽内存(HBM)。市场反应是切实的,但其底层结论——DeepSeek已永久性地降低了全球HBM需求——在技术层面缺乏支持。

DeepSeek的工作展示了更狭隘和具体的内容:多种架构技术可以减少推理过程中产生的内存压力,特别是对于称为KV缓存的注意力数据。这并不等同于从AI系统中消除HBM。

投资者的担忧很直接:如果每个AI请求需要更少的高带宽内存,芯片制造商最终可能会减少其出货量。但这种解释从模型级效率声明跃升到全球硬件需求预测。虽然相关,但两者不能互换。一个模型可以在推理的一个组件中使用较少的内存,同时仍然为其权重、激活、加速器间通信和生产服务所需的总吞吐量需要大量内存。

因此,近期的市场行动反映了对短期半导体需求的担忧。它本身并不能衡量全球HBM消费,也不能确立三星电子或SK海力士基本面的持久变化。

**DeepSeek实际优化的内存**

HBM是堆叠的DRAM,位于加速器旁边,用于超高带宽数据移动。它对要求苛刻的AI训练和推理系统至关重要,但不同于模型的KV缓存。

KV缓存存储由注意力机制生成的键值信息,当模型处理对话或其他长序列时。因为这个存储的状态随着上下文长度增长,它可能成为推理过程中加速器内存压力的主要来源。

DeepSeek的多头潜在注意力(MLA)通过将键值信息压缩为可以缓存的潜在表示来解决这个压力。较小的注意力状态减少了该工作负载特定部分的内存需求。

Engram采取了不同的方法,使用与卸载内存层次结构连接的条件内存,允许静态或可检索的知识驻留在加速器最受限制的内存之外。加速器仍执行模型的主动计算,而内存系统管理不需要完全驻留在设备上的信息。

这些机制解决了不同的问题,不应该合并为单一的标题数字。MLA涉及压缩的注意力状态。Engram涉及条件内存和卸载。两者都没有声称所有物理HBM需求已消失。

**报告的DeepSeek V4数据意义**

一份次要报道在百万令牌的上下文中为DeepSeek V4标注了两个数字:DeepSeek V3.2的KV缓存需求的10%和其单令牌推理浮点运算次数的27%。这些是特定的工作负载指标。第一个描述了相对于DeepSeek V3.2的KV缓存使用;第二个描述了单令牌推理的计算。两者都不衡量总HBM容量、HBM出货量或内存芯片收入。

另一张技术图表显示DeepSeek V4-Pro在1,024K序列长度下的累积KV缓存比DeepSeek V3.2低13.7倍。该数字属于不同的模型标签和呈现,不应与10%数字合并,好像两者都衡量相同的变体、基线或条件。

实际的教训很简单:始终指定哪个内存、哪个模型、哪个工作负载和哪个上下文长度。没有这四个细节,"更少的内存"太模糊,无法支持硬件需求预测。

**为什么KV缓存节省不等于HBM出货量降低**

想象一个AI加速器作为一个繁忙的工作室。KV缓存是工作台旁边的一堆零件——不是整个建筑。使那堆零件变小会创建空间,但它不会移除机器、原始材料或通过设施的流量。

几个其他因素仍然至关重要:

模型权重必须存储在系统可访问的某处。

激活——在模型处理输入和生成输出时创建的中间值——仍然需要存储。

注意力和计算:压缩缓存状态不会消除产生结果的操作。

通信:多加速器系统仍然在设备和内存池之间移动数据。

工作负载形状——长上下文、批大小、响应速度和总并发用户——都改变内存需求。

软件优化也可以使受限的硬件更有用,而不改变其物理内存容量。英伟达H100和H800说明了这一区别:H100提供900 GB/s的互连带宽,而H800提供400 GB/s。诸如低精度计算和低级调优等技术有助于管理带宽瓶颈,但它们不会将内存容量转换为带宽,也不会使这两个资源可互换。

HBM和DDR5在系统中也占据不同的角色。HBM为加速器附近的超高带宽而构建;DDR5是通用系统内存。在每个AI工作负载中,不能简单地用一个替换另一个。

**更高效的AI会增加内存需求吗?**

是的,至少在原则上。如果推理变得更便宜,提供商可能会运行更多请求、支持更长的上下文,或将AI功能提供给更多用户。这种可能性通常通过杰文斯悖论描述:当效率收益使资源更便宜时,它们可以增加总消费。

这仍然是一种可能性,而不是衡量的市场结果。对于内存压力直接降低所需硬件数量的工作负载,相反的结果也是可能的。平衡取决于部署规模、模型需求、服务经济学和训练与推理工作负载的混合。

这就是为什么股票反应应该被理解为早期市场担忧,而不是对HBM的最终判决。

**市场背景**

| 公司或基准 | 2026年9月11日报告的股份变动 | 价格与账面价值的关系 | 距离历史高点的距离 |

|---|---|---|---|

| 三星电子 | −3.5% | 当前账面价值的2.7倍 | 下跌超过25% |

| SK海力士 | −2.2% | 当前账面价值的5倍 | 下跌超过25% |

| 费城半导体指数 | — | 账面价值的11倍 | — |

估值数字提供了对这些公司在那一刻如何被看待的背景;它们不是投资建议。日常市场价格变化迅速,一个交易日无法解决关于长期半导体需求的问题。

**证据支持什么——不支持什么**

DeepSeek报告的效率工作可以减少KV缓存使用并在特定推理条件下缓解加速器内存压力。Engram的卸载内存层次结构可以将条件内存工作从加速器中移开。MLA可以压缩推理期间保留的注意力状态。

这些代表了有意义的工程发展。它们不等同于总HBM容量、HBM出货量或全球需求的确认减少。HBM仍然与模型权重、激活、注意力、通信和高吞吐量部署相关。

最清晰的——也是最有用的——结论也是最谨慎的:DeepSeek可能正在使AI推理更节省内存,但9月11日的市场反应并不能证明HBM需求已永久性下降。下一步行动不仅取决于每个请求节省的内存,还取决于该效率在多大程度上扩展了业界能够承担的AI请求数量。

阅读原文
DeepSeek最近关于其AI系统中高效HBM使用的声明正在压低三星电子和SK海力士的估值。 · Slicast