在Hot Chips 2026上,XCENA展示了其MX1设备将CXL内存控制器与3072个RISC-V核心及SSD分层技术相结合,三星则展示了其LPDDR5X-PIM解决方案的扩展能力。
XCENA 将在 Hot Chips 2026 上与三星联合举办会议,展示其 MX1 CXL 计算内存设备,并将该芯片与机架级 CXL 内存架构相结合。MX1 是一种 Type 3 CXL 组件,将三种功能集成在一个封装中:CXL 内存扩展、通过 SSD 支持并作为字节寻址 CXL 内存暴露的存储,以及跨越数千个 RISC-V 核心的近内存处理。在先前对第一代 MX1 作为 CXL 3.0 计算内存部件的报道基础上,本次会议将该技术的范围扩展到了机架级系统。
XCENA 的核心观点是,AI 工作负载在达到原始计算能力的极限之前,早已受限于内存容量、带宽和能效。MX1 通过四个 DDR5-8400 通道解决这些限制,支持高达 2TB 的 CXL 内存扩展。此外,连接到 MX1 根端口的 SSD 被主机识别为完全可寻址的 CXL 内存。近内存计算由直接集成在芯片上的 3,072 个定制 RISC-V 核心提供。
MX1 芯片采用三星晶圆厂(Samsung Foundry)的 4nm 工艺制造,并被划分为 24 个子系统。每个子系统包含四个集群,每个集群有 32 个内存单元(MUs),总计 3,072 个 MUs。XCENA 将子系统定义为主机作业分配的基本单位;每个子系统可以执行独立的工作负载,同时共享一个 128MB 的 L3 缓存。
XCENA 选择了大量简单的有序 RISC-V 核心,而非少数高性能核心,这与目标工作负载受带宽限制和对功耗敏感的特性相一致。这种架构使得能够集成 3,072 个核心,同时保持每字节的低能耗。开放的 RISC-V ISA 提供了成熟的开发工具链,并支持针对数据并行任务定制的指令,包括内存分析、检索增强生成(RAG)检索和内存压缩。
向量处理引擎(Vector Processing Engine)为标量 MUs 补充了专用的向量执行路径。每个 MX1 SoC 可实现约 3 TFLOPS 的点积峰值吞吐量,支持逐元素算术、归约、CRC32 和向量-标量计算等操作。每个 MU 专用的命令队列针对 RAG 向量搜索和 KV 缓存评分进行了优化。
片上局部性得到了精心管理。每个集群具有一个跨四个 MUs 共享的 8KB L1 指令缓存,以及一个在其 32 个 MUs 之间共享的 256KB L2 数据缓存。一个 128MB 的末级缓存(LLC)连接各个集群。指令获取使用物理地址,而数据访问依赖主机虚拟地址,地址转换在集群级别协调进行。
一个关键的软件设计选择是实现主机和 MUs 之间共享的统一虚拟地址空间。通过允许主机和设备引用相同的指针,指针密集型数据结构可以安全遍历,基于 `malloc` 的传统应用程序只需极少重构即可迁移到 CXL 内存。一个感知 CXL 的分配器维护每个租户的页表,以隔离应用程序内核和内存分配。
在软件栈方面,XCENA 提供了 PXL(Parallel Xceleration Library),这是一种类 MapReduce 风格的运行时环境。PXL 管理从设备上下文初始化到在 C/C++ 或 Rust 中定义内核的应用程序生命周期。它负责在一个或多个子系统之间调度作业,并公开一个 map API,将工作分布在 MU 核心上,自动处理内存分配和同步。
XCENA 报告称,与主机通过 CXL 配置相比,吞吐量提高了多达 4.7 倍,与本地 DRAM 相比提高了 2 倍,同时消耗的功率约为主机功率的四分之一。这些指标转化为比 CXL 高出多达 18.7 倍、比 DRAM 高出 6.2 倍的效率提升。基准测试使用 Intel Xeon 6767P 参考平台进行,测量中排除了空闲功耗。
超越 DRAM,MX1 通过 XCENA 的“无限内存”(Infinite Memory)架构将 SSD 容量暴露为字节寻址的 CXL 内存。这种 DRAM 和 NAND 混合方案利用板载 DRAM 来缓存 SSD 页面。数据被分割成 64KB 的页面,由一个 1,024 项的映射缓存 TLB 管理,缓存未命中由在 MU 核心上执行的固件服务。虽然概念上类似于现有的内存分层解决方案,但 XCENA 的实现与 CXL 互连紧密集成。这种方法强调了在英特尔 Optane 停产之后,行业继续依赖基于 NAND 的缓存层。
无限内存直接解决了生成式 AI 工作负载中的 KV 缓存管理问题。当提示前缀被固定到驻留内存时,XCENA 演示的查询首令牌时间(TTFT)性能达到原生 DRAM 的 1.13 倍。移除固定会使延迟增加到 1.57 倍,而原始 SSD 基线则达到 1.86 倍。一种 lookahead 预取机制利用设备的未充分利用情况,将性能恢复到接近 DRAM 的水平。基准测试使用了带有 vLLM、LMCache 和 NVIDIA RTX 6000 Pro GPU 的 Llama-3.1-8B。
会议的后续部分突出了三星利用 MX1 进行的近内存处理研究。三星的方法强调利用 CXL 互连后面可用的高 DRAM 带宽,通过在原位执行计算并仅传输聚合结果来实现。演示文稿对比了 268.8 GB/s 的 DDR5 带宽与 64 GB/s 的 PCIe Gen6 x8 主机链路,反映了 Gen6 服务器处理器当前的推出时间表。在会议期间,三星指出,CXL 在主要超大规模厂商中的采用正在加速,特别是在数据库加速和 AI/KV 缓存工作负载方面。
三星和 XCENA 概述了一种机架级 CXL 计算内存架构,使 GPU 服务器能够通过 CXL 语义池化内存。参考配置集成了 Liqid CXL 交换机和配备 96GB NVIDIA RTX Pro 6000 Blackwell 加速器的 GPU 服务器,目标是实现 20TB 的总内存容量和 2.7 TB/s 的持续带宽。
为了促进软件集成,三星引入了 NDC API,这是一个供应商无关的近数据处理库,通过 OCP Foundation 的 FTI DCC 倡议开源。通过 OpenXLA 和 PrivateUse1 后端实现 PyTorch 兼容性,使 AI 框架能够直接与 XCENA PXL 运行时接口,而无需进行应用程序级别的修改。
三星演示了两种主要的 AI 工作负载。第一种侧重于使用 CXL 加速的 PNM 和 FAISS IVF Flat 索引进行 RAG 向量搜索。由于 L2 k-最近邻距离计算严重受内存带宽限制,三星将该操作卸载到 MX1 设备。部署 10 个 PNM 单元产生的每秒查询数比主机 CPU 配合标准 CXL 内存池高出 64 倍,查询能效提高了 65 倍,使用的是源自 LAION-5B 数据集的 5.12 亿向量 FAISS 索引。
第二种工作负载针对通过 GPU 加 PNM 混合注意力机制进行的 LLM 解码。在这种架构中,频繁访问的(“命中”)KV 缓存页面保留在 GPU 上,而被驱逐的(“缺失”)页面路由到 PNM 设备。PNM 单元不将整个 KV 页面传回主机,而是计算并仅返回生成的注意力分数。解码时间线比较了传统的仅 GPU 注意力加载来自 CXL 的 KV 缓存与此混合卸载策略。
三星强调了混合解码路径上的显著性能提升。在 100K 上下文窗口下运行,PNM 池将吞吐量提高了 3.35 倍,每能量令牌效率提高了 3.84 倍,分别实现了每秒 17.7 对 5.50 个令牌和每千焦耳 4.31 对 1.12 个令牌。基准测试在两台服务器上执行 INT8 精度的 LLaMA-3.1-70B,每台服务器配置五个 MX1 设备和 NVIDIA RTX Pro 6000 Blackwell GPU。
总体而言,XCENA 和三星正将 MX1 定位为生产就绪的硅片,它是计算内存范式的关键。该合作伙伴关系将加速器、PXL 运行时和无限内存缓存与三星的机架级池化基础设施整合在一起。
XCENA 的演讲强化了这一论点:内存容量、带宽和效率——而非原始计算能力——仍然是 AI 和分析工作负载的主要瓶颈。提出的解决方案将优化逻辑从主机 CPU 或 GPU 转移到专用的 CXL 设备。通过结合近内存 RISC-V 计算、SSD 支持的字节寻址存储以及三星的机架级池化,该架构建立了一个新的内存层级,能够同时扩展容量和处理能力。随着技术的成熟,这种集成方法及其 SSD 分层实现的实践验证将受到密切关注。