2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

Everpure宣布其FlashBlade//EXA存储架构在MLPerf基准测试中,于405B和1.25T参数模型检查点及KV缓存性能方面位列第一。

结果证实高吞吐并行文件系统正成为训练稳定性和推理延迟的关键瓶颈,促使供应商专门设计针对AI检查点和缓存检索优化的存储栈。
行业媒体Slicast · 2026年9月3日 · 全球 · 来源: HPCwire
重要度 75

2026年9月2日,Everpure宣布,在最新发布的MLPerf Storage v3.0基准测试中,FlashBlade//EXA在405B和1.25T参数模型检查点(checkpointing)及KV缓存性能类别中均位列第一。该基准测试旨在评估严苛AI工作负载下的存储性能,而非孤立地衡量指标,从而凸显基础设施对计算效率的直接影响。

当训练任务需要保存检查点,或推理工作负载检索KV缓存数据时,存储便从次要考虑因素转变为关键组件。如果存储无法跟上速度,闲置的GPU和加速器将直接转化为资本浪费和吞吐量损失。

“这些结果再次证明,FlashBlade//EXA提供了市场上最高的性能和规模,始终领先于日益增长的AI工作负载需求,”Everpure首席技术与增长官Rob Lee表示。“处于AI开发前沿的组织需要能够提供极致性能和可扩展性的基础设施,且无需在可靠性和操作简便性之间做出妥协。FlashBlade//EXA是唯一能够实现这一点的解决方案。”

在大规模场景下,检查点测试结果尤为引人注目。在使用30个数据节点、跨越1,024个模拟加速器处理1.25T参数模型时,FlashBlade//EXA在17.74秒内实现了877.52 GiB/s的写入带宽,在28.99秒内实现了588.28 GiB/s的读取带宽。性能从使用10个数据节点时的327.65 GiB/s写入吞吐量,线性扩展至使用30个节点时的877.52 GiB/s。这种线性扩展至关重要,因为AI工作负载本质上是动态的;随着组织扩大计算能力、增加模型规模、摄入更多数据并扩展容量,其底层存储也必须相应扩展。

推理端也发生了类似的转变。随着组织从训练越来越大的模型转向大规模部署服务,KV缓存管理已成为数据路径的重要组成部分。在MLPerf测试中,仅使用存储即可为Llama 3.1 8B工作负载提供每秒85,736个令牌(tokens),结合存储和内存可为8B工作负载提供每秒67,642个令牌,而仅使用存储则为70B工作负载提供每秒33,403个令牌。这些数据突显了行业更广泛的转变:存储不再仅仅是计算操作之间的被动存储库,它必须以由AI工作负载决定的速度积极参与数据路径。

这种性能得益于FlashBlade//EXA的解耦架构,该架构将元数据管理与数据传输分离。在基准测试配置中,配备120个专用于元数据的DirectFlash模块的30个FlashBlade//EXA刀片与30个Linux/NVMe数据节点协同工作,通过统一文件系统提供约866 TB的有效容量。该系统利用基于TCP的NFSv4.1/pNFS进行文件布局协商,并利用基于RDMA(RoCEv2)的NFSv3进行高速数据传输。因此,数据直接穿越底层网络结构,消除了集中式存储路径相关的瓶颈。

随着AI集群的扩展,这种架构差异变得越来越重要。目标不是构建针对单一配置优化的存储系统——这种系统在AI环境演变时需要重新设计——而是部署一种架构,使其容量和性能能够与计算资源无缝扩展,同时不会给工程团队带来额外的复杂性。

这种方法符合Everpure的战略演变,即从传统存储阵列向企业数据云(Enterprise Data Cloud)转型——这是一个软件驱动框架,旨在帮助企业管理和利用数据,以应对日益复杂的环境。AI是对这一愿景最严格的考验之一,因为现代基础设施不能再被视为孤立组件的集合。GPU、网络、存储和数据必须协同运作,且每一方的性能越来越依赖于其他方。在此背景下,可预测地扩展数据传输的能力可能与峰值性能指标同样关键。

Everpure(纽约证券交易所代码:P)通过行业领先且持续演进的存储和数据管理平台,赋能组织掌控其数据。该公司确保数据在AI时代保持可访问、智能且优化性能,从而帮助企业释放数据的全部潜力。Everpure简化了数据管理,同时扩展了性能并显著降低了能耗。凭借超过十年的最高净推荐值(Net Promoter Score)之一,Everpure成为全球最具创新力组织的首选合作伙伴。欲了解更多信息,请访问www.everpuredata.com。

来源:Mike Adams, Everpure

阅读原文