DeepSeek和Huawei已发布针对Huawei Ascend 950 AI加速器的开源编程工具和库(计算和通信库),旨在减少Nvidia生态系统依赖。
DeepSeek与华为联合发布了针对华为昇腾AI芯片的开源编程工具,旨在减少对英伟达软件和硬件生态的依赖。据路透社9月30日报道,此次发布包含用于AI计算和芯片间通信的开源库,以及针对高阶编程语言TileLang的原生昇腾支持。DeepSeek表示这些工具由华为全力支持开发,目的是简化编程流程,使开发者能够充分发挥硬件性能。
两家公司对以128个昇腾950芯片为核心的超级节点系统的计算和通信能力进行了优化。他们的工作针对跨多个加速器运行大规模AI工作负载的两个核心需求而进行:在单个芯片上高效执行计算,以及在芯片间快速传输数据以保持处理器的运行效率。
发布的库包括DeepGEMM-Ascend,用于处理矩阵乘法和DeepSeek模型中使用的其他计算。它支持BF16、FP8和FP4运算,并采用与DeepSeek现有DeepGEMM库相同的编程接口,使开发者在迁移至昇腾时能保持熟悉的API。DeepEP-Ascend负责训练和推理的通信,包括在混合专家模型中将数据路由至不同的专家并合并其输出。这两个库均在昇腾950硬件上开发和测试完成。
TileLang提供了优化内核编写的高级编程层。DeepSeek将其描述为提供"比英伟达CUDA更简洁的编程模型",旨在提高开发效率并简化代码。该语言已支持英伟达及其他硬件平台,较早的适配器也可用于华为昇腾处理器。9月30日的更新为昇腾950添加了原生支持,包括代码生成、自动调度和同步功能。
这些工具建立在华为现有CANN软件平台的基础之上,该平台为昇腾AI工作负载运行提供底层基础设施。英伟达的CUDA平台长期以来为开发者提供了成熟的编程环境和针对其GPU的优化库,成为该公司AI计算领域的重要竞争优势。虽然DeepSeek的此次发布为开发者提供了额外工具来优化华为硬件上的工作负载,但TileLang对多个平台的支持确保了该语言对英伟达GPU的持续适用性。
该公告发布于华为发布下一代AI处理器和超级节点系统两周后。华为预期其AI系统将在2027年被广泛应用于模型训练。DeepSeek与华为已在DeepSeek V4模型上开展过合作,该模型于4月以预览版形式发布,支持华为昇腾芯片。华为确认其昇腾950超级节点完全支持V4模型,且其芯片被用于较轻量化的V4-Flash模型训练的部分工作。