芯片与硬件 · 报道
Together AI优化了HPC张量库ThunderKittens在英伟达Vera Rubin GPU上的性能,增强了新加速器上的工作负载效率。
GPU云提供商的软硬件协同优化通过编译器工作展示竞争差异化,因为英伟达的架构组合不断扩展。
行业媒体Slicast · 2026年9月12日 · 美国 · 来源: TipRanks
重要度 25Together AI已更新其ThunderKittens GPU内核框架,使其能够在NVIDIA新推出的Vera Rubin NVL72平台上运行。该公司的内核团队获得了该架构的早期访问权限,探索了新的指令集,并实现了NVFP4和FP8 GEMM支持。
通过包括更宽的矩阵乘-累加步骤、更大的张量和共享内存、更深的管道以及改进的收集器行为在内的优化技术,NVFP4内核实现了超过22 PFLOPS的性能。根据该公司的LinkedIn帖子,这一性能水平使ThunderKittens能够与NVIDIA的cuBLAS和用于关键线性代数工作负载的CuTe领域特定语言竞争。
Together AI已记录了NVIDIA Blackwell和Vera Rubin架构之间的技术差异,以及达到这些性能水平所需的具体优化。这项工作使Together AI的软件栈能够与下一代NVIDIA硬件紧密结合,有可能加强该公司在高性能AI基础设施中的角色。对于在尖端GPU集群上优化工作负载的企业客户而言,与NVIDIA自有库相当的性能可能会扩大Together AI在高效模型训练和推理中的市场机会。