AMD 与 Cerebras 宣布技术合作,将 Helios 机架级基础设施与 Cerebras Wafer-Scale Engine(WSE)结合,实现超低延迟 AI 推理。
AMD和Cerebras Systems宣布建立技术合作伙伴关系,推出分解式AI推理解决方案,将AMD Helios机架级解决方案与Cerebras Wafer-Scale Engine相结合。该方案在2026年"推进AI"大会上发布,旨在为先进AI应用提供超低延迟,同时大幅提高吞吐量和效率。这两个计算引擎预计每瓦特每秒的令牌数可提高5倍。
AI推理工作负载在延迟、吞吐量、令牌容量、成本和规模等方面的需求日益多样化。大容量工作负载优先考虑最大化令牌生成,而编码、实时副驾驶、实时代理和代理工作流则需要更快的响应时间。这种多样性推动了对异构基础设施的需求,以便将计算技术与特定工作负载需求相匹配。
AMD和Cerebras的解决方案通过分解式推理来应对这一挑战,独立优化工作流的两个主要阶段。AMD Helios提供超高吞吐量,处理提示词和大型上下文窗口。Cerebras Wafer-Scale Engine以超低延迟加速内存带宽密集型的令牌生成。通过一个集成工作流连接这两个引擎,两家公司正在创建一个差异化平台,可实现超低延迟推理,同时不牺牲吞吐量或规模。
AMD Helios提供高吞吐量提示引擎、机架级效率和部署规模,可处理大量复杂请求。Cerebras Wafer-Scale Engine技术提供超低延迟和解码性能,支持实时返回令牌。该解决方案专门针对推理市场的超低延迟领域而设计,以AMD Helios为基础,用于数据中心的高吞吐量和均衡推理工作负载。
AMD董事长兼首席执行官Lisa Su博士表示:"AI推理正在成为AI领域最大的基础设施机遇之一,其日益增长的多样性需要更灵活的方法。AMD Helios为最广泛范围的推理工作负载提供领导性的性能和规模。与Cerebras合作,我们正在将这种领导力扩展到最具延迟敏感性的应用中,并为实时代理AI创建一个强大的新平台。"
Cerebras首席执行官兼联合创始人Andrew Feldman表示:"对超快速推理的需求以前所未有的速度增长。Cerebras提供全球最快的超低延迟推理。与AMD的合作为我们提供了一个难得的机会,将这一性能带给更多客户。"
随着AI应用扩展到软件开发、自主代理、机器人技术、科学发现和其他应用领域,快速令牌生成变得越来越重要,因为响应时间直接影响用户体验和系统的实用性。Cerebras计划在其数据中心部署AMD Helios系统,预计联合解决方案将在2026年下半年首次通过Cerebras Cloud提供。