2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

Lumai(牛津衍生光学计算公司)宣布Iris Nova,利用光的专用硬件加速器

GlobeNewswire新闻稿——第一手披露。
官方披露Slicast · 2026年9月11日 · 全球 · 来源: GlobeNewswire

沿AI公司预计计算需求在未来五年内增长约1000倍。用传统数字加速器满足这一需求需要大约100万亿美元的基础设施投资和约1000吉瓦的额外电力容量。随着电力成为数据中心的制约因素,推理各个阶段的效率都至关重要。

AI推理涉及两个具有不同特性的不同计算阶段。Prefill在生成开始前处理输入上下文,由高度并行的矩阵乘法主导,属于计算密集型。Decode生成输出令牌,主要由内存带宽和数据移动驱动。领先的基础设施提供商正在将这些工作负载分解到独立的资源池,但Lumai主张下一步应该为每个阶段专门化硬件。

Lumai产品负责人Phil Burr解释了这一想法:"如果工作负载从根本上不同,那么不再让相同的硬件执行两项工作就很有道理。将Prefill和Decode分解是重要的一步。但更大的机会是将计算架构与工作负载相匹配。"

向更长上下文窗口、检索增强生成、多模态输入和代理工作流的转变正在增加令牌生成开始前处理的信息量。单个用户请求可以触发多个模型调用,每个调用都携带累积的上下文,使prefill效率与decode一样对整体推理经济学至关重要。如今,为两项工作都适度优化的硬件往往在任何一项工作上表现不佳。

这造成了三个基础设施挑战。电力成为制约因素,将固定的兆瓦预算转换为推理容量。当相同的GPU集群吸收更多适合令牌生成的prefill计算时,GPU容量被搁置。推理经济学也受到限制,因为处理上下文的成本可能使长上下文和代理应用程序难以具有竞争力地定价。

Lumai Iris Nova使用光学计算来处理prefill工作负载。硬件在单个光学周期内完成每个向量矩阵乘法,将prefill视为专门构建的工作负载,而非在通用硅上运行。在测试中,Iris Nova以实时方式运行了数十亿参数的语言模型,在prefill工作负载上演示了比GPU等效产品高出约10倍的每瓦计算能力。

这种方法为令牌生成释放了GPU容量,使现有基础设施无需更换就能变得更加高效。Burr表示:"我们的观点不是每个加速器都需要被替换,而是我们应该停止要求每个加速器解决每个问题。未来的AI数据中心将越来越异构,不同的技术针对推理的不同阶段进行优化。"

Lumai由牛津大学光学研究在2021年分拆创立,获得了2025年Falling Walls科学突破年奖,并在OCP Future Technologies Symposium赢得了最佳整体技术奖。该公司声称其技术相比传统GPU架构能源消耗降低高达90%。

阅读原文