2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

法国初创公司Kog开发GPU优化软件,实现现有Nvidia硬件推理效率提升30倍。

软件层推理优化正成为竞争替代方案,Kog的方法释放了沉没GPU资本的产能,挑战Nvidia垂直栈主导地位。
行业媒体Slicast · 2026年8月14日 UTC 14:50 · 美国 · 来源: TechCrunch
重要度 68

快的AI推理竞赛已经开始,市场对Cerebras及其专为此设计的芯片在5月的IPO首日表现热烈欢迎。但法国创业公司Kog打赌说,从传统GPU中还能榨出显著更多的性能。

这家创业公司在5月因一次技术预览而获得关注,旨在证明"在企业已拥有的标准数据中心GPU上实现极快的单请求解码是可能的"——包括其演示中使用的AMD MI300X和Nvidia H200 GPU。

虽然有些人听说这不适用于笔记本电脑而感到失望,但其他人看到了潜力。随着推理速度和成本现在成为关键瓶颈,Kog通过软件优化在现有硬件上解锁新功能的承诺吸引了大量关注。"我们有200个实实在在的商业线索,"首席执行官Gaël Delalleau告诉TechCrunch。

基于早期反馈,这位独立创始人预计软件工程将成为第一个使用场景。资深Claude Code用户很清楚,他们有时需要等待数小时才能得到结果。Anthropic本身也理解速度是有价值的,为Claude的Fast Mode收取溢价。

Kog的目标客户是对这些延迟感到厌烦的,通常是那些依赖AI工作流进行专业任务的客户。该创业公司还有设计合作伙伴通过提示生成游戏和应用,对他们而言,通过Kog推理引擎(KIE)加快推理速度意味着收入增加,Delalleau说。

该公司意识到市场还未完全成熟。从早期客户对话中,Kog了解到潜在客户还没准备好对小型模型进行微调。"这就是为什么自推出以来,我们一直完全专注于加快更大规模模型的开发,以满足我们所看到的需求。"

这给Kog带来了一个实质性的挑战,即兑现"30倍更快的LLM推理"的承诺。其演示显示了令人印象深刻的每秒3000个请求令牌——但使用的是一个专为此构建的只有约20亿参数的小型模型,即现已开源的Laneformer 2B。

与持怀疑态度的人相反,Delalleau对相同的方法也能在更大规模的LLM上同样有效充满信心,这些大型模型的规模可能会对推理芯片造成挑战。"GPU前景光明,"他说。对于Kog的首席执行官而言,认为GPU不适合解码的观点已经成为一种误解;更新的GPU具有越来越多的内存带宽,只是在等待被解锁。

Kog并不是唯一认为软件优化可以帮助GPU超越其规格的公司。同样来自法国的ZML发布了与硬件无关的软件,绕过Nvidia的CUDA以支持跨竞争芯片的快速推理。但Delalleau说Kog更像斯坦福大学实验室Hazy Research,对GPU加速有更深入的关注。

Delalleau本人不是研究员,他的第一家创业公司——TechCrunch50 2009年参赛者Stribe——与Kog没有关联,除了通过他的前共同创始人转风投Kamel Zeroual,其公司Varsity VC共同领导了Kog的种子轮融资。但该创业公司的深厚技术重点源于他独特的背景。

Delalleau在École Polytechnique学习了固态物理,之后从事攻防性网络安全工作——即白帽黑客。根据他的说法,这塑造了他鼓励团队采用的思维方式。在科学方面,"有一种思维方式是理解物理定律和GPU定律,以便充分利用它们。"

至于黑客方面,这位DEFCON CTF锦标赛的四次决赛选手学会了"在极低的层面进行反向工程——直到汇编语言和二进制代码——以理解其工作原理,并尝试将其用于本来没有设计的目标。"

这种方法的缺点是动手操作且耗时。"对于每个新GPU,我们将投入数周甚至数个月的时间,真正深入细节并对该硬件进行GPU工程研究。"凭借11人的团队规模,这限制了Kog在短期内支持多少芯片。

从长远来看,Kog希望将其方法应用于基于代理的管道中,这将使支持更多芯片和模型成为可能。随着欧洲寻求在这两个领域建立能力,这可能为该创业公司带来主权红利,该公司已获得Scaleway的支持,并得到法国的Bpifrance和French Tech 2030项目的资助。

不过,现在Kog必须证明其方法在LLM上的有效性。这也将成为获得进一步融资的关键。"一旦我们以10倍速度实现了第一个主要模型,我认为这将在9月份完成,我们就能够开始展示客户吸引力,从那里融资我们的A轮,"Delalleau说。

阅读原文
法国初创公司Kog开发GPU优化软件,实现现有Nvidia硬件推理效率提升30倍。 · Slicast