2026年10月7日星期三
AI 基础设施 · 新闻与分析
首页 › 资本市场 › 报道
资本市场 · 报道

Clockwork.io宣布获得3100万美元融资,在LinkedIn和Together AI实现新部署,提供能在不修改代码的情况下保留GPU工作负荷进度的工具。

GPU利用效率优化正成为AI基础设施中的关键竞争优势;在LinkedIn和Together AI的部署验证了工作负荷可靠性工具的市场需求。
行业媒体Slicast · 2026年10月6日 UTC 12:10 · 全球 · 来源: HPCwire
重要度 72

Clockwork.io是一家故障容错软件公司,其软件能够保持AI训练、强化学习和推理工作负载在基础设施故障中持续运行。该公司宣布获得3100万美元新融资,在LinkedIn和Together AI实现生产部署,并获得WhiteFiber的扩大采用。公司还为其TorchPass解决方案推出了两项新功能。多节点平台快照是训练领域首创,可在不修改训练代码的情况下保存整个运行中的作业(跨越每个节点),并将其保留以供恢复。快速、异步应用检查点在作业运行时在后台进行,通过向生成汇总(模型学习所用示例)的推理副本传递更新的模型权重来加速强化学习,使这些副本花费更少的时间等待或使用过时模型。

大型分布式AI工作负载可跨越数千个必须保持同步的GPU:一个失败的GPU、丢弃的链接或冻结的服务器可能导致整个作业停滞。Meta在54天内使用16,384个GPU训练Llama 3时报告了意外中断,平均每三小时发生一次。典型的应对方式是重新加载检查点,即作业进度的保存副本。恢复可能需要长达90分钟,导致健康的GPU等待,并要求作业重复该检查点之后完成的工作。客户为闲置的GPU和重复计算付费,模型的完成时间也会延长。随着作业规模扩大,每次重新启动都会使更多GPU时间处于风险中。

Clockwork.io通过故障容错套件来满足这一基础设施需求,该套件由平台团队部署在硬件和工作负载之间的层中。LinkPass在失败的链接周围重新路由流量,使作业永远不会看到故障。TorchPass将工作从失败的GPU移动到健康的GPU,以便训练继续而不是回滚。两者都在生产中。TorchPass的新平台快照捕获运行中分布式作业的状态,以便在故障太大而无法迁移时恢复整个作业。

Clockwork.io首席执行官Suresh Vasudevan表示:"在AI规模下,故障是不可避免的。因此损失数小时有用工作是不应该发生的。故障容错是吞吐量倍数器:它使GPU持续进行有用工作,而不是等待恢复或重复已完成的工作。我们在运营最大GPU群集的企业和云提供商的协作下开发了该软件,因此它能够处理他们实际遇到的故障。这种保护应该成为企业和云提供商每天依赖的基础设施的一部分。"

LinkedIn已在其AI基础设施群集中部署了LinkPass网络故障容错,每月防止数万GPU小时的停机。LinkedIn基础设施高级副总裁兼首席技术官Raghu Hiremagalur表示:"在AI基础设施规模下,单一网络问题不应该影响健康的GPU或中断运行的工作负载。在使用Clockwork.io之前,一次InfiniBand NIC故障可能会导致八GPU服务器脱离服务,而交换机端口故障可能导致第二台服务器掉线,将影响范围扩大到16个GPU。Clockwork.io帮助我们改变了运营模式。其网络故障容错技术自动将流量重新路由到健康路径,允许作业在链接、光学器件、电缆或NIC故障修复时继续中断。总的来说,Clockwork.io每月在整个群集中防止了数万GPU小时的停机。通过将曾经破坏性的运营事件转变为可管理的维护事件,Clockwork.io帮助提高了基础设施利用率和运营效率。"

Together AI正在其GPU集群上将TorchPass作为服务推向市场。在PyTorch大会上,两家公司将演示一个实时多节点训练作业在注入的网络和GPU故障中继续运行而无需重新启动。Together AI产品主管Pavneet Ahluwalia表示:"我们的客户根据吞吐量(他们GPU小时中实际推动模型前进的份额)对我们进行评分。节点修复已经检测到故障并自动提供替换容量。Clockwork.io的TorchPass和LinkPass建立在该基础之上,旨在保持作业通过GPU故障和链接故障继续运行,保留进度。我们正在将其作为平台中下一层弹性能力推向市场。"

现有客户WhiteFiber正在扩大其在不断增长的全球GPU即服务足迹中对Clockwork.io软件的使用。WhiteFiber首席技术官Tom Sanfilippo表示:"在群集投入生产之前对其可靠性进行压力测试至关重要,因为继承隐藏结构故障的客户后来会为失败的作业和丢失的GPU小时付费。边际光学、配置错误的NIC和基本测试通过但在负载下降级的链接可能会被遗漏。Clockwork.io的自动群集审计可同时验证每条链接和节点,在数分钟内定位故障,并允许我们在接受前纠正这些故障。我们更快地启动群集,客户的第一次训练运行落在经过端到端验证的结构上,而不仅仅是已启动。随着市场需求增长速度如此之快,快速获得经过验证的容量交付给客户对我们的业务至关重要,这就是我们正在扩大Clockwork.io在集群中使用的原因。"

Clockwork.io已将TorchPass扩展到GPU迁移之外,配备了平台团队以前没有的两项功能:整个分布式作业的快照(可由他们自己进行),以及快速到足以在后台运行的应用检查点。对于训练,平台快照保存运行中作业在所有节点上的执行状态,以便在中断后可以恢复作业。平台团队和AI基础设施工程师可以为支持的工作负载部署它,而无需等待应用所有者修改其代码或添加检查点逻辑。企业团队可以用一种机制保护其整个群集的训练作业,云提供商可以保护其不控制代码的客户作业。在团队在应用程序级别进行检查点的地方,TorchPass的快速检查点可以更频繁地进行,因此故障后丢失更少的进度,重复的计算也更少。

对于推理,大型模型跨两个或更多服务器运行,因此一条坏链接可能导致整个副本瘫痪并中断用户会话或代理任务。LinkPass使这些多服务器副本通过链接故障继续提供服务。强化学习同时依赖训练和推理。模型的副本生成汇总,训练器从中学习,更新的权重必须在这些副本生成最新版本之前到达它们。TorchPass的应用检查点更快地将更新的权重传递给汇总副本,而LinkPass使这些副本通过链接故障继续提供服务。

SemiAnalysis创始人兼首席执行官、GPU云提供商基准ClusterMAX评级的首席分析师Dylan Patel表示:"群集故障容错曾经是一个训练问题。现在它也是推理问题。在我们的ClusterMAX中,TorchPass将金牌级新云的训练吞吐量损失从14%降低到3%以下。强化学习将两者联系在一起:推理副本生成汇总,训练器从中学习,更新的权重回到副本。Clockwork.io使副本通过链接故障和网络故障继续提供服务。其极快的检查点加速了权重传输回汇总群集,因此两个方向都不会使运行停滞。训练、推理和RL下的单一故障容错层是解决此问题必须采取的方式。"

Clockwork.io开创了软件驱动型AI结构,这是硬件和工作负载之间的可编程层,使GPU集群在任何加速器、网络或云上都可观察、故障容错且充分利用。AI工作负载需要整个集群充当一台机器,但故障和瓶颈导致GPU闲置。Clockwork.io的FleetLens平台恢复了这些丢失的容量:纳秒级精准遥测可精确定位导致作业减速或停滞的GPU、节点或链接,在启动前验证群集,并通过LinkPass和TorchPass,使工作负载从训练到推理都能通过基础设施故障和降级继续运行。SemiAnalysis独立基准测试了TorchPass从故障恢复的速度快于检查点重启,并领先开源框架。LinkedIn、Together AI、WhiteFiber、Wells Fargo、Nebius、NScale和DCAI信任Clockwork.io为其AI基础设施供电。

阅读原文
Clockwork.io宣布获得3100万美元融资,在LinkedIn和Together… · Slicast