Clockwork.io获得3100万美元融资,被LinkedIn、Together AI和WhiteFiber采用,以优化GPU利用率并防止计算资源浪费。
# Clockwork.io融资3100万美元,推进AI工作负载容错技术
容错软件初创公司Clockwork.io宣布获得3100万美元新融资,在LinkedIn和Together AI实现生产部署,并扩大了WhiteFiber的采用范围。该公司的容错软件使AI训练、强化学习和推理工作负载能够在基础设施故障中继续运行。
公司为其TorchPass解决方案推出了两项新功能。多节点平台快照——这在训练中属于业界首创——可以在不修改训练代码的情况下保存整个运行作业在所有节点上的状态,并将其保留用于恢复。快速异步应用检查点在作业运行时在后台进行,通过向生成rollouts(模型学习的样例)的推理副本交付更新的模型权重来加速强化学习——这样这些副本可以减少等待时间或从过时模型中工作的时间。
大型分布式AI工作负载可以跨越数千个必须保持同步的GPU。单个GPU故障、链路中断或服务器冻结都可能导致整个作业停滞。Meta报告称,在为期54天的Llama 3训练期间(使用16,384个GPU),平均每三小时发生一次意外中断。
典型的恢复方法——重新加载检查点——可能需要长达90分钟的时间,导致健康的GPU闲置,并要求作业重复执行自该检查点以来已完成的工作。客户需要为闲置GPU和重复计算付费,而模型完成时间也会延长。随着作业规模的增大,每次重启都会使更多GPU时间面临风险。
在这种规模下,保持有用的工作通过故障继续运行是基础设施的要求。Clockwork.io将其容错套件部署为硬件和工作负载之间的一层。LinkPass绕过失败的链路重新路由流量,使作业永远不会看到该故障。TorchPass将工作从失败的GPU转移到健康的GPU,使训练继续进行而不是回滚。两者都已投入生产。TorchPass的新平台快照可以捕获运行中分布式作业的状态,以便在故障过大无法迁移时恢复整个作业。
"在AI规模下,故障是不可避免的。但不应该因此损失数小时的有用工作,"Clockwork.io首席执行官Suresh Vasudevan表示。"容错是有用吞吐量的倍增器:它使GPU继续执行有用的工作,而不是等待恢复或重复已完成的工作。我们与运营全球最大GPU集群的企业和云提供商一起构建了我们的软件,因此它可以处理他们实际看到的故障。这种保护应该成为企业和云提供商每天依赖的基础设施的一部分。"
运营自己GPU集群的企业、超大规模云计算提供商和新云提供商正在采用Clockwork.io,原因相同:他们的更多GPU小时数用于有用的工作。
LinkedIn已在其AI基础设施群中部署了LinkPass网络容错技术,每月防止数万个GPU小时的停机。
"在AI基础设施规模下,单一网络问题永远不应该导致健康的GPU离线或中断运行中的工作负载,"LinkedIn基础设施高级副总裁兼首席技术官Raghu Hiremagalur表示。"在使用Clockwork.io之前,一个InfiniBand NIC抖动可能导致一个八GPU服务器离线,而一个交换机端口抖动可能导致另一个服务器离线,双倍影响达到16个GPU。Clockwork.io帮助我们改变了这个运营模式。其网络容错技术自动将流量重新路由到健康的路径上,允许作业在修复链路、光学、电缆或NIC故障时继续不中断地运行。总体而言,Clockwork.io每月防止我们整个群中数万个GPU小时的停机。通过将曾经具有破坏性的操作事件转变为可管理的维护事件,Clockwork.io帮助提高了基础设施利用率和运营效率。"
Together AI正在其GPU集群上将TorchPass作为服务推向市场。在PyTorch大会上,两家公司将展示一个实时多节点训练作业通过注入的网络和GPU故障而继续运行而无需重启。
"我们的客户根据有用吞吐量——他们GPU小时数中实际推动模型前进的份额——来评估我们,"Together AI产品负责人Pavneet Ahluwalia表示。"节点修复已经能够检测故障并自动配置替代容量。Clockwork.io的TorchPass和LinkPass以此为基础构建,旨在使作业通过GPU故障和链路故障继续运行,保留进度。我们正在将其作为平台中的下一层弹性推向市场。"
现有客户WhiteFiber(NASDAQ: WYFI)正在其不断增长的全球GPU即服务业务中扩大Clockwork.io软件的使用。
"在集群投入生产之前对其可靠性进行压力测试是至关重要的,因为继承隐藏结构故障的客户稍后会通过失败的作业和丢失的GPU小时数付出代价,"WhiteFiber首席技术官Tom Sanfilippo表示。"边界光学、配置错误的NIC和通过基本测试但在负载下性能下降的链路可能会漏过。Clockwork.io的自动化群审计可以同时验证每条链路和每个节点,在几分钟内定位故障,并让我们在接收前纠正它们。我们更快地启动集群,客户的第一个训练运行涉及经过端到端验证的结构,而不仅仅是通电。由于市场需求增长如此之快,快速向客户提供经过验证的容量对我们的业务至关重要,这就是我们为什么要在我们的集群中扩展Clockwork.io的原因。"
Clockwork.io将TorchPass扩展到GPU迁移之外,增加了平台团队以前缺乏的两项功能:他们可以自己管理的整个分布式作业的快照,以及足够快以在后台运行的应用检查点。
对于训练,平台快照保存运行作业在所有节点上的执行状态,以便在中断后可以恢复该作业。平台团队和AI基础设施工程师可以为支持的工作负载部署它,而无需等待应用所有者修改其代码或添加检查点逻辑。企业团队可以用一个机制保护整个群中的训练作业,云提供商可以保护他们不控制代码的客户作业。在团队在应用级别进行检查点的地方,TorchPass的快速检查点可以更频繁地进行,因此损失的进度更少,故障后重复的计算也更少。
对于推理,大型模型在两个或多个服务器上运行,因此一个坏链路可能导致整个副本离线并中断用户会话或代理任务。LinkPass使这些多服务器副本通过链路故障继续服务。
强化学习依赖于训练和推理。模型的副本生成rollouts,训练器从中学习,更新的权重必须到达副本才能使用最新版本生成。TorchPass的应用检查点更快地将更新的权重传递到rollout副本,而LinkPass使这些副本通过链路故障继续服务。
"集群容错过去是一个训练问题。现在它也是一个推理问题,"SemiAnalysis创始人、首席执行官兼首席分析师Dylan Patel表示,该公司的ClusterMAX评级对GPU云提供商进行基准测试。"在我们的ClusterMAX中,TorchPass将一个黄金评级新云的训练有用吞吐量损失从14%减少到3%以下。强化学习(RL)将两者联系在一起:推理副本生成rollouts,训练器从中学习,更新的权重返回到副本。Clockwork.io使副本通过链路抖动和网络故障继续服务。其极快的检查点加速了权重转移回rollout群,因此两个方向都不会导致运行停滞。在训练、推理和RL下的一个容错层是必须解决的地方。"
企业平台团队和云提供商可以联系Clockwork.io评估其软件以满足其工作负载或探索合作机会。
本轮融资由Premji Invest、Wing Venture Capital和Seligman Ventures共同领投,现有投资者NEA和e& Capital参与。本轮融资使Clockwork.io的总融资达到7300万美元。公司将利用这笔资本加速其容错套件在训练、推理和强化学习中的推出,扩大企业采用范围,并扩展交付规模。