Clockwork.io融资$31M,通过AI基础设施容错软件消除GPU浪费,已被LinkedIn和Together AI采用于生产环境。
Clockwork.io 已募集3100万美元新资金,使其总融资额达到7300万美元。在此之际,AI基础设施供应商正面临一个代价高昂的问题:当单个组件出现故障时,数千个GPU可能会闲置。本轮融资由Premji Invest、Wing Ventures和Seligman Ventures共同领投,现有投资者NEA和e& Capital也参与了投资。
该公司正在应对一个随着AI模型和集群规模扩大而成本不断增加的挑战。Meta此前报告称,在一次涉及16,384个GPU的54天Llama 3训练运行中,大约每三小时就会发生一次意外中断。传统的检查点-重启系统会在GPU、网络链路、NIC或服务器故障时强制整个训练任务从上一个检查点重新启动,可能会损失数小时已完成的工作,并导致健康的GPU处于闲置状态。
Clockwork.io成立于2018年,源自Stanford的研究,创始人为Balaji Prabhakar、Yilong Geng和Deepak Merugu,VMware联合创始人Mendel Rosenblum担任首席科学家。Prabhakar是Stanford教授,研究专注于计算机网络和数据中心系统;Geng在Stanford的研究成果是Huygens时钟同步技术,这项技术成为Clockwork平台的基础。Merugu曾联合创办Urban Engines,后被Google收购。公司现由Suresh Vasudevan领导,他在加入担任CEO前曾领导过Sysdig和Nimble Storage。在Nimble期间,他带领公司完成IPO及其随后被HPE收购的过程,还在NetApp担任过高管职务。
Clockwork的软件位于基础设施和工作负载之间,可确保任务在故障时继续运行。LinkPass可重新路由网络流量绕过故障链路,而TorchPass可将工作负载从故障GPU移至健康GPU,无需完全重启。TorchSnap增加了另一层功能,通过捕获多个节点上分布式AI任务的状态来实现——对于训练,其平台快照可以保存正在运行的任务,而无需对训练代码进行修改。其更快的应用检查点也可以帮助强化学习系统更快地将更新的模型权重移至推理副本。
LinkedIn已在其AI基础设施中部署了Clockwork的LinkPass,报告称它每月可防止数万GPU小时的停机时间。Together AI正将TorchPass引入其GPU集群,而WhiteFiber则在其全球GPU即服务基础设施中扩展Clockwork的应用。
Gartner预测,全球AI支出将在2026年达到2.7万亿美元,同比增长49.5%,其中AI基础设施代表最大的支出类别。这股热潮催生了一波获得大量融资的参与者:Together AI在最新融资中以83亿美元估值募集8亿美元,Crusoe最近以300亿美元估值募集超过30亿美元,Nscale在IPO前融资中募集33.6亿美元。Clockwork攻击的是同一基础设施栈的另一层——确保部署的庞大计算容量得到充分利用。
Clockwork.io首席执行官Suresh Vasudevan表示:"在AI规模下,故障是不可避免的。不应该因为故障而损失数小时的有用工作。容错是一个吞吐量倍增器:它让GPU持续进行有用的工作,而不是等待恢复或重复已完成的工作。我们与运营一些最大GPU集群的企业和云服务商合作开发了软件,因此它能处理他们实际遇到的故障。这种保护应该成为企业和云服务商每天依赖的基础设施的一部分。"