Clockwork.io raises $31 million in funding with adoption by LinkedIn, Together AI, and WhiteFiber to optimize GPU utilization and prevent compute waste.
Clockwork.io는 AI 훈련, 강화 학습, 추론 워크로드를 인프라 장애를 통해 계속 실행되도록 유지하는 내결함성 소프트웨어를 제공하며, 3,100만 달러의 신규 자금 조달, LinkedIn과 Together AI에서의 프로덕션 배포, WhiteFiber의 도입 확대를 발표했습니다.
이 회사는 TorchPass 솔루션을 위한 두 가지 새로운 기능을 선보였습니다. 다중 노드 플랫폼 스냅샷(훈련 분야에서 업계 최초)은 훈련 코드를 변경하지 않고 모든 노드에서 실행 중인 전체 작업을 저장하며 복구를 위해 보존합니다. 작업이 실행되는 동안 백그라운드에서 수행되는 빠르고 비동기식 애플리케이션 체크포인트는 업데이트된 모델 가중치를 롤아웃을 생성하는 추론 복제본에 전달하여 강화 학습을 가속화합니다(롤아웃은 모델이 학습하는 예제입니다). 이를 통해 이러한 복제본은 대기 시간을 줄이거나 오래된 모델에서 작업할 수 있습니다.
대규모 분산 AI 워크로드는 수천 개의 GPU에 걸쳐 있으며 이들은 동기화를 유지해야 합니다. 단일 GPU 장애, 끊어진 링크 또는 정지된 서버는 전체 작업을 중단시킬 수 있습니다. Meta는 16,384개의 GPU에서 Llama 3 훈련 중 54일 기간 동안 대략 3시간마다 발생하는 예상치 못한 중단을 보고했습니다.
일반적인 복구 방법인 체크포인트를 다시 로드하는 것은 최대 90분이 소요될 수 있으며, 정상 GPU가 대기하도록 두고, 작업이 해당 체크포인트 이후 완료한 작업을 반복해야 합니다. 고객은 유휴 GPU와 반복 계산 비용을 지불하고, 모델 완성에 더 오래 걸립니다. 작업이 커질수록 각 재시작은 더 많은 GPU 시간을 위험에 빠뜨립니다.
이러한 규모에서 장애를 통해 유용한 작업을 계속 실행하는 것은 인프라 요구사항입니다. Clockwork.io는 하드웨어와 워크로드 사이의 계층으로 내결함성 제품군을 배포합니다. LinkPass는 장애가 발생한 링크 주변 트래픽을 다시 라우팅하여 작업이 장애를 인식하지 못하도록 합니다. TorchPass는 장애가 발생한 GPU에서 정상 GPU로 작업을 이동하여 훈련이 계속되고 롤백되지 않도록 합니다. 둘 다 프로덕션 상태입니다. TorchPass의 새로운 플랫폼 스냅샷은 실행 중인 분산 작업의 상태를 캡처하여 장애가 너무 커서 주변을 마이그레이션할 수 없을 때 전체 작업을 복구할 수 있습니다.
"장애는 AI 규모에서 불가피합니다. 그것으로 인한 수 시간의 유용한 작업 손실은 없어야 합니다"라고 Clockwork.io의 CEO인 Suresh Vasudevan이 말했습니다. "내결함성은 굿풋 배수입니다. 이는 GPU가 복구 대기나 이미 완료된 작업 반복 대신 유용한 작업을 수행하도록 유지합니다. 우리는 가장 큰 GPU 플릿을 운영하는 기업 및 클라우드 공급자와 함께 소프트웨어를 구축했으므로 실제로 발생하는 장애를 처리합니다. 이러한 보호는 기업과 클라우드 공급자가 매일 의존하는 인프라에 포함되어야 합니다."
자신의 GPU 플릿을 운영하는 기업, 하이퍼스케일러, 네오클라우드는 같은 이유로 Clockwork.io를 도입하고 있습니다. GPU 시간의 더 많은 부분이 유용한 작업으로 이동합니다.
LinkedIn은 AI 인프라 플릿 전체에 LinkPass 네트워크 내결함성을 배포했으며, 매월 수만 시간의 GPU 다운타임을 방지합니다.
"AI 인프라 규모에서 단일 네트워크 문제는 정상 GPU를 중단시키거나 실행 중인 워크로드를 중단시켜서는 안 됩니다. Clockwork.io 이전에는 하나의 InfiniBand NIC 플랩이 8개 GPU 서버를 서비스에서 제거할 수 있었고, 스위치 포트 플랩은 두 번째 서버를 배출하여 16개 GPU로의 영향을 두 배로 증가시킬 수 있었습니다"라고 LinkedIn의 SVP, CTO Infrastructure인 Raghu Hiremagalur가 말했습니다. "Clockwork.io는 그러한 운영 모델을 변환하는 데 도움이 되었습니다. 해당 네트워크 내결함성 기술은 트래픽을 정상 경로로 자동으로 다시 라우팅하여 링크, 광학, 케이블 또는 NIC 장애가 수리되는 동안 작업을 중단 없이 계속 실행할 수 있습니다. 전체적으로 Clockwork.io는 플릿 전체에서 매월 수만 시간의 GPU 다운타임을 방지합니다. 한때 중단적인 운영 사건이던 것을 관리 가능한 유지보수 이벤트로 변환함으로써, Clockwork.io는 인프라 활용도와 운영 효율성 향상에 도움이 되었습니다."
Together AI는 GPU Clusters에서 TorchPass를 서비스로 시장에 가져오고 있습니다. PyTorch Conference에서 두 회사는 주입된 네트워크 및 GPU 장애를 통해 재시작 없이 계속 실행되는 실시간 다중 노드 훈련 작업을 시연할 것입니다.
"우리 고객은 우리를 굿풋, 즉 GPU 시간 중 실제로 모델을 앞으로 이동시키는 부분에 대해 평가합니다"라고 Together AI의 제품 리드인 Pavneet Ahluwalia가 말했습니다. "노드 복구는 이미 장애를 감지하고 자동으로 교체 용량을 프로비저닝합니다. Clockwork.io의 TorchPass와 LinkPass는 해당 기반을 바탕으로 하며 GPU 장애 및 링크 장애를 통해 작업을 계속 이동하도록 설계되어 진행 상황을 보존합니다. 우리는 이들을 플랫폼의 다음 탄력성 계층으로 시장에 가져오고 있습니다."
기존 고객인 WhiteFiber(NASDAQ: WYFI)는 성장하는 글로벌 서비스형 GPU 풋프린트 전체에서 Clockwork.io 소프트웨어의 사용을 확대하고 있습니다.
"클러스터의 신뢰성을 프로덕션에 도달하기 전에 스트레스 테스트하는 것은 중요합니다. 왜냐하면 숨겨진 패브릭 장애를 상속하는 고객은 나중에 실패한 작업과 손실된 GPU 시간으로 대가를 치르기 때문입니다"라고 WhiteFiber의 최고 기술 책임자인 Tom Sanfilippo가 말했습니다. "한계적인 광학, 잘못 구성된 NIC, 기본 테스트는 통과하지만 부하 아래에서 저하되는 링크는 통과할 수 있습니다. Clockwork.io의 자동화된 플릿 감사는 모든 링크와 노드를 한 번에 검증하고, 몇 분 내에 장애를 지역화하며, 수용 전에 이를 수정할 수 있습니다. 우리는 클러스터를 더 빠르게 가동하며, 고객의 첫 훈련 실행은 단순히 전원이 켜져 있지 않고 끝에서 끝까지 검증된 패브릭에 떨어집니다. 시장 수요가 빠르게 증가하면서 검증된 용량을 고객에게 빠르게 전달하는 것이 우리 사업의 핵심이며, 이것이 우리가 클러스터 전체에서 Clockwork.io를 확대하는 이유입니다."
Clockwork.io는 TorchPass를 GPU 마이그레이션을 넘어 확장했으며, 두 가지 기능은 플랫폼 팀이 이전에 부족했습니다. 전체 분산 작업의 스냅샷(팀이 스스로 관리할 수 있음), 그리고 백그라운드에서 실행할 수 있을 정도로 빠른 애플리케이션 체크포인트입니다.
훈련의 경우, 플랫폼 스냅샷은 모든 노드에서 실행 중인 작업의 실행 상태를 저장하여 중단 후 작업을 복구할 수 있습니다. 플랫폼 팀과 AI 인프라 엔지니어는 애플리케이션 소유자가 코드를 수정하거나 체크포인팅 로직을 추가할 때까지 기다리지 않고 지원되는 워크로드에 대해 배포합니다. 기업 팀은 플릿 전체에서 훈련 작업을 하나의 메커니즘으로 보호할 수 있으며, 클라우드 공급자는 코드를 제어하지 않는 고객 작업을 보호할 수 있습니다. 팀이 애플리케이션 수준에서 체크포인트할 때, TorchPass의 빠른 체크포인트는 더 자주 수행될 수 있으므로 더 적은 진행 상황이 손실되고 장애 후 더 적은 계산이 반복됩니다.
추론의 경우, 큰 모델은 두 개 이상의 서버에서 실행되므로 하나의 잘못된 링크가 전체 복제본을 다운시킬 수 있으며 사용자 세션이나 에이전트 작업을 중간에 끊을 수 있습니다. LinkPass는 이러한 다중 서버 복제본이 링크 장애를 통해 계속 서비스하도록 합니다.
강화 학습은 훈련과 추론 모두에 달려 있습니다. 모델의 복사본은 롤아웃을 생성하고, 트레이너는 이로부터 학습하며, 업데이트된 가중치는 최신 버전으로 생성할 수 있도록 복사본에 도달해야 합니다. TorchPass의 애플리케이션 체크포인트는 업데이트된 가중치를 롤아웃 복제본에 더 빨리 전달하는 동시에 LinkPass는 이러한 복제본이 링크 장애를 통해 계속 서비스하도록 합니다.
"클러스터 내결함성은 훈련 문제였습니다. 이제 추론 문제이기도 합니다"라고 GPU 클라우드 공급자를 벤치마킹하는 ClusterMAX 평가를 소유한 SemiAnalysis의 설립자, CEO, 수석 분석가인 Dylan Patel이 말했습니다. "우리 ClusterMAX에서 TorchPass는 금급 네오클라우드에 대한 훈련 굿풋 손실을 14%에서 3% 미만으로 줄입니다. 강화 학습(RL)은 둘을 함께 연결합니다. 추론 복제본은 롤아웃을 생성하고, 트레이너는 이로부터 학습하며, 업데이트된 가중치는 복제본으로 돌아갑니다. Clockwork.io는 복제본이 링크 플랩과 네트워크 장애를 통해 계속 서비스하도록 합니다. 이의 극도로 빠른 체크포인트는 롤아웃 플릿으로의 가중치 전송을 가속화하므로 어느 방향이든 실행을 중단시키지 않습니다. 훈련, 추론, RL 아래 하나의 내결함성 계층은 이것이 해결되어야 하는 방식입니다."
기업 플랫폼 팀과 클라우드 공급자는 워크로드에 대한 소프트웨어를 평가하거나 파트너십 기회를 탐색하기 위해 Clockwork.io에 연락할 수 있습니다.
라운드는 Premji Invest, Wing Venture Capital, Seligman Ventures가 공동 주도했으며, 기존 투자자 NEA와 e& Capital이 참여했습니다. 이 펀딩은 Clockwork.io의 총 펀딩을 7,300만 달러로 가져옵니다. 회사는 자본을 사용하여 훈련, 추론, 강화 학습 전반에 걸쳐 내결함성 제품군의 배포를 가속화하고, 기업 도입을 확대하며, 제공을 확장할 것입니다.