General Compute가 Cerebras AI 가속기의 대규모 함대를 구매하여 추론 처리 능력을 강화했습니다.
General Compute는 2026년 9월 29일 Cerebras Systems의 웨이퍼 규모 칩 대규모 함대를 구매한다고 발표했습니다. 이를 기존 Nvidia GPU와 함께 운영하여 까다로운 인공지능 작업 부하에서 지연 시간을 줄이도록 설계된 하이브리드 아키텍처를 구성합니다. 이 용량은 2027년 1분기에 고객을 위해 실시간 운영될 예정이며, 에이전트 코딩이 첫 번째 목표 사용 사례입니다. 자율 코딩 에이전트는 긴 연속 추론 단계의 사슬에 의존하는데, 작은 지연도 누적되어 답답한 대기 시간이 됩니다.
하이브리드 아키텍처는 두 개의 서로 다른 단계로 작동합니다. 첫 번째인 프롬프트 사전 채우기는 전체 입력 맥락을 한 번에 처리하는 것입니다. 이 작업은 매우 병렬적이고 계산 집약적입니다. 이것이 정확히 Nvidia GPU가 처리하도록 설계된 것입니다. 두 번째인 디코딩은 순서대로 한 번에 하나의 토큰을 생성합니다. 이 과정은 계산 제약이 아니라 메모리 대역폭 제약입니다. 즉, 순수한 GPU 성능보다는 칩이 데이터를 얼마나 효율적으로 이동시키는지가 더 중요합니다. Cerebras의 웨이퍼 규모 엔진은 이 병목 현상을 위해 특별히 설계되었습니다. Cerebras는 현재 생산 중인 사용자당 가장 빠른 토큰 생성 속도 중 일부를 운영하고 있으며, 전체 파이프라인에서 더 낮은 토큰당 지연 시간을 제공합니다.
이번 구매는 Finn Puklowski와 Jason Goodison이 설립한 이후 General Compute의 가장 큰 하드웨어 약정을 나타냅니다. 이는 회사가 2026년 7월 Upper90과 확보한 4억 달러의 채무 시설에 의해 부분적으로 지원됩니다. 별도로 Cerebras는 OpenAI와 다년 계약을 체결했으며, 이는 100억 달러에서 200억 달러 사이의 가치가 있으며 750 메가와트의 용량을 포함합니다.
이 거래는 추론 분화로 알려진 광범위한 산업 동향을 반영합니다. 단일 공급업체의 동일한 하드웨어에서 모델 작동의 모든 단계를 실행하는 대신, 운영자들은 특정 파이프라인 단계에 최적화된 맞춤형 실리콘을 점점 더 많이 채택하고 있습니다. Cerebras는 디코딩 단계를 처리하고, Nvidia는 사전 채우기를 처리합니다.