AI 추론 칩 전문 제조업체인 Cerebras는 더 빠른 추론 실행으로의 업계 전환을 활용하면서 추론당 비용 메트릭으로 경쟁 중이다.
Cerebras Systems는 두 가지 주요 인프라 트렌드의 교집점에 위치하고 있습니다: AI 훈련에서 더 빠르고 낮은 지연 시간의 추론으로의 전환, 그리고 토큰 생성 속도의 상업적 중요성 증가. 대화형 AI 사용 사례(코딩 도구, 에이전트, 고객 대면 애플리케이션)에서는 응답 시간이 단순한 기술 속성이 아닌 경쟁 기능이 되었습니다.
Cerebras의 웨이퍼 규모 아키텍처는 기존 액셀러레이터 클러스터의 근본적인 병목 현상인 칩 간 통신을 해결합니다. WSE-3 프로세서는 통합 하드웨어 및 소프트웨어 스택을 통해 훈련과 추론 모두를 지원하도록 설계된 CS-3 시스템을 구동합니다. 회사의 전략적 위치는 용량, 공급망, 이윤을 과도하게 늘리지 않으면서 고속 추론 수요를 확대할 수 있는지 여부에 달려 있습니다.
OpenAI와의 파트너십은 이 테제의 가장 명확한 검증입니다. 이 협약에 따라 Cerebras는 수년에 걸쳐 750메가와트의 고속 추론 컴퓨팅을 제공하기로 약정했으며, 이는 200억 달러 이상의 가치가 있고 최첨단 모델 워크로드에 대한 직접적 노출을 제공합니다. Amazon Web Services는 또 다른 중요한 기회를 제시하고 있으며, AWS Trainium 3이 프리필 작업을 처리하고 Cerebras CS-3이 디코드를 처리하는 분산형 추론 접근 방식을 계획하고 있습니다.
직접적인 엔터프라이즈 관계를 넘어, Cerebras는 클라우드 마켓플레이스와 개발자 채널을 통해 배포를 확대했습니다. 이제 AWS Marketplace, Microsoft Marketplace, IBM watsonx Model Gateway, Vercel AI Gateway, OpenRouter, Hugging Face를 통해 솔루션을 제공하고 있습니다. 이러한 다양화는 회사가 기존 클라우드 워크플로우 내에서 스타트업과 AI 기반 기업에 도달할 수 있도록 지원하며, 셀프 서비스 추론 API는 초기 실험을 지속적인 배포로 전환할 수 있습니다.
비즈니스 모델도 제품과 함께 진화하고 있습니다. 2026년 1분기 실적에서 핵심 매출이 전년 동기 대비 92% 증가해 1억 9,130만 달러에 달했으며, 하드웨어 매출은 60% 증가한 1억 1,160만 달러, 클라우드/서비스 매출은 167% 증가한 7,980만 달러를 기록했습니다. 더 큰 서비스 비중은 결국 매출 가시성을 개선할 수 있으며, 고객은 토큰 단위로 추론을 소비하거나 전용 용량을 예약하거나 프로덕션급 클라우드 인프라에 접근할 수 있습니다.
실행 위험이 주요 제약으로 남아 있습니다. Cerebras는 주요 수요 신호를 여러 데이터 센터와 서비스 수준에 걸친 공급 용량으로 전환해야 합니다. OpenAI 협약은 위험도를 상당히 높입니다. 배포 마일스톤을 충족하지 못할 경우 협약의 일부에 영향을 미칠 수 있으며 운영자본 관련 약정을 통해 재무 위험에 노출될 수 있습니다. 고객 집중(OpenAI, AWS, G42, MBZUAI가 성장의 상당 부분을 차지할 것으로 예상됨)은 종속성 위험을 초래하며, 인프라 집약성은 데이터 센터 가용성, 제조 규모, 리스 시점에 대한 유연성을 제한합니다.
투자 테제는 간단합니다: Cerebras는 추론 인프라 전환에 대한 직접적 노출을 제공합니다. 그러나 회사는 아직 증명 단계에 있으며, 최종 수익성은 약정된 용량을 신뢰할 수 있고 수익성 있는 공급으로 전환하는 능력에 달려 있습니다.