Cerebras 주가는 OpenAI 추론 모델에 대한 추측과 Groq 등 다른 기업들로부터의 가속기 경쟁 우려 속에서 7% 하락했다.
OpenAI가 세레브러스 하드웨어 대신 엔비디아 GPU를 사용하여 새로운 GPT-6.1 솔 울트라패스트 서비스를 구동할 가능성에 대한 추측이 나타난 후 세레브러스 시스템즈 주가가 약 7% 하락했습니다. 반도체 연구 회사인 세미애널리시스는 OpenAI의 고속 모델이 전문화된 세레브러스 프로세서를 사용하지 않고 낮은 배치 크기에서 일반적인 엔비디아 GPU에서 실행된다고 주장하며 이러한 하락을 촉발했습니다.
이러한 구별이 중요한 이유는 빠른 AI 추론이 세레브러스가 기존 GPU 클러스터의 대안으로 자신의 하드웨어를 포지셔닝한 영역 중 하나이기 때문입니다. 엔비디아가 까다로운 최첨단 모델에 대해 유사한 낮은 지연 시간을 제공할 수 있다면, 투자자들은 세레브러스의 경쟁 우위의 일부를 재고해야 할 수도 있습니다. 세레브러스는 자신의 기술이 최종적으로 OpenAI의 인프라에서 역할을 할 수 있는지 여부를 공개적으로 확인하거나 부인하지 않았습니다. 현재로서는 시장 반응이 확인된 계약 손실보다는 추측에 의해 주도되고 있습니다.
OpenAI의 울트라패스트 서비스는 표준 배포보다 훨씬 빠른 모델 응답을 약속하며, 초당 최대 300개의 토큰을 생성할 수 있는 것으로 추정됩니다. AI 추론은 모델이 학습된 후에 발생합니다. 사용자가 프롬프트를 보내면 기본 하드웨어가 응답을 생성하는 데 필요한 계산을 수행합니다.
초당 수백 개의 토큰을 생성하려면 막대한 컴퓨팅 성능과 메모리 대역폭이 필요합니다. 시스템은 프로세서와 메모리 시스템 간에 데이터가 이동할 때의 지연을 최소화하면서 모델 매개변수에 빠르게 액세스해야 합니다. 세레브러스는 이 문제를 해결하기 위해 웨이퍼 스케일 엔진을 설계했습니다. 세레브러스는 작은 칩을 많은 클러스터로 생산하는 대신 거의 전체 실리콘 웨이퍼를 사용하여 거대한 프로세서를 구축합니다. 이렇게 하면 막대한 컴퓨팅 성능과 메모리를 가깝게 배치할 수 있습니다. 이를 통해 별도의 프로세서 간에 정보를 이동하는 데 소요되는 시간이 줄어듭니다. 이것이 세레브러스가 고속 AI 워크로드에 대해 자신의 기술을 홍보한 이유 중 하나입니다.
OpenAI가 엔비디아 GPU를 사용하여 매우 빠른 추론을 달성할 수 있다는 것은 기존 GPU 인프라가 전문화된 하드웨어가 이점을 가질 것으로 예상되는 워크로드에서 경쟁할 수 있음을 시사합니다.
세미애널리시스의 주장에서 가장 중요한 부분은 OpenAI가 낮은 배치 크기에서 모델을 실행하고 있다는 것입니다. 배칭은 여러 요청을 함께 그룹화하여 GPU가 더 큰 배치를 더 효율적으로 처리하고 전체 하드웨어 이용률을 개선할 수 있도록 합니다. 이는 AI 추론의 경제성을 개선합니다. 단점은 지연 시간입니다. 요청이 그룹화될 때까지 기다리면 개별 응답이 느려지므로 즉시 응답이 필요한 애플리케이션에서는 큰 배치가 덜 매력적입니다.
낮은 배치 크기는 한 번에 하나 또는 소수의 요청을 처리하여 응답 속도를 우선시합니다. 세레브러스는 대규모 온칩 메모리와 기존 GPU 클러스터의 병목 현상을 줄이기 위해 설계된 긴밀하게 통합된 컴퓨팅 리소스를 갖춘 아키텍처가 이 워크로드에 특히 적합하다고 주장해 왔습니다. OpenAI가 낮은 배치 크기를 유지하면서 엔비디아 GPU에서 최첨단 모델을 효율적으로 작동할 수 있는 방법을 찾았다면, 이는 세레브러스의 전문화된 프로세서로의 전환을 위한 가장 명확한 논거 중 하나를 약화시킵니다. 하지만 순수한 속도만으로는 필요한 컴퓨팅 용량이나 각 토큰을 생성하는 데 드는 OpenAI의 비용이 얼마인지 알 수 없습니다. 세레브러스는 여전히 더 나은 경제성이나 더 간단한 인프라를 갖춘 특정 워크로드에서 이점을 가질 수 있습니다.
더 광범위한 우려는 AI 전반에 걸친 엔비디아의 계속된 강점입니다. 엔비디아는 하드웨어뿐만 아니라 CUDA를 통해 경쟁합니다. CUDA는 오랜 세월에 걸쳐 구축되고 AI 개발자와 데이터 센터에서 사용하는 도구에 깊숙이 통합된 소프트웨어 생태계입니다. 이 생태계는 하드웨어 전환을 복잡하게 만듭니다. 경쟁 프로세서는 인상적인 기술 성능을 제공할 수 있지만, 고객은 또한 소프트웨어 호환성, 개발자 경험 및 기존 워크로드 마이그레이션 비용도 고려해야 합니다.
세레브러스는 근본적으로 다른 아키텍처를 통해 이러한 장벽을 극복하려고 노력하고 있습니다. 주요 AI 개발자로부터 추론 워크로드를 확보하는 것은 성능 이점이 충분히 클 때 고객이 기존 GPU 인프라를 넘어서려고 기꺼이 움직일 의사가 있음을 보여줄 것입니다. 이것이 OpenAI의 하드웨어 결정이 주목을 받는 이유입니다. 고속 최첨단 모델을 제공하는 것은 대체 AI 칩이 시장의 최상위에서 경쟁할 수 있는지 여부를 보여주는 중요한 시연이 될 수 있습니다.
현재 상황은 세레브러스가 OpenAI의 인프라에서 영구적으로 제외되었다는 것을 입증하지 않습니다. 대규모 AI 회사는 다양한 모델, 워크로드 및 배포 단계에 다양한 하드웨어를 사용합니다. 엔비디아의 보도된 역할은 그럼에도 불구하고 세레브러스가 최적화가 증가하는 GPU 시스템으로 쉽게 재현할 수 없는 이점을 전문화된 아키텍처가 전달한다는 것을 증명해야 한다는 압박을 더합니다. AI 추론이 더 빠르고 상호작용적이 됨에 따라, 그 경쟁이 심화될 가능성이 높습니다.
7% 하락은 시장의 불확실성을 반영합니다. 핵심 질문은 더 이상 전문화된 AI 하드웨어가 예외적인 속도를 제공할 수 있는지 여부가 아니라, 엔비디아의 GPU가 동일한 저지연 워크로드를 향해 추진될 때 그 속도가 충분히 차별화되어 있는지 여부입니다.