Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
컴퓨트·클라우드리포트
컴퓨트·클라우드 · 리포트

Cerebras가 OpenAI의 GPT-5.6 Sol 추론 엔진을 구동하여 초당 750개 토큰을 전달하고 11시간 내 2,500개 질문을 처리합니다

Cerebras를 프로덕션급 추론 가속기로 검증; OpenAI의 선택이 자사 칩들이 실제 워크로드에서 GPU와 경쟁 중임을 시사
업계 전문지Slicast · 2026년 8월 13일 17:10 UTC · 미국 · 출처: quiverquant.com
중요도 91

Cerebras Systems는 OpenAI의 GPT-5.6 Sol을 위한 새로운 서비스 등급인 Ultrafast 모드의 출시를 발표했습니다. 이 모드는 초당 최대 750개의 토큰 처리 속도를 제공하며, 이는 표준 처리 속도보다 최대 14배 빠른 것입니다. 초기에는 제한된 사전 검토를 통해 일부 선택된 OpenAI 고객에게만 제공되며, Ultrafast는 지연 시간을 크게 줄이면서 GPT-5.6 Sol의 전체 지능에 대한 접근을 제공합니다.

CEO 앤드루 펠드먼(Andrew Feldman)은 이러한 속도를 달성하는 것이 더 넓은 AI 채택에 중요하다고 언급했습니다. 펠드먼은 "모든 주요 컴퓨팅 전환은 속도의 도약으로 가능해졌습니다. PC 시대에는 킬로헤르츠에서 기가헤르츠로의 점프가 필요했고, 인터넷은 모든 사람에게 도달하기 전에 다이얼업에서 광대역으로 이동해야 했습니다. AI도 다르지 않습니다. 이제 프론티어 모델들이 명백한 능력을 갖추게 되었으니, 채택에 대한 다음 제약 조건은 얼마나 빠르게 실행되느냐입니다."라고 말했습니다.

OpenAI의 VP 컴퓨트 전략 및 GPT-인프라 책임자 사친 카티(Sachin Katti)는 파트너십이 프론티어 모델의 지능에 훨씬 낮은 지연 시간으로 접근할 수 있을 때 고객이 어떻게 혜택을 보는지 탐색하고 있다고 밝혔습니다. 그는 "우리는 먼저 소수의 고객 그룹과 함께 그 속도가 의미 있는 가치를 창출하는 곳을 배우고 있으며, 이러한 학습 내용을 바탕으로 시간이 지남에 따라 서비스를 확장하는 방식을 결정할 것입니다."라고 말했습니다.

Ultrafast 등급은 근본적인 제약을 해결합니다. 조직들은 역사적으로 더 큰 모델의 기능과 더 작은 모델의 빠른 응답 시간 중 하나를 선택해야 했습니다. Artificial Analysis가 보고한 출력 속도에 따르면, Ultrafast는 Fast 모드에서 Claude Opus 4.8보다 5배 빠르고 Claude Fable 5보다 11배 빠르며, 프론티어 지능과 전례 없는 속도를 결합합니다.

벤치마크 결과는 실제 영향을 보여줍니다. 대학원 수준의 화학, 경제학, 문학 분야를 아우르는 2,500개 질문으로 구성된 Humanity's Last Exam 벤치마크에서 GPT-5.6 Sol Ultrafast는 Claude Fable 5가 연속 계산으로 3일 이상 걸린 것에 비해 불과 11시간 만에 전체 질문 세트에 답변했으며, 거의 7배 더 빠른 속도로 유사한 정확도에 도달했습니다. 법률 요약서, 재무 모델, 엔지니어링 보고서 등 경제적 가치가 높은 지식 작업 작업을 평가하는 GDP-Val 벤치마크에서는 Ultrafast가 품질 저하 없이 5.6배의 종단 간 속도 향상을 제공했습니다.

Ultrafast의 속도는 Cerebras의 웨이퍼 스케일 엔진(Wafer-Scale Engine) 아키텍처에서 비롯됩니다. 이 아키텍처는 GPU 기반 추론이 필요한 온칩 및 오프칩 저장소 간 데이터 이동 대신 모델 가중치를 칩 내부에 유지합니다. 각 웨이퍼 크기 칩에는 44GB의 SRAM이 탑재되어 있습니다. 이 접근 방식은 기존 하드웨어에서 프론티어 모델 추론 속도를 제한하는 메모리 대역폭 병목 현상을 제거합니다. Cerebras는 초기 피드백과 경험을 바탕으로 추가 고객에게 Ultrafast 용량을 확장할 계획입니다.

원문 보기
Cerebras가 OpenAI의 GPT-5.6 Sol 추론 엔진을 구동하여 초당… · Slicast