Tuesday, September 29, 2026
AI 인프라 · 뉴스 & 분석
홈 › 헤드라인 › 리포트
헤드라인 · 리포트

Cerebras와 OpenAI, GPT-5.6 Sol Ultrafast Mode 발표 - Cerebras 하드웨어로 프로덕션 규모의 초당 최대 750토큰 추론 제공

Cerebras가 대규모 AI 추론용 비GPU 솔루션을 검증하는 주요 생산 성공을 달성하며 GPU 주도 인프라 패러다임에 도전했다.
업계 전문지Slicast · 2026년 8월 13일 18:37 UTC · 미국 · 출처: Unite.AI
중요도 91

Cerebras는 이제 어떤 GPU 클라우드도 공개적으로 달성한 속도를 초과하여 OpenAI의 주력 모델을 실행 중입니다. 2026년 8월 13일, 웨이퍼 규모 칩메이커인 Cerebras는 Ultrafast라는 새로운 OpenAI 서비스 계층에서 GPT-5.6 Sol을 지원한다고 발표했으며, 초당 최대 750개의 출력 토큰을 제공하고 OpenAI의 설명에 따르면 표준 처리보다 최대 14배 빠르게 모델을 실행합니다. Ultrafast는 먼저 OpenAI API에서 선별된 고객 그룹을 위한 제한된 미리보기로 출시되며, 용량이 증가함에 따라 접근성이 확대될 것입니다.

핵심 주장은 직설적입니다: 속도 페널티 없는 최고 수준의 지능입니다. GPT-5.6 Sol은 OpenAI의 가장 능력 있는 모델이며, Cerebras 실리콘에서 실시간 제품에 적합한 속도로 토큰을 생성합니다. 양사는 이 계층을 고위험 작업에 충분히 지능적인 모델과 그 작업이 전개되는 동안 사용할 수 있을 만큼 빠른 모델 간의 트레이드오프를 제거하는 것으로 프레임화합니다.

초당 750개의 출력 토큰 수치가 헤드라인을 장악하지만, Cerebras가 발표한 직접 비교 자료가 더 많은 정보를 제공합니다. Artificial Analysis가 보고한 출력 속도와 비교하면, 이 회사는 Ultrafast의 GPT-5.6 Sol이 Claude Fable 5보다 11배 빠르고 Fast 모드의 Opus 4.8보다 5배 빠르다고 주장합니다.

Cerebras는 이 계층을 박사 수준의 어려움으로 제시되는 2,500개 문제 벤치마크인 Humanity's Last Exam에 대해 테스트했습니다. Ultrafast의 GPT-5.6 Sol은 2,500개 문제를 모두 11시간 11분 만에 답변했으며, Claude Fable 5는 비교 가능한 결론에 도달하는 데 78시간 27분이 필요했습니다. Cerebras의 측정에 따르면 거의 7배 느립니다. GDP-Val이라는 경제적 가치 있는 지식 작업을 위한 벤치마크에서, 이 회사는 품질 저하 없이 표준 처리에 비해 5.6배의 end-to-end 속도 향상을 보고합니다.

이들은 공급업체 실시 평가입니다. Humanity's Last Exam 비교는 Cerebras에 의해 2026년 7월 10일과 7월 13–15일에 벤치마크되었으며, GDP-Val 수치는 2026년 7월 31일 테스트에서 나왔습니다. 이들을 회사 자체 측정으로 취급하되, 독립적인 결과는 아닙니다.

메커니즘은 비교적 작은 칩메이커가 GPU 기존 업체들이 달성하지 못한 속도로 OpenAI의 가장 큰 모델을 지원하는 이유를 설명합니다. 대형 모델의 빠른 추론은 근본적으로 데이터 이동 문제입니다: GPU에서는 모델 가중치가 각 연속 토큰을 생성하기 위해 온칩 메모리와 오프칩 스토리지 간에 반복적으로 왕복하며, 메모리 대역폭이 병목이 됩니다.

Cerebras는 이러한 이동을 제거합니다. Wafer-Scale Engine은 단일 웨이퍼 크기의 칩에 44GB의 SRAM을 집적하여 모델 가중치를 온칩에 유지하므로 토큰이 중단 없이 웨이퍼 전체에 파이프라인된 계층을 통해 흐릅니다. 가중치가 실리콘을 떠나지 않기 때문에 이 접근 방식은 모델 크기에 따라 확장됩니다. 회사의 주장은 속도 이점이 최고 수준의 모델이 성장할 때 유지된다는 것입니다. 추론 경제학 관점에서 이것은 결정적입니다: 모델을 지원하는 비용과 레이턴시는 계산으로 가중치를 얼마나 빨리 공급할 수 있는지에 의해 지배되며, 44GB를 하나의 다이에 상주시키는 것이 이를 직접 해결합니다.

Ultrafast는 수개월 동안 구축되고 있는 관계의 가장 눈에 띄는 제품입니다. OpenAI는 2026년 초 저레이턴시 컴퓨팅을 위해 Cerebras에 100억 달러를 지급했으며, 이 출시는 그 용량을 더 작거나 특화된 모델이 아닌 회사의 최고 모델을 지원하기 위해 배치합니다. OpenAI는 Ultrafast를 초저레이턴시 추론을 플랫폼에 제공하기 위한 파트너십의 "다음 단계"로 설명합니다.

Cerebras의 경우 이 배치는 중요합니다. 스타트업은 오랫동안 웨이퍼 규모 아키텍처가 시장의 중심이 GPU 공급업체에 있을지라도 추론에 적합한 형태라고 주장해왔습니다. 이는 기존 업체들이 모델을 실리콘에 직접 포함시키려고 할 때 가속기 비즈니스 전체에서 펼쳐지는 경쟁입니다. OpenAI의 주력을 위한 지원 계층을 확보하면 Cerebras는 시장의 정상에서 프로덕션 참조 계정을 얻습니다. 모델 자체는 OpenAI가 출시한 GPT-5.6 제품군의 앵커이며, Sol은 균형 잡힌 Terra 및 비용 효율적인 Luna와 함께 주력이므로, Ultrafast는 Cerebras를 그 라인업의 최전선에 연결합니다.

OpenAI는 이 계층을 시간 민감한 고위험 작업에 위치시키고 있습니다: 활성 장애 중 사건 대응, 시장 상황 변화에 따른 금융 조사, 실시간 고객 지원 및 음성, 상거래, 그리고 이전에 밤새 실행되던 라이브 연구 루프. 초기 접근은 Jane Street, Podium, Basis, Rogo를 포함한 코딩, 상거래, 금융 분야의 회사들로 이루어졌습니다.

"Cerebras가 가져온 속도 증가는 인상적입니다,"라고 Jane Street의 AI Assistants인 John Crepezzi가 OpenAI의 발표에서 말했습니다. "이는 모델을 사용하는 다양한 방식을 가능하게 하며, 개발자들이 그들과 함께 더 집중되고 생산적인 방식으로 작업할 수 있게 해줍니다."

OpenAI는 의도적으로 출시를 제한하고 있습니다. 회사는 미리보기 기간을 사용하여 순서 크기의 속도 변화가 가장 많은 가치를 창출하는 곳을 파악하고 있으며, 용량이 증가함에 따라 접근을 확대할 것이라고 말합니다. 양사는 미리보기가 확대됨에 따라 업데이트를 위한 등록을 수락하고 있습니다.

단기 성공은 용량에 달려 있으며, 능력에는 달려 있지 않습니다. Ultrafast는 제한된 미리보기이며, 양사는 더 광범위한 가용성을 고정된 날짜가 아닌 용량 증가와 연결합니다. 따라서 확대의 속도가 지켜볼 사항입니다. 더 큰 질문은 OpenAI의 모델이 확장될 때 Cerebras의 온칩 메모리 이점이 유지되는지 여부이며, 이는 정확히 웨이퍼 규모 아키텍처가 구축된 베팅입니다.

원문 보기
Cerebras와 OpenAI, GPT-5.6 Sol Ultrafast Mode… · Slicast