Cerebras는 GPT-5.6 Sol용 OpenAI의 새로운 Ultrafast 모드를 구동하고 있으며, Cerebras 하드웨어 플랫폼에서 14배 빠른 추론과 초당 최대 750개의 출력 토큰을 제공합니다.
OpenAI가 초당 최대 750개의 출력 토큰을 제공하는 새로운 "Ultrafast" 모드의 미리보기를 출시하고 있습니다. 이는 플래그십 모델인 GPT-5.6 Sol에서 제공됩니다. 추론 가속화는 올해 초 OpenAI와 100억 달러 규모의 파트너십을 체결한 Cerebras에서 나옵니다. 처음에는 GPT-5.6 Sol용 OpenAI API를 통해서만 제공되며 선정된 고객으로 제한되지만, 용량이 증가함에 따라 점진적으로 확대될 것입니다. 조기 액세스에 관심 있는 회사는 양식을 통해 등록할 수 있습니다.
OpenAI는 Ultrafast가 작은 모델의 속도와 큰 추론 모델의 모든 기능을 결합하도록 설계되었으며, 회사가 "초당 더 유용한 작업"이라고 부르는 것을 가능하게 한다고 말합니다. 예를 들어, 장애 대응 중에 엔지니어는 아직 진행 중인 장애 동안 로그, 코드 변경 및 보고서를 분석하여 원인을 파악하고 실시간으로 수정 사항을 준비할 수 있습니다. OpenAI는 이미 이 목적을 위해 내부적으로 모델을 사용하고 있다고 말합니다.
OpenAI는 다른 여러 시나리오를 강조합니다. 금융에서는 모델이 시장 신호를 평가하고 조건이 여전히 변하는 동안 의심스러운 거래에 플래그를 붙일 수 있습니다. 고객 지원에서는 복잡한 문의를 실시간으로 해결할 수 있으며, 찾는 답변이 여러 단계 또는 시스템이 필요한 경우에도 마찬가지입니다. 전자상거래에서는 제품 질문에 답하고, 재고 수준을 확인하고, 주저하는 구매자가 장바구니를 떠나기 전에 개인화된 권장사항을 제공할 수 있습니다.
연구는 OpenAI가 강조하는 또 다른 분야입니다. 이전에 일괄 작업으로 밤새 실행되던 실험은 대화형 작업 세션으로 변할 수 있으며, 팀이 아이디어를 테스트하고 결과를 검토하고 접근 방식을 조정하고 워크플로우를 중단하지 않고 다른 실행을 시작할 수 있습니다.
OpenAI는 이미 계층적으로 추론 속도를 수익화하고 있습니다. API를 통해 GPT-5.6 Sol에 대해 대략 2배의 가격으로 최대 2.5배의 속도와 더 낮은 지연 시간을 약속하는 "Fast Mode"를 제공합니다. Ultrafast는 세 번째, 더 빠른—그리고 아마도 더 비싼—계층을 추가합니다. 논리는 AWS와 같은 클라우드 제공자를 반영하며, 이들은 오랫동안 더 높은 성능 수준에서 동일한 서비스에 대해 더 많은 비용을 청구했습니다. 속도가 산업 전반에 걸쳐 병목이 되면, 이 계층화된 모델은 OpenAI에 더 빠른 추론이 만드는 수익 증가의 직접적인 몫을 제공합니다.