NVIDIA Blackwell GPUs are powering OpenAI's GPT-6 Astra Ultrafast model, now available in the OpenAI API and to eligible ChatGPT Work and Codex users in production.
GPT-6 Astra Ultrafast는 NVIDIA Blackwell GPU에서 실행되며, 이제 OpenAI API와 적격 ChatGPT Work 및 Codex 사용자를 통해 이용 가능합니다.
OpenAI 모델에 내장된 추론 최적화를 활용하여 NVIDIA Blackwell 아키텍처를 활용하는 Ultrafast는 Astra Standard 모드보다 최대 8배 빠른 토큰 생성을 제공합니다. 개발자의 경우, 가속화된 생성은 코딩 에이전트의 편집-테스트-디버그 사이클을 단축하고, 도구 호출 간 지연 시간을 줄이며, 대화형 애플리케이션을 더 반응성 있게 만듭니다.
성능 이득은 워크플로우 전반에 걸쳐 반복적으로 적용될 때 가장 중요합니다—에이전트가 코드를 작성하고, 도구를 호출하고, 결과를 확인하고, 다음 단계를 결정합니다. Ultrafast는 Astra의 전체 기능을 이러한 시간에 민감한 루프에 도입하여 NVIDIA 인프라가 개발자가 필요할 때 유용한 모델 출력을 제공할 수 있도록 합니다.
"NVIDIA의 도구 및 문서에 대한 깊은 투자 덕분에 우리는 Blackwell과 Rubin GPU를 프로그래밍하는 데 뛰어난 모델을 만들 수 있었습니다," OpenAI의 추론 리드인 Philippe Tillet이 말했습니다. "Astra는 그 지식을 지연 시간, 처리량 및 비용의 전체 범위에서 NVIDIA 하드웨어를 매력적으로 만드는 고성능 커널로 변환할 수 있습니다. Astra Ultrafast를 사용하면, 에이전트가 코드를 작성하고, 도구를 사용하고, 복잡한 작업을 수행할 때 더 빠른 모델 응답을 의미합니다."
OpenAI는 자체 모델을 사용하여 NVIDIA GPU의 추론 소프트웨어를 최적화하고, 플랫폼의 프로그래밍 가능성을 활용하여 개선 사항을 테스트하고 구현함으로써 배포 후 추론 성능을 계속 개선합니다. 이러한 반복적 접근 방식은 모델 응답을 가속화하고 시간이 지남에 따라 배포된 인프라 생산성을 증가시킵니다.
"NVIDIA와의 우리 작업은 AI를 더 빠르고 유용하게 만드는 데 도움이 되고 있습니다," OpenAI의 컴퓨팅 담당 최고 기술 책임자인 Uday Ruddarraju이 말했습니다. "우리는 NVIDIA GPU의 추론을 최적화하기 위해 내부 모델을 사용했으며, NVIDIA의 프로그래밍 가능성은 Astra Ultrafast의 가속화를 제공하는 데 도움이 되었습니다."
프로그래밍 가능한 NVIDIA 플랫폼은 개발자와 연구자가 모델이 진화함에 따라 학습, 추론 및 강화 학습 전반에 걸쳐 인프라를 재사용하여 리소스 활용을 개선하고 개별 워크로드에 대한 과도한 프로비저닝을 피할 수 있도록 합니다. 개발자는 오늘 API를 통해 GPT-6 Astra Ultrafast에 액세스할 수 있습니다. Ultrafast 가이드에서 액세스 방법, 가격 책정 및 구현 세부 사항을 확인하세요.