Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

OpenAI는 차세대 맞춤형 가속기 'Jalapeño'를 공개하며, 플래그십 GPU 대비 더 빠른 AI 추론 속도와 낮은 전력 소비를 달성했다고 밝혔다.

제3자 파운드리 의존도를 줄이고 추론 경제성을 최적화하기 위해 최상위 연구소들이 자체 실리콘으로의 전략적 전환을 단행했다.
업계 전문지Slicast · August 27, 2026 · 미국 · 출처: Techgenyz
중요도 85

OpenAI는 자체 맞춤형 AI 추론 칩인 Jalapeño의 첫 번째 상세 성능 결과를 발표하며, 이를 NVIDIA의 최신 하이엔드 시스템과 직접 비교 positioning했습니다. 회사에 따르면 Jalapeño는 와트당 더 많은 AI 작업을 처리하면서도 응답 지연 시간을 크게 줄여주는데, 이는 AI 워크로드가 단순 프롬프트에서 상시 작동하는 에이전트로 전환됨에 따라 두 가지 핵심 지표로 부상하고 있습니다. 다만 OpenAI는 Jalapeño가 전체 AI 인프라 스택 전반에 걸쳐 NVIDIA를 대체하기 위한 것은 아니라고 명확히 했습니다. 대신 이 칩은 추론 특화 가속기로서 기존 NVIDIA 및 서드파티 시스템과 함께 OpenAI에 추가적인 하드웨어 옵션을 제공합니다.

성능 평가를 위해 OpenAI는 SemiAnalysis가 개발한 공개 벤치마크인 InferenceX를 사용했으며, 이는 현실적인 추론 조건 하에서의 AI 서빙 능력을 측정하도록 설계되었습니다. 회사는 GPT-OSS 120B, DeepSeek R1, Kimi K2.5 1T와 관련된 워크로드를 테스트했습니다. 이러한 운영 지점 전반에 걸쳐 Jalapeño는 킬로와트당 피크 처리량이 상업용 참조 시스템 대비 1.5~1.9배 더 높았으며, 엔드투엔드 지연 시간은 1.7~3.6배 낮았습니다. 여러 모델 호출이 필요한 AI 에이전트의 경우, 이러한 지연 시간 감소가 누적되어 눈에 띄게 빠른 상호작용으로 이어질 수 있습니다. 이러한 수치는 독립적인 산업 전체 벤치마크가 아닌 OpenAI의 내부 측정치를 반영합니다.

순수 성능 외에도 Jalapeño 뒤의 아키텍처 접근 방식에 주목할 필요가 있습니다. OpenAI는 칩, 메모리 서브시스템, 네트워킹 파브릭, 서빙 소프트웨어를 통합된 스택으로 설계하여 현대적 언어 모델을 중심으로 정밀하게 튜닝할 수 있도록 했습니다. 이 아키텍처는 불필요한 데이터 이동을 최소화하고 중요한 모델 상태를 컴퓨팅 리소스에 가깝게 유지하며, 범용 하드웨어를 재활용하는 것이 아니라 LLM 추론에 특화되어 있습니다. 이 가속기는 Broadcom 및 Celestica와의 파트너십을 통해 개발되었으며, 광범위한 다세대 인프라 플랫폼의 일환입니다.

직접 비교 테스트에서 OpenAI는 Jalapeño를 NVIDIA의 GB200 및 GB300 가속기를 기반으로 구축된 상업용 시스템과 대결시켰습니다. Kimi K2.5 워크로드에서 Jalapeño는 킬로와트당 초당 혼합 토큰 수 18,195개를 기록하여 GB300 기반 시스템의 11,862개를 능가했으며, 동시에 엔드투엔드 지연 시간을 5.31초에서 1.56초로 단축했습니다. 이러한 향상에도 불구하고 OpenAI는 Jalapeño가 NVIDIA와의 관계를 끊는 신호가 아니라고 강조합니다. 회사는 단일 벤더에 의존하기보다 특정 워크로드 요구사항에 따라 가속기를 선택하는 다각화된 하드웨어 전략을 유지할 계획입니다.

Jalapeño는 OpenAI의 내부 인프라 전용이며 상업적으로 판매되지 않습니다. 첫 세대 가속기는 다세대 컴퓨팅 플랫폼의 초기 단계를 대표하며, 2026년 말까지 배포되고 시간이 지남에 따라 기가와트급 용량으로 확장될 예정입니다. 주목할 점은 OpenAI가 자체 AI 모델을 활용해 설계 및 최적화 파이프라인의 일부 가속화를 지원함으로써, 초기 설계부터 제조 테이프아웃까지 약 9개월 만에 칩 개발 여정을 완료했다는 것입니다. 회사는 어텐션 및 mixture-of-experts 워크로드에 대한 AI 생성 구현체가 이전 인간 작성 버전보다 1.5~1.8배 더 빠르게 실행되었다고 보고했지만, 이러한 개선 사항은 완전한 모델이 아닌 특정 구성 요소에만 적용됩니다.

자체 가속기를 개발함으로써 OpenAI는 지연 시간, 전력 효율성, 메모리 대역폭, 추론 경제성에 대해 더 긴밀한 통제를 얻게 되며, 하드웨어를 일상적으로 운영하는 모델, 서빙 소프트웨어 및 제품과 직접적으로 일치시킵니다. 사용자에게 이는 더 빠른 ChatGPT 응답, 가속화된 Codex 워크플로우, 감소된 API 추론 비용으로 이어질 수 있습니다. 전략적으로 이 조치는 AI 에이전트 및 실시간 추론에 대한 수요가 계속 확대됨에 따라 인프라 유연성을 확보합니다. Jalapeño의 초기 벤치마크 결과가 커스텀 실리콘 분야에서 특히 추론 효율성과 지연 시간 측면에서 강력한 기반을 마련했음은 분명하지만, 진정한 검증은 이러한 성과가 통제된 테스트 환경에서 대규모 생산 환경으로 전환될 때 이루어질 것입니다.

원문 보기