Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

OpenAI는 자체 개발한 Jalapeño 칩을 공개하며, 경쟁사 가속기 대비 훨씬 빠른 추론 속도와 우수한 성능 대비 전력 효율을 제공한다고 밝혔다.

오픈에이아이의 자사형 ASIC인 할라페뇨 도입은 표준 GPU 공급업체들의 경쟁 압박을 가중시키며, 대규모 AI 학습 및 추론 분야에서 벤더 특화 실리콘으로의 구조적 전환을 시사한다.
업계 전문지Slicast · August 26, 2026 · 미국 · 출처: Livemint
중요도 88

OpenAI는 와트당 더 많은 AI 작업을 처리하고 응답 시간을 크게 단축하도록 설계된 최초의 맞춤형 추론 칩인 Jalapeño의 새로운 성능 결과를 공개했습니다. 프로세서를 독립적인 하드웨어로 취급하는 전통적인 접근 방식과 달리, OpenAI는 칩, 메모리, 네트워킹 및 소프트웨어를 결합한 통합 시스템의 일부로서 Jalapeño를 설계했습니다. 이 가속기는 모델을 개발하는 데 사용되는 학습 단계가 아니라, 훈련된 모델이 출력을 생성하는 추론 단계에 특화되어 구축되었습니다.

OpenAI는 Kimi K2.5 1T를 포함한 세 가지 공개 모델과 비교하여 Jalapeño를 테스트했으며, 이는 평가된 가장 큰 모델입니다. 전체 스위트에서 회사는 피크 처리량 기준 Jalapeño가 참조 시스템 대비 와트당 AI 작업량이 1.5배에서 1.9배 더 많고, 엔드투엔드 지연 시간이 1.7배에서 3.6배 낮으며, 고상호성 워크로드에 대해 성능이 2.1배에서 4.1배 더 높다고 보고했습니다. 특히 Kimi K2.5 1T의 경우, Jalapeño는 와트당 피크 성능이 약 1.5배 높고 엔드투엔드 지연 시간이 3.4배 낮았습니다. OpenAI는 이러한 결과가 독점 벤치마크 결과이며, 특정 테스트 방법론 및 비교 시스템의 맥락 내에서 해석해야 한다고 명시했습니다.

이 칩의 아키텍처는 AI 추론의 고유한 단계와 병목 현상을 해결합니다. 프리필(prefill) 단계에서는 시스템이 상대적으로 연산 집약적인 작업을 통해 사용자 프롬프트를 처리합니다. 디코딩(decode) 단계는 토큰별로 응답을 생성하며 주로 메모리 대역폭에 의해 제약됩니다. 세 번째 과제는 통신 오버헤드로, 프로세싱 유닛이 다른 프로세서나 메모리 리소스 간 데이터 이동 대기 중 종종 유휴 상태가 됩니다. 이러한 문제를 완화하기 위해 Jalapeño는 KV 캐시를 포함하여 중요한 모델 정보를 필요한 위치에 물리적으로 가깝게 유지합니다. OpenAI는 네트워킹 레이어가 아키텍처의 핵심 요소이며, 워크로드가 긴밀하게 연결된 시스템 내에 머무르도록 하여 불필요한 데이터 이동을 최소화한다고 강조합니다. 이 접근 방식은 프리필과 디코딩 작업을 모두 효율적으로 처리할 수 있는 균형 잡힌 가속기를 제공하며, 이는 여러 칩에 분산되어야 하는 수천억 개 또는 수조 개의 파라미터를 가진 대규모 AI 모델의 특성상 특히 중요합니다.

기존 챗봇의 경우, 더 빠른 추론은 직접적으로 더 빠른 응답 시간으로 이어집니다. 그러나 효율성 향상은 여러 순차적 작업을 실행하는 AI 에이전트에 훨씬 더 큰 영향을 미칠 것으로 예상됩니다. 현대 언어 모델과 AI 에이전트의 특정 특성에 맞춰 하드웨어를 최적화함으로써, OpenAI는 더 적은 전력 소비와 짧은 사용자 대기 시간으로 더 유용한 AI 출력을 생성하는 것을 목표로 합니다.

특히 OpenAI는 인공지능이 프로세서 자체의 설계에 직접적인 역할을 했다고 주장합니다. AI 도구는 엔지니어들이 대체 구현 방식을 탐색하고, 설계 및 검증 주기를 압축하며, 산술 회로를 최적화하는 것을 지원했습니다. 이렇게 가속화된 워크플로우 덕분에 팀은 초기 설계부터 제조를 위해 제출하는 테이프아웃(tapeout) 단계까지 단 9개월 만에 완료할 수 있었습니다. 하드웨어 완공 후, AI는 동봉된 소프트웨어 스택 최적화에도 활용되었습니다.

Jalapeño의 능력을 감안하더라도, OpenAI는 학습과 추론을 위해 Nvidia 및 기타 파트너의 가속자를 계속 배포할 것이라고 명시했습니다. 따라서 Jalapeño는 상용 GPU의 즉각적인 대체재라기보다 OpenAI의 컴퓨팅 용량의 점진적인 추가물로 보는 것이 적절합니다. 전략적으로는 이 칩이 OpenAI에게 인프라 스택의 일부분에 대한 더 큰 통제력을 부여하여, 향후 하드웨어가 독점 모델과 워크로드에 더 밀접하게 맞춤화될 수 있도록 합니다. Jalapeño는 다세대 하드웨어 로드맵의 첫 번째 세대를 대표하며, 두 번째 및 세 번째 세대 칩은 이미 개발 중입니다. 대규모 배포 전에 OpenAI는 2026년 말까지 내부 롤아웃을 시작하면서 추가 모델에 걸쳐 생산 자격 인증, 소프트웨어 개발 및 성능 테스트를 계속 진행할 계획입니다.

원문 보기