OpenAI의 첫 번째 맞춤형 가속기 Jalapeño는 Moonshot AI의 Kimi K3와 유사하게 메모리 대역폭 병목 현상을 해결하도록 설계되었습니다.
OpenAI는 Broadcom와 공동 개발한 맞춤형 추론 가속기인 Jalapeño의 첫 번째 포괄적인 성능 데이터를 공개했다. 이 수치는 하나의 핵심 과제, 즉 유휴 시간을 없애고 연산 코어로 데이터를 충분히 빠르게 공급하는 것을 중심으로 설계된 칩을 보여준다. SemiAnalysis의 InferenceX 스위트에서 GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T 등 세 가지 모델 계열에 대해 벤치마킹한 결과, Jalapeño는 최고 운영 시 킬로와트당 혼합 토큰 처리량이 기존 OpenAI가 평가한 선도적인 상용 시스템보다 1.5배에서 1.9배 더 높았으며, 엔드투엔드 요청 지연 시간은 1.7배에서 3.6배 감소했다. 높은 지연 민감도를 가진 상호작용 워크로드의 경우, 이 성능 우위가 2.1배에서 4.1배까지 확대되었다.
비교 하드웨어의 최대 능력과 정확히 일치하도록 디코드 속도가 맞춰진 후 킬로와트당 처리량을 측정할 때 가장 눈에 띄는 수치가 나타난다. 그 균형 상태에서 Jalapeño는 GPT-OSS 기준 참조 시스템보다 킬로와트당 혼합 토큰이 53.7배 더 많았고, DeepSeek R1에서는 104.3배, Kimi K2.5에서는 56.1배 더 많았다. 이러한 승수들은 최고점과 고부하 운영 지점에서 widening되는 우위를 강조한다. OpenAI의 자체 차트는 경량 워크로드 하에서 성능 격차가 현저히 좁아짐을 나타내며, 이는 해당 수치가 일반적인 운영 기준선보다는 극단적 사례의 상한선을 대표함을 의미한다.
OpenAI는 실제 운영자 경험의 관점에서 성능을 평가했다. 이는 순수 처리량 alone를 우선시하기보다, 상호작용 에이전트의 엄격한 지연 요구 사항을 유지하면서 단위 전력당 완료된 유용한 작업을 측정하는 방식이었다. 이 구별은 중요하다. 에이전틱 워크로드는 수많은 모델 호출을 체인으로 연결하므로, 단계별 미세 지연이 전체 작업에 걸쳐 누적되기 때문이다. 결과를 정규화하기 위해 OpenAI는 각 가속기의 공식 전력 등급을 사용했으며, Jalapeño는 700와트, 비교 대상 칩은 각각 1,200와트와 1,400와트로 평가되었다. 또한 Jalapeño의 측정된 지속 전력은 테스트된 모든 워크로드에서 550와트 이하로 유지됨을 확인했다. 벤치마크 중 가장 큰 모델인 Kimi K2.5(1조 파라미터) 대비 Jalapeño는 와트당 최고 성능이 약 1.5배 높았고, 엔드투엔드 지연 시간은 3.4배 낮았다. 이 마진은 다른 두 모델보다 좁지만, 여전히 Jalapeño를 OpenAI가 테스트된 운영 범위에 대해 '파레토 최적(Pareto frontier)'으로 분류하기에 충분하다.
Jalapeño의 아키텍처는 언어 모델 실행에 대한 정확한 관찰에 기반한다. 프롬프트 처리는 연산 집약적이지만, 자기회귀적 토큰 생성은 주로 메모리 대역폭에 의해 제약된다. 칩 간 통신 지연은 이 문제를 더욱 악화시켜 데이터 대기 중 연산 유닛이 유휴 상태가 된다. 이를 완화하기 위해 OpenAI는 Jalapeño가 데이터 이동을 최소화하도록 설계했으며, 생성 중에 필요한 키-값 캐시를 포함한 모델 상태를 명시적으로 로컬에 배치했다. Broadcom의 Tomahawk 기술을 기반으로 한 광범위한 네트워킹 파브릭은 전체 워크로드가 단일 연결 시스템 내에 머무르도록 하여 칩 경계를 넘어 데이터를 셔틀링할 필요성을 제거한다. Tom’s Hardware가 공개된 칩 이미지를 분석한 결과도 이러한 메모리 중심 설치를 뒷받침한다. 패키징에는 여섯 개의 HBM 모듈로 둘러싸인 단일 대형 연산 칩렛이 포함되어 있으며, 이는 순수 연산 밀도보다 로컬 메모리 접근에 최적화된 구성이다.
Broadcom의 참여는 제조를 훨씬 뛰어넘었다. 동사는 실리콘 구현 및 네트워킹 파브릭을 공급했고, Celestica는 보드, 랙 및 시스템 통합을 관리했다. OpenAI는 이 협력을 재현 가능한 모델로 위치짓고 있다. 자체 모델과 서빙 패턴에 대한 깊은 전문 지식을 갖춘 AI 운영자는 내부 제조 능력을 투자하는 대신 숙련된 실리콘 기업과 파트너십을 맺을 수 있다. Broadcom CEO Hock Tan은 회사의 AI 고객 기반 전반의 컴퓨팅 수요가 이번 decade 말까지 본질적으로 무제한이라고 밝혔다. 마찬가지로 OpenAI 사장 Greg Brockman은 CNBC와의 인터뷰에서 회사가 "컴퓨팅을 충분히 빠르게 확보할 수 없다"고 언급했으며, 이는 한 공급자를 다른 공급자로 대체하기보다 지속적인 확장을 추구하는 OpenAI의 전략과 부합한다.
Jalapeño는 초기 설계부터 테이프아웃까지 단 9개월 만에 진행되었으며, 이 속도에 대해 OpenAI는 자체 모델을 활용해 칩 구현을 탐색하고 검증 루프를 가속화했으며, 칩의 산술 회로 최적화를 포함했다고 부분적으로 평가한다. 이 방법론은 하드웨어를 넘어 확장되었다. OpenAI는 Jalapeño를 결정론적 프로그래밍 대상으로 설계하여 엔지니어들이 워크로드를 명시적인 통신 프로토콜을 가진 로컬 텐서로 정의하도록 요구했다. 이는 스케줄링 및 전체 인프라에 걸친 작업 매핑이라는 어려운 작업을 AI 기반 시스템으로 이전시킨다. Codex with GPT-Astra를 활용하여 엔지니어링 팀은 Jalapeño의 원래 생산 범위 밖인 세 가지 오픈 웨이트 모델을 두 달 만에 고성능으로 최적화했다. GPT-OSS의 특정 어텐션 및 mixture-of-experts 블록의 경우, AI가 생성한 구현체가 인간이 작성한 counterparts보다 1.5배에서 1.8배 더 빠르게 실행되었다. 이는 최첨단 AI 개발의 더 넓은 트렌드의 축소판이다. 칩 설계 및 커널 최적화와 같이 제한적이고 검증 가능한 환경에서 먼저 검증된 기능들은 기초적인 접근법이 입증되면 점차 생산 시스템으로 확장된다.
OpenAI의 Jalapeño 발표 다섯 주 전, Moonshot AI는 2.8조 파라미터를 가진 Kimi K3를 발표했다. 이 모델은 896개의 전문가(expert) 중에서 토큰당 1,040억 파라미터만 활성화한다. 시장의 반응은 2025년 초 DeepSeek의 데뷔가 촉발한 지진 같은 변화와 유사했다. 뉴스 이후 반도체 주식은 하락했으며, Bloomberg는 중국 AI 경쟁사들의 급격한 매도세를 보도했다. Z.ai는 28%, MiniMax는 같은 날 16% 하락했다. 그러나 Bloomberg의 후속 분석은 Kimi K3를 DeepSeek와 직접 비교하는 것이 오해의 소지가 있다고 주장했다. DeepSeek의 돌파구가 훈련 및 추론 비용 절감에 집중했다면, Kimi K3는 메모리 인프라 수요를 극적으로 증가시키는 규모에서 컴퓨팅 효율성을 향상시킨다. 메모리 시장을 약화시키기보다, 이러한 아키텍처 선택은 SK 하이닉스와 Nvidia의 차세대 시스템으로부터 고품질 대역폭 메모리(HBM) 솔루션의 전략적 가치를 강화한다.
Moonshot의 기술 문서는 이러한 평가를 지지한다. Kimi K3는 컨텍스트 윈도우가 확장됨에 따라 표준 트랜스포머 아키텍처에 내재된 메모리 병목 현상을 완화하도록 설계된 하이브리드 선형 어텐션 메커니즘인 Kimi Delta Attention을 중심으로 구축되었다. 이는 Moonshot가 '어텐션 잔여물(Attention Residuals)'이라 명명한 새로운 계층 간 데이터 이동 기법으로 보완된다. 모델 호스팅 요구 사항에 대한 독립적인 분석은 디코딩을 주요 병목 현상으로 식별한다. 새로 생성된 각 토큰이 모델 가중치를 정확히 한 번씩 접근하기 때문에, 라우팅 희소성과 관계없이 연산 코어는 데이터가 부족하며 고품질 대역폭 메모리를 기다리게 된다. Moonshot의 공식 배포 가이드라인은 프로덕션 환경에 64개 이상의 가속기로 구성된 슈퍼노드 구성을 권장한다. furthermore, 출시된 체크포인트에 대한 제3자 평가는 최소 실용적인 VRAM 사용량이 1.6테라바이트를 초과한다고 추정한다.
이러한 아키텍처에 있어 중국의 메모리 공급망은 여전히 핵심 병목 현상이다. Huawei는 고품질 대역폭 메모리(HBM) 칩 개발을 목표로 하는 국내 컨소시엄을 주도해 왔으나, 고급 HBM 제조는 여전히 SK 하이닉스, 삼성, 마이크론에 집중되어 있다. 중국의 가장 진보된 국내 메모리 생산자는 현대식 가속기가 요구하는 밀도로 HBM을 제작할 능력을 아직 입증하지 못했으며, 양산에 도달하는 것은 더욱 멀었다. Kimi K3 출시와 함께 발표된 뱅크 오브 아메리카의 연구 노트는 ongoing 컴퓨팅 제한에도 불구하고 대규모 사전 훈련과 아키텍처 효율성 결합이 중국 연구소에 상당한 성능 향상을 가져올 수 있다고 제안했다. 그러나 이 관점은 근본적인 해결책이라기보다 메모리 부족에 대한 완화 전략으로 작용한다.
나란히 볼 때, Jalapeño와 Kimi K3는 서로 다른 출발점에서 동일한 산업적 압력을 보여준다. OpenAI는 최첨단 실리콘에 거의 제한 없이 접근하며, 전력 효율성과 비용 최적화를 극대화하기 위해 맞춤형 칩 개발을 추구한다. 이 전략에서 킬로와트당 토큰이 1.5배 개선되는 것조차 방대한 데이터 센터 군집 전반에 걸쳐 상당한 재정적 절감으로 이어진다. 반면 Moonshot는 차세대 가속기 및 관련 메모리 인프라 접근을 제한하는 수출 규제를 극복해야 하며, 향후 하드웨어 가용성에 의존하기보다 토큰당 필요한 메모리 대역폭을 본질적으로 줄이는 모델을 아키텍처링함으로써 대응한다. 두 접근 방식 모두 단일한 결론으로 수렴한다. 모델 규모가 확장되고 추론 워크로드가 더 길고 더 에이전틱한 작업으로 진화함에 따라, 메모리 대역폭은 태평양 양안의 AI 연구소들이 순수 연산 처리량보다 우선시하게 된 핵심 자원으로 부상했다.
OpenAI는 2026년 말까지 자체 인프라 내에서 Jalapeño의 배포를 시작할 계획이며, Nvidia 및 기타 공급자의 사용을 계속 확장하고 대체하지는 않을 것이라고 밝혔다. 회사는 이러한 하이브리드 조달 전략이 단일 공급업체 의존도에 과도하게 몰입하지 않으면서 성장 속도를 유지하는 데 필수적이라고 설명한다.