OpenAI와 Broadcom, 기가와트급 데이터 이동 최적화 50% 낮은 추론 비용을 주장하는 맞춤형 AI 추론 칩 Jalapeño 공개
ChatGPT를 운영하는 데 있어 가장 비용이 많이 드는 부분은 엔지니어나 사무실 공간이 아니라 칩, 특히 Nvidia가 만든 칩입니다. Nvidia의 가격에 구매되고, 소비되는 속도로 인해 컴퓨팅 지출이 OpenAI의 가장 큰 운영 비용 중 하나가 되었습니다. 수요일, OpenAI는 이것이 출구의 시작이 될 것으로 희망하는 것을 성취했습니다.
OpenAI와 Broadcom은 OpenAI의 첫 번째 맞춤형 AI 가속기인 Jalapeño를 공개했습니다. 이 칩은 OpenAI의 엔지니어링 팀에 의해 처음부터 설계되었고, TSMC에서 제조되었으며, 추론 워크로드를 실행하도록 구축되었습니다. 추론 워크로드는 학습된 모델로부터 ChatGPT, Codex, OpenAI의 API 사용자, 그리고 회사가 설명하는 차세대 에이전트형 AI 제품의 사용자들에게 응답을 제공하는 프로세스입니다. 이것은 학습 칩이 아닙니다. 범용이 되려고 시도하지 않습니다. OpenAI가 운영하는 규모에서 한 가지 작업을 가능한 한 효율적으로 수행합니다.
초기 실험실 테스트에 따르면, Jalapeño는 Nvidia의 Blackwell 프로세서 및 Google의 Tensor Processing Unit과 동등한 성능을 제공하며, 추론 토큰당 비용이 약 50% 낮습니다. 이는 의미 있는 수치입니다. 단, 이러한 수치가 유지된다는 조건입니다. 기초 데이터가 포함된 기술 보고서는 아직 발표되지 않았습니다. OpenAI는 "앞으로 몇 개월 안에" 공개될 것이라고 말합니다.
Broadcom CEO Hock Tan과 회장 Charlie Kawwas와의 인수인계식에서 CEO Sam Altman과 함께 첫 번째 웨이퍼를 받은 OpenAI 회장 Greg Brockman은 인프라 제어의 관점에서 발표를 프레이밍했습니다. "스택의 더 많은 부분을 직접 설계함으로써, 우리는 더 큰 효율성으로 더 많은 지능을 제공할 수 있고, 고급 AI를 더 널리 접근할 수 있도록 계속 밀어붙일 수 있습니다"라고 Brockman은 CNBC에 말했습니다. 이 칩은 초기 설계에서 제조 테이프 아웃까지 9개월이 걸렸으며, 이는 OpenAI와 Broadcom이 고성능 AI 반도체에서 지금까지 달성한 가장 빠른 일정이라고 설명합니다. 설계 프로세스의 일부는 OpenAI의 자체 AI 모델을 사용하여 가속화되었습니다.
AI 추론 워크로드는 이제 AI 데이터 센터 컴퓨팅의 2/3를 차지하고 있으며, 그 워크로드의 경제성이 Jalapeño의 목표입니다. AI 메모리 칩은 추론 배포의 수요 증가로 인해 연중 공급 부족 상태에 있습니다. 지난 달 Nvidia의 250억 달러 채권 판매는 회사의 5년 만의 첫 채무 제공이며, AI 붐의 최대 수혜자도 생산 용량 확대를 위해 경쟁하고 있음을 시사합니다. Jalapeño는 OpenAI가 그 공급망에 대한 의존도를 줄이기 위한 지금까지 가장 직접적인 시도입니다.
OpenAI는 이제 수년간 맞춤형 실리콘을 구축해 온 회사들의 반열에 합류합니다. Google은 Tensor Processing Unit을 가지고 있고, Amazon은 Trainium을 가지고 있으며, Meta는 자체 추론 실리콘을 개발하고 있습니다. 하지만 이 비교는 Jalapeño가 나타내는 것을 부분적으로만 포착합니다. 그 칩들은 하이퍼스케일러에 의해 외부 클라우드 고객에게 서비스를 제공하기 위해 구축되었습니다. OpenAI는 자신의 제품과 자신의 사용자를 위한 칩을 구축하고 있으며, 연구 비영리로 시작한 회사가 이제 기술 산업에서 가장 자본 집약적인 엔지니어링 프로그램 중 하나에 전념하고 있습니다.
Hock Tan은 OpenAI와의 협력이 "2026년부터 Microsoft 및 기타 파트너와 함께 기가와트 규모 데이터 센터의 배포"를 가능하게 한다고 말했습니다. 기가와트 규모는 AI 산업이 가장 큰 인프라 구축을 설명할 때 사용하는 측정 단위입니다. 이것이 Jalapeño의 생산 요구 사항 및 TSMC가 제공해야 할 제조 수율에 대해 의미하는 바는 공개되지 않았습니다. Celestica는 보드 및 랙 통합을 담당하고 있습니다. 회사들은 Jalapeño를 다세대 컴퓨팅 플랫폼의 첫 번째 단계로 설명하며, 초기 배포는 2026년 말을 목표로 합니다.
칩의 아키텍처는 학습 가속기 또는 범용 프로세서에 적응한 것이 아니라 대규모 언어 모델에 대한 추론을 위해 특별히 설계되었습니다. 이 설계 선택은 AI 산업이 탐색하고 있는 구조적 전환을 반영합니다: 모델 구축에서 엄청난 규모로 이를 저렴하게 운영하는 것으로의 전환입니다. 올해 OpenAI의 Elon Musk의 xAI와의 법적 분쟁은 회사의 전략적 결정이 얼마나 분쟁이 많은지를 명확히 하고 있습니다. 이것은 올해뿐만 아니라 무한정으로 그 규모에서 운영하는 경제성에 관한 것입니다.
OpenAI와 Broadcom은 50% 비용 절감 주장을 독자가 독립적으로 평가할 수 있게 해주는 어떤 것도 제공하지 않았습니다. 발표된 방법론이 없습니다. 제3자 벤치마크 결과가 없습니다. TSMC의 수율 데이터가 없습니다. Jalapeño는 생산 환경에서 실행된 적이 없는 첫 번째 세대 칩이며, 제조사가 이미 설명하고 있는 기가와트 규모의 환경은 더욱 그렇습니다. 수요일 현재, 존재하는 것은 잠재력뿐입니다. 칩이 인도되었습니다. 증거는 여전히 작성 중입니다.