Sunday, September 27, 2026
AI 인프라 · 뉴스 & 분석
홈 › 반도체·하드웨어 › 리포트
반도체·하드웨어 · 리포트

Google의 TPU는 DeepSeek의 오픈소스 vLLM 프레임워크를 이용하여 Nvidia GPU 대비 DeepSeek의 Kimi 모델에서 57% 더 빠른 추론 성능을 제공합니다.

비용 경쟁력 있는 대규모 모델 서빙을 위한 대체 가속기를 검증하고, 추론 단계에서 Nvidia의 지배력에 의문을 제기한다.
업계 전문지Slicast · 2026년 9월 26일 07:12 UTC · 중국 · 출처: 量子位
중요도 70

16개의 Google TPU v7이 Kimi K3를 실행하여 초당 709개의 토큰을 달성했습니다—Nvidia의 GB200이 초당 452개의 토큰을 기록한 것보다 57% 더 빠릅니다.

이 결과를 만든 회사는 Inferact입니다. 새로이 창립된 추론 스타트업으로, 예상과 달리 Kimi의 창작자인 Moon-Whispering Intelligence나 TPU의 제조사인 Google이 아닙니다. Inferact의 창립 팀은 원래 vLLM 개발자들로 구성되어 있으며, 이들은 8억 달러 평가액에서 a16z와 Lightspeed가 주도한 1억 5천만 달러 규모의 시리즈 A 자금을 조성했습니다(Zhenfund, Sequoia, Altimeter의 참여).

이 획기적 성과는 메가커널이라는 기법에 기반합니다. 메가커널은 전통적으로 별도로 스케줄링되던 수백 개의 소규모 프로그램을 하나의 대형 프로그램으로 융합하는 추론 커널입니다. 컨텍스트 전환 오버헤드를 제거하고 TPU의 독특한 온칩 메모리 아키텍처를 활용함으로써, 메가커널은 메모리 대역폭 활용률을 하드웨어의 이론적 최대치에 가깝게 높입니다. DeepSeek의 DSpark 예측적 디코딩 프레임워크와 결합하면, Kimi K3에서 초당 709개의 토큰이라는 결과가 나오며, 구현은 현재 오픈 소스입니다.

**동일한 하드웨어, 다른 결과**

Inferact는 동일한 조건 하에서 16개의 TPU v7 Ironwood를 16개의 GB200과 벤치마크했습니다. 둘 다 Kimi K3를 실행하고, 둘 다 vLLM 추론 엔진을 사용하며, 칩과 커널 구현만 다릅니다. TPU가 압도적으로 승리했습니다: 초당 709개 토큰 대 452개, 57% 우위입니다.

DeepSeek이 개발한 DSpark는 작은 모델이 빠르게 후보 토큰을 예측한 후, 대형 모델 검증을 배치 처리하여 추론을 가속화합니다. Inferact는 이 파이프라인을 TPU에 구현하여, 수용 길이 6(추정당 평균 6개의 검증된 토큰)을 달성했으며, 단일 스텝 디코딩 지연시간은 약 8.5밀리초입니다.

예측적 디코딩 없이는 격차가 더 벌어집니다. 배치 크기 1에서 TPU는 초당 249개 토큰에 도달한 반면 GB200은 127개였습니다—거의 2배의 차이입니다. 배치 크기 8에서 TPU는 초당 865개 토큰에 도달했고 GB200은 636개를 달성했습니다. 4개의 TPU를 사용한 Qwen 27B에서 Inferact는 초당 1,515개 토큰을 달성했으며, 동등한 GB200 구성은 695개였습니다.

속도 이점은 정확도 손실 없이 달성되었습니다. 탐욕 디코딩 검증을 사용하여, TPU의 Kimi K3는 GPQA-Diamond에서 94.4%, GSM8K에서 97.2%를 기록했습니다—GPU 결과와 동일합니다.

**하드웨어 사양의 역설**

57% 격차는 칩의 원시 사양으로 설명할 수 없습니다. TPU v7의 HBM 대역폭은 초당 7,380GB이고, GB200은 초당 8,000GB로 더 높습니다. 그러나 더 낮은 대역폭의 칩이 더 높은 처리량을 제공했습니다—이는 실리콘이 아닌 소프트웨어를 가리키는 역전입니다.

전통적인 추론 워크플로우는 계산을 수백 개의 독립적인 커널로 분산시키며, 각각 좁은 작업을 처리합니다. 커널 전환 사이에 메모리 대역폭이 유휴 상태로 있는 격차가 축적됩니다. CUDA Graphs와 Nvidia의 PDL 기술이 이러한 격차를 좁혀주지만, 커널 경계는 지속됩니다.

메가커널은 경계를 완전히 제거합니다. Kimi K3의 92개 MoE 계층에 대해, Inferact는 모든 92개를 단일 Pallas 프로그램으로 컴파일했습니다—단일 함수 호출이 완전한 정방향 패스를 실행합니다. 경계가 제거되면, 계층 간 가중치 프리페칭이 원활해집니다: 계층 N이 MoE 작업을 계산하는 동안, 계층 N+1의 어텐션 가중치는 이미 메인 메모리에서 온칩 캐시로 프리페칭됩니다. 계산과 데이터 이동이 겹치며, 메모리 대역폭은 거의 유휴 상태가 되지 않습니다.

TPU의 아키텍처가 이 접근을 가능하게 했습니다. 각 TPU v7 TensorCore는 완전한 소프트웨어 제어 하에서 64MiB의 VMEM 온칩 메모리를 포함합니다—엔지니어는 정확히 언제 어떤 데이터를 로드할지와 언제 공간을 해제할지를 결정합니다. 이 용량은 현재 계층의 계산 데이터와 다음 계층의 프리페칭된 가중치를 모두 수용합니다. GPU 아키텍처(Blackwell)는 약 38MiB의 온칩 메모리를 152개의 SM에 걸쳐 자동 하드웨어 스케줄링으로 분산시키므로, 그러한 세밀한 오케스트레이션을 위한 여유 공간이 적습니다.

Inferact는 Google의 저수준 TPU 프로그래밍 언어인 Pallas에서 메가커널을 직접 코딩했습니다(Nvidia GPU용 CUDA와 비교 가능). TPU의 기본 XLA 컴파일러는 단일 계층 최적화에 탁월하지만, 92계층 조정은 자동 스케줄링이 최적 경로를 찾기에는 너무 많은 결정 분기를 제시합니다. Pallas에서 전체 파이프라인을 직접 작성함으로써, 엔지니어는 각 데이터 이동 결정을 제어했습니다. 부차적인 이점: 컴파일 시간이 30분 이상에서 90초 미만으로 단축되었으며, 빠른 반복이 가능해졌습니다—커널 변경은 약 90초 안에 검증됩니다.

현재 메가커널은 Kimi K3의 아키텍처에 맞게 최적화되어 있으며, 다른 모델 레이아웃은 별도의 적응이 필요합니다. Inferact는 추가 모델 아키텍처에 걸쳐 메가커널 지원을 확장할 계획을 표시했습니다.

**vLLM의 창작자들이 TPU로 전환**

Inferact는 2025년 11월에 원래 vLLM 개발자들에 의해 창립되었습니다—Nvidia GPU 추론을 명성 있게 만든 팀입니다. 그들은 1월에 공식적으로 시작했으며 TPU 추론이 이제 GPU를 능가한다는 것을 즉시 시연했습니다.

vLLM은 오픈 소스 추론 엔진의 거물급입니다: 500개 이상의 모델 아키텍처를 지원하고, 2,000명 이상의 커뮤니티 기여자를 자랑하며, Meta, Google, Character.ai에서의 생산 추론을 구동합니다.

CEO Simon Mo는 원래 vLLM 프로젝트 관리자이자 Berkeley EECS 졸업생이며, 이전에 Anyscale에서 일했습니다. 공동 창립자 Woosuk Kwon은 전체 vLLM 프로젝트를 시작했으며 Ion Stoica의 감독 하에 Berkeley 컴퓨터 과학 박사 학위를 보유하고 있으며, PagedAttention을 저술했습니다—GPU 메모리 단편화를 해결한 알고리즘이며 vLLM의 핵심 혁신으로 남아 있습니다. Chief Scientist Kai You는 Tsinghua University의 특별 장학금 수령자이며 vLLM의 분산 추론 기능을 주도했습니다.

이 TPU 메가커널 노력은 Inferact와 Google Cloud 간의 공동 엔지니어링 협업에서 비롯되었으며, TPU를 일급 vLLM 대상으로 만드는 것을 목표로 합니다. 모든 최적화는 오픈 소스 커뮤니티에 상류로 기여될 것입니다; tpu-megakernels 저장소는 이 파트너십의 첫 번째 공개 결과를 나타냅니다.

원문 보기
Google의 TPU는 DeepSeek의 오픈소스 vLLM 프레임워크를 이용하여… · Slicast