Sunday, October 4, 2026
AI 인프라 · 뉴스 & 분석
홈 › 반도체·하드웨어 › 리포트
반도체·하드웨어 · 리포트

SemiAnalysis 팟캐스트 에피소드는 Google TPU v7, Vera Rubin 아키텍처, 그리고 Groq, Cerebras, SambaNova를 포함한 AI 추론 칩의 경쟁 환경을 다룬다.

Vera Rubin과 TPU v7은 AI 추론 효율성과 비용 경쟁의 심화를 반영하며, 여러 아키텍처가 시장 점유율을 놓고 경쟁하고 있음을 나타낸다.
업계 전문지Slicast · 2026년 10월 3일 08:25 UTC · 미국 · 출처: finance.biggo.com
중요도 67

오픈소스 추론 서빙은 현재 InferenceX에 따르면 매우 수익성이 높습니다. 자체 수익성 추정기에 따르면 GB300 NVL72 랙에서 Kimi K3를 60% 사용률로 서빙할 때 Moonshot의 30% 라이선스 비용을 고려한 후 대략 40~50%의 수익 마진을 얻습니다. 팀은 30~40% 사용률에서도 수익성이 유지된다고 주장합니다. 이 평가는 SemiAnalysis 직원의 인프라에서 캡처한 실제 에이전트 코딩 세션을 재현하는 AgentX 벤치마크를 기반으로 하며, 이론적 캐시 히트율이 98%를 초과하고 DRAM 오프로딩이 높은 처리량 작동 지점에서 그 중 20~30%를 복구합니다.

**N-그램 레이어와 메모리 대역폭 제약**

N-그램 레이어는 HBM 부족에 대응하는 공동 설계 방식입니다. 트랜스포머의 모든 레이어가 토큰 시퀀스의 의미를 축적하는 대신, 2-그램 및 3-그램 토큰 임베딩이 학습 시간에 학습되어 해시 테이블에 저장된 후 추론 시간에 조회됩니다. 이 메커니즘은 효과적으로 추가 비용 없이 레이어를 생성합니다. 모델은 단어 의미를 암기하는 데 매개변수를 소비하는 것을 멈추고 스택의 더 초기에 다음 토큰 예측으로 이동합니다. DeepSeek의 절제 연구에 따르면 손실은 극단이 아닌 일부 n-그램 레이어와 일부 MoE 레이어가 있는 중간 지점에서 최소화되며, 초기 및 후기 은닉 상태 간의 KL 발산이 n-그램으로 감소하여 모델이 더 초기에 의미를 파악함을 나타냅니다.

추론 시 n-그램 입력은 단순히 토큰 ID이며, 다른 계산과 겹치는 비동기 검색을 가능하게 합니다. 이는 배치 위치의 트레이드오프를 만듭니다. n-그램 레이어는 모델 초기에 가장 유용하지만, 레이어 1에 배치하면 검색과 겹칠 것이 없습니다. Qwen 3.8 Flash Next는 DRAM 또는 SSD 검색기가 반환할 시간을 주기 위해 엔그램을 레이어 2에 배치했으며, V4.1 Flash는 레이어 1에 배치하여 겹침 공간을 덜 남겼습니다. 오프로딩은 통합 가상 주소 지정을 사용하여 n-그램을 CPU 고정 호스트 메모리로 이동합니다. 미국과 중국 연구소 간의 아키텍처 차이는 기본 하드웨어 제약을 반영합니다. 미국 연구소는 제약이 강요되지 않았기 때문에 용량보다 HBM 대역폭 최적화에 집중하는 반면, 중국 연구소는 특히 Ascend 950의 국내 고대역폭 메모리(수출 가능한 HBM보다 낮은 대역폭)를 고려하여 최적화합니다. Meituan의 LongCat 팀은 n-그램에 대해 동시에 작업했다고 주장하여 이 기술이 용량 제한에 대한 수렴적 대응임을 시사합니다.

**AgentX 벤치마크와 KV 캐시 오프로딩**

AgentX는 칩 수준의 초기 벤치마크를 에이전트 코딩 트래픽의 시스템 수준 재현으로 대체합니다. 작업 부하 패턴은 다음과 같습니다. 에이전트 하네스가 메시지를 보내고, 모델이 도구를 호출하고, 도구 출력이 추가되고, 모델이 상태 비저장이기 때문에 증가하는 메시지 스트림이 매 턴마다 다시 전송됩니다. 백만 토큰 컨텍스트 모델을 사용하면 KV 캐시 저장이 심각한 문제가 됩니다. 데이터 세트는 SemiAnalysis 직원의 에이전트 코딩 세션을 가로채는 프록시로 캡처되고, 잘못된 요청을 제거하기 위해 후처리된 후, 오픈소스 추론을 실행하는 실제 서버에 대해 재현됩니다. 재현된 추적의 이론적 캐시 히트율은 98%를 초과합니다.

B300 vLLM에서 오프로딩은 매우 높은 처리량에서 40~60 토큰/초 범위에서 매우 관련성이 높습니다. 오프라인 배치 추론 또는 수백 개의 동시 에이전트 세션이 있는 강화 학습 롤아웃에서 DRAM 오프로딩은 HBM만으로는 20~30%의 추가 캐시 히트율을 복구합니다. 스택은 KV 전송을 위해 Nixl, KV를 CPU로 오프로딩하기 위해 vLLM, DRAM 전용 오프로딩 및 Dynamo 라우터를 사용합니다. 데이터 세트의 P50 요청에는 거의 100,000개의 입력 토큰이 포함됩니다.

**수익 마진 및 TCO 모델링**

InferenceX의 TCO 모델은 시간당 가속기 비용(데이터센터, 전기, 칩)을 분류하고 OpenRouter 가격 책정 데이터 및 InferenceX 처리량과 동시성 수를 결합하여 수익을 추정합니다. 최적의 서빙 구성으로 GB300 NVL72에서 Kimi K3는 약 40.70%의 수익 마진을 얻고, DeepSeek V4.1 Flash는 수익이 없는 구성을 보입니다. 30% Moonshot 라이선스 비용으로 60% 사용률에서 마진은 약 50%에 도달하며, 30~40% 사용률에서도 수익성이 지속됩니다. 비공개 구성을 가진 추론 제공자는 이러한 오픈소스 기반 수치를 초과해야 합니다. 컴퓨팅 가격이 조정되면 이러한 마진은 정상화될 것으로 예상됩니다.

**TPU v7 비용 경쟁력**

Google이 자체 클라우드를 통해 구매 가능하게 만들고 있는 TPU v7은 B200 및 B300에 대한 토큰당 비용 파레토 곡선의 하단에 위치하며, 백만 토큰당 약 1.21달러의 외부 TCO를 가집니다. 최근 TPU 메가커널 작업은 큰 성능 향상을 가져왔으며, 추가 개선이 예상됩니다. 구조적 주장은 외부화에 관한 것입니다. Google이 모든 TPU를 내부 작업에 할당하는 것에서 외부에서 큰 비중을 판매하는 것으로 전환하면서 이는 현재의 중간 표현 체인을 대체하는 TPU용 네이티브 torch 백엔드를 포함하여 오픈소스 에코시스템 개선을 주도합니다. 역사적으로 TPU의 고정 크기 수축 배열은 더 작은 모델에서 패딩과 낭비를 강요했으며, TPU가 주로 내부용이었기 때문에 많은 모델이 이러한 제한을 중심으로 구축되었지만 오픈소스는 그렇지 않았습니다. TPU가 네오클라우드에 설치되어 처음으로 GCP 외부에서 호스팅되는 것은 가격을 낮출 가능성이 있는 발전입니다.

**Vera Rubin 성능**

DeepSeek V4 Pro에서 Vera Rubin은 제공자가 실제로 서빙하는 상호작용 범위에서 약 3배 더 나은 성능을 제공하여 동일한 지연 시간에서 3배 더 많은 동시 사용자로 변환되고 수익 추정기에 반영된 해당 수익 증가로 이어집니다. 이전 세대(HGX H100/H200에서 GB200/GB300으로)는 ARM CPU, 스케일업 NVL 스위치, 새로운 400G/800G 네트워킹 및 새로운 FP4 데이터 타입이 있는 SM100 개정을 도입했습니다. Vera Rubin은 물리적으로 그리고 소프트웨어 지원에서 더 점진적입니다. 8-고 구성 및 축소된 VRAM은 스케일업 네트워크가 모델을 더 많은 GPU에 걸쳐 분산시켜 추가 메모리 대역폭을 사용할 수 있도록 하므로 GPU당 용량보다 메모리 대역폭을 우선시합니다. 진정한 새로운 항목은 LUTB로, PTX 및 오픈소스 Triton 분기에서 확인된 하드웨어 가속 조회 테이블 양자화 경로이며, 3비트 키를 사용하여 8비트 테이블 값을 조회합니다.

원문 보기
SemiAnalysis 팟캐스트 에피소드는 Google TPU v7, Vera… · Slicast