Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
컴퓨트·클라우드리포트
컴퓨트·클라우드 · 리포트

SambaNova의 AI 추론 최적화 기술은 추론 워크로드의 컴퓨팅 요구사항을 줄임으로써 하이퍼스케일러의 AI capex를 상당히 억제할 수 있다.

Inference 효율성 개선으로 데이터센터 전력 및 칩 요구사항이 10–30% 감소한다면, training infrastructure capex 지출이 다른 우선순위로 전환될 수 있습니다.
업계 전문지Slicast · 2026년 7월 10일 14:42 UTC · 미국 · 출처: Jon Peddie Research
중요도 60

SambaNova는 단순히 더 큰 GPU 클러스터를 배포하는 것에서 벗어나 기존 하드웨어의 효율성을 극대화하는 방향으로 AI 인프라 논의를 재구성했습니다. 새로운 벤치마크 결과는 5세대 RDU(Reconfigurable Dataflow Units)가 Nvidia H200 GPU와 함께 작동하여 선택된 워크로드에서 GPU만 사용하는 시스템보다 상당히 높은 추론 처리량을 달성함을 보여줍니다. 프롬프트 처리와 토큰 생성을 분리함으로써, 이 접근 방식은 기업들이 기존 GPU 인프라를 생산적으로 유지하면서 디코드 작업을 특화된 가속기에 위임할 수 있게 합니다. 프로덕션 배포가 시연된 성능과 일치한다면, 조직들은 추론 비용을 줄이면서 설치된 AI 시스템의 운영 수명을 연장할 수 있습니다.

여러 해 동안, AI 업계는 단 하나의 목표를 추구했습니다: 더 큰 GPU 클러스터를 배포하는 것입니다. 각 새로운 세대는 컴퓨팅 성능, 메모리 대역폭, 전력 소비, 그리고 비용을 증가시켰습니다. 이 전략은 기초 모델 훈련에 적합했습니다. 여기서 순수 부동소수점 성능은 방대한 데이터세트가 사용 가능한 모델로 변환되는 속도를 결정하기 때문입니다. 그러나 추론은 다른 경제학을 제시합니다.

모델이 프로덕션에 도달하면, 수백만 명의 사용자를 서빙하는 것은 피크 컴퓨팅 능력보다는 프롬프트 처리, 메모리 관리, 컨텍스트 처리, 그리고 지속적인 토큰 생성에 덜 의존합니다. 이 변화는 AI 인프라 공급업체들이 단순히 더 많은 GPU를 추가하기보다는 시스템 아키텍처를 재검토하도록 촉발했습니다.

SambaNova는 이질적 추론이 AI 인프라 진화의 다음 단계를 나타낸다고 생각합니다. RAISE Summit 2026에서, 이 회사는 이질적 아키텍처 위에 구축된 프리미엄 추론 플랫폼이라고 설명하는 것을 시연했습니다. 이 구성은 컴퓨팅 집약적인 프리필 단계를 위해 4개의 GPU를 포함하는 하나의 Nvidia H200 랙과 디코드 작업에 전념하는 16개의 5세대 RDU로 채워진 하나의 SambaRack SN50을 짝지었습니다. 이는 Nvidia B200 GPU가 프리필을 처리하고 SambaNova SN40 가속기가 디코드를 수행한 COMPUTEX에서 처음 시연된 이질적 청사진을 확장합니다. 최신 구성은 SN40을 새로운 SN50으로 대체하고 새로운 에이전트 AI 워크로드를 목표로 합니다.

Artificial Analysis에 의한 독립적인 벤치마킹은 MiniMax M2.7 모델을 사용하여 단문 컨텍스트 워크로드에서 초당 850 토큰의 디코드 성능에 도달하고 장문 컨텍스트 추론에서 초당 450 토큰 이상을 지속할 수 있음을 보고했습니다. 이전 벤치마크 공시는 약 763 토큰/초를 보고했습니다. 최신 결과는 SN50 플랫폼의 지속적인 최적화를 반영하면서 MiniMax 추론을 위한 새로운 성능 기준을 확립합니다.

추론은 자연적으로 두 가지 서로 다른 작업으로 나뉩니다. 프리필 단계는 프롬프트를 처리하고, 행렬 계산을 수행하며, 키-값 캐시를 생성합니다. 이 작업은 높은 병렬성 때문에 GPU가 탁월한 분야입니다. 디코드는 근본적으로 다른 패턴을 따릅니다: 각 출력 토큰은 이전 토큰에 의존하기 때문에 메모리 대역폭과 데이터 이동이 피크 산술 처리량보다 훨씬 더 중요합니다. SambaNova는 특히 추론 파이프라인의 이 부분을 위해 RDU 아키텍처를 설계했습니다. GPU를 대체하기보다는, 이 시스템은 각 프로세서가 가장 효율적으로 실행하는 워크로드를 할당합니다.

클라우드 제공자와 엔터프라이즈 운영자의 경우, 이 구분은 근본적으로 인프라 경제학을 변경합니다. 기존 H200 GPU 클러스터는 계속 컴퓨팅 집약적인 프리필 작업을 처리하는 반면, SN50 시스템은 전용 디코드 용량을 제공합니다. 조직들은 전체 GPU 설치를 교체하지 않고 추론 처리량을 증가시킬 수 있습니다.

벤치마크는 단순히 더 높은 토큰 생성 속도 이상을 드러냅니다. SambaNova의 기본 데이터플로우 아키텍처를 강조합니다. 전통적인 GPU 아키텍처는 점점 더 커지는 메모리 시스템으로 지원되는 대규모 병렬 실행을 강조합니다. SambaNova는 대신 통신을 계산과 겹치게 하고 활성 데이터를 실행 리소스에 더 가깝게 유지함으로써 데이터 이동을 줄이는 데 초점을 맞춥니다. 회사는 지속적인 추론이 광고된 피크 FLOPS보다는 아키텍처 효율성에 더 의존한다고 주장합니다.

SN50은 SambaNova의 5세대 Reconfigurable Dataflow Unit이며 2024년 동안 도입된 SN40L을 대체합니다. 회사에 따르면, 새로운 프로세서는 FP16 성능을 약 2.5배 증가시키고 FP8 처리량을 대략 5배 증가시켜 약 1.6 PFLOPS FP16과 3.2 PFLOPS FP8에 도달합니다. 이 수치들이 Nvidia의 최신 Blackwell급 GPU의 이론적 피크 성능보다 여전히 낮지만, SambaNova는 메모리 이동, 동기화 오버헤드, 그리고 사용률이 실제 성능을 결정하기 때문에 피크 사양이 프로덕션 추론으로 직접 변환되는 경우가 거의 없다고 주장합니다.

메모리 아키텍처는 이 철학을 보여줍니다. 각 SN50은 432 MB의 온칩 SRAM, 약 1.8 TB/s의 대역폭을 제공하는 64 GB의 HBM2E, 그리고 256 GB에서 2 TB 사이의 DDR5 메모리를 통합합니다. SambaNova는 의도적으로 더 낮은 비용과 향상된 공급 가용성을 이유로 더 새로운 메모리 기술을 채택하는 대신 HBM2E을 유지했습니다. 더 큰 DDR5 풀은 모델과 키-값 캐시가 메모리 계층 간에 밀리초 단위로 이동하도록 하여, 높은 사용률을 유지하면서 빠른 모델 전환을 지원합니다.

SambaNova는 분산된 추론을 수용하는 증가하는 회사 목록에 합류합니다. Nvidia는 프리필과 디코드 워크로드에 다양한 GPU 리소스를 할당함으로써 NVL72 시스템을 통해 이 개념을 도입했으며, 나중에 Groq 엔지니어링 재능을 인수한 후 그 전략을 확장했습니다. AMD, AWS, Cerebras, 그리고 몇몇 신흥 가속기 회사들이 유사한 아키텍처를 도입했습니다. 업계는 점점 더 단일 프로세서 아키텍처가 AI 추론의 모든 단계에서 최적 효율성을 제공하지 않는다는 것을 인식하고 있습니다. 수십만 개의 가속기를 운영하는 하이퍼스케일러의 경우, 적은 사용률 개선도 직접 더 낮은 운영 비용과 더 높은 서비스 용량으로 변환됩니다.

아마도 SambaNova의 가장 강력한 논거는 새로운 하드웨어보다는 설치된 인프라에 중심을 둡니다. 대부분의 기업들은 이미 Nvidia 가속기에 상당한 투자를 소유하고 있으며, 그 중 많은 것들이 더 새로운 GPU 세대에도 불구하고 계속해서 상당한 컴퓨팅 능력을 제공합니다. SambaNova는 교체를 권장하기보다는 유용한 수명을 연장할 것을 제안합니다. 기존 H100 및 H200 클러스터는 계속 프리필을 실행하고 SN50 랙은 디코드를 수행합니다. 기업들은 전체 교체용 GPU 클러스터를 구매하지 않고도 더 높은 추론 처리량을 얻습니다. 액체 냉각이 필요한 많은 차세대 AI 시스템과 달리, SambaNova의 SN50 랙은 공기 냉각 방식이며 기존 데이터 센터 인프라에 적합합니다. AI 확장을 평가하는 CIO들은 따라서 비싼 시설 업그레이드를 수행하지 않고도 추론 용량을 증가시킬 수 있습니다.

SambaNova는 최근 금융적 지위와 산업 파트너십을 모두 강화했습니다. 회사는 더 광범위한 $1 billion Series F의 일부로 $350 million 자금 조달 라운드의 첫 번째 마감을 완료하여 약 $11 billion의 추정 평가를 산출했습니다. General Atlantic이 자금 조달을 주도했으며, Intel Capital, Vista Equity Partners, Cambium Capital, 그리고 여러 추가 기관 투자자들이 참여했습니다. Intel의 참여는 회사가 SambaNova를 인수할 의도가 있었다는 추측을 해결합니다. 대신, Intel은 이질적 AI 인프라에 초점을 맞춘 다년간의 엔지니어링 파트너십을 선택했습니다. 이 협력은 엔터프라이즈 AI 배포를 목표로 한 결합 하드웨어-소프트웨어 최적화를 통해 Intel Xeon 프로세서와 SambaNova RDU를 결합합니다. Intel은 Vector Core Compute를 첫 번째 배포 파트너 중 하나로 식별했으며, Together AI는 초기 대규모 상용 고객이 될 것입니다. Intel의 경우, 이 파트너십은 이전 데이터 센터 GPU 및 Gaudi 이니셔티브의 제한된 성공 이후 GPU를 넘어 AI 인프라 전략을 확장합니다.

SambaNova는 오늘날의 16-RDU 시스템을 단지 시작일 뿐이라고 봅니다. 향후 구성은 128개, 그리고 결국 256개의 RDU로 확장되며, 각 가속기당 약 2.2 TB/s의 양방향 칩-칩 대역폭을 전달하는 스위치식 상호연결을 통해 연결됩니다. 이 더 큰 시스템은 AI 에이전트, 코딩 어시스턴트, 검색 증강 생성(retrieval-augmented generation), 엔터프라이즈 검색, 그리고 지연 시간, 처리량, 사용률, 그리고 생성된 토큰당 비용이 수익성을 결정하는 다른 프로덕션 추론 워크로드를 목표로 합니다.

이 아키텍처는 또한 신흥 과제를 해결합니다: 엔터프라이즈 AI는 점점 더 사용자 정의 모델에 의존합니다. 부서, 고객, 그리고 애플리케이션은 하나의 기초 모델을 공유하기보다는 종종 별도의 모델을 필요로 하며, 각 모델이 귀중한 메모리 리소스를 차지하기 때문에 가속기 사용률을 낮춥니다. SambaNova의 큰 DDR5 메모리 풀은 모델과 키-값 캐시가 메모리 계층 간에 빠르게 이동하도록 하여, 인프라 제공자가 모델 특화를 수용하면서도 더 높은 사용률을 유지할 수 있게 합니다.

원문 보기
SambaNova의 AI 추론 최적화 기술은 추론 워크로드의 컴퓨팅 요구사항을… · Slicast