Wednesday, September 16, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

NVIDIA가 특화된 AI 칩 설계 및 IP 역량 인수라는 Google의 전략을 따라 Groq에 200억 달러를 투자합니다.

NVIDIA의 AI 칩 수직 통합을 가속화하고 인재와 IP를 통합하며, fabless에서 설계 중심 모델로의 잠재적 전환을 시사합니다.
업계 전문지Slicast · 2026년 3월 29일 12:00 UTC · 글로벌 · 출처: forbes.com
중요도 90

Nvidia는 지난 12월 Groq의 추론 기술을 200억 달러에 라이선싱했으며, San Jose에서 개최된 GTC 2026에서 이를 통해 개발된 Groq 3 언어 처리 장치를 공개했습니다. Nvidia 역대 최대 규모의 거래인 이 계약으로 Groq 설립자 Jonathan Ross와 선임 경영진들이 Nvidia에 합류했으며, Groq의 특허 포트폴리오와 소프트웨어 스택에 대한 영구 라이선스가 함께 제공되었습니다. Groq는 새로운 CEO Simon Edwards의 주도 아래 독립적으로 운영을 계속하지만, 이 기술은 이제 Nvidia의 추론 로드맵의 중심에 자리하고 있습니다. 이러한 결정은 세계 최고의 AI 칩 제조업체로부터, 그래픽 처리 장치가 아무리 강력하더라도 모든 AI 워크로드에 최적의 도구는 아니라는 점을 가장 명확하게 인정하는 사례입니다.

AI 컴퓨팅은 크게 두 가지 단계로 나뉩니다: 수주에서 수개월에 걸쳐 대규모 데이터셋을 처리하여 모델을 구축하는 학습(training)과, 학습된 모델을 실행하여 실시간으로 응답, 이미지, 결정을 생성하는 추론(inference)입니다. Nvidia의 GPU는 뛰어난 병렬 처리 성능으로 인해 학습 분야에서 지배적 위치를 차지해 왔지만, 추론은 근본적으로 다른 계산 특성을 요구합니다. 추론 과정에서 병목이 되는 요소는 부동소수점 연산이 아니라 메모리 대역폭, 즉 프로세서가 모델 가중치와 중간 데이터를 칩 전체에 전달하는 속도입니다. Nvidia의 차세대 Rubin GPU는 288GB의 고대역폭 메모리와 초당 22TB의 대역폭을 갖춘 반면, Groq 3 LPU는 500MB의 온칩 SRAM만 탑재하면서도 초당 150TB의 대역폭을 제공하며, 이는 Rubin의 약 7배에 해당합니다. 이러한 간결하고 속도 중심의 설계가 LPU로 하여금 예측 가능한 낮은 지연 시간으로 토큰을 생성할 수 있게 해줍니다.

Nvidia는 LPU를 단순한 GPU 대체제로 포지셔닝하지 않고, 두 프로세서가 추론 파이프라인의 서로 다른 단계를 담당하는 이기종 아키텍처를 구축했습니다. Vera Rubin NVL72 랙 시스템은 72개의 Rubin GPU와 256개의 상호 연결된 LPU를 갖춘 새로운 Groq 3 LPX 랙을 결합하고 있으며, Nvidia의 Dynamo 소프트웨어 계층이 실시간으로 두 프로세서 간의 워크로드를 조율합니다. 이러한 움직임은 심화되는 경쟁 속에서 나타났습니다: Google은 10년 이상 목적 제작형 텐서 처리 장치(TPU)를 운영해 오고 있으며, 최근에는 추론 워크로드 전용으로 설계된 7세대 TPU인 Ironwood를 출시했으며, Gemini 3를 전적으로 TPU에서 학습시켜 맞춤형 반도체가 GPU 기반 학습 파이프라인과 동등하거나 이를 능가할 수 있음을 입증했습니다. Amazon은 학습과 추론 모두를 위해 데이터센터 전역에 수십만 개의 Trainium 칩을 배포했습니다. 패턴은 명백합니다—세 개의 가장 큰 클라우드 제공자 모두 전문화된 반도체가 특정 작업을 처리하는 이기종 컴퓨팅 환경을 구축하고 있습니다.

GTC에서 Jensen Huang은 2027년까지 Blackwell 및 Vera Rubin 시스템에 대한 1조 달러 규모의 수주를 예상했으며, 에이전트 AI가 컴퓨팅 수요에 근본적인 변화를 몰고 올 것이라고 주장했습니다. Nvidia는 결합된 GPU-LPU 아키텍처가 GPU 전용 배포 대비 메가와트당 최대 35배 높은 추론 처리량과 조 단위 모델에 대해 최대 10배의 수익 기회를 제공한다고 주장합니다. 다만 이러한 성능 주장은 검토가 필요합니다: 35배의 처리량 개선과 10배의 수익 이득은 모든 추론 시나리오가 아닌 특정 디코드 집약적 워크로드에만 적용되며, Nvidia의 자체 배포 지침도 데이터센터 전체 용량의 약 25% 정도에만 Groq LPU를 추가할 것을 제안하고 있습니다. LPU의 500MB SRAM 용량은 대규모 모델의 가중치를 랙의 모든 256개 칩에 분산시켜야 하므로 긴밀한 칩 간 조율이 필요하며, 이 아키텍처가 Nvidia의 제어된 벤치마크 환경을 벗어나 경제적으로 확장 가능한지는 아직 입증되지 않았습니다.

Nvidia는 2025년 9월 Groq의 평가액 69억 달러의 거의 3배에 해당하는 금액을 지불했으며, 이는 완전한 인수가 아닌 기술적으로는 비독점 라이선싱 계약에 대한 상당한 프리미엄입니다. Samsung에서 제조되는 Groq 3 LPX 랙은 2026년 하반기에 출시될 예정이며, AMD는 6월 Computex에서 자체 추론 중심 발표로 대응할 것으로 예상됩니다. AI 인프라 도입을 검토하는 CXO 입장에서는, Nvidia-Groq 조합이 조달 결정이 더욱 복잡해지고 있음을 시사합니다: 더 이상 구매할 GPU의 개수가 문제가 아니라, 올바른 워크로드에 올바른 프로세서를 올바른 비용으로 결합하는 이기종 컴퓨팅 환경을 어떻게 구성할지가 핵심입니다.

원문 보기
NVIDIA가 특화된 AI 칩 설계 및 IP 역량 인수라는 Google의 전략을… · Slicast