Wednesday, September 16, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

NVIDIA가 Mellanox 아키텍처 통합 모델과 유사하게 특화된 저지연 디코드 가속화 역할을 수행하기 위해 Groq를 인수했습니다.

NVIDIA가 인수를 통해 추론 및 디코드 최적화를 통합하여 실시간 AI 서빙을 위한 수직 통합을 강화하고 있습니다.
업계 전문지Slicast · 2026년 2월 26일 12:00 UTC · 글로벌 · 출처: wccftech.com
중요도 75

NVIDIA의 크리스마스 이브에 발표된 Groq과의 200억 달러 규모 라이선싱이 아닌 협정은 GPU 트레이닝을 넘어 영향력을 확대하려는 회사의 최대 규모 투자를 나타냅니다. Q4 2026 어닝 콜에서 NVIDIA CEO Jensen Huang은 Groq의 LPU(저지연 디코더) 유닛에 대한 회사의 계획에 관해 질문받았고, GTC에서 자세히 설명하기로 약속한 전략적 비전으로 답변했습니다. "Groq과 저지연 디코더에 대해 우리가 어떻게 생각하는지에 대해, GTC에서 여러분과 나누고 싶은 훌륭한 아이디어들이 있습니다"라고 그는 말했으며, NVIDIA가 "Mellanox로 NVIDIA의 아키텍처를 확장한 것과 거의 같은 방식으로 Groq을 가속기로 하여 우리의 아키텍처를 확장할 것"이라고 덧붙였습니다.

이번 인수는 NVIDIA의 제품 포트폴리오에서 중요한 격차를 메우는 것을 목표로 합니다. 회사가 Hopper와 Blackwell 프로세서로 트레이닝 분야를 지배해온 반면, 추론은 NVIDIA가 아직 주도권을 확고히 하지 못한 영역입니다. 특히 에이전트 AI 애플리케이션이 초고속 응답을 요구하는 지연 시간 민감형 워크로드에서 그렇습니다. Groq의 LPU 유닛은 온칩 SRAM을 활용하여 초당 수십 테라바이트의 내부 대역폭을 제공하며, 이는 Cerebras의 WSE-3 및 Microsoft의 Maia 300과 같은 경쟁사들이 이미 채택한 접근 방식입니다. 에이전트 AI 워크로드의 경우 디코드 성능이 중요하며, 이는 산업이 상호 의존적인 AI 에이전트 무리로 나아가면서 에이전트들이 단 몇 초 만에 복잡한 추론 단계를 수행할 수 있게 합니다.

NVIDIA의 접근 방식은 네트워킹 문제를 해결하고 회사의 데이터센터 전략을 강화한 "극단적 공동 설계" 원칙을 확립한 Mellanox 인수와 유사합니다. GF Securities에 따르면, NVIDIA는 올해 GTC에서 단일 유닛에 256개의 LPU 유닛을 포함하는 "LPX 랙"을 공개할 수 있습니다. 두 가지 주요 통합 전략이 검토 중입니다: 통합 상호연결로 연결된 여러 LPU를 포함한 랙 규모의 하이브리드 컴퓨팅 노드, 또는 하이브리드 본딩을 통해 Feynman GPU 내에 통합된 온칩 LPU 유닛입니다. 랙 규모 접근 방식이 우선할 경우, LPU 간 연결은 기본 플레지오동기식 칩 간 프로토콜을 사용할 가능성이 높으며, LPU-GPU 통신은 프리필 단계에서 GPU로부터의 대규모 KV 캐시 오프로드를 처리하기 위해 NVLink Fusion을 사용할 수 있습니다.

디코딩을 위해 LPU를, 프리필 단계를 위해 기존 GPU 기능을 결합한 NVIDIA의 하이브리드 아키텍처는 Vera Rubin의 어텐션 가속 엔진과 NVFP4 컴퓨팅을 활용하여 회사가 추론 성능에서 주도하도록 위치시킵니다. Jensen Huang은 최근 NVIDIA에서 컴퓨팅과 수익 성장이 이제 AI의 애플리케이션 레이어에서의 공격적 진화로 인해 1:1 비율로 동시에 확대되고 있음을 공개했습니다. 올해 GTC에서의 공식 발표가 예상되는 가운데, Groq 기술의 NVIDIA 통합은 컴퓨팅 제공자에게 기본적인 병목이 되어 나타난 지연 시간 문제를 해결하는 데 회사에 결정적 이점을 제공할 것을 약속합니다.

원문 보기
NVIDIA가 Mellanox 아키텍처 통합 모델과 유사하게 특화된 저지연 디코드… · Slicast