Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
자본시장리포트
자본시장 · 리포트

엔비디아는 그록과 200억 달러 규모의 전략적 파트너십 하에 개발한 AI 추론 가속기가 정식 양산 단계에 진입했다고 확인했다.

대규모 자본 투입은 장기적인 맞춤형 실리콘 전략을 입증하며, 광범위한 시장 포화 이전에 전용 추론 용량을 선점한다.
업계 전문지Slicast · August 25, 2026 · 미국 · 출처: qz.com
중요도 90

비디아($NVDA)는 월요일 자사의 Groq 3 LPX 추론 칩이 양산에 들어갔다고 발표했으며, 이는 지난해 12월 엔비디아가 칩 스타트업 Groq의 자산을 200억 달러에 인수한 거래의 기반 기술로서 중요한 이정표를 의미한다. 이 인수는 엔비디아가 지금까지 완료한 가장 대규모 거래다.

Groq 3 LPX는 엔비디아의 Vera Rubin 플랫폼을 확장한 것으로, AI 추론의 ‘디코드(decode)’ 단계를 가속화하도록 설계되었다. 이 단계는 최종 사용자의 토큰 생성 속도를 결정한다. 각 LPX 랙에는 256개의 개별 Groq 3 칩이 탑재된다. 삼성에서 제조하는 이 칩은 실리콘 다이 위에 SRAM 500메가바이트를 직접 통합하여, 일반적으로 경쟁 추론 가속기의 성능을 제한하는 메모리 대역폭 병목 현상을 우회한다고 CNBC는 전했다.

Artificial Analysis가 수행한 벤치마킹 결과, Groq 3 LPX는 오픈소스 Gemma 4 31B 모델을 10만 토큰 컨텍스트 윈도우에서 실행할 때 초당 3,400개의 출력 토큰을 달성했다. 엔비디아는 이 성능이 지연 시간 민감성 워크로드에 있어 가장 가까운 경쟁 플랫폼보다 네 배 빠르다고 밝혔다.

AI 클라우드 제공업체인 Nebius는 Nebius Token Factory 서비스를 통해 해당 칩을 최초로 도입할 예정이다. CNBC에 따르면, 이러한 랙들은 올해 말 Vera 중앙 처리 장치와 Rubin 그래픽 처리 장치와 함께 가동될 계획이다. Nebius 이후 원래 독립적인 스타트업이었던 Groq는 해당 기술을 가장 먼저 채택하는 기업 중 하나가 될 예정이다.

Nebius의 최고기술책임자(CTO)인 Danila Shtan은 “생성은 AI 시스템의 실제 반응성을 결정하는 추론 단계이며, 이것이 바로 NVIDIA Groq 3 LPX가 가속화하기 위해 설계된 부분”이라고 말했다.

엔비디아 시니어 디렉터 Dion Harris는 클라우드 제공업체들이 프리미엄 서비스 등급을 출시할 수 있도록 함으로써 칩의 상업적 가치를 강조했다. “토큰을 제공하는 업체들에게 이는 실제로 가장 높은 지연 시간 민감성 서비스 계약을 요구하는 사용자 및 고객에게 프리미엄 서비스 등급을 제공할 수 있는 가능성을 열어준다”고 Harris는 지적했다. 그는 Groq 3 LPX가 엔비디아의 기존 GPU 포트폴리오를 대체하기보다는 보완하도록 설계되었으며, 해당 포트폴리오는 모델 학습과 범용 추론에 여전히 중요하다고 명시했다. “이는 GPU를 대체하는 것이 아닙니다. 그것은 올바른 가격, 올바른 프로세서를 워크로드의 올바른 부분에 사용하는 것입니다.”라고 Harris는 말했다.

Vera Rubin 시스템의 출하가 2026년 초 생산 시작 이후 가속화되고 있다. 엔비디아는 수요일 다음 분기 실적을 보고할 예정이다.

원문 보기