Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

벤치마크 결과에 따르면, Vera Rubin 플랫폼에서 배포된 NVIDIA Groq 3 LPX 가속기는 초당 3,431건의 트랜잭션을 처리합니다.

정량적 지연 시간 지표는 칩이 고빈도 에이전트 워크로드에 적합함을 입증하며, 경쟁 추론 실리콘의 성능 기준을 제시한다.
업계 전문지Slicast · August 25, 2026 · 미국 · 출처: blockchain.news
중요도 86

NVIDIA의 Groq 3 LPX는 AI 추론을 위한 새로운 성능 기준을 확립했으며, 100K 컨텍스트 벤치마크에서 초당 3,431 토큰(TPS)의 처리 속도를 달성했습니다. 2026년 8월 24일 발표된 공식 블로그 게시글에 따르면, 이 성과는 높은 상호작용성과 긴 컨텍스트를 요구하는 AI 워크로드의 능력을 재정의합니다. Artificial Analysis가 Gemma 4 31B 모델을 사용하여 수행한 이 벤치마크는 NVIDIA의 차세대 Vera Rubin 플랫폼 위에서 demanding한 작업을 처리할 수 있는 시스템의 능력을 입증했습니다.

NVIDIA의 LP30 가속기와 랙 규모 아키텍처를 기반으로 구축된 Groq 3 LPX는 FP8 추론 컴퓨팅 성능으로 315 PFLOPS와 128 GB의 SRAM을 제공합니다. 이 설계는 결정론적 실행, 낮은 지연 시간의 토큰 생성, 세분화된 스케줄링을 우선시하여, 각 사용자 상호작용마다 컨텍스트가 크게 확장되는 다중 턴 에이전틱 세션 및 인터랙티브 워크로드에서 탁월한 성능을 발휘합니다. 전통적인 모델들은 특히 긴 입력 컨텍스트를 처리할 때 이러한 규모에서 응답성을 유지하는 데 어려움을 겪곤 합니다.

테스트 동안 Artificial Analysis는 100K의 입력 컨텍스트 길이를 사용하여 시스템의 출력 생성 속도를 측정했습니다. 이 기능은 축적된 대량의 컨텍스트를 처리해야 하는 코딩이나 복잡한 추론 워크로드와 같은 에이전틱 AI 애플리케이션에 필수적입니다. NVIDIA에 따르면, 이러한 속도는 100 TPS에서 50초가 걸리는 것과 비교해 단 1.5초 만에 5,000개의 토큰을 생성할 수 있게 해주며, 효율성 측면에서 한 차원 향상된 결과입니다. 10K 컨텍스트 벤치마크에서는 최소한의 지연 시간 변동으로 초당 3,382 TPS를 달성했습니다. 또한, NVIDIA의 SPEED-Bench 코딩 작업 테스트에서는 초당 평균 4,767개의 출력 토큰 처리량을 기록했으며, 20%의 작업이 5,500 TPS를 초과하여 다양한 사용 사례에서 LPX의 다양성을 강조했습니다.

Vera Rubin 플랫폼 내 핵심 구성 요소로 자리 잡은 Groq 3 LPX는 높은 상호작용성 서빙 계층이 필요한 AI 팩토리를 위해 설계되었습니다. 100K 이상의 컨텍스트 토큰을 관리하면서도 낮은 지연 시간을 유지할 수 있는 능력은 고객 서비스 자동화, 대규모 코딩 어시스턴트, 실시간 의사결정 시스템을 포함하여 복잡한 다중 턴 AI 상호작용에 의존하는 산업들을 변화시킬 잠재력을 지니고 있습니다. 이러한 성능의 주요 동력은 256개의 연결된 LPU 간 통신 오버헤드를 최소화하는 LPX의 컴파일러 기반 워크로드 계획입니다. 계산과 통신을 세분화된 수준에서 겹치게 함으로써, 이 아키텍처는 기존 텐서 병렬화 기법이 일반적으로 저조한 성능을 보이는 작은 배치 크기에서도 unmatched한 효율성을 달성합니다.

이번 발표는 NVIDIA가 AI 하드웨어 분야에서 리더십을 공고히 한 시점에 이루어졌습니다. Groq 3 LPX는 암호화폐 중심 제품이 아니지만, AI 주도 섹터에 미치는 영향은 상당합니다. Groq 3 LPX로 강화된 Vera Rubin 플랫폼은 실시간 추론부터 생성형 AI 애플리케이션에 이르기까지 높은 수요의 AI 워크로드에서 NVIDIA의 지배력을 가능하게 합니다. 금융 시장에서 NVIDIA(NVDA) 주가는 최근 24시간 동안 전체 시장의 부진 속에서 2.11% 하락한 $210.18로 거래되었습니다. 그럼에도 불구하고 AI 추론 기술의 발전은 특히 고마진 엔터프라이즈 솔루션 내에서 회사의 장기 성장 궤적을 지속적으로 뒷받침하고 있습니다. 별도로, NVIDIA는 중국 전용 LPU 제품에 대한 최근 루머를 공식적으로 부인하며 해당 로드맵이 존재하지 않음을 명확히 했습니다. 이는 투자자들의 지정학적 우려를 완화시키는 developments로 작용할 수 있습니다.

Groq 3 LPX가 입증한 성능은 극도의 속도와 광범위한 컨텍스트 처리 능력을 모두 요구하는 새로운 AI 애플리케이션의 길을 열었습니다. NVIDIA는 수십만 토큰의 컨텍스트에서도 이러한 처리량 수준을 유지할 계획을 가지고 있으며, 이는 에이전틱 AI 사용 사례를 더욱 혁신할 잠재력을 지닙니다. 견고한 성능 지표와 Vera Rubin 아키텍처와의 전략적 통합을 고려할 때, Groq 3 LPX는 향후 몇 년간 높은 상호작용성 AI 시스템의 벤치마크를 설정할 것으로 예상됩니다.

원문 보기