Groq 3 LPX가 양산에 돌입하며 Agentic AI 애플리케이션을 위한 고속 추론을 목표로 하고 있습니다.
NVIDIA는 에이전트 AI의 집약적인 연산 요구사항을 충족하도록 설계된 Groq 3 LPX 추론 가속기를 양산 단계로 본격화했다. Vera Rubin 플랫폼의 확장으로 개발된 이 전용 실리콘은 벤치마크 테스트에서 초당 3,400개의 출력 토큰을 달성했다. Nebius는 해당 아키텍처를 최초로 배포할 클라우드 제공업체로 선정되었다.
에이전트 시스템은 수천 번의 빠른 추론 단계를 필요로 하므로, 실시간 운영을 위해서는 원시 토큰 생성 처리량이 매우 중요하다. Artificial Analysis가 오픈소스 Gemma 4 31B 모델과 10만 토큰 컨텍스트 윈도우를 사용하여 수행한 벤치마크에서 Groq 3 LPX는 새로운 성능 한계를 수립했다. NVIDIA는 이 가속기가 가장 가까운 경쟁 시스템 대비 응답 속도가 4배 빠르며, 긴 코딩 작업을 시간 단위에서 분 단위로 줄인다고 밝혔다.
이 칩은 Vera Rubin NVL72 랙 규모 시스템과 상호 보완적으로 작동한다. 기존 아키텍처가 범용 처리를 담당하는 반면, LPX는 생성 처리량에 최적화되어 소프트웨어 에이전트가 지연 없이 코드를 검증하고 도구를 실행할 수 있도록 한다. NVIDIA CEO Jensen Huang은 Hot Chips 발표회에서 이러한 워크로드 분배 변화에 대해 다음과 같이 언급했다:
Nebius는 Token Factory 플랫폼에 하드웨어를 직접 통합하여, 엔지니어들이 코드 재구성 없이 기존 소프트웨어 인터페이스를 통해 가속화된 성능에 접근할 수 있도록 했다. 전용 제공업체 Groq 역시 서버 군집에 장치를 통합하는 초기 운영사 중 하나가 될 예정이다.
더 넓은 범위의 하드웨어 롤아웃은 5가지 전용 랙 구성 전반에 걸쳐 총 7종의 칩을 포함한다. 이러한 아키텍처는 BlueField 4 데이터 처리 장치, Vera CPU 모듈, Vera BlueField 4 STX 스토리지 어레이 및 Spectrum 6 SPX 이더넷 네트워킹을 채택하여 다중 에이전트 환경 전반에 낮은 지연 시간을 유지한다.