Wednesday, September 30, 2026
AI 인프라 · 뉴스 & 분석
홈 › 반도체·하드웨어 › 리포트
반도체·하드웨어 · 리포트

MLPerf 추론 벤치마크는 Nvidia의 성능 리더십을 확인하며, Jetson 엣지 제품 라인은 시장 범위를 확대합니다.

확보된 추론 성능 우위는 클라우드 및 엣지 인프라 전역의 프로덕션 AI 배포 채택을 주도합니다.
업계 전문지Slicast · 2019년 11월 6일 12:00 UTC · 글로벌 · 출처: forbes.com
중요도 70

MLPerf 컨소시엄이 Inference v0.5 벤치마크의 첫 번째 결과를 공개했습니다. 이 벤치마크는 이미지 분류, 객체 감지 및 기계 번역을 포함한 3가지 일반적인 머신러닝 작업에 중점을 둔 5개의 대규모 병렬 벤치마크로 구성됩니다. 자율 주행 및 얼굴 인식에서 자연어 처리에 이르는 응용 프로그램을 대상으로 하며, 스마트폰 및 PC에서 데이터 센터의 클라우드 컴퓨팅 플랫폼에 이르기까지 다양한 폼 팩터에 걸쳐 확장됩니다. NVIDIA, Google, Intel, Alibaba 및 전 세계의 다른 기업들이 결과를 제출했으며, NVIDIA는 가장 광범위한 결과 범위를 제출했고 가장 다양한 시나리오를 포함했습니다. NVIDIA의 Turing 기반 GPU와 Jetson Xavier 플랫폼은 상대적으로 좋은 성능을 보였습니다.

ImageNet ResNet-50 v1.5 Offline 시나리오에서는 많은 회사들이 몇 가지 결과만 제출했기 때문에 직접적인 비교는 제한적입니다. NVIDIA는 Titan RTX로 강한 프로세서당 성능을 입증했으며 65,431.40 입력/초를 기록했습니다. 많은 제출물은 여러 프로세서가 있는 시스템이며, SCAN 3XS DBP T496X2 Fluid 시스템은 4개의 Titan RTX 카드를 사용하여 66,250.40 입력/초를 기록했고, 8개의 프로세서를 활용하는 2x Google Cloud TPU v3-8은 유사한 결과를 달성했습니다. NVIDIA의 성능은 ImageNet ResNet-50 v1.5 테스트에서 Offline에서 Server 시나리오로 전환할 때 단 몇 퍼센트 포인트만 감소하는 반면, Google의 성능은 동일한 전환에서 거의 절반으로 떨어집니다. Titan RTX는 ECC 메모리를 지원하지 않기 때문에 성능은 강력하지만, 이 기능의 부재는 일부 데이터 센터 고객의 사용을 제한할 수 있습니다. Habana Labs의 HL-102-Goya PCI 보드는 ImageNet ResNet-50 v1.5 Offline 시나리오에서 14,451.00 입력/초의 단일 프로세서 결과로 좋은 성능을 보였습니다. 한 쌍의 Intel Nervana NNP-I 1000s는 동일한 테스트에서 10,567.20을 기록했으며 Offline에서 Server 시나리오로의 이동 시 가장 작은 성능 감소(10,567.20 입력/초 대 10,262.63 QPS)를 보였습니다.

NVIDIA의 가속 컴퓨팅 부사장 겸 총괄 책임자 Ian Buck은 "AI는 연구에서 실제 응용 프로그램을 위한 대규모 배포로 빠르게 이동하고 있으므로 전환점에 있다"고 말했으며 "AI 추론은 엄청난 계산 문제입니다. 업계에서 가장 고급의 프로그래밍 가능한 가속기, CUDA-X AI 알고리즘 제품군 및 AI 컴퓨팅에 대한 우리의 깊은 전문성을 결합하여 NVIDIA는 데이터 센터가 크고 계속 증가하는 복잡한 AI 모델을 배포하는 데 도움을 줄 수 있습니다."라고 말했습니다. 결과는 가격이나 전력 소비를 고려하지 않으며 추가 가속기, 서버, 클라우드 및 기타 다양한 폼 팩터를 사용하지만, 데이터는 기대치를 설정하고 일부 뛰어난 성과자를 강조합니다.

강한 MLPerf 결과 외에도 NVIDIA는 에지에서 AI 컴퓨팅을 위한 새로운 Jetson Xavier NX 장치를 발표했습니다. 새로운 장치는 Xavier SoC의 저전력 버전을 기반으로 구축되어 Jetson Xavier 클래스의 성능을 훨씬 더 작은 폼 팩터로 축소합니다. 에지의 로봇 및 임베디드 컴퓨팅 장치를 대상으로 하는 Jetson Xavier NX는 70mm x 45mm의 컴팩트 폼 팩터를 특징으로 합니다. 모듈을 구동하는 SoC에는 L2 6MB와 L3 4MB 캐시를 포함한 6코어 Carmel Arm 64비트 CPU, 384 CUDA 코어와 48 Tensor 코어를 갖춘 Volta 기반 GPU, 그리고 2개의 NVIDIA 심층 학습 가속기가 포함됩니다. 128비트 인터페이스를 통해 연결된 8GB의 LPDDR4x 메모리가 있으며 최대 51.2GB/초의 피크 대역폭을 제공합니다. Jetson Xavier NX는 최대 6개의 CSI 카메라(가상 채널을 통해 36개), 기가비트 이더넷을 지원하며 2 x 4K30 비디오 스트림을 인코드하고 2 x 4K60 스트림을 디코드할 수 있습니다.

원문 보기
MLPerf 추론 벤치마크는 Nvidia의 성능 리더십을 확인하며, Jetson… · Slicast