Wednesday, September 30, 2026
AI 인프라 · 뉴스 & 분석
홈 › 반도체·하드웨어 › 리포트
반도체·하드웨어 · 리포트

Nvidia가 AI 추론 애플리케이션용 Turing 기반 GPU를 발표합니다.

데이터센터 추론 가속기에서 Nvidia의 지배력을 효율적이고 높은 처리량의 솔루션으로 확립합니다.
업계 전문지Slicast · 2018년 9월 13일 12:00 UTC · 글로벌 · 출처: nextplatform.com
중요도 85

머신러닝의 진화는 신경망 훈련에서 추론, 즉 새로운 데이터에 훈련된 모델을 적용하여 유용한 애플리케이션을 생성하는 행위로 초점이 이동했습니다. Nvidia는 훈련 인프라 분야에서 지배적인 위치를 점하고 있지만, Maxwell GPU 기반의 Tesla M4 및 M40 가속기를 출시한 2015년 11월 이후로 추론 솔루션 개발을 이어왔습니다. Tesla M4는 1,024개의 CUDA 코어와 8 GB의 GDDR5 메모리를 탑재하여 88 GB/sec의 메모리 대역폭과 함께 2.2 테라플롭스의 단일 정밀도 성능을 제공했으며, 열 설계 전력은 50와트와 75와트 버전으로 제공됩니다. 이는 CPU 추론 대비 상당한 개선을 의미했지만, 데이터센터에서는 여전히 기존 Xeon 서버에서 추론 워크로드를 주로 처리했습니다.

2년 전, Nvidia가 Tesla P4 및 P40 가속기를 출시하며 추론 분야로의 본격적인 진출을 선언했습니다. 이 시기는 Ian Buck이 주도한 'Buck의 법칙'이라는 개념이 등장한 시기이기도 합니다. Nvidia의 Tesla 데이터센터 비즈니스 유닛 부사장 겸 일반 관리자였던 Ian Buck이 제시한 Buck의 법칙은 "세상에서 생성되는 모든 데이터는 수명 주기 동안 기가플롭스 단위의 컴퓨팅 성능을 필요로 한다"는 주장으로, 하이퍼스케일러와 기업 전반에 걸쳐 필요한 컴퓨팅 규모의 규모를 반영한 관찰이었습니다. Facebook은 머신러닝 추천 엔진을 통해 하루 10억 개 이상의 동영상을 처리하며, Google과 Bing은 음성 인식을 기반으로 한 검색을 하루 10억 건 이상 처리합니다. 이러한 활동들은 매일 1조 건 이상의 광고 노출을 발생시키며, 모두 효율적인 추론 인프라를 요구합니다.

Tesla P4는 2,560개의 코어를 갖추고 단일 정밀도 성능 5.5 테라플롭스와 업계 표준인 INT8 8비트 정수 형식 기준 22 테라오퍼스를 달성하며 GPU 추론 능력을 크게 발전시켰습니다. 이 가속기는 192 GB/sec의 메모리 대역폭을 갖춘 8 GB의 GDDR5 메모리를 특징으로 하는데, 이는 컴퓨팅 용량이 두 배 이상 증가함에 따라 Tesla M4의 대역폭보다 두 배 이상 높은 수치입니다. Buck에 따르면 구체적인 P4 수익을 공개할 수는 없지만, 추론 워크로드 구성은 다음과 같습니다: 비디오 인식은 사업의 절반을 차지했고, 음성 처리는 약 4분의 1을 차지했으며, 검색 또한 상당한 비중을 차지했습니다. 이로 인해 추론 수익은 "사업의 중요한 부분"이 되었습니다.

Nvidia가 일본 GPU 기술 컨퍼런스에서 Tesla T4 가속기 출시를 발표하며 추론 가속화의 차세대 전환점을 알렸습니다. 이 발전은 머신러닝 추론 기회가 가속화되는 시점에 이루어졌으며, 향후 5년간 인프라 판매액 200억 달러 규모의 잠재 시장을 형성하고 있습니다. 주목할 점은 Tesla T4 도입 2년 전만 해도 머신러닝 추론의 95%가 전용 가속기가 아닌 표준 X86 서버에서 실행되었다는 것입니다. 하지만 이제 에지 디바이스, 네트워크 내 시스템, 데이터센터 애플리케이션 등 효율적인 추론 처리가 필요한 데이터의 양은 근본적으로 더 효율적인 접근 방식을 요구하고 있습니다.

원문 보기
Nvidia가 AI 추론 애플리케이션용 Turing 기반 GPU를 발표합니다. · Slicast