Nvidia는 AI 클러스터의 물리적 규모를 줄이는 공간·전력 효율 딥러닝 시스템을 개발했다.
화요일, 실리콘 밸리의 대규모 연례 컨퍼런스에서 엔비디아는 두 개의 페타플롭을 처리할 수 있는 컴퓨팅 성능을 갖춘 세계 최초의 단일 서버를 공개했다. 이는 일반적으로 수백 대의 서버가 클러스터로 연결되어 제공되는 수준의 성능이다. 칩 제조업체에 따르면, 주로 딥러닝 애플리케이션을 대상으로 하는 DGX-2 시스템은 지난 9월에 출시된 전작인 DGX-1의 볼타 GPU 탑재 버전보다 10배 더 강력하다. 엔비디아는 DGX-2에 GPU 수량을 두 배로 늘리고, 각 GPU의 메모리를 이전 대비 두 배로 업그레이드하며, 새로운 GPU 인터커넥션 기술을 사용하고 엔비디아 딥러닝 소프트웨어를 개선함으로써 이러한 성능을 달성했다. 캘리포니아주 산타클라라에 본사를 둔 이 회사는 컴퓨터 그래픽을 가속화하는 동시에 방대한 양의 데이터를 분석하여 자체적으로 학습하는 컴퓨팅 시스템인 신경망 훈련에 사용되는 기계 내부에서 작동하는 GPU의 주요 제조사로서 AI 붐을 주도하고 있다.
DGX-2는 산호세에서 열린 GTC 서밋에서도 발표된 엔비디아의 새로운 GPU 인터커넥션 기술인 NVSwitch를 최초로 적용한 시스템이다. NVSwitch는 기존 GPU 파브릭인 NVLink를 개선하여 상자 내부의 16개 모든 GPU를 서로 연결한다. 엔비디아에 따르면, 이는 시장 최고 수준의 PCIe 스위치보다 5배 더 많은 대역폭을 제공한다. 엔비디아의 창립자이자 CEO인 젠슨 황은 GTC 기조연설에서 "모든 GPU가 PCI 익스프레스 대역폭의 20배에 해당하는 대역폭으로 다른 모든 GPU와 통신할 수 있다"고 말했다. 이 스위치는 초당 300GB의 데이터를 전송한다. 서밋에서 회사는 또한 최상위 데이터센터용 GPU인 테슬라 V100이 이제 새로운 슈퍼컴퓨터 박스에 탑재될 수 있도록 메모리가 두 배 증가한 32GB로 출고된다고 발표했다.
엔비디아는 DGX-2를 39만 9천 달러에 가격 책정했으며, 데이터센터의 주요 비용 및 공간 절감 솔루션으로 포지셔닝했다. 엔비디아 딥러닝 시스템 담당 부사장 겸 일반 관리자(Jim McHugh)에 따르면, 단일 DGX-2 박스는 "300대 [인텔] 스카이레이크 서버"에 해당하는 성능을 제공한다. 맥휴는 300대의 스카이레이크 서버가 "실질적으로 15개의 서버 랙을 차지한다"며, 이는 데이터센터에서 상당한 공간과 전력 절감 효과를 가져올 것이라고 지적했다. 황 회장은 이에 상응하는 스카이레이크 클러스터 구축 비용이 "쉽게 300만 달러에 이를 것"이라고 덧붙였다.
GPU 판매는 엔비디아에 막대한 수익을 안겨주었으며, GPU는 회계연도 2018년 기준 회사 매출의 81억 4천만 달러를 기록했다. 이 중 19억 3천만 달러는 딥러닝 및 보다 전통적인 고성능 컴퓨팅 워크로드를 위한 데이터센터용 GPU 판매에서 비롯되었으며, 이는 전년 대비 133% 증가한 수치다. 아마존 웹 서비스(AWS), 마이크로소프트 애저, 구글 클라우드 플랫폼과 같은 클라우드 거대 기업들은 엔비디아 데이터센터 GPU 매출의 상당 부분을 차지하고 있으며, 모든 주요 클라우드 서비스 공급사는 자체 AI 애플리케이션 구동 및 GPU 컴퓨팅 파워 서비스를 제공하기 위해 엔비디아 GPU를 도입하고 있다.