Nvidia가 데이터센터 및 설계 워크로드를 위한 하드웨어 가속 실시간 레이 트레이싱 기능을 갖춘 획기적인 GPU 아키텍처 Turing을 발표했습니다.
SIGGRAPH 2018에서 NVIDIA CEO 젠슨 황(Jensen Huang)은 AI, 레이 트레이싱, 래스터화, 그리고 컴퓨팅을 통합하는 새로운 GPU 디자인인 Turing 아키텍처를 공개했습니다. 2006년 CUDA GPU가 소개된 이후 그래픽 프로세서에서 가장 큰 도약이라고 부르며, 황은 청중에게 새로운 Turing GPU가 설계자와 아티스트들이 포토리얼한 장면을 실시간으로 렌더링할 수 있게 해줄 것이라고 말했습니다. "이것은 컴퓨터 그래픽이 수행되는 방식을 근본적으로 변경할 것입니다"라고 그는 말했습니다. "이것은 리얼리즘에서의 도약입니다."
Turing 아키텍처를 포함하는 첫 번째 제품들은 영상 콘텐츠 제작, 자동차 및 건축 설계를 하는 전문가들, 그리고 과학 시각화를 수행하는 연구원들을 대상으로 하는 Quadro RTX Professional GPU입니다. 제품 라인에는 48GB 메모리, 초당 10 Giga-rays 레이 트레이싱 처리량, 4,608개의 CUDA 코어 및 576개의 Tensor 코어를 갖춘 Quadro RTX 8000(예상 가격 $10,000)이 포함되며, 24GB 메모리, 초당 10 Giga-rays 레이 트레이싱, 4,608개의 CUDA 코어 및 576개의 Tensor 코어를 갖춘 Quadro RTX 6000($6,300), 그리고 16GB 메모리, 초당 6 Giga-rays 레이 트레이싱, 3,072개의 CUDA 코어 및 384개의 Tensor 코어를 갖춘 Quadro RTX 5000($2,300)이 있습니다. 이러한 GPU는 올해 4분기부터 워크스테이션과 서버 모두에서 사용 가능할 것입니다. NVIDIA는 또한 최고 사양의 Quadro RTX 8000을 기반으로 한 RTX Server를 출시하고 있으며, 이는 렌더 팜의 기초로 사용되도록 설계되었습니다. NVIDIA의 계산에 따르면, 각각 8개의 GPU로 장착된 4개의 RTX 서버는 Skylake CPU로 구동되는 240개의 이중 소켓 서버와 동일한 렌더링 처리량을 제공할 수 있으며, 자본 비용을 $200만에서 $50만으로 줄이고 전력 요구 사항을 144에서 13킬로와트로 감소시킵니다.
Turing 아키텍처는 세 가지 특화된 하드웨어 요소를 중심으로 구축됩니다: 컴퓨팅과 셰이딩을 위한 스트리밍 멀티프로세서(SM), 딥러닝과 AI를 위한 Tensor 코어, 그리고 레이 트레이싱을 위한 RT 코어입니다. 칩은 754mm²의 다이에 최대 186억 개의 트랜지스터를 포함하며, 이는 815mm²의 다이에 211억 개의 트랜지스터를 탑재한 Tesla V100 GPU와 거의 동일한 크기입니다. RT 코어는 정확한 그림자, 반사, 굴절 및 글로벌 조명을 위한 실시간 레이 트레이싱을 가능하게 하는 특화된 회로로, 새로운 Quadro가 초당 최대 100억 개의 광선을 시뮬레이션할 수 있게 합니다. 메모리는 GDDR6 기반이며, 이는 32GB의 HBM2 메모리를 사용한 이전 Quadro GV100과는 다릅니다. 하지만 두 개의 GPU를 NVLink를 통해 연결하여 메모리 용량을 효과적으로 2배로 늘릴 수 있습니다.
Turing 실리콘은 Pixar의 Universal Scene Description(USD)과 Material Definition Language(MDL) 지원, 래스터화, 레이 트레이싱(OptiX, DXR, 및 Vulkan), 시뮬레이션(PhysX, FleX 및 CUDA 10), 그리고 AI(NGX SDK)를 위한 API를 포함하는 NVIDIA RTX 소프트웨어 스택으로 지원됩니다. 스트리밍 멀티프로세서는 동시에 작동할 수 있는 별도의 부동소수점 및 정수 파이프라인을 갖추고 있어, 주소 계산과 수치 계산을 동시에 수행할 수 있습니다. 새로운 Quadro 칩은 최대 16테라플롭 및 16테라옵스의 부동소수점 및 정수 연산을 병렬로 제공할 수 있으며, 이전 세대 아키텍처의 2배 대역폭을 가진 통합 캐시를 갖추고 있습니다.
Turing Tensor 코어는 AI 기반 노이즈 제거, 딥러닝 앤티 앨리어싱(DLAA), 프레임 보간 및 해상도 스케일링을 포함하는 그래픽 및 시각화 애플리케이션을 지원하여 렌더링 시간을 단축하거나, 이미지 해상도를 높이거나, 특수 효과를 만듭니다. Volta 기반 V100 GPU의 코어와 유사하지만, 새로운 Turing Tensor 코어는 신경망 추론에 사용되는 INT8(8비트 정수) 연산을 위한 텐서 계산을 V100의 62.8테라옵스에서 Quadro RTX 칩의 250테라옵스로 크게 향상시켰습니다. 새로운 Tensor 코어는 또한 더 낮은 정밀도가 필요한 특정 유형의 추론 작업을 위해 INT4(4비트 정수) 기능을 제공하여 500테라옵스(petaop의 절반)를 달성하며, FP16 데이터에 대해 125테라플롭을 지원합니다(V100과 동일).