Nvidia宣布Turing,一种具有硬件加速实时光线追踪功能的数据中心和设计工作负载GPU架构。
在2018年SIGGRAPH大会上,NVIDIA首席执行官Jensen Huang推出了Turing架构,这是一种融合AI、光线追踪、光栅化和计算功能的新型GPU设计。Huang将其称为自2006年引入CUDA GPU以来图形处理器最大的飞跃,并向观众介绍新型Turing GPU将使设计师和艺术家能够实时渲染逼真的场景。他表示:"这从根本上改变了计算机图形的完成方式。这是一次真实感的跃升。"
首批采用Turing架构的产品是Quadro RTX专业GPU,针对从事视频内容创作、汽车及建筑设计的专业人士,以及从事科学可视化的研究人员。产品线包括配备48GB内存、10 Giga-rays/秒光线追踪吞吐量、4,608个CUDA核心和576个Tensor核心的Quadro RTX 8000,估价$10,000;配备24GB内存、10 Giga-rays/秒光线追踪、4,608个CUDA核心和576个Tensor核心的Quadro RTX 6000,价格为$6,300;以及配备16GB内存、6 Giga-rays/秒光线追踪、3,072个CUDA核心和384个Tensor核心的Quadro RTX 5000,价格为$2,300。这些GPU将从今年第四季度开始在工作站和服务器中提供。NVIDIA还推出了基于顶级Quadro RTX 8000的RTX Server,用作渲染农场的基础。根据NVIDIA的计算,四台RTX服务器(每台配8个GPU)可提供与240台由Skylake CPU驱动的双插槽服务器相同的渲染吞吐量,将资本成本从$200万降低到$500,000,功耗需求从144千瓦降低到13千瓦。
Turing架构以三个专业硬件元素为基础构建:用于计算和着色的流多处理器(SM)、用于深度学习和AI的Tensor核心,以及用于光线追踪的RT核心。该芯片在754 mm²的芯片面积上包含高达18.6亿个晶体管,规模与Tesla V100 GPU几乎相同,后者在815 mm²的芯片面积上拥有21.1亿个晶体管。RT核心是专业电路,可实现实时光线追踪,用于精确的阴影、反射、折射和全局光照效果,使新型Quadro每秒能够模拟多达100亿条光线。内存采用GDDR6标准,这与之前采用32GB HBM2内存的Quadro GV100不同,但可以通过NVLink连接两个GPU来将内存容量有效增加一倍。
Turing硅芯片由NVIDIA RTX软件栈提供支持,该软件栈包括对Pixar Universal Scene Description(USD)和Material Definition Language(MDL)的支持,以及用于光栅化、光线追踪(OptiX、DXR和Vulkan)、模拟(PhysX、FleX和CUDA 10)和AI(NGX SDK)的API。流多处理器具有可同时运行的独立浮点和整数管道,可同时进行地址计算和数值计算。新型Quadro芯片可分别进行高达16万亿浮点运算和16万亿整数运算的并行处理,配备统一缓存,带宽是上一代架构的两倍。
Turing Tensor核心支持图形和可视化应用,包括基于AI的降噪、深度学习抗锯齿(DLAA)、帧插值和分辨率缩放,可用于减少渲染时间、提升图像分辨率或创建特殊效果。虽然与基于Volta的V100 GPU中的类似,但新型Turing Tensor核心大幅提升了INT8(8位整数)运算的张量计算性能,这些运算用于神经网络推理,从V100中的62.8万亿次运算提升到Quadro RTX芯片中的250万亿次运算。新Tensor核心还为某些需要较低精度的推理任务提供INT4(4位整数)功能,达到500万亿次运算——即半千万亿次运算——并为FP16数据支持125万亿次浮点运算,与V100相同。