MLPerf推理基准确认英伟达性能领先;Jetson边缘产品线扩大市场覆盖。
MLPerf联盟发布了其Inference v0.5基准测试的第一批结果,该基准包含五个大规模并行基准测试,重点关注三个常见的机器学习任务,包括图像分类、物体检测和机器翻译。这些基准面向的应用范围从自动驾驶和面部识别到自然语言处理,覆盖从智能手机和个人电脑到数据中心云计算平台的各种硬件形态。NVIDIA、谷歌、英特尔、阿里巴巴以及全球其他公司提交了结果,其中NVIDIA提交的结果范围最广、涵盖的场景最多。NVIDIA基于Turing架构的GPU和Jetson Xavier平台表现相对突出。
在ImageNet ResNet-50 v1.5离线场景中,由于许多公司只提交了少量结果,只能进行有限的直接比较。NVIDIA的Titan RTX展示了强大的单处理器性能,得分为65,431.40输入/秒。许多提交的是多处理器系统的结果;SCAN 3XS DBP T496X2 Fluid系统使用四张Titan RTX卡,得分为66,250.40输入/秒,而配置八个处理器的2x Google Cloud TPU v3-8获得了相似的结果。在ImageNet ResNet-50 v1.5测试中,从离线场景转向服务器场景时,NVIDIA的性能下降仅为几个百分点,而谷歌的性能在同样的转换中下降了近一半。值得注意的是,Titan RTX不支持ECC内存,因此虽然其性能强劲,但这一特性的缺失可能会限制某些数据中心客户对其的使用。Habana Labs的HL-102-Goya PCI板卡在ImageNet ResNet-50 v1.5离线场景中的单处理器结果也表现不错,得分为14,451.00输入/秒。一对英特尔Nervana NNP-I 1000在同一测试中得分为10,567.20,并在从离线场景转向服务器场景时表现出最小的性能下降(10,262.63 QPS对10,567.20输入/秒)。
NVIDIA加速计算部门总经理兼副总裁Ian Buck表示,"人工智能正处于一个转折点,它正在从研究迅速转向大规模部署真实应用",并表示"人工智能推理是一项巨大的计算挑战。NVIDIA将业界最先进的可编程加速器、CUDA-X人工智能算法套件和我们在人工智能计算方面的深厚专业知识结合在一起,可以帮助数据中心部署其数量庞大且不断增长的复杂人工智能模型。"这些结果没有考虑定价或功耗,采用了不同的硬件形态——加速卡、服务器、云计算等——但这些数据确实为预期奠定了基础,并突出了一些表现突出的产品。
除了取得强劲的MLPerf成绩外,NVIDIA还宣布推出新的Jetson Xavier NX设备用于边缘人工智能计算。这款新设备本质上是将Jetson Xavier级性能缩小到一个更小的硬件形态中,采用了低功耗版本的Xavier片上系统。Jetson Xavier NX针对边缘机器人和嵌入式计算设备,采用紧凑的70mm x 45mm形态。该模块的片上系统配备了一个6核Carmel Arm 64位CPU,具有6MB L2和4MB L3缓存,一个基于Volta架构的GPU,配有384个CUDA核心、48个Tensor核心和两个NVIDIA深度学习加速器。它配备8GB LPDDR4x内存,通过128位接口连接,提供最高51.2GB/秒的峰值带宽。Jetson Xavier NX支持最多六个CSI摄像头(通过虚拟通道可达36个)、千兆以太网,并可编码2路4K30视频流和解码2路4K60视频流。