2026年9月22日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达展示RC18推理芯片,这是一款专为AI模型推理工作负载设计的专用处理器。

英伟达的推理专用硅芯片解决高容量生产成本优化,这对数据中心AI经济至关重要。
行业媒体Slicast · 2019年9月4日 UTC 12:00 · 全球 · 来源: nextplatform.com
重要度 70

然对芯片制造商和运行机器学习工作负载的人来说,如果训练和推理可以在同一设备上进行会很方便,但Nvidia目前用其Tesla "Volta" GPU加速器在机器学习训练领域保持着虚拟垄断。该公司在新兴推理领域也取得了重大进展,其"Turing" GPU用于其最新GeForce图形卡,以及针对服务器推理卸载的低压Tesla变体。在最近于斯坦福大学举行的Hot Chips 31会议上,我们与Bill Dally进行了交谈。Dally在过去十年领导Nvidia研究部门,之前在加州理工学院、MIT和斯坦福大学拥有长期职业生涯,从事超级计算机和互连设计。Dally共同撰写了三本关于互连的书:《数字系统工程》(1998年)、《互连网络的原理与实践》(2004年)和《数字设计:系统方法》(2012年)。

Dally的团队在Hot Chips会议上展示了RC18研究芯片,旨在展示128万亿次操作的高效推理加速。据Dally介绍:"RC18芯片是一个高效的推理引擎——采用台积电常规的16纳米工艺,性能能效为9.5万亿次操作每瓦。"这相当于约13.5瓦的功耗,这种功耗特性和性能效率对寻求推理引擎的超大规模计算商和云计算构建者很有吸引力。Dally强调该芯片可以替代Nvidia深度学习加速器(NVDLA),指出它"设计方式实际上与NVDLA非常相似,但我们对工具的关注度与对芯片本身的关注度一样高。"该团队开发了设计空间探索工具,可以测试"向量宽度的所有组合、向量单元的数量、缓冲区数组的大小以及循环平铺的各种方式",该工具为各种神经网络识别最优配置。

一个关键问题涉及向量操作的最优矩阵大小。Google的TPU1使用256×256矩阵,其TPU3将其减小到128×128,Intel的Nervana推理芯片采用32×32。RC18则采用8×8矩阵。Dally解释了其中的根本权衡:"当你把它做得更大时,对真正大的矩阵乘法来说效率会略有提升,但当它无法完全填充时效率会下降。如果你把它做得很大,可以摊销更多的外部开销,但如果无法填满它,就是在浪费空间。"对于推理,Dally认为最优范围"介于8×8和16×16之间的某处——很好的是将其设为2的幂次,因为这样一切都能很好地映射。"他预测,更新的网络可能需要更小的粒度,表示"我认为它将保持在8×8到16×16范围内。"

RC18集成了旨在提高功耗效率的创新设计。与所有处理元素都由单一时钟驱动的方案不同——这种方案需要降低时钟频率以适应芯片最低电压区域——RC18的每个处理元素都由"单独生成并跟踪电源供应的本地时钟"驱动。这使得芯片可以"以接近极限的频率运行,然后当电源下降时相应降低频率。"但这需要时钟域之间的快速同步。Dally的团队创建了达到"平均半个时钟周期"同步的同步器,相比之下从一个时钟域到另一个时钟域通常需要"五到六个时钟周期。"该技术采用异步通信方式,"只有在处于极限区域时才会额外增加一个时钟周期以确保安全。但这几乎从不发生,所以平均下来仍是半个时钟周期。"这项同步技术赢得了5月国际异步电路和系统研讨会(ASYNC)的最佳论文奖。

阅读原文
英伟达展示RC18推理芯片,这是一款专为AI模型推理工作负载设计的专用处理器。 · Slicast