2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

Nvidia推出Grace-Blackwell变体,针对数据中心AI工作负载的优化超级芯片,扩展Blackwell产品系列。

为GPU密集型AI训练和推理实现成本优化的数据中心部署,改善云提供商的总拥有成本,扩大Nvidia可寻址市场。
行业媒体Slicast · 2025年1月7日 UTC 12:00 · 全球 · 来源: theregister.com
重要度 82

伟达宣布推出Project Digits,这是一个价格为3,000美元的桌面系统,由全新的GB10 Grace-Blackwell超级芯片驱动,配备128GB内存,旨在为AI开发人员、研究人员和学生提供在桌面上运行大型模型的工具。该系统由英伟达与联发科技合作开发,由首席执行官黄仁勋在拉斯维加斯举行的CES大会上发布,采用基于Arm架构的Grace CPU和Blackwell GPU,这两者似乎集成在一个单一的SoC中。该系统将搭载特制的Ubuntu Linux系统,预先配置以充分发挥硬件性能。Project Digits的体积与英特尔NUC迷你电脑相仿,提供整整1petaFLOP的AI性能,不过这个数据是基于稀疏4位浮点工作负载计算的。

规格说明表明GB10配备20核的Grace CPU和一个GPU,其性能为英伟达GB200 AI服务器中双Blackwell GPU性能的1/40。该系统的功能强于英特尔、AMD或高通的AI PC,但在与配备英伟达RTX 6000 Ada的工作站竞争时将显得力不从心。RTX 6000 Ada拥有1.45 petaFLOPS的稀疏FP/INT8性能——大约是Project Digits在该精度下预计可提供的500 teraFLOPS的三倍。据英伟达企业平台产品营销总监Allen Bourgoyne表示,选择128GB的LPDDR5x内存是为了让大型AI模型的使用更加便捷。

英伟达声称Project Digits将支持多达2000亿参数的模型,前提是这些模型被压缩为4位格式。两个单元可通过板载ConnectX网络连接,以运行最多4050亿参数的模型,使Meta的Llama 3.1 405B成为可能——同样在4位格式下。作为参考,在现有的工作站硬件上运行同一模型至少需要五个48GB的GPU。根据展示六个LPDDR5x模块的渲染图,假设内存速度为8,800 MT/s,该系统可提供约825GB/s的带宽,与RTX 6000 Ada的960GB/s相差不远,这相当于对2000亿参数模型每秒约8个token的性能——尽管在发布时尚未披露完整规格。

除了AI推理外,英伟达预期Project Digits还将适用于模型实验、微调、数据科学和边缘应用。该系统将包含4TB的NVMe存储,足以容纳大多数开源模型,特别是那些量化为4位的模型。Project Digits从5月开始提供,代表了英伟达Jetson开发工具包的成熟版本,该公司多年来一直提供这些工具包,并在2024年12月通过Orin Nano Super进行了最近一次更新。在其现有形式下,该产品似乎旨在使用户熟悉英伟达功能更强大的Grace-Blackwell超级芯片,如GB200和GB200 NVL4,但英伟达尚未披露是否会将GB10许可给其他PC制造商。

阅读原文
Nvidia推出Grace-Blackwell变体,针对数据中心AI工作负载的优化超级芯片,扩… · Slicast