中国AI开发者探索在云端租用英伟达Rubin GPU,但成本、复杂性和监管障碍限制部署。
中国的人工智能硬件开发商正在自主设计的加速器方面取得快速进展,但中国最先进的人工智能开发商越来越多地承认,国内硬件在短期内不太可能赶上美国领先企业,这大大限制了具有竞争力的模型开发。为了与美国同行保持竞争力,中国人工智能开发商正在探索在云端租赁英伟达即将推出的Rubin GPU的方式。当英伟达在1月份推出其用于人工智能的Rubin数据中心平台时,它公开点名了美国客户而忽略了中国客户,这反映了美国出口规则、其遵守这些规则的承诺,以及其不想向投资者表明中国市场将要开放的意图。这一信息促使中国公司开始探索从英伟达远程获取尖端处理器的方式,以避免落后于美国竞争对手。
中国人工智能公司已开始协商访问托管在中国以外数据中心(特别是在东南亚和中东地区)的NVL144 GR200和其他基于英伟达Rubin的系统。直到本周中旬,这些安排通常被认为是合法的,尽管它们存在固有局限性:计算能力是租用而非拥有,容量是共享而非专属,部署时间表取决于第三方运营商而非内部计划。
在远程云数据中心租赁Rubin与本地部署之间存在深刻差异。美国超大规模公司可以大规模集成Rubin加速器,围绕新硬件紧密调优其软件堆栈,并为长期训练运行预留大规模GPU集群。相比之下,租赁Rubin容量的中国开发商必须应对有限的分配、跨境延迟、定制系统的自由度有限,以及在某些情况下的排队。如果他们租赁足够的系统,可能能够相当顺利地训练模型;然而,如果他们无法及时找到合适的云服务,每个项目可用的人工智能加速器将更少,在某些情况下将无法运行大型训练任务,这将直接制约模型规模、实验节奏和迭代速度。
中国开发商已经有了处理这一挑战的经验。他们使用由A100、H100、H800和H20等不同英伟达GPU组成的集群来训练前沿模型,并在云中租赁了额外的容量——据业内人士称,这种经历既昂贵又在运营上很困难。随着模型规模的进一步扩大,对大规模、同构GPU集群的不间断访问变得越来越重要,但租赁的容量很难提供这一点。即使交易达成,也通常使中国开发商相对于能够在一个地点部署数万个加速器的资金充足的美国竞争对手处于结构性劣势。
中国人工智能开发商面临的财务限制加重了这些挑战。根据瑞银集团的估计,中国的超大规模公司去年在资本支出上投入了约570亿美元,大约是美国同行的十分之一——少于Meta单独的资本支出70多亿美元。鉴于这些财务限制,中国人工智能开发商是否能够与美国同行保持基本竞争力仍有待观察。