2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

英伟达推出Cosmos 3仿真平台,目标定位为具身智能时代的底层操作系统。

该平台构建的开发者生态将直接拉动面向大规模并行训练与高带宽内存的定制化服务器采购需求。
行业媒体Slicast · 2026年8月19日 UTC 06:15 · 中国 · 来源: 雷锋网
重要度 75

2026年,大语言模型行业正经历一场前所未有的感知转变。主导纯数字领域的扩展定律在试图跨越进入物理世界时,正面临严酷的清算,受到物理定律、空间限制和长尾数据的制约。AI行业的核心矛盾日益凸显:云端算力的指数级激增与边缘侧机器人部署的步履蹒跚形成鲜明对比。

这一分歧在悉尼举行的RSS 2026(机器人科学和系统会议)最后一天达到顶峰。在“机器人世界模型”研讨会上,传统机器人社区对物理因果关系的敬畏与AI行业对规模效应的信仰发生了正面碰撞。在这场范式冲突的中心,英伟达(NVIDIA)Physical AI专家李马克(Max Li)深入介绍了其最新发布的旗舰产品:Cosmos 3。

Cosmos 3不再仅仅是一个更逼真的视频生成器。它是世界上第一个基于单一Transformer架构构建的世界基础模型,完全统一了文本、视觉、音频和行动模态。如果过去两年的具身智能(Embodied AI)类似于一个拼搭积木的时代——开发者们像拼乐高一样艰难地组合视觉模型、语言模型和控制算法——那么Cosmos 3标志着集成平台时代的黎明。

在演讲中,李马克发出了明确的战略转向信号:具身智能的下一阶段将属于边缘端,而非数据中心。通过将AGI大脑迁移到Jetson等边缘设备进行实时推理,英伟达旨在消除机器人背负服务器级硬件的负担。这反映了英伟达作为计算巨头的终极野心:不仅要成为硬件垄断者,更要成为具身智能时代的Android操作系统。通过为“大脑和肢体”制定标准化协议,英伟达力求统一碎片化的机器人形态格局,使它们能够在共同的逻辑基础上演进。

以下是李马克演讲的编辑版文字稿,改编自英文原演示文稿,同时保留了所有原始含义和技术细节。

李马克:感谢主持人的介绍。今天很荣幸在这里分享我们最新的研究成果:Cosmos 3,这是一个专为物理AI设计的多模态世界基础模型。

目前物理AI面临的巨大挑战之一是数据。与计算机视觉代理或大语言模型相比,获取物理世界的数据受到时间和空间的线性约束严重限制。我们无法像扩展算力那样简单地扩展物理数据。这就是为什么我们认为仅靠遥操作或合成数据无法解决问题;我们需要更根本的技术。这就是我们引入“世界基础模型”概念的原因,旨在成为许多物理AI应用的真正基石。

我们还花了大量时间定义什么是合格的世界基础模型,特别是从代理的角度来看。模型必须具备哪些能力才能以基础方式与世界互动?我们确定了三项关键能力:

第一,理解世界。正如前一位演讲者劳拉(Laura)所指出的,如果你想从微波炉中取出食物,模型必须首先理解当前的环境状态,然后才能行动。第二,模拟结果。代理必须能够预测特定行动的结果。在物理世界中,试错成本很高;打破玻璃杯是不可逆的。然而,在模拟中,你可以零成本反复打破东西。因此,模拟未来轨迹的能力至关重要。第三,采取行动。这对机器人研究人员来说是最熟悉的部分:将意图转化为物理现实。

在劳拉的框架基础上,我们将所有模态整合到一个模型中:文本、图像、视频、音频和行动,从而实现跨所有模态的生成。让我们看看Cosmos实际上能做什么。

对于理解真实世界,给定一段机器人执行任务的视频观察,该模型的运作方式类似于视觉-语言模型(VLM),对特定时间戳之间发生的事情进行推理,或预测观察结果。我们认为世界理解是任何模型的基石;没有它,行动就不可能实现。

生成能力同样重要。我们对音频、视频和行动进行联合建模。在这个例子中,音视频生成作为一种验证机制,确认模型在特定控制条件下正确理解了未来结果。加入音频条件特别有趣,因为物理交互通常通过声音提供线索,例如碰撞或摩擦。这就是为什么我们将音频纳入基础模型训练的原因。

关于世界模拟,这里有一个Cosmos模拟复杂的人机环境互动的例子。左下角显示了头戴式摄像机的轨迹,右下角显示了手部姿态。该模型模拟了加热物体并将其放置在桌子上的整个过程。

我们坚信,自我中心数据是基础模型获取物理交互深层知识的最有效途径。我们正在与众多团队和开源社区合作,将这些知识注入模型。

我们还实现了逆动力学。这不仅限于从给定动作预测未来的视觉观察;利用多视角观察,它可以逆向工程驱动这些视觉变化的底层动作。如果你拥有海量未标记的视频数据,这将是一个出色的数据挖掘工具。在这个演示中,我展示了预测的动作如何驱动机器人的URDF模型向前移动。

一旦模型充分捕捉了所有可能的物理结果——动力学、视频演变、文本理解——它就可以直接转换为策略模型,在现实世界中执行动作。虽然目前的演示可能在视觉上不是最引人注目的,但核心逻辑很简单:如果模型深刻地建模了状态及其转换机制,它自然具备策略能力,接收特定指令并物理执行它们。

发布后,我们推出了几个即插即用版本。服务器端的Super系列提供了巨大的规模,但对实时机器人任务不太友好。因此,我们投入了大量精力开发Cosmos Edge。我们发现它在Jetson等边缘设备上实现了实时推理,无需服务器级GPU,这对于该领域的开发者来说应该非常实用。

自发布以来,一项关键进展是与Pi团队合作展示策略评估。我们并不声称这完全取代了现实世界的评估,但我们成功地将部分评估工作离线卸载。策略可以与Cosmos交互,利用其逆动力学进行新颖的评估。屏幕顶部显示了现实世界中的策略表现;在进行在线策略评估期间,模型决定不将球放入垃圾桶,导致失败——这是我们当前技术可以准确模拟和评估的场景。

总结上述要点:该模型包含VLM能力、粒子跟踪、运动规划(Move it)、多模态输入/输出(文本、图像、视频、音频)、全局策略、正向动力学模型和逆动力学模型。我们配置不同的输入输出组合,将这些功能统一在一个模型中。

在架构上,这是一个混合专家(MoE)设计。对于注意力掩码,我们使用因果自注意力进行世界理解(推理),并使用双向注意力进行生成。

鉴于这是机器人会议,我必须谈谈我们如何统一不同具身形式的动作向量。我们支持各种形式:自动驾驶汽车(AV)、相机运动(第一人称移动)、单臂机器人、双臂机器人和人形机器人。我们使用启发式规则耦合不同的动作向量,使它们尽可能共享语义空间。

在逆动力学模式下,给定视频,模型预测导致该视频的底层动作。

处理不同模态时的一个持续挑战是处理位置嵌入。这是我们统一解决方案:

视频:我们在所有维度P、H、W(定义为3D空间)上应用增量索引,沿水平和权重轴编程。

音频与动作:缺乏高度和宽度,我们仅依赖时间轴。

这确保了所有深度生成都与大语言模型的底层循环兼容,保留其通用基础知识。

一个关键的难点在于同步:语言令牌没有时间概念,而视频、音频和行动需要时间对齐。我们的方法使用24 FPS作为基准。当输入不同帧率的视频时,我们根据24 FPS重新计算它们的索引,将所有内容对齐到真正的时间线,而不是引入漂移。

关于数据,我们过滤了约2200万个可训练样本用于预训练,涵盖OCR、视觉定位和其他领域。对于监督微调(SFT),我们提取了专门针对物理AI的子集。

训练分为三个阶段:

1. 预训练:专注于图像生成、视频生成和图像到视频。这些数据相当于大约1000万小时的视频,以便直观参考规模。

2. 中期训练:我们引入了额外的模态,特别是动作,以及机器人领域流行的跨域转移数据。例如,我们生成资产模拟视频。尽管它们在模拟中看起来是人工的,但我们将其渲染为照片级真实质量而不改变物理属性,并将它们纳入数据集。

3. 后训练:在论文发布时,我们只训练了Nano和Super版本。我们应用了后训练用于文本到图像、文本到视频和图像到视频任务,以及与本受众相关的策略导向输出,展示了Cosmos如何转换为策略模型并运行。

模型规格:

Cosmos Edge:一个4B参数的MoE模型,具有两个专家塔(每个2B)。

Cosmos Nano:一个16B参数的MoE模型(8B用于推理器,8B用于生成器)。

Cosmos Super:我们最大的版本,一个64B参数的MoE模型(各32B),服务于多样化的应用场景。

我们观察到明显的扩展定律。撇开实时推理的策略要求不谈,更大的模型在图像和视频生成方面表现出极其显著的优势。

最后,一个关键点:Cosmos是完全开源的。我们致力于最大程度的开放。我鼓励大家探索我们的项目。我个人承诺手动回复GitHub上的每一个问题。没有使用AI代理;我自己回复。我每天花时间调试模型和代码库。如果您遇到问题或错误,请报告它们,我将尽最大努力在24小时内提供支持。

我们发布了模型、代码以及一篇包含详尽细节的综合论文。这是一项非凡的合作努力,涉及超过100名贡献者,最终成就了Cosmos。我们希望它为社区旨在构建的许多应用奠定坚实的基础。

主持人:谢谢,马克,精彩的演讲。我有一个问题:你将所有模态压缩到一个庞大的模型中。是否有证据表明这显著缩小了动作接地差距?由策略生成的动作——特别是Edge版本——仅仅是看起来合理,还是物理上可行的?

李马克:极好的问题。论文中有详细的分解。例如,在Cosmos的预训练期间,我们完全排除了PID控制信息或类似数据。它纯粹被训练为一个状态转换机。控制信号仅在后期训练中引入。当我们针对特定机器人进行联合后训练并整合控制信息时,它变得真正实用。这反映了一种哲学立场:预训练应最大化通用性和泛化能力,而后训练则针对特定任务进行调整。

观众成员:你如何衡量Cosmos对物理定律的精确度?具体来说,你如何量化视频生成中预测的物理轨迹与实际物理定律之间的差距?

李马克:我们利用专门的基准进行测试物理评估,例如VBench,这些基准专门设计用于评估生成视频的物理合理性。

关于是否加入动作能提高物理精度:虽然这一迭代缺乏强有力的全局统计数据证明加入动作提高了所有领域的物理预测准确性(因为并非所有互联网视频都带有机器人动作标签),但我们始终观察到,在机器人和具身智能背景下,加入动作显著提高了模型对未来视觉轨迹的预测准确性。在这些场景中,该模型被证明非常有价值。

观众成员:谢谢你的演讲。我注意到有多个尺寸变体(Edge、Nano、Super),并提到训练利用了数百万小时的视频数据。你是否使用不同数量的视频数据训练不同大小的模型,还是所有版本的数据集都是一致的?

李马克:一个非常敏锐的问题。通常,在研究扩展定律时,你希望保持令牌数量与参数之间的计算最优比例。然而,对于Edge模型,我们不得不做出故意的权衡。例如,我们从Edge版本中完全移除了音频模态。我们发现音频对于大多数边缘任务是不必要的,移除它释放了资源。当扩展到16B(Nano)和64B(Super)时,资源约束不那么严重。

这突显了一个关键的痛点和一个开放的研究问题:技术权衡最终取决于你可用的数据。由于数据集不同,我的经验可能无法被其他团队直接复制。总体而言,是的,在不同模型规模之间存在数据和模态权衡。我仍然相信更大的模型会产生更好的结果,我希望我们最终能训练出一个确定的物理AI基础模型。

RSS 2026即将到来。我们目前正在组建一个高水平的AI研究者群体,专注于实时论文追踪和严格的技术讨论,没有任何废话。

通过二维码加入或添加微信:Luyoyo_2026。注意:论文小组 + 您的AI重点领域。

版权所有 © 2011-2026 Leiphone / 深圳鹰鹏信息技术有限公司。保留所有权利。ICP许可证:粤ICP备11095991号。办公室电话:0755-26581864。

阅读原文
英伟达推出Cosmos 3仿真平台,目标定位为具身智能时代的底层操作系统。 · Slicast