Skild AI推出S1机器人基础模型,可从单个视频演示学习新工业任务
Skild AI发布了S1机器人基础模型,该模型设计用于通过单个视频演示学习之前未见过的长期任务。该模型使用视频作为输入来理解和执行任务,无需更新其权重或进行特定任务的重新训练,这种技术称为上下文学习。Skild在NVIDIA AI基础设施上构建了S1并进行了研究,作为涵盖合成数据生成、模型训练、模拟和真实物理AI部署的更广泛合作的一部分。
该机器人解决了工业自动化中的一个根本性挑战:制造车间、仓库和生产线不断变化,任务、布局和新产品不断到来,但大多数机器人无法在没有重大重编程的情况下进行适应。Skild AI联合创始人兼首席执行官Deepak Pathak表示,通过经验学习而不是预编程代表了机器人技术的质的飞跃,并指出NVIDIA Isaac Lab和NVIDIA Cosmos技术帮助Skild创建可扩展的、多样化的体验,使其机器人能够在许多场景和物体形态中学习。
该发布正值Skild在首次商业部署仅10个月后达到年收入1亿美元的运行率。在这段时间内,该公司建立了60多个部署合作伙伴关系,应用跨越制造、物流、检查、安全、食品准备和其他领域。
与为固定工作而构建的传统工业机器人不同,S1以不同的方式运作。操作员录制所需任务的视频并将其作为提示提供给模型。该模型解释所演示的意图、对象和序列,然后将其映射到机器人的操作,无需重新训练,通常用于其预训练数据集中未涵盖的任务。S1可以执行持续长达10分钟的陌生任务,包括盆栽种植、烙饼制作、手冲咖啡冲泡和套件组装。这些任务可能跨越数十个操纵步骤,并要求机器人以它以前未执行过的序列组合技能。
在测试中,一个盆栽种植演示仅用11分钟从视频录制到硬件上的自主执行。该模型可以在对象移动时进行调整,从错误中恢复,并以新的序列组合技能。在Skild对新的多步任务的测试中,S1在每个步骤的成功率约为66%,而类似的AI系统为9%,改进了七倍多。Skild估计向机器人展示一个简短的视频示例可以与提供大约380个实践训练示例一样有用,这项工作可能需要一个人花费50到100小时才能手动收集。
Skild、NVIDIA和Foxconn现在在双臂操纵器上部署Skild Brain,用于NVIDIA Blackwell系统的高精度组装。在一个演示的工作流程中,机器人安装了母线和极限块,紧固了16个螺钉,并在多步任务中适应干扰,需要精确的运动、接触感知的控制、序列跟踪和当场景与计划不同时的恢复。
NVIDIA加速计算为Skild提供了使用模拟、人工视频、远程操作和部署数据训练其共享机器人大脑的能力。NVIDIA Cosmos开放世界基础模型帮助多样化训练数据并将视频转换为结构化描述,而NVIDIA Omniverse库和Isaac Sim提供基于物理的虚拟环境用于生成数据、测试边界情况和验证行为。Skild使用由Newton物理引擎提供支持的开放式模块化机器人学习框架Isaac Lab,通过强化学习来加强其大脑,帮助工程师准确建模物理参数,如力、接触、碰撞和压力,以减少模拟到现实的差距。Skild和NVIDIA正在联合开发新的GPU加速模拟求解器,以快速准确地模拟机器人如何以物理方式接触、抓握和操纵固体物体,这些工具将作为Newton的一部分提供给所有开发者。NVIDIA Nsight工具帮助工程师在训练期间找到性能瓶颈,NVIDIA TensorRT优化推理,使机器人能够在物理世界中快速响应。