Skild AI 上周发布了 S1 机器人基础模型。该模型采用上下文学习(in-context learning)技术,操作员只需提供一段目标任务的演示视频作为提示,模型即可解析其中的意图、物体与动作序列,并将其映射为当前机器人的可执行动作,无需更新模型权重或进行针对特定任务的后续训练。
单段视频驱动长序列操作
传统工业机器人通常针对固定任务设计,新产品、新工艺或布局调整往往需要重新采集数据、训练和验证。S1 的设计目标是让机器人能够处理预训练数据集中未覆盖的任务。
据 Skild AI 介绍,S1 可执行最长约 10 分钟的陌生多步骤任务,例如植物盆栽移栽、制作煎饼、手冲咖啡和套件组装。这些任务可能包含数十个操作环节,要求机器人在此前未执行过的序列中组合各项技能。在一次盆栽测试中,团队从录制演示视频到在硬件上实现自主执行仅耗时 11 分钟。模型还能够在物体移动时进行调整、从错误中恢复,并组合未被显式编程的技能序列。
在 Skild 针对新多步骤任务的测试中,S1 在每个步骤的成功率约为 66%,而同类 AI 系统的成功率为 9%。Skild 估算,向机器人展示一段简短的演示视频,其效果大致相当于提供约 380 次实操训练样本;若由人工手动采集同等数量的样本,可能需要 50 至 100 小时。
商业化进展与产线落地
Skild AI 联合创始人兼 CEO Deepak Pathak 表示:“通过经验而非预编程来学习,是机器人领域发生的阶跃式变化。”
此次 S1 发布之际,Skild 在首次商业部署 10 个月后达到了 1 亿美元的年化收入规模。该公司目前已建立超过 60 个部署合作关系,应用场景涵盖制造、物流、检测、安防及食品制备等。在客户协议允许的情况下,商业部署中积累的经验可用于优化通用模型,加速后续部署。
在实际产线应用中,Skild、NVIDIA 与富士康正将 Skild Brain 部署于双臂机械臂上,用于 NVIDIA Blackwell 系统的高精度装配。在一个已演示的工作流中,机器人完成安装母排与限位块、紧固 16 颗螺丝等操作,并在多步骤任务中适应现场干扰。这类工作要求精确运动、接触感知控制、序列跟踪以及在场景偏离计划时的恢复能力。
基于 NVIDIA 基础设施的开发链路
S1 的研究与构建均在 NVIDIA AI 基础设施上完成,双方合作覆盖合成数据生成、模型训练、仿真及真实世界物理 AI 部署等环节。
在数据与仿真层面,NVIDIA Cosmos 开放世界基础模型用于多样化训练数据并将视频转化为结构化描述,Cosmos Curator 负责大规模数据的标注、过滤与组织。Skild 使用 NVIDIA Omniverse 库与 Isaac Sim 框架构建基于物理的虚拟环境,用于生成数据、测试边缘情况并验证行为。
在训练与强化学习阶段,Isaac Lab 框架结合 Newton 物理引擎,帮助工程师对力、接触、碰撞和压力等物理参数进行建模,以缩小仿真与现实之间的差距。双方还在联合开发新的 GPU 加速仿真求解器,用于快速准确地模拟机器人对固体物体的物理接触、抓取与操作,相关工具将作为 Newton 的一部分向开发者开放。
在部署优化方面,NVIDIA Nsight 工具用于定位训练过程中的性能瓶颈,TensorRT 软件开发套件则用于优化推理速度,使机器人能够在物理环境中快速响应。
