快速了解本文
Skild AI 发布 S1 模型,支持单段视频演示学习新任务。
S1 对未见任务成功率达 66%,远超语言提示模型的 9%。
从录制演示到机器人自主执行仅需 11 分钟,无需微调。
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 Skild AI 发布机器人基础模型 S1,支持通过单段视频演示学习新操作任务。操作者只需录制一段人类执行任务的视频,S1 即可解释演示内容并在机器人硬件上复现预期行为,无需针对新任务进行微调或后训练。
关键数据
S1 采用上下文学习方法,类似大语言模型的提示机制,但将提示载体从文本替换为视频。在 10 万小时数据预训练后,S1 对未见任务的成功率达 66%,而基于语言提示的模型仅为 9%。单段视频演示产生的性能约等于传统模型接收 380 段后训练演示,后者通常需要 50 至 100 小时的遥操作数据采集。
在植物盆栽实验中,从录制人类演示到 S1 在机器人硬件上自主执行仅间隔 11 分钟。S1 还在煎饼制作、手冲咖啡和套件组装等任务上完成演示,部分任务包含数十个操作步骤,可持续运行达 10 分钟。S1 能响应演示中未出现的变化,如物体移动或替换,并能从执行错误中恢复。
S1 基于 Skild Brain 架构,采用分层设计,包含高层决策程序与低层控制器,可控制任何机器人形态。Skild AI 创建了包含超过 10 万种机器人形态的模拟环境用于训练。S1 已在 Skild AI 的商业合作伙伴中使用。

