据量子位报道,北美具身智能初创公司Skild AI于8月26日发布机器人基础模型S1。该模型主打上下文学习,无需针对新任务进行后训练,只需观看一段人类示范视频,即可完成整套从未见过的复杂操作流程,任务长度可达10分钟以上。
在官方演示中,S1完成了煎饼制作、冲泡咖啡、给植物换盆和设备组装等长程任务。在未见过的任务上,S1的成功率达到66%,而基于语言提示的VLA模型仅有9%。Skild AI在技术博客中对比称,传统VLA模型需要约380次任务演示的后训练,才能追平S1仅看一次演示的效果。
Skild AI认为,机器人学习目前仍处于类似大模型BERT时代的阶段,每次学习新任务都需要大量真机数据和重新训练。该公司希望推动机器人向GPT时代转变,使预训练模型获得从上下文直接学习的能力。S1在演示过程中模型权重完全不变,使用同一套权重完成所有任务,其输入Prompt不再是语言,而是能够更好对齐下游任务的动作视频。
在实验部分,Skild AI对比了ICL视频Prompt与传统语言Prompt VLA。当训练数据为1000小时时,语言Prompt效果更好;随着数据规模增加,ICL开始反超。在10万小时训练数据下,面对见过的任务,ICL成功率为96%,语言Prompt为89%;面对关键的OOD(分布外)任务,ICL成功率为66%,语言Prompt仅9%。在不同实验条件下,语言Prompt VLA的性能下降幅度最高达到ICL的3倍。Skild AI认为,ICL学到的不是固定场景内的动作复读,而是能根据环境重新规划操作。
Skild AI成立于2023年,创始人为卡内基梅隆大学机器人研究所教授Deepak Pathak和Abhinav Gupta。两人曾在2022年合作WHIRL项目,让机器人通过观看人类视频进行一次模仿学习。Skild AI于2024年获得3亿美元A轮融资,估值15亿美元;今年1月完成14亿美元C轮融资,估值超过140亿美元,软银领投,英伟达、贝索斯参投。Skild AI强调自己的定位是“Any robot, any task, one brain”,希望同一个模型可以运行在机械臂、四足、人形等不同机器人上,目标是成为机器人时代的安卓系统。
在数据策略上,Skild AI同时采用真机遥操作、UMI、第一视角人类视频和仿真数据。该公司此前于2025年9月发布LocoFormer,2026年2月实现首次域内上下文学习,5月完成首次煎饼任务,8月发布S1,将上下文学习能力扩展到最长10分钟的OOD长程任务。