据量子位报道,美国具身智能公司 Skild AI 展示了一款名为 Messinator 的人形机器人。该机器人在 NVIDIA Isaac Sim 搭建的虚拟足球场中通过自我对弈训练约140年,学会带球、护球、抢断和射门,并能将足球策略迁移到真实人形机器人。Skild AI 试图以此证明,机器人不必由人类逐项教会新动作,也可以通过自我对弈自主发现技能。
Messinator 的名字由梅西(Messi)和终结者(Terminator)组合而成,其大脑是 Skild AI 此前推出的旗舰机器人基础模型 S1。S1 的核心能力是让机器人像大模型一样进行上下文学习:给它看一段任务示范视频,它就能把视频当作提示词,理解任务意图,并把视频中的动作转换成适合自身身体的执行方式,遇到新任务不必重新训练。
Skild AI 认为,S1 主要从人类数据中学习,能力上限受人类经验限制,因此又在 S1 基础上加入强化学习和自我对弈。团队把机器人放进虚拟足球场,只设定一个最终目标:进球、拿高分。训练中没有为盘带设置单独奖励,也没有为护球、抢断、射门和倒地起身逐项打分。机器人面对的对手,只是自己此前保存的模型版本;赢下来的新策略又会成为下一轮更难对付的对手。
据 Skild AI 技术博客,机器人刚进入虚拟球场的前几个月连走路都不利索,但等它“长到大学生的年纪”,便自行学会摔倒后重新站起来。随着对手不断变强,盘带绕过防守、用身体护球、主动抢断等更复杂行为陆续出现。最终,Messinator 不仅能走到球前完成射门,还学会了带球、护球、抢断,并在真人对抗中调整自己的位置和动作。
这一方法与 AlphaGo 的自我对弈思路相似。当年 AlphaGo 通过与自己对弈,逐渐发现一些连顶尖棋手都没预料到的下法,并于2016年以4:1击败韩国棋手李世石九段。如今,Messinator 也通过自我对弈,把在虚拟世界中练成的足球策略迁移到真实人形机器人上。
Skild AI 成立于2023年,脱胎于卡内基梅隆大学机器人研究体系。2025年7月,该公司推出跨硬件运行的机器人基础模型 Skild Brain,主张“Any robot, any task, one brain”,目标是让不同形态的机器人使用同一颗大脑。约两个月后,Skild AI 又公开 omni-bodied 训练成果:团队在仿真世界中生成约10万种身体结构各异的机器人,让同一个模型累计训练约1000个仿真年;测试阶段,模型直接接管训练时从未见过的机器人,即使机器人断腿、关节锁死、轮子卡住或额外负重,也能在线调整重心和运动方式。Messinator 延续了这条路线:Skild Brain 负责控制身体、保持平衡和应对碰撞,自我对弈负责让它思考下一步怎么做才会更好。
公司团队包括来自卡内基梅隆大学、斯坦福大学、加州大学伯克利分校等高校的研究人才,以及曾任职于 Meta、Tesla、NVIDIA、Google、Amazon 和 Everyday Robotics 等机构的研究员及工程师。联合创始人兼 CEO Deepak Pathak 是卡内基梅隆大学机器人研究所和机器学习系教授,曾在 Meta AI Research 工作,其代表性研究包括“好奇心驱动的探索”。另一位联合创始人兼总裁 Abhinav Gupta 是马里兰大学计算机博士,现任卡内基梅隆大学机器人研究所教授,曾参与建立 Facebook AI Research 匹兹堡实验室,长期研究大规模视觉学习和机器人操作。