据量子位9月12日报道,生数科技发布世界模型Motus2,将动作生成、后果预测和价值评估整合在同一模型中,形成“生成动作—预测后果—评估结果—更新策略”的闭环,用于机器人持续改进策略。该模型已部署在单手22自由度的Sharpa Wave、单手20自由度的WUJI Hand 2等平台。

Motus2是Motus升级版。今年2月前代Motus发布时,世界动作模型概念尚不成熟,Motus在50项通用任务测试中较Pi-0.5绝对成功率高出35%以上。Motus2拓展视觉、语言、动作与触觉模态,同时具备行动、预测、评估能力:WAM生成动作,AC-WM预测后果,VM评估结果。三者形成闭环,预测和评估结果成为改进策略的反馈,被团队视为对递归自我改进的初步探索。这里的自进化指利用模型自身预测和价值反馈持续改进策略,不意味着机器人能在开放环境无限自主学习。

为避免模型提前“偷看”动作执行后的结果,Motus2在中间训练阶段采用Action-first信息流,先根据当前观测生成动作,再预测后果,最后评估。推理阶段用Best-of-N规划,提出多个候选动作,分别预测执行后画面并由价值模型打分,选择最高分动作执行,执行一小段后重新观察真实世界。训练阶段把打分转化为策略更新信号,分数高者得到更强正向引导,低者逐渐被放弃,团队称之为基于模型的强化学习,且只更新动作相关参数,预测和评估部分保持不动。

真机数据验证了闭环效果。手机放置和多指操作两项真机任务中,基础策略平均成功率65%;单独加入规划提升至67.5%;单独加入基于模型的强化学习达到72.5%;两者结合达到75%,比基础策略高10个百分点。失败轨迹在闭环中用于学习动作后果与结果评价,帮助模型识别哪些动作未能推进任务。材料提到,Physical Intelligence的RECAP会让机器人先跟人学再自己练习,做错时由人接管纠正;Motus2则利用世界模型先预测后果、打分比较,再用反馈改进策略。

触觉是Motus2新增能力。灵巧操作中,视觉难以完整判断接触状态。Motus2加入轻量级触觉专家模块,在短动作片段执行前读取最新触觉反馈,细化动作,并复用主模型中间结果,避免重跑完整视频骨干。在抽取纸杯、撕纸两项真机任务中,加入触觉后平均成功率从60%提升至72.5%。记忆方面,Motus2默认缓存近期真实观测。在寻找隐藏方块、根据历史提示操作按钮两项测试中,保留完整历史信息的方案平均成功率57.5%,明显高于压缩历史信息方案。材料称,这组实验不能说明记忆压缩行不通。

Motus2将人类第一视角操作经验作为主要数据来源,再迁移到机器人。其Ego数据体系规模约13万小时人类第一视角数据,配上百小时级机器人及人机对齐数据,训练分三步:单目Ego视频预训练;引入双目视频和人类动作数据;进行机器人领域适配训练。对照实验中,同样目标任务微调下,只经人类Ego数据预训练的模型五项真机任务平均成功率51%,加入机器人领域中间训练后升至84%,提升33个百分点。双目数据从2000小时增至20000小时,人类动作预测验证误差持续下降。

按照生数科技对通用世界模型的分级,L1为生成世界,L2为与世界交互,L3为在世界中行动,L4为自主世界智能体,L5为世界组织者。Motus2已具备L3核心能力:理解当前状态、预测动作后果并输出真实机器人动作;通过预测后果和价值评估产生策略更新信号,开始触碰L4自主决策、自主反馈、持续自我改进的部分。但触觉数据跨机器人本体迁移、更长任务中的预测可靠性、长期记忆效率以及开放世界持续学习仍需探索。