据量子位9月14日报道,生数科技最新发布世界模型Motus2,试图让机器人评价动作结果并从反馈中继续学习。其前代Motus今年2月发布,在50项通用任务测试中较Pi-0.5绝对成功率高出35%以上。
Motus2把行动、预测、评估放进同一个模型:WAM生成动作,AC-WM预测后果,VM评估结果,形成“生成动作—预测后果—评估结果—更新策略”的闭环。团队称这是对递归自我改进(RSI)的初步探索,但自进化指利用模型自身预测和价值反馈持续改进策略,不意味着机器人已能在开放环境中无限自主学习。
为避免模型提前“偷看”动作执行后的结果,Motus2在中间训练阶段采用Action-first信息流,先根据当前观测生成动作,再预测结果,最后评估。推理阶段用Best-of-N规划,生成多个候选动作并分别预测执行后的画面,由价值模型打分,挑选最高分动作执行;执行一小段后重新观察,再进入下一轮。训练阶段把候选动作打分转化为策略更新信号,只更新动作相关参数,预测和评估部分保持不动。
真机数据验证了闭环效果。在手机放置和多指操作两项任务中,基础策略平均成功率为65%;单独加入规划提升至67.5%;单独加入基于模型的强化学习达到72.5%;两者结合达到75%,比基础策略高10个百分点。
Motus2还增加触觉和记忆。触觉方面,模型加入轻量级触觉专家模块,在短动作片段执行前读取最新触觉反馈,并复用主模型中间结果。抽取纸杯和撕纸两项真机任务中,加入触觉后平均成功率从60%提升至72.5%。记忆方面,Motus2默认缓存近期真实观测。在寻找隐藏方块、根据历史提示操作按钮测试中,保留完整历史信息的方案平均成功率为57.5%,高于压缩历史信息方案。团队认为,保存完整观测更像找到最终答案前的阶段性妥协。
Motus2已部署在单手22自由度的Sharpa Wave、单手20自由度的WUJI Hand 2等平台,展示拧灯泡、翻书、多指操作等任务。数据路径上,它把人类第一视角Ego数据作为主要来源,再迁移到机器人。训练分三步:单目Ego视频预训练,引入双目视频和人类动作数据,再到机器人领域适配。整套体系约13万小时人类第一视角数据,配百小时级机器人及人机对齐数据。对照实验显示,只经过人类Ego数据预训练的模型五项真机任务平均成功率为51%,加入机器人领域中间训练后升至84%,提升33个百分点。双目数据从2000小时增至20000小时,人类动作预测验证误差持续下降。
生数科技把通用世界模型演进路线分为L1至L5。按这套分级,Motus2已具备L3“在世界中行动”的核心能力,并开始触碰L4“自主世界智能体”。但触觉数据跨机器人本体迁移、更长任务中的预测可靠性、长期记忆效率以及开放世界持续学习仍需探索。