据爱范儿报道,在世界人形机器人运动会落幕之际,自变量机器人公司发布了自回归世界模型WALL-SS,为机器人构建了一座“虚拟训练场”。该模型可推演持续60秒的倒水、物品整理等任务,预测不同动作导致的不同结果。研究团队将多套机器人策略分别放入WALL-SS和真实世界测试,虚拟世界中执行效果较好的动作策略,搬到物理世界后往往也有较好的表现。
真实世界没有固定的跑道和统一摆放的道具,杯子被挪动一点、桌面多出一块抹布,都可能让原本训练好的动作失效。世界模型被认为是具身智能的重要方向,它像机器人脑中的预演系统,根据当前画面和动作预测未来。但许多世界模型存在类似“磁铁式抓取”的偏差:夹爪与物体还有明显空隙时,生成画面中的物体也会主动贴进夹爪。推演时间一长,误差还会不断累积,导致物体位置漂移。
WALL-SS采用“下一尺度自回归”方式生成预测。模型先搭建低清预览,确定运动大方向,再逐层调清,补上物体轮廓、夹爪开合和接触位置。动作与画面放在同一条时间线上,哪只夹爪何时移动到哪里,多个相机应该看到什么变化,都需要相互对应。固定初始画面只改变动作轨迹时,模型会生成不同未来,而非总是生成同一个成功结局。在衡量动作变化敏感度的评测中,WALL-SS得分0.290,对比模型Cosmos3为0.044,其他模型为0分。在衡量生成轨迹是否贴合给定路线的“轨迹精度”上,WALL-SS得分0.539,为全部对比模型最高。
长时任务中,WALL-SS采用“尺度压缩的长时间跨度记忆”,最近发生的事情保留更多细节,更早的历史被压缩成摘要,最初观察画面作为场景锚点。训练时,研究团队加入“逐尺度梦境强迫”,向历史信息添加扰动,要求模型基于有误差的信息预测正确未来,让机器人学会纠正小误差。在60秒推演测试中,WALL-SS的轨迹误差、片段衔接、物体状态和视觉质量均比对照模型稳定。倒水任务中,机械臂逐帧轨迹误差保持在画面对角线的0.5%以下。
WALL-SS还引入“视觉动力学的在线策略对齐”,安排两个裁判分别检查动作跟随和长期一致性,模型根据评分调整生成不同未来的概率。对齐后,动作跟随从0.264提升至0.290,轨迹精度从0.512提升至0.539,跨片段边界误差从0.118降至0.104。
研究团队选取5个不同训练阶段的WALL-WM策略,在6项任务、20组匹配初始状态下,分别放入WALL-SS和真实机器人执行,共得到600对闭环结果。其中527对最终成败一致,虚拟世界选出的较好版本有89%的优劣关系与真机测试相同。将30个“任务与策略版本”组合的成功率比较,虚拟结果和真机结果的相关系数为0.926,平均绝对误差为0.062。该相关系数衡量整体变化趋势,不代表单次预测有92.6%的命中率。
WALL-SS还加入了动作专家,外部动作给定时,视觉生成器预测动作后果;需要自主行动时,动作专家根据当前状态生成控制指令。在桌面双臂任务中,WALL-SS的平均任务进度得分为69.1,对比π 0.5为49.6,DreamZero为44.1,LingBot-VA为34.0。
世界模型可提前发现更可能失败的动作路径,减少较差策略直接上真机的次数,但末端执行器能否稳定落位,仍依赖关节精度、灵巧手、触觉和力控等软硬件配合。