据雷峰网报道,纽娲机器人联合上海交通大学、山东大学研究人员近日发布Video2DoorTraversal框架。该框架用一段普通RGB视频即可让轮足移动操作机器人完成从接近、开门到穿越真实门的连续任务,在五扇真实推门上平均成功率达96.57%。
论文预印本已公开,由上海交通大学博士生唐心诚担任第一作者,纽娲机器人创始人、上海交通大学特聘教授杨睿刚担任通讯作者。研究针对每扇目标门分别采集一段RGB视频,在指定轮足平台上每扇测试35次,共175次,成功169次,平均成功率96.57%。在三扇结构相似、训练阶段未见过的门上,策略无需增加目标门训练或轨迹生成,零样本平均成功率为80.95%。从接近门到完成开门和穿越,平均用时约13秒,视觉处理和策略推理均在机器人本地完成。
真实建筑中的门并不统一,门板尺寸、铰链方向、把手形态、安装位置和开启阻力都会变化。现有方案往往依赖预构建门资产、额外扫描、人工任务设计或真机适配。Video2DoorTraversal试图减少其中一部分前置工作。系统首先从单段RGB视频中恢复带真实尺度的几何信息和相机运动,识别门板、把手及铰链关系,生成包含关节、碰撞几何和外观纹理的数字资产DoorTwin。随后从参考视角检查轮廓、比例、把手类型、铰链方向和部件位置,并持续修正,使数字门既在视觉上接近真实对象,也能在物理上被抓住、转动和推开。
生成DoorTwin后,论文中的仿真闭环代理将任务组织为接近、抓取、转动把手、推门和穿越等参数化技能,并在模拟器中反复执行。轨迹失败后,系统根据碰撞、接触、把手旋转和门体开启状态分析原因,在邻近参数继续搜索,只有通过任务、碰撞和运动学验证的成功轨迹才保留为训练数据。为提高从仿真到现实的适应能力,训练还随机改变机器人与门的初始位姿、铰链和把手的摩擦与阻尼、开门阻力和相机外参,并加入多种深度噪声,只保留在扰动下仍成功的轨迹。
真机执行时,ArticuACT模型使用机器人前视和腕部的双视角深度图,以及机器人状态,协同输出底盘、机械臂和夹爪命令。模型训练时还会预测接触、把手转动和门体开启进度,以学习任务不同阶段的交互特征。
96.57%对应论文设置下五扇真实推门的平均真机结果,表明该框架在论文限定的对象、轮足平台和测试设置下完成了端到端真机验证,但不代表通用开门产品或纽娲公司级工程闭环已经得到验证。80.95%对应结构相似未见门上的零样本测试,给出跨门迁移的初步证据。目前验证对象仍是结构相似的推门,拉门、更多把手机制和更丰富的门体结构被论文列为后续方向。对产业部署而言,该项技术的有价值指标还包括新场景适配周期、现场试错次数、人工介入成本,以及仿真资产和训练数据能否在更多设施、场景和本体之间复用。
纽娲将具身智能定义为机器人在开放人类环境中的持续通行与任务完成,并通俗解释为具身智能与自动驾驶的交集。其世界通行模型WTM旨在把空间理解、任务判断、导航和具身操作组织在同一智能底座中。公开架构中,WorldWeaver定位为真实场景数据与三维资产的组织层,SimWeaver提供物理仿真能力,支持WTM训练与评测。Video2DoorTraversal使用DoorTwin和论文所述的仿真训练管线,与上述模块共同指向“让真实场景进入数字环境,机器人在仿真中积累经验,再回到真实任务”的技术路径。门只是常见通行设施,该研究的后续价值将取决于类似方法能否覆盖更多设施与任务,并降低新场景适配和验证成本。