据雷峰网报道,9月16日,由清华大学团队联合多所海内外高校推出的WorldArena 2.0 Challenge公布全球终榜,视启未来WorldIncept、北京中关村学院MW2和小米机器人ViTacX分列视频质量、在线强化学习环境和真实机器人操作三条赛道第一。赛事在IROS 2026设置真机闭环竞技场,三条赛道独立排名、独立评奖。
WorldArena 1.0以15项指标评测视频质量,并考察数据生成、策略评估和动作规划等具身任务;对14个代表性模型的测试显示,视频质量与具身任务表现并不总能对应。1.0模态限于视觉,功能以离线任务为主,平台主要停留在仿真环境。2.0沿模态、功能、平台升级,从纯视觉扩展到视触觉,从离线评测扩展到在线强化学习,从仿真环境延伸到真实机器人。
Challenge设置三条赛道。Track 1评测视频质量,70个任务中50个为白色桌面ID clean场景,20个为彩色或带纹理桌面OOD场景,成绩由15项指标共同决定,并纳入JEPA表征相似度。Track 2把世界模型作为强化学习环境,策略在连续交互中更新,训练后回到RoboTwin 2.0测试Adjust Bottle任务成功率。Track 3进入真机,Track 3.1评测视触觉操作,包括夹薯片、削黄瓜和插两孔插头;Track 3.2评测纯视觉操作,覆盖擦桌、倒水、清理桌面、叠衣服和叠纸盒等任务。
Track 1终榜共81个模型获成绩。视启未来WorldIncept以72.33分第一,同济大学空间智能团队BWM-Turbo以71.49分第二,相差0.84分。WorldIncept在物理遵循性、3D准确性排名第一,语义对齐得分90.11。视启未来由IDEA研究院孵化,已推出DINO-X系列视觉模型和DINO-XGrasp万物抓取模型。BWM-Turbo在背景一致性和JEPA表征相似度排名第一,方案在DiT架构基础上加入首帧引导、动态记忆和动作控制。
Track 2终榜中,北京中关村学院MW2以72.93分第一,晨昏线科技TTWM以72.40分第二,相差0.53分,也是47个参评模型中仅有的两个超过72分的方案。TTWM是晨昏线目标因果世界模型GCWM的参赛版本,重点建模动作会怎样改变未来状态,并针对目标区域、空间几何和跨时间一致性优化,通过帧级噪声、冷启动随机化降低误差累积。Baseline VLA π0.5成功率55.46%;以GCWM作为强化学习环境优化后,VLA模型成功率提升至72.40%。
Track 3综合总榜中,小米机器人MiRobot团队ViTacX以76.64分第一,上海科技大学OmniFlow以67.37分第二。ViTacX优势来自纯视觉子榜,在Track 3.2以85.00分第一,擦桌、倒水、叠衣服和折纸箱4项取得单项最高分,前三项均为100分;Track 3.1视触觉子榜中,ViTacX以66.67分第三,OmniFlow在两个子榜中均列第二。小米机器人长期关注具身基础模型和真机执行,上海科技大学团队研究覆盖触觉感知、遥操作、模仿学习和强化学习等方向。