据雷峰网报道,上海交通大学长聘教轨助理教授穆尧2026年创办SeeAct AI观行智能,并判断具身智能终局一定会迈向奖励驱动的自我进化。他主导的RoboTwin已成为中国具身智能圈事实标准之一,GitHub收获超过2900颗星,蚂蚁集团LingBot-VA、生数科技Motubrain在该基准上刷新成绩。穆尧入选国家级青年人才计划,谷歌学术引用超过5000次。
穆尧对奖励驱动的关注始于2017年。他系统学习强化学习课程和Sutton的《Reinforcement Learning》,看到Alpha Go通过奖励驱动、自我规划、自我推演产生超越人类智能。2018年在清华读硕士时,他坚持端到端Policy和奖励驱动,希望由神经网络承载策略。当时自动驾驶行业仍将感知、决策、规划、控制分开,他后来做Mixed Reinforcement Learning,试图搭建Model-based RL与Model-free RL之间的桥。2021年,他进入香港大学MMLab,成为罗平教授和汤晓鸥教授共同指导的学生,转向具身智能。
穆尧回忆,2021年具身智能几乎没有成熟数据集和标准Benchmark。2023年大模型、ChatGPT出现后,机器人处理复杂长程任务的能力上限被推高。他先后参与EmbodiedGPT、RoboCodex,通过上层大模型做任务拆解、生成底层代码并调用接口。此后团队推出RoboTwin 1.0,覆盖场景、任务、数据生成和对早期Policy Model的Benchmark;2.0将任务扩展至约50个,升级行为生成和代码生成,核心定位是Benchmark和数据生成器;3.0与摩尔线程合作,支持国产显卡和国产物理引擎。代码生成线完善后,他认为最底层API可扩展性成为瓶颈,于是推进具身基础模型,研究形成端到端策略基础模型和以代码生成为主的Agent System。端到端模型可作为Skill嵌入Agent System,上层负责复杂任务推理和拆解,底层作为可扩展、泛化较好的Skill被调用。团队后来做完整Agent System,包括与智元合作发布RoboClaw。
穆尧将具身智能scaling分为三层:Scale up Data、Scale up Model和Scale up Experience。他认为前两层竞争已白热化,第三层经验规模化是所有人做得都不够好的部分。Data Scaling关注训练数据规模,Model Scaling关注模型规模,Experience Scaling强调机器人能否在与环境交互中持续产生对自己有用的新经验。他以人进电子厂从认识仪器到成为熟练工为例,说明工作经验对能力提升的作用。机器人自己执行时遇到什么问题、采取不同动作有什么结果、失败后如何调整,需要它自己去经历。Experience Scaling解决经验从哪里来,自我进化解决这些经验如何转化成能力。机器人需要先产生足够丰富、有价值的交互经验,但经历多并不意味着能力一定提高,中间还需要评价和学习。奖励驱动通过任务结果和环境反馈判断哪些尝试更有效,再据此改进策略。改进可以发生在底层操作,也可以通过训练更新策略模型,还可以发生在上层任务规划和决策。穆尧进一步提出递归自我进化,即一轮提升后可Rollout出更多经验,且这些经验比上一轮更好。强化学习是自我进化工具之一,但不是唯一;一些经验总结可以文档形式存储,相当于智能体层面的进化。他希望自进化系统覆盖预训练到后训练完整流程:预训练阶段给策略基座嵌入自主纠错基因,汇聚不同机器人、场景、任务的自主纠错经验;后训练阶段面向用户目标场景,通过交互和反馈快速达到用户满意标准。
他以拧瓶盖为例说明自主纠错。专家数据通常展示抓住瓶盖后顺利旋开,但机器人执行时可能抓的位置偏了,也可能打滑。它需要根据实际反馈判断下一步是重新抓、调整力度,还是换一种方法。这些交互可以记录成数据,用于训练模型,因此经验和数据并非截然分开。穆尧强调,需要建立能够持续产生经验的机制,让机器人遇到不会的问题时自主探索,把尝试过程和结果积累下来供后续学习复用。