据量子位9月2日报道,星尘智能当日宣布,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入,负责机器人强化学习方向的技术研发与应用探索。孙鹏的加盟旨在强化星尘智能在机器人强化学习环节的能力,与AI模型、具身OS和绳驱机器人本体形成协同,推动Physical AI全栈技术体系的完善。

具身智能领域,机器人基础模型过去两年主要解决“会不会”的问题。随着机器人从演示走向真实部署和商业化,问题正转向“能不能稳定做好”。如何让机器人根据真实执行结果持续修正策略,使强化学习重新成为行业关注的中心。孙鹏长期深耕强化学习、智能体及多智能体强化学习,拥有横跨机器人强化学习、大规模分布式强化学习系统与大模型强化学习的研究和产业实践经历。

孙鹏博士毕业于清华大学,此后在康奈尔大学和罗格斯大学从事博士后研究。在腾讯AI Lab及Robotics X机器人实验室期间,他曾担任智能体中心负责人,利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随,并研发《星际争霸》AI智能体TStarBots、TStarBotX。加入字节跳动后,他主导开发核心强化学习基础设施ByteRL,支持多款自研游戏AI的高效训练,团队曾夺得IEEE CoG 2023策略卡牌AI竞赛冠军。随着大语言模型兴起,孙鹏又参与研发强化微调方法ReFT和数学推理智能体DeltaProver,并在Seed团队深度参与模型RLHF与预训练。

星尘智能自成立之初便坚持Design for AI,主张机器人身体、数据与AI模型不应被割裂设计。该公司已形成覆盖基座模型、前端Agent和强化学习后训练的完整闭环,基座模型Lumo系列用于环境与动作的理解、预测和生成,Lumo-2率先引入Latent World Dynamics,在隐空间预测未来世界再生成动作;前端Agent Philia面向长期记忆、任务管理和多机器人协同。孙鹏加入后将继续扩充机器人强化学习团队,推动相关技术能力提升和应用部署,参与星尘具身模型、机器人强化学习及后训练体系建设,探索大模型时代已验证的强化学习后训练方法与真实机器人执行、数据闭环和长期部署的结合。

对于此次加入,孙鹏表示,过去十多年他一直在做强化学习和智能体,亲历了强化学习从机器人控制、复杂博弈走向大模型后训练的过程,现在希望把这些积累带回物理世界。星尘智能已具备从机器人本体、具身OS到AI模型的完整技术基础,他最期待的是和团队一起把强化学习进一步融入真实机器人的训练与部署,让机器人不只是“学会一个任务”,而是能在一次次真实执行和反馈中把任务越做越好。