据雷峰网报道,9月27日在美国匹兹堡举行的IROS 2026“Perception and Decision Making for Athletic Humanoid Robotics”Workshop上,中国动易科技(PHYBOT)刘晨澔介绍,团队让一台1.35米高的人形机器人与人类连续对拉40余拍,并能在仿真中通过自我博弈学习击球选择与落点。演讲题目为《人形羽毛球:把运动机器人从实验室带进球场》。

刘晨澔说,羽毛球飞行中承受极强空气阻力,速度迅速且非线性衰减,轨迹预测困难,频繁加速减速对下肢敏捷与挥拍时机要求高。与足球、篮球的一次性触球不同,球拍类运动要求机器人反复可靠击球,关节微小误差会在球拍处放大,加上高球速,形成狭窄击球窗口。选择羽毛球还因中国有庞大爱好者群体,该课题有望把机器人带入现实人类环境。

据雷峰网报道,2025年11月,刘晨澔作为第一作者发表论文,用三阶段课程训练统一全身控制器,不依赖动作先验和专家演示,真机出球速度最高达每秒19.1米。此后团队引入人类参考动作和多个判别器学习上旋、下旋正反手等风格,并训练学习型技能选择器为来球挑选最优技能;高层用GRU策略决定击球技巧和落点,借鉴联赛式零和多智能体强化学习在模拟中制造更强对手;同一框架约一周迁移到乒乓球和足球,还带到商场快闪场馆与真人互动。

团队目前使用三个判别器,分别对应上手、下手正手和下手反手。为实现精准回球,他们在策略观测中加入目标区域独热编码,并训练技能选择器,即已学习的状态—动作价值函数,对每个来球轨迹评估所有可用技能的任务效用,任务效用定义为击中奖励与回球落点奖励的乘积,系统执行任务效用最高的技能。模拟对比显示,没有技能选择器会导致回合过早结束,配备后则能继续对峙。刘晨澔称,机器人单回合可连续对拉40拍以上,机器人只有1.35米高,但能覆盖4.4×4.4米场地。他称无法把机器人运到美国,现场不能演示。

下一步是让机器人具备竞争力,能做出战略决策、适应不同对手并最终获胜。团队将该高层级问题表述为零和多智能体强化学习问题。主智能体持续针对历史对手训练,优先采样虚拟自博弈把重点放在当前策略难以战胜的对手上。高层策略观察机器人、击球、对手状态及之前决策,用GRU输出击球技巧和回球落点,再交给固定低层全身控制器执行。为避免有限对手造成的循环支配,团队采用联盟训练:主智能体提升整体表现,主力陪练寻找主智能体弱点,联盟陪练引入更多样化策略。刘晨澔说,结果仍限于模拟,下一步在真机验证。

回顾领域工作,刘晨澔看到分层与人类先验两个趋势,例如AdaPT让规划器生成风格化动作、跟踪器负责执行,HITTER、LATENT也采用高层决策低层执行。他认为多数工作解决接球问题,关于打赢对手的策略层公开成果还不多。实际部署还要求导航、捡球、跌倒恢复和长期稳定运行。