据量子位报道,亮源新创在过去一个多月连续发布三项具身智能技术:LightParkour、LightNav-0和Light REACT,分别面向复杂接触技能、通用导航以及外力扰动、跌倒和硬件损伤条件下的全身韧性控制。该公司称,三项技术共同围绕Physical AI的规模化预训练、规模化对齐和规模化部署展开。
亮源新创将这一路径概括为三个阶段:规模化预训练通过大规模数据建立基础能力,规模化对齐通过强化学习等方式提升模型能力,规模化部署推动基础模型进入真实世界,并持续产生高质量真实世界数据,形成数据飞轮。三项技术方向不同,但被该公司视为同一学习闭环下的阶段性进展。
LightParkour从真实人类动作中恢复简短动作种子,再把动作和对应障碍物一起放入物理仿真。仿真重新建立动作、障碍物、接触力和机器人执行器约束之间的关系。机器人完成当前动作后,系统提高障碍物难度,并把成功轨迹作为下一轮训练参考。据量子位报道,从一段针对45厘米障碍物的初始动作出发,可逐步生成覆盖至75厘米障碍的参考轨迹,对应90厘米高的Lightbot 0约83%的身高。整个扩展过程中,只有最初的动作和障碍物需要人工对齐,之后的能力增长由物理仿真和课程学习完成。
LightParkour还使用多专家蒸馏,把行走和三项复杂接触技能整合到一个统一策略中,并对不同技能之间的切换进行训练。部署时,系统不需要外部提供技能标签,也没有人工编写的状态机负责切换。在Lightbot 0上,模型运行统一的循环深度视觉策略,只使用胸前深度相机、本体感知和速度指令,以50 Hz在机载计算平台运行,不需要运行时参考轨迹、外部运动捕捉或机外状态估计。
LightNav-0基于Real2Sim2Real数据引擎,将2,000+个互联网来源的真实场景转换为可复用仿真环境,形成4,000+小时视觉、语言和动作后训练经验。同一个场景可以产生不同目标、不同路线、不同视角和不同任务,摄像机几何也可以随训练变化,以避免模型只适应某一种固定机器人视角。据量子位报道,在当前实验范围内,LightNav-0发现扩大环境覆盖度比单纯增加相同环境里的轨迹数量更能稳定提升泛化能力。
导航方面,LightNav-0引入Point CoT。模型首先在图像空间预测目标点和可通行点,再生成后续动作token,推理过程从“视觉+语言直接生成动作”变为“视觉语言理解、空间推理、动作生成”。在公开的8项消融评测中,引入Point CoT后,平均任务成功率提高8.4个百分点,SPL提高5.7个百分点。随后,LightNav-0通过RVQ动作编码器,将连续机器人轨迹压缩为3个动作token,使视觉、语言、空间位置和机器人动作进入统一的模型训练框架。
据量子位报道,LightNav-0在10个仿真设置中覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型零样本迁移到人形、四足、轮式和飞行机器人等不同本体。官方同时发布了模型、代码和技术报告。
Light REACT则面向外力扰动、跌倒和硬件损伤条件下的全身韧性控制,研究机器人如何依据自身交互历史调整运动方式。据量子位报道,这类异常在单次实验中可能并不高频,但随着部署规模扩大,其绝对发生次数也会增加,对系统韧性、故障恢复能力和运维效率提出更高要求。规模化部署因此不只是增加部署数量,还需要提高机器人在真实环境中的持续运行和异常恢复能力。