据量子位报道,光象科技联合清华大学李升波教授课题组于9月5日发布第一代物理原生世界模型Phi-WM 1.0 ActEffect。该模型仅在训练阶段陪伴机器人,通过预测动作后果来优化策略;训练完成后,它从部署链路退出,机器人执行任务时不再依赖世界模型,任务成功率反而得到提高。
在公开的基准测试中,ActEffect在LIBERO上取得98.8%的平均成功率,在加入七类分布偏移的LIBERO-PLUS上达到80.3%,在面对29维动作空间的RoboCasa-GR1上平均成功率为67.5%。其中,RoboCasa-GR1的成绩比对比方法中第二名高出9.2个百分点。
这一做法与传统世界模型不同。过去,世界模型像机器人随身携带的“脑内沙盘”,机器人先借助它展开推理、预测未来,再决定下一步动作,由此带来额外计算和时延。ActEffect把世界模型留在训练场,让策略同时产出三版动作方案:前馈分支的“第一反应”、动作头的粗提案以及精修后的执行动作。受控世界模型读取当前视觉状态和动作方案,预测三套方案分别造成的场景变化,并在视觉特征空间中将预测与真实未来比较。训练过程中,模型要求精修提案比粗提案更接近真实结果,粗提案又比初始提案更接近,通过排序损失将“后果判断”写进策略权重。为避免模型走捷径,该损失还设置了梯度截断。语言指令仍由策略一侧处理,世界模型只关注画面和动作引起的物理状态变化。
训练完成后,受控世界模型与未来观测分支一起退出,仅保留动作头完成粗提案与精修,使执行阶段保持轻量。在工业场景中,机器人每多运行一层模型,都意味着新的时延、算力与成本;ActEffect相当于把“多想一会儿”留在训练阶段,把更短的推理链路留给执行。消融实验显示,去掉后果反馈后,LIBERO平均成功率从98.8%降至97.0%;换用VLM表示视觉特征后为97.3%;移除排序损失后为98.1%。
光象科技成立于2025年4月,由清华大学车辆与运载学院和人工智能学院联合孵化,创始人张涛曾任阿里巴巴高德地图技术总监,联合创始人李升波长期从事自动驾驶与具身智能研究。该公司正进入汽车制造场景,已围绕焊接上下料、移动质检等工位完成真实场景验证,并与多家国内外头部车企展开商业合作。在2026年ATC展会上,其机器人Phi-Bot X1在蔚来汽车焊接上下料场景连续运行3天,累计作业21.5小时,期间零失误、零中断。
这项研究的后续挑战在于真机验证与批量复制。从仿真基准到汽车产线,还需要经过节拍、精度、安全性、故障率等验收指标;同一套能力能否迁移到新车型和新工位,将决定其商业化进度。