据雷峰网报道,9月1日,李飞飞、吴佳俊团队在arXiv发表论文《TrAct》,提出用视觉轨迹统一机器人动作与世界模型;同一天,慕尼黑工业大学教授黎子玥在IJCAI 2026上表示,可解释性和数据质量是AI交通落地的关键。
论文《TrAct》针对机器人控制器与视觉世界模型“语言不通”的问题,引入了视觉轨迹作为中间表示。视觉轨迹是任务相关关键点在图像坐标系中的运动路径,不依赖具体机器人型号,可视为跨本体的“普通话”。框架由三部分组成:VLAT同时输出动作和轨迹,TWM基于轨迹生成预演视频,VLAC为预演结果打分。推理时,系统先采样多个候选动作-轨迹对,经世界模型预演后选择得分最高的执行。
在自建的LIBERO-INTEGRAL基准上,TrAct的平均成功率为55%,显著高于基线π0.5的27%。在跨本体任务中,π0.5在处理UR5机器人时部分场景成功率仅为0%,TrAct最高可提升至50%。由于轨迹不依赖动作标签,该框架还可以使用约15万条人类第一视角操作视频参与预训练,缓解了机器人数据稀缺的问题。
同一天,慕尼黑工业大学教授黎子玥在IJCAI 2026早期职业焦点演讲中,分享了关于AI交通系统落地难的思考。他引用麦肯锡2023年调研称,全球交通和工业领域从业者认为距离真正智能化还需10到20年。黎子玥认为,学术研究长期停留在“干净数据”的舒适区,而公共部门面对的往往是缺失、杂乱的真实数据;同时,可解释性不是论文的加分项,而是从实验室走向城市的“生死线”。
他提出了“PDE三角”框架,即感知、决策、解释性三者需要均衡发展。他用强化学习信号灯控制作为案例,指出尽管该方向研究众多,但全球尚无城市长期部署此类系统,原因包括模型跨城市迁移困难、大规模路口协作复杂、以及工程师无法信任缺乏解释的控制策略。黎子玥还勾勒了一条从描述性分析到规范性分析的技术路径,强调学术社区与公共部门之间需要有效的转化机制。