据量子位报道,任少卿以通讯作者身份参与的新论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》近日公开。论文第一机构为蔚来,提出多模式世界—动作联合模型,让自动驾驶一次规划中同时生成多组场景—动作假设,再选择最安全路径。
公开学术记录中,任少卿的代表性研究集中在2014—2016年,包括Faster R-CNN、ResNet等,此次是他时隔十年再次以通讯作者身份出现在论文中。论文团队主要来自蔚来智能驾驶基础模型预研团队,第一作者Shuai Liu署名蔚来和中山大学,任少卿同时署名蔚来和中国科学技术大学AGI研究院。
论文要解决的问题是,同一驾驶场景下,系统需要处理的不仅是一条轨迹或一个确定未来。现有World–Action Model大致分两类:级联式先生成候选轨迹再预测未来场景,信息单向传递,后生成变量无法修正前面决策;联合式让场景和动作相互影响,但通常只生成一组结果。MM-Future一次生成多组配对场景—动作假设,每一组内部的场景和动作共同演化,再从中筛选。
论文将难点拆为多样性、计算成本和筛选。多样性上,模型在动作端建立Gaussian Mixture Noise、场景端使用独立噪声,并加入Best-of-Many监督。计算成本上,作者提出MM-Tokens,将多摄像头、多时间帧视觉特征压缩为面向规划的紧凑表示,不重建RGB图像,也无需恢复完整BEV。筛选上,Future-Conditioned Proposal Scorer同时读取历史信息和该轨迹专属的预测未来,候选之间不共享未来场景结果。
在NAVSIM-v1 navtest上,使用trainval数据训练的MM-Future获得94.0 PDMS,高于DriveFuture的90.7和DrivoR trainval的93.7;NAVSIM-v2上获得91.5 EPDMS,高于UniTeD的90.1和DriveFuture的89.9。消融实验显示,仅生成动作且单模式时PDMS为84.1,动作候选增至32种后为92.3;加入联合生成后单模式85.1、32模式92.9;评分器读取配对预测未来后升至93.3。多模式训练收敛更快,16/32模式达到0.80验证PDM分数约需3.8k steps,单模式需17.5k steps。
但多组未来假设带来额外计算成本。论文主模型一次采样64组场景—动作候选,在单张NVIDIA H800、batch size为1、bf16条件下,端到端前向延迟约233ms;16种候选延迟与单模式接近,32种后延迟明显提高。闭环测试中,MM-Future未针对HUGSIM微调,在436个场景上取得32.3平均HD-Score,高于Latent-WAM的28.9和UniAD的28.6,但平均Route Completion为44.5,低于Latent-WAM的45.9;Extreme难度下HD-Score为8.6,Latent-WAM为18.1。论文还指出MM-Tokens属于隐式场景表征,保留哪些规划信息仍难直接观察,作者计划增加辅助感知模块。
蔚来此前在2024年发布NIO WorldModel和NADArch 2.0,2025年加入全闭环强化学习,2026年初最新版NWM开始大规模推送。蔚来披露,截至今年9月,该智驾系统已部署到超过95万辆车。论文地址:https://arxiv.org/pdf/2609.20377。