< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

时隔十年,AI大牛署名新论文

让自动驾驶“走一步想十步”

杰西卡 发自 ROBO-人

量子位ROBO | 公众号 AI4ROBO

自动驾驶领域再出一篇原创研究论文。

这篇最新论文,让自动驾驶能“走一步想十步”,更像老司机了!

最近,任少卿指导发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出一种新的多模式世界—动作联合模型。

公开学术记录中,他的代表性研究主要集中在2014—2016年,包括Faster R-CNN、ResNet等一系列计算机视觉经典工作。

这一次,他重新以通讯作者身份出现在自动驾驶论文中。论文第一机构为NIO,多位作者来自蔚来,研究方向也直接指向世界模型和规划。

这篇论文要解决的核心问题很明确:同一个驾驶场景下,系统需要处理的不只是一条轨迹,也不只是一个确定的未来。

团队的思路是:让模型一次生成多组场景—动作假设,车辆轨迹与对应的未来场景共同演化,最后再从中选择。

简单来说,自动驾驶不仅能看清周围环境,还能预演多种可能的未来,最终选择最安全的路径执行。

从一条轨迹,扩展到多个未来

端到端自动驾驶的基本逻辑,是将传感器观测直接映射为自车轨迹或控制指令。

World–Action Model则进一步增加了未来场景建模,让规划不仅依据当前环境,也参考动作可能带来的后果。

现有的World–Action Model大致存在两类路线:

一类是级联式方案。例如先生成几条候选轨迹,再分别预测每条轨迹对应的未来场景;或者先预测未来场景,再基于场景完成规划。这种方式可以生成多个候选结果。

但这种方法的问题也很明确:信息按单向传递,后生成的变量无法回头修正前面的决策。

假如模型已经先确定自车向前通过路口,随后才预测到对向车辆没有减速,这个未来结果很难重新参与前面的动作生成过程。

另一类是联合式方案。场景和动作放在同一个生成过程中,两者可以相互影响。

车辆动作变化,预测环境随之调整;环境一旦变化,也会反过来影响车辆轨迹。现有这类方法通常只生成一组场景—动作结果。

论文指出了其中的空白:级联式模型可以覆盖多种驾驶结果,但场景和动作之间缺乏双向交互;联合模型具备双向交互能力,但通常只生成单组结果。

但真实道路往往需要同时处理这两件事。

MM-Future给出的方案是:一次生成多组场景—动作假设,每一组内部的场景和动作继续共同演化。

每一组结果叫做paired scene–action hypothesis(配对场景-动作假设)。

假设模型同时生成几十组候选,其中一组可能是自车加速、对向车辆让行,另一组是自车减速、对向车辆先行,还有其他不同程度的制动、通过方式以及场景变化。

这些结果不再只有轨迹差异,每条轨迹对应的未来环境也各不相同。由此,多种可能的未来进入规划过程。

同时推演几十个未来,需要面临的三道门槛

论文把多模式联合建模的难点拆成了三项:

*多样性从哪里产生,多组未来如何控制计算成本,以及生成多个候选后如何筛选。MM-Future的核心设计也是围绕这三个问题展开。

首先是多样性问题

真实驾驶数据有天然局限,一段录像只记录一种已经发生的结果。司机最终减速,数据中就不会同时留下同一时刻选择加速后的真实场景。模型需要在单结果监督下学出多种合理结果。

MM-Future在动作端根据训练轨迹分布建立了Gaussian Mixture Noise,从不同动作先验出发;场景端则使用独立噪声。

动作与场景的初始状态两两配对,构成了不同驾驶结果的独立起点。

训练时又加入Best-of-Many监督。模型一次生成多组候选,先找出与真实轨迹最接近的一组,再用同一个赢家索引监督动作流和场景流。

这样可以避免所有候选被同一条真值轨迹拉向相似结果,也能保持一条轨迹和它对应的未来场景始终配对。

其次是计算成本。多视角视频如果按每种候选完整展开,模式数量和预测时间一增加,计算量会迅速上升。

作者提出了MM-Tokens,将多摄像头、多时间帧的视觉特征压缩为面向规划的紧凑表示。

MM-Tokens不承担RGB图像重建,也不需要恢复完整BEV。有限的Token预算主要保留与未来演化和驾驶规划相关的信息。

从论文给出的注意力可视化来看,MM-Tokens关注的信息主要集中在道路结构、路口、前车以及周围交通参与者等区域

模型由此无需为几十种候选分别生成完整的高清未来视频,内部保留的是一组面向规划的紧凑未来场景表征。

第三项是场景与动作如何共同演化,以及多组候选如何筛选。MM-Future使用了modality-aware Transformer同时处理动作流和场景流。

共享注意力负责两类信息的交互,模态专属分支保留两类数据各自的统计特征。

每一组候选共享模型参数,但不同模式之间不交换Token。

因此,动作轨迹会随着配对场景的变化继续更新,场景预测也会根据自车动作重新调整。多轨迹规划由此引入了动作与环境的双向耦合。

生成结束后,Future-Conditioned Proposal Scorer负责完成最后筛选。

它评估一条候选轨迹时,同时读取历史信息和这条轨迹专属的预测未来,再给出分数。每个候选只能读取自己配对的未来,不能借用其他模式的场景结果。

论文还对轨迹和未来Token使用stop-gradient,避免生成器为了提高评分而改变输出分布。

最终推理过程可以压缩成四步:编码历史观测,生成多组场景—动作结果,使用历史与配对未来给候选评分,再输出得分最高的轨迹。

世界模型开始更深层进入规划

MM-Future最终带来了多大提升呢?

论文使用NAVSIMHUGSIM两套基准进行了测试:

在NAVSIM-v1 navtest上,使用trainval数据训练的MM-Future获得94.0 PDMS。同一张结果表中,WAM方案DriveFuture为90.7,E2E方案DrivoR trainval为93.7。

NAVSIM-v2上,MM-Future获得91.5 EPDMS,高于论文列出的UniTeD 90.1和DriveFuture 89.9。

更能说明方法效果的是消融实验

只生成动作、仅保留一种模式时,PDMS为84.1;把动作候选增加到32种后提升到92.3。

加入场景—动作联合生成后,单模式为85.1,32模式达到92.9。最后让评分器读取每条轨迹对应的预测未来,PDMS继续提升到93.3。

几组对照分别验证了三个环节:增加模式数量带来主要增益;场景和动作联合生成还能继续提升;配对未来参与候选评分后,规划指标再次改善。

评分器带来的提升在TTC指标上最明显,论文据此认为:候选专属未来主要帮助模型排除交互风险较高的轨迹。

多模式训练还表现出更快的收敛速度。16模式和32模式达到0.80验证PDM分数大约需要3.8k steps,单模式需要17.5k steps。

这个结果说明,多种假设不仅增加了推理分支,在论文设定下也改善了训练效率和最终指标。

不过,多组未来假设也带来了额外的计算成本。

论文主模型一次采样64组场景—动作候选,在单张NVIDIA H800、batch size为1、bf16条件下,端到端前向延迟约为233ms。

16种候选的延迟和单模式方案较为接近,增加到32种后延迟明显提高。候选覆盖范围和计算成本之间仍需要平衡。

闭环测试也存在类似的局限。

MM-Future没有针对HUGSIM继续微调,在436个场景上取得32.3平均HD-Score,高于论文列出的Latent-WAM 28.9和UniAD 28.6。

平均Route Completion为44.5,略低于Latent-WAM的45.9;Extreme难度下HD-Score为8.6,Latent-WAM达到18.1。

论文也主动指出了可解释性问题。MM-Tokens属于隐式场景表征,模型到底保留了哪些规划信息,目前仍难直接观察。

作者计划增加辅助感知模块,把与规划相关的场景结构进一步可视化,以提升模型透明度并辅助故障诊断。

因此,MM-Future目前展示出的价值,更适合放在方法层面理解:

自动驾驶世界模型的角色正在从未来预测进一步走向规划,模型不仅需要估计场景会怎样变化,还要比较不同动作对应的不同场景结果。

更关键的变化发生在多模式的定义上。以往多模式规划主要回答可以走哪几条轨迹,MM-Future把问题扩展到采取不同轨迹后,环境分别可能怎样变化。世界模型开始承担动作后果建模的一部分功能。

这条路线仍处于公开数据集和仿真验证阶段,计算开销、隐式表征、极端场景稳定性都需要继续验证。

论文当前能够支持的结论更明确:在自动驾驶规划中,同时覆盖多种可能结果,并让场景与动作保持双向交互,能够带来稳定的指标增益。

真实道路始终存在多种合理结果。随着世界模型继续进入规划环节,自动驾驶需要处理的对象,也正在从一条候选轨迹,扩展到一组动作与未来的联合结果。

团队介绍

MM-Future背后的研究团队,主要来自蔚来智能驾驶基础模型预研团队。

第一作者Shuai Liu同时署名NIO和中山大学计算机学院。他此前已经在端到端自动驾驶方向有过研究积累,2025年曾以第一作者发表GaussianFusion,尝试用紧凑的高斯表示完成多传感器融合,并被NeurIPS 2025接收。

论文另外几位作者中,Hechangle Gong同时署名NIO和北京航空航天大学,Hao Jiang、Runlin He、Junxiang Zhan、Sheng Yang均署名NIO,Kai Huang来自中山大学。

任少卿担任论文通讯作者,同时署名蔚来和中国科学技术大学AGI研究院。

对于任少卿,大家应该已经很熟悉了——

他是国内自动驾驶深度学习化最关键的那批推手之一,目前为中国科学技术大学讲席教授,中科大官网显示其担任通用人工智能研究所所长;也仍是蔚来智能驾驶业务负责人。

而MM-Future放在蔚来的技术演进里看,也有另一层意义。

2024年,蔚来发布NIO WorldModel和NADArch 2.0,将智能驾驶架构进一步转向世界模型驱动的端到端体系;2025年又加入全闭环强化学习,2026年初最新版NWM开始大规模推送。

蔚来最新披露,截至今年9月,这套基于世界模型和全闭环强化学习的智驾系统已经部署到超过95万辆车。

从NWM到MM-Future,可以看到蔚来世界模型路线的一条演进线索:

先让模型预测未来,再让未来进入规划;从生成多条轨迹,继续走向同时生成多组动作与未来。

论文地址:https://arxiv.org/pdf/2609.20377

 

版权所有,未经授权不得以任何形式转载及使用,违者必究。