MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/mumucc01/MOJITO
领域: 自动驾驶
关键词: 端到端自动驾驶, 多模态联合学习, 扩散规划器, 无锚框设计, 统一变换器架构
一句话总结¶
MOJITO 提出了一种完全统一的传感器到动作端到端自动驾驶框架,通过块级模态联合注意力打破传统两阶段级联架构的信息瓶颈,无需预定义轨迹锚框与密集辅助监督即可实现具备强泛化与可扩展性的连续轨迹扩散生成。
研究背景与动机¶
端到端自动驾驶的核心愿景是建立从原始传感器观测直接到驾驶轨迹输出的联合优化映射。然而,主流系统长期依赖级联式双阶段范式:感知阶段先利用专用骨干网络将多相机图像和激光雷达点云压缩为紧凑的潜空间上下文或粗粒度表征,下游规划头再基于该上下文回归或生成未来路径点。近期基于视觉语言模型(VLM)的具身驾驶框架虽然通过通用语义增强了感知理解,但依然延续了将高维观测压平为离散 Token、再经独立规划头解码轨迹的单向流动设计。
这种级联设计为端到端系统带来了三层根本性瓶颈。首先是信息瓶颈,从感知到规划的单向粗粒度压缩破坏了密集空间几何与细粒度视觉线索,使得规划器在复杂博弈与临界转弯时无法直接回溯原始感知证据;其次是对人工先验与辅助任务的重度依赖,由于下游轨迹监督信号直接作用于高度压缩的潜变量上,梯度对于底层感知特征的表征学习引导过于微弱,现有系统不得不引入大量人工预定义的轨迹锚框(如 20 至 8192 个聚类锚框)来约束动作空间,并强行绑定 3D 边界框检测或语义地图构建等昂贵辅助任务以稳定训练;最后是与通用基础模型的架构割裂,现代视觉基础模型(如 ViT)具备强大的通用表征能力,但在两阶段方案中仅被充当孤立的特征抽取器,其高层表征与自注意力机制无法被规划阶段深层复用。
面对上述困境,本文主张彻底废除感知与规划之间的单向级联隔离,将轨迹生成视作与图像、点云平权的模态演化过程。核心 idea:构建由图像 ViT、LiDAR ViT 与动作 DiT 并行组成的统一架构 MOJITO,通过在每个骨干块内执行模态联合注意力(Modal Joint Attention),让动作噪声序列与稠密感知 Token 实时双向交互,实现无需预定义锚框与辅助感知识别的端到端连续轨迹扩散生成。
方法详解¶
整体框架¶
MOJITO 的整体架构由三个结构对齐的并行分支构成:基于 DINOv3-S+ 的多视角图像分支、基于 Uni3D-S 改良的 LiDAR 分支、以及基于扩散变换器(Diffusion Transformer, DiT)的动作规划分支。三个分支均由 12 层隐藏维度 \(D=384\) 的标准 Transformer 块构建,并在每一层通过参数共享的多头自注意力进行模态融合,输出自车未来 4 秒内的 8 个航路点序列 \(\tau=\{w_t\}_{t=1}^8\)(其中 \(w_t=[x_t, y_t, \theta_t]\) 包含二维位置与航向角)。
系统执行流程如下:原始多视角相机图像经过切块投影生成图像 Token;原始 LiDAR 点云通过专为大尺度场景设计的 BEV 网格分组切片模块(PillarGroup)离散化为具备绝对物理尺度的点云 Token;规划分支则以高斯噪声初始化的轨迹序列为输入,并注入由高层导航指令和扩散步长编码的自适应归一化条件。在每个网络层中,三个分支的 Token 拼接为同一超长序列进行模态联合注意力交互,感知与规划特征相互查询并自适应调整,最终由动作规划分支解码为平滑且符合物理约束的可行轨迹。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多模态输入<br/>多视角环视图像 + 原始LiDAR点云 + 轨迹高斯噪声"] --> B["柱状分组分块化<br/>PillarGroup保留绝对物理尺度与几何网格"]
B --> C["块级模态联合注意力<br/>图像/点云/动作序列无瓶颈双向交互与自适应更新"]
C --> D["基于扩散变换器的无锚框轨迹规划<br/>高层指令条件引导下的连续去噪与平滑轨迹解码"]
D --> E["输出规划轨迹<br/>未来 4 秒时域 8 航路点坐标与航向"]
关键设计¶
1. 柱状分组分块化(PillarGroup Tokenization):面向大尺度驾驶场景的绝对度量空间表征
传统点云表征在形状级任务中广泛采用最远点采样(FPS)与 K 近邻(KNN)切片,然而在自动驾驶开阔大尺度场景中,FPS/KNN 仅依赖点间相对几何距离,彻底丢弃了世界坐标系下的绝对物理尺度与全局空间排布,且极易因雷达点密度非均匀分布导致远近物体 Token 密度失真。为克服这一缺陷,MOJITO 引入了 PillarGroup 模块,首先对自车周围固定物理度量范围内的 3D 点云空间进行截断,划分为规整的二维 BEV 物理柱状网格(例如 \(32 \times 32\) 根柱体)。随后系统筛选出点数最多的 Top-\(K\)(\(K=512\))个非空柱体,并在每个选定柱体内均匀采样固定数量 \(N=64\) 个点构建局部几何块。这种离散化方式确保了每一个点云 Token 都被显式锚定在确定性的物理度量坐标中,不仅天然保留了路面坡度与障碍物高度信息,还为后续跨模态联合注意力提供了高度稳定的几何对齐基准。
2. 块级模态联合注意力(Block-wise Modal Joint Attention):打通感知与规划的双向特征交互
以往级联方法采用单向交叉注意力,使得规划器只能被动地将感知特征作为固定条件,感知分支却完全无法根据规划意图调整表征重点。MOJITO 在所有 12 个网络块中引入了全对等联合自注意力机制。设第 \(l\) 层输入的图像特征为 \(X_I \in \mathbb{R}^{N_I \times D}\)、LiDAR 特征为 \(X_L \in \mathbb{R}^{N_L \times D}\)、动作轨迹潜变量为 \(X_A \in \mathbb{R}^{N_A \times D}\)。模型将三者沿序列长度维度直接拼接构成统一联合序列:
在叠加上各模态动态生成的显式位置编码 \(PE\) 与层归一化后,统一输入共享权重的多头自注意力层:
该设计的精妙之处在于实现了真正的双向信息流:动作 Token 能够直接向稠密图像 Patch 与激光雷达柱体主动查询精细几何细节与边界可通行性,自动将扩散去噪轨迹拉向可行驶区域;与此同时,图像与雷达感知分支亦能够根据当前的去噪轨迹意图自适应重构自身注意力权重,在早期网络层聚焦前向可通行区域,在深层网络自动转向自车转向意图相关的关键障碍物。自注意力计算完成后,\(Y_{\text{joint}}\) 重新切分回各自模态并分别流经独立的 FFN 网络,既消除了感知与动作任务之间的梯度冲突,又达成了深度的特征级共融。
3. 基于扩散变换器的无锚框轨迹规划(Anchor-Free Diffusion Planning):去约束化端到端轨迹生成
以往端到端规划方法(如 VADv2 的 8192 个锚框或 DiffusionDrive 的 20 个聚类锚框)极度依赖手工先验以防止发散,但受限的锚框候选空间限制了复杂长尾场景下的决策多样性。MOJITO 将动作规划建模为连续几何空间中的条件扩散过程。给定真实未来轨迹 \(x^{(0)} \in \mathbb{R}^{8 \times 3}\),前向过程逐步添加高斯扰动生成加噪状态 \(x^{(k)}\);去噪网络 \(\epsilon_\theta\) 则利用包含高斯噪声初始化的动作 Token,接收通过 MLP 嵌入的高层驾驶指令(如直行、左右转)与扩散步长 \(k\)(借助自适应层归一化 adaLN 调制注入)。得益于模态联合注意力每层提供的细粒度物理约束,规划器完全摆脱了对显式锚框先验的依赖,仅需 2 步去噪即可从连续空间中生成平滑、无碰撞的高质量轨迹分布,并能够根据自然语言转译后的指令生成具有精确转向幅度梯度的多模态未来路径。
损失函数 / 训练策略¶
MOJITO 的训练完全由轨迹扩散去噪目标驱动,彻底去除了 3D 目标检测框回归、BEV 语义地图分割等所有显式感知识别辅助损失函数。扩散规划的目标函数定义为:
其中条件 \(C\) 包含了多视角图像 Token、LiDAR Token 以及高层导航指令。在训练配置上,图像分支与 LiDAR 分支分别加载预训练好的 DINOv3-S+ 与 Uni3D-S 权重并开启端到端微调,动作规划分支则从头随机初始化训练。模型采用 AdamW 优化器在 8 张 NVIDIA H200 GPU 上进行全量训练,全局批大小为 512,学习率设为 \(6 \times 10^{-4}\)。输入视角由前视、左前 60° 与右前 60° 三路拼接而成(分辨率降采样为 \(1024 \times 256\)),每个决策周期预测未来 4 秒内的 8 个空间路标点。
实验关键数据¶
主实验¶
评估基于权威的真实物理闭环评测基准 NAVSIM-v1 与 NAVSIM-v2。评估指标包括预测驾驶员模型得分(PDMS,综合考量无过错碰撞 NC、可行驶区域合规性 DAC、碰撞时间 TTC、舒适度 Comf 及自车前向进度 EP)及扩展合规性指标(EPDMS,追加车道保持 LK、交通灯顺应 TLC、驾驶方向顺应 DDC、历史舒适性 HC 及扩展舒适性 EC)。
| 基准与方法 | 传感器输入 | 锚框数量 | 模型参数量 | NC (%) ↑ | DAC (%) ↑ | EP (%) ↑ | PDMS / EPDMS ↑ |
|---|---|---|---|---|---|---|---|
| NAVSIM-v1 navtest | |||||||
| UniAD | 单目/环视相机 | 0 | - | 97.8 | 91.9 | 78.8 | 83.4 |
| Transfuser | 相机 + LiDAR | 0 | - | 97.7 | 92.8 | 79.2 | 84.0 |
| DRAMA | 相机 + LiDAR | 0 | - | 98.0 | 93.1 | 80.1 | 85.5 |
| VADv2 | 相机 + LiDAR | 8,192 | - | 97.2 | 89.1 | 76.0 | 80.9 |
| Hydra-MDP | 相机 + LiDAR | 8,192 | - | 98.3 | 96.0 | 78.7 | 86.5 |
| DiffusionDrive | 相机 + LiDAR | 20 | - | 98.2 | 96.2 | 82.2 | 88.1 |
| WoTE | 相机 + LiDAR | 256 | - | 98.5 | 96.8 | 82.6 | 88.3 |
| ReCogDrive-Base-IL | 环视相机 (InternVL3) | 0 | 2B | - | - | - | 86.5 |
| AutoVLA-IL | 环视相机 (Qwen2.5-VL) | 0 | 3B | - | - | - | 80.5 |
| MOJITO (本文) | 相机 + LiDAR | 0 | 127M | 98.6 | 96.9 | 83.5 | 88.9 |
| NAVSIM-v2 navtest | |||||||
| Transfuser | 相机 + LiDAR | 0 | - | 96.9 | 89.9 | 87.1 | 76.7 |
| Hydra-MDP++ | 相机 + LiDAR | 8,192 | - | 97.2 | 97.5 | 83.1 | 81.4 |
| DriveSuprim | 相机 + LiDAR | - | - | 97.5 | 96.5 | 88.4 | 83.1 |
| ARTEMIS | 相机 + LiDAR | - | - | 98.3 | 95.1 | 81.5 | 83.1 |
| DiffusionDriveV2 | 相机 + LiDAR | 20 | - | 97.7 | 96.6 | 88.9 | 85.5 |
| MOJITO (本文) | 相机 + LiDAR | 0 | 127M | 98.2 | 96.2 | 87.8 | 88.4 |
消融实验¶
在 NAVSIM-v1 navtest 数据集上对输入模态、LiDAR 切块离散化算法以及注意力交互形式进行的深度消融:
| 配置编号 | 图像模态 | LiDAR 模态 | 点云采样方式 | 注意力交互机制 | NC (%) ↑ | DAC (%) ↑ | EP (%) ↑ | PDMS ↑ | 说明 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | ✓ | ✗ | - | 自注意力 (Self-Attn) | 98.0 | 95.3 | 81.6 | 86.8 | 纯视觉单模态基线 |
| 2 | ✓ | ✓ | FPS + KNN | 自注意力 (Self-Attn) | 97.8 | 94.8 | 81.0 | 86.1 | 传统点云切片导致性能负收益 (-0.7) |
| 3 | ✓ | ✓ | PillarGroup | 交叉注意力 (Cross-Attn) | 97.8 | 94.4 | 80.7 | 85.7 | 单向感知注入割裂双向梯度 (-3.2) |
| 4 (Full) | ✓ | ✓ | PillarGroup | 自注意力 (Self-Attn) | 98.6 | 96.9 | 83.5 | 88.9 | 完整模态联合架构取得最优表现 |
关键发现¶
- PillarGroup 绝对物理尺度的决定性作用:当引入点云模态但沿用传统的 FPS+KNN 聚类切片时(配置 2),PDMS 从纯视觉的 86.8 反常下跌至 86.1。这证实了在自动驾驶开阔几何场景中,缺乏绝对物理坐标与全局网格对齐的局部相对特征会扰乱视觉多模态对齐。而一旦换用保留物理米制范围的 PillarGroup 网格编码(配置 4),PDMS 大幅跃升至 88.9,证明了规则柱状网格在端到端驾驶中的卓越鲁棒性。
- 双向自注意力对单向交叉注意力的全面超越:对比配置 3 与配置 4,若将网络中的联合自注意力降级为传统的单向交叉注意力(仅允许动作 Token 单向查询传感器特征,禁止感知 Token 反向感知动作状态),模型得分暴跌 3.2 点(85.7 vs 88.9)。可视化分析表明,双向机制让底层感知 Token 能够随着去噪过程自适应地将注意力从广域道路收束至规划意图强相关的障碍物,形成了密不可分的认知闭环。
- 模型深度的优异扩展性与轻量高效:扩展性实验(Scaling Study)显示,随着层数从 3 层(33.4M)、6 层(64.4M)、9 层(95.5M)扩展至 12 层(127M),PDMS 得分呈现极其平滑的阶梯式增长(80.5 → 80.5 → 83.0 → 88.9)。此外,相比 2B-8B 规模且重度依赖强化学习微调的 VLA 模型(如 ReCogDrive-Base-IL 仅 86.5 PDMS),MOJITO 仅凭 127M 参数量和纯模仿学习即可取得 88.9 PDMS,单帧推理延迟仅 187.65 ms(2 步去噪),展现了无与伦比的参数效率与计算经济性。
亮点与洞察¶
- 抛弃级联瓶颈的对等全模态表征:MOJITO 证明了自动驾驶并不需要人为设计显式的「感知中间瓶颈」与昂贵的 3D 边界框/地图标注。让传感器 Token 与动作 Token 在同一高维空间中进行对称联合自注意力演化,规划器能够直接捕捉亚米级的密集视觉几何细节。
- 首个完全摆脱先验约束的无锚框扩散规划器:传统扩散与回归规划器由于缺乏与稠密感知特征的深层耦合,必须依靠数千个离散锚框或强启发规则防止动作发散。MOJITO 凭借深层感知的自适应约束,达成了完全从高斯连续噪声自发收敛至精确平滑轨迹的高阶能力。
- 视觉基础模型直连决策的设计范式:不同于 VLA 方案通过生成低频文本 Token 间接控制自车,MOJITO 探索了标准 ViT 与 DiT 权重层级对齐、无缝堆叠的新范式,为未来将更大规模的通用视觉骨干网络直接迁移至机器人与具身控制领域提供了高参考价值的技术路线。
局限与展望¶
- 高阶认知与复杂交规常识推理的上限:由于模型剥离了大型语言模型(LLM)的常识世界知识库,在应对罕见长尾交警手势、特殊语义路牌及多车博弈意图推理等极端社会化交互场景时,单纯依赖视觉-几何-动作映射仍可能面临上下文理解上限。
- 多步扩散带来的实时计算开销:虽然 2 步扩散去噪将延迟控制在 187.65 ms,快于数十亿参数的 VLA 模型,但在车端 10 Hz 甚至 20 Hz 的严苛控制闭环中依然偏高。未来可通过一致性模型(Consistency Models)或流匹配(Flow Matching)技术将推理过程压缩至单步前向传播。
- 动态交互环境下的闭环反馈机制拓展:当前评测主要集中于非反应式仿真环境,未来结合可微世界模型或生成式闭环模拟器进行策略演进,是进一步挖掘全模态联合学习潜力的关键方向。
相关工作与启发¶
- vs UniAD / Transfuser / SparseDrive: 传统端到端方案构建了极其复杂的感知管道,依赖密集的分层预测头与信息压缩瓶颈;MOJITO 彻底消除了中间显式感知代理任务,以纯粹的统一 Transformer 架构实现了卓越的驾驶决策性能。
- vs DiffusionDrive / VADv2: 此类方法必须预设 20 到 8,192 个聚类轨迹锚框作为规划先验以约束发散;MOJITO 采用首创的锚框无关(Anchor-Free)连续空间扩散建模,利用块级模态联合注意力自然施加环境约束,轨迹生成更加灵活且多样。
- vs ReCogDrive / AutoVLA 等 VLA 模型: VLA 方案动辄消耗 2B-8B 参数且需要复杂的强化学习(RL)多阶段对齐才可达到 89+ PDMS;MOJITO 仅凭 127M 紧凑参数量与端到端模仿学习即斩获 88.9 PDMS,展现出极强的工业落地可行性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 彻底打破端到端自动驾驶级联信息瓶颈与锚框依赖,构建了三模态全对等联合自注意力的全新生成范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 横跨 NAVSIM-v1、NAVSIM-v2 标准及 Hard 严苛基准,消融实验设计严谨,多模态注意力演化可视化极具说服力。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻透彻,架构对比与技术推导清晰流畅,图表传达信息高效。
- 价值: ⭐⭐⭐⭐⭐ 为轻量级端到端自动驾驶开辟了摆脱大型 VLM 依赖、直连视觉基础模型与扩散动作的全新演进路径。