跳转至

DriveFine: Refining-Augmented Masked Diffusion VLA for Accurate and Robust Driving

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 掩码扩散LLM, 视觉语言动作模型, 块级MoE, 轨迹精炼, 强化学习微调

一句话总结

针对传统自回归VLA解码不可逆与连续扩散策略弱对齐易退化的问题,DriveFine基于掩码扩散LLM构建端到端自动驾驶规划器,通过轻量级块级MoE在最小开销下解耦轨迹生成与自我精炼,并结合在线离线混合RL策略,在NAVSIM与Navhard基准上取得显著的准确率与鲁棒性提升。

研究背景与动机

端到端自动驾驶系统依赖生成式规划器来应对多模态驾驶行为并实现主动探索。当前主流生成规划器主要分为两类:一是基于连续扩散策略的模型,通过并行多步去噪高效生成平滑准确的轨迹;二是基于自回归离散Token的视觉语言动作模型(VLA),将视觉、语言与控制动作统一到离散词表空间中。然而这两条技术路线各自存在显著瓶颈:扩散策略往往依靠独立的连续去噪头,与上游视觉语言骨干呈现弱耦合,导致训练效率极低(动辄需数百轮训练),且在针对目标指标(如PDMS)进行强化微调时极易发生奖励黑客攻击(reward hacking),导致在拓展指标(EPDMS)上泛化急剧崩塌;而自回归Token-based VLA虽具备更强泛化性,却受制于因果单向注意力与自回归串行解码,不仅推理延迟高、容易累积漂移误差,更因Token解码过程不可逆,完全丧失了对已生成轨迹的二次审校与修正能力。

这一现象的核心矛盾在于:连续扩散策略具备天然的迭代精炼能力,但缺乏统一多模态表征与跨分布泛化底盘;自回归离散VLA具备强大的世界语义与泛化韧性,却因不可逆因果解码无法在出界或碰撞前自我修正。掩码扩散大语言模型(dLLM,如LLaDA)通过在离散Token空间执行双向注意力与并行解掩码,天然兼备高效并行生成与全局上下文双向建模的特性,成为了桥接两者的理想基座。然而,标准dLLM在解掩码完成后同样缺乏显式精炼机制,一旦某一步解码出偏离物理道路的离群Token或潜在碰撞点,后续依然无法回溯修整。

为了在保留离散语言动作统一对齐与泛化鲁棒性的同时赋予模型真正的自我精炼能力,本文的核心思路是将掩码解码与轨迹修正解耦。核心 idea:采用掩码扩散LLM作为统一规划基座,通过参数共享与轻量化块级MoE架构解耦轨迹生成专家与精炼专家,并在强化学习微调阶段结合在线与离线相对优势矩阵实施混合监督,使精炼专家具备零样本异常纠偏与鲁棒平滑能力。

方法详解

整体框架

DriveFine由前端多模态分词模块、前28层共享Transformer编码块,以及顶层解耦的4层块级MoE(生成专家与精炼专家)构成。输入的前向单目视觉图像由SigLIP-384提取视觉特征,与驾驶文本指令一同投影到统一语言嵌入空间中;连续动作轨迹则被均匀离散化为包含4000个坐标bin与1800个航向角bin的动作Token词表中。在生成阶段,模型将全掩码序列 \([M]\) 送入网络,通过生成专家进行多步并行解掩码采样得到候选轨迹;在随后的精炼阶段,生成的候选轨迹Token被原样送入精炼专家中,由其直接对已解出的Token执行单步显式修正与碰撞避障微调。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单目前向图像 + 导航文本指令"] --> B["多模态分词与共享骨干<br/>SigLIP视觉编码 + 前28层LLaDA提取共享上下文"]
    B --> C["块级MoE解耦架构<br/>顶层4层复制为生成专家与精炼专家"]
    C --> D["生成专家:多步并行解掩码<br/>从全掩码[M]逐步去噪采样候选轨迹"]
    D --> E["精炼专家:单步自反思修正<br/>直接以生成Token为输入纠偏离群点与碰撞风险"]
    E --> F["最终鲁棒可执行轨迹"]

关键设计

1. 离散动作分词与掩码扩散规划:兼顾连续分辨率与双向上下文建模

传统连续扩散策略难以与离散大模型对齐,而常规自回归动作分词在长轨迹下累积误差严重。DriveFine将空间坐标横纵向 \([-100\text{m}, +100\text{m}]\) 范围以 \(0.05\text{m}\) 分辨率均匀划分为 4000 个 bin,将航向角 \([-90^\circ, +90^\circ]\)\(0.1^\circ\) 分辨率离散为 1800 个 bin,无缝拓展至 LLaDA 词表中。在训练中,输入动作序列以概率 \(t\) 被随机替换为掩码标记 \([M]\),基于掩码交叉熵损失进行无因果约束的双向自注意力学习;在推理阶段,不同于自回归严格从左向右生成,DriveFine通过置信度驱动的自适应解掩码机制,多步并行完成轨迹整体填充,彻底消除因果累积误差。

2. 块级MoE解耦架构:零互相干扰的即插即用精炼机制

如果在标准 dLLM 顶层直接引入常规 Token 级 MoE 或在同一参数分支上混合掩码生成与已解码修正,会严重破坏预训练 dLLM 固有的掩码先验,并引发不同任务间的梯度冲突。为此,DriveFine 借鉴 Mixture-of-Transformers 思路,保持 LLaDA 前 28 个 Transformer 模块参数完全共享以捕获通用的场景与指令上下文,仅将最后 4 层模块克隆复制为生成专家(Generation Expert)与精炼专家(Refinement Expert)。生成专家严格只在掩码位置计算监督损失并执行多步解掩码,精炼专家则以完整轨迹序列作为输入计算全局序列修正损失,且反向传播梯度严格隔离于精炼块内部。这种物理级结构隔离实现了生成与精炼的完全解耦,既保留了基座通识先验,又让精炼专家能够以即插即用形式对生成结果做针对性纠偏。

3. 在线离线混合强化微调:构建致密对称优势矩阵突破性能极限

精炼专家的核心使命是实现“改对加分,改错扣分”,天然不需要依赖传统 PPO 中的 Value 价值网络或 GRPO 的群体均值基线。在后训练微调(RFT)阶段,生成专家首先在环境提示下并行采样 \(G\) 条候选轨迹并基于环境仿真奖励 \(r_i\) 实施 GRPO 优化。对于精炼专家,DriveFine 巧妙地将生成专家采样的 \(G\) 条候选轨迹两两配对,构建成无偏零均值的离线优势矩阵 \(\hat{A}^{\text{of}} \in \mathbb{R}^{G \times G}\): $$ \hat{A}{ij}^{\text{of}} = r_i - r_j, \quad \forall i, j \in {1, \dots, G} $$ 离线优势无需额外交互开销即可提供致密的负正样本梯度。为了防止精炼能力被生成专家的候选质量上限所锚定,精炼专家在在线阶段针对每个候选轨迹 \(x_i\) 进一步在线探索采样 \(K\) 条精炼变体,计算在线探索相对优势: $$ \hat{A} - r_i, \quad \forall i \in {1, \dots, G}, k \in {1, \dots, K} $$ 将离线两两配对与在线探索优势联合加权,同步监督精炼专家的策略更新,驱动模型主动识别潜在碰撞风险点并平滑离群拐角。}^{\text{on}} = \hat{r}_{ik

损失函数 / 训练策略

模型采取两阶段训练: 1. 监督微调(SFT)阶段:在 ReCogDrive 提供的多模态 QA 与文本化轨迹数据上训练 12 个 epoch,批大小为 64,采用 AdamW 优化器配合余弦衰减学习率 \(4 \times 10^{-5}\)。生成专家只计算掩码 Token 上的交叉熵,精炼专家通过热启动学习基本解码能力。 2. 强化学习微调(RFT)阶段:在 NAVSIM 闭环仿真环境中训练 1 个 epoch,批大小为 16,学习率 \(1 \times 10^{-6}\)。生成专家采样组大小设为 \(G = 10\),精炼专家针对每个轨迹在线探索 \(K = 6\) 次并行优化,两专家联合同步优化。

实验关键数据

主实验

在 NAVSIM-v1 与 NAVSIM-v2 官方评测集上,DriveFine 与当前具有代表性的端到端自动驾驶及 VLA 方案对比结果如下(原论文 Table 1 与 Table 2):

方法 (Method) 论文出处 传感器配置 无碰撞 (NC↑) 可行驶区 (DAC↑) TTC↑ 舒适度 (C.↑) 进度风险 (EP↑) PDMS↑ (v1) EPDMS↑ (v2)
Human (人类专家) - - 100.0 100.0 100.0 99.9 87.5 94.8 -
UniAD CVPR'23 Camera 97.8 91.9 92.9 100.0 78.8 83.4 -
DiffusionDrive CVPR'25 Cam+LiDAR 98.2 96.2 94.7 100.0 82.2 88.1 88.1
AutoVLA NeurIPS'25 Camera 98.4 95.6 98.0 99.9 81.9 89.1 -
ReCogDrive ICLR'26 Camera 97.9 97.3 95.2 99.8 86.7 90.4 83.6
AdaThinkDrive ICRA'26 Camera 98.4 97.8 95.2 100.0 84.4 90.3 -
CuriousVLA CVPR'26 Camera 99.1 98.8 95.2 98.1 88.5 90.3 -
DriveFine (本文基础) 本文 Camera 98.6 98.1 95.2 99.9 85.5 90.8 89.7
DriveFine* (含打分微调) 本文 Camera 98.8 98.6 96.2 100.0 86.9 91.8 -
DriveFine† (Best-of-6) 本文 Camera 99.3 99.2 97.9 100.0 89.1 94.2 -

(注:NC: No Collision, DAC: Drivable Area Compliance, TTC: Time-to-Collision, EP: Ego Progress, C.: Comfort)

在最具挑战性的分布外评测 Navhard 基准上(原论文 Table 3): - Stage 1 EPDMS:ReCogDrive 为 68.9,DiffusionDrive 为 66.7,而 DriveFine 达到了 74.4(超出 ReCogDrive 达 5.5 个百分点,且 DAC 从 80.2% 大幅提升至 90.0%)。 - Stage 2 EPDMS:ReCogDrive 为 37.8,DiffusionDrive 为 40.5,DriveFine 达到 41.0,展现出卓越的越野与极限场景泛化稳健度。

消融实验

针对 DriveFine 核心模块逐层消融验证(原论文 Table 4):

配置 (ID) SFT GRPO 离线RFT 在线RFT NC↑ DAC↑ TTC↑ Conf.↑ EP↑ PDMS↑ (增益)
1. SFT 基线 98.0 95.2 94.9 99.4 81.6 86.7 (基准)
2. + GRPO 策略 98.3 96.7 95.1 99.2 85.0 89.7 (+3.0)
3. + 离线优势精炼 98.5 97.3 95.2 99.9 85.4 90.4 (+0.7)
4. + 在线探索精炼 (Full) 98.6 97.9 95.2 99.9 85.5 90.8 (+0.4)

在推理效率与解码策略方面(原论文 Table 6 与 Fig. 7): - 解码顺序:自适应解掩码(Adaptive)实现 89.7 PDMS 与 96.7% DAC,明显优于前向因果解码(89.0 PDMS)与逆向因果解码(89.2 PDMS),验证了双向动态解掩码对轨迹上下文全局连贯性的优越性。 - 推理效率:在 \(s=4\) 扩散生成步数加 1 步精炼下,DriveFine 仅耗时约 280ms 即可达到 90.51 PDMS,显著快于 ReCogDrive-8B(约 450ms+)。

关键发现

  • 离散自精炼的抗崩溃特性:消融显示精炼专家对 DAC(可行驶区符合度)和 Conf(平滑舒适度)增益最为显著。定性可视化显示,生成阶段偶发的离散离群点或即将压线的边缘点,在经过精炼专家的一步修正后被平滑拉回车道中央,彻底杜绝了自回归 VLA 一步错全盘崩的硬伤。
  • 强化学习鲁棒性:连续扩散策略在 PDMS 导向下进行 RFT 时,其 EPDMS 从 86.3 骤降至 83.4(发生 reward hacking);而 DriveFine 在 PDMS-RFT 后,PDMS 提升 3.2 的同时,扩展指标 EPDMS 依然同步提升 2.3(从 86.8 升至 89.1),证明了离散多模态表征对目标过拟合具有天然的防御屏障。

亮点与洞察

  • 将掩码扩散大模型引入 VLA 规划:打破了自回归 LLM 与外部连续扩散头的二元对立局面,利用 dLLM 的双向注意力与并行解掩码兼顾了全局上下文视野与推理低延迟。
  • 极简而优雅的 Block-MoE 物理隔离:仅克隆末尾 4 层 Transformer 模块分别专攻“从无到有生成”与“基于上下文精炼”,零额外架构冗余且互不干扰,极大保护了基础大模型的语言空间完整性。
  • 成对样本自构造相对优势:精炼专家的优势计算巧妙利用生成轨迹构建零均值差分矩阵,免去了昂贵的大规模 Critic 训练,为动作精炼型 Agent 提供了高度可复用的 RL 范式。

局限与展望

  • 精炼步数的边际效应:当前精炼专家仅在单步前传下取得最优性价比,多步自回环精炼会导致生成累积耗时增加,且多次微调可能带来边际效益递减或过平滑。
  • 多视角与时序多模态开销:目前输入仅依赖单目前向图像输入,在更复杂的大转弯或倒车环视场景下,扩展至多路环视相机需要更紧凑高效的时空压缩表征。

相关工作与启发

  • vs ReCogDrive: ReCogDrive 采用自回归 VLM 结合独立的连续扩散去噪头(Diff-head),需要多步去噪且扩散头与语言特征解耦导致后训练泛化指标骤降;DriveFine 将生成与精炼完全统一在离散 dLLM 内部,训练效率高且泛化指标稳定增长。
  • vs AutoVLA / AdaThinkDrive: 传统自回归 VLA 依赖因果掩码和自回归串行生成,延迟高且解码具有不可逆性,发生错误无法补救;DriveFine 借助掩码扩散的双向并行机制将推理速度提升近倍,并通过精炼专家实现轨迹自审校。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性将掩码扩散 LLM 与块级解耦 MoE 引入端到端驾驶规划,设计精巧完整。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 NAVSIM v1/v2 以及极具挑战性的 Navhard 分布外基准,消融和对比实验详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表清晰,对连续与离散两派瓶颈的洞察剖析深刻。
  • 价值: ⭐⭐⭐⭐⭐ 为解决具身智能与智能车端规划中的动作解码不可逆与泛化退化难题提供了重要的统一方案。