跳转至

Teaching Vision-Language-Action Models What to See and Where to Look

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ShivaTeam/DriveTeach-VLA
领域: 机器人/具身智能
关键词: 视觉语言动作模型、自动驾驶轨迹规划、驾驶感知视觉蒸馏、2D轨迹引导提示、强化学习对齐

一句话总结

提出 DriveTeach-VLA 框架,通过目标框自蒸馏(DVD)与 2D 轨迹引导提示(2D-TGP)将视觉注意力显式锚定至关键交通目标与可行行驶路径,在 NAVSIM 达到 90.4 PDMS 并刷新 nuScenes 开环轨迹预测 SOTA。

研究背景与动机

端到端自动驾驶系统近年来正经历从传统分模块架构向多模态大模型驱动的视觉-语言-动作(VLA)范式迁移。传统模块化管线将感知、预测和规划依次串联,虽然具备较强的可解释性与规则可控性,但级联误差累积严重,各模块间难以实现深度的跨任务联合推理。为了解决这些痛点,以 MLLM 为底座的端到端 VLA 模型被广泛探索,它们直接接收环视或前向图像以及自车状态,自回归输出未来数秒的路径点坐标或离散动作序列,并在预训练与微调中引入视觉问答(VQA)和思维链(CoT)推理数据。

然而,现存 AD-VLA 模型在感知表征与轨迹规划之间存在根本性的结构脱节。当前 VLA 的预训练和指令微调数据高度偏向文本语义中心化,模型监督目标主要聚焦于解释场景语义、交通规则描述或高层意图分类,而非面向物理空间的可行动作规划。这种文本驱动的学习方式使模型视觉编码器更倾向于“给看到的物体命名”,而无法真正掌握自动驾驶所需的几何拓扑与运动空间依赖。实际注意力分析显示,经过纯文本微调的模型在解码轨迹时,其交叉注意力权重分散漂移于整个视觉场景中,缺乏对关键车辆、行人及可行驶区域的空间接地能力。

针对这一瓶颈,本文切入的角度是:必须将视觉语言模型的通用表征能力显式重定向到驾驶行动相关的时空感知上,让模型在规划前清楚“该看什么(what to see)”以及“往哪看(where to look)”。核心 idea:解耦感知引导与轨迹生成,构建由 Prompter 和 Planner 构成的双模型架构,通过目标框增强图像的特征自蒸馏(DVD)教会视觉编码器聚焦关键交通参与者,同时将 BEV 轨迹投影为图像平面 2D 引导点(2D-TGP)约束可行行驶空间,并在 GRPO 强化学习下完成闭环轨迹偏好对齐。

方法详解

整体框架

DriveTeach-VLA 采用解耦的双模型协同架构,分别由负责提供空间引导的 TGP-Prompter 与负责最终动作决策的 TGP-Planner 组成,二者均以 Qwen2.5-VL-3B 为基座。整个系统遵循“明确该看什么(DVD 预训练)\(\to\) 明确往哪看(2D-TGP 引导 SFT)\(\to\) 明确如何行动(TGP 引导的 GRPO 对齐)”的三阶递进流程。在输入端,系统接收单帧前视相机图像、当前自车物理状态以及高层意图指令;TGP-Prompter 首先输出图像平面的 2D 轨迹关键点序列作为空间提示,TGP-Planner 随后将该 2D 提示作为文本先验条件,联合视觉特征进行四步 CoT 结构化推理,最终自回归生成最优的 4 秒 BEV 空间行驶轨迹。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入:前视图像 C + 自车状态 S + 任务指令 L"] --> D1["驾驶感知视觉蒸馏(DVD)<br/>Grounding DINO检测框增强 + ViT块级自蒸馏"]
    D1 --> D2["2D 轨迹引导提示(2D-TGP)<br/>针孔相机逆向投影 + Prompter输出2D坐标引导"]
    D2 --> D3["双模型解耦与两阶段强化对齐<br/>Planner接收2D-TGP执行4步CoT + GRPO偏好对齐"]
    D3 --> Out["输出:最优 4 秒未来 BEV 轨迹"]

关键设计

1. 驾驶感知视觉蒸馏(DVD):自蒸馏注入关键交通先验

现有多模态骨干网络的视觉 Transformer(ViT)大多在自然图像上进行通用自监督或弱监督预训练,缺乏对车道线、交通参与者、路口拓扑等自动驾驶高危要素的敏感度。传统方法试图通过大规模文本 VQA 注入先验,但语言损失难以强力约束底层视觉特征图的几何聚集。DVD 摒弃了文本中介,直接在视觉隐空间构建自蒸馏任务。首先利用开放词表检测器 Grounding DINO 自动检测场景中 11 类关键交通目标(包括轿车、卡车、公交车、行人、自行车、交通指示牌与红绿灯等),将检测框线条与色块叠加至原图构建增强图像 \(C_{\text{bbox}}\)。

随后,系统维护一对孪生 ViT 编码器,Teacher ViT 接收增强图像 \(C_{\text{bbox}}\),Student ViT 接收原始未标记图像 \(C\)。为了避免逐 Patch 对齐时因绝大多数 Patch 落在背景区域而稀释前景关键信号的问题,DVD 将特征图划分为 \(K\) 个不重叠的矩形网格块 \(\mathcal{B}_k\)(如 \(2 \times 4\) 网格),计算块内 patch 特征均值并施加 Smooth-L1 损失:

\[\bar{v}_k^t = \frac{1}{|\mathcal{B}_k|}\sum_{i \in \mathcal{B}_k} v_i^t, \quad \bar{v}_k^s = \frac{1}{|\mathcal{B}_k|}\sum_{i \in \mathcal{B}_k} v_i^s\]
\[\mathcal{L}_{\text{distill}} = \frac{1}{K}\sum_{k=1}^K \text{Smooth-L1}(\bar{v}_k^t, \bar{v}_k^s)\]

Student ViT 参数通过梯度反向传播更新,Teacher ViT 则采用动量指数移动平均(EMA,动量设为 0.996)从 Student 平滑演进,成功将显著性交通物体的感知先验隐式沉淀到 Student 视觉表征中。

2. 2D 轨迹引导提示(2D-TGP):空间投影约束可行行驶域

VLA 模型直接在鸟瞰图(BEV)或自车局部物理坐标系下回归轨迹点难度极大,因为自回归语言解码器天然缺乏对 3D 地平面绝对尺度的直觉感知,但在图像像素平面上具备极强的视觉定位与坐标 Grounding 先验。为此,本文设计了 2D 轨迹引导提示(2D-TGP)。给定自车局部坐标系下的 3D/BEV 专家轨迹点序列 \(\mathcal{T}_w = \{(x_t, y_t, \psi_t)\}_{t=1}^T\),利用相机内参矩阵 \(K\) 与外参 \([R|t]\),通过针孔相机投影函数 \(\pi(\cdot)\) 投射至 2D 图像平面:

\[(x_t^I, y_t^I) = \pi(K, [R|t], (x_t, y_t))\]

该 2D 像素坐标序列 \(P_I = [(x_1^I, y_1^I), \dots, (x_T^I, y_T^I)]\) 直观对应于车辆未来行驶轨迹在相机视场中的可通行通路。在平坦路面假设(\(z=0\))下,该映射可逆,不仅能作为强约束空间提示注入给解码器,还能通过逆投影反算验证轨迹质量。TGP-Prompter 的解码器以自回归方式直接预测这一组 2D 归一化像素坐标,监督目标采用标准交叉熵损失 \(\mathcal{L}_{\text{TGP}}\)。

3. 双模型解耦与两阶段强化对齐:从提示引导到偏好优化

若由单一模型同时承担“预测 2D 图像引导线”与“规划最终 BEV 轨迹”两项指令,模型极易产生任务指令混淆与梯度冲突。DriveTeach-VLA 采用解耦双模型设计,TGP-Planner 直接初始化自已完成 DVD 预训练的 TGP-Prompter 权重,天然继承驾驶视觉感知先验。在推理管线上,TGP-Planner 以 Prompter 生成的 \(\hat{P}_I\) 文本坐标为条件提示,执行由粗到细的四步思维链(CoT)推理:① 关键碰撞威胁目标检测;② 驾驶意图与场景物理行为解释;③ 离散元行为选择(如直行跟车、左转变道);④ 最终 4 秒 BEV 连续路径点预测。

在训练阶段,为了保证轨迹学习阶段具有稳定准确的空间基准,系统在 SFT 阶段对 Planner 采用 Teacher Forcing 策略注入真实 \(P_I\)。SFT 完成后,进一步引入基于组相对策略优化(GRPO)的强化学习阶段,以非反应式模拟指标 PDM-Score(PDMS)构建密集奖励函数:

\[\text{PDMS} = \prod_{c \in \mathcal{C}} c \times \frac{\sum_{m \in \mathcal{M}} w_m \cdot m}{\sum_{m \in \mathcal{M}} w_m}\]

其中无过错碰撞率(NC)与可行驶区域顺从度(DAC)作为乘法过滤惩罚项 \(\mathcal{C}\),自车前进进度(EP)、碰撞时间裕度(TTC)和驾驶舒适性(C)作为加权分项 \(\mathcal{M}\)(权重比为 5:5:2)。测试阶段无需真实轨迹,Prompter 预测的 \(\hat{P}_I\) 与真实值仅有约 0.4 PDMS 的细微差距,展现出高度鲁棒性。

损失函数 / 训练策略

DriveTeach-VLA 采用标准的三阶段递进式训练策略: 1. DVD 预训练阶段(1 epoch):联合优化 ViT 块级蒸馏损失与 Prompter 的 2D 轨迹预测损失,总损失为 \(\mathcal{L}_{\text{DVD}} = \mathcal{L}_{\text{distill}} + \lambda_{\text{TGP}} \mathcal{L}_{\text{TGP}}\),其中平衡权重 \(\lambda_{\text{TGP}} = 0.1\),AdamW 优化器学习率 \(4 \times 10^{-5}\),权重衰减 0.05,余弦退火配合 0.10 warmup。 2. CoT-SFT 阶段(6 epochs):在 8 张 H100 GPU 上进行多任务思维链监督微调,Batch size 为 16,采用 Qwen2.5-VL-72B 生成的高质量推理标注。 3. GRPO 强化对齐阶段:执行 180 步更新,每组采样 8 个 rollout 候选轨迹,依据 PDMS 标量奖励更新 Planner 策略参数,重点拉升长尾极限工况下的合规性与舒适度。

实验关键数据

主实验

在主流端到端自动驾驶闭环基准 NAVSIM(navtest 数据集)上评估非反应式规划综合得分(PDMS),对比同架构及多模态 SOTA 模型:

方法 出处 基座模型 NC (%) ↑ DAC (%) ↑ TTC (%) ↑ C (%) ↑ EP (%) ↑ PDMS ↑
人类专家 (Human) - - 100.0 100.0 100.0 99.9 87.5 94.8
UniAD CVPR'23 - 97.8 91.9 92.9 100.0 78.8 83.4
TransFuser TPAMI'22 - 97.7 92.8 92.8 100.0 79.2 84.0
Hydra-MDP CVPRW'24 - 98.3 96.0 94.6 100.0 78.7 86.5
DiffusionDrive CVPR'25 - 98.2 96.2 94.7 100.0 82.2 88.1
WoTE ICCV'25 - 98.5 96.8 94.4 99.9 81.9 88.3
ASSCG arXiv'26 - 98.2 98.3 94.8 100.0 87.5 91.4
ReCogDrive ICLR'26 InternVL3-8B 98.2 97.8 95.2 99.8 83.5 89.6
ImagiDrive-S ICRA'26 InternVL2.5-4B 98.1 96.2 94.5 100.0 80.5 86.9
AutoVLA NeurIPS'25 Qwen2.5-VL-3B 98.4 95.6 98.0 99.9 81.9 89.1
CuriousVLA CVPR'26 Qwen2.5-VL-3B 97.7 95.9 97.2 98.2 89.2 88.9
DriveTeach-VLA (本文) ECCV'26 Qwen2.5-VL-3B 98.5 96.9 97.9 98.2 88.5 90.4

在真实世界公开基准 nuScenes 开环轨迹预测任务中,DriveTeach-VLA 同样取得了最优表现: - ST-P3 评测准则:L2 轨迹位移误差达到 0.30 m(对比 AutoVLA 的 0.48 m 与 Impromptu VLA 的 0.33 m),碰撞率仅为 0.12%(优于 UniAD 的 0.12% 与 AutoVLA 的 0.13%)。 - UniAD 评测准则:L2 误差达到 0.60 m(对比 UniAD 的 1.03 m、AutoVLA 的 0.86 m),碰撞率为 0.31%。

消融实验

在 NAVSIM 基准上对各组件与训练阶段进行逐步叠加消融(† 表示通过逆投影将 Prompter 的 2D 轨迹还原为 BEV 轨迹):

配置与训练阶段 运行模型 DAC (%) ↑ EP (%) ↑ TTC (%) ↑ PDMS ↑ 说明
Qwen2.5-VL-3B 基线 Planner 93.2 85.8 97.3 84.8 未加专项预训练的基础微调
+ VQA 预训练 + CoT-SFT Planner 94.0 87.2 96.7 86.4 传统文本中心化预训练管线
+ DVD 预训练 + CoT-SFT Prompter † 94.9 87.5 96.7 87.3 仅用 Prompter 逆投影验证 DVD 增益
+ DVD + CoT + GRPO Prompter † 95.5 90.2 96.5 88.2 强化学习进一步对齐 Prompter
+ DVD 预训练 + CoT-SFT Planner 94.4 86.3 97.8 87.1 Planner 继承 DVD 先验但不加 2D-TGP
+ DVD + 2D-TGP + CoT-SFT Planner 95.8 87.2 96.6 88.2 引入 2D 轨迹提示显著提升 DAC 顺从度
+ DVD + CoT + GRPO Planner 95.8 90.6 96.7 89.1 无 2D-TGP 条件下的强化微调
+ DVD + 2D-TGP + CoT + GRPO (完整版) Planner 96.9 88.5 97.9 90.4 双模协同与强化对齐达到顶峰性能

关键发现

  • DVD 预训练比传统文本 VQA 更有效:将文本中心化的 VQA 替换为基于视觉框自蒸馏的 DVD 后,模型对关键交通物体的注意力质量显著改善。Attention Mass(AM)指标从基线的 \(2.28 \times 10^{-2}\) 跃升至 \(3.19 \times 10^{-2}\),直接带动 PDMS 提升 0.7~0.9 点。
  • 2D-TGP 极大缓解可行驶区域违规(DAC):加入 2D-TGP 空间坐标引导后,DAC 顺从度指标从 94.4% 骤增至 95.8%(SFT 下)和 96.9%(GRPO 下),说明图像平面的显式通路提示成功纠正了 MLLM 对道路几何拓扑理解模糊的通病。
  • 双模型结构胜过单模型多轮 QA:消融显示将 Prompter 和 Planner 整合为单模型多轮对话时,PDMS 仅为 87.0,不仅低于解耦双模型的 88.2,甚至不如单模型 Prompter 逆投影的 87.3,证实了解耦设计消除指令干扰的必要性。
  • 推理端 token 开销与速度优势:虽然双模型带来了二次调用开销(H100 上约 3.03s 延迟),但由于 2D-TGP 提供了清晰的空间引导,模型无需生成过长繁琐的文本 CoT 即可完成决策。在 L20 GPU 部署实测中,DriveTeach-VLA 的耗时(3.18s)明显低于 AutoVLA 文本路径点(7.65s)和离散动作 token(3.95s)。

亮点与洞察

  • 视觉层面的无字蒸馏机制:利用目标检测器在图像上直接画框生成视觉 Prompt,并借助孪生网络自蒸馏让原始视觉编码器“自学成才”,巧妙绕过了纯文本描述丢失密集空间细节的缺陷。
  • 2D 图像坐标与 3D 物理动作的降维映射:利用地平面几何可逆性将复杂的 BEV 规划解构为 2D 像素通路提示,让大语言模型的视觉 Grounding 天赋完全服务于物理世界驾驶动作。
  • Teacher Forcing 消除级联训练误差:在离线训练阶段直接使用真实 2D-TGP 喂给 Planner,在线推理时即使 Prompter 输出存在轻微波动,Planner 依旧展现出极高容忍度(仅 0.4 点差距)。

局限与展望

  • 高度依赖前级开放词表检测器的召回率:DVD 预训练严重仰赖 Grounding DINO 的质量,实验显示当随机丢弃或扰动超过 40% 的检测框时,噪声先验会导致最终 PDMS 显著下降(跌至 85.3)。
  • 仅基于单目平坦地平面的几何假设:2D-TGP 依赖单目针孔投影与 \(z=0\) 地平面假设,在面对起伏剧烈的坡道、立交桥以及多相机环视联合规划时,逆投影与跨视场几何一致性将受到挑战。
  • 双模型显存占用翻倍:双模型并存使得推理显存开销达到 17.2 GiB(单模型约为 8.2 GiB),未来可探索将 Prompter 蒸馏轻量化或通过 LoRA 分支在单模型内部实现参数共享。

相关工作与启发

  • vs AutoVLA:AutoVLA 依赖离散动作 token 与长文本 CoT 弥补感知缺陷,推理 token 数庞大且视觉注意力弥散;本文通过 DVD 和 2D-TGP 显式提供空间锚点,用更少推理 token 实现了更高规划精度(PDMS 90.4 vs 89.1)。
  • vs ReCogDrive:ReCogDrive 依赖 8B 参数的大体量 InternVL3 与外部 Diffusion Planner 辅助生成连续轨迹;本文仅采用 3B 级别的 Qwen2.5-VL 端到端自回归解码,即在更低模型规模下取得了同等卓越的规划表现。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 创新性地提出面向驾驶的无文本视觉自蒸馏与 2D 轨迹投影提示,构思巧妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ NAVSIM 与 nuScenes 双榜验证,涵盖详细的注意力定量分析、噪声扰动及效率测试。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照自洽,问题定义清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为解决多模态大模型在具身智能与自动驾驶中的空间接地难题提供了极具说服力的通用范式。