跳转至

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

会议: ECCV 2026
论文: ECCV Official
代码: https://pixelpilotvla.github.io/
领域: 机器人/具身智能
关键词: 视觉语言动作模型, 端到端自动驾驶, 规划与提升解耦, 数据扩展, 组相对策略优化

一句话总结

PixelPilot 提出“图像空间规划与确定性 3D 提升”解耦架构,通过多任务 SFT 与基于中间可验证奖励的 GRPO 强化学习,消除了直接预测 3D 轨迹带来的传感器绑定与自车运动状态捷径学习,实现了跨异构数据集扩展与 SOTA 规划性能。

研究背景与动机

近年来视觉语言模型(VLM)在端到端自动驾驶中展现出强大潜力,视觉语言动作模型(VLA)试图借助通用大模型的视觉理解与语义推理能力攻克长尾驾驶场景。然而,主流端到端自动驾驶 VLA 普遍遵循“2D 图像输入 → 直接预测与优化 3D 空间轨迹”的范式。这一范式物理上直观,但在实践中遭遇了两大根本瓶颈:首先是数据扩展性严重受限,直接从 2D 图像回归 3D 度量轨迹要求模型在网络权重中隐式或显式学习特定传感器的内外参映射;当聚合 nuScenes、Waymo 等异构车辆采集的数据集时,相同的像素坐标对应着截然不同的 3D 物理空间位置,引入了严重的几何歧义。

更为严重的是,这种传感器绑定的 3D 优化极易诱导模型陷入捷径学习与退化解。由于 2D 到 3D 的非线性逆投影高度病态且难以优化,现有模型倾向于走捷径——仅凭输入的自车运动状态(如车速、纵向加速度)直接外推 3D 轨迹,而漠视视觉场景输入。实验表明,当屏蔽自车状态仅保留图像时,SOTA 模型的 L2 误差会从 0.36m 激增至 1.98m,证明其并未真正利用视觉感知与语义理解。

针对上述瓶颈,PixelPilot 借鉴了人类驾驶员的决策认知:经验丰富的驾驶员首先基于 2D 主观视野规划行驶路径(传感器无关的感知与意图),再根据所驾驶车辆的具体几何规格映射为实际底盘控制(传感器特定的坐标映射)。核心 idea:将自动驾驶策略彻底解耦为图像平面的传感器无关 2D 规划与推理时的确定性 3D 几何提升,并在多任务 SFT 的基础上利用可验证中间奖励的 GRPO 强化学习,强力锚定从目标感知、边界框 CoT 推理到像素轨迹生成的因果链。

方法详解

整体框架

PixelPilot 由两大核心阶段组成:第一阶段为传感器无关的图像平面规划(Sensor-Agnostic Planning in the Image Plane),通过自回归生成目标检测边界框、基于边界框的因果思维链、元动作以及图像空间航路点;第二阶段为确定性 3D 提升(Deterministic Lifting to the 3D World),仅在推理阶段利用目标车辆已标定的相机内外参,通过局部平面投影视线交叉计算输出真实世界的 3D 度量轨迹。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角图像输入 + 自车状态指令"] --> B["自车中心一致性预处理<br/>后视视角旋转180°拼接"]
    B --> C["2D目标检测感知<br/>预测目标边界框及类别"]
    C --> D["边界框空间关系推理<br/>CoT显式关联目标RoI与意图"]
    D --> E["元动作决策与2D轨迹规划<br/>横纵向元动作 + 像素级航路点"]
    E -->|仅在推理阶段执行| F["确定性3D几何提升<br/>局部道路平面投影视线相交"]
    F --> G["车辆PID底盘控制执行"]

关键设计

1. 规划与提升解耦范式:传感器无关的图像空间规划与确定性 3D 提升

针对跨异构传感器数据难以联合扩展以及模型过度依赖自车运动状态的痛点,PixelPilot 将策略模型的全部学习和优化目标限制在 2D 图像平面 \(\mathcal{P}_{\text{img}}\)。在短时域(3 秒)自车中心前行过程中,路面高程变化极小(nuScenes 统计 3 秒内平均高差仅 0.16m),道路平面与图像平面之间存在严格的双射投影变换,因此 2D 平滑连续轨迹在局部平面假设下严格对应 3D 连续平滑轨迹。模型自回归输出未来各时间步的像素坐标航路点 \((\hat{u}_t, \hat{v}_t)\)

在推理阶段,给定相机内参及外参矩阵 \(K\) 和地平面离地高度 \(h\)(地平面方程为 \(Z = -h\)),确定性提升函数 \(\Psi\) 通过光线投射法求取光线与局部路面的交点:

\[\hat{T}_{\text{3D}} = \Psi(\hat{T}_{\text{2D}}, K, h)\]

由于 2D 像素位移与 3D 真实距离之间必须通过场景几何深度进行换算,模型无法直接将自车绝对速度通过线性权重捷径映射为像素位移,从而迫使模型真正去理解图像视觉线索。

2. 自车中心一致性图像预处理:消除多相机视差与拼接断裂

为了给多相机全景规划提供连续、物理一致的 2D 图像空间,PixelPilot 分析了传统网格状拼接的几何缺陷。若直接将前视与后视摄像头上下排列堆叠,车道线会在视图交界处产生严重的方向翻转与几何不连续;而水平翻转后视图像虽然能够使车道线方向大致对齐,却会破坏轨迹在多视角画布上的连续传播。PixelPilot 采用后视旋转 180 度拼接机制(Back Views 180 Degree Rotation Stitching),纠正了全景相机的空间拓扑关系,在整张拼接大图上构筑了平滑且视觉连续的道路规划表面。

3. 基于边界框的因果思维链:显式锚定视觉锚点与决策因果

以往 VLA 生成的自由文本推理往往模糊笼统,容易产生幻觉,难以与底层控制形成可追溯的因果联系。PixelPilot 引入了“显式目标边界框推理机制”(Reasoning with Bounding Boxes)。模型在决策前必须首先输出交通参与者的 2D 边界框 \(\hat{B}_{\text{2D}}\),随后在 <think> 标签内直接引用特定边界框坐标(例如 <think> 坐标为 [363, 239, 402, 274] 的前车距离过近,需要减速保持安全车距 </think>),进而输出横向与纵向元动作 \(\hat{A}\),最后生成规划轨迹。通过构建“感知锚点 → 空间推理 → 行为决策 → 轨迹生成”的严格因果链,确保规划意图完全建立在确凿的视觉证据之上。

4. 知识注入多任务 SFT 与基于中间可验证奖励的 GRPO 策略优化

针对长视野生成中的长序列信用分配难题,PixelPilot 设计了两阶段学习策略。阶段一通过多任务 SFT 注入基础驾驶常识,覆盖目标检测、边界框推理、元动作识别及轨迹规划四个子任务;阶段二基于 SFT 初始权重,使用组相对策略优化(GRPO)强化学习微调策略。与以往仅对最终轨迹打稀疏奖励的方法不同,PixelPilot 构建了全链路密集复合奖励 \(R_{\text{acc}}\)

\[R_{\text{acc}} = \lambda_{\text{fmt}} R_{\text{fmt}} + \lambda_{\text{percep}} R_{\text{percep}} + \lambda_{\text{action}} R_{\text{action}} + \lambda_{\text{traj}} R_{\text{traj}}\]

其中 \(R_{\text{fmt}}\) 检验包含格式标签、检测框规范和轨迹完整性的结构格式;\(R_{\text{percep}}\) 使用匈牙利算法匹配预测框与真值框并计算 Mean IoU;\(R_{\text{action}}\) 为横纵向元动作预测的宏 F1 得分;\(R_{\text{traj}}\) 结合了像素误差阈值 \(L_1\) 奖励、Sigmoid 缩放的 \(L_2\) 奖励以及用于闭环轨迹安全舒适性评估的 PDMS 分数 \(R_{\text{PDMS}}\)。自由形式的边界框思考过程保留给模型自由探索,不设强行语义打分,从而避免了策略过早退化或走捷径。

实验关键数据

主实验

PixelPilot 在 nuScenes 开环轨迹预测及 Bench2Drive(CARLA)闭环基准上均刷新了 VLA 方法的最好成绩。

表 1:nuScenes 验证集开环轨迹规划性能对比 (原论文 Table 3)

方法 1s L2 (m) ↓ 2s L2 (m) ↓ 3s L2 (m) ↓ 平均 L2 (m) ↓ 碰撞率 (%) ↓ 越界率 (%) ↓
DriveVLM 0.18 0.34 0.68 0.40 0.27 -
OmniDrive 0.14 0.29 0.55 0.33 0.30 3.00
OpenDriveVLA 0.15 0.31 0.55 0.33 0.10 -
Imprompt-VLA 0.13 0.27 0.53 0.30 - -
AutoVLA 0.21 0.38 0.60 0.40 0.20 -
PixelPilot (本文) 0.13 0.26 0.51 0.30 0.25 1.77

表 2:Bench2Drive (CARLA) 闭环自动驾驶性能对比 (原论文 Table 4)

方法 驾驶得分 (Driving Score) ↑ 成功率 (%) ↑ 行驶效率 ↑ 舒适度 ↑
UniAD-Base 45.81 16.36 129.21 43.58
VAD 42.35 15.00 157.94 46.01
Orion 77.74 54.62 151.48 17.38
AutoVLA 78.84 57.73 146.93 39.33
PixelPilot (本文) 79.14 58.87 153.26 38.01

消融实验

表 3:自车状态 vs 视觉图像单模态屏蔽消融分析 (原论文 Table 9)

方法 包含自车状态 包含输入图像 平均 L2 误差 (m) ↓
OmniDrive 1.98
OmniDrive 0.36
Imprompt-VLA 2.39
Imprompt-VLA 0.36
PixelPilot (本文) 0.71
PixelPilot (本文) 0.90

表 4:训练策略与中间奖励消融 (原论文 Table 5 & Table 7)

实验配置 模块调整 平均 L2 误差 (m) ↓
学习策略消融 Qwen2.5-VL-7B Zero-Shot 1.92
仅 SFT 微调 (Stage 1 only) 0.46
仅 RL 训练 (Stage 2 only) 0.49
SFT + RL 完整模型 0.30
RL 奖励项消融 移除轨迹奖励 (\(w/o.\ R_{\text{traj}}\)) 0.44
移除感知奖励 (\(w/o.\ R_{\text{percep}}\)) 0.41
移除动作奖励 (\(w/o.\ R_{\text{action}}\)) 0.40

关键发现

  • 打破运动状态捷径:从表 3 可见,传统 3D 优化模型(OmniDrive、Imprompt-VLA)在仅有速度/加速度输入而没有图像时,L2 误差依然极低(0.36m),而在仅有图像缺乏自车状态时误差崩溃至 1.98m~2.39m;PixelPilot 仅靠视觉输入时 L2 误差可达 0.71m(显著优于纯状态输入的 0.90m),证明解耦架构成功迫使模型基于真实视觉输入进行空间推理。
  • 跨数据集扩展红利:在 nuScenes 与 Waymo 异构传感器联合训练中,引入 Waymo 数据让 PixelPilot 的平均 L2 误差降低了 0.06m;在零样本迁移至 Waymo 评估时,无需任何目标域微调即取得 0.40m 的平均 L2 误差。
  • 全链路中间奖励的必要性:仅靠终末轨迹奖励强化容易引发长序列策略崩溃,逐级加入 \(R_{\text{percep}}\)\(R_{\text{action}}\) 可验证奖励能有效解决长序列信用分配问题,平均 L2 从 0.44m 稳步收敛至 0.30m。

亮点与洞察

  • 设计范式反思:跳出盲目追求模型内部“端到端学习 2D-3D 几何投影”的执念,通过物理几何分析证明短时规划下的 2D-3D 局部单应双射性,将计算负担交给无参数的几何逆变换,解放了神经网络的多模态语义推理潜力。
  • 视觉锚定 CoT 范式:将思维链中的自由文本与高确定性的目标检测框坐标强制对齐,既赋予了强化学习明确的因果审计指标,又保留了复杂自然语言场景推理的自适应性。
  • 跨平台泛化低门槛:模型本体网络权重完全不固化特定相机的焦距、畸变或安装高度,实车部署迁移至全新车型时,仅需更新下游提升矩阵 \(K\),极大降低了端到端算法的落地适配成本。

局限与展望

  • 局部平坦道路假设的边界:该方案高度依赖 3 秒局域内的地平面平整性假设。面对连续上下坡起伏剧烈的多层立体立交桥、陡坡地下车库或路面高度突变地形时,2D 像素到 3D 平面的直接投影视线相交会出现测距偏差。
  • 严重遮挡与未知测距场景:在动态障碍物极端密集遮挡导致无法看清路面接触点时,光线投射算法对非接触接地面点的投影容易受到物体高度干扰。
  • 改进方向:未来可在推理阶段的确定性提升器中轻量级融入单目稀疏深度估计或地面高度网格先验(DEM),在不破坏 2D 策略模型传感器无关特性的前提下,增强极端起伏地貌的几何适配鲁棒性。

相关工作与启发

  • vs OmniDrive / Orion / OpenDriveVLA: 此类方法使用 3D Q-Former 或 3D Queries 在特征层显式学习相机内外参投影,导致模型网络权重严重耦合特定车辆传感器,无法联合训练异构数据集;PixelPilot 将网络预测限制在纯 2D 图像域,使异构数据联合扩展变得天然可行。
  • vs AutoVLA / DriveVLM: 此类方法直接让语言模型输出 3D 坐标并施加稀疏 RL 惩罚,容易让模型退化为盲目依赖车辆速度外推轨迹;PixelPilot 解耦 2D/3D 并引入可验证中间奖励,既切断了捷径学习,又规范了因果逻辑链。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 创造性提出解耦 2D 图像规划与推理期几何提升的全新范式,打破了自动驾驶 VLA 陷入 3D 传感器绑定的思维定势。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 nuScenes、Waymo 跨域扩展、CARLA closed-loop 评测及单模态图像/状态屏蔽消融,论据详实确凿。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论证明(轨迹可行性、碰撞安全性)严密,图表清晰,逻辑层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 为自动驾驶 VLA 的超大规模多源异构数据预训练及低成本实车迁移指明了极具实用价值的技术路线。