DriveHierarchy: A Benchmark for Diagnosing VLM Driving Capabilities from Open-Loop Understanding to Closed-Loop Execution¶
会议: NeurIPS2026
arXiv: 2609.31814
代码: https://github.com/PerfectXu88/DriveHierarchy
领域: 自动驾驶
关键词: 视觉语言模型、分层能力诊断、开环评测、闭环仿真、监督微调
一句话总结¶
DriveHierarchy 将视觉语言模型的驾驶能力组织为感知落地、上下文记忆、心智推理和闭环执行四层,用统一开环任务及 100 个交互仿真场景诊断 15 个模型,并在 Qwen3-VL-8B 上展示仅补强开环薄弱能力即可把闭环综合分从 0.902 提高到 8.021,但这不等于真实道路安全保证。
研究背景与动机¶
视觉语言模型(vision-language model,VLM)可以识别车辆、理解导航语言、描述交通情境,甚至直接给出驾驶动作,但这些表现并不能互相替代。驾驶问答答对了,不代表模型能在车辆连续运动时及时转向;闭环路线失败了,也不能仅凭一次碰撞判断问题究竟出在目标距离、跨视角去重、未来行为判断,还是模型到控制器的接口。现有开环数据集和闭环驾驶基准各有用途,却很少把两者放到可解释的能力坐标中。
本文填补的不是“再给模型加一个规划模块”,而是评测结构的空白。作者借鉴认知能力层级,把当前场景的感知、跨视角与时间的信息整合、未来推断,以及环境交互中的执行分别测量。公共驾驶数据已经提供对象身份、几何、时序和问答标注,CARLA 与 SUMO 又能提供可控交互,因此可以建立一套同时包含局部能力画像和整体驾驶结果的研究工具。
这套层级首先是一种任务组织假设,而不是经验证明的神经计算链。作者用跨模型相关性检验能力是否既有关联又不完全重复,再用定向监督微调检验薄弱项是否能够成为干预入口。核心 idea:用四层能力画像把开环理解与闭环执行联系起来,既保留每项能力的诊断信息,也通过受控微调测试这种诊断是否有实际改进价值。
方法详解¶
整体框架¶
DriveHierarchy 是基准及诊断协议,不是新的四阶段神经网络。R1–R3 是分别运行的开环任务,模型读取单张图像、同步多视角图像或短片段并回答问题;R4 则把同一模型接到交互仿真中,根据在线观测输出动作。四个层级并不意味着推理时必须先显式调用 R1,再调用 R2、R3,最后生成 R4。
整体设计包含四件事:以不同输入与监督定义能力层级,用按题型评分和冻结权重保留可比较的能力画像,用统一控制接口及乘积指标测量闭环执行,再根据画像选择监督微调目标。因为这些是评测与分析关系,而不是网络模块的数据流,本笔记不把层级目录画成模型流水线。
数据规模需要区分两个口径。整合语料有 84,279 帧、76,798 组问答;正文所有已报告的 R1–R3 结果使用精炼版,即 31,945 帧、14,000 组问答。R4 使用另行构建的 100 个仿真场景,不能把全量语料规模当作主结果的实际测试量。
关键设计¶
1. 分层能力任务:用可检查的输入与标签区分不同驾驶问题
R1 感知落地(Perceptual Grounding)关注当前画面中的可靠证据,共有 8 类任务:存在判断、数量统计、状态识别、最近对象距离、指定对象距离、距离区间计数、语言指代定位和情境描述。前三类从对象类别与状态标注生成标签;距离任务使用自车—对象几何及标定坐标;定位输出边界框;描述任务要求回答符合当前交通情境,而不是凭常识写一段合理的驾驶叙述。
R2 上下文记忆(Contextual Memory)有 4 类任务,关键不是增加图像数量,而是让信息整合不可绕过。多视角记忆给出同一时刻的六路相机图像,要求统计去重后的目标总数,并只保留确实存在跨视角整合需求的样本。时序计数使用固定短片段统计出现过的唯一对象,时序状态任务跟踪同一对象是否发生状态转换,空间关系任务则询问对象之间的前后左右关系。对象身份去重、同步视角和连续性检查,使“每张图分别数完再相加”不能轻易替代真正的整合。
R3 心智推理(Mental Reasoning)有 2 类任务:根据当前上下文预测目标未来动作,以及恢复候选观测的时间顺序。前者用未来相关标注构建多选答案,后者检验序列一致性。这里的“序列规划”实际是图像排序,不是自由生成驾驶轨迹;因此不能把 R3 的高分解读为完整交通博弈或长期规划能力。
数据来自 NuScenes、nuPlan、NAVSIM、DriveLM、DriveBench、LingoQA 和 DRAMA。精炼集采用可见性投影检查、类别词汇归一化、场景配额、无效框剔除、实例 ID 去重、状态转换平衡和选项随机化。发布清单保留来源标识与答案标签,便于审计来源比例和答案分布;这些控制增加可追溯性,却不自动消除公共数据的偏差或模型预训练污染。
2. 按题型评分与冻结权重:区分能力差异,也避免重复计分
不同任务不能全部按答案字符串准确率计分。二分类和多选题使用规范化后的精确匹配;定位分数为边界框 IoU 乘以 100;情境描述使用 LingoQA 官方文本分类评判器给出的语义正确概率乘以 100,其 0.5 通过阈值只作诊断,不用于总分;序列排序按正确的成对顺序比例给部分分数。
数值题先解析有效数值,再用误差衰减而非全对全错。计数误差是预测与真值之差的绝对值除以真值和 1 中较大者;距离误差采用加上 0.1 后的距离对数比绝对值。两者共同使用以下有界评分函数:
计数设 \(\tau=0.05\)、\(\sigma=(0.20-0.05)/\ln 2\),使归一化误差 0.20 得到半分;距离设 \(\tau=0\)、\(\sigma=1.0\),使对数比误差 \(\ln 2\) 得到半分。由此,小误差可以获得部分信用,但所有结果仍被约束在 0–100。不能解析的题目输出按 0 分记录;缺输入、记录损坏或生成失败的样本则记录并在恢复评测时重跑,两类情况不能混为一谈。
每项任务先对样本分数取平均,每个层级再对所属任务均值取算术平均。表 1 的开环综合分另外使用 14 项任务的固定加权和,而不是简单把三个层级均值平均。作者先规定 R1、R2、R3 的预算分别为 0.3、0.3、0.4,再按子任务在初始校准池中的冗余程度分配层内权重:
其中 \(\rho_{ij}\) 是子任务间的 Spearman 相关系数,\(B_{r(i)}\) 是所属层级预算。这个式子合并了附录 F 的冗余负载、倒数唯一性及层内归一化步骤:同层正相关的惩罚强度为 1.0,跨层为 0.35,相关值平方后累加;负相关截为零,不当成额外独立性奖励。权重只在第一轮基准测试后的初始校准阶段估计一次,之后冻结,而不是针对每个新参评模型重算。
这样的总分减少相似计数、距离任务的重复奖励,但 0.3/0.3/0.4 预算和校准模型池仍是设计选择,并非唯一客观的驾驶能力权重。尤其应保留任务画像:平均分接近的模型可能在定位与时序记忆上完全不同。
3. 统一闭环接口与乘积指标:把理解能力放到持续交互中检验
R4 闭环执行(Closed-loop Execution)使用真实道路布局上的 CARLA–SUMO 联合仿真。CARLA 提供自车、视觉观测和车辆执行,SUMO 控制背景交通流,交互编辑器配置参与者、轨迹与交通条件。100 个场景属于 10 类:行人相遇、避障、转弯、交叉口、T 型路口、交通扰动、急刹、汇入、让行和环岛。真实道路拓扑不等于真实道路试验。
每个决策时刻,所有模型接收前视图、鸟瞰路线图,以及速度、剩余距离、导航命令和自车坐标系下的短期路线点。默认接口要求输出转向意图与目标速度,而不是长篇解释或自行执行一段完整轨迹。通用执行桥限制转向范围和每次更新的变化量,再将目标速度误差转换为油门或制动;这不是为各模型单独训练的控制器,但仍是闭环结果所依赖的共同实现条件。
闭环执行频率为 4 Hz,仿真步长为 0.05 s,前视图分辨率为 800×450,保留 1 轮对话。转向每次更新最多变化 0.12;无法解析动作时保留上一个有效控制并记录失败,模型查询之间也保持最后控制。每个场景重启 CARLA,达到目标、发生碰撞、持续偏离道路、阻塞或超时会结束运行。因此 R4 同时测到了观测理解、动作格式可靠性和持续控制,不是纯粹的问答分数。
最终分数定义为路线进度、安全项和效率项的乘积:
路线分位于 0–100,安全和效率项位于 0–1。到达目标得到路线分 100,否则按已完成参考路线比例计分;仅当轨迹投影横向偏差不超过 6 m 时更新进度,默认终点半径为 8 m。安全项累乘事件惩罚,再乘以未偏离有效路线的时间比例:行人碰撞的事件项为 0,车辆碰撞为 0.2,静态对象碰撞为 0.3,场景超时或阻塞超时为 0.7。其他终止事件的具体惩罚由实现定义,本笔记不补猜数值。
效率项比较实际路程与参考路线、实际时间与参考时间,分别容许 1.10 和 1.50 的宽限倍率。乘积使“完成路线但危险”或“很安全却长时间停滞”不能仅凭单项获得高分。发布日志还保留路线、安全、效率、解析和终止信息,诊断时应同时看这些分项,而不能由一个乘积倒推出唯一失败原因。
4. 基准引导监督微调:用能力缺口选择干预,而不训练闭环测试场景
作者以 Qwen3-VL-8B-Instruct 为基础,对照各任务最佳参评成绩寻找缺口,选中 R1 的最近距离、指定距离和定位,R2 的多视角记忆和空间关系,以及 R3 的结果预测。分别训练单任务或组合版本,再检查未受监督任务和 R4 是否也发生变化。联合配置 ALL 指这些被选中的弱项,不是全部 14 类任务,也不是把闭环驾驶数据加入训练。
这个实验的辨识力来自“监督范围之外”的结果:目标题型涨分只能说明模型学到了该类监督,未目标题型的变化才揭示能力耦合,未参与训练的 R4 才提供闭环迁移证据。它仍然只是一个基础模型上的干预案例;跨模型相关系数不能说明层级存在因果链,单次 SFT 迁移也不能证明所有模型都会受益。
损失函数 / 训练策略¶
微调使用 SWIFT 的 LoRA 监督微调流程,视觉塔与对齐器冻结,线性层采用 LoRA 适配;原文明确所有实验都不使用 R4 场景训练。每份训练数据留出 5% 验证集,LoRA rank 为 8、缩放系数为 32,学习率为 \(1\times10^{-4}\),预热比例为 0.05,使用 bfloat16。
训练每设备批量为 1,梯度累积为 8,最大序列长度为 16384,每样本视觉 token 上限为 1024,硬件为 4×A800。论文未在这里提出新的损失函数,因此不为其补写专用闭环优化目标。训练策略固定有助于比较不同监督组,但训练集规模、题型混合和测试来源重叠仍需结合发布清单审计。
实验关键数据¶
主实验¶
下表从表 1、表 2 摘取代表性模型。开环分来自精炼 R1–R3 集的冻结加权总分;闭环分来自 100 个场景的路线—安全—效率综合分。二者虽均在 0–100 尺度内,却不是相同任务,不能直接比较数值高低。
| 模型 | 开环综合分 | R4 综合分 | R4 排名 |
|---|---|---|---|
| Qwen3-VL(8B) | 45.09 | 0.902 | 9 |
| MiniCPM-V-4_5(9B) | 45.50 | 5.405 | 3 |
| Gemma-3-it(27B) | 49.53 | 12.619 | 1 |
| Qwen3-VL(32B) | 49.64 | 3.452 | 5 |
| Qwen2.5-VL(72B) | 54.47 | 9.366 | 2 |
| DA-DriveLM(4B) | 38.31 | 0.017 | 15 |
| ReasonDrive(7B) | 43.13 | 4.201 | 4 |
开环领先者不一定闭环领先:Qwen2.5-VL(72B) 的开环总分最高,但 Gemma-3-it(27B) 的 R4 更高;MiniCPM 的开环分与 Qwen3-VL(8B) 接近,闭环分却明显不同。表中专用驾驶模型也没有整体压倒通用模型,说明领域适配成功不能只由某项问答强项判断。
消融实验¶
下表对应表 3、表 4 的监督组干预,不是新网络模块的去除消融。开环变化量按表 3 原值保留,R4 绝对分按表 4 保留。
| Qwen3-VL(8B) 配置 | 开环综合分变化 | R4 综合分 | R4 相对基线增加 |
|---|---|---|---|
| 基线 | 0 | 0.902 | 0 |
| 最近距离 + 指定距离 + 定位(R1 组) | +2.14 | 4.943 | +4.041 |
| 多视角记忆 + 空间关系(R2 组) | +0.42 | 5.171 | +4.269 |
| 结果预测(R3_1) | +7.12 | 4.595 | +3.693 |
| ALL:全部选中弱项联合训练 | +20.88 | 8.021 | +7.119 |
单独监督指定对象距离后,最近对象距离提高 +35.78,普通对象计数提高 +10.91,时序计数提高 +3.03,说明部分数值与记忆任务存在迁移。但迁移并非全面正向:单独监督结果预测时,多视角记忆下降 −9.05;R2 组合的结果预测下降 −19.90。因此应保留负迁移证据,而不是把作者“没有系统性崩溃”的叙述理解为没有任何退化。
原文有两处需要保留边界。表 1 的 Qwen3-VL(8B) 开环总分为 45.09,表 3 的 Baseline* 为 45.10,本笔记不统一改写。表 3 的 R1 三任务组合在定位列仅为 +0.01,而单独定位监督为 +79.45,ALL 为 +79.74;这与“组合也监督定位”形成需要复核的结果差异,不能擅自把 +0.01 修成较大的数字。
关键发现¶
- 在 15 个模型上,R1、R2、R3 与 R4 的 Spearman 相关系数分别为 0.664、0.596、0.418。它们支持开环能力与闭环表现有关联,不支持“R1 导致 R4”或“推理能力不重要”的因果结论。
- R1 与 R2 相关为 0.843,而 R1–R3、R2–R3 分别为 0.346、0.425;最近距离与指定距离的任务相关高达 0.961。层级保留了共性和差异,但这种结构也取决于当前题型与参评模型。
- R2 组合的开环加权总分只增 +0.42,却取得单组干预最高的 R4 分 5.171;结果预测单组开环增 +7.12,R4 为 4.595。总分涨幅不是闭环迁移收益的可靠替代指标。
- 最强原始模型的 R4 也只有 12.619,转弯类别尤其困难,例如该模型转弯分为 0.212。论文没有提供重复运行置信区间,不能把小分差当成稳定排名证据。
亮点与洞察¶
- 评测目标从“谁的分数高”转向“强在哪里、弱在哪里、能否干预”。任务画像和受控 SFT 结合,比单独呈现一个新排行榜更有诊断价值。
- 冗余校正有明确边界:减少多个近似能力被重复计分,同时冻结权重保证后续比较稳定。可迁移的是这种校准后固定的协议,而不是直接照搬其驾驶层级预算。
- 统一动作桥避免给每个模型配置不同下游控制器,但保留了解析失败和执行限制。它提醒研究者,闭环能力是模型、提示、接口和执行环境的组合表现。
局限与展望¶
- 作者明确承认仿真闭环不是现实部署表现的直接代理;真实道路布局、硬件接入计划和受控场景都不能构成真实驾驶安全认证。
- R3 只有结果预测与图像排序,长期规划、反事实交通互动和复杂意图推断覆盖不足。“认知层级”名称不应掩盖实际测量任务的狭窄性。
- 单次确定性运行没有刻画仿真随机性、服务延迟和解析可靠性的方差;应增加重复试验,并报告路线、安全、效率和失败事件的不确定性。
- 权重受初始校准池、正相关截断和预算影响,应比较不同模型池及均匀权重下的排名稳定性。公开数据来源也需要审计训练污染、场景级划分与跨数据集重复。
- SFT 仅在一个基础模型上验证,且联合监督存在定位列的可疑差异;更有力的结论需要复核该结果,并加入其他模型、等数据量训练和随机弱项选择对照。
相关工作与启发¶
- vs DriveLM、LingoQA:它们提供驾驶语言问答及监督资源,本文重新组织多来源任务并加入闭环执行来诊断能力关联。价值在于评测协议,不能把整合后的原始数据都视为作者新采集。
- vs Bench2Drive、Bench2Drive-VL:这些工作强调闭环驾驶或 VLM 驾驶评测,本文强调分层开环画像与闭环结果之间的分析,并适配部分 Bench2Drive 评分实现。它不是对所有旧基准的同环境替代比较。
- 研究启发:可设计等数据量、跨基础模型的能力干预试验,并把预测的闭环改善与真实改善比较,检验“能力缺口选监督”是否优于随机选题。本论文只提供方向线索,没有完成这样的普适验证。
- 资源与来源:本笔记依据 arXiv v1 全文、方法、实验及附录 A–I。摘要给出上述 GitHub 链接,附录 B 另列匿名审稿地址
anonymous.4open.science/r/DriveHierarchy-2FD5;链接未在本次离线写作中核验。上游数据、模型及评分代码仍受各自许可约束,项目发布不等于可以任意重新分发所有原始资产。
评分¶
- 新颖性: 4/5 — 将分层开环画像、闭环执行和干预验证放在同一诊断协议中,主要创新是评测组织。
- 实验充分度: 3/5 — 覆盖 15 个模型及 100 个场景,但缺重复运行、跨基础模型干预和充分的权重敏感性分析。
- 写作质量: 3/5 — 方法与附录给出较多实现细节,但基线舍入差异及联合定位结果仍需澄清。
- 价值: 4/5 — 有助于定位驾驶 VLM 的能力缺口;应作为研究评测工具,而不是现实道路部署资格证明。