跳转至

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

会议: ECCV 2026
论文: ECCV 官方
领域: 自动驾驶
关键词: 双视域协同, 隐空间推理, 车路协同, 视觉语言模型, V2X 通信

一句话总结

提出车路双视域协同隐式推理架构 DH-VLM,由路端大模型聚合多层隐状态形成全局认知引导,并通过路端驱动隐式演化机制在车端两阶段推理中自适应细化局部规划,在降低 57.3% 通信开销的同时显著提升决策安全性与长时域规划精度。

研究背景与动机

端到端自动驾驶直接学习从原始传感器观测到轨迹控制指令的映射,克服了传统模块化流水线中误差串联累积与阶段间信息瓶颈的问题。然而,传统端到端方案高度依赖低级网格特征或离散查询向量,缺乏对复杂交互与罕见长尾工况的高层语义理解与因果推断能力。引入大规模视觉语言模型(VLM)为自动驾驶带来了强大的零样本泛化与复杂常识推理先验,但单车智能受限于车载传感器的有效感知范围、盲区与严重遮挡;若强行在车端部署高参数量 VLM,则会面临无法满足车载实时决策与功耗限制的高昂计算与显存开销。

车路协同(V2X)通过路侧基础设施(RSU)等外部智能体共享超视距视野,是打破单车感知物理局限的天然途径。然而,现有协同自动驾驶系统在信息交换范式上面临严峻的两难困境:早期融合方案传输原始图像或点云数据,引发不可承受的通信网络带宽开销;中期感知查询(Query)或 BEV 特征融合方案缺乏长时域因果推理,且感知导向与规划目标常存在错配;后期文本级语言协同(如 LangCoop)虽然带宽较低,但要求车端部署庞大模型以解析自然语言,且离散文本对路侧感知噪声与长时域不确定性极其敏感,一旦路侧给出错误文本建议,自车规划性能将发生剧烈退化。

面对车载计算约束、信道带宽瓶颈与语义推理鲁棒性之间的三角制约,本文借鉴单体智能中的双系统认知理论,将超视距全局推理与毫秒级局部执行进行空间与时域上的解耦。核心 idea:构建非对称双视域隐式推理框架,由路侧高算力模型聚合深层隐状态提炼全局认知先验,车端轻量模型通过两阶段隐式演化机制自适应吸收路端连续语义指导,在保证自车决策自主权与异步降级能力的同时实现低带宽、抗噪声的超视距协同规划。

方法详解

整体框架

DH-VLM 将车路协同自动驾驶解构为“路端全局推理视域(Global-Reasoning Horizon)”与“车端局部规划视域(Local-Planning Horizon)”的非对称架构。路侧部署高容量模型 Qwen2.5-7B,通过融合视觉编码器聚合路侧与车端感知查询,在统一的 3D 坐标空间下利用分层隐式特征聚合模块(HLA)从中间 Transformer 层的隐状态中提炼高维紧凑的全局引导特征 \(\mathbf{z}_t^{\text{inf}}\);车载侧则部署轻量级模型 Qwen2.5-0.5B,执行包含两阶段前向传播的自适应规划流程。车端在首轮前向生成本车初始隐状态,若成功接收到路端特征,则通过路端驱动隐式演化模块(IDLE)进行跨域特征对齐与交叉注意力融合,再经由第二轮前向递归细化轨迹输出;若网络丢包或延迟超标,自车则直接依靠首轮前向独立决策,实现无缝降级。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["车路多模态输入<br/>车端局部图像 + 路侧超视距视野 + 自车状态"] --> FVE["融合视觉编码器<br/>统一3D空间查询交互对齐"]
    FVE --> HLA["分层隐式特征聚合(HLA)<br/>中间层注意力汇聚与时序平滑"]
    HLA --> Comm{"异步稀疏 V2X 通信<br/>5:1 传输比 / 丢包与延迟判定"}
    Comm -->|接收成功| IDLE["路端驱动隐式演化(IDLE)<br/>MLP跨域对齐与两阶段递归细化"]
    Comm -->|通信中断/超时| Fallback["车端单阶段自主降级<br/>轻量 Qwen2.5-0.5B 独立生成轨迹"]
    IDLE --> Plan["协同安全轨迹输出<br/>避开盲区与交互冲突"]
    Fallback --> Plan
    QA["协同导向反事实问答监督<br/>场景拓扑 + 自车定位 + 假设轨迹推演"] -.->|三阶段联合训练| HLA
    QA -.->|增强安全敏感度| IDLE

关键设计

1. 分层隐式特征聚合(HLA):多层表征蒸馏与时序平滑

针对传统协同方案中传输最终文本输出导致误差级联放大、或传输稠密特征图导致带宽过载的问题,路端需要在压缩数据量的同时保留深层因果认知。大语言模型的表征特性表明,网络深层靠近输出端的隐藏状态倾向于过度偏向离散词元(token)分类概率,丢失了丰富的连续多模态空间几何与因果关系;而中间隐藏层则富集了结构化的时空拓扑与交互推理先验。为此,HLA 模块选取路端 VLM 的一组中间关键层 \(\mathcal{S} \subset \{1, \dots, L-1\}\)(实验证明选取 8 层最优),首先在每一层内部引入可学习查询向量 \(\mathbf{q}\) 实施注意力加权汇聚:

\[\text{Agg}(\mathbf{h}_l^{(t)}) = \sum_{i=1}^N \beta_{l,i}^{(t)} \mathbf{h}_{l,i}^{(t)}, \quad \beta_{l,i}^{(t)} = \frac{\exp(\mathbf{q}^\top \mathbf{h}_{l,i}^{(t)})}{\sum_{j=1}^N \exp(\mathbf{q}^\top \mathbf{h}_{l,j}^{(t)})}\]

随后通过层级可学习权重 \(w_l\) 进行归一化跨层加权整合:\(\tilde{\mathbf{z}}_t^{\text{inf}} = \sum_{l \in \mathcal{S}} \alpha_l \text{Agg}(\mathbf{h}_l^{(t)})\),其中 \(\alpha_l = \frac{\exp(w_l)}{\sum_k \exp(w_k)}\)。为消除路端因传感器观测轻微抖动和异步处理带来的高频噪声,系统进一步在时序滑动窗口 \(\mathcal{T}\)(窗口大小设为 5)内执行聚合函数 \(\mathbf{z}_t^{\text{inf}} = \mathcal{G}\left(\{\tilde{\mathbf{z}}_{t-\tau}^{\text{inf}}\}_{\tau \in \mathcal{T}}\right)\),生成时序一致、紧凑且富含高层全局语义的隐式引导向量。

2. 路端驱动隐式演化(IDLE):异构对齐与递归条件细化

车端与路端模型在参数规模(0.5B vs 7B)与特征分布上存在显著的异构性与维度不匹配,且车端必须具备对路侧不可靠信息的免疫力。IDLE 模块通过“软先验注入”和“两阶段前向”巧妙化解了这一矛盾。自车在时间戳 \(t\) 首先利用车载轻量 VLM 进行首轮前向传播,编码车载视觉与文本提示获得自车基础隐状态 \(\tilde{Q}_t^{\text{veh}}\)。在获得路端引导 \(\mathbf{z}_t^{\text{inf}}\) 后,模块先通过轻量级 MLP 适配器消除跨模型统计偏差:\(\bar{\mathbf{z}}_t^{\text{inf}} = \text{MLP}(\mathbf{z}_t^{\text{inf}})\)。随后,以车载隐状态 \(\mathbf{z}_t^{\text{veh}} = \text{MLP}(\tilde{Q}_t^{\text{veh}})\) 作为 Query,将路端对齐特征作为 Key 和 Value 进行交叉注意力交互:

\[\tilde{\mathbf{z}}_t^{\text{veh}} = \text{CrossAttn}(\mathbf{z}_t^{\text{veh}}, \bar{\mathbf{z}}_t^{\text{inf}}, \bar{\mathbf{z}}_t^{\text{inf}})\]

该机制将路端特征作为条件软先验注入,使得自车能够自适应筛选路侧可见的超视距潜在风险(如被前车遮挡的鬼探头行人),同时抑制路端长时域预测中的虚假报警。紧接着,车端启动第二轮递归前向传播 \(\hat{\mathbf{z}}_t^{\text{veh}} = \mathcal{F}_{\text{VLM}}^{\text{2nd}}(\tilde{\mathbf{z}}_t^{\text{veh}}, \mathcal{C}_t)\),将演化后的隐状态完全融入车载模型的内部动态,直接解码输出下游高精度规划轨迹。当遇到通信完全丢包或极端延迟时,自车仅保留首轮前向输出即可实现连续无缝的自主行驶。

3. 协同导向反事实问答数据集:以自车为中心的意图与安全风险推演

现有的单车自动驾驶 QA 数据集多关注通用的被动场景问答,无法促使路端大模型产生专门针对特定自车的安全规避建议。为此,本文基于真实车路协同基准 DAIR-V2X 构建了包含超过 8 万条问答对的协同导向数据集。数据集划分为两大逻辑层级:一是“基础场景理解”,监督路侧识别全局拓扑、车道线通行规则以及多目标运动趋势;二是“以自车为中心的个性化理解”,通过全局位姿标定将自车投射到路侧坐标系并执行自车视线遮蔽标注。在此基础上,路侧利用 Qwen2.5-VL-32B 针对自车规划意图开展反事实推演——系统枚举多条符合拓扑但潜在危险的假设轨迹(如激进超车、借道绕行),训练模型推演“如果自车按此轨迹行驶将发生何种冲突与碰撞后果”,进而输出具备前瞻预警和安全纠偏的战略建议。这种细粒度推理监督使得路侧提炼的隐藏状态内蕴强烈的安全防碰撞意识,从源头上赋能了高质量隐式特征的生成。

损失函数 / 训练策略

训练采用系统解耦的三阶段进阶优化策略: - 第一阶段(路端语义对齐):冻结视觉编码器底座,在协同 QA 数据集与视觉输入上微调路侧 Qwen2.5-7B,学习率设为 \(1 \times 10^{-5}\),使其掌握全局道路拓扑认知与自车反事实碰撞推理; - 第二阶段(车端基准感知):仅使用车载摄像头传感器数据独立训练车端 Qwen2.5-0.5B,学习率设为 \(1 \times 10^{-4}\),确保自车具备扎实的单车自主感知与应急避障兜底能力; - 第三阶段(车路隐式协同联合微调):冻结两侧语言模型主干,专门训练 HLA 模块中的层级注意力汇聚权重、IDLE 模块中的跨域对齐 MLP 适配器与交叉注意力交互层。优化器选用 AdamW,权重衰减设为 0.03。通信频率采用 5:1 的异步周期设定,平衡路端 7B 模型与车端 0.5B 模型的推理帧率匹配。

实验关键数据

主实验

在 DAIR-V2X 真实车路协同数据集上,将 DH-VLM 与单车智能基线(VAD、UniAD、SparseDrive、OpenDriveVLA)以及前沿多智能体协同基线(V2VNet、CooperNaut、UniV2X、UniMM-V2X、V2X-VLM、LangCoop)进行轨迹位移误差(L2 Error)与碰撞率(Collision Rate)的系统对比。

方法分类 方法名称 1s L2↓ 3s L2↓ 5s L2↓ 平均 L2 (m)↓ 1s CR↓ 3s CR↓ 5s CR↓ 平均 CR (%)↓
单车智能 VAD 1.65 3.80 5.78 3.72 0.86 1.28 1.95 1.35
单车智能 UniAD 1.26 3.06 5.22 3.15 0.88 1.32 1.45 1.17
单车智能 SparseDrive 1.02 2.37 3.87 2.39 0.46 1.28 1.58 1.18
单车智能 OpenDriveVLA 0.64 2.69 5.57 2.89 0.15 0.59 0.44 0.53
车路协同 V2VNet 1.96 3.41 4.73 3.28 0.74 1.03 1.58 1.09
车路协同 CooperNaut 2.69 5.50 7.94 5.24 1.18 1.76 1.69 1.58
车路协同 UniV2X 1.45 3.04 5.24 3.18 0.15 0.44 0.74 0.41
车路协同 UniMM-V2X 0.78 2.05 5.00 2.60 0.05 0.15 1.18 0.42
车路协同 V2X-VLM 0.49 2.89 5.34 2.87 0.05 0.15 0.68 0.26
车路协同 LangCoop 0.30 1.96 4.58 2.19 0.05 0.44 1.02 0.51
车路协同 DH-VLM (本文) 0.26 1.76 3.72 1.87 0.05 0.11 0.44 0.19

在车载端部署开销方面,对比各协同方法的车载参数量、显存占用与传输带宽需求:

方法名称 车端参数量 (M)↓ 车端显存占用 (GB)↓ 通信传输开销 (BPS)↓
V2VNet 262.1 6.09 \(8.19 \times 10^7\)
UniV2X 264.2 6.11 \(8.09 \times 10^5\)
UniMM-V2X 267.8 6.14 \(9.32 \times 10^5\)
V2X-VLM 776.5 10.92 \(1.24 \times 10^7\)
LangCoop 7384.5 17.74 \(\sim 4 \times 10^3\)
DH-VLM (本文) 640.6 4.54 \(3.45 \times 10^5\)

消融实验

为验证路侧引导注入形式(离散文本 vs 连续隐式特征)在面对不同程度的路侧噪声时的鲁棒性,评测了在不同路侧自身规划质量水平(•: 优秀 \(<2\)m, ◦: 中等 \(2\sim 4\)m, △: 较差 \(>4\)m)下车端的表现:

协同引导形式 路侧质量等级 1s L2↓ 3s L2↓ 5s L2↓ 平均 L2 (m)↓ 1s CR↓ 3s CR↓ 5s CR↓ 平均 CR (%)↓
无路端协同(单车基线) - 0.64 2.69 5.57 2.89 0.15 0.59 0.44 0.53
文本级直接注入 (Text) •(优) 0.19 1.59 3.98 1.83 0.05 0.05 0.45 0.17
文本级直接注入 (Text) ◦(中) 0.44 2.31 4.98 2.48 0.15 0.34 1.27 0.54
文本级直接注入 (Text) △(劣) 2.26 5.63 9.15 5.66 0.43 1.84 4.99 2.38
隐式特征融合 (Latent, 本文) •(优) 0.26 1.76 3.72 1.87 0.05 0.11 0.44 0.19
隐式特征融合 (Latent, 本文) ◦(中) 0.24 1.82 3.99 1.98 0.05 0.24 0.58 0.28
隐式特征融合 (Latent, 本文) △(劣) 0.26 2.07 4.50 2.19 0.15 0.57 1.02 0.56

此外,针对通信传输比与 HLA 聚合层数的敏感性消融显示: - 聚合层数影响:固定 5:1 传输比下,聚合 8 层时平均 L2 为 1.87m、碰撞率 0.19%;当仅使用模型最后一层输出状态(Fused Layers = 1)时,平均 L2 退化至 2.06m、碰撞率增至 0.32%,证明单层浅显特征丢失了多层推演信息; - 模块替换消融:将 HLA 替换为普通 MLP 聚合时,平均 L2 误差上升 23.5%(从 1.87m 恶化至 2.31m),碰撞率由 0.19% 飙升至 0.39%;将车端 IDLE 替换为简单 MLP 拼接时,平均 L2 误差上升 32.6%(恶化至 2.48m),碰撞率升至 0.34%;两者均缺失时平均 L2 恶化至 2.59m、碰撞率达到 0.47%。

关键发现

  • 隐式协同兼具高精度与极致鲁棒性:当路侧感知因视线不佳或目标误检出现严重错误时(△ 等级),文本协同方法会将错误建议无条件采纳,导致平均 L2 误差剧增至 5.66m(比单车基线差 95.8%),碰撞率高达 2.38%(恶化 349.1%);而 DH-VLM 将路端特征作为注意力先验软注入,自车通过局部感知自适应过滤误导信号,即使路端严重失真,平均 L2 依然压制在 2.19m、碰撞率仅 0.56%,全面保障了行车安全性。
  • 中间层隐特征是语义密度的甜点区:实验清晰揭示仅传输 VLM 最后一层隐藏状态会导致显著的性能损失,因为顶层特征已被高度词元化、针对文本 token 分布坍缩;而中间 8 层保留了最优的空间几何、时空因果与交互约束,展现出极高的信息承载力。
  • 显存与带宽双重减负:相比同为 VLM 协同架构的 V2X-VLM,通信速率从 \(1.24 \times 10^7\) BPS 骤降至 \(3.45 \times 10^5\) BPS(节省 97.2%),车端显存从 10.92 GB 降至 4.54 GB(降幅 58.4%);相比基于 Query 的非语言端到端方案 UniV2X,通信开销亦缩减了 57.3%,彻底使消费级车载算力平台运行大模型协同决策成为可能。

亮点与洞察

  • 认知层面的非对称双视域架构:打破了过去车车或车路协同中各端必须部署相同体量模型或对称特征图的思维定势,路端 7B 专攻全局长时域推演、车端 0.5B 专攻即时安全控制,用算力非对称匹配场景物理属性。
  • 从离散文本通信回归连续隐式表征:避免了将连续视觉空间压缩成离散自然语言、再由接收端解析为动作时的语义信息损失与不可导性,以特征流替代文本流,实现了端到端梯度优化与连续软约束。
  • 两阶段递归推理保障绝对底线安全:通过第一阶段独立建图 + 第二阶段条件细化的架构设计,原生支持任意比例的通信丢包与信道延迟,为车联网系统设计了天然的退化冗余路径。

局限与展望

  • 开环评测的局限性:受限于当前公开真实车路协同数据集(如 DAIR-V2X)的数据采集机制,所有规划实验均在离线开环轨迹重放模式下完成,缺乏在闭环动态模拟器中面对自车动作引发环境反馈交互的长期验证。
  • 未扩展至端到端连续动作控制(VLA):当前模型直接输出离散时间步规划轨迹点,尚未直接打通至车辆底盘执行机构的油门、刹车与方向盘力矩控制(Vision-Language-Action),未来可进一步探索隐式空间到连续控制律的端到端演化。

相关工作与启发

  • vs UniV2X / UniMM-V2X: 后者在车路之间传递密集的 BEV 特征或稀疏感知 Query,本质上仍局限于感知几何层面的特征融合,缺乏对罕见异常行为的高层常识推理;DH-VLM 引入 VLM 深度推理能力,在保持同等甚至更低带宽的同时大幅降低了碰撞率。
  • vs LangCoop: LangCoop 探索了车车之间直接发送自然语言建议的合作方式,但不仅需要车端承载百亿级庞大 LLM 解码开销,而且离散语言缺乏容错性;DH-VLM 采用连续特征对齐,兼具高语义表现力与抗噪鲁棒性。
  • vs V2X-VLM: V2X-VLM 倾向于在早期共享原始多视点图像或高级视觉表征,导致传输带宽突破 \(10^7\) BPS,完全无法适应拥塞的城市车联网信道;DH-VLM 仅在 5:1 稀疏周期下传输紧凑隐式向量,极大地契合了工程落地需求。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出并在车路协同自动驾驶中实现大模型隐空间特征融合,构筑了双视域非对称认知协同范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 包含完备的主规划指标、显存与通信带宽分析、对抗性路端噪声消融、时延丢包测试以及反事实问答定性可视化。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念清晰,数学形式严谨,动机与实验设计环环相扣。
  • 价值: ⭐⭐⭐⭐⭐ 为大模型上车与车路协同落地的算力、通信与安全三角矛盾给出了极具启发性的工程与学术解决方案。