Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/
领域: 自动驾驶
关键词: 端到端自动驾驶, 交通要素感知, 拓扑推理, 即插即用, 轨迹规划
一句话总结¶
针对主流端到端自动驾驶系统忽视红绿灯和交通标志等规则性交通要素的缺陷,本文提出了轻量级即插即用的 3D 交通要素辅助监督与自车相关拓扑语言条件机制,在 nuScenes、NAVSIM-v1/v2 和 Bench2Drive 四大基准上全面提升了各类规划器的安全性与合规性。
研究背景与动机¶
端到端自动驾驶系统近年来迅速从实验室原型走向工业部署,涵盖了基于感知-预测-规划级联、直接回归、轨迹打分、扩散生成以及视觉-语言-动作(VLA)模型等多种技术范式。然而,在现有文献与基准中,一个直接制约人类驾驶决策的核心要素却被普遍边缘化——交通灯与交通标志等交通要素(Traffic Elements, TE)。在真实道路中,交通要素并非可有可无的背景纹理,而是直接规定行驶可行动作空间(如红灯停绿灯行、禁止右转、分道行驶许可)的法定规则信号。统计表明,在 nuScenes 和 NAVSIM-v1 等基准中,超过 55% 到 65% 的场景均包含交通要素,这意味着交通要素是自动驾驶常态化交互对象而非长尾偶发个案。
然而,现有端到端系统普遍欠缺对交通要素的系统性建模与量化分析。导致这一现状的核心阻碍主要有二:一是公开数据集缺乏完备且结构化的 3D 交通要素与拓扑真值标注;二是现有端到端模型架构与训练范式异构繁复,单一模型的特化改进很难推广成为通用规律。现有模型往往将特征容量倾斜于前景动态障碍物(机动车、行人)和密集几何结构,在复杂交叉路口容易生成几何上看似平滑平顺、但在交通法规上属于违规穿行的危险轨迹。
本文没有针对特定模型搭建孤立的专用规划器,而是旨在建立一套最小化且通用的基础研究框架。研究切入点是构建完备的 3D 交通要素基准并提炼极简集成路径。核心 idea:通过构建多数据集统一的 3D 交通要素标注,引入即插即用的轻量级 3D 辅助检测监督,并结合紧凑结构化语言编码的自车局部车道-要素拓扑先验,以极低计算开销为异构端到端规划器注入强鲁棒的规则感知与安全约束。
方法详解¶
整体框架¶
本文方法的整体 pipeline 分为两个核心阶段:离线跨基准 3D 交通要素数据自动化构建,以及在线端到端规划器的即插即用规则注入。针对输入的前视与多视角图像,主干网络提取潜在视觉查询(如 BEV 查询 \(Q_{\text{bev}}\))。为解决稀疏微小交通要素容易被稠密几何背景梯度淹没的问题,模型外挂独立的 3D 交通要素检测头进行多任务辅助监督;同时,将场景全局车道中心线拓扑与要素关联拓扑在自车坐标系下进行局部筛选,转化为结构化语言文本后经冻结语言编码器生成拓扑查询 \(Q_{\text{topo}}\)。最终,视觉查询与拓扑查询拼接送入规划解码器输出安全轨迹。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["多视角图像 + 点云输入"] --> B["3D 交通要素自动化提取<br/>2D 检测 + 单目深度 + LiDAR 投影"]
B --> C["独立 3D 交通要素辅助监督<br/>3D 中心坐标 L1 与类别 Focal Loss"]
A --> D["多视角视觉编码器<br/>生成 BEV 特征查询 Q_bev"]
C -.->|梯度回传优化特征| D
A --> E["自车局部拓扑语言条件化<br/>提取自车相关车道与要素并文本化"]
E --> F["冻结 BERT 语言编码器<br/>生成拓扑查询 Q_topo"]
D --> G["双流空间特征拼接<br/>Q_plan = [Q_bev; Q_topo]"]
F --> G
G --> H["规划解码器 Trajectory Decoder<br/>输出合规自车行驶轨迹"]
关键设计¶
1. 3D 交通要素自动化提取:多模态几何融合伪标签流水线 为了消除公开数据集中交通要素 3D 空间结构标注缺失的瓶颈,本文建立了一套从 2D 图像与激光雷达点云中稳健解算 3D 中心坐标 \((x, y, z)\) 的自动化管线。对前视图像分别执行 2D 交通要素检测与单目稠密深度估计(采用 UniDepthv2 模型),利用相机内外参矩阵将 2D 边界框投影至激光雷达坐标系中,融合深度先验与对应区域的激光点云聚类,精准解算出每个交通要素的 3D 物理中心点。在缺少标注的 NAVSIM 数据集上,研究团队通过数据增强、类别重采样、损失重加权、伪标签迭代和测试时增强(TTA),在 OpenLane-V2 上将 YOLOv8 优化为高精度检测器,成功为 NAVSIM-v1 和 NAVSIM-v2 全量场景生成了高质量的 3D 交通要素伪标签。
2. 独立 3D 交通要素辅助监督:梯度解耦与峰值保留双流表征 针对交通要素在整个鸟瞰图(BEV)中极其微小稀疏、若直接作为语义分割类别会被稠密背景梯度压制的痛点,本文采用独立预测头与 Focal Loss 进行解耦监督。对于每个交通要素,使用 L1 损失监督其 3D 真实中心坐标,并使用 Focal Loss 监督其类别标签。在特征下采样交互过程中,传统平均池化会严重稀释微弱特征,因此采用自适应最大池化(Adaptive Max Pooling)保留峰值响应,并将最大池化后的要素特征直接以通道拼接(Concat)形式并入 BEV 记忆中,构建对齐的“双空间流(Dual Spatial Stream)”。相较于复杂的交叉注意力(Cross-Attention),直接拼接提供了更为明确且保真的空间约束,使规划器稳定对齐车道规则。
3. 自车局部拓扑语言条件化:结构化文本映射与紧凑注入 全局拓扑关系(车道间连通性 \(R_{\text{LCLC}}\) 与车道-要素从属关系 \(R_{\text{LCTE}}\))蕴含全图数百条交互,直接输入不仅冗余而且会引入大量与自车无关的远端噪声干扰。本文根据自车当前位姿识别其所在车道 ID,在拓扑邻接矩阵中定向检索与自车紧密相关的车道中心线以及直接约束自车车道的交通要素,形成局部紧凑子图。随后,将该子图映射为一段直观的结构化自然语言序列(例如描述前方受红绿灯状态与转向禁止标志控制,并连接特定方向车道)。该文本由预训练且参数冻结的 BERT-base 编码为紧凑的拓扑查询向量 \(Q_{\text{topo}}\)。相比图卷积网络(GCN)容易在离散交通标志与连续中心线混合节点上产生特征过平滑问题,语言模型将异构几何与逻辑语义统一映射到高维语义空间,完整保留了长程因果规则约束。
损失函数 / 训练策略¶
系统的整体多任务训练损失定义为主规划损失与辅助损失的线性加权组合: $$ \mathcal{L}{\text{total}} = \mathcal{L}}} + \sum_k \lambda_{\text{aux}}^{(k)} \mathcal{L{\text{aux}}^{(k)} + \lambda}} \left( \mathcal{L{\text{L1}}^{\text{TE}} + \mathcal{L} \right) $$ 其中,}}^{\text{TE}\(\mathcal{L}_{\text{plan}}\) 为轨迹模仿学习或生成损失,\(\mathcal{L}_{\text{aux}}^{(k)}\) 为各基准原有的辅助监督目标(如 3D 目标检测、运动预测、语义占据栅格等),交通要素权重 \(\lambda_{\text{TE}}\) 设置与原有辅助任务权重保持完全一致。在 nuScenes 和 Bench2Drive 上采用 8 张 NVIDIA A100 GPU 训练,NAVSIM 上使用 4 张 RTX 3090 GPU 训练,完全沿用各 baseline 的学习率与衰减策略。
实验关键数据¶
主实验¶
评估跨越三大开环基准(nuScenes、NAVSIM-v1、NAVSIM-v2)和一个闭环仿真基准(Bench2Drive)。以下汇总代表性模型在各基准上的性能提升对比。
| 基准 / 任务 | 评估指标 | 基础模型 | 基础得分 | + 本文方法 (Ours) | 提升幅度 |
|---|---|---|---|---|---|
| nuScenes (Open-Loop) | Avg. L2 (m) ↓ | VAD-Base | 0.72 | 0.60 | -0.12 m |
| nuScenes (Open-Loop) | Avg. Collision (%) ↓ | VAD-Base | 0.22 | 0.17 | -0.05% |
| nuScenes (VLA 架构) | Avg. L2 (m) ↓ | Orion | 0.34 | 0.26 | -0.08 m |
| nuScenes (VLA 架构) | Avg. Collision (%) ↓ | Orion | 0.37 | 0.23 | -0.14% |
| NAVSIM-v1 (navtest) | PDMS ↑ | LTF (回归式) | 84.1 | 85.2 | +1.1 |
| NAVSIM-v1 (navtest) | PDMS ↑ | DiffusionDrive (扩散式) | 86.0 | 87.7 | +1.7 |
| NAVSIM-v1 (navtest) | PDMS ↑ | DrivoR (打分式) | 93.1 | 94.4 | +1.3 |
| NAVSIM-v1 (+SimScale) | PDMS ↑ | DrivoR + SimScale | 94.6 | 95.1 | +0.5 (超人类 94.8) |
| Bench2Drive (Closed-Loop) | Driving Score ↑ | VAD | 42.3 | 56.4 | +14.1 |
| Bench2Drive (Closed-Loop) | Driving Score ↑ | DriveTransformer-L | 63.46 | 68.29 | +4.83 |
在 NAVSIM-v2(navhard-two-stage)两阶段伪闭环基准中,各范式规划器的 EPDMS 提升均非常显著: - 回归式 LTF:从 25.1 提升至 28.9(+15% 相对提升);联合 SimScale 协同训练后从 33.6 进一步冲至 36.9。 - 扩散式 DiffusionDrive:从 29.4 提升至 32.7(+11% 相对提升);联合 SimScale 后达到 37.9。 - 打分式 DrivoR:从 48.3 提升至 51.8(+7.2% 相对提升);联合 SimScale 后达到 57.9(创下新 SOTA)。
消融实验¶
针对交通要素表示形式与网络集成架构,在 NAVSIM-v2 上使用 LTF 进行了系统的消融实验。
| 配置编号 | 实验变体 | 核心改动说明 | EPDMS ↑ | 增益对比 |
|---|---|---|---|---|
| 0 | LTF Baseline | 原始回归规划器 | 25.1 | 基准 |
| 1 | + TE(2D) | 仅引入前视 2D 交通要素边界框 | 28.1 | +3.0 |
| 2 | + depth(FV) | 引入全图前视全局稠密深度辅助任务 | 27.7 | +2.6 |
| 3 | + TE(LiDAR) | 2D 框直接投影激光雷达点云聚类解算 3D | 27.9 | +2.8 |
| 4 | + TL Only | 仅监督交通信号灯,剔除交通标志 | 26.7 | +1.6 |
| 5 | + Class-Agnostic TE | 仅监督 3D 位置 L1,剔除语义类别损失 | 26.2 | +1.1 |
| 6 | Ours (Full TE) | 3D TE 独立头 + Focal Loss + MaxPool + Concat | 28.9 | +3.8 |
在拓扑先验整合策略的消融中(nuScenes / VAD 基线,原 L2 Avg 为 0.72m,CR Avg 为 0.22%): - 仅引入 LCLC 连通拓扑:L2 降至 0.63m,CR 降至 0.16%。 - 仅引入 LCTE 要素从属拓扑:L2 降至 0.62m,CR 降至 0.18%。 - GCN 拓扑图编码:CR 为 0.23%(存在过平滑退化)。 - BERT 语言结构化编码:CR 优化至 0.16%,L2 保持 0.62m。 - 全局拓扑 vs 自车局部拓扑:全局拓扑引入无关干扰,碰撞率恶化至 0.50%;自车局部拓扑将碰撞率压缩至 0.16%。
关键发现¶
- 交通标志与信号灯同等关键:仅监督红绿灯(TL Only)的增益仅有 +1.6 EPDMS,补齐各类路面与悬挂交通标志后增益翻倍达到 +3.8,证明限速、禁止转向等标志是消除合规违章的核心约束。
- 目标级深度优于全局几何:显式解算目标要素 3D 深度优于直接监督全景深度图(28.9 vs 27.7),表明全局密集深度包含了大量非关键路面几何噪声,而目标级 3D 建模将注意力精准聚焦于高信噪比约束。
- 语言编码显著优于图卷积(GCN):在拓扑图融合中,车道中心线(连续折线)与要素(离散语义标签)属于异质多模态节点,GCN 的邻域聚合导致语义模糊;而语言建模将其转换为具有逻辑先后的因果序列,表现出压倒性优势。
- 上游感知具备良好容错鲁棒性:在推理阶段对预测的交通要素主动注入高达 10 米的深度误差、55% 的漏检率或 20% 的误检率时,规划性能缓慢线性衰退,但在全部扰动下依然稳健高于基线规划器(EPDMS > 25.1)。
亮点与洞察¶
- 即插即用的极简设计:无需对规划器骨干网络进行侵入式大改,仅通过一个轻量辅助 3D 目标检测头(训练阶段提供正则化约束,推理阶段可选辅助)和紧凑文本拓扑投影,实现对感知规划、回归、扩散、打分及 VLA 模型的一体化适配。
- 计算推理开销微乎其微:相较于动辄数秒延迟的大型端到端 VLM/VLA 模型,轻量化的拓扑生成与要素检测仅使推理帧率降低约 0.3 FPS(延迟增加 4-5ms),使得高吞吐实时嵌入式车载部署完全可行。
- 可迁移的规则注入思路:将复杂的符号化拓扑图通过模板语言序列化输入通用小型语言模型,这种“拓扑序列化语言编码”思路能够直接推广至自动驾驶高精地图路网推理、无人配送路径规划以及具身机器人导航等需要遵循显式交通规则的领域。
局限与展望¶
- 复杂气象与恶劣光照下的鲁棒性:虽然对一般检测噪声表现稳健,但在暴雨、强逆光或夜间等极端恶劣环境下,单目深度估计模型的先验偏差可能扩大,影响 3D 交通要素的定位准确率。
- 对动态交通信号时序理解的欠缺:当前工作主要基于单帧或短时序前视图像检测交通要素,对于黄灯闪烁过渡、绿波带倒计时等涉及复杂时序动力学判断的场景尚未做专门时序建序建模。
- 未来方向:探索在端到端世界模型或长时序视频自监督架构中联合建模时序交通信号状态变迁,并将车路协同(V2X)数字规则信号直接与语言拓扑条件进行多源融合。
相关工作与启发¶
- vs OpenLane-V2 与 TopoMLP: OpenLane-V2 提出了车道与要素拓扑感知的基准与评测,TopoMLP 针对拓扑关系刷榜;但它们局限于感知层面,未验证拓扑信息对下游端到端规划的实际驱动效用。本文打通了从拓扑感知到规划落地的完整因果链路,首次系统量化了要素与拓扑对规划的实质价值。
- vs UniAD / VAD 等主流规划器: UniAD 和 VAD 将特征关注点重度放在动态障碍物(车辆、行人)的占据栅格和连续地图边界上,缺乏对离散法定交通信号的显式表征;本文作为轻量插件直接补齐了这一决策盲区,在保持原推理速度的同时显著降低了路口违规率。
- vs DriveVLM / OmniDrive 等大模型端到端方案: VLM 方案依赖数十亿参数的多模态大模型进行高层语义推理,虽然具备规则理解能力但推理速度极其缓慢(< 1 FPS)。本文通过“辅助 3D 监督 + 小型语言模型拓扑编码”以极高性价比(仅掉 0.3 FPS)实现了相当水准的规则遵循能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性量化交通要素对多种现代端到端驾驶范式的作用并提出极简即插即用框架。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大主流基准、6 种主流端到端模型,横跨开环、闭环仿真以及真实数据引擎协同训练。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,实验消融深入,动机论述直击当前研究痛点。
- 价值: ⭐⭐⭐⭐⭐ 对工业界部署端到端自动驾驶具有极高的实用价值与工程指导意义。