Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3394
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/1261.pdf
代码: https://github.com/wjl2244/BeyondDrive
领域: 自动驾驶
关键词: 模仿学习、困难负样本、流匹配、安全边界、轨迹规划
一句话总结¶
BeyondDrive 不只让规划器靠近专家轨迹,还让它远离“离专家很近却不安全”的生成轨迹,在优化后 LTF 基线上将 NAVSIM v1 PDMS 从 88.7 提升到 89.7、NAVSIM v2 EPDMS 从 89.1 提升到 90.1,并展示跨规划器及 HUGSIM 零样本迁移结果。
研究背景与动机¶
端到端驾驶通常把未来规划当作轨迹回归:给定传感器观测和导航指令,预测轨迹越接近专家演示,训练损失就越小。但几何偏差不等于风险。同样向左右偏移,向车道内部的一侧可能仍然安全,向路沿或前车的一侧却可能导致越界或碰撞。论文把这种“相近模仿误差、不同安全后果”的现象称为安全非对称性。只提供成功轨迹,模型就很难知道专家周围哪一侧可以偏、哪一侧不能偏。
DiffusionDrive、MeanFuser、WoTE 等方法用多个候选和评分器缓解单轨迹回归的局限,不过推理时丢弃低分轨迹,并不等于把失败作为监督用于优化规划器。本文关注的是更局部的边界学习:远离专家的明显坏轨迹可能没有多少训练价值,真正需要的是看起来几乎模仿正确、却越过安全边界的困难负样本。反过来,单纯生成大量相似轨迹也未必能得到这些样本,因为生成器可能集中在少数高概率模式附近。
核心 idea:先从多样化候选中筛出低安全分、再选其中最接近专家的轨迹,用“靠近专家 + 有限度远离失败”的联合监督学习轨迹空间中的安全边界。
方法详解¶
整体框架¶
BeyondDrive 是训练框架,不是要求车辆在线运行一个新的避障搜索器。第一阶段用条件流匹配生成候选,经多样性采样和两阶段负样本筛选得到每个场景的困难负样本;第二阶段把负样本加入原规划器的训练。最终执行的仍是经过安全增强的规划器,负样本生成和筛选属于训练数据构造环节。
任务输出是在自车坐标系中表示的未来 4 秒轨迹:2 Hz、8 个航点,每点含位置与朝向。条件生成器使用前视图像、自车速度和加速度、导航指令;其感知模块与 LTF 相同。下游既可以是相机输入的 LTF,也可以是额外使用 LiDAR 的 TransFuser,不能把下游的全部传感器都误写成负样本生成器的输入。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
INPUT["场景条件与专家轨迹"] --> GEN["条件流匹配"]
GEN --> DIV["多样性采样<br/>64 条候选"]
DIV --> SELECT["两阶段负样本筛选<br/>低分中选最近"]
SELECT --> TRAIN["截断排斥训练"]
INPUT -->|专家模仿监督| TRAIN
TRAIN --> OUTPUT["安全增强规划器<br/>8 个未来航点"]
关键设计¶
1. 条件流匹配:先学驾驶轨迹分布,而不是直接拟合事故数据
生成器的训练终点是专家轨迹,而非真实事故轨迹。它把高斯噪声与向量化专家轨迹做线性插值,学习从噪声流向轨迹的速度场;场景条件由编码器提供,速度网络由 Transformer Decoder、LayerNorm 和前馈网络组成。特别之处在于,论文使用 L1 速度回归,而不是预备知识部分介绍的常规平方误差。这一步提供一个了解当前场景、能生成接近专家候选的模型,但本身并不保证候选危险。
训练时以 0.1 的概率丢弃条件,使同一个网络同时学到有条件和无条件的速度估计。这样后续才可以用 classifier-free guidance(CFG)控制对条件的依赖,而不必另外训练一个无条件模型。以下保留决定机制的数学表达;缓存中公式排版有缺损,公式按第 4 节相邻文字整理,属于可读重述而非逐字公式转录,精确记号以 PDF 为准。
这里 \(x_0\) 来自高斯先验、\(x_1\) 是专家轨迹的向量表示,\(t\) 在 \([0,1]\) 均匀采样;\(\mathcal{C}_{\mathrm{in}}\) 是保留或丢弃后的场景条件。直观地说,生成器先学“这类场景里车通常如何运动”,失败样本再由采样和筛选从这一邻域中挖掘出来。这与对专家轨迹随意加噪声后直接认定为危险不同。
2. 多样性采样:适度减弱条件约束,同时扩大初始噪声
一个拟合良好的条件生成器可能反复生成相似的安全轨迹。若没有足够不同的候选,就无法找到专家附近的多种失败方向。因此作者同时采用较低 CFG 权重与更大的采样噪声:训练先验标准差为 \(\sigma\),生成负样本时变为 \(2.0\sigma\);CFG 权重取 \(w=0.5\),每个场景并行生成 64 条候选,以 5 个流匹配采样步求解 ODE。
\(w=1.0\) 恢复普通条件生成,\(w=0.5\) 则减弱对条件模式的集中程度,并非惯常用大于 1 的 guidance 强化条件。扩大噪声也不是最终目标:它扩大探索范围,之后仍要筛掉无关轨迹。有效负样本场景比例从 8.0% 到 78.8%,再到 96.4%,说明“生成多少条”和“覆盖多少种失败”是两件事;64 条近乎重复的候选仍可能不够有用。
3. 两阶段负样本筛选:先确保低分,再追求接近专家
每条候选先通过安全与驾驶质量评分函数 \(S\),实现中使用 PDMS。它考虑碰撞、是否离开可行驶区域、碰撞时间、舒适性和行进效率。首先保留 \(S(\tau)<\xi\) 的低分候选,然后在其中选与专家轨迹距离最近的一条。距离按航点累计欧氏距离衡量。顺序很关键:直接找最近轨迹很可能得到另一个安全演示,直接找最低分轨迹则可能得到离正常驾驶太远的容易负例。
这一步中的“困难”是低分条件下的专家邻近性,不是负样本评分越低越好。还需要注意,PDMS 是复合驾驶分数,低分并不逻辑等价于发生碰撞,不能把全部负例都描述成事故轨迹。评分器提供训练信号的操作性定义,方法没有证明这个定义覆盖全部真实安全风险。
缓存正文没有明确给出阈值 \(\xi\),也没有说明低分候选集合为空时的处理规则。有效负样本覆盖率 96.4% 并不等于每个场景都有负样本;不能据此自行补写跳过场景、补采样或损失掩码的实现。生成样本的物理可执行性与评分器对长时间交互的可信度,也仍然是后续训练效果的前提。
4. 截断排斥训练:惩罚靠近负例,但不无限奖励逃离负例
下游规划器先把轨迹转为一阶位移及朝向的正余弦表示,即每个航点使用 \((\Delta x_k,\Delta y_k,\sin h_k,\cos h_k)\)。位移对应 0.5 秒内的运动,而不是未缩放的速度;正余弦避免朝向跨角度边界时的不连续。模仿损失和排斥损失都在这个表示中计算,所以生成阶段的几何近邻筛选与训练阶段的差分 L1 距离不是同一种距离,不能混为一谈。
最小化负距离会把预测推离负例,但只推到截断常数 \(C\) 为止。距离超过该上限后,排斥项不再持续鼓励轨迹偏离;专家模仿项则始终拉向正常行为。这不是在嵌入空间区分标签的普通对比学习,也没有新建一个推理评分器,而是直接改变预测轨迹的训练梯度。它能形成经验上的区分边界,但不构成形式化安全保证。
一个完整示例¶
原文图 3 的一个案例是需要停车的路口:LTF* 仍预测向前行驶,导致 NC 和 TTC 都为 0。对应训练机制可以这样理解:对同一场景生成 64 条候选,经 PDMS 低分过滤后,选出最接近专家停车轨迹的失败轨迹,再以它作为排斥目标。专家监督拉向停车行为,负样本监督则指出“继续往前”这一局部偏移的危险。
这个过程最终仍输出 4 秒、8 航点的轨迹,不是增加一个在线紧急制动规则。论文没有给出这个案例过滤后还剩多少条候选、具体间距或速度,因此这里不添加这些数值。图示案例支持机制解释,但不能代替大规模碰撞风险评估。
损失函数 / 训练策略¶
总目标为模仿损失、RD 损失和语义辅助损失的加权和。原文先把地图重建辅助项记为 \(\mathcal L_{\mathrm{map}}\),总目标又写成 \(\mathcal L_{\mathrm{sem}}\),记号存在不一致;可以确定有栅格化 HD 地图的辅助监督,但不能据此臆造两个独立辅助头。损失权重和截断常数 \(C\) 的具体取值未在可读正文明确列出。
训练 batch size 为 32,共 100 epochs,采用余弦退火、3 个 warmup epochs,峰值学习率为 \(2\times10^{-4}\)。调参还包括降低辅助任务损失权重。图 4 的文字说明指出,RD 权重逐渐增加能够改善结果,但应低于模仿损失权重,否则不收敛;图中精确曲线值未能从缓存读取,不补写最佳权重比例。
实验关键数据¶
主实验¶
NAVSIM v1 使用约 85k 个 navtrain 场景、约 12k 个 navtest 场景,属于短时、非反应式伪仿真评估;NAVSIM v2 使用会响应自车的交通参与者。PDMS 为 NC 与 DAC 乘以 EP、TTC、舒适性按 5:5:2 加权的均值。EPDMS 还覆盖行驶方向、信号灯、车道保持及历史/扩展舒适性。两者不是完全相同的指标,不应直接比较跨版本数值高低。
下表摘自原文表 1、2、4,均为越高越好;C 表示相机,C+L 表示相机与 LiDAR,分数差用点数而非相对百分比表示。
| 模型 | 输入 | NAVSIM v1 PDMS | NAVSIM v2 EPDMS |
|---|---|---|---|
| TransFuser | C+L | 84.0 | 84.4 |
| TransFuser v7 | C+L | 89.6 | 90.0 |
| LTF | C | 83.8 | 83.6 |
| LTF*,调参及轨迹归一化 | C | 88.7 | 89.1 |
| LTFv7,LTF* + BeyondDrive | C | 89.7 | 90.1 |
| DiffusionDrive | C+L | 88.1 | 88.3 |
| DiffusionDrive + BeyondDrive | C+L | 89.2 | 88.9 |
| MeanFuser | C | 89.0 | 89.6 |
| MeanFuser + BeyondDrive | C | 90.3 | 90.5 |
| WoTE | C+L | 88.3 | 87.6 |
| WoTE + BeyondDrive | C+L | 89.2 | 88.7 |
在 HUGSIM 的零样本交互式闭环测试中,LTF 到 LTFv7 的总体 RC 为 41.4 → 46.2,HD-Score 为 24.8 → 34.8。RC 是路线完成度,HD-Score 用 RC 乘以跨时间平均的安全与舒适性分数。Hard 难度 RC 反而从 36.9 降到 35.5,尽管 HD-Score 从 19.8 升到 26.3,说明安全收益不意味着各难度下进度均提升。
消融实验¶
原文表 4 把工程优化与 BeyondDrive 的增量分开,下面是理解贡献归属最重要的一组数据。
| LTF 逐步配置 | PDMS | EPDMS | 本步 PDMS 增量 |
|---|---|---|---|
| 原始基线 | 83.8 | 83.6 | 不适用 |
| 加学习率与损失权重调参 | 87.4 | 87.8 | +3.6 |
| 再加一阶差分轨迹归一化,LTF* | 88.7 | 89.1 | +1.3 |
| 再加 BeyondDrive,LTFv7 | 89.7 | 90.1 | +1.0 |
原文表 5 的采样消融如下,各行均生成 64 条候选。有效负样本覆盖率是能找到有效负例的场景比例;负例距离为被选负例到专家的平均距离,缓存未明确其单位,因此不标作米;负例 PDMS 为被选负例的平均分,末列是下游 LTF 分数。
| CFG 权重 | 采样标准差 | 有效负样本覆盖率 | 负例距离 | 负例 PDMS | 下游 PDMS |
|---|---|---|---|---|---|
| 1.0 | \(1.0\sigma\) | 8.0% | 0.40 | 23.9 | 88.8 |
| 0.5 | \(1.0\sigma\) | 78.8% | 1.83 | 22.8 | 89.1 |
| 0.5 | \(2.0\sigma\) | 96.4% | 1.68 | 19.8 | 89.7 |
关键发现¶
- 从原始 LTF 到 LTFv7 的 5.9 PDMS 总增益中,调参贡献 3.6、归一化贡献 1.3、BeyondDrive 贡献 1.0;新方法应主要对照 LTF*,而不是把全部增益归给负样本学习。
- 多样性增强不只是制造更远的错误:提高采样噪声后,覆盖率从 78.8% 到 96.4%,最终选中的负例距离反而从 1.83 降到 1.68,体现了扩大候选池再挖掘近邻失败的作用。
- 跨架构 PDMS 增益为 DiffusionDrive +1.1、MeanFuser +1.3、WoTE +0.9,但 MeanFuser 的 NC 从 98.6 到 98.5、WoTE 从 98.5 到 98.4,并非所有安全子指标都严格改善。
亮点与洞察¶
- 把失败监督放在专家邻域,比简单增加极端负例更贴近模仿学习的误差来源。可以迁移的是“先满足失败条件,再找最接近正例的反例”的样本选择原则,而非特定评分器。
- 小于 1 的 CFG 权重在这里服务于寻找不同失败模式,而不是生成展示时常见的提高条件保真度。生成模型的最好看样本和对下游最有用样本并不是同一个优化目标。
- 截断负距离让排斥有停止条件,避免对负例的远离压倒对专家的吸引。工程上较易接入连续轨迹规划器,但仍需计入生成、评分和数据存储成本,不能把“增加一项损失”理解成整个流程零成本。
局限与展望¶
- 作者明确承认没有显式建模长时交互与高层语义约束;4 秒轨迹监督不足以覆盖协商让行、长期通行效率等问题。可进一步研究交互式长时负例,而不是仅扩大短轨迹采样量。
- 对 VADv2 一类词表式候选选择器,评分后需要额外轨迹细化模块才能进行这类安全训练。方法不是对所有离散规划器都可直接无结构改动地使用。
- 复现信息不完整:缓存存在公式抽取缺损、算法/补充材料引用为“??”,没有清晰的筛选阈值、空集合处理、截断常数和精确损失权重;文中表达式已按可读文字整理,未补造参数。
- 表文存在需要谨慎处理的地方:正文称两个 NAVSIM v2 变体都“超过 90”,但表 2 的 TransFuser v7 是 90.0;HUGSIM 表 3 的 MeanFuser Overall 数字重复 VAD 行,且与分难度结果不协调。本笔记不据此给出 HUGSIM 全模型最优排名,也不自行修正该行。
- 论文未提供可读的多随机种子误差条、真实道路部署结果或安全保证。HUGSIM 比较也没有单列 LTF*,因而无法把零样本总收益全部隔离归因于 BeyondDrive;后续应补公平基线、方差、评分器迁移和生成成本分析。
相关工作与启发¶
- 对比 TransFuser / LTF:保留端到端规划主体,从仅模仿成功轨迹改为同时利用局部失败。表 4 的强基线说明,研究新训练信号前先充分优化基线非常重要。
- 对比 DiffusionDrive / MeanFuser / WoTE:这些方法分别强调扩散生成、流生成或世界模型评估,BeyondDrive 可作为它们的附加训练信号。关键差别在于失败是否实际改变规划器参数,而不只是推理时被过滤。
- 对比 DriveDPO / TakeAD:按本文相关工作中的定位,后两者主要利用预收集或预定义的偏好/接管轨迹集合,BeyondDrive 则主动生成专家附近的低分轨迹并在连续输出上施加排斥。由此可探索把真实接管反例与生成反例混合,检验两者是否互补。
评分¶
- 新颖性: 4/5。专家近邻失败挖掘与截断排斥的组合针对性强,基本生成与对比工具本身并非全新。
- 实验充分度: 4/5。覆盖两版 NAVSIM、跨架构消融和零样本 HUGSIM,但缺少方差、完整代价和强基线迁移对照。
- 写作质量: 3/5。核心问题与案例清楚,引用占位、参数缺失和表文不一致降低了可复现性。
- 价值: 4/5。展示了在优化后基线上仍有效的安全训练信号,适合继续验证和扩展,而不是作为可部署安全保证。