跳转至

Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3394
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/1261.pdf
代码: https://github.com/wjl2244/BeyondDrive
领域: 自动驾驶
关键词: 模仿学习、困难负样本、流匹配、安全边界、轨迹规划

一句话总结

BeyondDrive 不只让规划器靠近专家轨迹,还让它远离“离专家很近却不安全”的生成轨迹,在优化后 LTF 基线上将 NAVSIM v1 PDMS 从 88.7 提升到 89.7、NAVSIM v2 EPDMS 从 89.1 提升到 90.1,并展示跨规划器及 HUGSIM 零样本迁移结果。

研究背景与动机

端到端驾驶通常把未来规划当作轨迹回归:给定传感器观测和导航指令,预测轨迹越接近专家演示,训练损失就越小。但几何偏差不等于风险。同样向左右偏移,向车道内部的一侧可能仍然安全,向路沿或前车的一侧却可能导致越界或碰撞。论文把这种“相近模仿误差、不同安全后果”的现象称为安全非对称性。只提供成功轨迹,模型就很难知道专家周围哪一侧可以偏、哪一侧不能偏。

DiffusionDrive、MeanFuser、WoTE 等方法用多个候选和评分器缓解单轨迹回归的局限,不过推理时丢弃低分轨迹,并不等于把失败作为监督用于优化规划器。本文关注的是更局部的边界学习:远离专家的明显坏轨迹可能没有多少训练价值,真正需要的是看起来几乎模仿正确、却越过安全边界的困难负样本。反过来,单纯生成大量相似轨迹也未必能得到这些样本,因为生成器可能集中在少数高概率模式附近。

核心 idea:先从多样化候选中筛出低安全分、再选其中最接近专家的轨迹,用“靠近专家 + 有限度远离失败”的联合监督学习轨迹空间中的安全边界。

方法详解

整体框架

BeyondDrive 是训练框架,不是要求车辆在线运行一个新的避障搜索器。第一阶段用条件流匹配生成候选,经多样性采样和两阶段负样本筛选得到每个场景的困难负样本;第二阶段把负样本加入原规划器的训练。最终执行的仍是经过安全增强的规划器,负样本生成和筛选属于训练数据构造环节。

任务输出是在自车坐标系中表示的未来 4 秒轨迹:2 Hz、8 个航点,每点含位置与朝向。条件生成器使用前视图像、自车速度和加速度、导航指令;其感知模块与 LTF 相同。下游既可以是相机输入的 LTF,也可以是额外使用 LiDAR 的 TransFuser,不能把下游的全部传感器都误写成负样本生成器的输入。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    INPUT["场景条件与专家轨迹"] --> GEN["条件流匹配"]
    GEN --> DIV["多样性采样<br/>64 条候选"]
    DIV --> SELECT["两阶段负样本筛选<br/>低分中选最近"]
    SELECT --> TRAIN["截断排斥训练"]
    INPUT -->|专家模仿监督| TRAIN
    TRAIN --> OUTPUT["安全增强规划器<br/>8 个未来航点"]

关键设计

1. 条件流匹配:先学驾驶轨迹分布,而不是直接拟合事故数据

生成器的训练终点是专家轨迹,而非真实事故轨迹。它把高斯噪声与向量化专家轨迹做线性插值,学习从噪声流向轨迹的速度场;场景条件由编码器提供,速度网络由 Transformer Decoder、LayerNorm 和前馈网络组成。特别之处在于,论文使用 L1 速度回归,而不是预备知识部分介绍的常规平方误差。这一步提供一个了解当前场景、能生成接近专家候选的模型,但本身并不保证候选危险。

训练时以 0.1 的概率丢弃条件,使同一个网络同时学到有条件和无条件的速度估计。这样后续才可以用 classifier-free guidance(CFG)控制对条件的依赖,而不必另外训练一个无条件模型。以下保留决定机制的数学表达;缓存中公式排版有缺损,公式按第 4 节相邻文字整理,属于可读重述而非逐字公式转录,精确记号以 PDF 为准。

\[ x_t=(1-t)x_0+tx_1,\qquad \mathcal{L}_{\mathrm{FM}}= \mathbb{E}\left[\left\|v_\theta(x_t,t\mid\mathcal{C}_{\mathrm{in}})-(x_1-x_0)\right\|_1\right]. \]

这里 \(x_0\) 来自高斯先验、\(x_1\) 是专家轨迹的向量表示,\(t\)\([0,1]\) 均匀采样;\(\mathcal{C}_{\mathrm{in}}\) 是保留或丢弃后的场景条件。直观地说,生成器先学“这类场景里车通常如何运动”,失败样本再由采样和筛选从这一邻域中挖掘出来。这与对专家轨迹随意加噪声后直接认定为危险不同。

2. 多样性采样:适度减弱条件约束,同时扩大初始噪声

一个拟合良好的条件生成器可能反复生成相似的安全轨迹。若没有足够不同的候选,就无法找到专家附近的多种失败方向。因此作者同时采用较低 CFG 权重与更大的采样噪声:训练先验标准差为 \(\sigma\),生成负样本时变为 \(2.0\sigma\);CFG 权重取 \(w=0.5\),每个场景并行生成 64 条候选,以 5 个流匹配采样步求解 ODE。

\[ \widetilde v_\theta(x_t,t\mid\mathcal C) =v_\theta(x_t,t)+w\left[v_\theta(x_t,t\mid\mathcal C)-v_\theta(x_t,t)\right]. \]

\(w=1.0\) 恢复普通条件生成,\(w=0.5\) 则减弱对条件模式的集中程度,并非惯常用大于 1 的 guidance 强化条件。扩大噪声也不是最终目标:它扩大探索范围,之后仍要筛掉无关轨迹。有效负样本场景比例从 8.0% 到 78.8%,再到 96.4%,说明“生成多少条”和“覆盖多少种失败”是两件事;64 条近乎重复的候选仍可能不够有用。

3. 两阶段负样本筛选:先确保低分,再追求接近专家

每条候选先通过安全与驾驶质量评分函数 \(S\),实现中使用 PDMS。它考虑碰撞、是否离开可行驶区域、碰撞时间、舒适性和行进效率。首先保留 \(S(\tau)<\xi\) 的低分候选,然后在其中选与专家轨迹距离最近的一条。距离按航点累计欧氏距离衡量。顺序很关键:直接找最近轨迹很可能得到另一个安全演示,直接找最低分轨迹则可能得到离正常驾驶太远的容易负例。

这一步中的“困难”是低分条件下的专家邻近性,不是负样本评分越低越好。还需要注意,PDMS 是复合驾驶分数,低分并不逻辑等价于发生碰撞,不能把全部负例都描述成事故轨迹。评分器提供训练信号的操作性定义,方法没有证明这个定义覆盖全部真实安全风险。

缓存正文没有明确给出阈值 \(\xi\),也没有说明低分候选集合为空时的处理规则。有效负样本覆盖率 96.4% 并不等于每个场景都有负样本;不能据此自行补写跳过场景、补采样或损失掩码的实现。生成样本的物理可执行性与评分器对长时间交互的可信度,也仍然是后续训练效果的前提。

4. 截断排斥训练:惩罚靠近负例,但不无限奖励逃离负例

下游规划器先把轨迹转为一阶位移及朝向的正余弦表示,即每个航点使用 \((\Delta x_k,\Delta y_k,\sin h_k,\cos h_k)\)。位移对应 0.5 秒内的运动,而不是未缩放的速度;正余弦避免朝向跨角度边界时的不连续。模仿损失和排斥损失都在这个表示中计算,所以生成阶段的几何近邻筛选与训练阶段的差分 L1 距离不是同一种距离,不能混为一谈。

\[ \mathcal{L}_{\mathrm{imi}}=\left\|\Delta\hat\tau-\Delta\tau^{\mathrm{exp}}\right\|_1, \qquad \mathcal{L}_{\mathrm{rd}}=-\min\left(\left\|\Delta\hat\tau-\Delta\tau^{\mathrm{neg}}\right\|_1,C\right). \]

最小化负距离会把预测推离负例,但只推到截断常数 \(C\) 为止。距离超过该上限后,排斥项不再持续鼓励轨迹偏离;专家模仿项则始终拉向正常行为。这不是在嵌入空间区分标签的普通对比学习,也没有新建一个推理评分器,而是直接改变预测轨迹的训练梯度。它能形成经验上的区分边界,但不构成形式化安全保证。

一个完整示例

原文图 3 的一个案例是需要停车的路口:LTF* 仍预测向前行驶,导致 NC 和 TTC 都为 0。对应训练机制可以这样理解:对同一场景生成 64 条候选,经 PDMS 低分过滤后,选出最接近专家停车轨迹的失败轨迹,再以它作为排斥目标。专家监督拉向停车行为,负样本监督则指出“继续往前”这一局部偏移的危险。

这个过程最终仍输出 4 秒、8 航点的轨迹,不是增加一个在线紧急制动规则。论文没有给出这个案例过滤后还剩多少条候选、具体间距或速度,因此这里不添加这些数值。图示案例支持机制解释,但不能代替大规模碰撞风险评估。

损失函数 / 训练策略

总目标为模仿损失、RD 损失和语义辅助损失的加权和。原文先把地图重建辅助项记为 \(\mathcal L_{\mathrm{map}}\),总目标又写成 \(\mathcal L_{\mathrm{sem}}\),记号存在不一致;可以确定有栅格化 HD 地图的辅助监督,但不能据此臆造两个独立辅助头。损失权重和截断常数 \(C\) 的具体取值未在可读正文明确列出。

训练 batch size 为 32,共 100 epochs,采用余弦退火、3 个 warmup epochs,峰值学习率为 \(2\times10^{-4}\)。调参还包括降低辅助任务损失权重。图 4 的文字说明指出,RD 权重逐渐增加能够改善结果,但应低于模仿损失权重,否则不收敛;图中精确曲线值未能从缓存读取,不补写最佳权重比例。

实验关键数据

主实验

NAVSIM v1 使用约 85k 个 navtrain 场景、约 12k 个 navtest 场景,属于短时、非反应式伪仿真评估;NAVSIM v2 使用会响应自车的交通参与者。PDMS 为 NC 与 DAC 乘以 EP、TTC、舒适性按 5:5:2 加权的均值。EPDMS 还覆盖行驶方向、信号灯、车道保持及历史/扩展舒适性。两者不是完全相同的指标,不应直接比较跨版本数值高低。

下表摘自原文表 1、2、4,均为越高越好;C 表示相机,C+L 表示相机与 LiDAR,分数差用点数而非相对百分比表示。

模型 输入 NAVSIM v1 PDMS NAVSIM v2 EPDMS
TransFuser C+L 84.0 84.4
TransFuser v7 C+L 89.6 90.0
LTF C 83.8 83.6
LTF*,调参及轨迹归一化 C 88.7 89.1
LTFv7,LTF* + BeyondDrive C 89.7 90.1
DiffusionDrive C+L 88.1 88.3
DiffusionDrive + BeyondDrive C+L 89.2 88.9
MeanFuser C 89.0 89.6
MeanFuser + BeyondDrive C 90.3 90.5
WoTE C+L 88.3 87.6
WoTE + BeyondDrive C+L 89.2 88.7

在 HUGSIM 的零样本交互式闭环测试中,LTF 到 LTFv7 的总体 RC 为 41.4 → 46.2,HD-Score 为 24.8 → 34.8。RC 是路线完成度,HD-Score 用 RC 乘以跨时间平均的安全与舒适性分数。Hard 难度 RC 反而从 36.9 降到 35.5,尽管 HD-Score 从 19.8 升到 26.3,说明安全收益不意味着各难度下进度均提升。

消融实验

原文表 4 把工程优化与 BeyondDrive 的增量分开,下面是理解贡献归属最重要的一组数据。

LTF 逐步配置 PDMS EPDMS 本步 PDMS 增量
原始基线 83.8 83.6 不适用
加学习率与损失权重调参 87.4 87.8 +3.6
再加一阶差分轨迹归一化,LTF* 88.7 89.1 +1.3
再加 BeyondDrive,LTFv7 89.7 90.1 +1.0

原文表 5 的采样消融如下,各行均生成 64 条候选。有效负样本覆盖率是能找到有效负例的场景比例;负例距离为被选负例到专家的平均距离,缓存未明确其单位,因此不标作米;负例 PDMS 为被选负例的平均分,末列是下游 LTF 分数。

CFG 权重 采样标准差 有效负样本覆盖率 负例距离 负例 PDMS 下游 PDMS
1.0 \(1.0\sigma\) 8.0% 0.40 23.9 88.8
0.5 \(1.0\sigma\) 78.8% 1.83 22.8 89.1
0.5 \(2.0\sigma\) 96.4% 1.68 19.8 89.7

关键发现

  • 从原始 LTF 到 LTFv7 的 5.9 PDMS 总增益中,调参贡献 3.6、归一化贡献 1.3、BeyondDrive 贡献 1.0;新方法应主要对照 LTF*,而不是把全部增益归给负样本学习。
  • 多样性增强不只是制造更远的错误:提高采样噪声后,覆盖率从 78.8% 到 96.4%,最终选中的负例距离反而从 1.83 降到 1.68,体现了扩大候选池再挖掘近邻失败的作用。
  • 跨架构 PDMS 增益为 DiffusionDrive +1.1、MeanFuser +1.3、WoTE +0.9,但 MeanFuser 的 NC 从 98.6 到 98.5、WoTE 从 98.5 到 98.4,并非所有安全子指标都严格改善。

亮点与洞察

  • 把失败监督放在专家邻域,比简单增加极端负例更贴近模仿学习的误差来源。可以迁移的是“先满足失败条件,再找最接近正例的反例”的样本选择原则,而非特定评分器。
  • 小于 1 的 CFG 权重在这里服务于寻找不同失败模式,而不是生成展示时常见的提高条件保真度。生成模型的最好看样本和对下游最有用样本并不是同一个优化目标。
  • 截断负距离让排斥有停止条件,避免对负例的远离压倒对专家的吸引。工程上较易接入连续轨迹规划器,但仍需计入生成、评分和数据存储成本,不能把“增加一项损失”理解成整个流程零成本。

局限与展望

  • 作者明确承认没有显式建模长时交互与高层语义约束;4 秒轨迹监督不足以覆盖协商让行、长期通行效率等问题。可进一步研究交互式长时负例,而不是仅扩大短轨迹采样量。
  • 对 VADv2 一类词表式候选选择器,评分后需要额外轨迹细化模块才能进行这类安全训练。方法不是对所有离散规划器都可直接无结构改动地使用。
  • 复现信息不完整:缓存存在公式抽取缺损、算法/补充材料引用为“??”,没有清晰的筛选阈值、空集合处理、截断常数和精确损失权重;文中表达式已按可读文字整理,未补造参数。
  • 表文存在需要谨慎处理的地方:正文称两个 NAVSIM v2 变体都“超过 90”,但表 2 的 TransFuser v7 是 90.0;HUGSIM 表 3 的 MeanFuser Overall 数字重复 VAD 行,且与分难度结果不协调。本笔记不据此给出 HUGSIM 全模型最优排名,也不自行修正该行。
  • 论文未提供可读的多随机种子误差条、真实道路部署结果或安全保证。HUGSIM 比较也没有单列 LTF*,因而无法把零样本总收益全部隔离归因于 BeyondDrive;后续应补公平基线、方差、评分器迁移和生成成本分析。

相关工作与启发

  • 对比 TransFuser / LTF:保留端到端规划主体,从仅模仿成功轨迹改为同时利用局部失败。表 4 的强基线说明,研究新训练信号前先充分优化基线非常重要。
  • 对比 DiffusionDrive / MeanFuser / WoTE:这些方法分别强调扩散生成、流生成或世界模型评估,BeyondDrive 可作为它们的附加训练信号。关键差别在于失败是否实际改变规划器参数,而不只是推理时被过滤。
  • 对比 DriveDPO / TakeAD:按本文相关工作中的定位,后两者主要利用预收集或预定义的偏好/接管轨迹集合,BeyondDrive 则主动生成专家附近的低分轨迹并在连续输出上施加排斥。由此可探索把真实接管反例与生成反例混合,检验两者是否互补。

评分

  • 新颖性: 4/5。专家近邻失败挖掘与截断排斥的组合针对性强,基本生成与对比工具本身并非全新。
  • 实验充分度: 4/5。覆盖两版 NAVSIM、跨架构消融和零样本 HUGSIM,但缺少方差、完整代价和强基线迁移对照。
  • 写作质量: 3/5。核心问题与案例清楚,引用占位、参数缺失和表文不一致降低了可复现性。
  • 价值: 4/5。展示了在优化后基线上仍有效的安全训练信号,适合继续验证和扩展,而不是作为可部署安全保证。