Progressive Risk Estimation for Accident Anticipation¶
会议: NeurIPS2026
arXiv: 2609.32811
代码: https://github.com/giddyyupp/PRE-ACT
领域: 自动驾驶
关键词: 交通风险预测、连续风险估计、进度监督、偏好排序、误报评估
一句话总结¶
PRE-ACT 用距离事件的连续进度监督和同视频片段排序,改进仅看过去滑动窗口的交通风险预测,在 FPR 不超过 0.1 的设置下将 CAP 的 mAUC 从 TOP 的 0.429 提升到 0.481,并用 Separation Score 检查整段风险曲线的误报倾向。
研究背景与动机¶
行车视频预警不只需要识别当前场景是否异常,还需要在可观察线索逐渐增强时及时提高风险评分,同时避免在正常行驶阶段反复报警。DSTA、GSC 等方法通过时空注意力或图结构加强视频表示,但主要监督仍是二分类。TOP 进一步预测多个未来时间点的事件概率,却仍把各时间点作为离散的二元目标;同为正例的两个片段,不一定被要求体现“哪个更接近事件”。
这个问题不能简单靠把所有事件视频的评分提前抬高解决,因为这样可能同时增加正常阶段的误报。局部 AUC 和平均提前量 mTTA 又只考察特定时间范围,可能让全程过早高分的曲线与正常阶段低分、关键阶段逐步升高的曲线获得相近指标。本文因此同时改动训练监督与评估方式:训练时利用事件时间构造连续风险目标,评估时检查异常起点前后的全段平均分,而不只截取少量时间窗口。
异常线索起点本身带有标注主观性,且 Nexar 不提供该标签。作者用固定的事件前 2 秒窗口定义训练关键区间,不依赖异常起点训练,再从同一视频中抽取更靠后的片段建立排序约束。核心 idea:把距离事件的进度变成共享视频表示的密集辅助监督,让分类模型学到风险随时间演化的结构,而不是只学一个正负分界。
方法详解¶
整体框架¶
输入是自车视角视频当前时刻及之前的 5 帧,而非完整视频或未来帧。视频统一为 10 FPS、224×224;VideoMAE 编码得到时空 token,平均池化后交给轻量预测头。预警主分支输出当前片段的分类评分,训练时再添加连续进度头与偏好排序头,三者共享视频特征。
“时域分区监督”“连续进度监督”“片段偏好排序”依次把正负区域、区域内部的风险变化,以及同视频片段间的相对先后关系告诉模型。推理只沿过去窗口到编码器、分类头、当前评分的数据流运行,不需要事件时间、异常起点或更靠后的配对片段;这里的未来信息是离线训练标签来源,不是在线输入。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["当前及过去5帧"] --> B["VideoMAE与平均池化"]
B --> C["分类头"]
C --> D["当前预警评分"]
L["仅训练:事件时间"] -.-> E["时域分区监督"]
E -.-> F["连续进度监督"]
F -.-> G["片段偏好排序"]
E -.->|BCE| C
B -.-> F
B -.-> G
H["仅训练:更靠后<br/>片段的共享编码特征"] -.-> G
图中实线是在线评分路径,虚线是训练分支或监督关系;排序分支的配对片段不会进入当前时刻的在线预测。
关键设计¶
1. 时域分区监督:用统一时间边界替代不一致的异常起点标签
对含事件的视频,设事件时间为 \(t_{\text{acc}}\),关键区间起点为 \(t_h\):之前视为正常区间,从起点到事件之前视为关键区间。实现中关键区间对应事件前 2 秒,因此 \(t_h\) 是一个时间位置,而不是数值固定为 2 的绝对帧索引。没有事件的视频把两个边界都设在视频末尾,关键区间为空,所有训练片段都属于正常区间。
分类头学习正常区间为 0、关键区间为 1 的 BCE 目标。它保留明确的事件判别任务,使辅助进度学习不脱离预警目的。代价是这条分界来自数据统计而不是逐视频的真实可见线索:有些风险线索可能早于 2 秒出现,有些则直到更晚才可观察,所以“训练正常区间”并不等价于物理上完全无风险。
2. 连续进度监督:让同为正例的片段具有不同目标值
仅用 BCE,关键区间入口与事件前一刻都被要求输出正类,无法直接教模型风险如何随时间增长。作者按关键区间内的相对时间构造连续目标:正常区间严格为 0,进入关键区间后从 0 逐渐趋近 1。额外进度头用 smooth L1 损失拟合这一目标,迫使共享表示包含距离事件的变化,而不是只保留类别信息。
这里的 \(\alpha\) 控制增长曲率:正值使早期增长更快,负值把明显增长推向更靠后的阶段,线性目标是另一组对照。默认 \(\alpha=3\),不是从视频内容预测出来的参数。正常视频没有非空关键区间,因而不会在分母为零的情形下使用第二段公式。
这是一种距离事件的监督代理,并非经概率校准的风险率,也不是直接回归剩余秒数。训练目标单调并不保证每段测试视频的预测逐帧单调;模型仍然会受视觉证据、遮挡与域偏移影响,论文没有在推理端加入硬性单调投影。
3. 片段偏好排序:让共享特征识别同视频内更接近事件的状态
绝对目标可能被外观差异干扰:不同道路或相机设置下,同一目标值对应的图像差别很大。作者因此从同一视频中选取更靠近事件的关键区间片段,用额外 MLP 给两个片段打分,通过 margin ranking loss 要求更靠后的片段分数更高。实现中的配对时间范围是当前片段之后 0.5–1.5 秒,约束来自时间先后,无需人工偏好标注。
相同视频的比较减少了场景差异对排序的干扰,但排序假设仍来自事件距离,并不意味着真实风险必定全程递增。它是辅助训练分支,不能被画成在线系统偷看之后 0.5–1.5 秒的视频;原文文字没有给出排名 margin 的具体数值,这里不补写作者未报告的设置。
一个完整示例¶
以下是说明监督机制的假设时间轴,不是论文测得的一段视频结果。若事件时间为第 10 秒,训练关键区间从第 8 秒开始,则第 7 秒的片段属于正常区间:分类目标与进度目标都为 0。
第 8 秒刚进入关键区间,分类目标已是 1,但连续进度仍为 0;第 9 秒在区间中点,分类目标依然是 1,而进度目标由上式决定。这种差别正是本文希望保留的时间结构,不能把进度头与分类头理解为两个同义的输出。
若训练时为第 9 秒的片段配对第 9.5 秒片段,排序头要求后者得分更高。真正在线运行到第 9 秒时,模型只处理截至第 9 秒的 5 帧窗口,既不知道实际事件时间,也不读取第 9.5 秒的画面;这些时间标签只用于离线优化。
损失函数 / 训练策略¶
三项损失共同更新共享特征;分类损失提供主任务信号,进度损失提供连续时间结构,排序损失提供相对时间结构。原文总目标为:
默认权重依次是 1.0、10.0、0.1。编码器使用 Kinetics-400 预训练的 VideoMAE-L,只训练最后 4 层和任务头;任务头为两层线性层配 GELU。编码器与任务头学习率分别是 \(10^{-5}\) 和 \(10^{-4}\),batch size 为 32,每视频最多抽取 50 个负片段,避免大量正常片段淹没关键片段。
由于 VideoMAE 默认接收 16 帧,5 帧输入按前 4 帧各重复 3 次、末帧重复 4 次补齐。它增加的是输入长度,不是额外的真实时间上下文;不能说模型在线观察了 16 个不同帧。
正文写训练 1 epoch,附录 A.1 写 2000 iterations,两种描述原样保留,缓存没有解释两者对应关系。附录报告总参数 307M、可训练参数 53M,在同一 NVIDIA A100 上推理 14.44 FPS;这不能直接推广为车载硬件上的实时性结论。
实验关键数据¶
主实验¶
MM-AU 的 CAP 为 8,959 个训练视频、800 个测试视频;DADA 为 1,771/198,两个子集分别训练与测试。Nexar 为 3,000/1,354,采用先 CAP 训练再 Nexar 微调的流程,其结果不是仅在 Nexar 上训练的对照。
下表摘自原文表 1,所有指标都采用 FPR 不超过 0.1 的设置,mTTA 单位为秒;比较方法的数值沿用 TOP 论文报告,并非作者重新统一训练。
| 数据集 | 方法 | AUC 0.0秒 | AUC 0.5秒 | AUC 1.0秒 | AUC 1.5秒 | mAUC | mTTA |
|---|---|---|---|---|---|---|---|
| CAP | TOP | 0.838 | 0.675 | 0.398 | 0.214 | 0.429 | 0.864 |
| CAP | PRE-ACT | 0.887 | 0.775 | 0.465 | 0.201 | 0.481 | 1.125 |
| DADA | TOP | 0.790 | 0.567 | 0.288 | 0.140 | 0.332 | 0.885 |
| DADA | PRE-ACT | 0.861 | 0.751 | 0.398 | 0.170 | 0.440 | 1.069 |
CAP 的 mAUC 增加 0.052,但 1.5 秒 AUC 从 0.214 降至 0.201,因此不是每个预警时间点都优于 TOP。CAP 的 mTTA 按表相减增加 0.261 秒,正文概述为 0.25 秒;DADA 对应增加 0.184 秒,正文概述为 0.18 秒。这里保留原文表格,不将表值改成概述值。
Nexar 原文表 2 给出 runner-up/winner/PRE-ACT 的 mAP 分别为 0.875/0.885/0.895。作者所称“+1 mAP”对应 0.010 的绝对提升,即以百分数表示时的 1 个百分点;不是 mAP 增加 1.0。
消融实验¶
下表为 CAP 上原文表 4 的辅助目标消融,FPR 不超过 0.1。BCE-only 使用本文骨干,是更接近控制变量实验的基线。
| 配置 | AUC 1.5秒 | mAUC | mTTA(秒) | Separation Score |
|---|---|---|---|---|
| 仅 BCE | 0.176 | 0.419 | 1.105 | 0.694 |
| BCE + 进度 | 0.197 | 0.477 | 1.128 | 0.723 |
| BCE + 进度 + 偏好 | 0.201 | 0.481 | 1.125 | 0.724 |
进度监督带来 mAUC 的主要增量 0.058,偏好排序再增加 0.004。偏好排序对 1.5 秒 AUC 有小幅帮助,但 mTTA 从 1.128 降到 1.125 秒,所以“完整模型所有指标都最好”并不成立。
Separation Score 用异常起点 \(t_{\mathrm{ai}}\) 而非训练边界分组:\(s_{\mathrm{pre}}\) 是视频开始至异常起点前的平均预测分,\(s_{\mathrm{post}}\) 是异常起点至事件时间的平均预测分,两组分别按各自预测数量归一化。
分数范围为 \([0,1]\),理想值 1 对应起点前全为 0、起点后全为 1;恒定预测无论高低都得到 0.5。它汇总全段平均分,但没有衡量起点后是否单调增长,也不是阈值化误报次数或每小时报警率。
下表摘自原文表 6;既有方法缺少公开预训练模型,因此作者只对自己的 BCE 基线与 PRE-ACT 报告该指标。
| 数据集 | 配置 | 起点前平均分(越低越好) | 起点后平均分(越高越好) | Separation Score |
|---|---|---|---|---|
| CAP | 仅 BCE | 0.420 | 0.808 | 0.694 |
| CAP | PRE-ACT | 0.344 | 0.792 | 0.724 |
| DADA | 仅 BCE | 0.372 | 0.763 | 0.696 |
| DADA | PRE-ACT | 0.319 | 0.798 | 0.740 |
关键发现¶
- CAP 起点后的平均分略降,Separation Score 仍提高,主要因为起点前平均分从 0.420 降到 0.344;改进不是简单把所有输出一起抬高。
- 原文表 5 的 \(\alpha=3\) 得到 mAUC 0.481、mTTA 1.125;线性目标为 0.470/1.118,\(\alpha=-3\) 为 0.458/1.112。正曲率更利于较长提前量,但 \(\alpha=4\) 也达到 0.481/1.125,默认设置不是唯一最优。
- 原文表 7 将 FPR 上限收紧至 0.01 后,CAP/DADA 的 mAUC 降至 0.210/0.226,mTTA 为 0.817/0.826 秒。及时性仍存在,但不能据此宣称低误报运行已经解决。
- 原文表 3 中 CAP 直接迁移 DADA 得到 mAUC 0.464;直接迁移 Nexar 仅为 0.361,低于附录表 9 微调后的 0.510。跨域差异不能用同域成绩掩盖。
亮点与洞察¶
- 主要变化是监督而非复杂网络扩建。连续目标把原本只有正负标签的视频转化为具有内部顺序的学习信号,消融也显示进度项比排序项贡献更大。
- 保留分类任务,同时用进度与偏好塑造共享表示。它不要求把进度值解释为真实概率,因而更像面向预警的辅助表示学习。
- 全段评估揭示局部指标之外的行为。正常阶段低分与关键阶段高分必须同时检查,单看提前量容易奖励过早抬高风险的模型。
局限与展望¶
- 作者承认只研究视频监测,未纳入驾驶员状态、车辆动力学和传感器可靠性,也没有闭环控制或实际风险降低的验证。
- 固定 2 秒边界和单调目标可能与真实线索出现时间不一致。应进一步测试可变时域、风险缓解片段与概率校准,而不是把时间距离当作普适真实风险。
- Separation Score 不检验单调性,且其理想值是异常起点后立即达到高分,与“逐渐增长”的目标并不完全相同;还需要阈值化误报频率、检测延迟和重复报警统计。
- Nexar 测试视频不包含事件帧且缺少异常起点。附录将起点人为设为事件前 2 秒,因此其 mTTA 与分离分数依赖代理起点,不能当成与 MM-AU 同等的人类标注评估。
- 原文表 8 的 DADA mTTA 为 V-JEPAv2 1.011、VideoMAE 1.069,附录文字却称 V-JEPA 在该指标超过本文骨干;表与文字冲突,不能据此宣称替换骨干会提高 DADA 提前量。
- 未报告多随机种子误差、车载端延迟或长时间正常驾驶的报警负担。作者列举的失败原因包括雪天与强逆光导致可见性下降,鲁棒性仍需独立验证。
相关工作与启发¶
- vs TOP:TOP 预测多个未来时间点的二元发生概率;PRE-ACT 用连续距离目标与片段排序约束共享表示。CAP 的较早 1.5 秒点仍落后 TOP,二者优势不能简化为全维度替代。
- vs DSTA / GSC:前者强调时空注意力,后者强调参与者关系与时空连续性;PRE-ACT 主要改变训练信号,并使用视频基础模型,不应把全部收益归因于排序目标。
- vs 机器人进度估计:共同点是用轨迹中的相对位置获得密集反馈。迁移到交通预测时,终点不再表示任务成功,而且真实风险可能被中途缓解,因此单调假设需要领域验证。
评分¶
- 新颖性: 4/5 — 将连续进度与排序监督用于交通预警,并补充全段分离指标,改进点明确。
- 实验充分度: 3/5 — 有多数据集、辅助目标、曲率、FPR 与骨干分析,但缺少随机性报告和长期误报验证。
- 写作质量: 3/5 — 方法直观,但训练描述、部分最优性表述和骨干实验文字存在不一致。
- 价值: 4/5 — 为时序预警提供可复用的监督思路,离真实车载安全系统仍有评估与部署距离。