Driving Video Retrieval for Complex Queries with Structured Grounding¶
会议: NeurIPS2026
arXiv: 2606.09109
领域: 自动驾驶
关键词: 驾驶视频检索、结构化定位、规则校准、弱监督排序学习、多源融合
一句话总结¶
STRIVE-D 在独立驾驶视频上用弱标签排序目标校准运动规则,再按查询复用或适配规则并融合视觉与词法检索,使 DrivingDojo 的 Acc@1 从主表最强稠密基线的 14.6% 提升至 26.8%,但不是直接让 LLM 读取视频并判断真实几何。
研究背景与动机¶
驾驶日志检索不仅要找“出现公交车”的场景,还要找“公交车切入本车道”的短暂运动。视觉语言模型(VLM)的全局视频嵌入容易把横向位移、相对距离变化等信号混进背景语义;词法检索又依赖摘要确实写出事件名称。因此,视频里有正确对象,不等于检索到了正确行为。论文把这种动态证据被场景内容冲淡的现象称为 dilution。
结构化规则可以直接检查跟踪对象的距离、车道和横向偏移,却会遇到另一种失败:大语言模型(LLM)知道“接近”“急刹”“切入”大致意味着什么,但不知道实际感知流水线输出的噪声、量化和变化幅度。一个文本上合理的阈值,在某套深度估计和跟踪系统上可能几乎处处触发,也可能从不触发。这是 miscalibration;即使把已有规则校准好,有限事件库也不能覆盖开放词汇查询,这是 coverage gap。
本文不把解决办法归结为更大的视频模型,而是把语义提案与经验校准分开:规则负责显式运动证据,独立辅助视频提供数值尺度,视觉和词法分支补上规则难表达的场景与长尾实体。核心 idea:用辅助视频摘要产生弱相关性标签,在真实感知记录上优化规则诱导的排序,再将可复用的校准规则与查询适配、多源检索结合。
方法详解¶
整体框架¶
输入是自然语言查询和一个驾驶视频候选库,输出是相关视频排序,而非车辆控制动作或经过证明的事故原因。STRIVE-D 先把视频预处理为逐帧对象记录,再让规则在这些记录上计算运动相关性;稠密分支看视觉嵌入,稀疏分支看视频文本,三者融合后重排前 20 个候选。
方法包含结构化运动证据、校准规则库、置信度适配、多源排序融合四个设计。离线阶段在独立 Nexar 辅助集上形成并校准规则库;在线阶段根据新查询决定复用还是适配规则,然后执行检索。辅助摘要只负责构造离线弱标签,不替代逐帧感知记录,也不是评测真值。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
V["辅助与候选视频"] --> S["结构化运动证据"]
C["辅助摘要弱标签"] -.->|离线监督| L["校准规则库"]
S -.->|辅助记录离线执行| L
L --> A["置信度适配"]
Q["新查询"] --> A
A -->|规则在候选记录上执行| F["多源排序融合"]
S -->|候选运动证据| F
D["候选视觉嵌入<br/>与视频文本"] --> F
F --> O["前20项重排<br/>输出视频排序"]
关键设计¶
1. 结构化运动证据:把对象身份、成立条件和事件强度分开
规则消费的是 iFinder 感知流水线生成的对象时间序列,不是 LLM 自行测量的真实位置。其上游包括 OWL-V2 检测、ByteTrack 跟踪、OMR 车道检测、Metric3D 深度、SAM 前景掩码,以及相机标定、姿态估计、属性识别和 3D 检测。距离、横向偏移、车道关系等字段都可能带误差;这些误差恰恰解释了为何阈值必须对感知系统的输出分布校准。Qwen2.5-VL-7B 在建库时生成辅助视频摘要,不是在线逐候选事件判断器。
一条规则首先用实体选择器限定对象类别、是否只看最近对象,以及怎样汇总多条轨迹。硬门控检查必要条件,例如存在距离小于阈值的对象;每个门控都必须成立,否则视频运动分数为零。软分数衡量指定时间窗内信号变化有多强,再按权重平均各项证据。只要一辆车满足即可的事件使用 any 聚合;本车运动可以借助周围对象的共同相对运动,使用 consensus 聚合,而不是把单个对象的侧移当成本车转向。
附录 A.3 的无方向软变化算子与最终分数为:
其中,时间窗限制检查的变化范围,幅度尺度控制连续分数何时饱和;若指定方向,则用单侧变化代替绝对值。附录的 any 取对象分数最大值,consensus 取“最大值与对象平均值的均值”。这保留了强事件,同时使群体一致性影响排序,不应简单等同于任意轨迹触发。
原文有两处值得保留的实现边界。其一,硬门控与软分数独立在视频层汇总,允许对象 A 满足距离条件、对象 B 提供运动强度,并不保证同一对象同时满足所有条件。其二,D.3 提示词把软分数描述为“达到阈值得 0.5、两倍阈值得 1”,且把 consensus 描述为带通过比例门控的平均值;这与 A.3 的公式口径不完全一致。这里按 A.3 解释正式算子,提示词差异不能靠猜测代码消除。
2. 校准规则库:让 AP 而非语言常识选择数值约束
离线辅助集是与三个评测集分离的 1,147 个 Nexar 视频。摘要模型先描述运动变化,LLM 再提取事件;A.2 说明事件归入预定义的 21 类目录,而不是不受约束地发现任意事件。对某一类事件,摘要提及它的视频作为弱正例,其余视频作为弱负例。一段视频可属于多类,因此各事件的计数不能相加解释为不同视频数量;急刹有 1,068 个关联视频,而 reverse、sharp turn 各只有 1 个。
正文 3.4 明确把每个事件的人类指定规则形式固定下来,联合搜索硬门控阈值、软分数幅度、权重和时间窗。LLM 看到辅助记录的字段均值、标准差、分位数,提出一组参数;执行器在辅助视频的感知记录上打分,然后用弱标签计算平均精度(AP)。字段统计帮助提案选对尺度,但不直接加入优化目标。LLM 是黑盒提案器,AP 才是候选方案的选择依据。
对按规则分数排列的视频,AP 在每一个弱正例出现的位置计算此前正例所占比例,再对全部弱正例求平均:
每次把当前 AP、历史最好规则和分数分布反馈给 LLM,达到目标 AP 或最多 20 轮后停止,保存历史最优参数。这样,优化目标是“让弱正例排在弱负例前面”,不是回归精确速度或人工标注的几何阈值;也不需要对视频编码器反向传播。跨多个样本聚合能减弱个别摘要错误的影响,但不能保证纠正系统性漏标,尤其对只有极少正例的事件。
D.3 的初始提示词会输出完整 JSON 规则,D.4 又允许修订整个对象,表述比正文固定规则形式更宽。应将已论证的贡献理解为数值校准,并与在线规则适配区分;这些材料不足以支持“完全自动发现并优化规则结构”的结论。
3. 置信度适配:高置信查询复用,低置信查询借校准规则改写
在线 matcher 由 GPT-4.1 将查询映射到最近的事件类别,并输出匹配置信度。置信度达到 0.6 时复用库中规则;低于 0.6 时,把最近的校准规则作为上下文示例,生成查询特定规则。这里的置信度是语言组件对类别匹配的估计,不是运动分数,更不是该视频确实发生事件的概率。高置信路径省掉规则生成,不意味着 matcher 本身没有 LLM 调用;附录 A.2 的“无需调用 LLM”应结合 D.5 限定理解。
适配不只是把原规则原封不动搬过来。D.6 给出目标数据集的无标签字段统计,允许改对象类别与数值约束,因此查询时可以使用目标感知分布信息;禁止使用目标相关性标签,与完全不读取目标数据是两回事。对于“在雪地失控”这类带天气或原因修饰的查询,matcher 提示词要求置信度不超过 0.55,主动走适配分支,避免把复杂查询压成普通失控事件。
这种策略的价值在于保留经过数据校准的起点,而非从语言常识重新猜尺度。不过,新规则并未在目标人工标签上重新进行 AP 校准;借用邻近规则并不能保证阈值迁移可靠,也不能凭空产生感知字段中不存在的因果、路况或事件顺序证据。
4. 多源排序融合:让运动规则补强视觉,而不是取代视觉
STRIVE-D 同时计算规则排序、Qwen3-VL-Embedding-8B 稠密排序和 BM25 词法排序。融合 router 根据查询和每个分支的输入能力产生非负权重:规则适合对象相对运动,视觉适合场景与显著像素变化,文本适合摘要确实出现的颜色、地点等词。它使用预先写入提示词的驾驶几何先验作路由,不是以 LLM 推理结果证明实际几何成立。
三个分支原始分数尺度不同,因此不直接求和,而使用查询条件化加权倒数排名融合(RRF):
其中排名从 1 开始,60 是平滑常数。按融合分数排序后,再对前 20 个候选进行重排。这个池大小来自附录 B.1 的扫参,论文称各方法在此附近达到峰值或平台,因此主实验固定同一重排预算。
稀疏分支的文本来源有未解决的表述差异:3.5 与 D.7 描述的是候选视频各自的摘要,4.1 却写 BM25 建在 auxiliary captions 上;A.1 又称其视频摘要模块只用于建库。由于辅助库与评测库分离,不能据此猜测真实索引怎样映射到评测候选。笔记保留词法分支机制,但不把辅助弱标签、候选文本索引和评测真值混为一谈。
一个完整示例¶
以“某辆车切入本车道”为例,先匹配 cut-in 类别:置信度达到 0.6 就复用校准规则,否则参考邻近规则改写。正文示例规则选择 car/truck,用小于 40.0 的距离门控,并检查 4.0 秒内横向偏移,幅度尺度为 14.0。这些是该规则的校准值,不应解释成适用于所有车辆和相机的物理定律。
为说明 A.3 的算子,假设某条候选轨迹的最大横向变化为 7.0,单项软分数为 0.5;达到 14.0 则饱和为 1。这两个轨迹变化值仅为笔记的计算示例,不是论文测量结果。门控未通过的视频仍为零;通过者也只是具有规则证据,最后还要与视觉、词法排序融合,并重排前 20 项。若门控与横向变化来自不同对象,原文算子仍可能赋予高分,不能把这个示例误读为严格的同对象切入验证。
损失函数 / 训练策略¶
本文没有新增端到端视频模型训练损失;核心训练性步骤是以弱标签 AP 进行逐事件黑盒数值搜索。建库摘要器为 Qwen2.5-VL-7B,语言组件默认为 GPT-4.1,置信阈值为 0.6,每事件最多 20 轮,实验使用单张 48 GB NVIDIA RTX A6000。辅助校准阶段不使用评测查询、标签或视频;在线适配提示词则可读取目标数据集无标签字段统计。
实验关键数据¶
主实验¶
主表数值均为百分数,以下保留 Table 1 的口径。DrivingDojo 有 583 个候选视频、41 个查询,236 个视频至少对一条查询相关;每查询相关视频数为 1–138。CarCrashDataset 使用 110 个带事故原因标注的视频和 45 类查询;MM-AU 使用 1,953 个测试视频和 49 类事故描述。它们不是相同难度或相同相关性密度的任务。
Acc@k 指前 k 项至少命中一个真值视频的查询比例,不是逐视频分类准确率或 Recall@k;MRR 是首个相关项倒数排名的平均值,mAP 是各查询 AP 的平均值。
| 数据集 | 方法 | MRR | mAP | Acc@1 | Acc@3 | Acc@5 | Acc@10 |
|---|---|---|---|---|---|---|---|
| DrivingDojo | Qwen3-VL-8B | 20.1 | 2.2 | 14.6 | 31.7 | 51.2 | 68.3 |
| DrivingDojo | NSVS-TL | 31.8 | 4.9 | 22.0 | 34.2 | 43.9 | 53.7 |
| DrivingDojo | STRIVE-D | 38.7 | 8.6 | 26.8 | 48.8 | 53.7 | 73.2 |
| MM-AU | Qwen3-VL-8B | 32.7 | 6.3 | 20.4 | 38.8 | 55.1 | 61.2 |
| MM-AU | NSVS-TL | 18.0 | 2.8 | 6.1 | 20.4 | 36.7 | 53.1 |
| MM-AU | STRIVE-D | 40.5 | 9.5 | 26.5 | 53.1 | 59.2 | 65.3 |
| CarCrashDataset | Qwen3-VL-8B | 40.1 | 33.5 | 28.9 | 46.7 | 62.2 | 66.7 |
| CarCrashDataset | NSVS-TL | 23.1 | 19.3 | 11.1 | 24.4 | 37.8 | 53.3 |
| CarCrashDataset | STRIVE-D | 45.0 | 37.7 | 28.9 | 60.0 | 73.3 | 75.6 |
DrivingDojo 的 26.8% 对 14.6% 是增加 12.2 个百分点、相对提高 83.6%,不是对所有基线都提高 84%;相对 NSVS-TL 的 Acc@1 只增加 4.8 个百分点。CarCrashDataset 的 Acc@1 为 28.9%,与 Qwen3-VL-8B 并列,不能说所有指标均严格领先。
原文内部数字不完全一致:Table 1 的 DrivingDojo Qwen3-VL-8B Acc@1 为 14.6,Table 8 的 +Reranker 行却是 7.3;Table 8 的 CarCrash Qwen3-VL-2B +Reranker MRR/mAP 为 32.1/38.3,Table 1 则为 38.3/32.1。此处不自行交换或统一,主结果只引用 Table 1,并降低对精确增益口径的确定性。
消融实验¶
下表来自 4.3 的正文以及附录 Table 6;去门控、去实体选择器的绝对分数由正文报告的百分点下降计算得到,不是另读图估值。所有项均为 DrivingDojo,百分数。
| 配置 | Acc@1 | mAP | 说明 |
|---|---|---|---|
| 完整 STRIVE-D | 26.8 | 8.6 | 完整模型 |
| 去稠密分支 | 9.76 | 未报告 | 4.3 明确给出 Acc@1 |
| 软分数二值化 | 12.2 | 未报告 | 下降 14.6 个百分点 |
| 去硬门控 | 19.5 | 未报告 | 按下降 7.3 个百分点计算 |
| 去实体选择器 | 22.0 | 未报告 | 按下降 4.8 个百分点计算 |
| NSVS-TL 替换规则、保留融合与重排 | 12.2 | 3.9 | Table 6,固定外围检索流程 |
没有从缓存中的 Figure 3/4 猜测未印出的图形数值。去校准库、去规则分支和去稀疏分支的文字分析可以说明趋势,但此处不补造完整定量行。
关键发现¶
- 最严重的整体退化是去稠密分支:26.8% 降至 9.76%。这反驳了“规则足以替代视觉”的解释,本文提升来自互补。
- 在规则内部,连续强度最重要:二值化后仅 12.2%。硬门控与对象选择继续减少误匹配;这些消融固定其余参数且不重新校准,反映该固定系统的依赖,不能证明其他规则形式也必然如此。
- Table 6 中保持相同融合与重排、改用 NSVS-TL 后,Acc@1 从 26.8% 降至 12.2%,mAP 从 8.6% 降至 3.9%。这支持校准连续规则优于直接替换的结构化分支,但没有单独分离“校准”和“连续分数”的全部作用。
- 附录五次完整流水线重跑得到 DrivingDojo Acc@1 为 26.8±1.3,CarCrash 为 28.9±1.2;稳定性报告不能消除主表与附录基线数字冲突。
在线耗时来自 Table 2/7,而非离线感知、摘要生成和校准总成本:
| 方法或阶段 | 平均在线耗时 | 证据 |
|---|---|---|
| Qwen3-VL-Embedding-8B | 128.54 ms | Table 2;也是 Table 7 稠密分支 |
| STRIVE-D 完整方法 | 3.10 s | Table 2;Table 7 合计 3,096.66 ms |
| NSVS-TL | 4,868.05 s | Table 2 |
| STRIVE-D 规则生成 | 1,987.43 ms | Table 7,仅适配分支调用 |
| STRIVE-D 多源融合 | 725.26 ms | Table 7 |
两项 LLM 阶段占报告总耗时约 87%;完整方法不能写成 128.54 ms。相对 NSVS-TL 约 1,500 倍加速也不能解释为比稠密检索更快;表内没有单独列出 matcher 与重排的耗时,完整部署的成本边界仍需进一步说明。
亮点与洞察¶
- 将语言知识与数值测量职责分离。LLM 可以提出“该检查哪些字段”,但最终尺度必须由感知记录上的排序表现选择,这比把语言先验当作物理测量可信得多。
- 用连续规则分数而不是仅返回成立/不成立。检索关心谁更应排在前面,事件边界附近的强弱差异正是二值输出丢失的信息。
- 把校准规则当作可复用检索部件。类似方法可用于有对象时间序列的工业或体育视频,但迁移前必须重新审视字段尺度、弱标签质量和规则覆盖范围。
局限与展望¶
- 作者明确承认不支持显式“事件 A 后发生事件 B”或带作用域的否定。复杂时序查询只能回退到其他分支或近似适配,不能把现有规则说成完整时序逻辑系统。
- 校准依赖有噪声的摘要事件标签;极端类别不均衡与单正例事件限制 AP 的可靠性。需要独立小规模人工校验、弱标签置信建模和稀有事件不确定性报告,而不是仅增加提案轮数。
- 视频层门控与软证据可能来自不同对象或不同时间。可研究同轨迹、同时间窗的联合证据约束,检查是否减少“各条件分别成立但事件未成立”的高分候选。
- 感知误差、遮挡与对象身份切换会传播到规则分数。论文没有报告更换感知系统、长视频或车队规模在线服务的全面鲁棒性与成本实验。
- 稀疏索引来源、正式算子与提示词差异、主表与附录基线冲突,以及缺少目标适配独立校准,都影响复现与结论精度。上线还需核对感知偏差、视频授权和隐私边界。
相关工作与启发¶
- vs Qwen3-VL / SigLIP 系列:稠密方法通过共享视觉文本空间检索,STRIVE-D 增加显式运动记录与校准规则;稠密分支仍是不可缺少的底座,新增结构化精度以秒级在线调用和离线预处理为代价。
- vs NSVS-TL:后者以时序逻辑组织视频验证,本文用较平坦的实体、门控和连续分数加数据校准。Table 6 的同流水线替换有助于控制外围因素,但本文表达能力也更受限。
- vs iFinder:本文复用其感知结构,不重新发明几何提取;新意在弱监督数值校准、规则复用/适配和多源排序,而非 LLM 本身获得了真实几何能力。
- vs LLM-as-Optimizer:本文把语言提案接到可执行规则与 AP 反馈上。可延伸的研究问题是,固定同一弱标签和预算后,随机搜索或传统黑盒优化是否能达到同等校准效果;论文未提供这个比较。
评分¶
- 新颖性: 4/5 — 将规则数值校准明确落到弱监督排序目标,贡献边界较清楚。
- 实验充分度: 3/5 — 三数据集、结构替换和五次重跑较完整,但数据口径冲突与复现细节削弱证据。
- 写作质量: 3/5 — 失败模式与组件对应直观,正式定义、提示词和附录存在需澄清的不一致。
- 价值: 4/5 — 对驾驶场景挖掘有实用启发,但仍需承担感知、在线 LLM 与校准维护成本。