DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding¶
会议: ECCV2026
论文: ECCV 原文
项目: DART
领域: 视频理解
关键词: 零样本视频时序定位、行列式点过程、谱熵、难度自适应路由、时序标记提示
一句话总结¶
DART 将同一个查询条件化 DPP 核同时用于关键帧选择和难度估计,仅对复杂事件启用结构化时序推理,在不做任务微调的条件下取得 Charades-STA 48.93、ActivityNet Captions 39.89 的 mIoU。
研究背景与动机¶
视频时序定位需要根据一句自然语言,在未裁剪视频中找出事件的开始和结束,而不只是判断视频是否出现了相关物体或动作。 零样本方法通常使用预训练视觉语言模型,把逐帧图像与查询映射到可比较的特征空间,再把高分帧合并为时间区间。 这对“某人坐下”这样的单一动作比较自然,却容易把“翻转后离器并落到垫子上”压缩成最容易匹配的落地画面。 论文在 ActivityNet Captions val_2 抽取各 100 条简单和复杂查询,报告最强特征匹配方法的 mIoU 从 42.2 降到 30.6,相差 11.6 个百分点。 这里的复杂性主要是时间先后、因果或条件关系,不等同于句子长,也不等同于视频长。
直接让大视觉语言模型对所有查询进行思维链推理,并不能自动弥补这类缺口。 如果输入帧漏掉了关键动作阶段,模型只能围绕残缺证据推理;如果输入充满重复或无关画面,中间推理又可能被干扰。 另一方面,简单事件不需要逐阶段解释,额外推理既增加生成时间,也可能引入错误边界。 因此本文同时面对两个具体问题:哪些帧足以支撑定位,以及哪些视频与查询组合值得投入结构化推理。
作者把二者连接到同一个关系矩阵:先同时编码帧与查询的相关性、帧间视觉差异和时间距离,再观察这个矩阵有多少显著的谱成分。 直觉上,单阶段事件的证据更集中,多阶段事件的相关证据则分布在多个不同的模式中。 这是一种利用视觉证据结构估计难度的办法,不是额外训练一个查询分类器,也不是让语言模型自行报告置信度。 核心 idea:用查询条件化 DPP 共同提供精简的时序证据和谱熵难度信号,再把需要推理的事件交给具有明确中间输出的时序标记提示。
方法详解¶
整体框架¶
输入是未裁剪视频和自然语言查询,输出是一个开始、结束时间戳组成的区间。 视频先按 3 FPS 降采样,提取每帧特征及查询特征,再进入“查询条件化证据选择”。 这一阶段不是简单取相似度最高的若干帧,而是用 DPP 兼顾相关性和互补性,并按新增信息量自适应决定关键帧数。 随后“谱熵难度路由”读取整个查询条件化核的特征值分布,而不是只统计选中了多少帧。 最后“双路径时序定位”把同一组带时间戳的关键帧交给快速直接预测或慢速时序标记提示。 慢速路径按全局事件分析、逐帧角色标注、边界提取执行,但这三个步骤发生在一次生成内部,并非三次独立调用。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["视频与查询<br/>降采样及特征提取"] --> Evidence["查询条件化证据选择"]
Evidence --> Routing["谱熵难度路由"]
Routing -->|低谱熵:直接预测| Localize["双路径时序定位"]
Routing -->|高谱熵:时序标记提示| Localize
Evidence -.->|带时间戳的关键帧| Localize
Localize --> Output["开始与结束时间戳"]
关键设计¶
1. 查询条件化证据选择:把相关性与跨阶段互补性放入同一核
普通相似度排序会重复选择同一个显著动作阶段,均匀采样又可能跳过短暂但重要的转折。 DPP 的子集行列式可以理解为所选证据张成的体积:帧本身重要、彼此又不重复,子集才更有价值。 本文先为候选帧构造视觉高斯核与时间高斯核的乘积,再用查询相关性对核的行列加权。 视觉上相似但相隔较远的帧,会因时间核而降低彼此的相似项,从而仍有机会同时保留。 这对重复动作以及同一事件不同时间阶段尤其重要,避免“外观相像”直接等价于“证据冗余”。 记帧特征为 \(f_i\)、查询特征为 \(q\)、帧时间为 \(t_i\),论文给出的核心核构造为:
其中 sigmoid 权重压低与查询不相关的帧,两个高斯核分别表达视觉及时间相似性。 加权后的子集行列式等于基础子集行列式乘上所选帧权重的乘积,因此相关性和多样性会共同影响选择。 算法逐次加入边际增益最大的帧,而不是对所有子集做穷举。 早期选择通常覆盖最有信息的内容,后续新增帧逐渐趋于重复,因而作者用相对增益下降作为停止信号。 原文写出的条件是 \(\Delta_k/\Delta_1<\varepsilon\),默认 \(\varepsilon=0.05\),而不是固定所有查询都用相同帧数。 最终的 \(K\) 张关键帧连同各自时间戳交给定位模型;这里的 \(K\) 是每个视频与查询组合的自适应结果。
缓存第 6–7 页的式 (1)–(2) 存在明显抽取损坏,不能据此准确恢复边际增益的完整公式。 正文将其解释为对数行列式增益,并解释了多样性项与查询相关性项的共同作用;本笔记保留该机制和可读的停止条件,不猜补损坏公式。 特别是对数增益的符号、接近零时的处理及停止实现,复现时应回查原始公式或代码。 论文关于贪心近似保证的概括也不应被理解为任意核和任意停止规则都自动具有同样保证。
2. 谱熵难度路由:判断证据结构,而不是数帧数
“从客厅走到厨房”可能因场景变化而需要很多帧,却仍然只是一个容易理解的动作。 “拿起电话并接听”可能只用少量帧就能覆盖,但需要区分具有先后联系的子动作。 因此 DART 不把自适应帧数直接当作难度,而对完整的查询条件化核做特征分解。 少数特征值占主导表示相关证据集中于少数模式,能量分散则表示多个独立的相关模式同时存在。 作者将后者解释为更丰富的事件阶段结构,以此决定是否启用慢速路径。 设候选帧数为 \(M\),将核的特征值归一化后计算归一化谱熵:
这里的 \(q_i\) 是谱概率,与前面表示查询向量的 \(q\) 不同。 谱熵位于 \([0,1]\):能量越集中越接近低值,多个特征值能量相近则越接近高值。 当 \(H_{\mathrm{spectral}}\leq\theta\) 时走快速路径,否则走慢速路径,默认 \(\theta=0.45\)。 同一个核既控制证据选择又控制路由,使二者都围绕当前查询,而不是围绕整段视频的一般视觉变化。 不过,核中的视觉相似性与时间距离没有显式编码因果方向,“谱模式对应事件阶段”是作者的解释及经验假设。 后续难度分桶实验支持相关性,但不能据此宣称谱熵已经识别出真实因果链。
3. 双路径时序定位:仅在需要时生成受约束的事件结构
快速路径输入关键帧、时间戳和规定输出格式的定位指令,直接给出开始与结束时间,不生成中间推理。
它仍然是 LVLM 的直接预测,不能把本文的快速路径实现完全等同于手写的相似度阈值算法。
慢速路径采用时序标记提示(Temporal Markup Prompting,TMP),不是只补一句“逐步思考”。
其第一步是全局时序分析:先分解查询中的关键动作,判断它们的先后、因果或条件关系,并形成粗略时间范围。
这要求模型在逐帧作判断前先确定整个事件应包含哪些阶段,避免看到显著画面就过早决定边界。
第二步是逐帧时序角色标注:每张关键帧都必须获得 before、start、during、end、after 中的一个标签。
这些标签表示相对于整个目标事件的位置,不是为每个子动作分别预测一套独立区间。
模型还被要求按时间顺序保持标签单调不减,不能在判为事件结束后又回到事件开始。
这种结构限制让“翻转、离器、落地”的关系直接参与整个区间的判定,而非仅输出一段解释性文本。
第三步从标签提取边界:第一个 start 帧的时间作为开始,最后一个 end 帧的时间作为结束。
与直接回归连续边界相比,这使慢速路径的边界依赖被选关键帧的时间分辨率。
论文称多样性选择有助于保留事件外上下文,但高查询权重仍可能压低背景帧,不能把边界外证据视为必然存在。
若关键阶段在降采样或 DPP 选择时丢失,标签约束本身无法补回原本没有看到的视觉信息。
此外,原文描述的是提示约束,没有给出非法标签序列的强制解码器或缺少 start、end 时的回退规则。
因此“单调标注”应理解为方法要求,而不是已经证明模型在每次生成时都满足的性质。
这也说明证据选择为何是前置条件:慢速路径组织和解释已有证据,不能替代正确的证据输入。
一个完整示例¶
以论文图 1 的体操事件为例,查询要求覆盖翻转之后离器并落到垫子上的过程,而非只找到着地的一瞬间。
下面是机制示意,不是图中帧标签或时间戳的实测复现。
候选帧中可能有大量相似的准备动作和落地画面,查询条件化 DPP 应尽量保留能互补地表现翻转、离器及落地的证据。
若这些相关阶段让谱能量分散,谱熵超过阈值,样本便进入慢速路径。
全局分析先把几个动作组织成同一个目标事件,之后再沿时间线标注事件前、开始、持续、结束和事件后。
翻转阶段的相关帧应参与起始判定,落地后的帧则帮助区分终止位置,最后从 start 与 end 标签取出区间。
若改成简单单阶段事件且谱熵较低,同样的关键帧输入可以直接走快速路径,不必生成这套标签。
损失函数 / 训练策略¶
DART 不新增任务损失,也不对定位数据做任务特定微调;其能力来自预训练模型以及推理时选择、路由和提示。 使用的骨干是 LLaVA-1.6-7B,所有实验在单张 NVIDIA A100 80 GB 上完成。 视觉核带宽为 \(\sigma_v=0.5\),时间核带宽为 \(\sigma_t=2.0\),相关性温度为 \(\tau=0.1\)。 论文明确说这三个参数通过 Charades-STA 验证划分上的网格搜索选择,因此“不训练”不等于“不使用验证集调参”。 另外设置 \(\varepsilon=0.05\) 和 \(\theta=0.45\);推理用贪心解码,最大生成长度为 512 tokens。 正文没有进一步说明该验证划分的构造,参数选择协议仍需复现材料补充。 论文将帧与查询特征描述为来自同一 LVLM 的视觉及文本编码端,但没有完整交代具体层、池化和特征对齐的实现。 本笔记不把这些缺失细节补写成作者已给出的操作步骤。
实验关键数据¶
主实验¶
表 1(第 11 页)采用 Charades-STA test 与 ActivityNet Captions val_2;下表只摘录三个零样本方法,单位均为百分数。 Charades-STA test 有 3,720 个视频与查询对,ActivityNet Captions val_2 有 17,031 对。 [email protected]、[email protected] 表示预测区间 IoU 超过相应阈值的比例,mIoU 是所有预测的平均 IoU。
| 数据集 | 方法 | [email protected] | [email protected] | mIoU |
|---|---|---|---|---|
| Charades-STA | TFVTG | 49.97 | 24.32 | 44.51 |
| Charades-STA | TAG | 48.58 | 26.67 | 45.69 |
| Charades-STA | DART | 52.04 | 29.45 | 48.93 |
| ActivityNet Captions | TFVTG | 27.02 | 13.39 | 34.10 |
| ActivityNet Captions | TAG | 28.91 | 15.07 | 36.55 |
| ActivityNet Captions | DART | 32.14 | 18.11 | 39.89 |
DART 相比 TAG 的 mIoU 提升分别为 3.24 和 3.34 个百分点,不能把它写成等幅的相对百分比提升。 优势也不是覆盖所有零样本指标:同表 GranAlign 在 ActivityNet Captions 的 [email protected] 为 34.0,高于 DART 的 32.14。 分布外测试覆盖时间位置偏移、Charades-CD、Charades-CG,以及跨数据集设置。 表 2(第 12 页)ActivityNet Captions OOD-1 的 mIoU 为 DART 39.7、TAG 36.2,相差 3.5 个百分点。 表 3(第 12 页)新组合与新词设置下,DART 的 mIoU 分别为 45.30 和 51.09;但新词 [email protected] 的 55.61 低于 TFVTG 的 56.26。
消融实验¶
表 6(第 13 页)在 Charades-STA IID 上逐项改动完整系统;不是重新训练不同监督模型。
| 配置 | [email protected] | [email protected] | mIoU | 改动 |
|---|---|---|---|---|
| 完整 DART | 52.04 | 29.45 | 48.93 | 自适应证据与路由 |
| w/o DPP | 46.79 | 25.55 | 44.70 | 改为均匀采样,保留路由与 TMP |
| w/o Adaptive K | 49.01 | 26.73 | 47.26 | 固定 K=8 |
| w/o TMP | 48.65 | 25.92 | 46.13 | 以通用 CoT 替换 TMP |
| Fast only | 46.71 | 25.34 | 44.34 | 所有查询直接预测 |
| Slow only | 49.80 | 26.78 | 47.53 | 所有查询使用 TMP |
去掉 DPP 降低 4.23 mIoU,且均匀采样加路由与 TMP 的 44.70 只略高于 Fast only 的 44.34,说明推理收益依赖证据质量。 通用 CoT 比 TMP 低 2.80 mIoU,固定关键帧预算低 1.67 mIoU,自适应路由比全慢速高 1.40 mIoU。 表 5(第 13 页)的选择策略比较进一步给出 Top-k + NMS 47.38、DPP 48.93 mIoU,差值为 1.55 个百分点。
表 7(第 13 页)的效率测试使用 Charades-STA 和单张 A100,时间为每条查询秒数;帧数是表中报告的每查询处理量,不是原始视频总帧数。
| 方法 | 帧数 | 时间(秒/查询) |
|---|---|---|
| TFVTG | 86 | 4.7 |
| TAG | 86 | 3.4 |
| DART (Slow) | 12 | 5.1 |
| DART (Adaptive) | 12 | 3.9 |
关键发现¶
- 自适应 DART 相比全慢速将延迟从 5.1 降到 3.9 秒,论文报告降低 23.5%,且 mIoU 同时由 47.53 升至 48.93。
- 12 对 86 帧意味着视觉输入大幅压缩,但 DART 的 3.9 秒仍慢于 TAG 的 3.4 秒,不能宣称相对 TAG 的速度也提升。
- 表 8(第 14 页)在 ActivityNet Captions 验证查询中按五个等宽谱熵区间各取 200 条,总计 1,000 条,仅使用快速路径。
- 随区间从 \([0,0.2)\) 到 \([0.8,1.0]\),mIoU 依次为 49.2、43.7、37.1、31.8、27.4,支持谱熵与直接定位难度相关,但该均衡分桶样本不能代表自然查询的难度分布。
亮点与洞察¶
- 复用证据结构做路由。 难度估计不用另一个模型,而从已经为关键帧选择构建的核中读取信号;查询相关性让路由不只反映背景变化。
- 中间表示直接服务最终边界。 TMP 的标签不是与结果无关的解释文本,开始与结束直接由标签提取,因而更容易检查错误发生在哪一步。
- 把更多推理是否有益变成可消融问题。 Fast only、Slow only 和完整路由的比较说明全量推理并非最优,但这仍是当前骨干和数据上的经验结论。
局限与展望¶
- 稀疏证据与边界精度。 慢速路径从关键帧时间取边界,短动作和精细起止位置可能受采样限制;粗定位后局部加密采样是读者建议,并非本文已验证结果。
- 谱熵不等于推理能力检测。 复杂背景、重复事件或编码偏差都可能影响核的谱;本文没有给出跨骨干难度校准或路由错误的系统统计。
- 复现细节仍有缺口。 缓存增益公式损坏,正文也没有完整提示词、非法标签回退、特征提取细节以及核近零时的数值处理说明。
- 跨数据集表存在待解释差异。 表 4(第 13 页)DART 的首选结果为 [email protected] 53.17、[email protected] 27.84,而同为 Charades-STA 的表 1 为 52.04、29.45;正文没有充分解释零样本评估配置差别,不应将两表混为同一设置。
- 验证与成本边界。 当前主要证据来自两个数据集、一个骨干和单张 A100,没有跨随机种子的置信区间;“谱分解成本可忽略”也缺少长视频规模下的独立计时。
相关工作与启发¶
- 对比 TFVTG。 TFVTG 把查询分解为子事件后做匹配并聚合;DART 进一步决定是否需要结构化时序推理,并让选帧覆盖互补证据。
- 对比 TAG 与 GranAlign。 TAG 是本文主要 mIoU 基线,GranAlign 通过多粒度查询与视频描述对齐;DART 的差异在于查询条件化证据选择和难度路由,而非所有检索指标都更高。
- 对比通用 CoT。 DART 要求全局关系分析和完整单调标签序列,限制了推理的中间形式;消融支持这一任务结构比开放式逐步解释更有效。
- 可迁移启发。 视频问答或长视频检索也可尝试先估计证据是否分散再分配推理预算,但应分别验证路由校准、漏证据风险和实际端到端成本。
评分¶
- 新颖性: 4/5。DPP 本身不是新工具,亮点在于同核证据选择与谱熵路由,以及定位专用的中间标签。
- 实验充分度: 4/5。覆盖 IID、多个 OOD、组件及效率比较,但缺少跨骨干验证和路由错误分析。
- 写作质量: 3/5。动机与流程清楚,部分实现细节和跨表差异仍待解释;缓存公式损坏另属文本抽取限制。
- 价值: 4/5。为免任务微调的视频定位提供可理解的推理预算分配方案,适合关注复杂事件与部署成本的研究者。