跳转至

Clue Matters: Empower Video Reasoning with Brain-Inspired Latent Clue Learning

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4320
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/5375.pdf
领域: 多模态推理 / 视频问答
关键词: 时序五元组、线索认知、自适应线索过滤、两阶段监督、视觉压缩

一句话总结

ClueNet 先把视频转换为带时间区间的实体交互线索,再学习哪些线索既与问题相关又受画面支持,通过两阶段监督在 STAR、NExT-QA 和 MVBench 分别达到 77.6%、84.3% 和 69.8%;可选视觉压缩进一步提速,但不应与最高精度配置混为一谈。

研究背景与动机

视频问答的困难不仅是识别画面里有什么,还包括把不同时间出现的动作串成证据。例如,“拿走瓶子之后关上了什么”要求区分拿取、持有和关闭的时间关系。VideoLLaMA3、Qwen2.5-VL 等模型把视觉 token 接到语言模型上直接作答,即使能流畅描述场景,也可能看错主体、把海报认成食物,继而沿错误语义生成一段自洽解释。论文把这些问题分别归为视觉感知偏差、线索认知偏差和归纳推理偏差。

CCoT、Video-of-Thought 等工作已经引入场景图或分步推理,但“写出中间过程”不等于“中间过程可信”。一条线索可以与问题高度相关,却根本没有出现在视频里;也可以确实出现在画面里,却对当前问题没有帮助。更隐蔽的问题是训练时提供人工标注的完美线索,测试时却让模型使用自己生成的含噪线索,这会使模型学会依赖一种部署时不存在的证据质量。

本文借鉴视觉认知从感知、结构化理解到证据整合的层次关系,但不是实现生物神经回路。核心 idea:把带时间定位的线索设为视频与答案之间的显式接口,先分别教会模型提取和利用线索,再用自生成线索与答案监督训练过滤器,使推理适应真实证据噪声。

方法详解

整体框架

输入是视频和问题,输出是选择题答案或开放式回答。推理依次经过关键帧选择、线索认知器、自适应线索过滤和可选视觉压缩,最后把过滤后的线索与视觉信息交错输入语言模型。模型仍然看视频,不是把全部视觉输入替换成文字场景图。

训练则分两阶段:第一阶段交替训练线索生成和真实线索条件下的回答;第二阶段改用模型生成的线索,并通过答案损失优化过滤器与回答能力。这个训练路径解释了为什么图中的线索认知器和过滤器能够协同,而不只是前后拼接两个独立工具。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    INPUT["视频 + 问题"] --> KS["关键帧选择"]
    KS --> CLUE["线索认知器"]
    CLUE --> ACF["自适应线索过滤"]
    ACF --> VC["视觉压缩<br/>可选"]
    KS --> VC
    VC --> OUTPUT["视觉与线索交错输入<br/>生成答案"]
    ACF --> OUTPUT

关键设计

1. 关键帧选择:先去重复,再保留问题可能需要的细节

直接均匀采样容易漏掉短暂动作,但对所有帧运行完整语言模型又很昂贵。关键帧选择 KS 首先用预训练 ResNet-18 提取帧特征,采用 LVNet 的时序场景聚类 TSC,以动态阈值将视觉相近的帧归组,形成去冗余候选集。这一步主要减少重复场景,并不声称已经找到了答案证据。

第二步才使用问题信息:spaCy 提取问题中的名词和动词,同时保留整个问题的表征;候选帧则被表示为 patch 特征。评分同时考虑整句问题与帧内 patch 的最大余弦相似度,以及关键词与 patch 的最大匹配,用两个权重结合后选取前 16 帧。最大匹配使一个小区域里的关键物体不易被整帧平均特征淹没,整句分支则补充关键词孤立出现时缺少的上下文。缓存中的原式有排版损坏,因此这里只说明已能确认的机制,不补写其完整公式或权重数值。

2. 线索认知器:把动作压缩成可追踪的时序五元组

线索认知器不是额外的物体检测器,而是通过指令提示和监督微调,让多模态模型输出结构化线索。每条线索记录交互起止时间、主体、关系和客体;全文采用如下表示:

\[ C_i=\langle t_{\mathrm{start}},t_{\mathrm{end}},s_i,r_i,o_i\rangle. \]

例如 <2-4> person take bottle 表示第 2 至第 4 帧出现“人拿瓶子”的交互,而不是笼统地说视频中有一个瓶子。完整线索集合随视频片段增量更新,承载主体状态和关系的时间演化。与静态场景图相比,真正重要的变化是关系有了有效时间区间,因此可以回答动作顺序问题,也能让后续过滤器回到对应片段寻找视觉支持。

第一阶段使用时间对齐的场景标注五元组监督线索生成;另一个子任务使用完整真实线索、问题和视频监督答案生成。两项监督分开、按 batch 交替优化,目的是先建立“看视频得到结构化证据”和“从结构化证据推出答案”两种能力。标题中的 latent 不应理解为完全不可读的隐藏思维:这里生成的线索本身是可以检查的文字五元组。

3. 自适应线索过滤:同时检验相关性和视觉支持

只训练上述两项任务还不够,因为推理时的五元组可能漏写、误认或加入无关关系。第二阶段让线索认知器先生成候选线索,再由自适应线索过滤 ACF 为每条线索计算门控。语义相关性分支比较问题和线索的语言模型最后一层平均 token 表征;视觉忠实性分支比较线索与其时间区间内视频帧的平均视觉 token 表征。每个分支使用线性层、LayerNorm 和 ReLU,两个分支输出相加后经 sigmoid 得到门控权重。

门控不是简单删掉一句文本:它缩放该线索中所有 token 的输入嵌入,从而构成可微的软过滤。回答模型接收这些加权线索、视频和问题,答案交叉熵提供外部任务信号;门控上的 L1 稀疏正则抑制所有线索都获得高权重的退化情况。这样,一条“看似能解释问题、但视频并不支持”的线索与一条“真实但无用”的线索都有机会被压低。

这仍然不等于事实核验保证。答案监督约束的是任务效果,并没有为每条门控提供独立真伪标签;视觉与语言表征也都来自模型系统。原文强调答案标签能避免纯粹自评分闭环,但不能据此推断过滤器永远不会保留错误证据。另一个实现边界是,可微门控并不自动意味着离散线索文本的生成过程也全程可微。

4. 视觉压缩:让通过过滤的线索决定哪里保留完整画面

过滤器已经判断哪些证据值得相信,因此视觉压缩 VC 复用其视觉忠实性分数,决定哪些帧应保留全部视觉 token。若多个线索覆盖同一帧,就把各线索的门控权重与对应视觉支持分数相乘,再取平均。原文式 7 的帧保留分数为:

\[ S_{\mathrm{ret}}(V_t)=\frac{1}{|\mathcal M_t|}\sum_{i\in\mathcal M_t}g_i\,s_v^{(i,t)}. \]

这里 \(\mathcal M_t\) 是时间区间覆盖帧 \(t\) 的候选线索集合,\(g_i\) 是线索门控,\(s_v^{(i,t)}\) 是该线索与该帧的视觉忠实性分数。达到阈值的帧完整保留,其余帧采用自适应平均池化而不是直接删除,保留一定背景上下文。如果所有帧都低于阈值,最高分帧仍不压缩。正文没有说明 \(|\mathcal M_t|=0\) 时如何处理,不能擅自补一个实现默认值。

这一顺序很关键:先判断证据,再压缩证据之外的视觉冗余,减少在理解问题之前就误删细节的风险。但压缩不是无损的,消融表显示仍会损失少量准确率;因此更合适的理解是证据引导的效率选项,而非免费的性能提升。

一个完整示例

论文图 1 中的问题是“拿走瓶子之后,人物关上了什么”。给出的线索包含 <2-4> person take bottle<5-10> person holding bottle<6-8> person closing refrigerator。拿取结束后出现关闭冰箱的动作,回答应指向冰箱,而不是只因瓶子频繁出现就选择瓶子。

线索认知器提供交互与时间区间,ACF 分别检查这些交互与问题的关系及相应画面的支持,VC 再决定相关帧是否需要完整保留。原文没有为这个例子公布具体门控值,因此这里不虚构阈值判断或线索删减数量;它说明的是证据如何串联,不是一次实测运行记录。

损失函数 / 训练策略

骨干为 VideoLLaMA3,视觉编码器采用冻结的 SigLIP-SO400M,语言模型初始化自 Qwen2.5-7B-Instruct。第一阶段交替优化自回归线索生成交叉熵和真实线索条件下的答案交叉熵;第二阶段改为自生成、软门控后的线索,优化答案交叉熵并加入按线索数平均的门控 L1 正则,系数记作 \(\lambda\)

论文也将方法解释为信息瓶颈:保留对答案有用的信息,减少视觉输入冗余。但这里没有实际估计互信息并以互信息作为训练损失,不能把概念解释等同于已验证的充分统计量性质。完整超参数、进一步理论证明和额外实验都被指向附录;当前缓存只有正文及参考文献,没有这些附录,因此不填学习率、训练轮数、\(\lambda\) 或视觉压缩阈值。

实验关键数据

主实验

以下摘录原文表 1 至表 3。前三项是准确率百分比,最后两项是开放式 NExT-OE 的 WUPS 分数,不能视为普通正确率。WUPS 用语义分类体系中的相似度评估答案;[email protected] 对低于 0.9 阈值的匹配进行 0.1 倍缩放,比 WUPS@0 更严格。

模型 STAR NExT-QA MVBench NExT-OE WUPS@0 NExT-OE [email protected]
InternVideo2.5 69.1 80.6 68.7 28.4 22.0
Qwen2.5-VL 68.4 81.5 65.2 30.6 24.6
VideoLLaMA3 72.1 81.3 68.3 32.3 25.7
ClueNet 77.6 84.3 69.8 35.5 29.2

相对 VideoLLaMA3,STAR 和 NExT-QA 分别提高 5.5、3.0 个百分点;MVBench 相对 InternVideo2.5 提高 1.1 个百分点。论文为 VideoLLaMA3 提供相同训练设置下的一轮普通 SFT;除引用原论文结果的 Flipped-VQA、ViLA、VideoChat2 外,其余开源基线重实现时最多输入 16 帧。不同模型的预训练数据与规模仍不完全相同,这不是只替换一个模块的严格控制实验。

消融实验

原文表 4 最清楚地区分了最高精度与压缩配置。下表时间、GFLOPs 按原文记录,基线未报告同口径推理开销,不能用它们推断相对裸 VideoLLaMA3 的加速倍数。

配置 STAR NExT-QA 推理时间 / s GFLOPs
VideoLLaMA3 72.1 81.3 未报告 未报告
仅阶段 1 70.8 80.6 6.5060 54,197.96
阶段 1 + 阶段 2 75.1 83.3 5.9963 54,026.85
再加 KS 75.4 83.4 6.0443 54,075.02
再加 ACF,不加 VC 77.6 84.3 4.9963 51,355.89
再加 VC 77.3 84.1 3.9298 40,622.84

仅阶段 1 比基线更差,说明完美线索条件下学会回答不代表能处理自生成证据。加入阶段 2 后,STAR 从 70.8 升至 75.1,即提高 4.3 个百分点;相对基线的净增益才是 3.0。ACF 在已有 KS 的配置上带来 2.2 个百分点,而正文称“2.5”的说法与这一相邻行比较不一致,此处以表格为准。

关键发现

  • VC 相对不压缩的 ACF 配置减少约 20.9% GFLOPs、缩短约 21.3% 推理时间,代价是 STAR 降低 0.3、NExT-QA 降低 0.2 个百分点。这是同一线索流水线内部的折中。
  • STAR Feasibility 中 ClueNet 为 66.7,低于 InternVideo2.5 的 68.0。可观察证据优先不必然适合需要不可见常识或可能性判断的问题。
  • NExT-OE 描述类 [email protected] 从 VideoLLaMA3 的 48.7 升至 60.5,但语义答案分数本身不是直接的幻觉发生率测量。
  • 原文图 7 的 oracle 结果与主表基线及其增益标注存在口径不一致;不将其作为精确提升量引用。正文提到 VideoMME、VideoHallucer 和跳过阶段 1 的额外实验,但完整结果在缺失附录中,不能据此补成额外实证表。

亮点与洞察

  • 证据格式同时服务于推理和视觉压缩。时间区间不仅让线索可读,也为视觉支持检查及帧保留评分提供定位接口。
  • 两阶段训练明确暴露了中间表示的训练与推理分布差异。单独第一阶段掉点,是比单纯展示完整模型提升更有解释力的证据。
  • ACF 把“与问题有关”和“由视频支持”分开建模。这个设计可以启发检索增强问答中的相关性与证据真实性分离,但迁移效果仍需另行实验。

局限与展望

  • 作者指出证据优先过滤可能损伤依赖不可观察常识的可行性判断。可考虑显式区分“画面证据”和“外部常识假设”,而非将两者混成同一线索权重。
  • 方法依赖时间对齐的场景图线索标注。正文说 NExT-QA 与 STAR 提供并转换了这些标注,但没有在当前可读材料中充分展开标注来源、转换质量及成本。
  • 线索生成错误仍可能被模型自身表征支持,答案损失也不保证逐线索忠实性。需要独立的线索正确率、时间定位质量和反事实证据干预测试来验证解释是否可信。
  • KS 最终只保留 16 帧,稀疏短动作仍可能提前丢失;VC 对无人覆盖帧的边界处理、图像与文本特征的对齐实现也需要更完整说明。
  • 缓存缺少附录,部分公式抽取损坏,oracle 图与主表口径不一致。现有材料不足以独立复现所有训练细节、确认硬件计时条件或全面核验幻觉抑制主张。

相关工作与启发

  • 对比 CCoT / Video-of-Thought:都用显式中间结构帮助推理,ClueNet 更强调时间定位、线索过滤和自生成证据下的监督适应,而不只是增加一条文字思维链。
  • 对比 LVNet:KS 复用其 TSC 去冗余思路,再以问题与关键词细选帧。应区分所借用的采样基础与本文的线索学习贡献。
  • 对比视觉 token 剪枝:常见方法依赖注意力或相似度直接删减视觉特征;这里先得到线索,再让证据支持决定压缩位置,代价是额外线索生成与过滤流程。

评分

  • 新颖性: 4/5。时序场景线索本身并非全新,但两阶段监督、双分支过滤与证据引导压缩的结合有明确针对性。
  • 实验充分度: 3/5。覆盖选择题、开放式问答和迁移评测,且消融揭示负结果;附录缺失、独立忠实性证据和口径问题限制验证力度。
  • 写作质量: 3/5。主流程与动机清楚,但表格增益、oracle 对照及若干实现边界需要澄清。
  • 价值: 4/5。对需要可追踪证据的视频问答有参考意义,最可复用的是用自生成中间表示训练下游推理的原则。