跳转至

Wavelet-based Intra-video Counterfactual Reasoning for Video Question Grounding

会议: ECCV 2026
论文: ECCV 2026
领域: VLM推理
关键词: 视频问答定位 / 因果干预 / 视频内反事实挖掘 / 小波动态建模 / 弱监督学习

一句话总结

针对弱监督视频问答定位中因外观相似导致的“视频内时序偏置”难题,提出 WICI 框架,通过小波多尺度动态建模捕捉帧间微弱运动线索,并结合课程驱动的视频内反事实挖掘与边界间隔损失,实现因果证据的忠实定位与鲁棒推理。

研究背景与动机

视频问答定位(Video Question Grounding, VideoQG)要求模型在回答自然语言问题的同时,精准定位视频中支撑该答案的时序视觉证据。在缺少高成本逐帧时序边界标注的弱监督设定下,现有方法主要依赖预训练视觉-语言编码器与跨模态注意力机制,通过多示例学习或跨模态对比对齐来间接挖掘证据区间。然而,这类以静态外观为导向的视觉表征极易使模型依赖虚假关联与表面统计偏置,陷入“知其然不知其所以然”的捷径学习困境。

现有去偏工作大多聚焦于数据集层面的跨样本先验关联(如语言先验或视听共现偏置),却普遍忽略了视频内部更为隐蔽且普遍的“视频内时序偏置(intra-video temporal bias)”。视频在时间维度上天然存在大量视觉高度相似的帧,它们共享相同的背景与实体,但不同时段片段对回答问题的因果贡献却大相径庭。在 NeXT-GQA 等典型基准中,与问题无关的背景帧或极具误导性的干扰帧占据了视频的大半时长;由于当前主干网络表征偏重静态外观而弱于动态细节,因果核心片段与相似的非因果片段在表征空间极易纠缠混淆。从结构因果模型(SCM)的视角审视,这种因果与非因果因素在全局表征中的混叠,诱导出了从非因果内容到答案预测的虚假捷径路径(\(N \to V \to a\)),使得模型即使打乱时间顺序依然给出相似答案,严重损害了定位精度与推理真实性。

要切断这一虚假因果链,单纯依靠跨样本对比或强制因果/非因果表征正交分离十分困难,因为单视频内时序相邻帧的高度同质性往往会导致表征解耦训练不稳定。核心 idea:将去偏重点从特征解耦转向决策偏好建模与细粒度动态增强,提出 WICI 框架,一方面用小波变换将视频特征显式分解为高频动态与低频外观以提升帧间辨别力,另一方面通过课程驱动的视频内反事实挖掘构造由易到难的时空反事实样本,配合边界间隔损失对因果、全景与反事实预测施加严格的概率分离约束。

方法详解

整体框架

WICI 的整体输入包括均匀采样的视频帧序列与自然语言问题及其候选选项,最终输出预测的正确答案以及支撑该答案的最佳时序定位区间。模型首先通过冻结的 CLIP-ViT 提取帧级视觉特征,并利用 RoBERTa 分别编码纯问题文本与问题-选项拼接对。为突破静态表征的局限,视觉特征首先经过小波动态建模(WDM)模块,在时序维度通过多级小波滤波显式分离并融合高频运动细节;随后通过时序 Transformer 编码器与高斯平滑定位模块得到针对问题的帧级因果注意力分布。在推理决策层,视频内反事实挖掘(ICM)模块利用注意力分布动态构建课程驱动的左右非因果反事实区间与时序打乱反事实样本,配合全视频参考表征,构建三级因果偏好结构,最终联合分类损失与跨模态对齐损失端到端优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入:视频帧序列与问题-选项文本"] --> WDM["小波动态建模<br/>多级DWT分离高频动态与低频外观"]
    WDM --> TempEnc["时序编码与高斯平滑定位<br/>建模全局依赖并输出时序注意力"]
    TempEnc --> ICM["视频内反事实挖掘<br/>课程驱动构建边界反事实与时序打乱分支"]
    ICM --> MarginLoss["边界间隔因果判别<br/>量化因果/参考/反事实预测概率级差"]
    MarginLoss --> Out["输出:正确答案预测与紧凑时序证据区间"]

关键设计

1. 小波动态建模:离散小波滤波分离高频动态与低频外观 常规视频编码器提取的全局特征严重偏向静态实体与背景外观,难以区分视觉相同但动作与状态不同的时序片段。为以轻量开销捕获区分因果动作不可或缺的细粒度帧间运动线索,WDM 模块引入基于离散小波变换(DWT)的时序分解层。该模块沿时间维度采用一维分组卷积实现,卷积核使用经典 Haar 小波基初始化,步长设为 2 模拟下采样过程,将输入信号分离为低频趋势近似分量与高频突变细节分量。低频近似分量递进输入下一级小波分解以构建多尺度时序结构,各级高频细节分量则通过双线性插值上采样恢复至原始时间分辨率,按固定残差权重(0.3)注入原始视觉嵌入中。这种显式频率解耦机制在完整保留主体语义上下文的同时,极大增强了模型对状态转移和细微动作演变的敏感度。

2. 视频内反事实挖掘:课程驱动生成难度递增的时空反事实片段 传统对比学习或因果负样本通常来自跨视频样本或随机裁剪,难以精准切除单视频内部与因果区间视觉高度一致的非因果捷径。ICM 模块通过构造两类精准的视频内反事实干预:一是基于帧位置的时序反事实,二是扰乱时序因果链的帧打乱反事实。针对时序反事实,直觉表明离真实因果区间越近的片段往往包含越相似的物体与运动残影,混淆度最高;若训练初期直接选用近邻片段作为负例,粗糙的初始注意力会导致过度惩罚甚至破坏收敛。因此,ICM 依据当前注意力分布估计因果区间的时序中心与方差,在左右两侧外围边界放置反事实提议窗口,并设计课程学习调度函数 \(\rho(e) = (e / E_{\max})^\gamma\):随训练轮次推进,反事实窗口逐渐向内收缩逼近因果区间,实现由易到难的平滑因果干预。结合全视频时序乱序分支,模型得以在外观不变量下孤立非因果混淆因素。

3. 边界间隔因果判别:量化因果预测层级并惩罚非因果虚假相关 现有因果去偏常使用松散的不等式排序或硬性正交不变性约束,但在视频内局部片段高度相似的情形下极易造成梯度震荡。为提供稳定且可度量的判别监督,本文将因果优先原则形式化为严格的预测概率层级:因果片段支撑的正确答案后验概率必须显著高于全视频参考输入,而全视频输入又必须显著高于反事实干扰片段。基于此,模型分别计算因果表征 \(v_t\)、全视频表征 \(v\) 以及反事实表征 \(v_{cf}\) 在正确答案上的交叉熵损失,并通过双边界间隔函数施加分离约束: $\(\mathcal{L}_{\mathrm{mdl}} = \max(0, \mathcal{L}_{ce}(v_t) - \mathcal{L}_{ce}(v) + \lambda_1) + \max(0, \mathcal{L}_{ce}(v) - \mathcal{L}_{ce}(v_{cf}) + \lambda_2)\)$ 超参数严格满足 \(\lambda_1 < \lambda_2\)(实验中分别设为 0.15 与 0.20),强制拉大因果证据与反事实假证据之间的置信度边界,促使模型自发抑制冗余背景、聚焦于信息密度最高的核心证据段。

损失函数 / 训练策略

整个 WICI 框架采用弱监督多任务联合优化,总损失函数定义为: $\(\mathcal{L} = \mathcal{L}_{qa} + \alpha \mathcal{L}_{align} + \beta \mathcal{L}_{mdl}\)$ 其中 \(\mathcal{L}_{qa}\) 为因果表征 \(v_t\) 下的答案多分类交叉熵损失,\(\mathcal{L}_{align}\) 为基于 InfoNCE 的跨模态对比对齐损失,用于拉近定位视频区间表征与对应问答文本表征的互信息;\(\alpha\) 与 \(\beta\) 分别为平衡权重(实验设为 \(\alpha = 1.0, \beta = 0.3\))。优化器选用 AdamW,初始学习率设为 \(1 \times 10^{-5}\),RoBERTa 文本端与 WDM/时序 Transformer 共同微调,视觉端 CLIP-L 保持冻结,小波分解级数取 2,课程学习速率 \(\gamma = 0.5\)。

实验关键数据

主实验

在代表性弱监督因果定位基准 NeXT-GQA 测试集以及情境推理基准 STAR 验证集上,WICI 与当前 SOTA 视频问答定位方法进行了系统对比:

数据集 方法 视觉编码器 文本编码器 Acc@GQA (%) Acc@VQA (%) mIoP (%) [email protected] (%) [email protected] (%)
NeXT-GQA SeViLA* ViT-G (BLIP-2) Flan-T5-XL 16.6 68.1 29.5 22.9 13.8
NeXT-GQA IGV ResNet BERT 10.2 50.1 21.4 18.9 9.6
NeXT-GQA TempCLIP ViT-L RoBERTa 16.0 60.2 25.7 25.5 8.9
NeXT-GQA TimeCraft ViT-L RoBERTa 18.2 - 28.1 27.8 9.6
NeXT-GQA TempCLIP ViT-L RoBERTa 18.2 61.1 28.6 28.5 10.6
NeXT-GQA WICI (本文) ViT-L RoBERTa 19.0 61.5 28.8 29.4 10.2
STAR SeViLA* ViT-G (BLIP-2) Flan-T5-XL 17.0 45.5 - 37.6 19.5
STAR IGV ResNet BERT 13.1 31.7 - 42.8 1.7
STAR TempCLIP ViT-L RoBERTa 24.4 57.3 - 41.4 4.7
STAR TempCLIP ViT-L RoBERTa 26.8 58.6 - 44.5 5.5
STAR WICI (本文) ViT-L RoBERTa 29.2 58.8 - 48.5 5.9

消融实验

在 NeXT-GQA 上的模块消融与去偏分析充分验证了各核心机制的有效性:

配置 Acc@GQA (%) Acc@VQA (%) [email protected] (%) [email protected] (%) 说明
WICI 完整模型 19.0 61.5 29.4 10.2 完整多组件协同
去掉小波动态建模 (w/o WDM) 17.8 (↓1.2) 60.5 (↓1.0) 28.6 (↓0.8) 9.5 (↓0.7) 缺失细粒度运动动态
去掉反事实挖掘 (w/o ICM) 17.7 (↓1.3) 60.8 (↓0.7) 28.4 (↓1.0) 7.1 (↓3.1) 丧失视频内时序去偏能力
仅保留基线对齐 (Baseline Align) 17.3 (↓1.7) 60.1 (↓1.4) 28.1 (↓1.3) 7.5 (↓2.7) 仅依赖全局交叉熵与对齐
ICM 无课程调度 (w/o CM, 固定 \(\rho=0.5\)) 18.2 (↓0.8) 60.7 (↓0.8) 28.8 (↓0.6) 8.7 (↓1.5) 早期硬负例导致优化不稳定
ICM 无时序乱序分支 (w/o TO-CF) 18.2 (↓0.8) 60.9 (↓0.6) 28.8 (↓0.6) 8.9 (↓1.3) 无法排除静态视觉共现偏置
替换为对比损失 (w/o ML) 18.3 (↓0.7) 61.2 (↓0.3) 29.0 (↓0.4) 8.6 (↓1.6) 缺乏明确概率间隔约束

关键发现

  • 双重协同驱动增益:去掉 ICM 导致 Acc@GQA 暴跌 1.3%,去掉 WDM 导致 Acc@GQA 下降 1.2%;二者结合能产生正向叠加,表明“时序特征辨识力(WDM)”与“决策层因果偏好监督(ICM)”缺一不可。
  • 课程调度的必要性:对比固定采样距离与渐进式课程采样,静态采样导致 Acc@GQA 降低 0.8%,证明在弱监督初期定位尚不精准时,盲目引入紧邻因果区间的强干扰帧会造成错误惩罚,而课程引导能确保渐进收敛。
  • 真实时序敏感性提升:在测试期对输入视频帧进行随机乱序扰动时,WICI 的 Acc@GQA 出现 4.0% 的显著衰减(19.0% → 15.0%),而 baseline 仅下降 3.4%;这证明 WICI 真正学到了依赖真实时序逻辑的因果证据,而非对时序不敏感的静态外观捷径。
  • 精简证据区间偏好:WICI 在大幅提升覆盖精度指标([email protected] 从 25.5% 跃升至 29.4%)的同时,TIoU 增幅相对平缓;去偏分析表明偏置错误率(BE 从 28.5% 降至 27.1%)和虚假正确率(UF 从 41.4% 降至 39.6%)显著下降,说明模型更加倾向于给出高信度、紧凑的核心证据区间,避免无脑放宽预测窗口。

亮点与洞察

  • 从数据集偏置迈向视频内偏置:打破了传统去偏仅关注跨样本词频或类别统计相关性的局限,首次系统界定并解决了同一视频内部实体高度重合、视觉极度相似却因果角色不同的“视频内时序偏置”。
  • 经典频域滤波与现代因果决策的优雅融合:以极低计算开销的一维小波卷积为静态 ViT 表征注入高频运动梯度,搭配三级相对预测排序边界损失,兼顾了表征辨识力与因果约束的数值稳定性。
  • 易于迁移的通用去偏范式:课程驱动的反事实区间构造逻辑与多级边界损失并不依赖特定的视觉骨干,可自然推广至视频长时定位、具身操作轨迹解释及长视频多模态大模型的虚假关联消除任务中。

局限与展望

  • 单连续因果区间假设的局限:当前的 ICM 模块主要基于单峰高斯注意力分布在左右两侧扩展反事实边界,预设问题由单一连续视频片段支撑;面对多跳推理(Multi-hop Reasoning)或跨越多个离散片段的复杂因果查询,当前反事实采样机制容易误伤分散的因果片段。
  • 高频噪声敏感度权衡:小波分解级数对视频运动烈度较为敏感(消融实验表明分解超过 2 级后低频语义一致性受损),未来需探索自适应频带加权网络。
  • 展望:后续工作可进一步将混合多区间反事实建模扩展至开放词表视频问答定位与具身智能环境交互决策中。

相关工作与启发

  • vs CRA (CVPR 2025): CRA 采用后门调整与前门干预消除文本与跨模态混淆,主要处理跨样本的统计先验偏置;本文 WICI 则深入视频内部,针对同视频内视觉高度相似的干扰帧,构建时空反事实干预与高频小波动态,在相同骨干下全面超越 CRA。
  • vs IGV / VCSR: IGV 等工作依赖不变性学习或严格的因果/非因果表征正交分离,在视频内相邻帧高度冗余时容易导致优化崩溃;WICI 放弃硬性表征解耦,转而在决策输出端施加软性的边界间隔相对排序约束,训练更加稳健。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 创新性提出视频内时序偏置概念,并将小波频域动态与课程因果反事实有机结合。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 NeXT-GQA 与 STAR 两大基准,包含详细消融、扰动鲁棒性分析及去偏错误分解。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,因果图建模直观,问题定义与动机阐述清晰透彻。
  • 价值: ⭐⭐⭐⭐☆ 为弱监督视频推理与可信多模态时序定位提供了高效且低成本的即插即用范式。