Test-time Counterfactual Calibration for Hallucination-Resistant Temporal Grounding¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/CVL-hub/HRVTG
领域: 多模态 VLM / 视频理解
关键词: 视频时序定位、时序幻觉、测试时自适应、强化学习、反事实校准
一句话总结¶
针对多模态大模型在视频时序定位中因闭环“必答”偏置引发的虚假时序幻觉,HRVTG 提出了测试时自适应框架,通过自监督构建文本篡改、视觉裁剪与混合伪造三类反事实探针,并在 GRPO 框架下结合一致性锚定奖励与非对称 KL 弹性约束实现推理期决策边界动态校准。
研究背景与动机¶
视频时序定位(Video Temporal Grounding, VTG)要求模型在未剪辑长视频中依据自然语言查询精确定位事件起止时间戳。近年来,基于多模态大语言模型(Video MLLMs)的生成式 VTG 范式迅速成为主流,模型通过自回归生成思维链与结构化时间戳,展现出卓越的复杂时空推理能力。然而,现有的模型训练与评测基准普遍建立在“闭世界假设”(Closed-world Assumption)之上,即默认每个输入的文本查询在对应视频中必然存在真实事件。这种“有问必答”的强行对齐偏置(Always-answer / Forced-alignment Bias)严重压缩了模型的决策边界,导致模型在开世界开放部署时,极度依赖浅层语言先验或粗粒度视觉相似度,对视频中根本未发生的事件给出品质看似合理但完全虚构的时序区间。
为了缓解这种被迫对齐引发的时序幻觉,近期的拒答时序定位方法尝试在离线训练阶段注入人工预设的负样本或显式拒答标注。然而,这种离线校准方法学习到的是静态、孤立的伪造模式,一旦面对真实的开放世界分布漂移、未见过的语言触发词或更具欺骗性的跨模态伪证据,预设的拒答分类器往往迅速失效。更深层的矛盾在于:时序幻觉的本质并非单纯缺少一个静态的拒答类别标签,而是模型在推理阶段无法动态度量当前输入是否存在实质性的多模态因果证据,进而在证据缺失时发生决策边界的校准失真。
针对这一瓶颈,本文主张摆脱昂贵的人工负样本标注与静态离线微调,转而在测试阶段对模型进行在线决策边界自适应校准。核心 idea:建立涵盖文本、视觉与跨模态维度的时序幻觉认知分类体系,在测试期自监督构造高质量反事实探针,并基于 GRPO 引入一致性锚定奖励与非对称 KL 弹性约束,在零标注流式推理中动态重塑区分真实证据与虚假伪证据的决策边界。
方法详解¶
整体框架¶
HRVTG 将测试时自适应(Test-time Adaptation, TTA)重构为流式环境下的强化学习在线策略优化问题。在冻结的基础时序定位大模型上外挂轻量化 LoRA 适配器,处理由真实测试样本与自监督反事实探针构成的混合数据流。系统整体流向包含三个阶段:首先针对输入样本动态生成反事实探针,提供可验证的缺失伪标签;其次通过分组采样获取动作候选项,计算一致性锚定、反事实排斥与格式规范奖励;最后利用非对称 KL 约束执行 GRPO 策略参数更新,在保护正向定位精度的同时抑制虚假时序生成。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入测试数据流<br/>(原始视频 Vori, 原始查询 Qori)"] --> B["反事实探针自监督构建<br/>文本篡改 / 视觉裁剪 / 混合伪造"]
B --> C["混合数据流与候选策略采样<br/>冻结主干 + LoRA 适配器 πθ 采样 G 个输出"]
C --> D["可验证奖励计算<br/>一致性锚定 Rca + 幻觉排斥 Rhr + 格式奖励 Rfmt"]
D --> E["非对称 KL 弹性约束与 GRPO 优化<br/>正样本高惩罚维持能力 / 反事实样本低约束促进拒答"]
E --> F["校准后决策输出<br/>真实事件精确起止时间 / 虚假事件判定 not found"]
关键设计¶
1. 反事实探针自监督构建:全方位暴露语言先验与伪证据对齐陷阱 针对时序幻觉中不同模态的信息误归因路径,本文提出了三类在测试时完全无需人工标注的自监督反事实探针: - 文本篡改(Textual Alteration):固定原始视频 \(V_{\text{ori}}\),针对原始查询 \(Q_{\text{ori}}\) 实施动作反转(如 open \(\to\) close)、时序乱序(倒置先行逻辑)与属性替换(如 watermelon \(\to\) potato),并通过冻结基线模型的检索一致性过滤,生成语义高度相似但视频中严格不存在对应动作的查询 \(Q_{\text{ta}}\),用以排查语言先验诱导的强行对齐。 - 视觉裁剪(Visual Pruning):保持原始查询 \(Q_{\text{ori}}\) 不变,通过冻结基线定位模型的高置信预测截取出作为证据区间的伪真实区间(Pseudo-GT),将其从原视频中剥除并时序拼接余下背景帧,获得缺少关键证据但保留环境与人物上下文的视频 \(V_{\text{ngt}}\),专门暴露模型仅凭背景一致性便惯性预测区间的视觉误判。 - 混合伪造(Hybrid Fabrication):在剥除真实证据的 \(V_{\text{ngt}}\) 上用原查询检索出最相似的难负例片段(Pseudo Hard-Negative Clip),利用视频描述模型生成匹配原查询语风的新描述 \(Q_{\text{phn}}\),最后在原视频中剔除该难负例片段以保留真实片段。该探针在视频包含强干扰语义但缺乏决定性事实证据时,形成极具欺骗性的跨模态复合考验。
2. 规则可验证双向奖励体系:兼顾真实事件定位稳固性与缺失事件排斥力
由于测试时无法获取人工标注的真实时间戳,框架设计了一套规则可验证的复合奖励函数 \(r\)。对于正向真实样本 \(x_{\text{pos}}\),引入一致性锚定奖励 \(R_{\text{ca}}\),利用冻结的参考策略 \(\pi_{\text{ref}}\) 贪婪解码出的基准预测 \(y_{\text{ref}}\) 作为锚点,计算当前策略生成区间与基准区间的重叠度:
$\(R_{\text{ca}}(y, y_{\text{ref}}) = \begin{cases} r_{\text{ca}}, & \text{IoU}(y, y_{\text{ref}}) \ge \delta \land \hat{\tau} \ne \emptyset \land \hat{\tau}_{\text{ref}} \ne \emptyset \\ 0, & \text{otherwise} \end{cases}\)$
该设计不设置显式负奖励,避免在流式自适应早期因误惩罚削弱定位能力;同时辅以仅作用于正样本的格式奖励 \(R_{\text{fmt}}\) 确保输出标签结构合规。对于携带天然事件缺失伪标签的反事实样本 \(x_{\text{cf}}\),则引入幻觉排斥奖励 \(R_{\text{hr}}\):
$\(R_{\text{hr}}(y) = \begin{cases} r_{\text{hr}}, & g(y) = \emptyset \\ 0, & \text{otherwise} \end{cases}\)$
模型仅在 <answer> 标签内输出显式拒答信号(如 not found)时获得正向奖励,依靠 GRPO 的组内优势归一化自发形成隐式对比学习,温和拉开真实证据匹配与虚假对齐的优势差距。
3. 非对称 KL 弹性约束:解耦知识保留与边界重塑的可塑性冲突 在标准的 GRPO 优化中,通常对所有样本施加全局统一的 KL 散度惩罚系数 \(\beta\)。然而,在测试时混合数据流中,正样本和反事实样本对策略偏移的需求截然相反:正样本需要策略严格贴近初始强基线以防灾难性遗忘,而反事实样本面对初始基线的幻觉输出,必须允许策略显著偏离参考模型以学习生成拒答状态。为此,本文设计了基于样本类型的非对称弹性权重 \(\lambda(x)\): $\(\lambda(x) = \begin{cases} \rho, & x \in \mathcal{X}_{\text{pos}} \\ 1, & x \in \mathcal{X}_{\text{cf}} \end{cases}\)$ 将有效 KL 惩罚重构为 \(\beta \cdot \lambda(x)\),通过设置超参数 \(\rho > 1\)(实验固定 \(\rho = 4\)),对正向样本施加数倍的强刚性约束,对反事实探针赋予充分的更新可塑性,成功化解了“拒答学习”与“定位保真”之间的优化张力。
损失函数 / 训练策略¶
在测试阶段,输入样本 \(x\) 被输入外挂 LoRA 的策略网络 \(\pi_\theta\),采样生成包含 \(G\) 个候选回答的组 \(\{o_1, \dots, o_G\}\)。根据各候选的复合奖励 \(r_i\) 计算组内相对优势 \(\hat{A}_i = \frac{r_i - \text{mean}(r)}{\text{std}(r) + \epsilon}\),并在重要性采样比率加权下执行 GRPO 在线更新: $\(J(\theta) = \mathbb{E}_{x \sim \mathcal{S}} \left[ \frac{1}{G} \sum_{i=1}^G \frac{\pi_\theta(o_i | x)}{\pi_{\theta_{\text{old}}}(o_i | x)} \hat{A}_i - \beta \cdot \lambda(x) \cdot D_{\text{KL}}(\pi_\theta \parallel \pi_{\text{ref}}) \right]\)$ 在流式部署中,通过缓存并复用视频骨干特征,仅对 LoRA 参数执行极少步梯度回传,实现高效的测试期在线演进。
实验关键数据¶
评测指标解耦¶
以往拒答评估往往将负样本拒答成功的样本直接记 IoU 为 1,导致极度保守(频繁无脑拒答)的模型虚高得分;或使用单一类别的 F1 忽略了数据极不均衡的影响。本文引入了两项解耦评测指标: 1. 条件交并比(Conditional IoU, \(mIoU_{\text{Cond}}\)):仅在真实正样本且模型正确预测为正样本的真阳性(True Positive, TP)集合上计算时序 IoU,完全剥离拒答机制对定位精度统计的干扰。 2. 均衡决策 F1 分数(Balanced Decision F1-score, \(F1_{\text{Balanced}}\)):计算回答类别 \(F1_{\text{Answer}}\) 与拒答类别 \(F1_{\text{Refuse}}\) 的调和平均数,重度惩罚全拒答或全必答的极端退化策略。
主实验¶
在涵盖 1:1 正负样本比例的 Charades-RF、ActivityNet-RF 以及覆盖三类复合幻觉的 TVGBench-RF 上,以 Qwen2.5-VL(3B 与 7B)为基座进行了全面测试。
| 数据集 | 模型 | 规模 | [email protected] | [email protected] | [email protected] | \(mIoU_{\text{Cond}}\) | \(F1_{\text{Ans}}\) | \(F1_{\text{Rfs}}\) | \(F1_{\text{Bal}}\) |
|---|---|---|---|---|---|---|---|---|---|
| Charades-RF | 原始基座 Base | 3B | 50.36 | 25.90 | 13.67 | 30.27 | 13.64 | 67.42 | 22.69 |
| 仅正样本微调 (Only-pos) | 3B | 67.60 | 38.53 | 14.90 | 41.48 | 69.50 | 33.38 | 45.12 | |
| HRVTG (本文) | 3B | 71.24 | 40.49 | 15.58 | 43.29 | 74.86 | 62.80 | 68.30 | |
| 原始基座 Base | 7B | 29.02 | 13.20 | 5.88 | 19.50 | 55.31 | 73.56 | 63.14 | |
| 仅正样本微调 (Only-pos) | 7B | 72.59 | 53.43 | 25.55 | 48.33 | 81.36 | 75.40 | 78.27 | |
| HRVTG (本文) | 7B | 73.97 | 54.07 | 27.01 | 48.94 | 83.00 | 80.91 | 81.94 | |
| ActivityNet-RF | 原始基座 Base | 3B | 17.70 | 12.60 | 5.41 | 17.70 | 52.31 | 73.17 | 61.00 |
| 仅正样本微调 (Only-pos) | 3B | 38.46 | 21.95 | 10.19 | 26.61 | 73.90 | 51.22 | 60.51 | |
| HRVTG (本文) | 3B | 40.79 | 23.00 | 10.89 | 28.03 | 83.81 | 84.01 | 83.91 | |
| 仅正样本微调 (Only-pos) | 7B | 44.15 | 27.22 | 14.04 | 30.85 | 85.15 | 85.43 | 85.29 | |
| HRVTG (本文) | 7B | 47.50 | 28.03 | 13.03 | 31.87 | 89.37 | 87.71 | 88.53 | |
| TVGBench-RF | 仅正样本微调 (Only-pos) | 3B | 32.59 | 18.35 | 6.33 | 23.34 | 66.18 | 5.28 | 9.78 |
| HRVTG (本文) | 3B | 40.26 | 18.53 | 7.99 | 26.09 | 66.67 | 52.65 | 58.83 | |
| 仅正样本微调 (Only-pos) | 7B | 36.70 | 24.47 | 10.37 | 26.31 | 70.74 | 42.09 | 52.78 | |
| HRVTG (本文) | 7B | 37.65 | 24.10 | 12.35 | 26.93 | 72.17 | 62.35 | 66.90 |
消融实验¶
在 TVGBench-RF 数据集上以 Qwen2.5-VL-3B 模型针对非对称 KL 权重 \(\rho\)、锚定阈值 \(\delta\) 及学习率进行了参数敏感性分析:
| 实验组别 | 参数变动项 | \(mIoU_{\text{Cond}}\) | \(F1_{\text{Balanced}}\) | 分析说明 |
|---|---|---|---|---|
| 对称 vs 非对称 KL | \(\rho = 1\) (标准对称 GRPO) | 21.15 | 53.16 | 正样本因缺乏保护导致定位退化,反事实样本未充分探索 |
| \(\rho = 2\) | 24.30 | 56.40 | 约束逐步向正样本倾斜,定位指标开始恢复 | |
| \(\rho = 4\) (本文默认配置) | 26.09 | 58.83 | 达到稳定与可塑性的最优平衡,双指标均达最高点 | |
| \(\rho = 8\) | 25.10 | 57.20 | 正样本过度锚定导致策略僵化,抑制了适度泛化 | |
| 锚定阈值 \(\delta\) | \(\delta = 0.1\) | 23.80 | 55.30 | 阈值过宽导致低质量伪区间获得奖励,定位漂移 |
| \(\delta = 0.2\) (默认) | 26.09 | 58.83 | 保证高证据质量与正向引导密度的平衡 | |
| \(\delta = 0.5\) | 22.40 | 51.10 | 条件过于苛刻导致正奖励极其稀疏,模型退化为盲目拒答 |
关键发现¶
- 抗幻觉不以牺牲定位为代价:相比于传统全量微调模型(Only-positive),HRVTG 不仅将决策平衡分数 \(F1_{\text{Bal}}\) 提升了 14~49 个点(如 TVGBench-RF 3B 从 9.78 跃升至 58.83),其纯粹定位指标 \(mIoU_{\text{Cond}}\) 甚至实现了 +1.8 到 +2.7 的小幅正向增益。这证明一致性锚定机制有效避免了测试时遗忘。
- 对称约束的失败与非对称的必要性:标准 GRPO(\(\rho=1\))在混合数据流中会陷入拉扯,既不能很好地保持原始定位精度(21.15 vs 26.09),拒答识别率也较低(53.16 vs 58.83);而非对称权重 \(\rho=4\) 赋予了正向先验“强防守”与反事实“敢探索”的协同能力。
- 复合伪造样本的杀伤力:在仅含单模态扰动的基准上,7B 传统模型尚有一定拒答能力,但在混合伪造占比高的 TVGBench-RF 上,传统 3B 模型的拒答 F1 仅有 5.28,充分说明跨模态高相似度伪证据对生成式 VLM 具有极强的欺骗性,测试期主动探针校准是不可或缺的防御手段。
亮点与洞察¶
- 从离线静态拟合转向测试期动态校准:传统方法试图枚举所有负样本特征,然而开放世界中的长尾分布使得离线模式注定不完备。HRVTG 将问题转换为“推理期动态边界重塑”,通过将当前视频就地制造反事实探针,针对当前环境分布进行个性化校准。
- 强化学习在线自适应的工程闭环:借助 GRPO 免去 Critic 网络的轻量化优势,结合视频特征缓存机制与 LoRA 少量参数更新,使得生成式大模型在测试期流式处理的同时进行参数微调具备了实际计算可行性。
- 解耦指标戳破了虚假的评估繁荣:指出了以往文献中通过一刀切将拒答判定视为 IoU=1 造成的指标泡沫,确立了 \(mIoU_{\text{Cond}}\) 与 \(F1_{\text{Balanced}}\) 双轨评测体系,为可信视频时序定位提供了更为严格的评估标杆。
局限与展望¶
- 计算延迟开销:尽管复用了视频特征且使用 LoRA,但在推理期为每个样本在线采样 \(G\) 个候选回答并反向传播一次梯度,吞吐量和时延相比单次前向推理仍有数倍增长,在强实时要求的高帧率监控边缘场景仍具部署挑战。
- 伪真实区间(Pseudo-GT)质量依赖:视觉裁剪与混合伪造探针严重依赖初始冻结模型的证据定位置信度。若初始模型在长视频上的原始定位发生严重漂移,截取出的伪证据区间失准可能导致反事实样本带有微小噪声。
- 未来方向:探索结合多步推理链与记忆库机制的轻量化校准策略,以及将测试期反事实探针机制推广到视频时空动作检测与多模态长程具身规划任务中。
相关工作与启发¶
- 时序定位大模型范式:承袭了 VTimeLLM、TimeChat、Time-R1 等将视频区间离散化为文本 token 的端到端生成框架,但在业内首次将 DeepSeek-R1 风格的 GRPO 规则驱动机制引入测试时自适应(TTA)阶段。
- 可信与拒答学习:延续了 RaTSG、CausalVTG 与 RA-RFT 对“有问必答”偏置的警惕,跳出了传统度量学习与因果干预离线数据集的框架,提供了一种完全自监督、零人工标注的自适应拒答解决方案。
评分¶
- 新颖性: 4.5 / 5.0(将 GRPO 规则强化学习与自监督反事实探针引入 TTA 时序定位,设计精巧)
- 实验充分度: 4.5 / 5.0(涵盖 3 个基准、双模型尺度、全面消融,提出解耦指标解决行业痛点)
- 写作质量: 4.5 / 5.0(逻辑严密、符号严谨、时序幻觉认知分类清晰)
- 价值: 4.5 / 5.0(为多模态大模型的时序幻觉抑制与开放世界落地提供了全新且切实可行的技术路径)