Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval¶
会议: ECCV 2026
论文: ECCV 原文
PDF: PDF
领域: 多模态VLM
关键词: 零样本视频时刻检索、时序自相似性、多模态大语言模型、模态鸿沟、语言风格鸿沟
一句话总结¶
针对零样本视频时刻检索中查询匹配受制于模态鸿沟与语言风格鸿沟的问题,本文提出自相似时段提议与打分框架(Self-SiMS),利用纯视频内部的时序自相似性构建候选时段与上下文打分,并结合多模态大语言模型进行查询感知二值验证重排序,刷新多项基准 SOTA。
研究背景与动机¶
自然语言驱动的视频时刻检索(Video Moment Retrieval, VMR)旨在从未修剪的长视频中精准定位与文本查询语义相匹配的特定时序片段。由于传统全监督方法高度依赖人工标注的精准起止时间边界,标注成本极其高昂且难以扩展,近年来免训练的零样本视频时刻检索(Zero-Shot Video Moment Retrieval, ZMR)成为学界与工业界的重要研究方向。然而,现有 ZMR 方法在生成与评估候选候选时段(moment proposals)时,普遍严重依赖文本查询与视频内容之间的相似度信号,导致检索结果极易受到表征偏差的干扰。
这种性能瓶颈的核心矛盾在于两类本质难以调和的表征鸿沟:一是直接基于文本查询与视频帧视觉特征计算相似度(如 TFVTG)所面临的模态鸿沟(Modality Gap)——多模态特征空间未能完全拉齐,即使在真实目标区间内,相似度信号也普遍呈现低平且无区分度的特征,极易导致算法生成过度冗长、边界松散的预测区间;二是通过 MLLM 预先生成密集帧描述再计算文本间相似度(如 Moment-GPT)所引入的语言风格鸿沟(Language-Style Gap)——用户撰写的高层抽象查询与 MLLM 生成的细粒度具象描述在表达偏好与关注点上差异极大(例如同一动作在不同帧被交替描述为拿着锤子或伸手拿物品),导致相似度曲线剧烈震荡且充斥噪声,往往坍缩成碎裂的短区间。通过量化区间内外相似度比值(Inner-to-Outer Ratio, IOR)可以发现,现有两类方法的 IOR 分布在真实目标边界两侧缺乏稳定的判别力。
本文的切入角度是:既然跨模态或跨语言风格的查询匹配信号在候选时段生成阶段极不可靠,为何不将时序分割彻底回归到视频内容自身的内部关系?视频内部的连贯动作在时序上具备天然的内容连贯性与自相似性,完全能够独立于查询文本提供纯净的事件边界先验。核心 idea:提出自相似时段提议与打分框架(Self-SiMS),利用纯视频内部的帧特征与密集描述特征构建联合时序自相似矩阵以生成高质量候选边界,结合峰值匹配与内部一致性进行时段初筛打分,最后由 MLLM 对候选时段执行细粒度查询感知二值推理重排序。
方法详解¶
整体框架¶
输入为一个包含 \(L\) 帧的未修剪视频 \(V = \{v_i\}_{i=1}^L\) 以及一个自然语言查询 \(Q\)。整个框架无需任何监督微调,整体分为三个核心阶段:首先提取视觉帧特征与 MLLM 预生成的帧级描述特征,分别构建时序自相似矩阵并融合成统一矩阵,通过对比核卷积捕捉时序边界以生成多尺度候选时段;随后利用时段内的 Top-\(k_S\) 峰值查询相似度与以关键帧为锚点的内部上下文自相似度进行联合打分;最后筛选出 Top-\(k_C\) 个高置信度候选时段,自适应采样代表帧并由多模态大模型进行查询感知的“Yes/No”二值推理,重排序输出最终时序区间。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入未修剪视频与文本查询"] --> B["自相似候选时段生成<br/>视觉+文本自相似矩阵与对比核卷积"]
B --> C["自相似感知时段打分<br/>Top-kS匹配分与关键帧自相似度融合"]
C --> D["多模态大模型重排序<br/>采样代表帧进行Yes/No跨模态验证"]
D --> E["输出高置信度目标时刻区间"]
关键设计¶
1. 基于视频时序自相似性的候选时段生成:解耦查询信号以摆脱模态与语言风格偏差 传统候选区间生成方法依赖查询与帧的跨模态相似度曲线,极易被模态差异或描述风格噪声所误导。为从根本上避免引入不可靠的查询信号,本文直接在视频内部提取自相似性结构。具体而言,分别提取帧视觉特征 \(F^f\) 与基于 MLLM 生成的逐帧描述文本特征 \(F^c\),经 \(\ell_2\) 归一化后计算各自的时序自相似矩阵(Temporal Self-similarity Matrix, TSM):\(M^f = \hat{F}^f (\hat{F}^f)^\top\) 和 \(M^c = \hat{F}^c (\hat{F}^c)^\top\)。两者等权平均形成统一的综合自相似矩阵 \(M = \frac{1}{2}(M^f + M^c) \in \mathbb{R}^{L \times L}\)。为了在该矩阵中自动定位事件转移边界,本文采用一个大小为 \(N_K \times N_K\) 的对比核(Contrastive Kernel)\(K\):核内左上和右下象限设为正权重(鼓励边界两侧各自保持内部一致),右上与左下象限设为负权重(抑制跨越边界的相似性),中心十字交叉位置置零。对角线上每个位置 \((i, i)\) 提取局部矩阵块 \(P_i\) 与核进行哈达玛积求和,得到第 \(i\) 帧的边界突变强度得分 \(b_i = \sum (P_i \odot K)\)。接着,基于整段视频的视觉特征方差自适应计算动态阈值集合 \(\mathcal{T}\),取局部极大值构成边界索引集合,在时间轴上切分出一系列互不重叠且贴合自然语义转折的高质量候选时段 \(\mathcal{E} = \{E_1, E_2, \dots, E_{N_s}\}\)。
2. 融合峰值匹配与内部一致性的自相似感知时段打分:抑制噪声与语义漂移 在为候选时段赋予文本相关性打分时,以往工作习惯将时段内所有帧的查询-描述相似度取均值。然而由于语言风格鸿沟,时段内哪怕是属于同一事件的帧,其生成描述也常出现与查询词不匹配的琐碎细节,全局平均会导致强相关片段被低分严重拉低。为此,本文提出查询匹配时段分(Query-Matching Span Score, QMS):在候选区间 \(E_n\) 内仅筛选与查询余弦相似度最高的前 \(k_S\) 个峰值帧打分并计算平均值: $\(S^Q_n = \frac{1}{k_S} \sum_{i \in I_{k_S}^{E_n}} S^f_i\)$ 该机制优先捕获最确切的语义重合点,有效抵御了描述风格噪声造成的局部信号塌陷。然而,仅靠少数几个孤立高分帧容易忽视时段整体的连贯性,甚至将包含了无关背景漂移的过长区间误判为高分。为此,本文设计了自匹配时段分(Self-Matching Span Score, SMS):将时段内得分最高的帧设为锚点关键帧 \(\kappa_n = \arg\max_{i \in E_n} S^f_i\),利用综合自相似矩阵 \(M\) 计算关键帧与该时段内所有其余帧的平均自相似度: $\(S^S_n = \frac{1}{|E_n|} \sum_{j \in E_n} M_{\kappa_n, j}\)$ 若候选时段过长或内部包含上下文脱节的场景转折,自相似打分将对其实施显著惩罚。两项得分通过超参数 \(\alpha\) 加权融合成初筛总分 \(S_n = (1 - \alpha) S^Q_n + \alpha S^S_n\)(设定 \(\alpha = 0.1\)),实现了语义峰值命中与全局上下文一致性的协同约束。
3. 基于多模态大模型的查询感知重排序:跨模态细粒度二值验证 基于预训练特征向量余弦距离的相似度计算属于浅层跨模态交互,难以理解长尾细节与复杂推理逻辑。为此,本文在精选候选时段上引入深层 MLLM 查询感知重排序。首先根据初始综合分 \(S_n\) 筛选出 Top-\(k_C\)(如 \(k_C = 5\))个候选时段;针对每个入选时段,根据查询相似度采样 \(N_R\) 个代表帧(数量设为时段长度的一半,截断在 10 至 30 帧之间)。随后将代表帧视觉图像与文本查询直接输入指令调优的 MLLM(如 LLaMA-3.2-11B-Vision-Instruct),构建 Yes/No 语义相关性判断提示词,通过模型输出 logits 经 Softmax 计算得到 "Yes" 词元的生成概率 \(S^r_i\)。取时段内代表帧中前 \(k_R\) 个最大概率均值作为时段重排序得分 \(S_{(m)}^R\),并与初始得分线性加权: $\(S_{(m)}^* = (1 - \beta) S_{(m)} + \beta S_{(m)}^R\)$ 通过设置 \(\beta = 0.5\),充分利用 MLLM 强大的端到端图文交叉注意力与推理能力,在最终决策阶段彻底消除浅层特征难以克服的模态与风格偏差。
推理与重排序策略¶
- 视频抽帧率:QVHighlights 采用 0.5 fps;Charades-STA、ActivityNet-Captions 和 TVR 统一采用 1.0 fps。
- 超参数配置:初始评分与重排序阶段的峰值帧数量 \(k_S = 3, k_R = 3\);候选重排序区间数 \(k_C = 5\);得分加权系数 \(\alpha = 0.1, \beta = 0.5\)。
- 计算效率优势:全流程中除 MLLM 提示外,纯矩阵操作与对比核卷积的耗时仅为每视频 0.194 秒,整体具备高度实用性。
实验关键数据¶
主实验¶
在 QVHighlights、Charades-STA 和 ActivityNet-Captions 等主流基准上,将 Self-SiMS 与代表性全监督(FS)、弱监督(WS)及零样本(ZS)方法进行全面对比:
| 数据集 | 方法 | 设置 | [email protected] | [email protected] | [email protected] | [email protected] | mAP@avg / mIoU |
|---|---|---|---|---|---|---|---|
| QVHighlights (val) | Moment-DETR [15] | FS | - | 54.2 | 33.4 | 55.4 | 31.1 (mAP@avg) |
| QVHighlights (val) | TFVTG‡ [41] | ZS | - | 21.0 | 7.4 | 19.2 | 7.3 (mAP@avg) |
| QVHighlights (val) | Moment-GPT [38] | ZS | - | 58.9 | 38.6 | 55.7 | 35.9 (mAP@avg) |
| QVHighlights (val) | Self-SiMS (本文) | ZS | - | 61.0 | 43.2 | 60.5 | 39.3 (mAP@avg) |
| QVHighlights (test) | Moment-DETR [15] | FS | - | 52.9 | 33.0 | 54.8 | 30.7 (mAP@avg) |
| QVHighlights (test) | UMT [21] | FS | - | 56.4 | 40.8 | 53.1 | 35.4 (mAP@avg) |
| QVHighlights (test) | TFVTG‡ [41] | ZS | - | 21.6 | 8.0 | 20.1 | 7.9 (mAP@avg) |
| QVHighlights (test) | Moment-GPT [38] | ZS | - | 58.3 | 37.7 | 55.1 | 35.0 (mAP@avg) |
| QVHighlights (test) | Self-SiMS (本文) | ZS | - | 59.7 | 42.2 | 59.2 | 38.3 (mAP@avg) |
| Charades-STA | Moment-DETR [15] | FS | 62.1 | 48.2 | 25.3 | - | 42.3 (mIoU) |
| Charades-STA | TFVTG‡ [41] | ZS | 64.8 | 30.0 | 10.1 | - | 38.4 (mIoU) |
| Charades-STA | Moment-GPT [38] | ZS | 58.2 | 38.4 | 21.6 | - | 36.5 (mIoU) |
| Charades-STA | Self-SiMS (本文) | ZS | 62.7 | 39.7 | 21.0 | - | 41.9 (mIoU) |
| ActivityNet-Captions | Moment-DETR [15] | FS | 52.6 | 32.5 | 15.3 | - | 37.8 (mIoU) |
| ActivityNet-Captions | TFVTG‡ [41] | ZS | 49.5 | 26.5 | 12.3 | - | 34.0 (mIoU) |
| ActivityNet-Captions | Moment-GPT [38] | ZS | 48.1 | 31.1 | 14.9 | - | 30.8 (mIoU) |
| ActivityNet-Captions | Self-SiMS (本文) | ZS | 49.9 | 28.2 | 13.8 | - | 34.7 (mIoU) |
消融实验¶
候选区间质量评估(Oracle mIoU 对比,QVHighlights 验证集): | 方法 | 候选生成机制依赖 | 平均候选时段数 | Oracle-mIoU (%) | 说明 | |------|-----------------|----------------|-----------------|------| | TFVTG [41] | 跨模态查询-视觉帧匹配 | 8.38 | 38.16 | 受模态鸿沟干扰,候选区间冗长且粗糙 | | Moment-GPT [38] | 跨模态查询-描述文本匹配 | 7.62 | 65.01 | 受风格鸿沟干扰,候选区间波动过碎 | | Self-SiMS (本文) | 视频时序自相似性(解耦查询) | 6.46 | 71.13 | 以最少候选数取得最高 Oracle 重合度(+6.12%) |
打分与重排序模块逐步消融(QVHighlights 验证集): | 配置 | [email protected] | [email protected] | [email protected] | mAP@avg | 说明 | |------|--------|--------|---------|---------|------| | 全局均值打分(Mean scoring) | 55.7 | 40.9 | 56.7 | 37.1 | 基线:简单平均时段内所有帧得分 | | + 查询匹配时段分(QMS) | 59.5 | 42.1 | 59.4 | 38.6 | 采用 Top-\(k_S\) 峰值帧打分,过滤风格低分噪声 | | + 自匹配时段分(SMS) | 60.3 | 42.9 | 59.6 | 38.7 | 引入关键帧全时段自相似性,惩罚语义漂移区间 | | + MLLM 查询感知重排序(Full) | 61.0 | 43.2 | 60.5 | 39.3 | 采用 MLLM 进行 Yes/No 二值推理,达到最高精度 |
关键发现¶
- 候选时段质量决定检索上限:如消融表所示,Self-SiMS 的候选区间 Oracle mIoU 达到了 71.13%,相比依赖查询-描述相似度的 Moment-GPT 高出 6.12 个百分点,且平均候选数仅为 6.46。这直接证明了在生成候选边界时解耦易受污染的查询文本、回归纯视频时序自相似性的巨大优越性。
- 峰值与一致性双轮驱动打分:从 Mean scoring 替换为 QMS 带来了最显著的性能跃升([email protected] 从 56.7 提升至 59.4),表明过滤低分描述噪声是解决语言风格鸿沟的关键;随后引入 SMS 进一步大幅提振了严格重叠指标([email protected] 提升 0.8%),有效压制了过长漂移区间。
- 模型参数量与运行效率更优:如论文统计,Moment-GPT 需要为查询改写、视频描述生成和重排序分别维护三个独立模型(总计 22B 参数),而 Self-SiMS 默认只需单套 LLaMA-3.2-Vision 模型即可统一完成描述与二值重排序(参数量减半至 11B),重排序开销仅 13.0 秒。
亮点与洞察¶
- 解耦查询的时序分割思想:现有零样本方法普遍惯性地在边界生成阶段就引入查询相似度,却忽视了模态与风格双重鸿沟对边界判别的破坏;本文将时段生成转变为纯粹的视频内部自相似突变检测,构成了方法最精妙的解耦设计。
- 以内证外的关键帧一致性打分:传统方法要么全局均值被噪声拖累,要么只看峰值导致区间过长;本文巧妙利用综合自相似矩阵中峰值关键帧对时段其他帧的自相关度(SMS)作为正则化约束,轻量且数学意义清晰。
- 可复用的通用迁移范式:基于对比核的 TSM 边界提取与动态阈值自适应算法不依赖任何参数训练,且非 MLLM 计算耗时不足 0.2 秒,完全可以直接迁移至无监督长视频摘要、事件切分以及弱监督动作定位等相关视频任务。
局限与展望¶
- 作者承认的局限:尽管重排序阶段仅需针对 Top-5 时段采样少量代表帧,但在超长视频(如 TVR 剧集)或高帧率场景下,逐帧生成初始密集描述和 MLLM 二值验证仍带来一定的端到端延迟。
- 潜在的研究盲区:目前自相似矩阵构建采用了视觉特征与文本描述特征简单等权平均,对快速运动、镜头突变或静态长镜头的不同场景类型缺乏自适应模态动态加权机制。
- 未来改进方向:可进一步探索在自相似矩阵中引入轻量级频域滤波以平滑微小抖动,或将代表帧二值验证升级为一次性输入时序网格图像,进一步压缩 MLLM 的重排序轮次与推理显存开销。
相关工作与启发¶
- vs TFVTG [41]:TFVTG 依赖查询与视觉帧特征的余弦相似度并使用启发式步长窗口搜索,严重受制于模态鸿沟,产生的相似度信号平坦且倾向于预测冗长区间(高 [email protected] 但严格 [email protected] 极低);本文利用自相似性解耦查询,并引入密集描述与 MLLM 重排序,定位精度与 mIoU 全面大幅领先。
- vs Moment-GPT [38]:Moment-GPT 依靠 MLLM 生成逐帧密集描述来规避模态鸿沟,但引入了严重的语言风格鸿沟,导致时序相似度尖锐震荡、易生成碎裂短区间;本文不仅在时段生成阶段绕开查询,还在打分阶段利用自相似矩阵的全局连贯性有效纠偏了风格抖动。
评分¶
- 新颖性: ⭐⭐⭐⭐ [首次在免训练 ZMR 中揭示模态与语言风格双重鸿沟,并提出基于纯时序自相似性的候选生成与内聚打分机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 QVHighlights、Charades-STA、ActivityNet 及 TVR 四大基准,包含详尽的 IOR 分布定量分析、Oracle mIoU 与组件逐级消融]
- 写作质量: ⭐⭐⭐⭐⭐ [问题动机分析透彻深刻,公式推导严谨规范,图表清晰且对比维度丰富]
- 价值: ⭐⭐⭐⭐⭐ [为零样本视频时序定位提供了一套高精度、轻量化且免训练的即插即用范式,具备极高的学术与工程参考价值]