跳转至

SE-DETR: Explicit Semantic Exploration for Generalizability and Distinguishability in Video Temporal Grounding

会议: ECCV 2026
论文: ECCV 2026 官方页面
代码: https://github.com/hu-cheng-yang/ECCV26-SE-DETR
领域: 目标检测
关键词: 视频时序定位、跨模态对齐、语义表示、DETR架构、自信息调制

一句话总结

SE-DETR 针对视频时序定位中词汇泛化弱与关键稀疏语义易被淹没的瓶颈,提出可学习语义代理对齐(SPA)与基于自信息的时序稀疏性调制(TSM),实现了跨视频概念泛化与视频内精准辨别,在 QVHighlight 等五大基准上全面刷新 SOTA。

研究背景与动机

视频时序定位(Video Temporal Grounding, VTG)要求模型在未剪辑的长视频中根据自然语言查询精确定位对应片段,主要涵盖视频精彩片段检索(VMR)、高光检测(HD)与视频摘要生成(VS)三大子任务。自 Moment-DETR 将检测 Transformer 引入该领域以来,QD-DETR、CG-DETR、Keyword-DETR 以及多层特征微调的 R2-Tuning 等方案,均将注意力机制聚焦于局部词汇与视觉 Patch 之间的交叉注意力计算。然而,现有方法隐式假设查询文本中的每个单词都与独立的视觉概念一一对应,忽视了视频语言定位中两个本质的语义属性。

第一个瓶颈是跨视频的语义泛化性(Inter-Video Semantic Generalizability)。在实际查询中,不同词汇往往对应高度相似的视觉概念,例如“meals”、“hamburgers”和“food”具有强重叠的视觉语义,但现有的逐词对齐将它们割裂为相互独立的 Token,导致模型难以在概念层面泛化,极易产生语义碎片化。第二个瓶颈是视频内的语义可辨别性(Intra-Video Distinguishability)。自然语言查询中普遍包含贯穿视频全局的冗余背景概念(例如“woman”或“in the car”),而真正决定时序起止边界的核心动作(例如“wearing a mask around her chin”或“waterfall diving”)在时空维度上高度稀疏且瞬时发生。若对所有查询词分配均等权重,这些稀疏而关键的高信息量语义会被全局常驻的视觉模式轻易稀释。

面对词汇隔离与稀疏动作被全局背景淹没的双重矛盾,本文放弃在传统注意力层数上单纯堆叠参数,转而从显式语义空间建模破局。核心 idea:通过引入一组动态更新的可学习语义代理构建跨词汇的概念锚点(SPA),并借助信息论中的自信息度量时序稀疏性以自适应放大关键罕见动作特征(TSM),构建显式兼顾泛化性与辨别性的统一检测 Transformer。

方法详解

整体框架

SE-DETR 的整体架构由特征提取与投影、语义代理对齐(SPA)、时序稀疏性调制(TSM)、多层自适应特征融合(AFF)以及多任务 Transformer 解码器与预测头构成。输入包含从未微调的 CLIP 视觉编码器倒数第二层提取的视频 Patch 特征 \(V \in \mathbb{R}^{B \times T \times (P+1) \times D_V}\) 及查询文本特征 \(Q \in \mathbb{R}^{B \times L \times D_Q}\)。两者先经各自的 MLP 映射至统一维度 \(D=256\)。随后,SPA 模块聚合词引导视觉特征并借助全局语义代理执行概念级对齐;TSM 模块评估词相关视觉分量的时序出现概率,根据全局一致性与局部稀疏度对各词特征进行动态加权;对于多层特征变体 SE-DETR+,AFF 模块自深向浅门控融合不同层级的信息;最终由 Transformer 解码器输出高层融合特征,并通过不同任务专用的 1D 卷积与相似度头输出时序区间和高光得分。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入多模态特征<br/>CLIP 视频 Patch V 与查询文本 Q"] --> B["特征投影与词引导视觉聚合<br/>MLP 映射至维度 D 并生成 V_Q"]
    B --> C["语义代理对齐(SPA)<br/>概念代理分配与多模态双向对齐"]
    C --> D["时序稀疏性调制(TSM)<br/>帧间相似度自信息计算与动态重加权"]
    D --> E["自适应特征融合(AFF)<br/>多层特征从深到浅自适应门控汇聚"]
    E --> F["Transformer 解码器与多任务输出<br/>时序区间定位 VMR、高光预测 HD 与摘要 VS"]

关键设计

1. 语义代理对齐(SPA):通过共享概念锚点打破词汇孤岛

针对现有方法直接将视频特征与孤立词 Token 匹配导致语义泛化差的缺陷,SPA 并不强行拟合离散词表,而是在连续表征空间中引入一组可学习的语义代理 \(C \in \mathbb{R}^{C_N \times D}\)。为了避免随机初始化陷入平凡解,模型首先提取训练集查询文本的全局 [CLS] 特征,通过 K-means 聚类中心初始化语义代理,使其具备覆盖全局语义空间的先验锚点作用。在训练过程中,这些代理保持端到端更新。对于视频 Patch 特征,模型先计算其与查询各词的交互,获得词引导视觉特征 \(V_Q \in \mathbb{R}^{B \times T \times L \times D}\)。随后执行两步对齐:在分配步中,从真值区间内随机采样正样本视频切片 \(V_Q^{POS}\),并将每个查询词通过余弦相似度匹配至最近的语义代理,得到离散分配标签 \(A = \arg\max_{C_N}(\text{Softmax}(\cos(Q, C)))\);在优化步中,模型借助交叉熵对比损失将文本词向量与对应的视觉正样本同时向该目标代理拉近,并推离其余不相干代理:

\[\mathcal{L}_{Q-C} = -\frac{1}{BL} \sum_{b=1}^B \sum_{l=1}^L \sum_{c=1}^{C_N} \mathbf{1}(c=A) \log(S_{Q-C}[c]), \quad \mathcal{L}_{V-C} = -\frac{1}{BL} \sum_{b=1}^B \sum_{l=1}^L \sum_{c=1}^{C_N} \mathbf{1}(c=A) \log(S_{V-C}[c])\]

这一设计的精妙之处在于,语义代理仅在训练阶段充当正则化支架,推理时完全移除。它使得具有相同概念但不同词汇表达(如“meals”与“food”)的 Token 能够自动汇聚到相近的概念代理周围,从而在不增加推理延迟的前提下赋予视觉特征强大的语义泛化力。

2. 时序稀疏性调制(TSM):基于信息论自信息抑制背景冗余

在视频时序定位中,常驻背景概念(如“in the car”)贡献了绝大部分特征能量,而决定关键动作的瞬时线索(如“wearing a mask”)往往时序稀疏,在全局池化或跨模态交互中极易被淹没。TSM 提出以无监督的信息论原理显式量化各语义成分的“意外程度”。对于每个词聚合后的视觉分量,TSM 先计算其跨帧时序相似度矩阵 \(\mathcal{A}_{V_Q} \in [0, 1]^{B \times L \times T \times T}\),并以上三角区域元素的平均相似度模拟该语义在整段视频中的出现概率。根据香农信息论,出现概率越低、帧间相似度越小的语义事件,其蕴含的自信息(Self-Information)越高:

\[\mathcal{S}_{V_Q} = -\log\left( \left(\frac{T(T-1)}{2}\right)^{-1} \sum \mathbf{U}(\mathcal{A}_{V_Q}) \right) \in \mathbb{R}_+^{B \times L}\]

为了避免在原本就高度动态多变的视频中过度放大局部扰动,TSM 进一步计算全局视觉 [CLS] 特征的跨帧注意力一致性 \(\mathcal{S}_{CLS} \in [0, 1]^B\)。当视频整体背景高度静态一致时(\(\mathcal{S}_{CLS} \to 1\)),关键动作最易被背景掩盖,模型便完全激活基于自信息的权重 \(\mathcal{W}_{V_Q} = \text{Softmax}(\mathcal{S}_{V_Q} \cdot \mathcal{S}_{CLS})\),显著放大稀疏动作词对应的视觉特征;而在视频本身频繁切换场景时(\(\mathcal{S}_{CLS} \to 0\)),调制权重平滑退化为均匀分布。最后,调制后的视觉流在真值区间内外采样正负样本,通过边际为 0.5 的三元组损失 \(\mathcal{L}_T\) 进行时序边界区分约束,迫使网络对瞬间发生的核心动作保持极高敏感度。

3. 自适应特征融合(AFF):从深到浅的跨层互补聚合

为了充分利用预训练视觉模型不同网络深度的表征优势,SE-DETR 进一步扩展为多层特征版本 SE-DETR+。中间层特征保留了更丰富的局部纹理与空间结构,而深层特征则富集了高阶语义概念。AFF 模块采用从深至浅(\(K \to 1\))的反向渐进式融合机制。对于第 \(k\) 层的特征 \(V_{O_k}\) 与来自深层的汇聚特征 \(\hat{V}_{O_{k+1}}\),AFF 将两者沿通道维度拼接后输入门控网络,动态计算逐帧门控权重 \(g = \text{Sigmoid}(\text{MLP}([V_{O_k}, \hat{V}_{O_{k+1}}]))\)。特征通过 \(g \cdot V_{O_k} + (1-g) \cdot \hat{V}_{O_{k+1}}\) 线性混合后送入 Transformer 解码器层更新。同时,模型引入跨层对比损失 \(\mathcal{L}_{K-Align}\) 约束各层特征与文本查询的一致性,有效防止了传统浅层特征直接拼接时带来的高频噪声干扰。

损失函数 / 训练策略

SE-DETR 采用端到端联合多任务优化目标。针对定位任务,VMR 头采用平滑 L1 边界回归损失 \(\mathcal{L}_{VMR} = |t_s - \hat{t}_s| + |t_e - \hat{t}_e|\);HD 高光任务基于正负切片与文本池化向量的余弦相似度构建对比损失 \(\mathcal{L}_{HD}\)(温度系数 \(\tau=0.07\));VS 视频摘要任务采用预测前景概率的 Focal Loss \(\mathcal{L}_{VS}\)(\(\beta=0.9, \gamma=0.2\))。对齐损失项统合了语义代理损失、全局对齐损失与时序三元组损失:

\[\mathcal{L} = \lambda_{VMR}\mathcal{L}_{VMR} + \lambda_{HD}\mathcal{L}_{HD} + \lambda_{VS}\mathcal{L}_{VS} + \lambda_{Align}(\mathcal{L}_{Q-C} + \mathcal{L}_{V-C} + \mathcal{L}_{Q-V} + \mathcal{L}_T + \mathcal{L}_{K-Align})\]

超参数设置上,\(\lambda_{VMR}=1.0, \lambda_{VS}=0.2, \lambda_{HD}=0.1, \lambda_{Align}=0.1\)。语义代理数 \(C_N\) 在大规模词表的 QVHighlight 上设为 1000,在 Charades/TACoS/Youtube-HL 上设为 100,在 TVSum 上设为 10。

实验关键数据

主实验

论文在五大公共基准上进行了详尽测试,涵盖跨任务联合评估、纯时序区间定位、纯高光检测及视频摘要。下表汇总了在最核心的 QVHighlight 基准(含 VMR 与 HD 双任务)上的官方测试集与验证集表现。

方法 特征输入 测试集 VMR Avg mAP 测试集 VMR [email protected] 测试集 VMR [email protected] 测试集 HD mAP 测试集 HD HIT@1 验证集 VMR Avg mAP 验证集 HD mAP
Moment-DETR (NeurIPS 21) CLIP+SlowFast 30.73 52.89 33.02 35.69 55.60 32.20 35.65
UMT (CVPR 22) CLIP+SlowFast 36.12 56.23 41.18 38.18 59.99 38.59 39.85
QD-DETR (CVPR 23) CLIP+SlowFast 39.86 62.40 44.98 38.94 62.40 41.22 39.13
UniVTG (ICCV 23) CLIP+SlowFast 35.47 58.86 40.86 38.20 60.96 36.13 38.83
CG-DETR (NeurIPS 23) CLIP+SlowFast 42.90 65.40 48.40 40.30 66.20 44.90 40.80
Keyword-DETR (AAAI 25) CLIP+SlowFast 45.69 66.86 51.23 40.94 64.79 47.69 41.67
R2-Tuning (ECCV 24) CLIP (K=4) 46.17 68.03 49.35 40.75 64.20 47.86 39.45
SE-DETR (本文单层) CLIP (K=1) 45.73 68.03 48.88 40.61 65.84 47.57 40.04
SE-DETR+ (本文多层) CLIP (K=4) 46.42 68.22 49.96 40.82 66.40 48.29 40.27

在单独的 VMR 任务上,SE-DETR+ 在 Charades-STA 取得 51.2 mIoU,在 TACoS 取得 36.2 mIoU 与 39.2 [email protected],显著优于经典 2D-TAN 与 UniVTG;在 Youtube-HL 高光检测上平均 mAP 达到 77.0,超越了引入音频多模态输入的 UMT(74.9);在 TVSum 视频摘要上达到 89.6 Top-5 mAP,刷新领域纪录。

消融实验

为了严格分离各核心创新设计的贡献,作者在 QVHighlight 验证集上对 SPA、TSM 与 AFF 模块开展了剥离实验(基线移除相应模块与损失,多层特征退化为平均池化):

配置 SPA TSM AFF VMR [email protected] VMR [email protected] VMR Avg mAP HD mAP HD HIT@1 说明
Baseline - - - 62.19 46.26 42.15 37.40 61.35 纯 DETR 架构,无显式语义增强
+SPA ✓ - - 67.74 50.77 45.29 40.02 65.41 单独加入语义代理,VMR大幅提升+5.55%
+TSM - ✓ - 64.97 49.15 44.86 38.68 63.47 单独加入时序稀疏调制,验证稀疏重要性
+AFF - - ✓ 63.47 47.61 43.18 37.47 61.09 单独使用自适应特征门控
SPA + TSM ✓ ✓ - 68.80 52.68 47.63 40.08 66.02 双语义显式建模,逼近完整模型
SPA + AFF ✓ - ✓ 68.73 51.65 46.72 39.88 65.51 跨层特征结合语义代理
TSM + AFF - ✓ ✓ 64.26 49.03 45.00 38.05 62.39 缺概念泛化导致上限受制
完整模型 (SE-DETR+) ✓ ✓ ✓ 69.51 53.61 48.29 40.27 66.97 协同增益,所有指标达到峰值

关键发现

  • SPA 是基础性能跃升的最大驱动力:在 baseline 上单独引入 SPA,VMR [email protected] 从 62.19% 暴增至 67.74%(净增 5.55%),HD mAP 从 37.40% 提升至 40.02%。这有力证明了词汇级硬匹配确实存在严重的表征割裂,概念级对齐是跨模态接地的基石。
  • TSM 与 SPA 具有高度互补性:在 SPA 赋予特征概念通用性后,TSM 进一步提供时序聚焦能力,使 VMR [email protected] 进一步从 50.77% 跃升至 52.68%,证明了“先概念泛化、后时序凸显”两阶段逻辑的自洽性。
  • 代理数量 \(C_N\) 呈现倒 U 型规律:在 QVHighlight 上的消融显示,代理数从 100 增至 1000 时,VMR Avg mAP 从 46.90 稳步升至 48.29;但激增至 2000 时性能骤降至 46.92。这是因为代理数过大导致长尾代理缺乏足够的样本更新,分配稀疏失衡。

亮点与洞察

  • 信息论自信息的无监督时序加权:巧妙地将词引导视觉特征的跨帧相似度视作经验概率,以负对数自信息直接度量时序稀疏度,无需任何额外的显著性标注即可自发惩罚常驻背景词、激活瞬间动作词。
  • 零推理代价的语义代理支架:语义代理机制仅在训练期通过对比损失对齐特征分布,推理阶段直接弃用代理矩阵,既获得了概念层级的泛化表征,又保持了轻量敏捷的推理速度。
  • 全局一致性门控防止过敏放大:引入全局 [CLS] 特征自注意作为先验门控因子,自适应调节加权剧烈程度,解决了动态高频切换视频中自信息误放大的鲁棒性难题。

局限与展望

  • 代理容量对词表规模敏感:语义代理数量 \(C_N\) 属于离散超参数,目前需要人工根据数据集规模设定(从 10 到 1000 不等),在开放域连续长视频流中难以动态自适应调整。
  • 多词长查询的时序复合推理不足:目前的自信息度量是按词独立计算的,尚未考虑多个动作之间的时间先后次序(如“先切菜再炒菜”)在时序逻辑上的联合稀疏性。
  • 未来的端到端视频大模型拓展:可探索将显式语义代理与时序自信息调制内嵌至 Video-LLM 的视觉提示投影层中,缓解多模态大模型在精细定位任务上的计算冗余与幻觉。

相关工作与启发

  • vs R2-Tuning (ECCV 2024):R2-Tuning 侧重于利用冻结 CLIP 的多层 Patch 级特征做跨模态注意力,缺乏显式概念聚合机制;本文通过 SPA 与 TSM 赋予多层特征更强的概念泛化与时序辨别力,在相同 4 层配置下取得显著更优的定位与高光表现。
  • vs Keyword-DETR (AAAI 2025):Keyword-DETR 引入额外的关键字分类器挑选高响应词,依赖强监督启发式;本文直接利用无监督自信息从时序变化中内生计算稀疏度,物理机制更自然,鲁棒性更高。
  • vs CG-DETR (NeurIPS 2023):CG-DETR 通过加入虚拟 Token 缓解文本被动注入,本文则直接在语义空间建立概念锚点与时序调制,从表征学习本质上解决了冗余词的干扰。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 引入语义代理与时序自信息建模,立意新颖且理论自洽。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 个公开数据集、3 项代表性子任务,消融与可视化详实透彻。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰,问题提炼与数学推导严密连贯。
  • 价值: ⭐⭐⭐⭐☆ 为时序动作定位与跨模态特征微调提供了兼具高精度与轻量推理的示范。