跳转至

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/TenMinutes209/ScanFocus
领域: 视频理解
关键词: 时空视频定位、粗到细框架、多模态融合、时间聚合器、可变形注意力

一句话总结

ScanFocus 提出了一种解耦全局时空扫描与局部边界聚焦的粗到细时空视频定位框架,结合轻量可变形语义-运动融合与语义引导时间聚合器(SGTA),在大幅降低计算开销的同时显著提高了边界定位精度。

研究背景与动机

时空视频定位(Spatio-Temporal Video Grounding, STVG)旨在根据自然语言查询在未剪辑视频流中检索特定目标的时空运动轨迹(即空间边界框序列及时间起止区间)。近年来,以 TubeDETR、STCAT 为代表的 Transformer 架构通过端到端编码器-解码器联合回归管线显著推进了该任务。然而,长视频处理高昂的计算复杂度迫使现有方法普遍采用全局低帧率均匀时间下采样;这种处理不可避免地抑制了高频时间边界线索,甚至直接跳过了落在真实边界附近的稀疏帧,使得模型在物理层面无法接触到精准的起止特征,引发时间边界模糊。

更深层的瓶颈在于现有方法缺乏显式的时间建模机制,且多模态交互架构过载。主流方法多沿用静态 MDETR 范式,通过庞大的标准 Transformer 编码器强行将外观、文本以及隐式动作特征映射到同一潜在空间。这种全耦合的三模态交互使得模型难以解耦空间与时间定位所需的异构特征,陷入次优解;而在帧间建模上,模型严重依赖主干网络隐式编码的动作特征,缺乏专用的帧间交互机制来捕捉起止边界处剧烈的动作状态跃迁。Oracle 实验表明,在给出真实时间戳时模型空间定位性能([email protected])从 42.2% 跃升至 86.9%,印证了时间边界模糊才是制约 STVG 性能的核心瓶颈。

面对这一矛盾,本文借鉴人类视觉“先全局粗扫、再局部细看”的感知策略,将 STVG 任务显式解耦为全局时空扫描与局部边界聚焦两阶段。核心 idea:将时空视频定位解耦为基于稀疏帧的全局粗定位与基于局部高帧率窗口的精细边界回归,利用可变形跨模态融合生成粗候选,再通过语义引导的时间聚合器(SGTA)显式建模密集边界窗口内的帧间依赖与高频运动变化。

方法详解

整体框架

ScanFocus 的整体流水线分为两个级联阶段:全局时空扫描(Global Spatio-Temporal Scan)与局部边界聚焦(Local Boundary Focus)。在粗定位阶段,视频经稀疏下采样后,由统一图文编码器(BEiT-3)和视频运动编码器(VideoMAE)提取多模态表征,经可变形语义-运动融合后通过双分支 DETR 解码器输出粗边界框序列与粗起止区间;在精细聚焦阶段,围绕粗预测边界进行高帧率密集采样并利用插值获得空间先验,随后经语义引导时间聚合器(SGTA)进行目标与文本引导的帧间交互,最终由细化解码器输出精确起止时间戳。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始长视频 + 文本查询"] --> B["全局时空扫描<br/>低帧率均匀采样 Tc 帧"]
    B --> C["可变形语义-运动融合<br/>BEiT-3 + VideoMAE 稀疏多尺度对齐"]
    C --> D["双分支粗解码器<br/>输出粗边界框 Bc 与粗区间 (tcs, tce)"]
    D --> E["边界密集采样与空间先验对齐<br/>高帧率采样局部窗口 + 线性插值生成 Bst"]
    E --> F["语义引导的时间聚合器<br/>RoI 空间对齐 + 语义调制 + 局部 MHSA"]
    F --> G["细化解码器<br/>输出精细起止时间戳与置信度"]

关键设计

1. 可变形语义-运动融合:打破三模态全耦合的优化瓶颈

针对传统 MDETR 架构强行使用标准 Transformer 编码器联合压缩外观、文本与运动特征导致的过载与次优问题,ScanFocus 引入解耦融合策略。首先采用在大规模图文对上充分预训练的统一视觉-语言编码器 BEiT-3 提取外观特征 \(F_a \in \mathbb{R}^{T_c \times N_a \times C_a}\)、文本特征 \(F_l \in \mathbb{R}^{T_c \times L \times C_a}\) 以及全局上下文标记 \(F_c \in \mathbb{R}^{T_c \times 1 \times C_a}\),从特征提取源头消除图文模态偏差;同时使用冻结的 VideoMAE 提取运动特征 \(F_m\)。为以极低代价完成跨模态对齐,模块将各特征投影至统一维度构建多层级金字塔 \(\mathcal{X} = \{F_a, F_m, F_t, F_c\}\),并构建可变形注意力机制:

\[\text{Fusion}(z_q) = \sum_{l=1}^{4} \sum_{k=1}^{K} A_{lqk} \cdot \Phi(\mathcal{X}^l; p_q + \Delta p_{lqk})\]

其中 \(p_q\) 为参考点,\(\Delta p_{lqk}\)\(A_{lqk}\) 为可学习的采样偏移量与注意力权重。该设计使文本 token 仅需自适应聚焦于最显著的局部时空运动或外观区域,将传统自注意力的二次方计算复杂度降至线性,显著减轻了时空背景噪声干扰。

2. 边界密集采样与空间先验对齐:低开销找回被丢弃的高频时间线索

全局稀疏下采样虽然维持了长时序计算可行性,却抹去了关键动作转换点的高频信息。为了在不显著增加全序列计算量的前提下恢复边界细节,该设计在粗阶段预测的起始时间戳 \(t_c^s\) 与结束时间戳 \(t_c^e\) 周围分别开辟局部观测窗口,以高采样率 \(f_r = k_r \cdot f_c\)\(k_r > 1\))在每个窗口内密集提取 \(N_w\) 帧图像,形成密集序列 \(V_{rs}\)\(V_{re}\)

为避免为局部窗口重新运行沉重的外部目标检测器,方法直接复用粗阶段预测的空间边界框序列 \(B_c\)。通过从粗边界框中切片取出对应局部窗口时间跨度的子集,并施加时序线性插值(Linear Interpolation),直接上采样得到长度为 \(N_w\) 的密集空间先验 \(B_{st} \in \mathbb{R}^{N_w \times 4}\)。这一轻量空间先验为后续精细定位锁定了目标运动轨迹,在计算量近乎为零的情况下完成了密集时空坐标系的对齐。

3. 语义引导的时间聚合器:显式建模局部窗口内的高频动作演变

简单的密集帧堆叠会引入大量的背景冗余与非目标物体动作干扰,必须建立目标导向的显式帧间交互。语义引导时间聚合器(SGTA)首先基于空间先验 \(B_{st}\) 对局部外观特征 \(F_{rs}^a\) 执行 RoI Pooling,精确剥离出受关注目标的局部外观序列 \(F_{ps}^a = \text{ROIPool}(F_{rs}^a, B_{st})\)。随后,以目标外观通过逐元素哈达玛积过滤运动特征中的背景动态,并加上投射后的文本特征以施加语言偏置:

\[F_{sg} = (\phi_a(F_{ps}^a) \odot F_{rs}^m) \oplus \phi_t(F_{rs}^t)\]

为了捕获动作起止瞬间的高频依赖,SGTA 将 \(F_{sg}\) 展平为长度为 \(N_w \times N_m\) 的统一序列,输入堆叠的 \(L_t\) 层时间多头自注意力(MHSA)中进行全域交互:\(F_{rs}' = \text{MHSA}_{\times L_t}(\text{Flatten}(F_{sg}))\)。局部窗口的降维特性使所有 token 能够充分感知彼此的时空演变,最终细化解码器能够灵敏辨别动作突变点,输出精确至帧级的起止分布。

损失函数 / 训练策略

为防止局部高精细梯度的扰动破坏已学成的全局上下文先验,ScanFocus 采用解耦的两阶段训练策略:

  1. 粗定位阶段:联合训练主干、融合编码器与粗解码器,总损失为 \(\mathcal{L}_c = \lambda_{box} (\mathcal{L}_{L1}(B_c, B^*) + \mathcal{L}_{IoU}(B_c, B^*)) + \lambda_{tmp} (\mathcal{L}_{KL}(\hat{P}_s, t_s^*) + \mathcal{L}_{KL}(\hat{P}_e, t_e^*))\),其中空间回归使用 L1 和 GIoU 损失,时间区间预测采用与高斯平滑真实标签对齐的 KL 散度。
  2. 细化聚焦阶段:完全冻结粗阶段参数,仅优化 SGTA 和细化解码器。将边界起止判定与动作置信度预测形式化为二分类任务,使用二值交叉熵(BCE)损失监督:\(\mathcal{L}_r = \lambda_{ref} \mathcal{L}_{BCE}(P_{st/ed}, y_{st/ed}^*) + \lambda_{act} \mathcal{L}_{BCE}(A_{st/ed}, y_{act}^*)\)

实验关键数据

主实验

在三个标准基准 HC-STVGv1、HC-STVGv2 和 VidSTG 上,ScanFocus 均超越了先前最先进的方法。尤其在严苛的定位阈值 [email protected] 下展现了大幅优势。

数据集 指标 ScanFocus (本文) TA-STVG (之前SOTA) 提升
HC-STVGv1 (Test) m_tIoU 55.5 53.0 +2.5%
HC-STVGv1 (Test) m_vIoU 41.8 39.1 +2.7%
HC-STVGv1 (Test) [email protected] 67.5 63.1 +4.4%
HC-STVGv1 (Test) [email protected] 42.2 36.8 +5.4%
HC-STVGv2 (Val) m_tIoU 62.4 60.4 +2.0%
HC-STVGv2 (Val) m_vIoU 41.7 40.2 +1.5%
HC-STVGv2 (Val) [email protected] 68.4 65.8 +2.6%
HC-STVGv2 (Val) [email protected] 39.3 36.7 +2.6%
VidSTG (Declarative) m_tIoU 53.3 51.7 +1.6%
VidSTG (Declarative) [email protected] 36.0 33.5 +2.5%
VidSTG (Interrogative) m_tIoU 51.4 50.2 +1.2%
VidSTG (Interrogative) [email protected] 29.4 28.0 +1.4%

消融实验

在 HC-STVGv1(输入分辨率 224×224)上进行的组件消融与融合机制对比验证了各模块设计的必要性。

配置 tIoU vIoU [email protected] [email protected] 说明
Coarse (Baseline) 50.9 38.2 60.7 38.0 全局粗定位基线
+ DS (密集采样) 52.4 39.1 62.6 37.9 仅引入密集采样与直接细化解码
+ SGTA (完整模型) 53.7 40.0 64.0 39.5 引入完整 SGTA 模块
SGTA w/o TA (去时间注意力) 52.8 39.3 63.1 38.7 移除显式帧间自注意力机制
SGTA w/o SG (去语义引导) 53.1 39.5 63.4 39.0 移除 RoI 目标外观与文本引导
Standard Self-Attn Fusion 53.3 39.8 - 36.5 标准自注意力融合(516 GFLOPs)
Deformable SM Fusion 53.7 40.0 - 39.5 可变形语义-运动融合(260 GFLOPs)

关键发现

  • SGTA 的协同价值:仅引入密集采样(+DS)时,虽然由于捕获更多帧使 tIoU 提升至 52.4%,但 [email protected] 出现微跌(38.0% \(\rightarrow\) 37.9%),表明未经显式建模的密集帧存在冗余和噪声;只有引入 SGTA 后,[email protected] 跃升至 39.5%,验证了语义调制与显式时间依赖对于边界细化的决定性作用。
  • 局部窗口大小的权衡:细化窗口大小 \(N_w\) 在 4 到 12 帧之间测试,性能在 \(N_w = 8\) 时达到峰值(tIoU 53.7%, vIoU 40.0%)。较小的窗口缺少上下文,而 \(N_w > 8\) 则引入过多非边界无关背景,稀释了起止状态转换特征。
  • 计算复杂度减半:可变形语义-运动融合相较于标准密集自注意力,将多模态融合的计算量从 516 GFLOPs 骤降至 260 GFLOPs(降低约 50%),同时高精度指标 [email protected] 提高 3.0 个百分点,实现了精度与效率的双赢。

亮点与洞察

  • 解耦设计精准命中任务核心瓶颈:通过 Oracle 分析明确了 STVG 的首要瓶颈在于时间维度模糊而非空间定位;粗到细的两阶段解耦有效避开了在全视频维持超密集帧的显存灾难。
  • 插值复用避免繁重检测开销:在局部细化阶段,创新性地使用粗边界框的线性插值获得局部密集空间先验,免去了额外调用物体检测器的庞大负担,机制精巧高效。
  • 即插即用的迁移潜力:SGTA 模块所采用的“局部密集采样 + 语义调制运动特征 + 局部时间注意力”模式,对视频时序动作定位(VTG)、长视频精彩片段检测(Highlight Detection)等细粒度时序任务具有很强的通用借鉴价值。

局限与展望

  • 粗阶段召回依赖:若粗定位阶段给出的起始或结束时间戳偏差过大(超出局部观察窗口的覆盖范围),细化阶段将无法修正严重偏离的假阳性边界。
  • 两阶段非端到端反向传播:为保持全局表征稳定,训练过程采用了冻结粗阶段的分步优化策略,限制了细化特征向全局感知模块的双向梯度反馈。
  • 未来方向:可进一步探索自适应动态窗口大小机制,根据查询动词的动作持续时间自适应缩放局部采样半径,并尝试联合强化学习探索端到端协同微调。

相关工作与启发

  • vs TubeDETR / STCAT / CG-STVG: 此类主流方法均采用全视频全局均匀采样的单阶段端到端管线,边界帧信息被均匀稀释;ScanFocus 通过粗到细机制恢复了局部密集高频线索,且融合模块计算量减少近半。
  • vs TA-STVG: TA-STVG 聚焦于利用目标感知增强时空交互,但仍受制于全局下采样导致的边界模糊;ScanFocus 在目标先验引导下进一步下沉至高分辨率时间窗口,在各基准的高精度阈值上均取得 2%~5% 的突破。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 针对 STVG 时间边界模糊的痛点,提出了结构清晰、切实有效的粗到细两阶段解耦与 SGTA 模块。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三大基准评测、详尽的 Oracle 分析、模块消融、参数敏感性测试以及计算量对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑线索鲜明,图表与动机自洽,实验分析深入透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为高时序精度的视频跨模态理解提供了极具实用价值的范式参考。