跳转至

MomentSeg: Moment-Centric Sampling for Enhanced Referring Video Object Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Dmmm1997/MomentSeg
领域: 语义分割
关键词: 视频引用目标分割, 关键时刻定位, 采样策略, 双向时序传播, 多模态大模型

一句话总结

针对多模态大模型在视频引用目标分割(RefVOS)中依赖启发式采样或外部关键帧模型的难题,MomentSeg 联合优化时序句子定位(TSG)与分割任务,提出基于 [FIND] 标记的原生关键时刻定位机制、以时刻为中心的分层自适应采样(MCS)以及双向锚点更新传播(BAP),在 MeViS 和 ReVOS 上分别取得显著 SOTA 表现。

研究背景与动机

视频引用目标分割(RefVOS)要求模型根据自然语言描述,在视频序列中对目标实体进行像素级的时空定位与持续追踪。随着多模态大模型(LMM)与基础分割模型(如 SAM2)的发展,基于单一 [SEG] 标记解码视频对象掩码的范式逐渐成为主流。然而,现实视频帧数繁多且包含大量冗余,直接将完整视频帧全部送入大模型会引发难以承受的计算开销与显存瓶颈。因此,如何在进入大模型前挑选出与文本高度语义相关的关键帧,成为决定分割精度与效率的胜负手。

现有基于大模型的 RefVOS 方案在帧采样机制上陷入两难境地。一方面,以 Sa2VA、VideoLISA 为代表的方法采用简单的静态规则,例如截取前 \(K\) 帧(FirstK)或全局均匀采样,这类启发式采样完全无视文本中关于动作时机或目标出现阶段的内容线索,在目标晚期出现或强依赖动作辨识的复杂场景中容易彻底遗漏目标;另一方面,VISA、ViLLa、GLUS 和 VRS-HQ 等方案转而求助于外部预训练模型(如 LLaMA-VID、Grounded-VideoLLM 或 CLIP)预先打分筛选时间戳,再交由大模型进行分割,这不可避免地大幅增加了系统复杂度、多阶段依赖与推理延迟。

针对这一矛盾,本文探索能否让大模型自身原生具备辨识动作关键时刻的能力,进而指导自适应采样。核心 idea:将时序句子定位(TSG)与视频引用目标分割(RefVOS)统一建模,通过引入专用的 [FIND] 标记实现无外部时间戳编码的自序相似度匹配,并以此驱动以时刻为中心的高密度局部+低密度全局分层采样(MCS)与双向锚点更新传播(BAP)。

方法详解

整体框架

MomentSeg 建立在 Qwen2.5-VL 视觉语言模型与 SAM2 分割解码器之上,构建了一个无需外部关键帧检测器的端到端双任务统一网络。在训练阶段,模型同时学习时序句子定位(TSG)与 RefVOS 任务:一方面通过注入极低分辨率的均匀帧序列与高分辨率密集片段帧,利用 [SEG] 标记解码出高精度目标掩码;另一方面利用新增的 [FIND] 标记直接计算与时序帧特征之间的余弦匹配概率,摆脱复杂的时间戳文本编码。在推理阶段,系统首先通过低分辨率帧特征与 [FIND] 标记推断出全时序的相关性响应分布,再经由 MCS 动态分配采样预算,最后以最高置信度的关键时刻为锚点进行双向掩码传播和自适应显存清理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:视频帧序列与自然语言文本"] --> B["阶段 1:[FIND] 标记与帧级时序匹配<br/>计算低分辨率帧与查询特征相关性分布"]
    B --> C["阶段 2:以时刻为中心的分层采样 (MCS)<br/>滑动窗口确定中心,逆 CDF 动态分配采样"]
    C --> D["阶段 3:双向锚点更新传播 (BAP)<br/>以关键时刻为锚点双向追踪与自适应显存刷新"]
    D --> E["输出:逐帧高精度目标分割掩码序列"]

关键设计

1. [FIND] 标记与帧级时序相似度匹配:无需外部时间戳编码的原生关键时刻定位

以往将时序句子定位(TSG)集成到视频大模型的工作通常依赖复杂的显式时间戳文本生成、时间标记编码或外部定位模型,不仅增加了推理步骤,还容易受到自回归生成幻觉的影响。为了让主干模型原生掌握时序注意力,MomentSeg 在训练中引入专用查询标记 [FIND]。具体而言,模型输入低分辨率均匀采样帧 \(I^l_{1:L}\)(每帧仅编码不超过 16 个视觉标记以严格控制计算预算)以及自然语言描述 \(R\)。大模型输出的时序视觉标记经过 MLP 投影与时序平均池化,生成帧级特征序列 \(T^v \in \mathbb{R}^{L_t \times C}\);同时 [FIND] 标记映射得到文本时序查询向量 \(T^f \in \mathbb{R}^{N_f \times C}\)。系统直接通过归一化内积计算帧级相似度矩阵 \(\ell_{ij}\),并采用加权二元交叉熵损失进行监督:

\[\ell_{ij} = \frac{(T^f_i)^\top T^v_j}{\|T^f_i\| \|T^v_j\| \tau}\]
\[\mathcal{L}_{\text{find}} = -\frac{1}{|\Omega|} \sum_{(i,j) \in \Omega} \left[ \lambda_p y_{ij} \log \sigma(\ell_{ij}) + (1 - y_{ij}) \log (1 - \sigma(\ell_{ij})) \right]\]

其中 \(\tau=0.07\) 为温度系数,\(y_{ij} \in \{0, 1\}\) 表示第 \(j\) 帧是否落在文本描述的时间区间内,\(\lambda_p=2.0\) 增强正样本权重。由于视频骨干网络对时序维度进行了下采样,模型对匹配分布实施双线性插值以恢复到原始帧长。该机制使得模型在不依赖任何额外辅助网络的情况下,通过单次前向推理便可直接输出全时序语义相关度曲线。

2. 以时刻为中心的分层采样(MCS):高相关区间密集与非关键背景稀疏并存

获得帧相关度分布后,常见的贪心策略如取最大值 TopK 或局部截取 NearbyK 极易导致采样帧过度聚集在狭窄的时序邻域,进而丢失全局上下文演化,且无法适应跨度较长的动作。MCS 旨在平衡局部动作细节与全局语义覆盖。首先对原始相似度应用高斯平滑滤除噪声获得平滑曲线 \(S \in \mathbb{R}^T\),随后利用预设长度为 \(w\) 的滑动窗口寻找累计语义质量最高的中心时刻 \(c^*\)

\[i^* = \arg\max_{i=0 \to T-w} \sum_{j=i}^{i+w-1} S_j, \quad c^* = i^* + \lfloor w/2 \rfloor\]

确定核心锚点 \(c^*\) 后,MCS 将视频在时间轴上划分为左侧 \([0, c^*-1]\) 与右侧 \([c^*+1, T-1]\) 两个分区,将总采样预算中扣除中心帧后的 \(K-1\) 个配额按照左右分区的累积质量权重比例 \(w_L / (w_L + w_R)\) 进行动态分配,分别得到左右预算 \(k_L\)\(k_R\)。在每个分区内部,将归一化的质量分布转换为累积分布函数(CDF)\(F(i)\),利用均匀分位数 \(\hat{u}_m = (m - 0.5) / k\) 执行逆采样(Inverse CDF):

\[i_m = \min \left\{ i \in [a, b] \mid F(i) \ge \hat{u}_m \right\}, \quad m = 1, \dots, k\]

这一设计保证了与文本描述高度契合的关键动作区间能够被密集密集抽取以看清精细形变,而边缘或低相关背景区间则以自适应稀疏间隔进行抽样,兼顾了精细动作辨识与完整全局时序建模,计算开销增幅不足总推理耗时的 0.1%。

3. 双向锚点更新传播(BAP):高置信时刻双向追踪与自适应记忆刷新

现有的视频掩码传播通常采用从视频第一帧单向顺序向后传播的范式。一旦目标实体在视频中后段才首次现身,前序传播将处于空转甚至被错误背景目标误导的状态。BAP 改换思路,将 MCS 确定的最高响应中心时刻 \(c^*\) 作为初始高质量种子帧,向视频的前序和后序两个时间方向展开双向传播。更为关键的是,为了解决长时间追踪中误差逐步累积放大的顽疾,BAP 在每个通过 MCS 采样的关键节点 \(i\) 执行自适应锚点更新与记忆清洗机制:

\[U_i = \begin{cases} 1, & \text{if } \prod_{j=1}^t S_j^t < \lambda \cdot S_i^p \\ 0, & \text{otherwise} \end{cases}\]

其中 \(S_j^t\) 为追踪模块在第 \(j\) 步输出的追踪置信度,\(\prod_{j=1}^t S_j^t\) 表示累积追踪可靠度,\(S_i^p\) 为大模型在采样节点 \(i\) 处基于文本生成的独立预测掩码置信度,敏感度超参 \(\lambda=0.9\)。当累积追踪信赖度低于当前直接预测质量的阈值时,触发记忆重置指令(\(U_i=1\)),清除容易累积误差的历史缓存,并以当前节点的高质量预测重新校准传播先验。该设计使得长期遮挡、剧烈形变或复杂交叠场景下的跟踪漂移能够被及时修正。

损失函数 / 训练策略

MomentSeg 的总训练目标包含时序定位与多模态分割两个部分: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{seg}} + \alpha \mathcal{L}_{\text{find}}\)$ 其中分割损失 \(\mathcal{L}_{\text{seg}}\) 沿用 SAM2 与 Sa2VA 的配置,由聚焦目标前景的二元交叉熵损失与 Dice 损失组合构成;\(\mathcal{L}_{\text{find}}\) 为上述公式所定义的时序匹配损失,平衡权重 \(\alpha=1.0\)。模型训练基于 8 块 NVIDIA H20 GPU(96GB 显存),采用 LoRA 针对 Qwen2.5-VL 骨干网络进行轻量级微调,序列截断长度设为 8,192 tokens,MomentSeg-3B 的整体训练耗时约 24 小时。

实验关键数据

主实验

论文在多项视频引用目标分割(RefVOS)、复杂推理视频分割(Reasoning VOS)以及时序句子定位(TSG)基准上进行了系统评测。

1. 经典视频引用目标分割(RefVOS)性能对比

模型 参数量 MeViS (valu) \(\mathcal{J}\&\mathcal{F}\) MeViS (val) \(\mathcal{J}\&\mathcal{F}\) Ref-Youtube-VOS \(\mathcal{J}\&\mathcal{F}\) Ref-DAVIS17 \(\mathcal{J}\&\mathcal{F}\)
ReferFormer - - 31.0 62.9 61.1
DsHmp - 55.3 46.4 67.1 64.9
DeRVOS - 60.6 51.8 70.0 70.9
LISA-7B 7B 43.2 37.2 53.9 64.8
VideoLISA-3.8B 3.8B 54.5 44.4 63.7 68.8
VISA-7B 7B - 43.5 61.5 69.4
ViLLa-6B 6B - 49.4 67.5 74.3
GLUS-7B 7B 60.9 51.3 67.3 -
Sa2VA-Qwen2.5-VL-3B 3B 57.5 50.0 71.0 74.4
MomentSeg-3B (Ours) 3B 62.0 54.8 72.0 76.4
MomentSeg-7B (Ours) 7B 62.6 57.1 72.3 77.4

2. 复杂推理视频目标分割(Reasoning VOS)性能对比

模型 参数量 ReVOS 整体 \(\mathcal{J}\&\mathcal{F}\) ReVOS 引用 \(\mathcal{J}\&\mathcal{F}\) ReVOS 推理 \(\mathcal{J}\&\mathcal{F}\) ReasonVOS \(\mathcal{J}\&\mathcal{F}\)
TrackGPT-13B 13B 45.0 49.5 40.5 -
VISA-13B 13B 50.9 57.4 44.3 -
VideoLISA-3.8B 3.8B - - - 47.5
HyperSeg-3B 3B 55.7 58.5 53.0 -
ViLLa-6B 6B 57.0 - - 55.4
GLUS-7B 7B 54.9 58.3 51.4 49.9
VRS-HQ-7B 7B 59.1 62.1 56.1 -
Sa2VA-Qwen2.5-VL-3B 3B 58.7 61.5 55.9 49.6
MomentSeg-3B (Ours) 3B 62.6 65.4 59.9 61.7
MomentSeg-7B (Ours) 7B 65.1 67.4 62.8 62.7

消融实验

1. 核心组件递进消融实验(\(\mathcal{J}\&\mathcal{F}\) 指标)

配置编号 时序标记注入 (TTI) 时刻中心采样 (MCS) 双向锚点传播 (BAP) MeViS (valu) MeViS (val) Ref-DAVIS17 Ref-Youtube-VOS ReasonVOS ReVOS
1 (基线) - - - 57.0 51.3 75.5 70.1 54.1 58.3
2 - - 58.7 (+1.7) 52.3 (+1.0) 76.2 (+0.7) 70.3 (+0.2) 58.1 (+4.0) 59.2 (+0.9)
3 - 61.3 (+2.6) 53.9 (+1.6) 76.8 (+0.6) 70.8 (+0.5) 60.8 (+2.7) 60.4 (+1.2)
4 (完整) 62.0 (+0.7) 54.1 (+0.2) 76.4 (-0.4) 72.0 (+1.2) 61.7 (+0.9) 62.6 (+2.2)

2. 采样策略对比消融实验

采样机制 MeViS (valu) \(\mathcal{J}\&\mathcal{F}\) Ref-DAVIS17 \(\mathcal{J}\&\mathcal{F}\) ReasonVOS \(\mathcal{J}\&\mathcal{F}\) 策略特点
FirstK (基线) 58.3 76.3 55.9 盲目截取前段,容易丢失中后段动作
Uniform 59.6 (+1.3) 76.2 (-0.1) 57.1 (+1.2) 全局均匀覆盖,但稀释了关键动作细节
KeyFrame (TopK) 60.1 76.9 60.2 局部高相关帧冗余,丧失全局时序演变
KeyFrame (NearbyK) 60.9 (+0.8) 77.1 (+0.2) 59.9 (-0.3) 聚集在中心邻域,对长序列泛化不足
MCS (本文) 61.3 (+3.0) 77.3 (+1.0) 60.8 (+4.9) 高相关区密集 + 低相关区稀疏,两全其美

关键发现

  • 采样策略的决定性影响:在动作密集且目标频繁变动的 MeViS 上,MCS 比 FirstK 带来了整整 3.0 个百分点的提升;在复杂关系推理的 ReasonVOS 上优势更为悬殊,提升达到 4.9 个百分点。实验证实,简单的 TopK 或 NearbyK 虽然抓住了关键帧,但过度集中的采样破坏了视频全局时间轴的连贯性,证明了 MCS“关键区密集、背景区稀疏”分层抽样的优越性。
  • BAP 对长期视频的纠偏能力:BAP 使得模型在 MeViS 上的初始命中率(Initial Shot Ratio)从 88.7% 跃升至 96.6%(+7.9%),起始帧掩码质量(Initial mIoU)提升 9.3 个百分点。同时,自适应记忆清理机制将累积追踪中约 7.1% 的低质量预测(IoU < 0.3)成功纠正为高质量掩码(IoU > 0.7),在长序列与强推理任务(ReVOS 提升 2.2 点)上展现了抗漂移效果。
  • 推理效率与收益比极佳:通过细粒度延迟剖析,引入 TSG 定位仅增加了约 7% 的 MLLM 计算开销,MCS 采样算法仅占不足 0.1% 的时间,整套流程相较于 Sa2VA-8B 仅带来约 3% 的总推理延迟增加,却在 MeViS 上获得了超过 10% 的绝对质量增益。

亮点与洞察

  • 将 TSG 转为多模态内部机制而非外挂管道:利用单标记 [FIND] 计算时序相似度,巧妙替代了复杂的显式文本时间戳生成,使得视觉大模型具备了内生的一级时序感知力,消除了对外部关键帧模型的依赖。
  • 逆 CDF 概率引导的时序空间分配:将语义相关度曲线平滑后视为概率密度函数,通过划分左右分区再使用 Inverse CDF 进行分位数采样,用优雅的统计学方法彻底解决了离散时序采样在局部密集度与全局跨度之间的权衡矛盾。
  • 可迁移至大模型视频理解通用管线:MCS 与 BAP 模块本质上独立于具体分割头,可直接迁移至长视频问答、视频时空定位(STGrounding)及具身机器人长时序轨迹追踪任务中,为有限算力下处理超长视频输入提供了范例。

局限与展望

  • 作者承认的局限:在目标贯穿整段视频且动作语义较为单一的静态短视频基准(如 Ref-DAVIS17)上,分层采样与双向记忆刷新的优势不明显,甚至带来微弱的精度扰动(表 7 中 BAP 在 Ref-DAVIS17 上出现了 -0.4 的小幅波动)。
  • 自适应窗口超参的依赖性:确定中心时刻 \(c^*\) 的滑动窗口大小 \(w\) 目前仍为固定先验超参,对于动作时长跨度极大的视频(从几秒瞬时动作到数分钟持续交互),固定窗口可能出现对瞬间事件定位模糊或对长程事件覆盖不全的妥协。
  • 改进方向:探索可学习的多尺度时序高斯混合核或由文本指令自适应预测窗口尺度的动态 MCS 机制,并将 [FIND] 标记拓展至多目标并发多时刻联合定位。

相关工作与启发

  • vs Sa2VA / VideoLISA: Sa2VA 采用固定 FirstK 帧输入,VideoLISA 采用等间隔均匀帧输入,均忽视了语言指代动作发生的时间偏置;MomentSeg 利用内生 [FIND] 驱动的 MCS 实现内容自适应分层采样,在动作密集型数据集上大幅领先。
  • vs VISA / ViLLa / GLUS: 这些方法依赖 LLaMA-VID 或 Grounded-VideoLLM 等外部预训练网络筛选关键时间戳,系统链路繁杂且增加显存占用;MomentSeg 实现了 TSG 与 RefVOS 在单一骨干内的统一学习与原生定位,结构轻量且端到端可导。
  • vs SAM2 原生单向传播: 原生 SAM2 自视频首帧向后单向传递记忆,若目标中途才出现或中途受严重遮挡易产生单向不可逆漂移;BAP 采用高置信关键帧双向扩散与置信度自适应记忆刷新,具备回溯纠偏能力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [设计专用的 [FIND] 标记实现无外部时间戳编码的时序定位,构建了优雅的以时刻为中心采样与双向自适应更新范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 RefVOS、Reasoning VOS、TSG、Image Grounding 等十余个基准,消融实验设计完备且包含详尽的延迟与鲁棒性度量]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,方法形式化推导清晰严密,实验分析切中痛点]
  • 价值: ⭐⭐⭐⭐☆ [为解决长视频多模态大模型在计算预算与关键时序信息捕捉间的矛盾提供了兼具理论优雅性与工程实用性的参考范例]