跳转至

Online Reasoning Video Object Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/KN1GHT9/ORVOSB
领域: 多模态VLM
关键词: 在线视频目标分割, 推理分割, 严格因果约束, 指代转移, 多模态大模型

一句话总结

针对传统推理视频目标分割依赖离线全局信息与未来帧回溯的缺陷,本文提出了在线推理视频目标分割任务(ORVOS)及基准 ORVOSB,并设计了结合连续更新分割提示与结构化时序令牌池的因果流式基线模型。

研究背景与动机

推理视频目标分割(Reasoning Video Object Segmentation, RVOS)旨在依据包含隐含逻辑、复杂属性或时序状态变化的自然语言查询,在连续视频序列中生成像素级目标掩码。近年来,多模态大语言模型(MLLM)被广泛引入该领域,通过将文本查询和视频帧映射为统一的特殊分割标记(如 <SEG>),显著提升了开放词表定位与复杂组合推理能力。然而,现有的 RVOS 算法与评测基准普遍建立在离线假设(offline regime)之上,即推理阶段模型可以任意访问整段视频的全部上下文。

这种离线范式存在两大致命缺陷:其一是「事后反向消除歧义」(retrospective disambiguation),模型会借助未来观察来逆向推导早先帧中的指代对象,例如当查询为“正在移动的车辆”时,离线模型往往在前半段车辆静止时就提前为其打上掩码;其二是脱离真实在线物理系统,具身智能体、自主机器人以及边缘端实时视频分析等真实场景严格要求因果推断,视频帧只能按时间流式到达,模型必须在无未来信息的前提下做出逐帧决策,且过往预测不可事后撤销重写。此外,现实动态事件常引发「指代转移」(referent shifts),即随着动作发生或状态演化,符合文本语义的目标实体本身会在不同时间段发生切换或出现非连续出现的情况。

现有基准均假设指代目标在整段视频中恒定不变,无法量化在线决策与目标转移的鲁棒性;而主流 MLLM 分割架构多采用“先关键帧推理后跟踪传播”或“全局视频令牌池化”策略,缺乏在严格因果约束下积累并更新历史消除歧义线索的时序记忆机制。核心 idea:本文构建了包含严格时序因果边界与指代转移标注的专用基准 ORVOSB,并提出一种在线推理基线,通过滑动窗口与历史聚合维护持续更新的自适应分割提示,并配合非线性时间弯折的结构化令牌池实现有界计算下的长程因果推理。

方法详解

整体框架

在线推理视频目标分割(ORVOS)要求模型在 \(t\) 时刻仅利用历史与当前视频帧序列 \(V_{\le t} = \{I_1, \dots, I_t\}\) 以及固定文本查询 \(q\),逐帧预测目标掩码 \(M_t \in \{0, 1\}^{H \times W}\),且严格禁止依赖任何 \(t' > t\) 的未来信息。为此,本文提出了一套端到端的因果流式多模态推理框架。

在每个时间步 \(t\),系统将输入组织为当前帧 \(I_t\)、包含 \(K\) 帧的局部滑动上下文窗口 \(I_{t-K:t-1}\)、从结构化令牌池中提取的历史聚合记忆令牌 \(M_{t-1}\) 以及文本指令。MLLM 统一对其进行自回归编码,利用预设的占位符提取当前目标令牌和上下文分割特征,再经由亲和力自适应融合生成演进的目标提示;随后将该提示投影至掩码解码器输出像素掩码,最后将当前语义特征写回令牌池,以便在后续时间步通过非线性密集到稀疏采样维持有界的长程记忆。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["流式输入<br/>当前帧 + 上下文窗口 + 文本查询"] --> B["连续更新分割提示<br/>多模态编码与自适应亲和力融合"]
    C["结构化时序令牌池<br/>密集到稀疏非线性保留与查询聚合"] -->|输入记忆令牌| B
    B --> D["提示引导掩码解码<br/>多尺度视觉特征交互与掩码生成"]
    B -->|写回当前融合令牌| C
    D --> E["输出逐帧因果掩码"]

关键设计

1. 连续更新分割提示:兼顾局部动态与语义自适应融合的演进查询

在流式输入场景下,固定的静态文本嵌入无法应对目标实体的动态转移与状态演化,而直接使用孤立的单帧特征又容易因局部遮挡或动作瞬态丢失语义连贯性。针对这一矛盾,模型在时间步 \(t\) 构建多模态输入序列: $\(\mathbf{X}_t = [\mathbf{T}_{\mathrm{inst}}; \mathbf{T}_q; \mathbf{T}_{\mathrm{vis}}; \mathbf{T}_{\mathrm{mem}}]\)$ 其中在指令模板的特定位置设置 <TGT><SEG> 占位符作为结构化锚点。MLLM 自回归编码后,从 <TGT> 位置提取当前帧的目标感知特征 \(\mathbf{g}_t \in \mathbb{R}^d\),从 \(K\)<SEG> 位置提取滑动上下文的分割特征 \(\{\mathbf{s}_{t-i}\}_{i=1}^K\)。为自适应滤除历史窗口中的无关扰动,模型计算余弦相似度亲和力权重: $\(u_i = \cos(\mathbf{s}_{t-i}, \mathbf{g}_t), \quad \alpha_i = \frac{\exp(u_i)}{\sum_{j=1}^K \exp(u_j)}\)$ 并以残差方式将上下文加权注入当前目标令牌: $\(\tilde{\mathbf{g}}_t = \mathbf{g}_t + \lambda \sum_{i=1}^K \alpha_i \mathbf{s}_{t-i}\)$ 超参数 \(\lambda\) 设定为 0.1。该机制让分割提示能够随新出现的观测动态吸收最近的有效上下文证据,在目标切换发生时迅速调整语义表征,同时平滑单帧噪声。

2. 结构化时序令牌池:基于非线性时间弯折与查询聚合的有界长程记忆

在线推理面临算力与长序记忆的内在冲突:保留完整历史令牌会导致显存与计算开销随视频长度线性发散,而简单截断滑动窗口则会彻底遗忘远期关键事件,使模型无法处理因果指代(如“先前被放置的物品”)和非连续目标出现。为此,模型维护了一个全局令牌池 \(\mathcal{B}_{t-1} = \{\tilde{\mathbf{g}}_1, \dots, \tilde{\mathbf{g}}_{t-1}\}\),并采用密集到稀疏(Dense-to-Sparse, D2S)的非线性保留策略。当历史长度超过上限 \(N_{\max}=32\) 时,利用非线性时间弯折函数对时间轴建立二次采样网格: $\(\phi(u) = 1 - (1 - u)^2, \quad t_k = \lfloor \phi(u)(n - 1) \rfloor + 1 \quad \left(u = \frac{k}{N_{\max} - 1}\right)\)$ 该映射赋予近距离时间步密集的采样间隔以捕获精细运动状态,同时对久远的时间步进行指数级稀疏采样以保留长程语义骨架。针对采样后的令牌序列 \(\mathbf{H}_{t-1}\),引入 \(L=32\) 个可学习记忆查询令牌 \(\mathbf{Q}\) 与正弦位置编码,通过轻量级 2 层 8 头 Transformer 编码器执行交互聚合: $\(\mathbf{M}_{t-1} = \mathrm{Agg}([\mathbf{Q}; \mathbf{H}_{t-1} + \mathbf{P}])_{1:L}\)$ 紧凑的记忆令牌 \(\mathbf{M}_{t-1}\) 作为外部记忆 \(\mathbf{T}_{\mathrm{mem}}\) 重新注入 MLLM,在保证常数级计算复杂度的前提下实现了跨越数百帧的因果上下文回溯。

3. 提示引导掩码解码:将演化语义注入视觉特征的逐帧因果掩码生成

获取到融合历史与局部的目标提示 \(\tilde{\mathbf{g}}_t\) 后,系统必须将其精确转换为当前帧的高分辨率像素级掩码。该模块利用轻量级多层感知机(MLP)将提示投影到掩码解码器的嵌入空间得到条件向量 \(\mathbf{z}_t\)。视觉骨干网络独立抽取当前帧 \(I_t\) 的多尺度视觉特征 \(\mathbf{F}_t\),并输入 SAM-2 掩码解码器: $\(M_t = \mathcal{D}(\mathbf{F}_t, \mathbf{z}_t)\)$ 由于解码器完全在单帧视觉特征与自适应提示之间进行跨模态交互,整个推断链条杜绝了任何后续帧的特征回流。当视频发生指代切换或目标暂时失去指代资格时,提示向量 \(\mathbf{z}_t\) 的响应会自动偏移或弱化,使得解码器输出全零背景或转移至新出现的合法目标,从而在像素层面严格忠实于时序因果准则。

损失函数 / 训练策略

模型在时间轴上展开(unroll)进行端到端流式训练。在时间步 \(t\),联合优化自回归文本生成的交叉熵损失以及掩码预测的二元交叉熵损失与软 Dice 损失: $\(\mathcal{L}_t = \mathcal{L}_{\mathrm{CE}}(Y_t, \hat{Y}_t) + \lambda_{\mathrm{bce}} \mathcal{L}_{\mathrm{BCE}}(M_t, \hat{M}_t) + \lambda_{\mathrm{dice}} \mathcal{L}_{\mathrm{DICE}}(M_t, \hat{M}_t)\)$ 训练损失权重设定为 \(\lambda_{\mathrm{bce}} = 2.0\)\(\lambda_{\mathrm{dice}} = 0.5\)。以 Chat-UniVi-7B-v1.5 作为 MLLM 基座,冻结主干权重并插入 rank-8 LoRA 模块,与 SAM-2 解码器、提示投影 MLP 和令牌池聚合编码器联合优化。采用 AdamW 优化器,学习率设为 \(3 \times 10^{-4}\),滑动窗口大小 \(K=4\)。在 8 张 RTX 4090 GPU 上利用 DeepSpeed 进行 9,000 次迭代训练,单卡批大小为 1,梯度累积 16 步(有效批大小 128)。

实验关键数据

主实验

论文提出的 ORVOSB 包含 210 个视频序列、12,907 个标注帧和 512 个涵盖属性、空间关系、动作/状态变化、交互以及外部知识五大类别的推理评测样本。下表展示了主流方法在严格因果在线协议下的评测结果,评价指标为区域相似度 \(\mathcal{J}\)、轮廓准确率 \(\mathcal{F}\) 及其均值 \(\mathcal{J}\&\mathcal{F}\)

方法 类型 属性 \(\mathcal{J}\&\mathcal{F}\) 空间 \(\mathcal{J}\&\mathcal{F}\) 动作 \(\mathcal{J}\&\mathcal{F}\) 交互 \(\mathcal{J}\&\mathcal{F}\) 知识 \(\mathcal{J}\&\mathcal{F}\) 整体 \(\mathcal{J}\) 整体 \(\mathcal{F}\) 整体 \(\mathcal{J}\&\mathcal{F}\)
VISA 视频模型 41.6% 31.0% 40.3% 27.5% 39.1% 30.8% 35.7% 33.3%
UniPixel 视频模型 35.5% 33.2% 47.7% 27.7% 57.4% 33.5% 38.7% 36.1%
VRS-HQ 视频模型 44.4% 44.3% 41.8% 35.8% 43.7% 40.4% 46.4% 43.4%
GLUS 视频模型 43.0% 45.8% 47.0% 32.9% 51.1% 42.7% 47.7% 45.2%
LISA 图像模型 53.6% 46.4% 47.7% 35.1% 49.5% 44.7% 48.4% 46.6%
VideoLISA 视频模型 53.2% 52.1% 46.1% 34.0% 55.0% 47.5% 53.1% 50.3%
READ 图像模型 56.2% 52.4% 50.7% 38.6% 48.9% 49.8% 53.2% 51.5%
本文方法 视频模型 63.8% 64.9% 52.4% 40.0% 62.0% 58.3% 64.2% 61.3%

消融实验

在离线基准 ReVOS 与在线基准 ORVOSB 上对各模块进行的消融分析如下表所示。CUSP 代表连续更新分割提示,AGAF 为亲和力引导自适应融合,TR 代表令牌池,US 为均匀采样,D2S 代表密集到稀疏采样。

配置 ReVOS \(\mathcal{J}\) ReVOS \(\mathcal{F}\) ReVOS \(\mathcal{J}\&\mathcal{F}\) ORVOSB \(\mathcal{J}\) ORVOSB \(\mathcal{F}\) ORVOSB \(\mathcal{J}\&\mathcal{F}\) 说明
基线模型 (Baseline) 49.5% 54.5% 52.0% 49.2% 55.6% 52.4% 仅采用当前帧目标令牌预测
+ CUSP (无 AGAF) 50.5% 55.4% 53.0% 51.8% 58.3% 55.1% 引入滑动上下文均值融合
+ CUSP (含 AGAF) 51.3% 56.1% 53.7% 55.0% 61.3% 58.1% 加入自适应亲和力加权 (+3.0%)
+ CUSP + TR (US) 51.8% 56.4% 54.1% 58.0% 63.9% 60.9% 增加均匀采样令牌池 (+2.8%)
+ CUSP + TR (D2S) 52.0% 56.6% 54.3% 58.3% 64.2% 61.3% 采用密集到稀疏二次弯折 (+0.4%)

关键发现

  • 离线视频 SOTA 在严格因果在线设置下严重退化:依赖“关键帧分割+跟踪传播”范式的代表模型(如 VISA 仅 33.3%、VRS-HQ 仅 43.4%)在 ORVOSB 上表现极差,甚至大幅落后于逐帧独立运行的图像推理模型 READ(51.5%)。核心原因在于此类模型一旦在早期将静态目标认死,后续发生指代转移或动作状态改变时,跟踪器会盲目传递错误掩码,无法实现因果再定位。
  • 动态提示更新对在线推理至关重要:引入 CUSP 使 ORVOSB 性能从 52.4% 跃升至 58.1%(提升 5.7 个百分点),证明在流式场景下,自适应吸收短程时序线索能够有效抑制单帧歧义并快速响应目标转移。
  • 非线性记忆保留在有界开销下实现最佳长程增益:相比简单截断历史,引入令牌池使 \(\mathcal{J}\&\mathcal{F}\) 进一步提升至 60.9% 以上。而采用二次时间弯折 \(\phi(u) = 1 - (1-u)^2\) 的 D2S 采样比均匀采样高出 0.4%,表明对近期状态细致追踪、对远期线索稀疏概括的非均匀分配更符合流式视觉认知的客观规律。
  • 常态通用基准上的泛化能力:在静态离线数据集 ReVOS 上,本文模型在纯因果单向推理的前提下依然取得了 54.3% 的 \(\mathcal{J}\&\mathcal{F}\),与具有双向全局注意力的离线模型 GLUS(54.8%)表现相当,证明所提在线记忆架构具备稳健的时序证据积累能力。

亮点与洞察

  • 重新定义了因果视频分割评估边界:首次在 RVOS 领域明确了“严格因果约束”和“指代转移”两大约束,揭示了过往离线模型利用未来信息作弊的假象,为机器人与具身交互场景建立了真实的评测基准。
  • 二次时间弯折的时序令牌池设计极其轻量巧妙:利用解析映射 \(\phi(u)=1-(1-u)^2\) 无缝兼顾了近程高频动态捕捉与远期关键语义回溯,以固定数量(32个)令牌约束了无限流式视频带来的计算爆炸。
  • 单帧与序列优势互补的模块化解耦:将 MLLM 的高层因果推理能力与 SAM-2 的低层空间掩码解码解耦,通过可动态演进的提示向量完成跨模态桥接,具有优异的模块复用潜力。

局限与展望

  • 作者承认的局限:受限于多模态大模型的自回归推理延迟与 SAM-2 解码开销,当前系统在边缘端计算受限设备上尚难以直接达到超高帧率(如 30+ FPS)实时吞吐。
  • 推断场景与复杂交互的挑战:在涉及极其细微或多主体快速交替交互的场景下,仅保留 32 个历史令牌和 4 帧滑动窗口仍可能出现瞬态语义混淆,导致短暂的掩码跳变。
  • 改进方向:可进一步探索在线 KV Cache 压缩剪枝与基于置信度门控的主动记忆写入机制,减少无效时序步骤的冗余计算并提升流式推理帧率。

相关工作与启发

  • vs VISA / VRS-HQ: 现有工作依赖离线整段视频,采用关键帧分割后结合跟踪器向前/向后双向传播掩码,无法处理事件展开过程中的指代切换;本文坚持严格因果单向推断,通过动态提示更新实时纠偏。
  • vs VideoLISA / GLUS: VideoLISA 和 GLUS 虽然提升了多帧时空交互能力,但其分割提示在整段视频中倾向于全局静态共享;本文通过 CUSP 和 TR 构建了逐帧演进的时序记忆通道,显著提升了在线动态适应性。
  • vs StreamingVLM / VideoLLM-Online: 现有时序流式 MLLM 主要聚焦在文本级连续问答与对话理解,缺乏像素级的致密空间对齐与时空一致性约束;本文将流式因果推理推进到了密集掩码预测粒度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性形式化在线因果 RVOS 任务,提出指代转移基准与密集-稀疏令牌池架构。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 大推理类别、跨越 12,907 标注帧,对比了离线与在线主流方案及详尽消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义清晰严谨,数学形式化表达规范,图表呈现详实。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能、移动机器人和实时边缘视频分析中的因果交互分割奠定了重要基石。