跳转至

MiNQVIS: Mitigating Noisy Queries for Robust Online Video Instance Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://nothing898.github.io/MiNQVIS
领域: 语义分割
关键词: 视频实例分割, 在线跟踪, 噪声查询, 原型对比学习, 双记忆关联

一句话总结

针对现实复杂视频中遮挡、模糊与背景杂波引发的噪声查询污染问题,MiNQVIS 提出查询级门控、视频级原型对比学习与双记忆融合关联,系统性消除错误检测对表征监督和在线时序关联的漂移与退化。

研究背景与动机

视频实例分割(VIS)要求模型在视频流中同时实现像素级实例定位、分割与跨帧身份关联。由于现实场景对因果性和实时响应的高要求,在线 VIS 仅依赖当前与历史帧展开因果推理,成为自动驾驶、混合现实和具身智能系统的核心感知基础。随着以 Mask2Former 为代表的 Transformer 架构兴起,主流在线方法如 IDOL、CTVIS、CAVIS 与 VISAGE 等,普遍采用可学习实例查询(queries)联合承载单帧检测与跨帧时序关联,并通过对比学习或动量记忆增强身份连续性。

然而,这些方法依赖一个关键假设:模型每帧预测出的实例查询能够提供可靠的视觉特征,以支撑跨帧相似度匹配与对比损失监督。在真实视频中,严重的物体遮挡、快速运动模糊、背景杂波及多目标相互重叠等极端工况频繁发生,导致该假设彻底失效。由此产生的噪声查询(包括误检假阳性、漏检碎片、边界粗糙的低质量预测)直接带来三重连锁反应:第一,退化嵌入特征扭曲了基于余弦相似度的跨帧匹配,造成频繁的身份跳变与轨迹断裂;第二,被污染的查询进入对比学习的正负样本对构建,向网络注入矛盾错误的梯度监督;第三,在依赖指数移动平均的动量跟踪记忆中,短期受损的特征被强制写入记忆库,导致误差随时间持续累积而发生不可逆的长程漂移。

以往工作主要聚焦于提升模型架构容量或设计更复杂的上下文交互模块,却从未正视过噪声查询污染这一根源瓶颈。本文的切入视角在于,稳健的在线跟踪不应单纯依赖单帧特征预测,而必须在时序信息流中显式建模并抑制查询噪声。核心 idea:构建首个噪声感知的在线视频实例分割框架 MiNQVIS,在输入端通过置信度与范数双重门控剔除低质查询,在训练端通过跨帧可靠匹配构建视频级原型进行对比监督,在推理端引入动量更新与历史最佳检索协同的双记忆融合,实现全流程防漂移在线跟踪。

方法详解

整体框架

MiNQVIS 沿用基于 Mask2Former 的在线视频实例分割范式。输入视频帧序列经骨干网络与 Transformer 解码器后,每帧生成固定数量的实例查询、分类预测与对应分割掩码。在此基础上,MiNQVIS 引入三个互补模块串联于全流程中:首先,在训练和推理两端统一执行「查询级门控」,基于分类置信度阈值和 \(\ell_2\) 范数归一化过滤低质与背景查询;其次,在训练阶段构建「视频级原型对比学习(VPCL)」,仅聚合门控后的可靠跨帧匹配特征生成视频级稳定原型,引导无温度超参的鲁棒对比监督;最后,在推理阶段采用「双记忆融合关联」,将捕获短期连续性的动量嵌入与保留历史最优特征的历史最佳记忆通过双向 Softmax 校准后加权融合,完成稳健的在线身份分配。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单帧视频输入 It<br/>Mask2Former 提取每帧 queries 与嵌入"] --> B["查询级门控<br/>置信度门控过滤不可靠预测 + L2 范数解耦归一化"]
    B -->|训练阶段| C["视频级原型对比学习 (VPCL)<br/>汇聚可靠跨帧嵌入生成视频级原型 + 对比损失监督"]
    B -->|推理阶段| D["双记忆融合关联<br/>动量嵌入与历史最佳检索结合 + 双向 Softmax 校准匹配"]
    C --> E["联合优化:分割损失 + 门控铰链损失 + 原型对比损失"]
    D --> F["在线输出稳定轨迹与高保真时序掩码"]

关键设计

1. 查询级门控:置信度引导与范数解耦过滤不可靠预测

在线 VIS 模型每帧产生大量冗余查询,在遮挡、模糊场景下充斥着背景混淆与破碎掩码。传统目标检测中的置信度阈值通常仅作用于后处理阶段,无法阻止噪声查询渗透进对比学习与时序记忆。此外,早期方法依赖未归一化的内积相似度,往往通过网络权重隐式缩小特征模长来抑制背景,使得匹配分数极易受特征模长波动干扰。针对该痛点,本文在训练和推理中统一引入轻量级查询级门控机制。

该设计首先从查询的分类输出 \(\mathbf{z}_{t,j} \in \mathbb{R}^{C+1}\)(第 \(C+1\) 维为背景类)提取前背景概率:\(p^j_{t,\text{bg}} = \text{softmax}(\mathbf{z}_{t,j})_{C+1}\)\(p^j_{t,\text{fg}} = 1 - p^j_{t,\text{bg}}\)。系统仅保留满足 \(p^j_{t,\text{fg}} > \gamma\) 的高置信度查询,直接切断低质候选向对比损失与在线匹配模块的信息传递。为了强化前景与背景特征在置信度空间的裕度,模型引入对数域铰链正则损失 \(\mathcal{L}_{\text{gate}}\):对匈牙利匹配确定的前景正样本集 \(\mathcal{S}^+\),要求其概率高于设定边界 \(p^\star_{\text{fg}} = \gamma + \mu\);对未匹配的背景负样本集 \(\mathcal{S}^-\),要求背景概率高于 \(p^\star_{\text{bg}} = 1 - \gamma + \mu\)(其中 \(\mu = 0.1\gamma\) 为预设裕度): $$ \mathcal{L}{\text{gate}} = \frac{1}{|\mathcal{S}^+|} \sum + \epsilon) \right]}^+} \left[ p^\star_{\text{fg}} - \log(p^j_{t,\text{fg}+ + \frac{1}{|\mathcal{S}^-|} \sum + \epsilon) \right]_+ $$ 随后,所有保留查询的特征向量 }^-} \left[ p^\star_{\text{bg}} - \log(p^j_{t,\text{bg}\(\mathbf{e}_t^j\) 均经过显式 \(\ell_2\) 范数归一化 \(\hat{\mathbf{e}}_t^j = \frac{\mathbf{e}_t^j}{\|\mathbf{e}_t^j\|_2 + \epsilon}\),彻底将相似度判定从特征模长中解耦,为下游模块提供尺度恒定的单位球特征空间。

2. 视频级原型对比学习(VPCL):跨帧可靠汇聚构建鲁棒表征

传统 VIS 采用的单帧级对比学习通常将当前帧的匹配查询与相邻帧对应查询组成正样本对。但在重度遮挡或剧烈运动帧中,单帧嵌入严重畸变甚至丢失语义信息,将其强行作为拉近的目标会导致表征学习严重退化。本文提出的视频级原型对比学习(VPCL)利用训练视频切片(clip)内的时间冗余性,通过时间维度特征汇聚抹平偶然帧的畸变扰动。

对于每个真值实例 \(k\),模型仅收集经过门控筛选且在匈牙利匹配中命中的可靠跨帧嵌入集合 \(\mathcal{E}_k = \{\hat{\mathbf{e}}_{t,j(t,k)}\}\),对其求算术平均并归一化,得到代表该实例在当前视频切片中的全局稳定表征——视频级原型 \(\hat{\mathbf{p}}_k\): $$ \hat{\mathbf{p}}k = \frac{\mathbf{p}_k}{|\mathbf{p}_k|_2}, \qquad \mathbf{p}_k = \frac{1}{|\mathcal{E}_k|} \sum}} \in \mathcal{Ek} \hat{\mathbf{e}} $$ 在构建对比监督时,单帧匹配特征 \(\hat{\mathbf{e}}_{t,j(t,k)}\) 作为锚点,以对应的视频原型 \(\hat{\mathbf{p}}_k\) 作为唯一的正样本,负样本集则联合纳入前一帧高置信度前景嵌入与当前视频切片内其他所有实例的原型向量。由于输入特征均已位于单位超球面,余弦相似度天然有界,对比损失可直接建立而无需额外的温度超参数 \(\tau\): $$ \mathcal{L}_k) \right) \right] $$ 该设计确保了梯度更新方向始终锚定在时序统计一致的中心表征上,有效阻断了瞬态畸变对特征判别性的侵蚀。}} = \log \left[ 1 + \sum_{e^- \in \mathcal{N}_{t,k}} \exp\left( \text{sim}(\hat{\mathbf{e}}, e^-) - \text{sim}(\hat{\mathbf{e}}, \hat{\mathbf{p}

3. 双记忆融合在线关联:动量更新与历史最佳检索协同防漂移

在因果在线推理中,现有方法普遍采用基于动量衰减的单轨记忆维护轨迹特征。当目标遭遇连续多帧的严重遮挡或光照剧变时,动量记忆会在数帧内被退化噪声连续覆盖,造成不可逆的「跟踪漂移(drift)」并在目标重现后永久丢失身份。为攻克这一长程一致性瓶颈,本文构建了动量记忆与历史最佳检索协同工作的双记忆体系。

对于每一条存活轨迹 \(k\),系统同时维护捕获短期平滑外观演化的动量向量 \(\mathbf{m}_k\)(通过 EMA 机制更新并重新归一化)以及一个历史优质特征缓存库 \(\mathcal{R}_k = \{\mathbf{r}_{k,1}, \dots, \mathbf{r}_{k,N_k}\}\)。对于当前帧候选查询 \(\hat{\mathbf{e}}_{t,q}\),分别计算其与动量特征的连续性得分 \(s^{\text{mom}}_t(q,k) = \langle \hat{\mathbf{e}}_{t,q}, \hat{\mathbf{m}}_k \rangle\),以及在历史缓存库中执行近邻检索的最大召回相似度 \(s^{\text{best}}_t(q,k) = \max_{\mathbf{r} \in \mathcal{R}_k} \langle \hat{\mathbf{e}}_{t,q}, \hat{\mathbf{r}} \rangle\)。为解决跨候选查询与跨轨迹间余弦打分尺度不平衡的问题,模型对两路相似度矩阵分别执行查询到轨迹(\(q \to k\))和轨迹到查询(\(k \to q\))的双向 Softmax 归一化: $$ f^u_t(q,k) = \frac{1}{2} \left( \frac{\exp(s^u_t(q,k))}{\sum_{k'} \exp(s^u_t(q,k'))} + \frac{\exp(s^u_t(q,k))}{\sum_{q'} \exp(s^u_t(q',k))} \right), \quad u \in {\text{mom}, \text{best}} $$ 最后,系统以等权凸组合融合两路校准分数 \(S_t(q,k) = 0.5 f^{\text{best}}_t(q,k) + 0.5 f^{\text{mom}}_t(q,k)\),并在满足阈值 \(\delta = 0.3\) 的前提下完成全局一对一匈牙利匹配。历史最佳匹配在目标脱离遮挡后能够提供强力锚定,而动量分支则确保常态下的平滑过渡,二者互补彻底消除了单向漂移。

损失函数 / 训练策略

MiNQVIS 的多任务端到端联合训练目标由基础分割损失 \(\mathcal{L}_{\text{seg}}\)、门控正则化损失 \(\mathcal{L}_{\text{gate}}\) 以及原型对比损失 \(\mathcal{L}_{\text{vpcl}}\) 共同构成: $$ \mathcal{L}{\text{total}} = \mathcal{L}}} + \lambda_{\text{gate}} \mathcal{L{\text{gate}} + \lambda}} \mathcal{L{\text{vpcl}} $$ 其中,基础分割损失包含常规的分类损失 \(\mathcal{L}_{\text{cls}}\)、二元交叉熵掩码损失 \(\mathcal{L}_{\text{ce}}\) 和 Dice 掩码损失 \(\mathcal{L}_{\text{dice}}\): $$ \mathcal{L}}} = \lambda_{\text{cls}} \mathcal{L{\text{cls}} + \lambda}} \mathcal{L{\text{ce}} + \lambda $$ 超参数配置严格遵循行业规范:各项损失权重分别设为 }} \mathcal{L}_{\text{dice}\(\lambda_{\text{gate}}=5.0\)\(\lambda_{\text{vpcl}}=2.0\)\(\lambda_{\text{cls}}=2.0\)\(\lambda_{\text{ce}}=5.0\)\(\lambda_{\text{dice}}=5.0\)。门控阈值在 YouTubeVIS 2019/2021 上取 \(\gamma=0.1\)\(\mu=0.01\)),而在遮挡更为稠密的 OVIS 上取 \(\gamma=0.05\)\(\mu=0.005\))。模型在 COCO 预训练权重基础上采用 COCO 联合训练策略(CJT),训练阶段 YouTubeVIS 视频切片长度取 8 帧,OVIS 取 10 帧,批大小为 16,共优化 16,000 次迭代。

实验关键数据

主实验

在主流视频实例分割基准 YouTube-VIS 2019、YouTube-VIS 2021 以及以重度遮挡著称的 OVIS 数据集上,采用 ResNet-50 和 Swin-Large 两种骨干网络全面评估 MiNQVIS 与前沿在线/近在线方法的性能对比:

数据集 骨干网络 指标 本文 (MiNQVIS) 之前 SOTA (CAVIS) 提升
YTVIS 2019 ResNet-50 AP 55.6 55.7 -0.1
YTVIS 2019 ResNet-50 AP50 78.5 78.3 +0.2
YTVIS 2019 Swin-L AP 66.2 66.0 +0.2
YTVIS 2019 Swin-L AP75 73.8 73.3 +0.5
YTVIS 2021 ResNet-50 AP 51.7 50.5 +1.2
YTVIS 2021 ResNet-50 AP75 56.6 54.9 +1.7
YTVIS 2021 Swin-L AP 61.6 61.1 +0.5
OVIS ResNet-50 AP 38.2 37.6 +0.6
OVIS ResNet-50 AR10 45.4 43.5 +1.9
OVIS Swin-L AP 49.1 48.6 +0.5
OVIS Swin-L AP75 52.6 52.5 +0.1
OVIS Swin-L AR10 53.9 53.3 +0.6

注:在重度遮挡数据集 OVIS 上,相较于此前代表性方法 CTVIS(35.5 AP, ResNet-50)和 IDOL(28.2 AP, ResNet-50),MiNQVIS 分别取得了 +2.7 AP 和 +10.0 AP 的大幅领先。

消融实验

1. 三大核心模块贡献消融(基线为关闭噪声注入的 CTVIS):

查询级门控 VPCL 原型对比 双记忆融合 YTVIS21 AP OVIS AP 说明
- - - 47.5 34.7 基准在线模型
- - 49.8 35.9 门控过滤不可靠查询(单模块提升最显著)
- - 48.7 36.3 视频级原型消除单帧畸变干扰
- - 48.1 35.5 双记忆增强跨长程时序关联稳定性
- 51.4 37.8 门控与原型对比强强协同,净化特征空间
51.7 38.2 完整模型:全流程噪声感知,达到最佳效果

2. 门控机制在训练与推理阶段的作用机制消融

评估配置 YTVIS21 AP OVIS AP 说明
仅训练应用门控 (Training-only) 39.6 25.2 训练/测试严重失配,推理充斥未过滤噪声致崩盘
仅推理应用门控 (Inference-only) 48.3 34.3 单纯后处理过滤带来轻微增益,但缺乏特征层正则
训练与推理协同应用 (Training + Inference) 51.7 38.2 保证训练与推理分布严格一致,发挥最大增益

3. 轨迹跟踪记忆模式对比

跟踪记忆配置 YTVIS21 AP OVIS AP 说明
纯动量记忆 (Momentum memory) 51.4 37.8 具备短程平滑性,但长期遮挡后易积累漂移
纯历史最佳检索 (History-best memory) 51.1 36.1 具备回溯能力,但对剧烈外观演化欠缺自适应
双记忆融合 (Dual-memory fusion) 51.7 38.2 短期自适应与长期历史锚定互补,效果最佳

关键发现

  • 查询级门控是性能飞跃的第一引擎:单模块消融显示,仅加入查询级门控便在 YTVIS21 上产生 +2.3 AP 的跃升;更关键的是,门控必须在训练和测试两端同时启用,若仅在训练期加入门控而测试期直接使用所有查询,由于测试阶段未过滤的噪声查询大幅涌入匹配阶段,导致匹配严重紊乱,在 OVIS 上 AP 剧烈暴跌 13.0 个点(25.2 vs 38.2)。
  • 门控阈值的场景敏感性:实验分析证实,YTVIS21 场景较为规整,最佳阈值为 \(\gamma=0.10\)(51.7 AP);而在高度拥挤、重叠严重的 OVIS 数据集上,较宽松的 \(\gamma=0.05\) 取得最佳表现(38.2 AP),表明极端遮挡下过高的门控阈值可能会误剔除弱可见度正样本,保留适度候选更有利于长轨迹召回。
  • 双记忆融合显著提升高遮挡鲁棒性:在 OVIS 上,双记忆相比单动量提升 +0.4 AP,相比单历史最佳提升 +2.1 AP,且整体召回率 AR10 从 43.5 提升至 45.4,充分证明历史最佳检索在解决目标长时间消失后重新出现时的身份重连上发挥了不可替代的作用。

亮点与洞察

  • 切中在线 VIS 隐疾的「噪声感知」新范式:以往工作大多假定检测 queries 天生可靠,将精力投向网络容量与注意力机制;本文首次明确揭示了遮挡与背景混淆所带来的查询噪声对对比监督和在线记忆的破坏机理,从「表征净化」这一全新视角破局。
  • 解耦特征模长的无超参对比设计:通过强制 \(\ell_2\) 归一化彻底解耦模长与语义,不仅根除了通过缩减范数压制背景的不稳定弊病,还巧妙免去了繁琐的温度系数超参搜索,使原型对比学习在有界空间内天然收敛。
  • 可复用的双向 Softmax 分数校准机制:在目标跟踪与关联匹配中,不同目标与轨迹的相似度基数往往存在系统偏差;通过对相似度矩阵双向执行 query-to-track 与 track-to-query 的 Softmax 归一化,能极大抑制「赢者通吃」的虚假强匹配,该 trick 对通用目标关联任务具备直接迁移价值。

局限与展望

  • 极端运动与剧烈姿态形变下的身份混淆:作者在可视化分析中指出,当同类物体发生剧烈姿态畸变、高速相对位移或严重空间交织时,外观表征判别力骤降,模型仍可能发生局部身份互换或轨迹断裂。
  • 对空间运动几何先验的挖掘尚浅:当前关联匹配主要依赖外观特征相似度与双记忆匹配,未充分融合卡尔曼滤波、光流场或空间运动轨迹平滑性等几何动力学先验,在外观高度模糊时缺乏备用几何约束。
  • 未来改进方向:可进一步探索结合时间步动态自适应门控阈值(根据场景杂波度动态调整 \(\gamma\)),并在双记忆关联中融入运动几何与 3D 轨迹预测机制,增强抗剧烈形变跟踪能力。

相关工作与启发

  • vs CTVIS [ICCV 2023]: CTVIS 通过在训练中向动量记忆手动注入高斯噪声来模拟推理误差;而 MiNQVIS 则从源头出发,通过前背景置信度与铰链损失在训练推理两端直接过滤真实噪声 queries,并利用视频级原型对比替代易受损的帧间对比,从根本上消除了噪声源。
  • vs CAVIS [ICCV 2025]: CAVIS 引入上下文感知匹配和原型对比,但仍假设单帧 query 具备足够置信度,且采用单轨动量更新;MiNQVIS 进一步揭示了单轨动量在连续遮挡下的累积漂移问题,通过创新的「动量 + 历史最佳」双记忆与双向 Softmax 成功化解了这一顽疾。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次系统阐述并从门控、原型与双记忆三重视角解决在线 VIS 的噪声查询污染问题,设计自洽完整。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 YTVIS19/21 与 OVIS 三大基准,涵盖双骨干网络、精细的组件消融与敏感性分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰紧凑,问题定义精准,图表详实且消融逻辑严谨。
  • 价值: ⭐⭐⭐⭐☆ 为在线视频感知系统提供了即插即用的抗噪与防漂移解决思路,对多目标跟踪、具身视频感知具有广泛启发。