Selective Synergistic Learning for Video Object-Centric Learning¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/wjun0830/SSync
领域: 视频理解
关键词: 视频目标中心学习 / Slot Attention / 伪标签 / 选择性对齐 / 传递合并
一句话总结¶
针对视频槽位注意力中编码器注意力图边界锐利但多噪、解码器物体图语义平滑但边界模糊的归纳偏置不对称性,本文提出选择性协同学习(SSync),通过时空局部一致性筛选高置信边界与内部区域进行线性复杂度的非对称互蒸馏,并结合传递式伪标签合并彻底消除槽位过分割。
研究背景与动机¶
视频目标中心学习(Video Object-Centric Learning, VOCL)旨在以无监督或自监督方式将复杂动态场景分解为一组结构化、可解释的槽位(Slot)表征,支撑视频编辑、物体级推理和场景理解等下游任务。主流方案建立在槽位注意力(Slot Attention)编码器-解码器架构之上:编码器通过视觉骨干提取图像特征并聚类得到潜在槽位,解码器通过重构原始帧隐式渲染物体空间图。然而,这种以重构为驱动的框架存在根深蒂固的结构性失配——编码器借助高容量主干网络输出的空间注意力图对高频信息极其敏感,边界锐利但充斥着孤立噪声;而轻量 MLP 解码器引入了强烈的低频空间平滑先验,生成的物体掩码时空连贯但边缘严重弥散。
为了弥合两者的空间分歧,近期代表性工作(如 ICLR 2026 的 SRL)尝试通过时空全局对比学习进行密集对齐(Dense Alignment)。然而,密集对齐盲目假设所有时空 patch 均具有同等可靠的监督质量,在所有位置无差别强制两者一致,导致编码器的孤立噪声被反向注入解码器,解码器的模糊轮廓亦被传递给编码器,使得双分支的固有缺陷被相互放大。更严重的是,密集补丁对齐需要计算时空体积内所有 patch 对之间的相似度,带来高达 \(\mathcal{O}((T \cdot H \cdot W)^2)\) 的二次方内存与计算开销,在长序列和高分辨率视频上极易触发显存溢出(OOM)。
与其在全图进行无差别对齐,不如让各模块在其擅长的优势区域内各司其职。编码器的真正长处在于精细轮廓,解码器的真正长处在于内部区域的时空连贯性。核心 idea:提出选择性协同学习(SSync),仅在编码器可靠的边界区域用注意力图指导解码器、在解码器可靠的内部区域用物体图校准编码器,并借助传递式连通图聚类合并冗余槽位,以线性内存复杂度实现鲁棒的跨模块互补蒸馏。
方法详解¶
整体框架¶
SSync 的核心思想是建立在“可靠区域选择”基础上的轻量非对称互蒸馏框架。给定包含 \(T\) 帧的输入视频,每帧划分为 \(P = H \times W\) 个 patch。编码器为每个 patch 预测跨 \(S\) 个槽位的注意力图 \(\mathbf{A} \in \mathbb{R}^{T \times P \times S}\),解码器重构视频时输出归一化的物体图 \(\mathbf{D} \in \mathbb{R}^{T \times P \times S}\)。
整个流程由三个紧密配合的阶段组成:首先,利用时空邻域一致性分析,分别从 \(\mathbf{A}\) 提取可靠边界集合 \(\mathcal{P}_{\text{bd}}\),从 \(\mathbf{D}\) 提取平滑内部集合 \(\mathcal{P}_{\text{nbd}}\);其次,针对在线伪标签易受模型过分割诱导而分裂物体的问题,构建时空激活重叠图并计算连通分量,执行传递式伪标签合并;最后,在过滤后的可靠区域上,利用单向独热伪标签进行非对称均方误差(MSE)互蒸馏,使解码器学习清晰边界、编码器过滤内部噪声。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入视频帧序列<br/>$T \times H \times W$"] --> EncDec["编码器与解码器前向传播<br/>生成注意力图 $\mathbf{A}$ 与物体图 $\mathbf{D}$"]
EncDec --> D1["基于时空局部一致性的可靠区域选择<br/>从 $\mathbf{A}$ 提取边界,从 $\mathbf{D}$ 提取内部"]
D1 --> D2["传递式伪标签合并<br/>构建槽位重叠图并聚类消除过分割"]
D2 --> D3["非对称交叉互蒸馏<br/>互补伪标签单向监督与 MSE 损失优化"]
D3 --> Out["鲁棒解耦的视频物体槽位表征<br/>清晰边界与低噪声内部"]
关键设计¶
1. 基于时空局部一致性的可靠区域选择:按模块专长划分边界与内部
密集对齐失效的根源在于忽视了模块归纳偏置的空间异质性。为了只在可靠区域施加监督,SSync 先对概率图 \(\mathbf{A}\) 和 \(\mathbf{D}\) 取 \(\arg\max\) 获取硬分配伪标签 \(\hat{s}^{\mathbf{A}}_{t,p}\) 与 \(\hat{s}^{\mathbf{D}}_{t,p}\)。对任意时空位置 \((t, p)\),定义其时空邻域 \(\mathcal{N}(t, p)\) 为空间 8 邻域 \(\mathcal{N}_{\text{sp}}(p)\) 结合时间前后相邻帧同一位置 \(\{(t-1, p), (t+1, p)\}\)。通过统计邻域内类别相同与相异的 patch 数量:
边界区域应当体现物体轮廓转换但同时具备语义支撑,因此候选边界集合从具备锐利边缘的注意力图 \(\mathbf{A}\) 中提取:
其中 \(n_{\text{bd}}\) 控制边界敏感度,\(c^{=, \mathbf{A}}_{(t,p)} \ge 1\) 确保排除孤立随机噪点。内部平滑区域则从具备空间连贯性的解码器物体图 \(\mathbf{D}\) 中筛选:
该设计本质上构建了一种参数化的时空松弛形态学腐蚀操作,避免了传统腐蚀对噪声极度脆弱且缺乏时间感知的缺陷,精准锁定了双分支各自的优势区域。
2. 传递式伪标签合并:基于时空重叠图消除槽位冗余过分割
在自监督槽位学习中,重构损失往往倾向于促使多个槽位协同瓜分同一个大物体,导致严重的槽位过分割(Over-fragmentation)。若直接将模型自身的在线预测用作互蒸馏目标,这种语义分裂会被当作真实监督信号进行反向强化,造成错误累积与训练崩溃。为此,SSync 在实施对齐前引入传递式连通图机制以合并冗余槽位。
首先计算每个槽位在全时空范围内的激活均值 \(\mu_s = \frac{1}{TP}\sum_{t,p}\mathbf{A}_{t,p,s}\),通过阈值化得到二值活跃掩码 \(\mathbf{M}_{t,p,s} = \mathbb{I}[\mathbf{A}_{t,p,s} > \mu_s]\)。随后计算任意两槽位 \((s, s')\) 在时间维度平均的交并比(IoU):
构建无向冗余图 \(G = (V, E)\),当 \(\text{IoU}(s, s') > \tau_{\text{merge}}\) 时添加无向边。由于过分割往往呈现链式传递(如槽位 1 与 2 重叠,2 与 3 重叠),SSync 计算 \(G\) 的连通分量 \(\{C_1, \dots, C_m\}\),并在每个连通簇内选择时空占有面积最大的槽位作为代表身份:
通过重标定函数 \(\phi(s)\) 将连通簇内的所有槽位伪标签统一映射为代表槽位 \(s^*_k\)。基于合并后的伪标签重新计算局部一致性并更新 \(\mathcal{P}_{\text{bd}}\) 与 \(\mathcal{P}_{\text{nbd}}\),彻底阻断了过分割在蒸馏循环中的自激强化。
3. 非对称交叉互蒸馏:以线性复杂度实现边界细化与内部去噪
基于筛选出的互补可靠区域与合并后的整洁伪标签,SSync 建立非对称跨分支单向蒸馏。在边界集合 \(\mathcal{P}_{\text{bd}}\) 上,解码器 \(\mathbf{D}\) 接收来自编码器注意力伪标签 \(\hat{s}^{\mathbf{A}}_{t,p}\) 的独热监督,强迫模糊的解码器边界对齐编码器的锐利几何边缘;而在内部集合 \(\mathcal{P}_{\text{nbd}}\) 上,编码器 \(\mathbf{A}\) 接收来自解码器物体伪标签 \(\hat{s}^{\mathbf{D}}_{t,p}\) 的独热监督,强迫编码器消除内部散乱的孤立噪点:
不同于常规对比学习或交叉熵,SSync 采用均方误差(MSE)作为蒸馏目标。MSE 的梯度天然有界,能够有效抵抗早期训练中不完美伪标签引发的梯度震荡;同时其数值尺度与底层重构损失高度契合,无需繁复的动态调权。更重要的是,该单向蒸馏仅在所选 patch 上进行逐点回归,计算和内存开销与总 patch 数量呈严格线性关系 \(\mathcal{O}(T \cdot H \cdot W)\),彻底摆脱了密集对齐的二次方内存诅咒。
损失函数 / 训练策略¶
模型的整体训练目标由基础无监督槽位学习损失 \(\mathcal{L}_{\text{base}}\)(包含视频重构损失与时序槽位对比损失)和 SSync 蒸馏损失线性组合而成。为避免初期未收敛特征产生不可信伪标签,在前 30% 迭代周期内进行纯基础训练预热:
其中 \(\eta\) 为当前训练步数,\(\eta_t\) 为总迭代步数。超参数方面,默认固定 \(n_{\text{bd}} = n_{\text{nbd}} = 1\),\(\lambda_{\text{SSync}} = 1.0\),仅根据数据集场景物体密度微调合并阈值 \(\tau_{\text{merge}}\)(MOVi-C 设为 0.7,MOVi-E 设为 0.65,YouTube-VIS 设为 0.6)。
实验关键数据¶
主实验¶
在三个标准视频物体中心学习基准(MOVi-C、MOVi-E、YouTube-VIS 2021)上的主要对比结果如下(3 次独立运行平均值):
| 数据集 | 指标 | SSync (本文) | 次优方案 (SRL / SlotCurri) | 相比次优变化 |
|---|---|---|---|---|
| MOVi-C | FG-ARI ↑ mBO ↑ |
79.4 ± 0.6 39.5 ± 0.1 |
77.6 ± 0.9 (SlotCurri) 34.5 (SRL) |
+1.8 +5.0 |
| MOVi-E | FG-ARI ↑ mBO ↑ |
84.0 ± 0.9 34.8 ± 1.9 |
83.7 ± 0.2 (SlotCurri) 29.3 (SRL) |
+0.3 +5.5 |
| YouTube-VIS | FG-ARI ↑ mBO ↑ |
42.6 ± 0.2 38.7 ± 0.6 |
44.8 ± 1.2 (SlotCurri) 35.6 (SRL) |
-2.2 +3.1 |
在以大量微小物体为特征的 MOVi-E 和物体交互复杂的 MOVi-C 上,SSync 的平均最佳重叠率(mBO)均大幅提升 5 点以上,表明边界定位精度与整体物体完整度显著改善;在复杂真实世界视频数据集 YouTube-VIS 上,SSync 斩获最高 mBO(38.7)。
消融实验¶
在 MOVi-C 基准上对各组件贡献、槽位数量敏感度及显存占用进行深入消融与评估:
| 实验配置 | FG-ARI ↑ | mBO ↑ | 说明 |
|---|---|---|---|
| Baseline (无对齐监督) | 69.0 | 30.6 | 基础无监督时序槽位模型 |
| + 边界校准 (\(\mathcal{L}_{\text{bd}}\)) | 72.9 | 33.4 | 编码器边界监督解码器,轮廓明显收敛 (+3.9 / +2.8) |
| + 内部去噪 (\(\mathcal{L}_{\text{nbd}}\)) | 71.4 | 33.3 | 解码器内部先验校准编码器,压制散乱噪点 (+2.4 / +2.7) |
| + 双向选择性对齐 (\(\mathcal{L}_{\text{bd}} + \mathcal{L}_{\text{nbd}}\)) | 77.1 | 38.0 | 优势区域互补蒸馏,大幅拉开性能差 (+8.1 / +7.4) |
| + 传递式合并 Full SSync | 79.4 | 39.5 | 消除多槽位冗余过分割,达到最佳性能 (+10.4 / +8.9) |
显存占用对比(518×518 分辨率,FP16 混合精度,单个 RTX PRO 6000 97GB GPU 峰值显存,GB):
| 序列帧数 \(T\) | Batch Size = 32 (SRL / SSync) | Batch Size = 64 (SRL / SSync) | 显存与扩展性优势 |
|---|---|---|---|
| \(T = 4\) | 70 GB / 27 GB | OOM / 59 GB | 显存降低 ~61%,支持更大 batch |
| \(T = 6\) | OOM / 48 GB | OOM / 89 GB | SRL 显存爆炸,SSync 稳定运行 |
| \(T = 8\) | OOM / 60 GB | OOM / 93 GB | 线性复杂度支持长时序建模 |
关键发现¶
- 双向选择性对齐的强互补性:单独引入 \(\mathcal{L}_{\text{bd}}\) 或 \(\mathcal{L}_{\text{nbd}}\) 均能带来 2~4 点提升,但两者联用时 mBO 从 30.6 跃升至 38.0(净增 7.4 点),验证了边界细化与内部去噪之间存在强烈的正向协同飞轮效应。
- 对槽位超参数 \(S\) 的绝佳鲁棒性:当场景设定槽位数从 7 增加至 15 时,由于槽位容量严重过剩,SlotContrast 的 FG-ARI 从 74.9 断崖式下跌至 61.8,SRL 从 76.5 下滑至 72.8;而拥有传递式合并机制的 SSync 仍旧稳定保持在 78.8 FG-ARI 和 41.0 mBO,几乎免疫槽位过参数化带来的过分割退化。
- 结构性去噪去模糊量化:帧平均连通分量(FCC8,衡量碎片化,越低越好,真实 GT 为 6.27)从 SlotContrast 的 33.20、SRL 的 21.03 锐减至 SSync 的 8.79,逼近真实参考;边界外溢像素泄漏量(Leak)相比 SRL 进一步缩减 16.5%,边界 F-score 达到 0.255(显著优于 SRL 的 0.222)。
亮点与洞察¶
- 选择性非对称蒸馏的极简与高效:密集对齐看似全面,实则以二次方代价传播双分支结构盲区。SSync 洞察到两分支在空间频域上的天然互补性,用直白规则提取边界与内部,仅施加局部 MSE 回归即可超越昂贵的全局对比。
- 图论连通分量化解自监督自激难题:在线伪标签自训练最忌讳将模型自身的系统性缺陷(如过分割)当成真值学习。利用时空 IoU 构建冗余图并基于连通分量进行传递合并,赋予了模型跳出过分割局部最优的自愈能力。
- 高度通用的即插即用属性:在 RandSF.Q 协议下,无论是基于 VideoSAUR 还是 SlotContrast 主干,挂载 SSync 后在 MOVi-C、MOVi-D 和 HQ-YTVIS 上均稳定增益 2~4 点,且在纯图像目标中心学习任务(COCO2017)上同样取得大幅领先(47.9 FG-ARI vs SRL 42.8)。
局限与展望¶
- 时空重叠阈值依赖先验密度:合并阈值 \(\tau_{\text{merge}}\) 虽在 0.6~0.7 之间展现出一定宽容度,但面对物体极度密集重叠或尺度剧烈变化的非结构化视频时,固定阈值可能存在过合并风险。
- 自适应动态区域划分的潜在空间:当前可靠区域划分依赖固定领域差分阈值(\(n_{\text{bd}}=n_{\text{nbd}}=1\)),未来可探索基于预测熵或特征不确定度估计的软性连续加权机制。
- 扩展至开放词表与三维场景:结合开放词表视觉语言模型(VLM)与三维高斯泼溅(3DGS),将选择性协同思想拓展到具有语义概念的物理 3D 目标解耦中。
相关工作与启发¶
- vs SRL (ICLR 2026):SRL 首次指出编码器与解码器的不一致性,但采取全图密集对比对齐,导致噪声与模糊双向渗透,显存复杂度为 \(\mathcal{O}((THW)^2)\)。SSync 建立区域专长选择原则,边界由编码器主导、内部由解码器主导,以线性复杂度实现更纯净的互相纠偏。
- vs SlotContrast (CVPR 2025) & SlotCurri (CVPR 2026):SlotContrast 仅依赖跨时间槽位对比,无法解决空间图本身的失配与过分割;SlotCurri 借助重构难度课程调度槽位学习。SSync 从图表示与几何拓扑出发,通过传递合并直接根治了槽位冗余过分割。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 敏锐指出密集对齐的误差互传缺陷,提出按归纳偏置专长进行选择性协同蒸馏,设计极具说服力。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多套视频/图像基准、RandSF.Q 协议、槽位敏感性、显存扩展曲线及定量碎片泄漏分析,证据链极其扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻透彻,问题切中要害,公式与逻辑推导条理清晰。
- 价值: ⭐⭐⭐⭐⭐ 为无监督目标中心表征学习提供了低算力、高鲁棒性的全新范式,即插即用潜力巨大。