跳转至

Towards Unsupervised Multi-modal Semantic Segmentation

会议: ECCV 2026
论文: ECCV 官方海报
代码: https://empactlab.github.io/UMSS/
领域: 语义分割
关键词: 无监督学习, 多模态融合, 语义分割, 特征对应协同, 模态冲突调和

一句话总结

针对无监督语义分割在直接引入多模态信号时普遍发生的“融合性能退化”,本文提出 UniM2 框架,以跨模态对应协同(CMCS)作为内在无标签监督信号构建统一表征空间,并通过以 RGB 为主锚点的跨模态调和器(CMH)解耦梯度冲突,首次在完全无标注条件下实现了显著超越单模态基线的跨传感器多模态分割增益。

研究背景与动机

多模态语义分割(MSS)在自动驾驶、具身智能及机器人夜间与复杂光照导航中扮演着至关重要的角色。引入深度(Depth)、红外热成像(Thermal)或偏振等辅助模态,可以有效弥补单一 RGB 图像在恶劣光照或视觉退化环境下的感知盲区。然而,当前绝大多数多模态分割算法严重依赖密集的人工像素级标注。标注不仅开销高昂且难以扩展,还固化了预定义的语义类别边界,极大地限制了现实世界中海量无标注多模态传感器数据的充分利用。

与此同时,单模态无监督语义分割(USS)在 DINO 族自监督视觉 Transformer 的特征蒸馏推动下取得了巨大飞跃。一个直观的设想是将现有的先进多模态融合策略(如特征相加、卷积融合、CBAM 注意力或 StitchFusion)直接嵌入到无监督分割流水线(如 STEGO 或 EAGLE)中。然而大量实验揭示了一个令人惊讶的“融合退化(Fusion Degradation)”现象:在缺乏真实标签的监督下,直接引入深度或热成像数据不仅无法提升性能,反而导致分割 mIoU 大幅跳水。这背后的核心根源在于不同物理传感机制的表征偏置与异构结构矛盾。例如,窗帘与白墙在 RGB 模态下具有鲜明的纹理边界,而在深度传感器中则由于几何平整度一致被视为同一平面。在有监督训练中,人工标签会显式仲裁这些模态分歧;但在无监督场景下,这种冲突会直接传导为方向相悖的优化梯度,破坏聚类流形的拓扑结构,最终导致表征坍塌与分割质量劣化。

面对无监督多模态表征中“信息互补性”与“结构冲突性”并存的困境,本文提出了全新的任务设定——无监督多模态语义分割(UMSS)。本文的切入角度是:不再强求对异构特征施加生硬的刚性对齐或单纯依靠单向模态模仿,而是以自监督冻结特征的跨模态关联共识作为内生监督,并显式构建不对称的调和缓冲层来吸收传感器物理特性冲突。本文的核心 idea 是:提出 UniM2 框架,以跨模态对应协同(CMCS)约束统一潜在空间捕捉多传感器共有的一致性流形,同时引入以 RGB 语义为主锚点的跨模态调和器(CMH)软化并解耦辅助模态的梯度矛盾,成功将无监督多模态融合的性能退化逆转为大幅度正向增益。

方法详解

整体框架

UniM2 的输入为成对的多模态图像组。以典型的 RGB-深度(RGB-D)或 RGB-红外(RGB-T)双模态为例,输入图像组分别经过冻结的大规模自监督骨干网络(DINOv3)提取高维稠密特征。随后,各模态特征先由独立的模态专有网络(Modality-Specific Networks, MSN)进行轻量特征精炼,再通过可学习的卷积融合模块(Conv Fusion)聚合为统一的多模态特征。最终,紧凑的分割头将融合特征映射至低维嵌入空间,用于无监督聚类输出。整个训练过程无需任何人工标签,完全依靠自构建的成对样本(Self 图像自配对、KNN 语义近邻对、Random 随机负样本对)以及跨模态对应协同损失和跨模态调和机制实现端到端优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入组<br/>RGB 图像 I + 辅助模态 X"] --> B["冻结 DINOv3 骨干网络<br/>提取稠密特征 f_rgb 与 f_X"]
    B --> C["模态专有精炼 MSN<br/>自适应校准各模态通道"]
    C --> D["可学习卷积融合 Conv Fusion<br/>聚合生成融合特征 f_fus"]
    D --> E["分割头投影<br/>生成统一流形嵌入 s"]
    E --> F["跨模态对应协同 CMCS<br/>计算多模态共有结构相似度"]
    E --> G["跨模态调和器 CMH<br/>以 RGB 为主锚点缓冲 f_X 梯度"]
    F --> H["端到端联合约束<br/>聚类输出像素级语义伪标签"]
    G --> H

关键设计

1. 跨模态对应协同(CMCS):用内生共识构建统一流形 传统单模态无监督语义分割假设紧凑低维嵌入空间中的特征余弦相似度应当逼近自监督骨干网络的特征相关性。然而在多模态场景下,任一单一模态都不可避免地带有其特定传感器的噪声与结构偏置。CMCS 的设计核心是不依赖外在监督,而是将异构模态之间的“关系共识”作为内生监督信号。具体而言,对于训练图像对 \((G_1, G_2)\),骨干网络直接提取出稳定的语义锚点特征,并分别计算空间像素点对之间的余弦相似度张量 \(F^{rgb}_{hwij} = \cos(f_{rgb,1,hw}, f_{rgb,2,ij})\)\(F^{X}_{hwij} = \cos(f_{X,1,hw}, f_{X,2,ij})\)。与此同时,统一多模态分割头输出的低维嵌入 \(s_1, s_2\) 亦计算其空间对应关系 \(S_{hwij} = \cos(s_{1,hw}, s_{2,ij})\)。CMCS 要求融合后的多模态表征 \(s\) 必须同时满足多传感器的结构相关性,只有被两个传感器一致认可的语义关联才会在统一嵌入空间中被显著放大,而模态特有的伪影噪声则被有效压制。

2. 跨模态调和器(CMH):以 RGB 为主锚点的梯度解耦缓冲机制 即使 CMCS 强调跨模态共识,传感器物理层面的固有差异仍会引发剧烈的梯度对抗。例如在墙面与壁画、窗帘与实墙的边界处,RGB 提供了强烈的语义纹理分界,而深度或红外传感器却可能完全平整无差。若强行使用统一嵌入 \(s\) 直接拟合辅助模态关系张量 \(F^X\),会向分割头反向传播错误的平滑梯度,从而抹杀 RGB 已学到的精细语义轮廓。为此,UniM2 摒弃了对称约束的常规思路,引入以 RGB 为主语义基准的不对称调和设计:RGB 特征直接监督统一嵌入 \(s\),而辅助模态 \(X\) 的监督则必须穿过一个轻量化的两层卷积缓冲层 \(\text{CMH}(\cdot)\)。即定义调和后的辅助嵌入为 \(s^X = \text{CMH}(s)\),其空间相似度为 \(S^X_{hwij} = \cos(s^X_{1,hw}, s^X_{2,ij})\)。辅助模态的蒸馏损失 \(\mathcal{L}_X\) 仅直接反传给 \(s^X\),通过 \(\text{CMH}\) 的参数自适应调节对主表征 \(s\) 的约束刚度。这一设计赋予了模型极大的弹性:主语义空间 \(s\) 能够从容吸纳辅助模态所包含的全局空间拓扑和几何轮廓,同时滤除微观层面的物理属性伪对抗信号,彻底化解了“融合退化”。

3. 模块化多模态可扩展架构:从双模态到任意 N 模态的无缝扩展 现实场景中的自主系统通常配备不仅限于深度或热成像的多种传感器。得益于 CMH 的解耦缓冲性质,UniM2 具有高度模块化的扩展能力。当引入 \(N\) 个辅助模态(如同时融合近红外 NIR、线偏振度 DoLP、偏振角 AoLP 等)时,系统不需要重新设计复杂的跨模态注意力网络或手动调整多重超参数平衡矩阵,而是针对每一个辅助模态分配独立的轻量 CMH 分支与专有 MSN 精炼层。每个辅助分支各自独立缓冲梯度回传,避免了多传感器间多对多的梯度相互交织与互相干扰,使得框架能够无缝横向扩展至四模态乃至更高维度的感知场景。

损失函数 / 训练策略

UniM2 的总损失函数由 RGB 主监督损失 \(\mathcal{L}_{rgb}\) 与各辅助模态的调和损失 \(\mathcal{L}_{X_n}\) 加权求和构成: $\(\mathcal{L}_{cmcs} = \mathcal{L}_{rgb} + \sum_{n=1}^{N} \lambda_n \mathcal{L}_{X_n}\)$ 对于每一路损失,其形式遵循带负压偏置的对应蒸馏目标: $\(\mathcal{L}_{rgb} = -\sum_{h,w,i,j} (F^{rgb}_{hwij} - b) \max(0, S_{hwij})\)$ $\(\mathcal{L}_{X} = -\sum_{h,w,i,j} (F^{X}_{hwij} - b) \max(0, S^{X}_{hwij})\)$ 其中 \(b\) 为根据输入对类型(Self、KNN 或 Random)设定的标量偏置,用于提供排斥负压以防止表征坍塌;\(\lambda_n\) 为模态平衡超参数。训练过程基于冻结的 DINOv3 骨干网络,采用 Adam 优化器,学习率设为 \(5 \times 10^{-4}\),批大小为 32。为确保评估的公平性与复现性,各对比方法均统一在 200 次贝叶斯超参数搜索预算下进行独立调优,单张 NVIDIA GeForce RTX 5090 显卡上两小时内即可完成单模型训练。

实验关键数据

主实验

论文在室内 RGB-D 数据集 NYU-Depth-v2(13 类评价协议)及全天候城市场景 RGB-T 数据集 MFNet(8 类)上进行了系统的量化评估。如原论文 Table 2 所示,现有先进 USS 方法在直接接入辅助模态时普遍遭遇明显掉点,而 UniM2 则实现了稳定的性能飞跃。

原论文 Table 2:NYU-Depth-v2 与 MFNet 数据集上的定量对比结果

方法 模态输入 骨干网络 NYU-Depth-v2 mIoU (%) NYU-Depth-v2 Acc. (%) MFNet mIoU (%) MFNet Acc. (%)
DINOv3 K-means RGB ViT-S/16 11.1 26.2 20.1 67.3
DINOv3 K-means RGB + X ViT-S/16 9.4 (↓1.7) 25.5 (↓0.7) 19.8 (↓0.3) 66.5 (↓0.8)
STEGO RGB ViT-S/16 28.8 52.0 32.2 72.1
STEGO RGB + X ViT-S/16 25.3 (↓3.5) 45.9 (↓6.1) 31.3 (↓0.9) 74.9 (↑2.8)
EAGLE RGB ViT-S/16 27.4 51.6 34.7 79.6
EAGLE RGB + X ViT-S/16 20.1 (↓7.3) 40.0 (↓11.6) 31.1 (↓3.6) 77.4 (↓2.2)
UniM2 (Ours) RGB + X ViT-S/16 36.9 (↑8.1) 56.1 (↑4.1) 35.2 (↑3.0) 81.5 (↑9.4)
DINOv3 K-means RGB ViT-B/16 14.3 32.8 20.0 72.1
DINOv3 K-means RGB + X ViT-B/16 10.4 (↓3.9) 23.3 (↓9.5) 21.2 (↑1.2) 72.4 (↑0.3)
STEGO RGB ViT-B/16 31.7 55.1 35.9 73.6
STEGO RGB + X ViT-B/16 31.1 (↓0.6) 49.7 (↓5.4) 32.5 (↓3.4) 74.1 (↑0.5)
EAGLE RGB ViT-B/16 30.9 49.5 37.8 72.5
EAGLE RGB + X ViT-B/16 25.8 (↓5.1) 46.9 (↓2.6) 33.5 (↓4.3) 74.5 (↑2.0)
UniM2 (Ours) RGB + X ViT-B/16 38.1 (↑6.4) 58.8 (↑3.7) 45.7 (↑9.8) 76.1 (↑3.7)

注:括号内提升/下降数值(↑/↓)均以对应骨干网络下的 STEGO RGB 单模态基线为基准计算。

消融实验

论文在 NYU-Depth-v2(ViT-S/16 骨干)上全面分析了各个关键组件的贡献、主锚点位置设定以及融合机制的影响。

原论文 Table 5、Table 6、Table 7:组件有效性、主锚点选择及融合方式消融

消融维度 具体配置 mIoU (%) Pixel Acc. (%) 核心说明
组件贡献 (Tab. 5) Baseline (Multi-modal STEGO + Conv) 25.0 48.1 朴素多模态基线,存在严重融合退化
+ CMCS + MSN (无 CMH) 31.3 50.7 跨模态共识提供基础增益,超越 RGB 基线 (28.8%)
+ CMCS + CMH (无 MSN) 34.2 54.3 引入调和器有效阻断梯度冲突,大幅涨点
Full UniM2 (CMCS + MSN + CMH) 36.9 56.1 全模块协同,达到最高分割精度
主锚点设定 (Tab. 6) No anchors (双分支均加缓冲) 19.8 50.8 缺乏稳定语义基准,表征剧烈漂移与震荡
Depth only (以 Depth 为主锚点) 27.6 45.3 深度几何缺失高层语义细节,引导效果受限
Both (双分支均作为刚性锚点) 31.3 50.7 对称刚性对齐无法化解冲突
RGB only (以 RGB 为主锚点, Ours) 36.9 56.1 RGB 蕴含最可靠语义先验,实现最优平衡
融合算子选择 (Tab. 7) Max 操作 30.5 50.2 静态硬选择丢失连续上下文特征
Mean 操作 32.5 53.2 静态均匀加权难以自适应通道权重
Sum 操作 33.0 53.6 简单求和缺乏非线性表达能力
Conv Fusion (Ours) 36.9 56.1 在 CMH 调和下,可学习卷积能够自适应提炼互补特征

关键发现

  • 打破无监督多模态“越融越差”的魔咒:在 ViT-B/16 骨干下,直接给 STEGO 增加 Thermal 导致 MFNet 上 mIoU 下降 3.4%(35.9% → 32.5%),给 EAGLE 增加 Depth 导致 NYU-Depth-v2 上暴跌 5.1%(30.9% → 25.8%)。而 UniM2 不仅完全消除了负迁移,反而在 NYU-Depth-v2 上实现 +6.4%(38.1% vs 31.7%)、在 MFNet 上实现 +9.8%(45.7% vs 35.9%)的跨越式性能提升。
  • 细粒度类别敏感性差异显著:从 NYU-Depth-v2 各类别的细粒度表现(原论文 Table 3)来看,几何敏感型类别(如 Sofa 从 STEGO-RGB 的 1.0% 飙升至 UniM2 的 55.7%,Table 从 15.8% 提升至 18.9%)极大地受益于深度的三维结构注入;而常规融合算法在外观主导类别(如 Floor 暴跌至 23.3%)上的崩溃在 UniM2 中被完美化解(UniM2 的 Floor 保持在 58.2%,几乎无损)。
  • RGB 主锚点不可动摇:消融实验证明,若不设置任何固定语义基准(No anchors),模型 mIoU 骤降至 19.8%;以 Depth 作为唯一基准也仅有 27.6%。只有以语义最丰富且泛化性最佳的 RGB 作为稳定基座,辅助传感器以缓冲形态注入几何/热辐射结构,才是无监督多模态学习的最优范式。

亮点与洞察

  • 首创 UMSS 任务新赛道并剖析融合退化机理:首次系统化定义并论证了无监督多模态语义分割任务,揭示了在无显式标签仲裁时,物理传感器间的表征差异会导致梯度冲突并瓦解聚类空间的深层机理。
  • 巧用不对称缓冲层破除表征对称强迫症:传统跨模态对齐多追求双向对称的对齐与蒸馏,UniM2 巧妙地指出在无监督学习中必须确立 RGB 为稳定的一级参考系,将辅助流经由 CMH 转换为“柔性单向约束”,思路极具启发性。
  • 即插即用且扩展至四模态:在 MCubeS 四模态(RGB、NIR、DoLP、AoLP)材料分割基准上,无需繁琐重构网络架构即可稳定扩展,从单模态(18.1%~19.1%)稳健提升至多模态(21.8%),展现出强韧的工程通用性。

局限与展望

  • 弱信噪比模态的负面拖累:在 MCubeS 数据集上,当引入线偏振角(AoLP)时,模型性能从 21.8%(IND)微降至 20.7%(INAD)。这表明对于物理噪声大、信息有效载荷极低的模态,仅依靠轻量 CMH 卷积缓冲仍无法完全过滤其劣质信号,未来需要引入自动模态可靠性门控或信噪比自适应加权机制。
  • 依赖自监督骨干网络的泛化质量:当前框架高度依赖冻结的 DINOv3 抽取高质量特征。若辅助模态(如特定频段雷达或声呐)在基础模型预训练中分布缺失严重,MSN 的特征映射可能难以有效对齐。
  • 未来方向:探索在无监督多模态分割中联合微调适配器(LoRA/Adapter),以及将框架推广到无监督开放词表多模态三维高斯(3D GS)/ NeRF 场景理解中。

相关工作与启发

  • vs STEGO [ICLR 2022]: STEGO 首创了基于特征对应蒸馏的单模态无监督语义分割范式,但其针对多模态输入的朴素扩展会导致严重的表征冲突与性能下滑。UniM2 继承了其相关性蒸馏思想,但重构为跨模态共识(CMCS)与不对称缓冲解耦(CMH),解决了多模态环境下的多义性。
  • vs EAGLE [CVPR 2024]: EAGLE 引入特征本征值聚合以强化物体中心表征,但在多模态输入下因不同模态特征图本征空间的剧烈失配而导致严重退化(在 NYU-Depth-v2 上暴跌至 20.1%)。UniM2 则通过统一潜空间学习保障了特征空间的平滑性。
  • vs 跨模态知识蒸馏(CMKD): 传统 CMKD 多遵循教师-学生的单向知识复制,依赖预先训练好的教师网络;UniM2 则是无教师预设的异构模态协同演化,通过互为锚点发现共有语义流形。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统攻克无监督多模态语义分割任务,提出 CMCS 与 CMH 的不对称调和解耦范式,立意极佳。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖双模态与四模态基准(NYU-Depth-v2、MFNet、MCubeS),包含 200 次贝叶斯超参优化、逐类 IoU 解析与细致消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 论文动机清晰明确,对多模态“融合退化”现象的剖析深刻透彻,图表呈现极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 为无标注多传感器融合研究奠定了坚实的 Baseline,对机器人自主建图与夜间安全感知具有极高实用价值。