RA-SOD: Reliability-Aware RGB-T Salient Object Detection under Modality Degradation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/zaoxienian/RA-SOD
领域: 语义分割
关键词: 显著性目标检测、RGB-T多模态、模态退化、专家混合模型、不确定性引导
一句话总结¶
针对真实场景中可见光与热红外传感器频发的噪声、失真与质量退化,RA-SOD 提出了贯穿表征、解码与融合全周期的可靠性感知检测架构,通过残差混合专家表征补偿、不确定性引导的双流双向纠偏及像素级模态竞争,显著提升了恶劣环境下的显著性目标检测鲁棒性。
研究背景与动机¶
RGB-热红外(RGB-T)显著性目标检测通过联合可见光与红外辐射信息,能够在复杂光照和恶劣气候下显著改善传统单模态检测的局限。然而,现有大多数 RGB-T 显著性检测方法建立在一个潜在的理想化假设之上:即网络编码器提取的单模态特征是足够可靠的,跨模态之间的不一致性仅发生在较深层次的融合阶段。因此,现有工作普遍将研究重心放在精巧的多尺度特征交互、注意力融合网络或图交互架构上。
在实际现实场景中,单模态的感官证据极其脆弱且不稳定。可见光图像极易受到极低照度、强运动模糊或传感器成像噪点的严重干扰;与此同时,热红外图像常常遭遇热交叉(thermal crossover)、温度对比度急剧压缩或热成像盲区伪影等现象。当这种模态退化(modality degradation)在输入端发生时,采用固定参数的标准骨干网络无法自适应输入相关的分布偏移,导致噪声和畸变表征在编码层级中被逐层传递甚至放大,致使后续的多模态融合模块不得不在已被污染的特征上强行交互,难以区分真实的结构边界与伪影噪点。
解决该问题的关键不能仅仅依靠后期的注意力重加权,而必须在特征提取伊始就引入模态质量的可靠性意识,并在逐层传播过程中主动抑制失真信号。核心 idea:将模态可靠性建模贯穿于编码、解码与融合的全生命周期,构建基于残差路由专家的可靠性条件骨干表征、以空间不确定性为置信门控的双流双向纠偏解码,以及动态甄选优胜特征的像素级模态竞争融合机制。
方法详解¶
整体框架¶
RA-SOD 包含三个紧密耦合的核心阶段:在编码阶段构建可靠性条件主干表征(RCBR),在双流解码阶段进行不确定性引导的递归校正(UGDD),并在融合阶段通过像素级模态竞争(PMC)完成多流协同预测。网络输入对齐的可见光图像 \(I^r\) 与热红外图像 \(I^t\),首先利用共享的冻结主干网络提取基础特征,经并行的残差自适应专家库补偿后获得可靠性条件表征;随后在 RGB 和 Thermal 两个顶端自底向上的解码流中,利用估计出的空间不确定性图动态引导跨模态补偿;最后在融合流中结合像素级竞争掩码完成细粒度跨模态汇聚,并通过多流独立预测头进行线性加权融合。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入成对图像 (RGB / Thermal)"] --> Enc["主干特征提取与基础特征映射"]
Enc --> RCBR["可靠性条件主干表征<br/>冻结主干 + 门控 MoE 专家残差分支"]
RCBR --> UGDD["不确定性引导双流递归解码<br/>空间不确定性估计 + 跨模态自适应双向纠偏"]
RCBR --> MFM["编码器多模态融合 (MFM)"]
MFM --> PMC["像素级模态竞争融合流<br/>空间自适应动态打分与通道特征竞争汇聚"]
UGDD --> PMC
UGDD --> PredHead["多流显著性预测头 (RGB / Thermal / Fusion)"]
PMC --> PredHead
PredHead --> Agg["线性加权汇聚输出最终显著图"]
关键设计¶
1. 可靠性条件主干表征:冻结先验下的残差混合专家自适应调制
面对因传感器退化引起的严重特征域偏移,如果完全微调主干网络容易在恶劣样本上过拟合或破坏预训练通识表征,而单纯冻结主干又无法适应受损输入的特征畸变。为此,RCBR 采用“冻结主干 + 旁路轻量残差专家”的解耦架构。冻结的主干模块 \(B_l(\cdot)\) 为输入特征生成基础特征 \(\mathbf{F}_l^{m,\text{base}}\),同时一个轻量门控网络 \(g_l^m\) 直接以该基础特征为条件预测专家路由概率 \(\boldsymbol{\alpha}_l^m = \text{Softmax}(g_l^m(\mathbf{F}_l^{m,\text{base}}))\)。
在旁路残差流中,网络结合了跨模态共享的专家池 \(E_{l,k}(\cdot)\) 与模态专属的低秩适配器(Adapter)\(A_l^m(\cdot)\)。残差特征增量计算为: $$ \Delta \mathbf{F}l^m = \sum}^K \alpha_{l,k}^m E_{l,k}(\mathbf{F{l-1}^m) + A_l^m(\mathbf{F}^m) $$ 最终输出的可靠表征为基础特征与残差增量之和 \(\mathbf{F}_l^m = \mathbf{F}_l^{m,\text{base}} + \Delta \mathbf{F}_l^m\)。当某种模态发生低光或对比度压缩时,门控网络能够感知基础特征的异常分布,动态激活更适合该退化类型的专家子空间,在不破坏冻结骨干结构先验的前提下精准修复特征失真。
2. 不确定性引导双流递归解码:空间显式置信门控下的双向交互纠偏
在由深至浅的解码传播过程中,单一模态在退化区域(如过曝反光、热成像模糊边缘)容易产生误导性响应。传统双流交互直接进行通道拼接或点积注意力,极易使受损模态的错误线索污染另一支正常模态。UGDD 在 RGB 与 Thermal 的顶向下解码流中引入显式不确定性图作为过滤门控。在阶段 \(l\) 计算初步解码特征 \(\hat{\mathbf{D}}_l^m\) 后,轻量预测器 \(\phi_l\) 预测单通道空间不确定性图: $$ \mathbf{U}_l^m = \sigma(\phi_l(\hat{\mathbf{D}}_l^m)) \in [0, 1]^{H_l \times W_l} $$
该不确定性图反映了当前模态在各像素位置上的不可信程度。在进行跨模态纠偏时,高不确定性的区域被赋予更高权重去从互补模态中汲取信息: $$ \mathbf{D}_l^r = \hat{\mathbf{D}}_l^r + \mathbf{U}_l^r \odot \mathcal{T}_l(\hat{\mathbf{D}}_l^t), \quad \mathbf{D}_l^t = \hat{\mathbf{D}}_l^t + \mathbf{U}_l^t \odot \mathcal{T}_l(\hat{\mathbf{D}}_l^r) $$ 其中 \(\mathcal{T}_l(\cdot)\) 为通道对齐变换层。若可见光分支在暗光下出现大面积不确定性(\(\mathbf{U}_l^r\) 接近 1),热红外特征将被强力注入以弥补可见光信息的缺失;反之,若热红外遇到温差均衡导致的模糊区域,则依赖清晰的可见光纹理进行修正,有效截断了局部噪声在解码金字塔中的恶性扩散。
3. 像素级模态竞争机制:高分辨率空间的细粒度胜者引导融合
即使经过双流校正,两模态特征在像素空间上的信息价值仍存在剧烈的空间异质性。全局标量权重或均匀相加往往导致边缘细节退化或背景伪影残留。PMC 在主融合解码流中构建了空间逐像素的竞争仲裁器。在融合解码层级 \(l\),网络拼接上一层的上采样融合表征以及本层经过校正的 RGB 与 Thermal 解码特征,通过轻量级卷积网络 \(\psi_l\) 在像素级别生成竞争概率分布: $$ [\mathbf{W}l^r, \mathbf{W}_l^t] = \text{Softmax}\left(\psi_l([\text{Up}(\mathbf{D}}^{fus}); \mathbf{Dl^r; \mathbf{D}_l^t])\right) $$ 其中 \(\mathbf{W}_l^r + \mathbf{W}_l^t = 1\) 在每个像素点严格成立。融合流的上下文引导特征由竞争加权与历史状态结合产生: $$ \mathbf{H}_l = \mathbf{W}_l^r \odot \mathbf{D}_l^r + \mathbf{W}_l^t \odot \mathbf{D}_l^t + \text{Up}(\mathbf{D}) $$ 通过让两种模态在每个空间坐标点竞争信息支配权,网络能够在同一幅图像中实现“边缘处依赖可见光纹理、昏暗主体内部依赖红外热辐射”的细粒度动态选择。}^{fus
损失函数 / 训练策略¶
为了防止网络在训练期间塌缩到某一种更容易拟合的单模态分支上,RA-SOD 采用了对三个分支并行的深度监督策略。针对 RGB、Thermal 以及 Fusion 解码输出,分别挂载结构一致但参数独立的轻量预测头 \(\mathcal{O}^r, \mathcal{O}^t, \mathcal{O}^{fus}\),产生三张预测图 \(\mathbf{S}^r, \mathbf{S}^t, \mathbf{S}^{fus}\)。
整体优化目标采用多任务二元交叉熵损失与 IoU 损失的加权和: $$ \mathcal{L} = \sum_{m \in {r, t, fus}} \left( \mathcal{L}{\mathrm{BCE}}(\mathbf{S}^m, \mathbf{G}) + \mathcal{L}) \right) $$ 其中 }}(\mathbf{S}^m, \mathbf{G\(\mathbf{G}\) 为真实显著性标注掩码。在推理阶段,最终的预测图由三个流的输出直接线性相加得到:\(\mathbf{S} = \mathbf{S}^r + \mathbf{S}^t + \mathbf{S}^{fus}\),充分兼顾单模态特定证据与跨模态融合线索。
实验关键数据¶
主实验¶
在三个经典 RGB-T 显著性检测基准(VT821、VT1000、VT5000)以及严苛传感器退化挑战集 VT-IMAG 上,RA-SOD 与当前最先进的 CNN 基准模型进行了全面对比。下表汇总了标准基准与挑战基准的主要对比指标(对应原论文 Table 1 与 Table 3)。
| 数据集 | 评价指标 | 本文 (RA-SOD) | 次优方法 (ConTriNet / CAVER) | 相对提升 / 降低 |
|---|---|---|---|---|
| VT5000 | Structure-measure (\(S_m\)) ↑ | 0.897 | 0.894 (ConTriNet) | +0.003 |
| VT5000 | Mean F-measure (\(F_\beta\)) ↑ | 0.870 | 0.860 (ConTriNet) | +0.010 |
| VT5000 | Weighted F-measure (\(F_\beta^w\)) ↑ | 0.855 | 0.846 (ConTriNet) | +0.009 |
| VT5000 | Mean E-measure (\(E_m\)) ↑ | 0.937 | 0.935 (SMR-Net) / 0.934 | +0.002 |
| VT5000 | Mean Absolute Error (\(M\)) ↓ | 0.029 | 0.030 (ConTriNet) | -0.001 |
| VT1000 | Mean F-measure (\(F_\beta\)) ↑ | 0.915 | 0.905 (LAFB) / 0.903 | +0.010 |
| VT1000 | Weighted F-measure (\(F_\beta^w\)) ↑ | 0.913 | 0.909 (CAVER) | +0.004 |
| VT-IMAG | Structure-measure (\(S_m\)) ↑ | 0.829 | 0.828 (ConTriNet) | +0.001 |
| VT-IMAG | Mean F-measure (\(F_\beta\)) ↑ | 0.765 | 0.745 (ConTriNet) | +0.020 |
| VT-IMAG | Weighted F-measure (\(F_\beta^w\)) ↑ | 0.735 | 0.727 (ConTriNet) | +0.008 |
| VT-IMAG | Mean E-measure (\(E_m\)) ↑ | 0.908 | 0.902 (ConTriNet) | +0.006 |
消融实验¶
下表列出了对可靠性条件主干表征(RCBR)各个核心组件的消融验证结果(对应原论文 Table 6),对比了纯冻结主干、仅加模态适配器、仅加共享专家库以及完整方案的效果。
| 配置变体 | 模态适配器 A | 共享专家库 E | VT821 (\(F_\beta^w\) / \(M\)) | VT1000 (\(F_\beta^w\) / \(M\)) | VT5000 (\(F_\beta^w\) / \(M\)) | 说明 |
|---|---|---|---|---|---|---|
| \(B_0\) (Frozen Backbone) | × | × | 0.840 / 0.032 | 0.906 / 0.019 | 0.851 / 0.030 | 基础主干无调制分支 |
| \(B_1\) (+A only) | ✓ | × | 0.843 / 0.032 | 0.914 / 0.018 | 0.853 / 0.031 | 仅引入模态低秩适配器 |
| \(B_2\) (+E only) | × | ✓ | 0.842 / 0.032 | 0.910 / 0.020 | 0.851 / 0.029 | 仅引入共享混合专家池 |
| \(B_3\) (RA-SOD 完整) | ✓ | ✓ | 0.846 / 0.031 | 0.913 / 0.018 | 0.855 / 0.029 | 联合适配器与门控专家分支 |
此外,在原论文 Table 7 与 Table 8 中针对不确定性解码模块(UGDD)的消融显示: - 去除 UGDD 机制后,在退化合成场景(Deg.)下的 \(F_\beta^w\) 从 0.907 剧降至 0.897,在 VT-IMAG 恶劣环境集上由 0.735 跌至 0.728。 - 不确定性统计表明,正常图像下 \(\mathbf{U}_l^r\) 均值仅为 0.32;而在低照度退化下,\(\mathbf{U}_l^r\) 显著跃升至 0.57(而同场景下正常的 \(\mathbf{U}_l^t\) 仍保持在 0.31),证实不确定性门控能够精准对准受损模态进行激活。
关键发现¶
- 退化场景下的可靠性建模至关重要:在真实包含热交叉、恶劣天气与强烈传感噪声的 VT-IMAG 数据集上,RA-SOD 相对 SOTA 基线 ConTriNet 的 \(F_\beta\) 提升达 0.020(0.765 vs 0.745),远高于其在标准测试集上的常规增益,证明其在极端干扰下的鲁棒优势。
- 专家数量在 \(K=3\) 时达到最佳均衡:Table 9 证实,当专家数量由 1 增至 3 时,VT5000 上的 \(F_\beta^w\) 从 0.853 稳步提升至 0.855;继续增加至 5 个专家时,模型由于过拟合与门控优化难度加大,性能微幅下降至 0.850。
- 计算效率保持优异:RA-SOD 在 Res2Net-50 下参数量为 46.72M,计算量为 60.13 GFLOPs,推理速度达到 11.24 FPS,远快于参数量达 453M、速度仅 4.62 FPS 的 LAFB,实现了精度与速度的高效平衡。
亮点与洞察¶
- 解耦式残差 MoE 适配机制:通过“冻结预训练主干 + 基础特征路由的残差专家分支”,既保护了自然图像通用语义不被退化噪点污染,又以极低开销赋予模型自适应处理光照剧变或热成像异常的能力。
- 置信度感知的不确定性阻断机制:打破了常规跨模态交互中两分支盲目互传特征的惯性,将不确定性作为动态空间门控,使得互补增强真正发生在“一方存疑、另一方清晰”的区域,有效防止了误差双向传染。
- 通用多模态可迁移性:该“表征自适应补偿 + 空间置信过滤 + 像素级竞争”的三级可靠性范式,可无缝推广至 RGB-D 深度失真、RGB-Event 事件相机低信噪比以及车载多传感器目标检测与自动驾驶感知中。
局限与展望¶
- 主干冻结带来的上限约束:为了保证训练稳定与先验完整性,主干网络的大部分层级被冻结,这在极端长尾或极罕见的热成像模式下,可能限制了更深层次特征表象空间的重构能力。
- 对同步配准精度的潜在依赖:虽然提出了像素级竞争,但双流校正与竞争机制依然假定 RGB 与 Thermal 具有像素级的几何空间对齐;当在颠簸载具或异步快门下出现严重视差时,跨模态空间纠偏可能引入边缘错位。
- 未来方向:可进一步探索无配准或弱对齐条件下的鲁棒可靠性度量,并将该可靠性建模机制扩展到基于多模态大模型的视频显著性分析与具身智能感官交互中。
相关工作与启发¶
- vs ConTriNet [35]:ConTriNet 提出了分而治之的三流网络架构并在多项榜单领先,但其假设各流特征输入可靠,缺乏对单模态局部退化的感知与防御;RA-SOD 继承了三流解码的思想,在此基础上首创了 RCBR 门控残差调制与 UGDD 不确定性纠偏,在恶劣环境挑战集 VT-IMAG 上将 \(F_\beta\) 大幅推高了 2.0 个百分点。
- vs CAVER [29] & SMR-Net [59]:CAVER 依赖跨模态视角混合 Transformer,SMR-Net 探索语义互增强,但它们在面对极端暗光或红外热块伪影时容易将伪影误识别为前景;RA-SOD 通过不确定性图的显式空间抑制与像素级胜者竞争,从根本上剔除了局部失真信号的干扰。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (系统性地将模态退化与可靠性建模引入 RGB-T 显著性检测,残差 MoE 与不确定性纠偏设计精炼且完备)
- 实验充分度: ⭐⭐⭐⭐⭐ (全面评测了四大基准,涵盖主实验、合成退化实验、挑战集测试、可视化与深入消融分析)
- 写作质量: ⭐⭐⭐⭐⭐ (逻辑推导清晰严谨,方法与实验章节衔接紧密,图表信息充实)
- 价值: ⭐⭐⭐⭐☆ (对恶劣工况与复杂气象条件下的多模态稳健感知具有重要的工程与学术参考价值)