Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations¶
会议: ECCV 2026
论文: ECCV 官方主页
代码: https://github.com/palmdong/RobSelf
领域: 图像恢复
关键词: 跨模态超分辨率、自监督超分辨率、空间未对齐、引导图像恢复、内容感知滤波
一句话总结¶
针对真实多模态图像对中复杂的跨传感器畸变、视点变化与物体运动导致的未对齐困境,RobSelf 通过在线联合优化弱监督未对齐感知特征转换器与内容感知参考滤波器,在无需成对训练数据、GT 监督或预对齐的前提下实现了高保真、高精度的自监督跨模态超分辨率重建。
研究背景与动机¶
多模态成像技术(例如 RGB、深度图 Depth 以及近红外 NIR)能够捕捉现实世界场景互补的几何与纹理信息。然而受限于物理硬件与传感机理,非可见光模态的传感器分辨率通常显著低于 RGB 相机,这催生了跨模态超分辨率(Cross-Modal Super-Resolution, SR)技术——即利用高分辨率(HR)RGB 引导图像的丰富结构细节来增强低分辨率(LR)源模态图像。传统监督学习方法严重依赖大规模带标注的领域特定数据集与 Ground Truth (GT) 高分辨率图像,但在非可见光领域构建此类数据极其耗时费力且成本高昂;而现有的自监督方法无需预训练或外部数据,直接在测试图像对上进行在线优化,具备更强的实用性与泛化能力。
然而,现存绝大多数跨模态超分辨率方法均基于一个高度理想化的前提:源图像与引导图像已在空间上严格像素对齐。但在实际部署场景中,空间未对齐(Spatial Misalignment)往往不可避免,其根源既包括相机硬件内在的镜头畸变、视场角差异及传感器基线物理间距,也包括外界平台带来的视点变化以及动态场景中的物体运动。如果采用传统两阶段策略先预对齐再超分,预对齐模型在面对分辨率跨度极大、模态差异悬殊的未知复杂场景时极易失效或产生伪影;而已有的少数端到端未对齐超分方法要么过度依赖仿真数据训练,要么简单套用通用的空间形变层而忽略了跨模态特征依赖,导致结构扭曲与细节退化。
面对源图像缺乏高分辨率标注以及引导图像缺乏对齐真值的双重无监督难题,本文的切入角度是:将跨模态、跨分辨率的空间对齐任务重构为一个在自监督超分闭环中内生的“弱监督特征转换”子任务。核心 idea:通过构建由低分辨率源图像在线弱监督驱动的未对齐感知特征转换器,促使引导特征拟合源模态分布并估计多尺度形变场;再由内容感知参考滤波器依据梯度重要性判别式地对源图像特征实施参考自增强,彻底隔绝未对齐模态中的冗余干扰。
方法详解¶
整体框架¶
RobSelf 的工作流程建立在对单对测试图像的在线自监督优化之上。给定低分辨率源图像 \(\mathbf{I}_{source}^{LR} \in \mathbb{R}^{h \times w \times \phi}\) 与高分辨率引导图像 \(\mathbf{I}_{guide}^{HR} \in \mathbb{R}^{H \times W \times \psi}\),网络首先对源图像进行双线性上采样至目标尺寸,并通过特征提取层分别抽取源特征 \(\mathbf{F}_{source}\) 与引导特征 \(\mathbf{F}_{guide}\)。随后系统由两大核心组件协同运转:未对齐感知特征转换器(Misalignment-Aware Feature Translator)负责估计跨模态形变场并输出对齐的引导特征 \(\mathbf{F}_{guide}^{Aligned}\) 及转换预测图 \(\mathbf{I}_{pred}^{Trans}\);内容感知参考滤波器(Content-Aware Reference Filter)则以 \(\mathbf{F}_{guide}^{Aligned}\) 为参照,在 \(\mathbf{F}_{source}\) 自身邻域内执行内容自适应的聚合增强,最终生成高保真超分预测图 \(\mathbf{I}_{pred}^{SR}\)。整个网络仅由低分辨率源图像经平均池化降采样后的重构一致性损失提供弱监督。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入:LR 源图像 + HR 引导图像"] --> Feat["多模态浅层特征提取"]
Feat --> Trans["未对齐感知特征转换器<br/>多尺度形变场估计 + 弱监督模态转换"]
Trans --> Align["输出对齐引导特征 F_guide_aligned"]
Align --> Filt["内容感知参考滤波器<br/>梯度显著图划分 + 参考判别式自增强"]
Feat -->|源模态特征输入| Filt
Filt --> Head["重建头输出 SR 预测图 I_pred_sr"]
Trans --> TransHead["转换头输出辅助预测图 I_pred_trans"]
Head --> Loss["降采样一致性损失<br/>仅由 LR 源图像反向传播监督"]
TransHead --> Loss
关键设计¶
1. 弱监督未对齐感知特征转换器:多尺度形变场估计与自适应空间校准
针对跨分辨率与跨模态对齐缺乏对齐标签(Alignment GT)的核心难点,本文将对齐机制内嵌于特征转换器中。该模块采用深层多尺度编码器-解码器架构(层数 \(i=3\sim 5\)),将输入的源特征与引导特征级联后逐步进行 \(2\times\) 降采样与升采样,捕捉从局部细节到大尺度视差的形变偏移,最终在特征分辨率下生成跨模态形变场 \(\mathbf{D}_{G2S} \in \mathbb{R}^{H \times W \times N}\)。基于该形变场,空间校准层对引导特征 \(\mathbf{F}_{guide}\) 进行空间重采样或可变形卷积重采样。针对不同场景需求,作者提出了两种模型变体:基于可变形卷积(Deformable Convolution)的 RobSelf-De 与基于双线性空间重采样(Spatial Resampling)的 RobSelf-Re: $$ \mathbf{F}{guide}^{Aligned}(p) = \begin{cases} \sum}^{k^2} w_i \mathbf{F{guide}(p + p_i + \Delta p_i), & \text{RobSelf-De} \ \mathbf{F} $$ 其中 }(p + \Delta p), & \text{RobSelf-Re} \end{cases\(p\) 为空间坐标,\(p_i\) 与 \(w_i\) 分别为 \(k\times k\) 卷积核的相对采样位置与权重,偏置向量从 \(\mathbf{D}_{G2S}\) 中回归得出。形变后的特征一方面作为下游滤波器的参考输入,另一方面经预测头输出辅助图像 \(\mathbf{I}_{pred}^{Trans}\),并受源图像下采样回归监督。这种以“使引导模态拟合源模态”为导向的弱监督约束,迫使形变场自发学到几何对应关系,不仅对传感器畸变和视角变化高度鲁棒,甚至能通过上下文借用“补全”引导图中因遮挡或视场差异而缺失的几何边缘。
2. 内容感知参考滤波器:基于梯度的判别式参考自增强
引导模态在对齐后依然不可避免地存在大量与源模态无关的固有纹理冗余(例如 RGB 图像丰富的表面颜色变化并不对应深度的边缘突变)。传统的特征拼接或引导滤波极易导致冗余纹理向源模态渗透(texture copying 伪影)。为了彻底切断冗余污染,本文设计了“参考自增强”机制:滤波操作严格在源特征 \(\mathbf{F}_{source}\) 自身的邻域内进行像素重组,对齐后的引导特征 \(\mathbf{F}_{guide}^{Aligned}\) 仅充当注意力权重的计算参考。首先,模型通过通道平均空间梯度计算内容重要性图 \(\mathbf{M}_{imp} \in \mathbb{R}^{H \times W}\): $$ \mathbf{M}{imp} = \frac{1}{C}\sum}^{C} |\nabla(\mathbf{F{source}^c)| $$ 设定动态阈值 \(\tau = \eta \cdot \mathbb{E}[\mathbf{M}_{imp}]\)(\(\eta\) 为自适应缩放因子)。对于边缘与纹理密集的强重要性像素(\(\mathbf{M}_{imp}(i) > \tau\)),模型采用大尺度卷积核 \(w_i^{imp} \in \mathbb{R}^{m \times m}\) 聚合更大范围的邻域像素;对于平滑区域的不重要像素(\(\mathbf{M}_{imp}(j) \le \tau\)),则采用紧凑小核 \(w_j^{l\text{-}imp} \in \mathbb{R}^{n \times n}\) 进行轻量自更新。邻域内源像素 \(\mathbf{F}_{source}(l)\) 与中心参考像素 \(\mathbf{F}_{guide}^{Aligned}(i)\) 计算归一化相关性权重: $$ w}^{imp} = \frac{\exp(\mathbf{F{source}(l)^\top \mathbf{F}}^{Aligned}(i))}{\sum_{l' \in \mathcal{Ni} \exp(\mathbf{F} $$ 自增强特征由式 }(l')^\top \mathbf{F}_{guide}^{Aligned}(i))\(\mathbf{F}_{source}^{Enhanced}(i) = \sum_{l \in \mathcal{N}_i} w_{i,l}^{imp} \mathbf{F}_{source}(l)\) 算出。这种设计使高分辨率引导信息仅用于指导源模态自身边缘的锐化与重构,完全避免了引导图像中无关模式的强行注入。
损失函数 / 训练策略¶
RobSelf 采用纯在线无监督自优化策略,对测试图像对直接优化 1000 次迭代。网络整体损失函数仅基于低分辨率源图像与两路输出的降采样一致性构建: $$ \mathcal{L} = \mathcal{L}{sr} + \lambda \mathcal{L}} = | f_{down}(\mathbf{I{pred}^{SR}) - \mathbf{I} |}^{LR1 + \lambda | f}(\mathbf{I{pred}^{Trans}) - \mathbf{I} |_1 $$ 其中 }^{LR\(f_{down}\) 表示与超分倍率一致的平均池化(Average Pooling)下采样操作,平衡超参数 \(\lambda=1\)。优化器选用 Adam,初始学习率为 \(10^{-3}\),每 5 次迭代按 0.9998 的衰减率更新。测试过程中无需任何数据增强或外部离线预训练权重。
实验关键数据¶
主实验¶
论文在三类设定下展开系统对比:合成未对齐 RGB 引导深度超分(Middlebury)、真实未对齐 RGB 引导深度超分(Azure Kinect DK 实测集)以及真实未对齐 RGB 引导近红外(NIR)超分。下表汇总了主实验核心对比数据(包含两阶段使用 SOTA 预对齐工具 MINIMA 的基线对比)。
表 1:合成与真实未对齐 RGB 引导深度超分辨率结果(原论文 Table 1 & Table 2 节选)
| 数据集 / 任务 | 指标 | RobSelf-De (本文) | RobSelf-Re (本文) | 最佳自监督对比项 (w/ Pre-align) | 最佳监督对比项 (w/ Pre-align) | 性能提升 (vs 最佳自监督) |
|---|---|---|---|---|---|---|
| 合成深度 \(\times 4\) | RMSE \(\downarrow\) | 1.43 | 1.52 | 1.88 (MMSR) | 2.06 (C2PD) | -0.45 (-23.9%) |
| 合成深度 \(\times 8\) | RMSE \(\downarrow\) | 2.49 | 2.57 | 2.79 (MMSR) | 3.15 (C2PD) | -0.30 (-10.8%) |
| 真实深度 \(\times 2\) | RMSE \(\downarrow\) | 2.18 | 2.23 | 2.53 (CMSR, 无预对齐) / 2.74 (SSGNet) | 2.98 (SGNet) | -0.35 (-13.8%) |
| 真实深度 \(\times 4\) | DSS \(\uparrow\) | 8.6 | 8.4 | 6.7 (CMSR, 无预对齐) / 5.6 (MMSR) | 5.1 (SGNet) | +1.9 (+28.4%) |
表 2:真实未对齐 RGB 引导近红外(NIR)超分辨率结果(原论文 Table 3 节选)
| 数据集 / 任务 | 指标 | RobSelf-De (本文) | RobSelf-Re (本文) | CMSR (自监督) | MMSR* (自监督) | Fusion-CAP (监督融合) | 提升幅度 |
|---|---|---|---|---|---|---|---|
| 真实 NIR \(\times 2\) | RMSE \(\downarrow\) | 3.12 | 3.09 | 3.42 | 8.91 | 4.40 | 误差降低 0.33 (vs CMSR) |
| 真实 NIR \(\times 4\) | NIQE \(\downarrow\) | 7.60 | 7.63 | 8.05 | 10.50 | 8.95 | 指标降低 0.45 (感知质量更优) |
消融实验¶
在真实未对齐 RGB-Depth 数据集(\(\times 2\) 超分,Task II)上,对转换器(Translator, T)与滤波器(Filter, F)的独立及联合贡献进行了消融验证。
表 3:特征转换器与参考滤波器的消融分析(原论文 Table 4)
| 配置 | Translator (T) | Filter (F) | RMSE \(\downarrow\) | 说明 |
|---|---|---|---|---|
| 1. Baseline | \(\times\) | \(\times\) | 2.55 | 去掉 T 与 F,仅通过 \(1\times 1\) 卷积直接融合未对齐特征 |
| 2. w/ only T | \(\checkmark\) | \(\times\) | 2.37 | 仅使用转换器对齐特征后直接拼接融合,冗余信息引起轻微扰动 |
| 3. w/ only F | \(\times\) | \(\checkmark\) | 2.31 | 仅使用滤波器但缺乏对齐参考,以未对齐特征引导引入错误结构 |
| 4. Full (Ours) | \(\checkmark\) | \(\checkmark\) | 2.18 | 转换器提供精确对齐参考 + 滤波器执行纯净自增强,达到最佳性能 |
关键发现¶
- 对齐与自增强协同增益显著:消融实验表明,单加转换器 RMSE 从 2.55 降至 2.37,单加滤波器降至 2.31,而二者联合时 RMSE 达到 2.18(相比 Baseline 降低 0.37),表明准确的几何对齐与隔绝冗余的判别式自增强缺一不可。
- 预对齐工具在真实场景严重失灵:两阶段 baseline 在带真实视点差异的测试集上普遍表现不佳(如 MMSR 配合 MINIMA 在真实 NIR \(\times 2\) 上的 RMSE 高达 8.91),这是因为现成配准模型难以跨越低分辨率非可见光与高分辨率可见光之间的巨大分辨率与模态鸿沟,而端到端联合优化的 RobSelf 展现出极高鲁棒性。
- 运行效率实现飞跃:在线推理时间测试(Table 5)显示,在真实 NIR \(\times 2\) 任务上,RobSelf-Re 仅耗时 64 秒,相比前序自监督方法 P2P(982 秒)提速达 15.3 倍,相比 MMSR(164 秒)提速 2.56 倍,且模型参数量仅为 0.65M~1.07M。
亮点与洞察¶
- 隐式跨模态结构“幻觉/补全”能力:在视场不一致或部分遮挡导致引导图像缺少对应物体结构的边缘场景下(如花盆边缘、仙人掌局部),特征转换器能够驱动形变场借用上下文相关区域的特征完成结构合成,使重建结果依然保持边界锐利。
- 参考式自滤波规避了模态纹理污染:与传统将两模态特征进行 Cross-Attention 或 Concat 混合的做法不同,RobSelf 的滤波器仅从引导特征获取相似度匹配权重,所有的特征值均来自源特征自身,从机理上杜绝了 RGB 颜色纹理在深度图上产生伪阴影的问题。
- 在线优化架构具备通用的迁移性:由于无需离线预训练且模型极为轻量,该“弱监督形变转换 + 判别式自滤波”架构可直接推广至高光谱图像超分辨率、医学图像多模态配准融合及红外小目标超分等各种未对齐物理成像场景。
局限与展望¶
- 迭代耗时仍限制了硬实时应用:虽然单对图像 64~122 秒的在线优化速度相比先前自监督基线已有十余倍提升,但相比单次前向推理的离线监督模型,仍无法直接部署在毫秒级实时机器人避障或自动驾驶传感器前端。
- 极端几何形变下的收敛挑战:当两模态图像之间的视差或物体的非刚性运动超过多尺度形变场编码器的最大感受野时,端到端在线优化的自监督损失可能陷入局部极小值。
- 未来改进方向:可探索将轻量级预训练流形先验引入形变场初始化,实现 10~20 步以内的极速自适应微调(Test-Time Adaptation, TTA),在保留无监督泛化优势的同时迈向准实时系统。
相关工作与启发¶
- vs MINIMA / 传统两阶段配准 + SR:MINIMA 等两阶段方法在离线配准时无法获取超分辨率重构的反馈信号,极易在真实噪声与大分辨率落差下丢失边界;RobSelf 将对齐作为超分的内生任务联合优化,相互赋能。
- vs CMSR (CVPR 2021):CMSR 依赖于现成 RGB 形变层生成伪配对数据,忽略了深层跨模态特征依赖,在复杂未对齐下发生边缘扭曲;RobSelf 通过多尺度编码-解码结构估计形变,在合成与真实数据上全面大幅领先。
- vs MMSR (ECCV 2022) / SSGNet (AAAI 2023):先前 SOTA 自监督超分方法假设图像完全对齐,一旦遇到传感器物理位移便性能剧降;RobSelf 填补了未对齐真实场景自监督跨模态恢复的技术空白。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次将弱监督跨模态特征转换与参考自增强相结合,提出无需标注与预对齐的端到端在线自监督超分范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖合成深度、真实多传感器深度以及真实近红外三大任务,包含详尽的参数量、耗时及特征可视化分析。
- 写作质量: ⭐⭐⭐⭐⭐ 动机与设计逻辑清晰自然,问题剖析一针见血,图表详实。
- 价值: ⭐⭐⭐⭐⭐ 对非受控物理多模态成像设备的实际部署具有很高的工业与学术参考价值。