Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment¶
会议: ECCV 2026
论文: ECCV 2026 Official
代码: https://github.com/wzy6055/GACR
领域: 语义分割
关键词: 云去除, 观测锚定残差流, 地理语境对齐, 视觉基座模型, 遥感图像解译
一句话总结¶
提出面向解译的地理锚定云去除框架 GACR,通过以含云观测为锚点的残差流匹配与视觉基座模型地理语境流形对齐,消除厚云区域幻觉与语义漂移,在显著提升像素恢复保真度的同时全面增强下游高层解译精度。
研究背景与动机¶
光学卫星遥感图像是地表覆盖制图、城市动态监测和土地资源规划的核心数据源。然而,大气层中广泛分布的云层遮挡会阻断地表反射光谱信号,造成地物结构严重缺失与分析不确定性。为了恢复可用光谱,去云(Cloud Removal, CR)技术已从最初的纯视觉增强预处理,演变为遥感自动化解译管线中不可或缺的物理与语义重建环节。现有的深度学习去云方法主要分为残差去噪与生成式扩散两大流派:前者将云层简化为高斯残差噪声学习直接映射,在厚云场景下因地表信息完全丧失而导致过度平滑与边界模糊;后者基于扩散概率模型合成纹理,却高度依赖无约束的高斯噪声采样,在严重遮挡区域极易生成与真实地理环境相违背的“逼真伪影”与结构幻觉。
这种失效的根源在于现行去云模型普遍采用“视觉保真度驱动(Visual-Fidelity-Oriented)”的优化范式。常规方法主要最小化像素级重建误差(如 L1/L2 损失以追求极高的 PSNR 和 SSIM),默认视觉清晰即等于语义正确。但由于遥感复杂地物具有严密的地理空间关联(如植被连续成片、建筑排列规则、水系地势顺延),缺乏高层语义先验约束的像素级优化会使厚云下的生成细节严重偏离真实地理语境。当重构图像送入下游语义分割、建筑物提取或高度估计网络时,细微的类别失真和拓扑断裂会被层层放大,导致下游解译精度急剧劣化。
本文的切入角度是打破去云从纯噪声起步的随机探索,同时摆脱单纯像素对齐的狭隘范式。核心 idea:将去云重新表述为以含云观测为物理锚点的残差流反演过程,并引入视觉基座模型的地理语境流形对齐约束,使生成轨迹在物理观测约束与高层语义先验的共同引导下,兼顾高质量纹理复原与严格的下游解译可靠性。
方法详解¶
整体框架¶
GACR 框架整体包含三大核心协同组件:基于物理启发的观测锚定残差流(Observation-Anchored Residual Flow, OAR-Flow)、基于预训练视觉基座模型(VFM)的地理语境先验对齐(Geo-Contextual Prior Alignment, GCPA),以及下游任务验证协议。
整个推理流程从输入的含云观测图像 \(x_c\) 出发。OAR-Flow 将确定性概率流常微分方程(ODE)的生成起点锚定在含云图像与其结构化残差扰动上,由轻量高效的沙漏型扩散变换器(Hourglass Diffusion Transformer, HDiT)作为速度场网络,沿确定性流轨迹逐步反向积分,直达无云洁净状态 \(x_*\)。在训练阶段,模型一方面在像素空间计算速度匹配损失 \(\mathcal{L}_{\mathrm{vel}}\),确保流场准确学习从含云扰动状态向真值地表的传输动力学;另一方面从 HDiT 瓶颈层提取特征,经自适应投影器(ADP)映射后,与冻结的 DINOv3 视觉基座模型所提取的无云地表多尺度地理语境表征进行 Patch 级余弦相似度对齐(GCI 损失 \(\mathcal{L}_{\mathrm{GCI}}\)),将重建过程强行规范在地理自洽的特征流形之中。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["含云观测输入 xc 与真实地表 x*"] --> B["观测锚定残差流<br/>构建观测锚定插值轨迹 xt 并解耦速度场"]
B --> C["高效解耦表征架构<br/>HDiT 预测速度场与瓶颈特征提炼"]
C --> D["地理语境先验对齐<br/>VFM 冻结特征抽取与自适应投影余弦约束"]
D --> E["双重目标联合优化与 ODE 积分重建<br/>Lvel 联合 LGCI 约束反演生成无云图像"]
E --> F["下游高层遥感解译评估<br/>地物分类 / 建筑提取 / 语义分割 / 高度估计"]
关键设计¶
1. 观测锚定残差流:基于物理先验与残差扰动的确定性流匹配 传统扩散和流匹配去云方法通常从无条件的高斯纯噪声起点开始采样,导致采样轨迹漫长且不可控。针对厚薄云交织的光学退化特性,OAR-Flow 构造了一个显式依赖含云观测 \(x_c\) 的前向插值过程: $\(x_t = \alpha_t x_* + \beta_t x_c + \sigma_t \epsilon, \quad \epsilon \sim \mathcal{N}(0, \mathbf{I})\)$ 采用线性调度系数 \(\alpha_t = 1 - t\)、\(\beta_t = \rho t\)、\(\sigma_t = t\)(其中 \(t \in [0, 1]\))。在薄云区域,\(x_c\) 中透射出的地表反射率作为物理锚点占据主导,直接锚定低频结构与光谱基调,免除无谓的随机探索;而在厚云完全遮挡区域,高斯扰动 \(\sigma_t \epsilon\) 提供必要的生成自由度以实现语义补全。流匹配传输方程对应的理想速度场为: $\(v_t(x) = \mathbb{E}[\dot{\alpha}_t x_* + \dot{\beta}_t x_c + \dot{\sigma}_t \epsilon \mid x_t = x]\)$ 速度场网络 \(\mathbf{u}_t(x) = \mathrm{Net}_\theta(x_t, t, x_c)\) 以 \(x_c\) 为先验条件直接学习确定性传输向量。在推断时,仅需通过几步 ODE 欧拉积分数值求解 \(\hat{x}_{t-1} = \hat{x}_t - \Delta t \cdot \mathbf{u}_t(\hat{x}_t)\),即可从 \(t=1\) 确定性演化至无云表面 \(\hat{x}_0\),去云速度相比均值回归扩散模型提升数倍且轨迹高度稳定。
2. 地理语境先验对齐:视觉基座模型流形约束与 GCI 损失 针对单纯像素损失易引发厚云遮挡区类别漂移和空间拓扑混乱的问题,GCPA 引入预训练遥感大模型 DINOv3(如 ViT-L/16-SAT-300M 或 ViT-L/16-LVD-1689M)构建高层地理语境流形。设真值图像通过冻结 VFM 编码获得密集语义表征 \(z_* = f_{\mathrm{vfm}}(x_*) \in \mathbb{R}^{B \times C' \times H' \times W'}\)。去云网络 HDiT 的瓶颈层隐藏状态 \(h_t\) 经自适应投影器 ADP(包含自适应池化、通道重排与轻量 MLP)映射到同一维度空间得到 \(z_t\)。模型通过最大化 patch 级余弦相似度构建地理语境完整性损失(GCI Loss): $\(\mathcal{L}_{\mathrm{GCI}} = - \mathbb{E} \left[ \frac{1}{N} \sum_{n=1}^{N} \frac{\langle z_*^{[n]}, z_t^{[n]} \rangle}{\| z_*^{[n]} \|_2 \| z_t^{[n]} \|_2} \right]\)$ 该设计强行约束生成过程中的浅层高频特征与大尺度地理空间先验(如森林连续性、水陆边界分界、规则建筑格局)对齐,彻底阻断模型在厚云下随机构想不合逻辑地物的倾向。
3. 高效解耦表征架构:HDiT 骨干与自适应投影适配 常规标准视觉 Transformer(DiT)在全分辨率像素级去噪中计算复杂度极高(达数百 GFLOPs),难以满足遥感大幅面影像批处理需求。本文采用沙漏型扩散架构 HDiT,通过多尺度层次化分块对特征进行下采样与上采样,将计算量骤降至原有的四分之一以下。更为关键的是,HDiT 最深层瓶颈富集了全局长程语义,与外部视觉大模型 VFM 的深层 Token 具有自然的尺度与语义映射对应关系;通过自适应投影器 ADP,既避免了对外部大模型进行参数微调带来的灾难性遗忘与巨大显存开销,又实现了像素级流场去噪与深层语义流形约束的平滑解耦。
损失函数 / 训练策略¶
模型整体端到端优化的联合损失函数形式为: $\(\mathcal{L} = \mathcal{L}_{\mathrm{vel}} + \lambda \mathcal{L}_{\mathrm{GCI}}\)$ 其中速度匹配损失 \(\mathcal{L}_{\mathrm{vel}}\) 定义为网络预测速度场与解析目标场之间的均方误差: $\(\mathcal{L}_{\mathrm{vel}} = \mathbb{E}_{x_*, \epsilon, x_c, t} \left[ \left\| \mathbf{u}_t(x_t) - (\dot{\alpha}_t x_* + \dot{\beta}_t x_c + \dot{\sigma}_t \epsilon) \right\|^2 \right]\)$ 超参数 \(\lambda\) 平衡像素重建速度匹配与高层地理语境对齐强度,实验表明 \(\lambda = 0.5\) 时能在像素级去噪精度与高层语义一致性之间达到最佳平衡。
实验关键数据¶
主实验¶
在涵盖真实含云与合成厚薄云的 6 个标准基准数据集上,GACR 与代表性 CNN、Transformer、Mamba 及扩散去云方法进行了定量对比。如下表所示,GACR 全面刷新了各项指标,尤其在厚云恶劣场景展现出巨大优势:
| 方法 | CUHKCR-GZ PSNR↑ / SSIM↑ | CUHKCR-CS PSNR↑ / SSIM↑ | Potsdam-Thick PSNR↑ / SSIM↑ | Vaihingen-Thick PSNR↑ / SSIM↑ |
|---|---|---|---|---|
| MPRNet (WACV 2021) | 23.454 / 0.712 | 23.365 / 0.695 | 26.418 / 0.902 | 27.805 / 0.935 |
| Restormer (CVPR 2022) | 25.839 / 0.743 | 23.632 / 0.710 | 28.831 / 0.922 | 28.867 / 0.922 |
| AST (CVPR 2024) | 25.482 / 0.735 | 23.365 / 0.695 | 25.886 / 0.890 | 26.471 / 0.916 |
| MambaIR (ECCV 2024) | 25.626 / 0.733 | 23.445 / 0.704 | 27.027 / 0.903 | 29.852 / 0.945 |
| DFCFormer (JSTARS 2025) | 25.816 / 0.746 | 23.876 / 0.711 | 28.196 / 0.917 | 30.396 / 0.951 |
| EMRDM (CVPR 2025) | 25.862 / 0.747 | 23.736 / 0.712 | 27.199 / 0.923 | 28.979 / 0.951 |
| GACR-SAT/2 (本文) | 25.964 / 0.736 | 24.230 / 0.709 | 30.578 / 0.934 | 33.018 / 0.964 |
| GACR-SAT/1 (本文) | 26.100 / 0.744 | 24.354 / 0.713 | 31.049 / 0.938 | 34.048 / 0.970 |
在 12 项下游解译任务(涵盖分类 CLS、建筑提取 BLD、语义分割 SEG、高度估计 HE)上,使用独立冻结的 DINOv3 权重评测,GACR 实现了断层式领先:
| 模型 | CLS-1 (Acc.↑) | BLD-2 (IoU↑) | SEG-2 (mIoU↑) | SEG-4 (mIoU↑) | HE-2 (RMSE↓) | HE-4 (RMSE↓) |
|---|---|---|---|---|---|---|
| 无去云 (下界) | 0.746 | 0.596 | 0.490 | 0.550 | 2.703 | 2.095 |
| EMRDM (CVPR 2025) | 0.776 | 0.696 | 0.668 | 0.692 | 2.133 | 1.629 |
| DFCFormer (JSTARS 2025) | 0.763 | 0.657 | 0.630 | 0.671 | 2.317 | 1.687 |
| GACR-SAT/2 (本文) | 0.833 | 0.710 | 0.699 | 0.737 | 2.014 | 1.554 |
| 清晰原图 (上界) | 0.882 | 0.762 | 0.733 | 0.755 | 1.868 | 1.477 |
消融实验¶
在 CUHKCR-EXT-CS 数据集上对生成动力学与语境约束进行的解耦消融分析:
| 模型配置 | PSNR ↑ | SSIM ↑ | 分类 (CLS) ↑ | 建筑提取 (BLD) ↑ | 计算量 (GFLOPs) | 说明 |
|---|---|---|---|---|---|---|
| DiT + MRDM | 24.037 | 0.707 | 0.670 | 0.693 | 697.20 | 传统扩散变换器,显存与计算开销极大 |
| HDiT + MRDM | 23.736 | 0.712 | 0.726 | 0.696 | 166.72 | 采用沙漏骨干,速度提升但扩散轨迹仍冗长 |
| HDiT + OAR-Flow | 23.986 | 0.698 | 0.690 | 0.700 | 56.05 | 引入观测锚定残差流,计算量锐降至 56G |
| HDiT + OAR-Flow + GCPA (完整 GACR) | 24.230 | 0.709 | 0.781 | 0.710 | 56.05 | 加入地理语境先验,下游分类暴增 9.1% |
在 Vaihingen-CR-Thick 上针对超参数 \(\lambda\) 与 Patch 尺寸 \(p\) 的敏感性消融:
| 配置参数 | PSNR ↑ | SSIM ↑ | 语义分割 (SEG) ↑ | 高度估计 (HE) ↓ | 计算量 (GFLOPs) | 说明 |
|---|---|---|---|---|---|---|
| \(\lambda = 0.2\) (\(p=2\)) | 33.073 | 0.965 | 0.728 | 1.578 | 56.05 | 语义约束偏弱,下游指标稍低 |
| \(\lambda = 0.5\) (\(p=2\)) | 33.018 | 0.964 | 0.737 | 1.554 | 56.05 | 最佳平衡点,下游性能达到峰值 |
| \(\lambda = 1.0\) (\(p=2\)) | 32.838 | 0.964 | 0.730 | 1.563 | 56.05 | 语境约束稍显过强,轻微限制高频像素恢复 |
| \(\lambda = 5.0\) (\(p=2\)) | 32.615 | 0.962 | 0.727 | 1.596 | 56.05 | 语义过拟合,去噪纹理略失真 |
| \(p = 4\) (\(\lambda=0.5\)) | 30.303 | 0.949 | 0.693 | 1.616 | 14.15 | 分块过大,细粒度纹理恢复受限 |
| \(p = 1\) (\(\lambda=0.5\)) | 33.799 | 0.969 | 0.720 | 1.548 | 223.60 | 细粒度极致保真,但计算量增加 4 倍 |
关键发现¶
- 观测锚定大幅加速收敛:相比传统均值回归扩散模型 EMRDM,OAR-Flow 仅需大约 1/3 的迭代步数即可达到高 PSNR 区间;结合 GCPA 后,整体训练收敛速度提升达 5 倍之多。
- 稠密下游任务对去云质量极度敏感:在全局场景分类任务中,厚云图像通过端到端训练也能达到较高准确率;但在语义分割(SEG)与高度估计(HE)等像素级稠密解译任务中,未去云图像性能发生断崖式下跌(Vaihingen 厚云下分割 mIoU 仅 0.490),而 GACR 恢复到了 0.699(逼近真值上限 0.733),证明地理语境约束对恢复精细地表几何与类别边界具有决定性作用。
- 语境先验有效抑制特征分布漂移:特征距离分布分析表明,传统去云结果提取的高层特征与清晰图像存在明显的分布偏移,而 GACR 提取的特征空间分布与真实无云图像高度重合,说明其生成的纹理具有货真价实的地理物理意义。
亮点与洞察¶
- 从纯噪声生成转向物理观测锚定:巧借观测图像 \(x_c\) 作为确定性 ODE 积分的动态锚点,自适应处理薄云透射与厚云遮挡,彻底解决了传统扩散模型无根无据“开局一张噪声图,内容全靠编”的致命缺陷。
- 打通低层去噪与高层解译的语义桥梁:巧妙借助冻结的视觉基座模型(VFM)特征空间构建余弦相似度监督,用极小的计算开销(仅增加一个轻量 ADP 投影器)将大模型的地理空间常识无缝注入去噪网络。
- 计算效率与解译精度的极致折中:通过沙漏型 HDiT 结构搭配 \(p=2\) 的分块策略,在保持仅 56 GFLOPs 的极低计算量下,不仅 PSNR 超过数百 GFLOPs 的大模型,更在 12 项高层下游任务中全面碾压所有现有 SOTA。
局限与展望¶
- 作者承认的局限:模型依赖预训练视觉基座模型(如 DINOv3)提供强有力的地理特征先验,若面对极端异质的罕见地理地貌或新型传感器光谱波段,缺乏预训练表征覆盖可能削弱语境引导效能。
- 深入分析的局限:目前评测主要集中在单时相光学去云场景;在实际卫星遥感作业中,多时相序列影像与 SAR(合成孔径雷达)穿透微波辅助是解决全天候全厚云遮挡的主流手段,本方法尚未显式纳入多模态 SAR-光学异构融合机制。
- 未来改进方向:可将观测锚定残差流机制拓展至多模态条件扩散框架中,联合 SAR 散射特性与多时相先验,形成面向复杂全天候遥感观测解译的一体化大模型基座。
相关工作与启发¶
- vs EMRDM (CVPR 2025):EMRDM 采用均值回归随机微分方程(SDE)进行扩散去云,采样步数多、训练耗时长且单纯追求像素保真度;本文提出确定性 OAR-Flow,轨迹显著变短且收敛速度快 5 倍,并通过 GCPA 显式保障下游语义对齐。
- vs DFCFormer (JSTARS 2025):DFCFormer 采用双域频域 Transformer 进行去云重建,属于确定性残差回归路线,在极端厚云区因信息全无而退化为平滑模糊;本文通过残差流赋予模型合理的生成自由度,结合 VFM 语义流形实现了真实自洽的结构补全。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [将流匹配确定性物理锚定与视觉大模型语义流形先验结合,开创面向高层解译的去云新范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [横跨 6 个真实/合成去云数据集与 12 个高层遥感下游任务,全方位验证像素与语义双重指标]
- 写作质量: ⭐⭐⭐⭐⭐ [动机明确、数学推导严密、图表详实直观,逻辑层层递进]
- 价值: ⭐⭐⭐⭐⭐ [直击遥感去云结果无法直接用于下游高精度测绘解译的工业界核心痛点,实用价值极高]