跳转至

Learning Semantic-Robust Change Detection via Semantic-Invariant Self-Distillation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/elecreak/SCDistill
领域: 遥感 / 变化检测
关键词: 变化检测, 自蒸馏, 视觉基础模型, 扩散模型扰动仿真, 语义表征学习

一句话总结

针对遥感双时相变化检测中光照、阴影和天气等非语义环境扰动导致的虚警与漏检问题,本文提出 SCDistill 框架,通过扩散模型仿真真实外观扰动,并利用语义不变自蒸馏促使视觉基础模型编码器提取抗干扰表征,在语义变化检测、二值变化检测与变化描述任务上均取得 SOTA。

研究背景与动机

双时相遥感图像变化检测(Change Detection, CD)在城市规划、土地覆盖制图和环境灾害监测等领域具有核心价值。随着深度学习的发展,结合孪生特征提取与时序差分交互的网络架构已取得了显著进展。然而,现实场景采集的卫星与航空图像不可避免地受到太阳高度角、光照阴影、云雾大气乃至季节更替等非语义环境因素的剧烈干扰。现有方法通常直接微调在单张自然图像分类或分割任务上预训练的视觉基础编码器(如 ResNet 或单视角 ViT),这类编码器对像素级外观波动高度敏感,极易把未改变地物的辐射亮度漂移误判为地表覆盖的语义更替,产生大量虚警;或者在强光照阴影覆盖真实地物边界时漏检真正的语义结构变化。

这种鲁棒性缺陷源自“数据分布”与“表征特性”的双重瓶颈。从数据端来看,现有的合成变化检测数据集(如 FSC-180k、Changen2 等)主要侧重于生成前景物体的语义增删与布局替换,却普遍假设背景未改变区域在时相间处于理想对齐的光照与纯净大气状态,无法为模型提供具有真实物理扰动的负监督信号。从表征端来看,通用视觉基础模型虽然具备丰富的语义先验,但并未显式建立跨环境扰动的语义不变性约束;一旦直接将外观敏感特征馈入下游差分分支,噪声便会在解码层不断放大。

为了打破这一困境,本文从数据增强与表征自蒸馏两个维度协同发力:一方面通过生成式模型重现真实的物理环境扰动,另一方面通过自监督蒸馏迫使编码器内化环境无关的语义不变性。核心 idea:利用场景重照明模型与指令扩散模型为双时相样本合成逼真的非语义环境扰动,并以冻结的干净图像视觉基础模型为教师,通过自蒸馏约束受扰动学生网络对齐语义特征,从而无需人工标注即可端到端习得强抗扰动能力。

方法详解

整体框架

SCDistill 包含两个紧密协同的核心阶段:基于扩散模型的非语义扰动仿真与语义不变自蒸馏,并在下游将蒸馏得到的鲁棒视觉基础模型编码器(Distilled VFME)与时空变化检测网络深度融合。整体工作流首先在合成或单时相遥感图像上引入真实物理外观扰动,构造语义绝对一致但外观剧烈波动的成对数据;随后,冻结的基础模型教师网络处理未受扰动的干净输入,引导学生网络从扰动输入中提取出高度一致的高层语义表征;最终,将训练好的抗干扰编码器作为主干注入变化检测框架,与浅层时空差分特征融合并输入通用解码器生成预测。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["双时相遥感样本 / 合成数据集"] --> B["非语义扰动仿真<br/>DIR 重照明 + InstructPix2Pix 天气编辑"]
    B --> C["噪声增强语义对<br/>外观扰动但语义完全一致"]
    C --> D["语义不变自蒸馏<br/>冻结教师引导学生对齐干净特征"]
    D --> E["蒸馏鲁棒编码器 Distilled VFME<br/>输出抗非语义干扰的时相特征"]
    E --> F["下游变化检测与解码<br/>多模态/多任务检测头输出变化预测"]

关键设计

1. 非语义扰动仿真:重构物理可信的环境外观扰动 合成变化检测数据集有效缓解了高分辨率双时相遥感标注匮乏的问题,但过往生成管线仅改变变化区域语义,未变区域保持理想一致,导致模型在真实环境噪声下泛化脆弱。为了赋予训练数据真实的光照与气象多样性,本文构建了一条解耦的扩散扰动仿真管线。给定样本三元组 \(\{X_0, X_1, L\}\),非语义变化本质上只需作用于单一时相即可破坏跨时相的外观恒定性,因此本文对前时相图像 \(X_0\) 施加连续扰动。针对太阳方位与高度角变化引起的阴影与照明差异,采用单图重照明模型 DIR(方位角在 \(0^\circ \sim 360^\circ\)、仰角在 \(20^\circ \sim 70^\circ\) 范围内均匀采样)渲染逼真的三维光照阴影;针对薄雾、暴雨、降雪等复杂气象变化,引入 InstructPix2Pix 并结合预设的天气文本提示词进行图像级可控编辑。两类编辑串联生成多版本受扰动图像: $\(\tilde{X}_0^{(i)} = \text{Relighting}(\text{Editing}(X_0, p_i))\)$ 结合底层高斯模糊、灰度拉伸和饱和度色彩抖动,构成了兼具大尺度物理光学变化与微观像素噪声的鲁棒训练集,彻底消除了合成数据与真实遥感环境的非语义域差。

2. 语义不变自蒸馏:在无标注下迫使编码器内化环境不变性 即便拥有丰富的扰动数据,若仅靠下游任务的有监督损失进行反向传播,主干网络往往依然倾向于拟合容易走捷径的低层纹理信息。本文提出语义不变自蒸馏机制(Semantic-Invariant Self-Distillation),将通用大模型(如 DINOv2 或 DINOv3)作为冻结教师网络 \(E_T\),学生网络 \(E_S\) 具有相同架构并由同一权重初始化。将干净图像 \(X\) 送入教师提取理想语义表征 \(F_T = E_T(X)\),而学生网络接收叠加了多重非语义扰动的样本 \(\tilde{X}\),输出受扰特征 \(F_S = E_S(\tilde{X})\)。蒸馏目标采用均方误差回归损失,迫使学生网络抹除一切由光照、阴影和天气带来的高维特征波动: $\(\mathcal{L}_{distill} = \|F_S - F_T\|_2^2\)$ 这一过程完全基于单时相或自合成样本展开,无需任何像素级变化标签或地物分类标注,极易在大规模无标注遥感底图上扩展。值得注意的是,教师网络本身在面对扰动图像时同样存在表征漂移,但由于教师仅接收未被扰动的纯净基准图,其输出的语义真值是稳定可靠的,学生网络的抗扰动能力完全来自于跨外观条件的自蒸馏对齐过程,而非简单继承教师现存的鲁棒性。

3. 鲁棒特征融合与多任务检测解码:多尺度特征引导与伪影抑制 为了将自蒸馏习得的抗干扰表征无缝赋能至下游任务,本文以 Change3D 的时空视频编码与通用解码框架为基座,将蒸馏好的鲁棒编码器(Distilled VFME)集成到双分支骨干中。对于给定的前时相与后时相图像对 \((I_0, I_1)\),蒸馏编码器分别提取出高度稳定的高层语义嵌入 \(F_0\) 与 \(F_1\)。这两个特征被注入并引导浅层 X3D 视频特征提取分支,在高维时空关联建模前对底层差分激活值进行语义标定与门控,过滤掉因光照反射率或云影移动导致的伪差分信号。融合后的时空变化特征随后馈入特定任务的解码头,以统一范式支持语义变化检测(SCD)、二值变化检测(BCD)和遥感变化描述(Change Captioning)。

损失函数 / 训练策略

训练流程划分为预训练与下游微调两阶段。在自蒸馏阶段,采用 AdamW 优化器,学习率为 \(2 \times 10^{-5}\),权重衰减为 0.05,批大小为单卡 8。完成表征自蒸馏后,将骨干网络置于扩散增强合成数据集 FSC-180k 上进行变化检测预训练(约 20 小时单次开销),最后在目标真实基准上进行下游微调。 在下游微调阶段,采用多任务联合损失函数: - 语义变化检测(SCD):联合使用交叉熵损失 \(\mathcal{L}_{ce}\)、Dice 分割损失 \(\mathcal{L}_{dice}\) 以及衡量双时相未变区域特征相似度的余弦相似度损失 \(\mathcal{L}_{cos}\): $\(\mathcal{L}_{SCD} = \mathcal{L}_{ce} + \mathcal{L}_{dice} + \mathcal{L}_{cos}\)$ - 二值变化检测(BCD):采用 \(\mathcal{L}_{ce} + \mathcal{L}_{dice}\) 监督变化区域的前背景边界。 - 变化描述(Change Captioning):使用自回归文本交叉熵损失 \(\mathcal{L}_{ce}\) 优化文字序列生成。

实验关键数据

主实验

在语义变化检测两大最具代表性的高分辨率真实基准 SECOND 与 HRSCD 上,SCDistill 与当前代表性主流模型进行了严格评测。评价指标包括变化区域 F1 分数(\(F_{scd}\))、平均交并比(mIoU)、整体准确率(OA)以及分离 Kappa 系数(SeK)。

方法 主干网络 SECOND \(F_{scd}\) (%) SECOND mIoU (%) SECOND SeK (%) HRSCD \(F_{scd}\) (%) HRSCD mIoU (%) HRSCD SeK (%)
SSCD-L (TGRS'22) ResNet 61.22 72.60 21.86 69.69 66.21 21.88
Bi-SRNet (TGRS'22) ResNet 61.85 72.08 21.36 71.72 67.83 24.59
ChangeMamba (TGRS'24) Mamba-based 61.59 72.32 20.30 70.04 67.93 24.50
Changen2 (TPAMI'24) ViT 62.79 72.39 22.09 73.03 68.73 26.25
Change3D (CVPR'25) VideoEncoder 62.83 72.95 22.98 73.29 68.67 26.85
SCDistill (本文) Distilled VFME 65.64 74.01 25.12 74.29 70.28 28.38

在泛化性评估中,SCDistill 在二值变化检测(CLCD、LEVIR-CD、WHU-CD)和变化描述(DUBAI-CC)上也显著超越基线。在 DUBAI-CC 描述任务上,SCDistill 的 CIDEr 得分由 Change3D 的 86.19 跃升至 95.59(提升 9.40 个点),BLEU-2 达到 59.77%,展现出语义级描述的高精确度。

消融实验

为了验证扰动仿真和自蒸馏各自的贡献及其协同作用,作者在 SECOND 基准上进行了系统消融(Table 4),同时评估了真实未改变区域上自蒸馏前后的特征距离与对齐度(Table 6)。

实验配置 扰动仿真 (Simulate) 自蒸馏 (Distill) \(F_{scd}\) (%) mIoU (%) OA (%) SeK (%)
Vanilla 基线 ✗ ✗ 62.86 72.54 87.53 22.30
仅加入扰动仿真 ✔ ✗ 63.55 73.10 87.87 23.39
仅加入自蒸馏 ✗ ✔ 63.91 73.13 88.24 23.37
完整模型 (Ours) ✔ ✔ 65.64 74.01 88.59 25.12

自蒸馏前后在真实 HRSCD 数据集未变图像对上的特征度量分析: | 蒸馏状态 | 特征均方误差 MSE (↓) | 余弦相似度 Cosine (↑, %) | 中心核对齐度 CKA (↑, %) | |---|---|---|---| | 蒸馏前 (Before) | 6.41 | 84.05 | 87.08 | | 蒸馏后 (After) | 3.32 | 89.78 | 90.89 |

关键发现

  • 非线性协同效应显著:单纯引入数据仿真带来 \(+0.69\) \(F_{scd}\) 提升,单纯做蒸馏带来 \(+1.05\) 提升,而两者联合实现了 \(+2.78\) 的增幅(SeK 更是由 22.30 提升至 25.12),表明高质量的物理级负样本仿真与自监督不变性蒸馏是相互依赖的闭环,缺一不可。
  • 真实未变区域的特征不变性实质性提升:表征分析显示,蒸馏后未变地物特征的 MSE 下降近一半(6.41 降至 3.32),Cosine 相似度逼近 90%,高维主成分特征热力图上原本受阴影与云层激发的虚警激活被近乎完全抑制。
  • 跨主干与少样本泛化优异:无论教师模型是 DINOv2 还是 DINOv3,自蒸馏均能稳定带来约 1.2% ~ 2.1% 的 \(F_{scd}\) 增益;在仅使用 1% 真实标注的极少样本设定下,完整模型相比未蒸馏版本 \(F_{scd}\) 高出 6.7%(55.6% vs 48.9%),验证了该表征在大规模无监督预训练中学习到了高度泛化的本质几何与类别结构。

亮点与洞察

  • 解耦物理先验的生成式环境扰动:利用单图 3D 重照明(DIR)与指令图生图(InstructPix2Pix)精准模拟太阳高度角和天气大气变化,比传统的色彩抖动或 GAN 随机插值更具真实物理因果性,为双时相学习提供了高质量负样本流。
  • “以自身为师”构建不变性表征:避开了人工标注成本,利用纯净输入的基础大模型充当“金标准”,在受噪输入下反向拉齐特征。这种让学生在不改变语义的前提下“无视外观伪装”的思想,可广泛推广至全天候无人机视觉感知、自动驾驶恶劣天气建图等任务。
  • 单次蒸馏跨任务复用:自蒸馏编码器仅需单次无监督学习(仅需 5 小时),完成后可直接插拔到二值检测、多类语义检测乃至变化字幕生成中,展现了类似遥感基础特征组件的即插即用价值。

局限与展望

  • 极端几何与视点形变未显式建模:当前的仿真管线主要针对光照、阴影和大气等辐射/颜色维度的非语义变化,对由于卫星侧视倾角不同、建筑物透视投影投影差(高层建筑倾斜)引起的几何非语义伪变化缺乏专门建模。
  • 计算流程包含多阶段依赖:生成逼真的气象与光照数据需要调用额外的重照明网络与扩散编辑模型,离线构建成本较高;未来若能将隐空间轻量扰动生成器与蒸馏框架端到端联合训练,管线将更加轻量精简。

相关工作与启发

  • vs Changen2 / ChangeDiff:Changen2 等利用扩散模型生成完整的双时相语义替换与伪地物,侧重于“造出更多语义变化类别”;而 SCDistill 敏锐指出模型在真实场景中最容易在“未改变背景”上翻车,因此专注在保持真实语义不变的前提下仿真非语义干扰,二者在数据增强维度上形成高度互补。
  • vs Change3D:Change3D 首次将视频时空关联网络引入变化检测,但在主干上仍受制于单图或通用视频编码器的外观敏感性;SCDistill 将抗干扰自蒸馏特征与 Change3D 解码器深度融合,填补了特征层物理鲁棒性的短板。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (巧妙地将物理扰动仿真与无监督跨条件自蒸馏结合解决遥感虚警痛点)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖语义变化检测、二值检测、变化描述三大任务,并包含详细的 CKA/MSE 表征分析与少样本实验)
  • 写作质量: ⭐⭐⭐⭐⭐ (论述清晰,动机切中行业共性难题,框架图与分析逻辑完整)
  • 价值: ⭐⭐⭐⭐⭐ (为真实全天候遥感观测提供了高实用价值且即插即用的鲁棒特征学习范式)