Free‑CD: Probabilistically Decoupled Training-Free Open-Vocabulary Change Detection with Resolution-Invariant Feature Inversion¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/20374230/FreeCD
领域: 语义分割
关键词: 遥感变化检测、开词汇表变化检测、无训练推理、傅里叶神经算子、贝叶斯概率校正
一句话总结¶
针对传统开词汇表变化检测中实例分割引入的过分割与边界模糊缺陷,本文提出无需任务特定微调的 Free-CD 框架,将变化检测解耦为潜在变化概率估计与双时相开词汇表语义分割,并结合分辨率不变特征反演上采样器(RIFI-Up)与贝叶斯概率校正,显著刷新多项遥感基准 SOTA。
研究背景与动机¶
遥感语义变化检测(Semantic Change Detection, SCD)旨在从双时相遥感影像中精准识别地表覆盖发生转变的空间范围及具体语义类型,是城市规划、灾害应急与生态监测的核心技术。尽管全监督深度学习方法在标准基准上取得了优异的像素级精度,但高度受限于预先固定的类别字典,无法应对实际对地观测中未定义的开放概念。随着通用视觉语言模型(如 CLIP、DINO)的飞速发展,开词汇表变化检测(Open-Vocabulary Change Detection, OVCD)成为极具潜力的范式,但其核心瓶颈在于基础模型追求高层语义抽象与变化检测严苛要求像素级空间保真度之间的固有粒度差距。
现有主流架构(如 DynamicEarth)通常依赖 SAM 或 APE 等实例分割模型显式提取几何边界,试图以此弥合粒度差距。然而,这种将检测与识别强耦合的刚性实例边界方案在遥感场景下暴露出严重的语义模糊性:一方面,遥感地物以连片连续分布的地表覆盖(如裸土、耕地、草地)为主,离散实例目标较少,强行实例提取极易诱发严重的过分割(将同一地块切割得支离破碎)或欠分割;另一方面,低矮植被与林地等类别之间存在渐变与模糊边界,硬性赋予确定性二值掩码会导致错误的语义置信度,使误差在时序比较中级联放大。
与其在前端强加确定性实例边界,不如将变化区域预测重构为连续的概率分布建模,在容纳边界不确定性的同时借助高质量特征反演维持空间细节。核心 idea:将开词汇表变化检测解耦为无训练的潜在变化概率估计与双时相单期语义分割两路并行任务,提出基于傅里叶神经算子的分辨率不变特征反演上采样器(RIFI-Up)消除多时相特征伪影,并利用贝叶斯概率校正消除单双时相背景定义歧义。
方法详解¶
整体框架¶
Free-CD 的核心理念在于将开词汇表变化检测中的“变化发生判定”与“地物类别识别”在概率空间彻底解耦。整个推理流水线分为三个紧密协作的阶段:首先,通过潜在变化区域提议分支,利用视觉编码器提取双时相低分辨率特征,经由 RIFI-Up 高保真上采样后计算像元级余弦相似度,生成潜在变化先验概率;其次,双时相开词汇表分割分支独立对两期影像执行开放文本概念驱动的单期密集语义预测,输出各前景类别的条件概率;最后,贝叶斯概率校正模块修正单时相与多时相任务之间背景定义的统计偏差,并将校正后的变化概率与语义分布融合生成最终的双时相语义变化掩码。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["双时相遥感影像输入"] --> B["潜在变化区域提议<br/>特征提取 + RIFI-Up 上采样"]
A --> C["双时相开词汇表语义分割<br/>单期密集概念预测"]
B --> D["变化相似度先验概率 P(F)"]
C --> E["单期类别条件概率 P(c|C)"]
D --> F["贝叶斯概率校正<br/>背景校准与双时相一致性"]
E --> F
F --> G["最终语义变化掩码输出"]
关键设计¶
1. 潜在变化区域提议与 RIFI-Up 上采样:消除分辨率畸变引起的伪变化伪影
传统特征双线性插值或普通转置卷积在放大 DINO 等视觉骨干网络的低分辨率特征时,往往丢失高频边界细节并产生明显的棋盘效应与语义漂移,导致双时相特征比对时出现大量假阳性伪影。为构建鲁棒的连续尺度空间映射,本文提出集成傅里叶神经算子(FNO)的特征上采样器 RIFI-Up。对于 ViT 编码器 \(\Phi_{\text{enc}}\),虽然其映射在理论上具有单射性,但解析求逆极为困难。本文利用神经算子逼近伪逆映射,并强制该映射满足分辨率不变性约束:无论输入特征尺度如何变化,伪逆算子均能重构出无伪影的对应空间域图像。
在具体实现中,RIFI-Up 采用堆叠的联合双边上采样器(Joint Bilateral Upsampler, JBU)以原始高清图像为引导进行空间重建。在多时相特征比对时,两期影像的高清特征余弦相似度经由负向 Sigmoid 映射为无参数的先验变化概率:
得益于 FNO 在频域的网格独立性,该上采样过程能够自适应过滤因空间分辨率差异引发的高频高斯噪声,保证特征差异纯粹源于实际地表变化。
2. 贝叶斯概率校正:消除单时相与双时相任务中的背景概率定义偏差
在单时相开词汇表语义分割中,“背景”类通常被定义为不属于预设前景集合的互补事件;而在双时相变化检测中,“未发生变化”或“发生变化但属于非目标类别”共同构成了多时相背景事件,两者在定义上的错位直接导致单期预测直接相乘时置信度严重失真。为此,本文建立了基于贝叶斯定理的背景概率校准机制。令 \(\mathcal{V} = \mathcal{C} \setminus \{\text{"background"}\}\) 为感兴趣的前景类别集合,\(B\) 表示单期图像中区域被判定为背景的事件。校正后的多时相有效前景变化概率 \(P(F' \mid \mathcal{C})\) 显式剔除两期影像中被识别为单期背景的置信度:
进一步地,联合多时相语义变化条件概率可精确表示为:
该校准项将单期 OVSS 模型的语义分类范围限定在严格的前景子集 \(\mathcal{V}\) 内,从数学公式上彻底消除了无变化区域误报为背景变化的模糊性。
3. 无参数掩码融合:自适应阈值截断与双时相语义对齐
在获得校正后的概率分布后,为避免硬编码阈值在跨传感器、跨分辨率场景下的性能崩塌,Free-CD 引入自适应掩码融合机制。首先,对全局概率图 \(P(F' \mid \mathcal{C})\) 采用 Otsu 大津自适应阈值分割算子 \(\Phi_{\text{threshold}}\) 自动解算最优分割界限,生成二值变化掩码:
随后,将二值掩码作为强空间门控因子,与通过最大后验概率(argmax)算子提取的各时相优势前景语义进行逐像元按位相乘:
该操作在推理期完全无参数且零梯度计算,既约束了语义仅在真实发生变化的几何区域内分配,又天然维持了双时相几何边界的严格空间重合度。
损失函数 / 训练策略¶
虽然 Free-CD 整体属于变化检测任务无微调(training-free)框架,但其中的基础模块 RIFI-Up 需在通用遥感数据集(MillionAID)上经过极少量的预训练(共计 1 epoch,batch size 为 4)。预训练分为两阶段:第一阶段训练频域 FNO 逆网络,以均方误差最小化特征到低分辨率降采样图像的重建误差 \(\mathcal{L}_{\text{FNO}} = \|\mathcal{G}_\theta(F) - \Phi_{\text{down}}(I)\|_2^2\);第二阶段冻结 FNO 参数,优化上采样器参数,采用多视角特征重建损失 \(\mathcal{L}_{\text{rec}}\) 与图像恢复约束 \(\mathcal{L}_{\text{img}}\) 的复合目标函数:
其中 \(\gamma = 0.1\) 为平衡权重系数,\(\mathcal{L}_{\text{rec}}\) 引入平移、缩放、裁剪与翻转等多视角扰动提升空间泛化能力。在后续的下游变化检测推理中,全部网络权重完全冻结,直接即插即用。
实验关键数据¶
主实验¶
在四个权威遥感语义变化检测基准(SECOND、HiUCD、HRSCD、JL1-SCD)上,Free-CD 与主流开词汇表基线 DynamicEarth 进行了全面定量对比。评估指标采用语义变化检测综合指标 \(F_{\text{scd}}\) 与平均交并比 \(\text{mIoU}\)(%)。
| 数据集 | 骨干与识别器配置 | 本文 (Free-CD) \(F_{\text{scd}}\) / \(\text{mIoU}\) | DynamicEarth \(F_{\text{scd}}\) / \(\text{mIoU}\) | 相对提升 (\(F_{\text{scd}}\) / \(\text{mIoU}\)) |
|---|---|---|---|---|
| SECOND | DINOv3 + SegEarth-OV | 23.19 / 59.84 | 20.50 / 58.77 | +2.69 / +1.07 |
| HiUCD | DINOv3 + SegEarth-OV | 30.00 / 54.99 | 23.24 / 53.21 | +6.76 / +1.78 |
| HRSCD | DINOv3 + SegEarth-OV | 8.37 / 57.73 | 3.18 / 48.38 | +5.19 / +9.35 |
| JL1-SCD | DINOv3 + SegEarth-OV | 16.15 / 52.37 | 8.07 / 40.31 | +8.08 / +12.06 |
| LEVIR-CD (建筑物) | DINOv2 + SegEarth-OV | 59.1 (F1) / 41.9 (IoU) | 53.6 (F1) / 36.6 (IoU) | +5.5 / +5.3 |
| WHU-CD (建筑物) | DINOv2 + SegEarth-OV | 64.6 (F1) / 48.6 (IoU) | 57.7 (F1) / 40.6 (IoU) | +6.9 / +8.0 |
消融实验¶
为验证特征上采样方案中特征反演(FI)与分辨率不变性(RI)约束的有效性,在统一 DINOv3 + SegEarth-OV 骨干下对不同上采样算子进行剥离分析(指标为 \(F_{\text{scd}}\) / \(\text{mIoU}\),单位 %):
| 上采样配置 | 特征反演 (FI) | 分辨率不变 (RI) | SECOND | HiUCD | HRSCD | JL1-SCD |
|---|---|---|---|---|---|---|
| 双线性插值 (Bilinear) | ✗ | ✗ | 21.11 / 56.32 | 28.57 / 52.25 | 8.23 / 57.22 | 15.14 / 49.64 |
| 传统联合双边上采样 (JBU) | ✗ | ✗ | 21.47 / 56.43 | 28.73 / 53.23 | 8.24 / 57.27 | 15.51 / 50.44 |
| 转置卷积 (Conv) | ✗ | ✗ | 18.72 / 54.07 | 28.97 / 53.85 | 7.89 / 56.90 | 15.18 / 50.91 |
| 仅预训练 JBU | ✗ | ✗ | 21.53 / 57.91 | 29.56 / 54.40 | 8.29 / 57.36 | 15.77 / 51.54 |
| 预训练 JBU + FI | ✓ | ✗ | 22.18 / 58.87 | 29.74 / 54.54 | 8.18 / 57.30 | 15.62 / 51.43 |
| RIFI-Up (JBU + FI + RI, 本文) | ✓ | ✓ | 23.19 / 59.84 | 30.00 / 54.99 | 8.37 / 57.73 | 16.15 / 52.37 |
关键发现¶
- 分辨率不变约束至关重要:在消融实验中,缺少 RI 约束的特征反演仅将高分辨率特征强行拟合到图像空间,导致两期特征在微小尺度扰动下产生剧烈漂移;引入 FNO 的频域连续算子约束后,在所有四个数据集上均实现显著且稳定的增益,尤其在极高分辨率 HRSCD 和 JL1-SCD 数据集上提升最为显著。
- 解耦概率显著改善连片地物表征:定性与定量对比显示,在包含大片连续农田、裸土、林地的遥感场景下,传统 SAM-based 方法产生极其杂乱的细碎实例网格;Free-CD 规避了硬实例分割后,完整保留了连续连片区域的空间拓扑一致性。
- 骨干通用性强:在 CLIP、RemoteCLIP 和 GeoRSCLIP 等不同遥感多模态大模型上,RIFI-Up 均展现出即插即用的自适应优势,验证了框架对底层编码器特征分布的高度宽容度。
亮点与洞察¶
- 抛弃硬边界、回归连续概率建模:将变化区域定位转化为无参数概率估计,不仅避免了遥感图像中对连片非离散地物做实例提议的固有缺陷,更在数学上自然融合了边界过渡带的语义不确定性。
- FNO 频域连续算子在特征超分的巧妙结合:传统特征上采样往往将低维特征当作离散网格拉伸,本文借助傅里叶神经算子的网格独立性构建特征伪逆,保证上采样特征具备严格的空间分辨率不变性,从根源上消除了伪变化假阳性。
- 即插即用的训练友好范式:整套框架无需在目标变化检测数据集上做任何参数微调,既能灵活对接任意单期开词汇表分割器,又能直接调用任意视觉骨干,极具工程落地价值。
局限与展望¶
- 依赖单期开词汇表分割器的语义上限:实验表明,当后置分类器选用 APE 等对遥感地表覆盖表征较弱的模型时,变化检测指标提升趋于饱和,说明整体精度仍受制于单期 OVSS 模型的跨域泛化水准。
- 双时相严格对齐假设:当前潜在变化区域直接通过余弦相似度计算,对卫星传感器不同视角引起的严重视差或微小配准误差较为敏感,容易在陡峭建筑物边缘引入微小误差。
- 未来方向:探索在无监督框架下融合可形变注意力或空间流场估计,以应对大倾角、未严密配准的高分辨率卫星重访序列。
相关工作与启发¶
- vs DynamicEarth: DynamicEarth 采用串行的 SAM/APE 提取离散 mask 再分配文本语义,容易陷入过分割与级联误差;Free-CD 采用并行解耦设计,以无参数概率估计替代硬性 mask,连片地表分割精度显著领先。
- vs FeatUp: FeatUp 侧重自然图像的特征上采样,缺乏对多尺度空间分辨率扰动的连续性约束;RIFI-Up 引入基于 FNO 的特征反演约束,使特征伪逆映射在遥感大跨度分辨率场景下保持严格的语义保真度。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 提出无训练解耦范式与基于 FNO 的分辨率不变特征反演,视角独特且机理完备。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖四个全要素语义变化检测基准与两个建筑物变化检测基准,消融详尽且定性分析深入。
- 写作质量: ⭐⭐⭐⭐⭐ 数学建模严谨,背景概率修正与神经算子形式化清晰,图表表现力强。
- 价值: ⭐⭐⭐⭐⭐ 为开词汇表变化检测摆脱昂贵的标注与微调依赖提供了极具实用价值的全新基准方案。