跳转至

CRISP: Calibration-Aware Visual State Space Duality for Remote Sensing Image Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/crazylifeha/crisp
领域: 语义分割
关键词: 遥感语义分割, 状态空间模型, 视觉状态空间对偶, 频率校准, 原型学习

一句话总结

针对视觉状态空间对偶(VSSD)全局归一化聚合引起高频能量衰减与边界平滑的缺陷,CRISP 提出了在线性复杂度内重用聚合权重的对偶校准算子(DCO)与端到端正交多原型(OMP)解码器,在轻量约 32M 参数下实现了遥感影像细粒度多模态特征与清晰边界的高效保留。

研究背景与动机

高分辨率遥感图像语义分割是对地观测中城市规划、灾害监测与环境评估的核心基础任务。遥感影像具有极高的空间分辨率、高密度的微小地物目标(如小型车辆、独立房屋)以及错综复杂的类别地物交界,对模型保留高频局部纹理与精确轮廓的能力提出了极其严苛的要求。早期基于 CNN 的模型虽然具有良好的局部归纳偏置,但在建模大范围空间依赖方面受限;随后的视觉 Transformer(ViT)借助自注意力机制有效捕获长距离上下文,然而自注意力随序列长度呈二次方膨胀的计算与显存开销,在超高分辨率遥感大图上构成了严重的硬件瓶颈。

状态空间模型(SSM)凭借线性时间复杂度成为替代 Transformer 的理想范式,从基于选择性状态空间的 Mamba 演进至引入状态空间对偶(SSD)的 Mamba-2,进一步将状态递归与掩码线性注意力形式统一。为了适应缺乏严格一维因果时序的二维图像,视觉状态空间对偶(VSSD)通过多方向扫描并将结果融合成全局位置无关聚合,在保持 \(O(L)\) 复杂度的同时大幅削减了多向扫描开销。然而,该设计存在一个长久被忽视的内在矛盾:VSSD 将各方向扫描响应融合成一个全局归一化的空间聚合算子,其在数学上等价于大窗口乃至全局的低通平滑滤波,不可避免地抹平了零均值的高频细节扰动。频谱分析表明特征高频能量比沿骨干网络层深递减,直接导致道路狭缝、建筑轮廓与小型物体边界遭受过度平滑与失真。

以往的局部性恢复或频域增强工作多倾向于外挂独立的并行频域分支、卷积旁路或复杂的解码器侧特征融合模块,这不仅破坏了状态空间连续扫描的高效硬件特性,还显著引入了额外计算负担。本文的核心 idea 是在不改变 VSSD 线性复杂度的前提下,构建一个与聚合操作对齐的原位对偶校准算子(DCO),重用既有扫描统计量补偿值缩放失真与高频衰减,并在解码端配合端到端正交多原型(OMP)匹配头防止恢复出的类内多模态特征坍缩。

方法详解

整体框架

CRISP 整体架构由两大部分协同构成:骨干网络内部的对偶校准算子(DCO)与解码器侧的正交多原型(OMP)匹配头。在骨干网络中,输入图像经过补丁嵌入进入多层 VSSD 阶段;每个 VSSD 块在执行多向扫描与全局归一化融合后,原位接入 DCO,利用已计算的键值与查询统计量进行残差注入、去均值高频调制和通道间频域重平衡,逆转高频信息损耗。在解码阶段,高层与多尺度特征送入轻量化的 MultiProtoDecoder,通过双路全局池化动态生成类别 Token 并经过双向交叉注意力细化,最后由超网络生成每类 \(K\) 个受正交正则化约束的子原型,与归一化像素描述子进行最大响应匹配输出最终分割预测。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入遥感图像<br/>H x W x 3"] --> Emb["Patch 嵌入与编码"]
    Emb --> VSSD["VSSD 骨干多向扫描<br/>状态聚合与全局归一化"]
    VSSD --> DCO["对偶校准算子 (DCO)<br/>残差注入 + 高频调制 + 频域重平衡"]
    DCO --> Dec["多尺度融合与动态 Token 生成"]
    Dec --> OMP["正交多原型匹配 (OMP)<br/>超网络生成多原型 + 最大响应匹配"]
    OMP --> Reg["正交与间隔正则化约束<br/>类内正交 + 类间角度间隔"]
    Reg --> Out["语义分割掩码输出"]

关键设计

1. 对偶校准算子(DCO):原位重用统计量以线性时间恢复高频能量

针对 VSSD 全局归一化聚合将特征推向低通滤波、衰减边界细长结构的问题,DCO 并不额外构建独立的傅里叶或小波旁路,而是直接挖掘 VSSD 内部值缩放产生的残差。在 VSSD 中,输入特征经投影后缩放得到带增益项的值 \(v'_j = \rho_j \odot v_j\)。DCO 提取两者的残差信号 \(\Delta v_j = v_j - v'_j\),并复用已有的核化 Key 统计量 \(k_j = \psi_v(b_j)\)(其中激活函数采用 \(\psi_v(x) = \text{ELU}(x) + 1\)),在全局范围内线性时间累加全局残差状态矩阵: $$ \bm{S}{\Delta} = \sum k_j \Delta v_j^\top $$ 对于查询位置 }^{L\(i\),直接利用其对应的 Query 特征 \(q_i = \psi_v(c_i)\) 读取残差表示 \(r_i \approx q_i^\top \bm{S}_{\Delta}\)。由于全局状态矩阵 \(\bm{S}_{\Delta}\) 对所有查询位置共享且只需计算一次,整个校准过程严格保持 \(O(L)\) 的线性复杂度。读取出的残差通过带微小初始化增益门控(初始化为 \(\lambda_h = 0.01\))注入回主干聚合输出 \(\tilde{y}_i = \hat{y}_i + (\varepsilon + \lambda_h) \odot r_i\),以恒等映射附近为初始点安全启动,有效补偿离散化与衰减造成的局部对比度损失。

2. 逐 Token 去均值高频调制与直流/高频分量重平衡

仅补偿值残差仍不足以完全纠正多层堆叠后被过度平滑的微弱高频响应。DCO 进一步在 Token 维度引入去均值高频调制: $$ y'i = \tilde{y}_i + \omega_h \odot (\tilde{y}_i - \bar{y}), \quad \text{其中} \quad \bar{y} = \frac{1}{L}\sum_j $$ 通过减去全图均值 }^L \tilde{y\(\bar{y}\) 显式提取出空间高频震荡成分,再以可学习的缩放系数 \(\omega_h\) 进行锐化放大。随后,将特征解耦为低频语义项与高频轮廓项 \(Y' = Y_{\text{dc}} + Y_{\text{hc}}\),并在通道维度进行重加权自适应分配:\(Y_{\text{out}} = (1+s) \odot Y_{\text{dc}} + (1+t) \odot Y_{\text{hc}}\)。门控参数 \(\omega_h\)、偏置参数 \(s\) 和 \(t\) 均初始化为 0.01 且加以数值约束,使得模型能够在反向传播中自主平衡宏观上下文语义与边界几何细节,避免人工固定滤波核带来的频带失真。

3. 正交多原型解码器(OMP):显式建模遥感同物异谱的类内多模态结构

高频细节在骨干层恢复后,传统单原型分类头(每个类别仅分配单一权重向量)极易将“同物异谱”(如同类建筑物因涂料、材质差异表现出截然不同的光谱分布)强行压缩至单一方向,破坏 DCO 还原的微观分布。OMP 针对此痛点设计了端到端多原型机制:利用平均与最大双路池化生成内容自适应查询权重,结合原型字典库动态合成类别 Token,再经超网络投射出每个类别 \(C\) 下的 \(K\) 个归一化子原型 \(\hat{P}_{c,k}\)。像素描述子 \(\hat{U}_i\) 在预测时采用最大响应匹配计算所属类别的置信度: $$ z_{c,i} = \max_{1 \le k \le K} \langle \hat{U}i, \hat{P} \rangle $$ 每个像素自主选择最吻合的子原型,赋予模型表征复杂类内多峰分布的自由度。

4. 类内正交性与类间角度间隔双重正则化

若缺少显式约束,多原型往往会退化坍缩至相同或极度相近的特征方向,使得多分支形同虚设。OMP 提出了互补的双重几何惩罚损失: $$ \mathcal{L}{\text{orth}} = \frac{1}{B |\mathcal{C}| K (K-1)} \sum} \sum_{k \neq l} \big| \langle \hat{P{b,c,k}, \hat{P} \rangle \big| $$ $$ \mathcal{L}{\text{margin}} = \frac{1}{B} \sum} \sum_{c \neq c'} \text{ReLU}\big( \langle \hat{\bar{P}{b,c}, \hat{\bar{P}} \rangle - \delta \big) $$ 类内正交惩罚 \(\mathcal{L}_{\text{orth}}\) 强制同一类别下的各个子原型相互正交,消除冗余并最大化子原型在子空间内的基底张成能力;类间间隔惩罚 \(\mathcal{L}_{\text{margin}}\) 则对不同类别中心均值 \(\hat{\bar{P}}_{b,c}\) 之间施加角间隔阈值 \(\delta\),防止类内扩展侵蚀类间决策边界。两者与标准分割损失联合优化,无需离线聚类即实现了端到端的原型解耦。

损失函数 / 训练策略

模型的整体训练目标采用多任务端到端联合优化: $$ \mathcal{L}{\text{total}} = \mathcal{L}}} + \lambda_{\text{orth}} \mathcal{L{\text{orth}} + \lambda $$ 其中 }} \mathcal{L}_{\text{margin}\(\mathcal{L}_{\text{seg}}\) 采用标准的交叉熵损失,\(\lambda_{\text{orth}}\) 与 \(\lambda_{\text{margin}}\) 为平衡超参数。训练采用 MMSegmentation 统一协议,优化器为 AdamW(学习率 \(6 \times 10^{-5}\),权重衰减 0.05),采用线性预热配合 Poly 衰减(幂指数 \(p=0.9\)),在 \(512 \times 512\) 随机裁剪块上训练。

实验关键数据

主实验

在代表性的遥感大基准 LoveDA、ISPRS Potsdam 和 ISPRS Vaihingen 上,CRISP 与各主流 CNN、Transformer 及最新 SSM 架构进行了系统评测。

数据集 模型 参数量 (M) mFscore (%) mIoU (%) 核心类表现 (Building / Tree / Forest)
LoveDA VSSD (基线) 56.1 - 47.15 Bu: 50.96 / Fo: 40.57
LoveDA UNetFormer 11.7 - 49.88 Bu: 58.89 / Fo: 41.49
LoveDA AerialFormer 43.2 - 50.41 Bu: 64.05 / Fo: 41.78
LoveDA CRISP (本文) 32.32 - 51.56 Bu: 65.16 / Fo: 43.92
LoveDA D2LS (大模型) 94.0 - 53.53 Bu: 63.27 / Fo: 41.10
Potsdam VSSD (基线) 56.1 92.07 85.57 Build: 92.81 / Tree: 77.30
Potsdam UNetFormer 11.7 92.68 86.59 Build: 96.83 / Tree: 88.07
Potsdam AerialFormer 43.2 93.02 87.17 Build: 96.74 / Tree: 88.77
Potsdam CRISP (本文) 32.32 93.93 88.77 Build: 97.78 / Tree: 89.47
Potsdam D2LS (大模型) 94.0 94.15 89.17 Build: 97.99 / Tree: 89.71
Vaihingen VSSD (基线) 56.1 88.54 79.75 Build: 90.37 / Tree: 79.43
Vaihingen UNetFormer 11.7 87.77 78.64 Build: 94.65 / Tree: 89.04
Vaihingen AerialFormer 43.2 89.98 82.03 Build: 95.75 / Tree: 89.00
Vaihingen CRISP (本文) 32.32 90.55 83.00 Build: 96.62 / Tree: 89.46
Vaihingen D2LS (大模型) 94.0 91.18 84.06 Build: 96.95 / Tree: 89.71

消融实验

1. DCO 内部各子组件消融(在 Potsdam 上基于 UPerHead 单尺度评估)

配置方案 残差注入 (Res. Inj.) 高频调制 (Hi-Pass) 频域重平衡 (DC/HC) mIoU (%) 相比 Baseline 增益
Baseline - - - 87.32 -
方案 A ✓ - - 87.65 +0.33
方案 B - ✓ - 87.68 +0.36
方案 C - - ✓ 87.64 +0.32
方案 D - ✓ ✓ 87.83 +0.51
完整 DCO ✓ ✓ ✓ 88.10 +0.78

2. 端到端系统级协同消融实验(在 Potsdam 上评估 VSSD 骨干)

解码头类型 引入 DCO 类内正交性 (Orth) 类间间隔 (Margin) mIoU (%) 说明与结论
UPerHead - - - 87.32 原始 VSSD 基线
UPerHead ✓ - - 88.10 骨干加入 DCO 即大幅提升 +0.78%
OMP - ✓ ✓ 85.63 缺高频校准时多原型分散退化(-1.69%)
OMP ✓ - - 86.85 DCO 搭配无正则多原型初显成效
OMP ✓ ✓ - 88.06 仅类内正交,多样性增强(+1.21%)
OMP ✓ - ✓ 88.02 仅类间间隔,边界可分性提升(+1.17%)
OMP (完整) ✓ ✓ ✓ 88.25 双重正则协同激活,达到最优性能

关键发现

  • DCO 各模块互补且无损高效:残差注入、Token 级去均值高频调制和通道重平衡各自带来约 +0.33% 的增益,完整组合实现 +0.78% 的提升,证明状态级残差注入恢复了对比度,而频域调制在此基础上完成了针对性增益,且整体 DCO 仅增加 3.19G FLOPs 和不到 \(10^{-3}\)M 参数。
  • DCO 与 OMP 存在严格的先后依赖关系:消融表明,若没有 DCO 恢复的高频纹理,单纯增加 OMP 多原型匹配反而会使 mIoU 暴跌至 85.63%(甚至低于基准 87.32%),因为低通平滑特征无法支撑多子原型的特征分离;而一旦 DCO 激活,OMP 配合正交正则化能充分捕获类内微模态,将整体指标进一步推高至 88.25%。
  • 原型数量 \(K\) 具有清晰的饱和阈值:随子原型数从 \(K=2\) 增至 \(K=3\),mIoU 显著提升并达到峰值,之后 \(K=4, 5\) 保持平稳,证实提升源于多模态类内覆盖,而非参数量虚增。

亮点与洞察

  • 将对偶近似误差逆向转化为校准信号:绝大多数 SSM 研究默认全局聚合是无损的降本手段,CRISP 首次从 2D FFT 频域能量比和边界 F-score 深入揭示了 VSSD 归一化聚合的低通滤波本质,并极其巧妙地将值缩放前后的差值直接作为残差源,不破坏底层硬件扫描机制。
  • DCO 与 OMP 的跨层次机制闭环:底层 DCO 负责“恢复高频几何分辨力”,顶层 OMP 负责“承接并解耦高维类内多峰分布”,两者缺一不可,构成了一个完整的“底层校准-顶层表征”技术闭环。
  • 可复用的 SSM 频域自适应范式:DCO 重用现有 \(Q/K\) 统计量进行 \(O(L)\) 残差重建的思想,不仅限于遥感分割,同样可直接迁移至医学影像病灶分割、工业缺陷检测等对微小结构和边界极其敏感的密集预测任务中。

局限与展望

  • 空间一致校准的局限性:当前 DCO 的调制参数主要依赖全局均值与通道级门控,尚未实现针对空间图像局部纹理复杂度的动态空间自适应校准(如平坦区域本不需要高频补偿)。
  • 小样本与极端非平衡类别的原型退化:对于遥感中极其罕见的地物类别,过多的子原型可能因训练样本稀疏而难以学到充分的基底表征。
  • 未来方向:作者指出未来将探索以局部频域特征为条件的自适应空间校准机制,并在更多超高分辨率多光谱、高光谱地表覆盖任务中进行验证。

相关工作与启发

  • vs VSSD [ICCV 2025]: VSSD 提出了无因果状态空间对偶并利用全局聚合降低扫描开销,但带来高频过度平滑;CRISP 直接在其聚合步骤后引入 DCO,原位修复了频域衰减缺陷,同时用 OMP 替代了笨重的 UPerHead。
  • vs FreqFusion [TPAMI 2024] / LocalMamba [ECCVW 2024]: FreqFusion 在解码端做高开销的频域特征融合,LocalMamba 引入窗口局部扫描破坏了全局连续性;CRISP 在骨干内部重用已有统计量实现 \(O(L)\) 的频域校准,兼顾硬件友好性与精确度。
  • vs NAPG [TGRS 2025] / 对比原型学习 [TMM 2025]: 以往遥感多原型方法往往依赖复杂的离线聚类或离线对比学习预训练;CRISP 的 OMP 依靠类内正交与类间间隔双重损失,实现了完全端到端的动态多原型学习。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次揭示 VSSD 全局聚合的低通频谱退化并提出原位轻量级对偶校准。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三大经典基准、完备的逐模块消融、能耗与效率拆解以及频域可视化分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑推导严谨,从数学剖析、频域实验验证到模块设计一气呵成。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量级状态空间模型在密集几何视觉与遥感分割落地提供了极具实用价值的范式。