跳转至

From Visual Primitives to Semantic Masks: Fine-Grained Visual-Linguistic Alignment for Open-Vocabulary Remote Sensing Image Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/blackdyc/SANO3
领域: 语义分割
关键词: 开放词表语义分割、细粒度遥感解译、SAM 3、视觉基元发现、信息增益提示

一句话总结

针对遥感图像中细粒度概念视觉高度相似与文本表征坍缩的痛点,SANO3 提出无需训练的框架,通过 DINOv2 拓扑自相似先验提取视觉基元、基于 Plackett-Luce 模型进行关系感知图文对齐、向文本流注入动静态混合原型,并以贪婪信息熵减迭代优化正负空间点提示,在新建的遥感细粒度评测基准 FG-OVSSRS Bench 上刷新 SOTA。

研究背景与动机

开放词表语义分割(OVSS)允许通过任意自然语言文本提示识别未见类别,在环境保护、精准农业、灾害评估和城市规划等遥感监测场景中展现出巨大潜力。以往基于 CLIP 的免训练方法通常通过改造注意力池化层获取密集特征,或借助 SAM、DINO 等视觉基础模型(VFM)补齐局部定位。然而,遥感影像中存在显著的细粒度类间相似度高(如阔叶树与针叶树、不同厚度云层或损坏等级建筑物)以及复杂的地物尺度多变问题,CLIP 全局对齐的预训练目标难以捕捉亚类别间的微妙差异,常导致语义混淆与轮廓边缘模糊。

随着具备概念提示能力的分割大模型 SAM 3 出现,研究者获得了远强于 CLIP 的几何与实体边界先验。然而,直接将 SAM 3 迁移到细粒度遥感场景依然遭遇严重瓶颈。一方面,SAM 3 原生文本编码器在面对细粒度概念时存在严重的表征坍缩现象,语义相近的类名在嵌入空间中高度拥挤,仅靠单向文本提示无法激活正确的视觉对应区;另一方面,现有基于 SAM 3 的遥感方法多采用简单的后处理结合 Transformer 解码器输出,依赖单次前向推理,完全浪费了交互式提示模型所特有的循环反馈与渐进优化潜能。此外,现有遥感 OVSS 基准主要聚焦于粗粒度地表覆盖类别(如水体、道路、建筑),缺乏针对细粒度属性与物理状态的系统评测体系。

为了破解细粒度图文对齐难与边界定位模糊的双重挑战,本文充分挖掘视觉基础模型在自监督表征中学习到的拓扑自相似性先验。核心 idea:利用 DINOv2 固有拓扑聚类解构出局部判别性视觉基元,通过跨模态注意力与 Plackett-Luce 排列一致性实现精细图文对齐并注入混合原型,再以贪婪熵减迭代选择正负空间提示点,实现无训练下的文本引导与空间约束协同优化。

方法详解

整体框架

SANO3 整体架构由视觉基元发现、视觉条件引导的关系感知对齐、混合原型注入与迭代信息增益空间提示四大模块构成。输入遥感影像首先送入冻结的 DINOv2 提取稠密特征图,经过度聚类与分层合并后生成无监督视觉基元及其对应掩码原型;随后,原型特征与细粒度文本查询通过交叉注意力聚焦关键词元,并经由排序模型计算结构相似度打分完成语义分配;通过筛选的动态原型与全局动量银行中的静态原型拼接注入 SAM 3 文本流构建多模态混合提示;最后,模型在空间域评估当前分割熵,通过贪婪计算信息增益迭代交替选取最能降低不确定性的正负点提示,输出高精度的细粒度分割掩码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["遥感输入图像 + 细粒度文本查询"] --> B["无监督视觉基元发现<br/>DINOv2 过聚类与分层合并提取掩码与原型"]
    B --> C["视觉条件引导的关系感知对齐<br/>词元级交叉注意力 + Plackett-Luce 排列结构匹配"]
    C --> D["混合原型注入<br/>动态实例原型与全局静态记忆银行拼接至文本流"]
    D --> E["迭代信息增益空间提示<br/>候选池构建与贪婪最小化全局熵正负点选取"]
    E --> F["输出细粒度预测掩码"]

关键设计

1. 无监督视觉基元发现:拓扑先验过聚类与分层合并

直接在多模态交叉特征空间中寻找细粒度对应易受文本歧义干扰,而在自监督视觉模型(如 DINOv2)内部,图像块的特征空间天然蕴含拓扑一致性与语义聚类结构。SANO3 利用这一模态内自相似性先验解构图像。针对输入图像 \(I\),首先使用 DINOv2 提取密集特征图 \(F_{vfm}\)。为捕获亚类级别的细微差异,模型采用过度聚类策略,通过 K-Means 将特征图划分为 \(K_{init} = Q \times C\) 个互不重叠的区域,其中 \(Q\) 为文本查询类别数,\(C\) 为控制聚类粒度的超参数。过度聚类容易导致连通区域碎片化,因此引入基于余弦相似度的分层合并机制:计算各聚类原型的相似度矩阵,将余弦相似度大于阈值(设定为 0.85)的相邻簇迭代合并,生成紧凑的基元掩码集合 \(\mathcal{M} = \{M_1, \dots, M_K\}\)。最后将掩码尺寸对齐至 SAM 3 视觉编码器输出分辨率 \(F_{sam}\),通过掩码平均池化计算每个基元的视觉原型向量: $\(v_k = \frac{1}{|M_k|}\sum_{(x,y):M_k(x,y)=1} F_{sam}(x,y)\)$ 这些原型保留了遥感地物的低层几何轮廓与高层视觉结构,为后续的语义分配提供了可靠的物理锚点。

2. 视觉条件引导的关系感知对齐:跨模态注意力与 Plackett-Luce 排列一致性

细粒度遥感类别(如 Thick Cloud 与 Thin Cloud)在 SAM 3 原生文本编码器中极易发生特征坍缩,单纯依赖静态句子级嵌入(如 [EOS] 向量)计算余弦相似度会导致大量误匹配。为此,SANO3 提出了两阶段对齐方案:视觉条件化文本细化与动态关系感知匹配。第一阶段,利用视觉原型 \(v_k\) 对文本查询 \(c\) 的所有词元嵌入 \(T_c \in \mathbb{R}^{L \times d}\) 做交叉注意力查询,计算视觉条件化文本特征 \(t_{k,c} \in \mathbb{R}^d\)。该操作能够根据具体图像块的视觉特征动态凸显具有判别力的描述词元,抑制无信息词干扰。

在第二阶段,针对绝对相似度在边界模糊时失效的问题,提出基于 Plackett-Luce 排序模型的分布结构对齐。对每个原型 \(v_k\) 取余弦相似度排名前 \(N\)(设 \(N=4\))的候选文本特征构建局部拓扑空间,在所有可能的排列空间 \(\Pi_N\) 上分别定义视觉侧分布与文本侧自相似分布: $\(P(\pi | v_k) = \prod_{i=1}^N \frac{\exp(\cos(v_k, t_{k,(i)})/\tau_t)}{\sum_{j=i}^N \exp(\cos(v_k, t_{k,(j)})/\tau_t)}\)$ $\(P(\pi | t_{k,c}) = \prod_{i=1}^N \frac{\exp(\cos(t_{k,c}, t_{k,(i)})/\tau_t)}{\sum_{j=i}^N \exp(\cos(t_{k,c}, t_{k,(j)})/\tau_t)}\)$ 最终通过两个排列概率分布的内积得到结构一致性评分 \(S(k, c) = \sum_{\pi \in \Pi_N} P(\pi | v_k) \cdot P(\pi | t_{k,c})\),将原型归属于得分最高的文本类别。这种机制通过校验视觉局部邻域与文本语义邻域的拓扑一致性,有效排除了特征坍缩引起的虚假绝对高相似度。

3. 混合原型注入:动静态双重表征注入文本提示流

将对齐后的视觉语义重新赋能分割模型需要紧密的模态融合。单一当前帧的动态原型容易因遮挡或极端光照引入噪声,而纯离线原型又缺乏实例适应性。SANO3 提出混合原型注入机制,将过滤后的图像级动态原型与在线更新的全局记忆库静态原型联合注入。对于目标类别 \(c\),仅保留对齐得分 \(S(k, c) \ge \tau\) 的高置信度原型作为动态集合 \(\mathcal{P}_{dyn}^{(c)}\);同时,维护一个跨测试样本在线动量更新的全局原型库: $\(m_c^{(t)} = \eta \cdot m_c^{(t-1)} + (1-\eta) \cdot \text{Mean}(\mathcal{P}_{dyn}^{(c)})\)$ 其中动量因子 \(\eta=0.9\)。在送入 SAM 3 融合编码器前,将文本词元嵌入、动态原型序列与静态原型拼接为联合提示向量: $\(T_{hybrid} = \text{Concat}(T_c, \mathcal{P}_{dyn}^{(c)}, m_c)\)$ 该设计使多模态 Transformer 交叉注意力既能捕捉当前图像的具体实例纹理,又能受限于全局类别先验的正则约束,大幅提升提示表征的类内紧凑性与类间分离度。

4. 迭代信息增益空间提示:基于贪婪熵减的交互式正负点优化

即使语义提示得到极大增强,单次前向推理在复杂地表边缘仍可能产生断裂或欠分割。为此,SANO3 将交互式空间点提示转化为贪婪信息熵减的离散优化过程。首先,针对目标类别构建正候选点池 \(\mathcal{X}_{pos}\)(来自该类对应基元簇掩码)与负候选点池 \(\mathcal{X}_{neg}\)(来自其余簇),依据点特征与簇原型的余弦相似度 \(S_{proto}(x)\) 对点进行代表性初筛。以增强文本提示生成的初始语义概率图 \(P_t\) 计算全图预测熵 \(U_{prev} = -\frac{1}{HW}\sum_{i} [P_t^{(i)}\log P_t^{(i)} + (1-P_t^{(i)})\log(1-P_t^{(i)})]\)

在每个迭代步 \(t\),算法分别从正负候选池中选取代表性最高的一对候选点 \(x^*_{pos}\)\(x^*_{neg}\),将其输入模型模拟推演更新后的概率图与全图熵 \(U_{new}\),计算信息增益 \(\Delta U = U_{prev} - U_{new}\)。比较正增益 \(\Delta U_{pos}\) 与负增益 \(\Delta U_{neg}\),将带来更大不确定性下降的候选点正式加入点提示集,并更新当前熵基准。重复该交互过程直至最大信息增益低于终止阈值 \(\tau_e\)。这种依据不确定性反馈主动在易混淆边缘与内部核心区布设引导点的策略,极大地锐化了细粒度掩码边界。

实验关键数据

FG-OVSSRS Bench 评测基准

论文针对遥感细粒度 OVSS 缺乏系统评测标准的问题,整合了 8 个涵盖卫星、高空航拍及无人机遥感的多源公开数据集构建 FG-OVSSRS Bench:包含 Forest(森林树种与倒木 10 类)、Cloud(云厚度与阴影 4 类)、Rescue(地震建筑损毁 11 类)、YRCC(黄河冰凌水情 3 类)、SkyScapes(城市微观地物 20 类)、GIS(城市道路基础设施 3 类)、Fine-RSMI(矿物材质 3 类)、Barley(高分辨率农作物 3 类)。

主实验

方法 主干架构 Forest Cloud Rescue GIS YRCC SkyScapes RSMI Barley 平均 mIoU (%)
GEM (CVPR 24) CLIP 12.97 30.25 18.88 31.57 26.56 9.70 7.24 9.06 18.28
ProxyCLIP (ECCV 24) CLIP + DINO 27.37 32.51 33.22 32.82 39.68 15.43 10.61 8.06 24.96
FSA (ICCV 25) CLIP + DINO 27.73 32.70 33.40 33.04 43.23 15.41 10.32 8.03 25.48
SCLIP (ECCV 24) CLIP 9.22 28.10 14.11 30.02 32.02 6.40 12.22 11.05 17.89
ClearCLIP (ECCV 24) CLIP 13.89 32.85 22.31 31.46 26.96 13.23 14.68 9.38 20.60
CorrCLIP (ICCV 25) CLIP+SAM2+DINO 29.33 19.24 33.89 31.81 50.57 15.46 12.10 10.51 25.36
SegEarth-OV (CVPR 25) CLIP 22.91 24.41 26.83 33.78 56.10 14.79 17.95 9.06 25.73
SAM 3 (ICLR 26) SAM 3 33.10 29.56 35.76 41.46 52.66 26.84 29.17 10.55 32.39
SegEarth-OV3 (arXiv 25) SAM 3 33.05 28.80 35.85 41.46 52.24 26.77 29.17 10.53 32.23
SANO3 (本文) SAM 3 + DINOv2 33.90 30.70 36.84 43.06 57.78 26.83 28.50 18.78 34.55

消融实验

1. 核心组件消融 (Tab. 3)

配置 动态原型注入 (DPI) 静态原型注入 (SPI) 迭代空间提示 (IGVP) Cloud (mIoU %) YRCC (mIoU %) Rescue (mIoU %)
SAM 3 基线 - - - 29.56 52.66 35.76
+ DPI - - 29.68 55.25 36.67
+ DPI + SPI - 30.11 56.46 36.82
完整模型 (SANO3) 30.70 57.78 36.84

2. 对齐策略与基础模型对比 (Tab. 5 & Tab. 6)

实验切片 变量设定 Cloud (mIoU %) YRCC (mIoU %) Rescue (mIoU %) 说明
原型匹配策略 Max Cosine Similarity 30.30 57.11 36.42 依赖绝对余弦相似度,受特征坍缩干扰大
原型匹配策略 VARA (本文) 30.70 57.78 36.84 结构化排序对齐,全面优于绝对匹配
视觉基础模型 (VFM) MAE 30.44 58.64 36.70 重建式自监督模型提供拓扑指导
视觉基础模型 (VFM) DINOv2 (本文) 30.70 57.78 36.84 综合表现优异稳定
视觉基础模型 (VFM) DINOv3 30.26 58.84 36.66 新版基础模型同样兼容有效

关键发现

  • 混合原型中动态原型 DPI 对几何边界较复杂的 YRCC 提升显著(+2.59%),而全局静态原型 SPI 提供了跨样本的语义正则,进一步提升 1.21% mIoU。迭代点提示 IGVP 则进一步在边界处收割收益,使 YRCC 整体提升达 5.12%,Barley 农业数据集更实现超 8% 的跨越式增长。
  • 超参数敏感性分析表明,聚类超参 \(C\) 处于 6 到 8 时达到最佳平衡,分层合并能有效抑制碎片化;原型注入阈值 \(\tau\) 在 0.4 到 0.8 区间内稳健,避免了低置信噪声原型的污染;点选择停止阈值 \(\tau_e\) 在 0.05 到 0.20 范围内表现平稳,对各类数据集适应度极高。
  • 替换不同 VFM 骨干(MAE、DINOv2、DINOv3)均能带来超越原生 SAM 3 的明显涨点,验证了框架对底层特征提取器的泛化性与自相似先验的普适性。

亮点与洞察

  • 拓扑排序对齐替代余弦打分:巧妙地借助 Plackett-Luce 置换概率模型计算局部邻域排列一致性,攻克了遥感细粒度概念在文本特征空间坍缩导致的绝对余弦虚假高分问题。
  • 熵减导向的贪婪交互提示:突破了传统免训练 OVSS 仅依赖单次前向传播的局限,把交互分割中的点提示机制转变为以最小化全局预测熵为目标的自主离散优化流程,以轻量推演实现了高质量边缘收敛。
  • 构建高难度细粒度遥感基准:跳出同类工作局限在粗粒度大类的评测舒适区,系统性整理出覆盖 8 个现实严苛领域的细粒度评测基准,并扩充了同义词与环境噪声词,填补了该方向标准化基准的空白。

局限与展望

  • 迭代优化的计算开销:迭代正负点提示机制在每一轮都需要模拟评估正负候选点的全图熵降,虽然能显著提升边缘精度,但相比单次前向推理增加了多次轻量前向开销,在超大规模遥感切片实时推理时存在时延瓶颈。
  • 极小目标与密集物体的聚类破碎:对于高分辨率无人机遥感中的极小目标(如狭窄路标、零散损毁瓦砾),无监督 K-Means 聚类与分层合并可能偶发漏检或过早合并到周围背景基元中。
  • 未来方向:可进一步探索结合轻量级测试时自适应(TTA)或自监督记忆蒸馏技术,减少迭代轮数,并将基元发现与自适应尺度先验深度融合。

相关工作与启发

  • vs SegEarth-OV / CorrCLIP: 现有 CLIP 范式主要聚焦于特征注意力池化层的魔改与特征相关性重构,但受制于 CLIP 的图像级对齐预训练本能,细粒度辨识率难以突破 26% mIoU 瓶颈。SANO3 切换至 SAM 3,通过 DINOv2 局部自相似基元弥补了细粒度视觉结构的不足。
  • vs SegEarth-OV3: SegEarth-OV3 仅在 SAM 3 解码器输出侧做简单的跨分支特征组合,未能触及原生文本表征坍缩这一核心矛盾,在细粒度辨识上与原版 SAM 3 几乎持平(32.23% vs 32.39%)。SANO3 则从文本条件化细化与关系排序对齐切入,实现了真正的语义辨析提升(34.55%)。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用 Plackett-Luce 排列模型和贪婪熵减提示闭环解决细粒度对齐和迭代优化难题。
  • 实验充分度: ⭐⭐⭐⭐⭐ 自建 8 数据集细粒度基准,涵盖主实验、多组件消融、骨干泛化性与超参敏感度分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,图文对齐清晰,方法动机与数学建模表述自然自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为免训练开放词表细粒度遥感感知开辟了新范式,提供的 FG-OVSSRS Bench 具有极高学术参考价值。