CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation¶
会议: ECCV2026
论文: ECCV 2026 / 项目页
领域: 语义分割
关键词: 遥感指代分割 / 视觉语言模型 / 级联蒸馏 / 对比学习 / SAM
一句话总结¶
CROSS 把 SAM 2 编码器里"文本过滤后的 patch 对几何亲和"作为软正则蒸进 SigLIP 2 的浅/深/末三层以补上 VLM 缺的空间结构,再用"感知式困难负样本 + 空间反事实文本"的双约束对比学习打破物体中心捷径,在 RefSegRS 上把 cIoU 推到 83.25、[email protected] 提到 41.32。
研究背景与动机¶
遥感指代图像分割(Referring Remote Sensing Image Segmentation, RRSIS)要求按一句自然语言描述,在卫星/航拍影像里分割出指定目标。它和自然场景的指代分割(RIS)看着像同一件事,难的地方却完全不同:遥感影像幅员尺度极大而目标常常只占几十个像素,同类地物(停车场里的车、机场里的飞机、球场边的同类场地)外观高度同质,且小目标密集、跨尺度分布。正因为像素级定位要求高、生成式文本能力用不上,这条线的主流方案从早期的专用结构(LAVT、RMSIN 用旋转卷积处理任意朝向、FIANet 做多尺度细粒度图文对齐)转向了"判别式基础模型拼装":用 SigLIP/CLIP 这类 VLM 出稠密语义提示,再交给 SAM/SAM 2 解码成掩码,RSRefSeg、RSRefSeg 2 是这条路线上的代表。
但这条路线基本是在吃基础模型的预训练红利,并没有为遥感的稠密杂乱场景做真正的多模态协同,作者把问题拆成两个瓶颈。其一是架构弱耦合:VLM 生成提示、SAM 消费提示,信息严格单向流动,SAM 那个擅长像素级结构的图像编码器在提示生成阶段完全没被用上;而 CLIP 式视觉编码器本身没有结构约束,输出的稠密提示图在杂乱遥感场景里响应是发散的,于是出现定位漂移。其二是物体中心语义偏置:CLIP 系模型是为全局图文对齐预训练的,它学到的最省力策略是盯住主导物体类别("vehicle"),而给"left/right/inside"这类空间修饰词的监督信号很弱。作者的扰动实验把这个失败模式摆得很清楚——把指代表达里的方位词换掉,基线模型的图文相似度依然很高,可预测的掩码已经完全错了,说明它是在做类别检索而不是逻辑定位;这也解释了为什么在"两个一模一样的场地,取灰色大体育场里的那个"这类描述上,基线会把两个都分割出来。
核心 idea:既然 SAM 编码器里现成就有与类别无关的结构先验,就把它以"文本过滤后的成对亲和矩阵"的形式反向蒸进 VLM 的多个中间层当软正则(LGCD),让 VLM 的语义定位被几何结构持续约束;同时从视觉和语言两个侧面各自挖出"最像目标但违反空间约束"的困难负样本(PSCL),显式惩罚语义捷径,逼模型真正解码句法里的空间关系。
方法详解¶
整体框架¶
CROSS 的推理骨架仍是"VLM 出提示 → SAM 2 解码掩码":SigLIP 2 分别编码遥感影像与指代表达得到视觉特征图和文本嵌入,跨模态提示生成器用两者的相似度算出稠密提示 \(P\),连同 SAM 2 编码器的图像特征送进 SAM 2 掩码解码器输出二值掩码。真正改动的是两处:训练时,LGCD 把 SAM 2 编码器的成对几何亲和矩阵级联地蒸进 SigLIP 2 的第 9、18、27 层,让每一级的视觉状态都被结构先验约束;同一时间,PSCL 在掩码预测之上构造两组困难负样本——掩码外最像目标的背景干扰物、以及主客/方位被掉包的反事实文本——用一个非对称 InfoNCE 把"像但位置不对"和"词换了但目标还是一样"这两种情况都推远。前者治架构隔离,后者治语义偏置;推理阶段只保留"文本→提示→掩码"这条主干,蒸馏的教师分支和对比分支都只在训练时存在。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["遥感影像 + 指代表达"] --> B["SigLIP 2 双塔编码<br/>视觉特征 + 文本嵌入"]
K["SAM 2 编码器(冻结)<br/>教师:patch 对亲和"] -.->|仅训练期| C["文本引导的级联蒸馏<br/>(LGCD)"]
B --> C
C --> D["跨模态提示 → SAM 2 掩码解码"]
D --> E["预测掩码"]
E --> F["感知式困难负样本"]
E --> G["空间反事实负样本"]
F --> H["非对称 InfoNCE 双约束"]
G --> H
关键设计¶
1. 文本引导的级联蒸馏(LGCD):把 SAM 2 的成对几何亲和当作软正则,分层注入 VLM
这一设计直接针对"单向流导致定位漂移"。它由两步组成。第一步是级联表征提取:不再只取编码器终端输出,而是从 SigLIP 2 的浅、深、末三个 block(实验里取第 9、18、27 层)各取一张特征图,展平成 patch token 序列后以残差方式逐级注入 \(X_i = H_{i-1} + F_v^{(i)}\)(\(H_0=0\),三张特征图 patch 数相同所以能直接相加);每级再叠一个双向交叉注意力,用文本嵌入当 K/V 把这个视觉状态"锚"到语言上下文上,得到精炼后的 \(H_i\),同时顺手拿到视觉 patch 对文本 token 的注意力矩阵 \(A_i\)。
第二步是真正把结构先验搬过来的文本引导关系蒸馏。这里有两个容易踩坑的地方,作者的取舍值得记下来。其一,遥感背景极其杂乱,如果把 SAM 的类别无关特征稠密地、无差别地蒸过来,等于灌进大量结构噪声;所以他们把交叉注意力矩阵沿文本 token 维求平均得到每个空间位置的"文本相关度"软掩码,用它给蒸馏加权,只把语言上相关的拓扑路由过来,并用一个下限 \(\alpha\) 保住背景的基本一致性、防止背景拓扑整体塌掉。其二,SAM 与 VLM 的潜空间是异构的,逐像素硬对齐会扭曲特征,于是改为只对齐相对拓扑:两边各算 patch 之间的 Gram 亲和矩阵(特征向量的余弦相似度矩阵),让 VLM 的成对相似度结构去逼近 SAM 的。蒸馏损失就是在所有空间对上,用文本软权重把两个亲和矩阵的差异加权求和,再在 K 个级联阶段上平均:
其中 \(S\) 是 SAM 2 编码器特征,\(\Omega\) 是所有空间位置对,\(\alpha=0.1\)。(⚠️ 缓存中该式排版损坏,此处按"亲和矩阵差值的文本加权"重建,具体范数形式以原文为准。)这一步和"把 SAM 的掩码当硬伪标签蒸"有本质区别:CROSS 不把 SAM 2 当分割 oracle,只传它对"哪两个 patch 属于同一结构"的偏好,因此不会把 SAM 的错误掩码固化进 VLM。级联的意义在于深度监督——浅层拿到的是粗结构、深层拿到的是精拓扑,共享同一个几何锚点可以把表征轨迹正则得更平滑(论文用 CKA 层间相似度热图佐证:相邻层过渡更顺、末层与前序深层对齐更稳),而层级的文本软掩码又能防止这种共享约束把各层的特征多样性抹平。
2. 感知式困难负样本:用 GT 掩码挡住目标,专挑最像它的背景干扰物
针对物体中心偏置的视觉侧。做法很直接:用真值掩码把目标区域从特征图里物理抠掉,只在剩下的背景 \(\Omega_{bg}\) 里,挑与文本嵌入余弦相似度最高的 Top-K 个位置作为困难负样本(\(K=8\))。动机来自遥感场景的具体病态:在"灰色大体育场里的跑道场"这种表达里,被语言排除掉的那个同类场地恰恰是与文本最像的背景区域——它满足类别匹配却违反空间约束。基线模型正是被这种"看起来对"的区域骗走,把两个同类实例都分割出来。把这些最像正样本的背景显式标成负样本,等于给"类别匹配但空间错位"这种情况一个专门的惩罚信号;而随机采背景负样本几乎起不到作用,因为它们和文本的相似度太低、梯度太弱。
3. 空间反事实负样本:交换左右与主客,逼模型真读句法而不是关键词
针对物体中心偏置的语言空间侧。作者不去建几何模型,而是用文本侧的合成扰动来制造逻辑矛盾:绝对方位词直接取反("top" 换 "bottom"),相对关系则把主体和客体整体对调("A golf field is on the left of the green airport" 改成 "The green airport is on the left of a golf field"),扰动句由轻量 LLM(实验用 Qwen2.5-7B-Instruct)离线批量生成。这样一组"词几乎没变、逻辑完全相反"的负样本,恰好堵死了关键词匹配这条捷径:模型若还想拿高分,就必须真的解码句法结构。把设计 2 和设计 3 合起来才是标题里的 "Dual-Constraint"——一条约束在视觉侧压制空间错位的干扰物,一条在语言侧惩罚空间逻辑不一致;消融显示只留语言空间扰动反而掉点(RefSegRS 上 -0.05 cIoU),因为脱离视觉落地的空间线索在杂乱场景里本身就有歧义,两者必须同时在场。
一个完整示例¶
拿 RRSIS-D 里那句嵌套表达 "The airplane is on the right of the airplane on the left" 走一遍:SigLIP 2 编码后,三级 LGCD 分别用文本软掩码过滤 SAM 的亲和结构,把"两个飞机各自的连通结构 + 谁的右谁左"这种成对拓扑压进 VLM 中间层;提示生成器输出的稠密提示因此集中在左侧那架飞机上(论文的可视化里 CROSS 的提示热图明显比 RSRefSeg 2 更聚拢)。训练时,PSCL 用真值掩码挡住左侧飞机,在剩余背景里挑出相似度最高的 8 个位置——最靠前的往往就是右边那架飞机的机身;同时把该句的方位词对调得到反事实文本 \(t^-\),让 \(t^-\) 与正样本原型 \(\mathbf{v}^+\) 的相似度被拉开、让背景里那架右飞机的嵌入与原文 \(t\) 的相似度被压低。基线 RSRefSeg 2 在这句上会退化成解析片段 "on the right",只切出右侧飞机;CROSS 因为既被结构约束又被两侧负样本夹住,掩码完整落在左侧目标上。
损失函数 / 训练策略¶
PSCL 把两侧约束统一进一个非对称 InfoNCE:正样本对是掩码聚合出的视觉原型 \(\mathbf{v}^+\) 与原文 \(t\),负侧同时放进视觉困难负样本集合 \(\mathcal{V}^-\) 和反事实文本 \(t^-\),后者用一个缩放系数 \(\eta\) 单独调权:
"非对称"就体现在 \(\eta\) 上(默认 \(\eta=2\)):空间逻辑约束被放大两倍,让"位置说反了"比"背景里有个像的东西"受到更重的惩罚。\(\tau=0.07\)。(⚠️ 该式在缓存中排版损坏,此处按其文字描述重建,逐项形式以原文为准。)
总目标就是常规的分割损失加上两个辅助项:\(\mathcal{L}_{total}=\lambda_{ce}\mathcal{L}_{ce}+\lambda_{dice}\mathcal{L}_{dice}+\lambda_1\mathcal{L}_{distill}+\lambda_2\mathcal{L}_{PSCL}\),其中 \(\lambda_{ce}=\lambda_{dice}=5.0\)(沿用 RSRefSeg 2),辅助项经调参定为 \(\lambda_1=0.5\)、\(\lambda_2=0.2\)。骨干是 siglip2-so400m-patch16-512 + sam2.1-hiera-large,两个编码器都用 LoRA(\(r=16\))做参数高效微调,可训练部分只有新引入的低秩模块、LGCD 模块和 SAM 解码器,主干权重冻结;输入分别 resize 到 512 与 1024,不做任何数据增强;AdamW、峰值学习率 \(1\times10^{-4}\)、batch size 8、300 epoch、BF16、DeepSpeed ZeRO-2、8 张 RTX PRO 6000。
实验关键数据¶
主实验¶
在两个标准基准上评估:RefSegRS(512×512,2,172/413/1,817)与 RRSIS-D(800×800,12,181/1,740/3,481)。指标是 cIoU、gIoU 与 Pr@X。
| 数据集 | 方法 | 发表 | [email protected] | [email protected] | cIoU | gIoU |
|---|---|---|---|---|---|---|
| RefSegRS | LAVT | CVPR'22 | 51.84 | 2.09 | 71.86 | 47.40 |
| RefSegRS | RMSIN | CVPR'24 | 79.20 | 3.25 | 75.72 | 62.58 |
| RefSegRS | FIANet | TGRS'24 | 84.09 | 7.10 | 78.32 | 68.67 |
| RefSegRS | RS2-SAM 2 | AAAI'26 | 84.31 | 21.19 | 80.87 | 73.90 |
| RefSegRS | RSRefSeg-2 | TGRS'26 | 88.22 | 34.40 | 81.24 | 77.39 |
| RefSegRS | CROSS | — | 88.61 | 41.32 | 83.25 | 79.51 |
| RRSIS-D | LAVT | CVPR'22 | 69.52 | 24.94 | 77.19 | 61.04 |
| RRSIS-D | RMSIN | CVPR'24 | 74.26 | 24.53 | 77.79 | 64.20 |
| RRSIS-D | RS2-SAM 2 | AAAI'26 | 77.56 | 29.73 | 78.99 | 66.72 |
| RRSIS-D | RSRefSeg-2 | TGRS'26 | 80.23 | 31.05 | 79.45 | 69.17 |
| RRSIS-D | CROSS | — | 81.24 | 32.82 | 79.89 | 68.92 |
相比最强对手 RSRefSeg 2:RefSegRS 上 cIoU +2.01、gIoU +2.12、[email protected] +6.92;RRSIS-D 上 cIoU +0.44、[email protected] +1.01、[email protected] +1.77,但 gIoU 低 0.25、[email protected](74.56 vs 75.78)与 [email protected](64.80 vs 65.41)也略低——论文对此的解释是 RRSIS-D 里密集小目标的尺度差异极端,模型把优先级给了全局逻辑定位与高精度命中,而不是边界贴合。
参数量方面(Table 6):基线(SigLIP 2 + SAM 2)1.438 B 总参 / 88.41 M 可训练(6.15%),RSRefSeg 2 为 1.447 B / 97.87 M(6.76%),CROSS 为 1.455 B / 106.09 M(7.29%)。也就是在 1.4 B+ 的骨干上只多引入 1.23%(相对基线)的可训练参数。论文没有报告推理时延、FPS 或 FLOPs,这一点在下面"局限"里再谈。
消融实验¶
组件消融(Table 3a,cIoU %,基线为 SigLIP 2 + SAM 2):
| 配置 | CRE | TGD | \(\mathcal{L}_{PSCL}\) | RefSegRS | RRSIS-D |
|---|---|---|---|---|---|
| Baseline | ✗ | ✗ | ✗ | 80.82 | 77.80 |
| + CRE | ✓ | ✗ | ✗ | 82.55 | 78.63 |
| + CRE + TGD | ✓ | ✓ | ✗ | 83.15 | 79.02 |
| 仅 PSCL(无 LGCD) | ✗ | ✗ | ✓ | 82.11 | 78.12 |
| Full | ✓ | ✓ | ✓ | 83.25 | 79.89 |
PSCL 负样本构成(Table 3b,cIoU %):
| 感知式负样本 | 空间反事实负样本 | RefSegRS | RRSIS-D |
|---|---|---|---|
| ✗ | ✗ | 83.15 | 79.02 |
| ✓ | ✗ | 83.21 | 79.34 |
| ✗ | ✓ | 83.20 | 78.70 |
| ✓ | ✓ | 83.25 | 79.89 |
蒸馏层选择(Table 5,cIoU %):
| 层索引 | RefSegRS | RRSIS-D |
|---|---|---|
| {18, 24, 27} | 83.19 | 79.71 |
| {5, 15, 27} | 82.76 | 79.42 |
| {25, 27, 27} | 83.14 | 79.50 |
| {9, 18, 27}(采用) | 83.25 | 79.89 |
关键发现¶
- 贡献主要来自 LGCD,不是标题里的对比学习。CRE 单独就带来 +1.73(80.82→82.55),再叠 TGD 到 83.15;PSCL 最后只加 +0.10(RefSegRS)。而"只有 PSCL、没有 LGCD"的配置是 82.11(+1.29)——说明两侧机制在功能上部分重叠:结构约束本身也在压空间歧义。作者自己的解释是 PSCL 提供的是"抑制视觉相似干扰物"的判别力,属于锦上添花而非主要来源。
- 增益高度集中在严格阈值上。RefSegRS 的 [email protected] 从 34.40 提到 41.32(+6.92),而 [email protected] 只 +0.39;RRSIS-D 上 [email protected] +1.77 对 [email protected] +1.01。这个分布形态和"缓解表征漂移、让掩码严格贴住目标边界"的说法是自洽的——松阈值下基线本来就能命中,差距只在高精度区间显形。
- 两侧负样本都不能砍。只留感知式负样本 83.21/79.34,只留空间反事实负样本 83.20/78.70(比不加负样本的 79.02 还低),两者都有才 83.25/79.89。空间负样本单独用会掉点,作者归因于遥感杂乱场景里"没有视觉落地的空间线索"本身歧义太大。
- 超参相当鲁棒:\(\lambda_1=0.5\)、\(\lambda_2=0.2\)、\(K=8\)、\(\alpha=0.1\) 在 Fig. 3 的广泛扫描区间里都稳定优于基线;\(\lambda_1\) 超过 0.5 会出现梯度主导、联合优化不稳;\(\alpha\) 取 0.5 会过度抑制潜在目标特征。层索引的选择作者也明说不强调严格最优,只要求覆盖不同中间阶段,过浅({5,15,27})才掉 0.49。
- 需要留意两处论文自身的不一致:正文实现细节写"7.2% 参数被更新"而 Table 6 写 7.29%;RRSIS-D 的分析段提到一个 "Filter-Refine-Verify paradigm",全文其他地方没有定义。⚠️ 以原文/表格为准。
亮点与洞察¶
- 把"教师"从掩码换成亲和矩阵,是这篇最值得搬走的 trick。掩码级蒸馏要为教师的错误掩码买单,而 Gram 矩阵只表达"哪两个 patch 属于同一结构",与类别、与教师的解码错误都解耦;再叠一层文本软掩码做条件路由,就得到一个既能注入几何、又不污染语义空间的软正则。任何"想要结构先验但怕污染语义"的场景(医疗、遥感、深度估计引导的分割)都能直接套这个形式。
- "文本注意力矩阵当软掩码"是一举两得的设计:它既是交叉注意力的副产物(不用额外算),又天然携带了语言相关性,所以能拿来做蒸馏的空间权重。这种"从已算出的中间量里回收一个掩码"的思路,比另训一个相关性打分头便宜得多。
- 困难负样本的两种构造都很贴合遥感的病理:视觉侧挑"掩码外最像文本的背景",正对应遥感里"同类地物遍地都是";语言侧换主客而不是换词,正对应模型"只匹配关键词、不解码句法"的失败模式。负样本不是随手加的,而是从两条具体的失败链反推出来的。
- 反事实文本用 Qwen2.5-7B-Instruct 离线批量生成、不参与训练,是个很轻的落地方式:把"需要句法理解"这件事从模型结构问题转成了数据构造问题。
局限与展望¶
- 没有推理成本报告。论文只给了参数量(Table 6),没有推理时延、FPS、显存或 FLOPs。考虑到 N×N 的 Gram 矩阵在 1024×1024 输入下的开销不小,而且方法仍需 SAM 2 编码器前向,实际部署成本是未知数——这是评判"实用价值"时最大的信息缺口。
- 消融与标题的权重不匹配。标题强调 "Dual-Constraint Grounding",但 PSCL 的净增益只有 +0.10 cIoU(RefSegRS),主要提升由 LGCD 贡献;同时"只有 PSCL 不要 LGCD"就到了 82.11,两者的独立性并不干净,读者很难判断两侧约束的真实边际价值。
- RRSIS-D 上是"偏科式"取胜:cIoU / [email protected] / [email protected] 领先,但 gIoU 和 [email protected]、[email protected] 都低于 RSRefSeg 2。论文用"优先全局逻辑而非启发式边界对齐"解释,但这也可以读成密集小目标的边界质量确有退步——如果下游要用掩码算面积或做变化检测,这个 trade-off 需要额外验证。
- 反事实文本的覆盖面有限。扰动模板只有"方位词取反 + 主客交换"两类,多重从句、嵌套关系(如"左边那架飞机的右边那架")以及数量词、比较级都没有覆盖;而论文自己举的最难例恰恰是嵌套表达。扰动的多样性和正确性也没有人工核验统计。
- 只在两个遥感基准(RefSegRS、RRSIS-D)上验证,没有跨传感器(SAR、多光谱、红外)、跨分辨率或开放词汇的泛化实验;教师 SAM 2 与训练数据是否存在域重叠也未讨论。
- 可改进方向:把 Gram 矩阵蒸馏换成低秩或随机采样近似,让级联蒸馏能铺到更多层;用关系图/句法树自动生成更丰富的反事实而非模板替换;给空间约束加一个显式的相对位置预测头,检验"语言侧约束"能否由几何监督更好地承担。
相关工作与启发¶
- vs RSRefSeg / RSRefSeg 2:同属"VLM 出提示 + SAM 解码"路线,也是本文的直接基线。区别在于它们是严格单向流(SAM 编码器在提示生成阶段闲置),CROSS 把 SAM 的结构信息反向蒸回 VLM 的多个层级,并额外做对比约束;代价是多了级联蒸馏模块与对应训练开销,收益在高精度阈值上最明显。
- vs LISA / EVF-SAM 这类 MLLM 系:它们靠多模态大模型生成文本驱动嵌入喂给 SAM,擅长整体理解与复杂推理,但论文明确选择不走这条路——理由是 RRSIS 要的是像素级定位而非生成式文本能力,初步证据显示 MLLM 系在这类稠密任务上打不过 CLIP 系。CROSS 属于后者的加强版。
- vs LAVT / RMSIN / FIANet 等专用结构:它们为指代分割重新设计融合模块(语言感知的 ViT、旋转卷积、多尺度细粒度对齐),不依赖基础模型的提示范式。CROSS 在表格里比它们高出一大截(RRSIS-D cIoU 79.89 vs RMSIN 77.79),但这个比较要打折扣:CROSS 用的是 1.4 B+ 的预训练骨干,属于"基础模型适配"对"从零设计结构"的跨范式比较。
- vs Cascade-CLIP 这类级联对齐工作:它们靠内部的语义逐级精炼,CROSS 用的是外部几何先验(SAM 的亲和),把"结构"从模型内部的知识换成了另一个基础模型的观测,这也是"级联蒸馏"这个词在这里的真正含义。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把 SAM 的成对亲和(而非掩码)作为软正则蒸进 VLM 多个层级,并用文本注意力当空间软掩码,是这条 VLM+SAM 路线里少见的反向信息流设计;对比学习部分的构造虽贴题但偏常规。
- 实验充分度: ⭐⭐⭐⭐ 两个基准 + 组件/负样本/层选择/超参四组消融 + 参数量对比 + 可视化与 CKA 分析比较完整,但没有推理成本,也未做跨域或跨传感器验证,RRSIS-D 上的劣势项解释偏弱。
- 写作质量: ⭐⭐⭐⭐ 两个瓶颈的刻画与扰动实验证据讲得很清楚,配图(范式对比 + 空间逻辑探针)有说服力;扣分在于标题强调的双约束实际增益很小,且正文/表格有 7.2% vs 7.29% 之类的数字不一致。
- 价值: ⭐⭐⭐⭐ 在 RRSIS 上拿到了全面 SOTA 且参数量开销很小,亲和矩阵蒸馏这一机制可迁移到其他"需要结构先验又怕污染语义"的任务;但推理成本未知、增益集中在严格阈值,实用价值还需更多验证。