TerrainGraphNet: Terrain-Constrained Graph Reasoning for Landslide Segmentation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 遥感
关键词: 滑坡分割, 地形感知学习, 图注意力网络, 数字高程模型, 遥感图像
一句话总结¶
针对传统滑坡分割将数字高程模型(DEM)简单视作额外外观通道而忽视地形地貌拓扑约束的问题,TerrainGraphNet 提出地形调制特征交互与坡度连续性约束的稀疏图注意力推理,显著降低边界泄漏与拓扑破碎。
研究背景与动机¶
滑坡是全球最具破坏性的地质灾害之一,从高分辨率遥感图像中快速准确地提取滑坡边界对于防灾减灾与应急响应至关重要。近年来,深度卷积神经网络与视觉 Transformer 虽大幅推进了遥感语义分割的性能,但在滑坡场景中仍频繁出现碎斑预测和边界泄漏。滑坡在物理本质上是受地形地貌控制的重力地质演化过程,其空间分布沿着坡度方向延展、在地形坡度连续处保持空间连通,并在山脊线或坡折断裂处截断;然而,滑坡体内常受植被覆盖、阴影遮蔽以及光谱异质性干扰,仅靠光学图像的外观特征极易导致同谱异物或异谱同物的误判。
为了引入地形几何信息,现有方法通常将对齐的数字高程模型(DEM)作为辅助通道直接与 RGB 拼接,或通过简单的双分支卷积进行统一融合。这种将 DEM 简单降阶为额外“外观通道”的做法存在根本性缺陷:它假定视觉和高程在所有空间位置具有均等贡献,忽视了陡坡与平缓区域模态重要性的动态差异,更未能在空间特征传播中显式施加地貌结构的物理连通约束,使得长程上下文传播容易跨越天然山脊造成过度蔓延。
本文的切入角度是将滑坡分割从传统的像素级外观分类重构为地形条件下的结构化预测问题,使特征传播在地形一致区域自适应扩散,同时在坡度突变处严格受阻。本文的核心 idea 是:通过双路视觉-地形编码与自适应软门控实现地形调制的特征交互,并进一步联合特征相似度与 DEM 坡度连续性构建稀疏拓扑图,利用图注意力网络(GAT)在保持地貌物理连通的同时抑制跨山脊扩散,实现拓扑一致的高精度滑坡边界轮廓勾勒。
方法详解¶
整体框架¶
TerrainGraphNet 的整体流程包含四个阶段:联合视觉-地形编码(提取多尺度光学语义与 DEM 坡度梯度)、地形调制特征交互(自适应门控双向调节视觉与高程表征)、地形感知图推理(基于特征与坡度双重连续性构建稀疏图并沿地形拓扑传播),以及分层残差解码生成最终预测掩码。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入数据<br/>RGB 影像 + DEM 高程"] --> B["联合视觉-地形编码<br/>SAM/CNN 与坡度梯度计算"]
B --> C["地形调制特征交互<br/>自适应双向门控特征调节"]
C --> D["地形感知图构建与传播<br/>坡度约束相似度建图与残差 GAT"]
D --> E["分层残差解码<br/>多尺度跳跃连接与深层监督"]
E --> F["输出预测掩码<br/>高保真滑坡分割图"]
关键设计¶
1. 联合视觉-地形编码:兼顾全局大上下文、细粒度纹理与局部坡度梯度
针对遥感光学图像尺度变化剧烈且滑坡边缘细节丰富的特性,视觉编码分支采用双流架构:全局分支利用冻结的预训练 Segment Anything Model(SAM)大模型编码器提取全局语义表示 \(F_g \in \mathbb{R}^{H' \times W' \times C}\),捕捉长程视觉上下文;局部分支则在轻量级多尺度 CNN 上分别以 64、128、256 三种分辨率处理中等分辨率图像提取局部细节 \(F_l\),最后经通道拼接和 \(1 \times 1\) 卷积投影融合成联合视觉特征 \(F_v\)。在地形分支中,除了将高程图 \(D\) 送入地形编码器获取 \(F_t\) 外,针对原始高程绝对值无法直接表征滑坡不稳定性这一物理机理,模型显式计算 DEM 在横向与纵向的空间偏导数,得到坡度幅值图:
坡度图突显了陡峭区域与地貌断裂带,为后续的地貌特征调制与图拓扑连接提供了明确的物理先验。
2. 地形调制特征交互:空间自适应的跨模态双向软门控
常规特征拼接或均值加权假定所有像素处视觉与地形的信噪比恒定,但实际上在坡度陡峭的滑坡易发区,地形坡度结构对滑坡边界的约束起决定性作用,而在平缓均质区域视觉纹理更占主导。为避免浅层卷积直接混合导致的表征混淆,该模块通过两个轻量可学习投影 \(W_t\) 和 \(W_v\) 分别生成地形和视觉的软空间注意门控图 \(A_t = \sigma(W_t F_t)\) 与 \(A_v = \sigma(W_v F_v)\),并引入加性偏置进行乘性调制:
这种偏置设计保证了原有模态特征不会因门控值较低而被完全抑制,而是根据地形起伏自适应增益。最后将调制后的两路特征拼接并通过可学习映射 \(\psi\) 投影为统一的局部特征空间 \(F\),使得每个空间位置的视觉嵌入均蕴含动态的地貌倾向性。
3. 地形感知图构建与传播:坡度连续性约束下的拓扑一致推理
由于局部植被遮挡或阴影干扰,同属一个滑坡体的区域在局部特征图上往往出现空间裂隙,纯局部卷积无法穿透这些视效断点。为此,模型将特征图上的每个空间位置视为图节点,联合多模态特征 \(f_i\) 与物理坡度标量 \(s_i\) 计算空间节点间的亲和度权重:
其中 \(\alpha \in [0, 1]\) 平衡特征嵌入相似度与坡度结构连续性。即便两点在几何坐标上存在距离,若具备相似的视觉地形表征且处于连续的坡度梯度带内,也能建立强拓扑连接;相反,当两点跨越山脊或深谷使得坡度差极大时,其连通权重被指数级截断。对每个节点选取前 \(K\) 个亲和度最大的邻居构建稀疏连通图,随后通过 \(L\) 层图注意力层(GAT)进行各向异性消息传递,并在最外层辅以残差跳跃连接 \(F' = F + h^{(L)}\)。这一过程等价于学习了一个受地形加权的平滑先验,强力驱动预测掩码沿真实滑坡滑动带聚合,根除了跨山脊误扩散现象。
损失函数 / 训练策略¶
模型采用多任务复合损失监督网络训练,结合 Dice 损失与二元交叉熵(BCE)损失,以兼顾区域重叠率最大化与单像素分类稳定性:
为确保浅层解码特征的一致性并稳定图推理梯度的反向传播,在多尺度解码器的中间上采样阶段施加辅助监督:
其中辅助损失系数设为 \(\lambda_{aux} = 0.4\)。
实验关键数据¶
主实验¶
在代表性公开基准 Bijie 数据集(高分辨率卫星图像及真值 DEM)与 Luding 震后滑坡数据集(无真值 DEM,采用预训练 Depth Anything V2 估计单目深度作为地形分支输入)上,TerrainGraphNet 与主流语义分割基线及滑坡专用模型的量化评测结果如下表所示:
| 数据集 | 模型 | Precision (%) | Recall (%) | F1 (%) | IoU (%) | mIoU (%) | Betti Error ↓ | Connectivity Error ↓ | HD95 ↓ | Boundary F1 ↑ |
|---|---|---|---|---|---|---|---|---|---|---|
| Bijie | U-Net | 84.64 | 63.51 | 72.57 | 56.94 | 76.20 | 2.9500 | 0.8540 | 27.84 | 35.12 |
| Bijie | SegFormer | 84.71 | 75.87 | 80.05 | 66.74 | 81.32 | 0.3060 | 0.0431 | 19.89 | 43.47 |
| Bijie | FFS-Net (前SOTA) | 87.64 | 86.61 | 87.12 | 77.19 | 87.15 | 0.0862 | 0.0474 | 15.06 | 52.22 |
| Bijie | TerrainGraphNet (本文) | 88.84 | 87.80 | 88.32 | 79.08 | 88.26 | 0.0776 | 0.0172 | 14.42 | 57.31 |
| Luding | U-Net | 80.34 | 75.37 | 77.78 | 63.63 | 79.62 | 1.0400 | 0.8200 | 22.93 | 36.31 |
| Luding | SegFormer | 81.52 | 83.73 | 82.61 | 70.37 | 81.86 | 0.3500 | 0.3300 | 25.21 | 39.34 |
| Luding | FFS-Net (前SOTA) | 86.00 | 86.85 | 86.42 | 76.09 | 84.73 | 0.9500 | 0.6400 | 25.69 | 50.04 |
| Luding | TerrainGraphNet (本文) | 87.06 | 89.40 | 88.22 | 78.92 | 87.18 | 0.3400 | 0.2400 | 21.94 | 52.03 |
在挑战性极大的 Landslide4Sense 数据集上,TerrainGraphNet 同样取得了 54.20% 的最高 IoU 与 76.39% 的 mIoU,优于此前最优的 FFS-Net(53.84% IoU)。
消融实验¶
在 Bijie 数据集上逐步激活各组件的消融评测(BB 为 SAM 视觉主干,LE 为局部 CNN 编码器,TE 为地形编码器,TMFI 为地形调制特征交互,HD 为分层解码器,TAGR 为地形感知图推理模块):
| 配置 | BB | LE | TE | TMFI | HD | TAGR | Precision (%) | Recall (%) | F1 (%) | IoU (%) | mIoU (%) | 说明 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 基线主干 | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | 80.93 | 83.65 | 82.30 | 69.92 | 81.34 | 仅用冻结 SAM 提取全局外观 |
| +局部细节 | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 84.65 | 80.41 | 82.48 | 70.20 | 82.94 | 加入多尺度 CNN 细化局部边缘 |
| +地形与门控 | ✓ | ✓ | ✓ | ✓ | ✗ | ✗ | 88.14 | 79.75 | 83.75 | 72.04 | 83.72 | 显式注入 DEM 及双向软门控 |
| +分层解码 | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 85.78 | 85.39 | 85.58 | 74.80 | 85.82 | 多尺度残差跳跃特征上采样 |
| 完整模型 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | 88.84 | 87.80 | 88.32 | 79.08 | 88.26 | 加入 TAGR 图推理,IoU 跃升 4.28% |
融合模式与图推理的单独切片消融显示:若将 TMFI 替换为逐元素相加(Add + TAGR),IoU 下降至 77.32%;替换为逐元素乘法(Multiply + TAGR),IoU 降至 76.21%;若仅使用普通拼接且彻底剥离 TAGR 模块(Concat w/o TAGR),IoU 显著衰减至 74.55%,同时 95% 豪斯多夫距离从 14.42 恶化至 18.20,证实了图推理对边界修饰的决定性贡献。
关键发现¶
- 图推理贡献最显著:从完整消融可以看出,TAGR 模块使 IoU 单独增加了 4.28 个百分点(从 74.80% 提升至 79.08%),同时拓扑连通误差 CE 从 0.1515 骤降至 0.0172,表明坡度加权连通性成功弥合了局部阴影与植被造成的掩码空洞。
- 图超参数对稀疏度敏感:图节点邻域大小实验显示,\(K=4, L=2\) 达到最优平衡;当增大邻域至 \(K=16\) 时,IoU 下降至 77.16%,说明过于密集的连接会引入无关的地形上下文,破坏局部地貌的异质性边界。
- 单目深度平替真值 DEM 的泛化性:在缺乏实测 DEM 的 Luding 数据集上,直接使用 Depth Anything V2 提取的相对深度推算坡度,模型依然大幅领先各基线(IoU 达到 78.92%),验证了该地形约束框架对生成式深度估计的良好鲁棒性。
亮点与洞察¶
- 物理先验驱动的图亲和度构建:不同于常规图卷积完全依赖神经嵌入相似度的黑盒建图,论文将解析计算的坡度梯度作为几何物理阻尼项嵌入亲和度公式。这种“物理约束+表征相似”的双轮驱动策略,以极低的计算开销(TAGR 仅占 0.54 GFLOPs、3.61 ms 耗时)精准阻断了跨地貌边界的错误特征扩散。
- 跨主干泛化能力稳健:在 ResNet-50 主干替换验证中,加入 TerrainGraphNet 模块使 ResNet-50 的滑坡分割 IoU 从 65.36% 大幅提振至 73.87%(增益 +8.51%),表明该设计具有即插即用的通用适配潜力,不局限于 SAM 等超大视觉模型。
局限与展望¶
- 复杂地质因子的单一化近似:当前框架仅显式引入了坡度幅值,消融实验显示加入坡向(Aspect)与曲率(Curvature)虽能在部分边界指标上带来微弱收益,但整体未见稳定突破。未来可进一步探索降雨汇水指数、断层构造与土质岩性等多维地理变量的深层图耦合。
- 极端地形下估计深度的形变误差:在没有测绘 DEM 的灾害应急现场,依赖单目深度模型估计相对地形虽然可行,但在剧烈逆光或高陡峡谷极端光照下,深度估计的畸变可能反向误导图连通性构建。
相关工作与启发¶
- vs FFS-Net (IEEE TGRS 2023):FFS-Net 采用双流网络配合多尺度交叉注意力融合光学与 DEM 特征,但仅停留在欧氏网格上的局部注意力层级;TerrainGraphNet 通过在非欧几何空间构建坡度约束的拓扑图,实现了长程连通性与地貌边界阻断的协同,在 Bijie 上将 F1 和 IoU 分别提升 1.20% 和 1.89%,边界 F1 显著提高 5.09。
- vs SegFormer (NeurIPS 2021):SegFormer 依靠层次 Transformer 提取全局上下文,但缺少地貌物理几何先验,在阴影遮挡区域易产生断裂;本文利用 SAM 提取全局语义的同时注入高程梯度拓扑平滑先验,有效解决了复杂滑坡区的拓扑破碎问题。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 创新性地将地貌坡度连续性转化为图推理亲和度权重,重构了多模态滑坡分割范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三个典型基准、详细的边界/拓扑几何指标评测、深度估计迁移验证以及跨主干泛化实验。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然且逻辑严密,图文对照清晰,公式推导与物理机理呼应得当。
- 价值: ⭐⭐⭐⭐⭐ 对空天遥感地质灾害智能监测具有高实用价值,尤其为缺少精准 DEM 的即时灾情评估提供了可行路径。