Uncertainty-aware tree height change regression¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://sid.erda.dk/sharelink/eP4ENGhKTv
领域: 遥感
关键词: 冠层高度变化、遥感大模型、不确定性感知回归、机载激光雷达、时序高分辨率卫星
一句话总结¶
论文构建了首个大范围高分辨率树冠高度连续变化及像元级不确定性基准数据集 CHC,并系统评估了主流地理空间基础模型在不确定性感知回归任务下的表现,揭示了监督基线及特定任务模型在亚像元连续变化回归上相比冻结 GFM 的显著优势。
研究背景与动机¶
监测树冠高度的时序动态对于量化陆地碳源碳汇、理解森林生态系统演替、监测灾害破坏以及追踪林木渐进生长与毁林至关重要。近年来,得益于高分辨率卫星影像的广泛覆盖以及以自监督地理空间基础模型(GFMs)为代表的深度学习架构演进,遥感领域已能实现全球或洲际尺度的静态树冠高度填图。然而,现有变化检测研究多将问题简化为二值变化检测(如森林砍伐/未砍伐的二元标签),完全忽略了植被高度变化的连续性本质——林木生长通常年增量微弱,而林冠局部间伐、枯死与退化也呈现连续梯度的数值变化。
造成这一局限的核心技术瓶颈在于,缺乏大规模、高分辨率且具备可靠真值不确定性量化的连续变化基准数据集。多期机载激光雷达(ALS)虽可作为测量高度差的高精度金标准,但不同年份航测的航高、传感器、扫描几何与脉冲密度(pulse density)差异巨大,离散点云采样复杂几何表面时不可避免地存在系统偏差与异方差统计噪声;若不考虑参考标签本身的测量不确定性,在微弱信号与高噪声的背景下训练和评估连续回归模型便极易失效。
为了打破这一困局,本文将机载激光雷达采样物理机制与时序光学遥感深度结合。核心 idea:构建覆盖西班牙 10,598 平方公里、3 米分辨率的树冠高度连续变化及像元级统计/系统不确定性基准数据集 CHC,并引入显式建模参考标签方差的不确定性感知回归训练与评估机制。
方法详解¶
整体框架¶
本文的方法流程涵盖两个核心部分:基准数据集 CHC(Canopy Height Change)的构建流水线,以及基于该数据集的地理空间基础模型不确定性感知回归基准测试。输入端由两期相隔五年的机载激光雷达点云(西班牙 PNOA 计划的 2018 年 Cobertura 2a 与 2023 年 Cobertura 3a)以及匹配的 2018–2023 年高分辨率 PlanetScope 时序光学多光谱卫星影像组成;输出端则是针对树冠高度连续变化 \(\Delta h\) 的密集像元级预测。
整体数据流水线先对点云在 3 米规则网格上提取第 95 高度百分位数生成地表数字表面模型(DSM)并直接做垂直差分,规避 DTM 插值误差;接着通过路面残差与局部高密度点云降采样仿真,分别估计像元级系统不确定性 \(\sigma_{\text{syst}}\) 与异方差统计不确定性 \(\sigma_{\text{stat}}\);最后在模型训练阶段,利用目标方差构建加权 MSE(wMSE)或基于显著置信区间的阈值化 MSE(tMSE)指导 GFM 解码器微调。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["双期 ALS 点云 (2018/2023) + PlanetScope 时序影像"] --> B["1. DSM 网格栅格化与高度差分<br/>ASPRS 植被类 95 分位数计算 Δh(95)"]
B --> C["2. 系统与异方差统计不确定性估计<br/>静态路面分析 + 脉冲密度降采样 MLP 拟合"]
C --> D["3. 不确定性感知回归微调<br/>wMSE 方差逆加权与 tMSE 显著性阈值过滤"]
D --> E["4. 多尺度特征融合与残差精炼<br/>冻结 GFM 编码器 + LTAE 时序融合 + UPerNet 密集预测"]
E --> F["连续树冠高度变化图及不确定性评估指标"]
关键设计¶
1. DSM 网格栅格化与高度差分:规避 DTM 误差传播的直接表面差分
现有树高变化估算常依赖冠层高度模型(CHM = DSM - DTM)之间的差值,但在复杂山区或植被覆盖区,数字高程模型(DTM)受地面激光回波穿透率不足影响,插值生成的地面网格往往携带额外误差。针对该问题,作者直接采用两期点云分类中的植被点(ASPRS 类别 3–5),在 3 米规则格网内计算第 95 高度百分位数生成地表表面高程 \(h(95)\)。通过直接进行垂直差分得到地表高度变化 \(\Delta h(95) = h(95)_{2023} - h(95)_{2018}\)。同时,设定双期植被高度均低于 3 米的区域进行空间掩膜,排除农田收割、低矮灌木等非木本植被引起的短周期变化干扰。
2. 系统与异方差统计不确定性估计:静态残差与点密度降采样拟合
机载激光雷达的几何误差由恒定的系统误差 \(\sigma_{\text{syst}}\) 与随冠层几何及扫描参数变化的统计误差 \(\sigma_{\text{stat}}\) 叠加而成。本文提出了一套数据驱动的解耦模拟机制: - 对于系统不确定性 \(\sigma_{\text{syst}}\),基于土地覆被数据筛选出观测期内未发生变化的平坦硬化道路表面,统计两期 ALS 点云的垂直残差分布,得到残差标准差在 \(0.17\,\text{m}\sim 0.23\,\text{m}\) 之间,系统偏移量在 \(-0.09\,\text{m}\sim -0.01\,\text{m}\) 之间; - 对于统计不确定性 \(\sigma_{\text{stat}}\),由于激光脉冲在树冠顶点存在离散采样漏失率(脉冲密度越低,漏测冠顶的概率越高),作者选取脉冲密度 \(\rho_i \ge 10\,\text{ppm}^2\)(即每个 \(3\times 3\,\text{m}\) 格网内含 \(\ge 90\) 个激光脉冲)的像元作为准真值基准;随后对这些高密度网格进行数值降采样(生成 \(1\,\text{ppm}^2 < \rho < 10\,\text{ppm}^2\) 的样本),计算不同采样率下引起的高度偏差与表面粗糙度等几何特征向量 \(v\)。在包含 \(7.935\times 10^5\) 个格网的数据集上训练多层感知机(MLP)调整模型 \(f(\rho, v)\),采用高斯负对数似然(Gaussian NLL)损失回归出局部位移 \(\hat{b}_i\) 与方差 \(\hat{\sigma}_i^2\):
最终,每个像元的总参考方差由系统方差与统计方差相加获得:\(\sigma_i^2 = \sigma_{\text{syst},i}^2 + \sigma_{\text{stat},i}^2\)。
3. 不确定性感知回归训练准则:抑制噪声标签与排除低信噪比样本
标准均方误差(MSE)对训练集内所有像元一视同仁,而深度神经网络在拟合真实模式的同时极易记忆标签中的高斯和异方差噪声。为使模型聚焦于高置信度的高度变化信号,本文引入了两种面向不确定性标签的训练策略: - 方差逆加权 MSE(wMSE):按照参考真值方差的倒数对每个像元的残差平方进行赋权,令高不确定性像元的损失贡献被平滑抑制:
- 阈值化 MSE(tMSE):仅在绝对变化显著性 \(z\)-score 超过 1.65(对应在“无变化假设”下单侧或双侧随机波动发生概率小于 10%)的像元上计算损失,直接在训练中硬过滤掉大量处于微小噪声区间的伪变化样点。
4. 基础模型多尺度时序适配架构:LTAE 时序融合与残差精炼
由于各开源地理空间基础模型(GFM)的设计架构各异(有的仅支持单期、有的通道数受限),本文依托 PANGAEA 评测框架建立了统一的密集回归适配层。各 GFM 主干被完全冻结(保持预训练通用特征不被微调破坏);针对无法直接处理多时相输入的编码器,各年度 PlanetScope 影像经过 GFM 编码后,由轻量级时序自注意力编码器(LTAE)利用时间位置编码完成多时相特征融合;融合后的多尺度特征金字塔输入可训练的 UPerNet 解码器执行尺度聚合,并在双线性插值上采样后外接残差精炼模块,最终输出 3 米分辨率的连续高度变化图。
损失函数 / 训练策略¶
模型在 CHC 数据集训练集(592 个 \(1024\times 1024\) 图幅)上训练 50 个 epoch,采用 AdamW 优化器配合学习率预热(warmup)与余弦退火学习率调度。训练与验证过程中应用植被掩膜(排除树高 \(< 3\,\text{m}\) 区域),并对掩膜边缘做 1 像元腐蚀以消除边界混杂效应。在测试集评估中,仅在统计显著变化像元(\(|z| > 1.65\))上计算 RMSE、MAE、nMAE 和 \(R^2\)。
实验关键数据¶
主实验¶
在 CHC 数据集测试集上,评测了完全监督 baseline(UNet、ResNet-50)、全球独立模型 ECHOSAT,以及 9 种主流地理空间基础模型(GFM)在三种损失配置下的最佳表现(原论文 Table 2):
| 模型编码器 | 最佳损失策略 | 整体 RMSE (m) ↓ | 整体 MAE (m) ↓ | 整体 nMAE ↓ | 整体 \(R^2\) ↑ |
|---|---|---|---|---|---|
| ECHOSAT (专业时序模型) | - | 5.25 | 3.70 | 0.67 | 0.55 |
| Supervised UNet (端到端) | tMSE (t) | 5.65 | 3.89 | 0.70 | 0.48 |
| Prithvi-EO 2.0 | wMSE (w) | 5.90 | 4.32 | 0.78 | 0.43 |
| DINOv3 | tMSE (t) | 5.95 | 4.20 | 0.76 | 0.42 |
| DOFA | tMSE (t) | 5.99 | 4.14 | 0.75 | 0.41 |
| SatlasNet | wMSE (w) | 6.43 | 4.63 | 0.83 | 0.33 |
| CROMA | tMSE (t) | 6.61 | 4.34 | 0.78 | 0.29 |
| Supervised ResNet-50 | tMSE (t) | 6.98 | 4.55 | 0.82 | 0.21 |
| RemoteCLIP | tMSE (t) | 7.12 | 5.10 | 0.92 | 0.17 |
| TerraMind | sMSE (s) | 7.17 | 5.14 | 0.93 | 0.16 |
| SpectralGPT+ | sMSE (s) | 7.23 | 5.27 | 0.95 | 0.15 |
| Scale-MAE | tMSE (t) | 7.83 | 5.59 | 1.01 | 0.00 |
消融与变化方向判别实验¶
下表汇总了各模型在变化方向(增加 vs 减少)上的判别准确率与 F1 得分(原论文 Table 3):
| 模型编码器 | 损失策略 (s/t/w) | 树高增加 Precision | 树高增加 Recall | 树高增加 F1 ↑ | 树高减少 Precision | 树高减少 Recall | 树高减少 F1 ↑ |
|---|---|---|---|---|---|---|---|
| Supervised UNet | t | 0.85 | 0.80 | 0.83 | 0.60 | 0.69 | 0.64 |
| ECHOSAT | - | 0.83 | 0.85 | 0.84 | 0.63 | 0.59 | 0.61 |
| Prithvi-EO 2.0 | w | 0.84 | 0.79 | 0.81 | 0.57 | 0.65 | 0.61 |
| DINOv3 | t | 0.83 | 0.76 | 0.80 | 0.55 | 0.65 | 0.59 |
| DOFA | t | 0.83 | 0.77 | 0.79 | 0.54 | 0.63 | 0.58 |
| CROMA | t | 0.77 | 0.96 | 0.85 | 0.79 | 0.33 | 0.47 |
| Supervised ResNet-50 | t | 0.76 | 0.94 | 0.84 | 0.70 | 0.34 | 0.45 |
| Scale-MAE | t | 0.69 | 0.00 | 0.00 | 0.31 | 1.00 | 0.47 |
关键发现¶
- GFMs 在连续回归任务上普遍落后于专用/监督模型:所有冻结的 GFM 编码器微调均未能击败从头监督训练的 UNet(RMSE 5.65 m),更无法企及针对森林结构时序优化的 ECHOSAT(RMSE 5.25 m)。这表明现有以自监督掩码图像建模或图文对比学习预训练的 GFM 在亚像元几何微结构与高精度数值回归上表征能力有限。
- 不确定性加权与阈值过滤带来一致增益:将参考真值的不确定性引入训练,能够显著降低模型过拟合噪声的倾向。例如在监督 UNet 上,tMSE 相较普通 MSE 使整体 RMSE 降低了 9%;Prithvi-EO 2.0 结合 wMSE 后 RMSE 改善了 8%;DOFA 结合 tMSE 后 RMSE 改善了 4%。
- 方向与幅度的学习脱节:绝大多数模型能够较好地判断树高变化的大致极性(如 CROMA 树高增加 F1 达到 0.85),但在量化具体变化幅度(meters)时表现吃力;对于树高剧烈降低(如伐木),模型在空间召回率与数值逼近上仍存在较大误差。
亮点与洞察¶
- 物理与仿真驱动的异方差不确定性建模:利用激光雷达高密度区域降采样模拟脉冲稀疏效应,结合 NLL 高斯似然拟合,不仅提供单点变化值,更赋予每个像元严格推导的方差真值。
- 直面遥感变化检测从“分类”走向“连续回归”的难点:现有工作大多局限于二元砍伐检测,而 CHC 是首个提供 10,598 平方公里、3 米分辨率且包含微弱自然年生长与不同程度采伐的公开连续变化基准。
- 揭示了遥感基础模型在回归任务中的泛化瓶颈:实验有力地证明了通用的视觉与多模态自监督表征在迁移到精细三维物理量回归时,表现远不及监督 CNN 与垂直领域模型,为未来 GFM 的预训练目标设计敲响了警钟。
局限与展望¶
- 时序影像物候与光照扰动:尽管 PlanetScope 影像经过云掩膜和生长季后期的物候窗口筛选,但跨年份的光照角度、地表干湿状况和阴影变化仍会干扰光学传感器对林冠微小高度增量的识别。
- 微小生长量低于单期激光雷达噪声上限:五年间林木自然生长通常仅有数十厘米至一米多,在局部低脉冲密度区域(如 2018 年部分低至 1-2 ppm²),真实生长量容易被 ALS 几何噪声淹没,导致 \(R^2\) 整体偏低。
- 未来方向:探索全参数端到端微调 GFM;融合合成孔径雷达(SAR,如 Sentinel-1 / PALSAR)的相干性或后向散射特征以增强垂直结构敏感性;引入基于物理生长动力学方程的时空先验约束。
相关工作与启发¶
- vs OpenCanopy:OpenCanopy 同样基于机载激光雷达,但其变化子集仅关注 \(>15\,\text{m}\) 且面积 \(>200\,\text{m}^2\) 的极端二元林木砍伐损失,而本文 CHC 填补了连续生长与渐进性损失的双向回归空白。
- vs ECHOSAT:ECHOSAT 依赖 10 米分辨率空间雷达与光学数据做像元时序高度反演,利用 GEDI 数据进行宏观监督;本文 CHC 则提供了 3 米超高空间分辨率并在训练与验证阶段深度集成像素级误差方差建模。
- vs 传统二值变化检测(BCD):传统方法只能回答“有没有变”,本文框架则推进到“变了多少米”以及“该标签在统计学上有多大概率是真实变化”。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出连续树高变化与像元级不确定性耦合的数据集与基准任务。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 9 种主流 GFM 与经典基线,消融了不同损失函数与变化极性。
- 写作质量: ⭐⭐⭐⭐⭐ 问题表述清晰,误差物理建模推导自洽且逻辑严密。
- 价值: ⭐⭐⭐⭐⭐ 为森林碳储量时序高精度监测与遥感大模型下游回归评估提供了关键基准。