Counting Trees from Satellite Imagery with Noisy Supervision¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/dgominski/treematch
领域: 自动驾驶
关键词: 树木计数, 最优传输, 含噪监督, 卫星遥感, 密度估计
一句话总结¶
针对高分辨率卫星遥感中树冠重叠边界模糊及机载激光雷达弱标注噪声难题,TreeMatch 将树木计数建模为非平衡最优传输(UOT)密度匹配问题,并通过传输边际残差迭代自校正弱标注,在覆盖三大洲 2.58 万平方公里的 TinyTrees 基准上显著超越检测与回归基线。
研究背景与动机¶
单木级别的数量与空间分布估算是森林碳汇核算、生态多样性监测以及人造绿化带管理的核心基础。长期以来,大范围树木遥感多聚焦于森林覆盖率、树冠高度或总生物量等宏观聚合指标,缺少单株尺度的精确解析。尽管航空影像或无人机视角下已有少量单木检测尝试,但将单木计数扩展至全球级卫星遥感仍面临严峻瓶颈。卫星影像分辨率受限(通常在 0.8 米至 4 米之间),单株孤立树木尚具可分辨性,但在郁闭密林中,树冠连续交叠、阴影掩映且存在传感器模糊,导致“单株树木”的离散几何边界在物理与感知层面上均严重退化。传统的实例检测模型(如 YOLO 或 CenterNet)在这种非可分场景下极易发生漏检与预测崩塌。
更大规模的实际阻碍来自于标注成本与标注质量的结构性失衡。纯人工标注单木不仅耗资极其昂贵,而且难以覆盖大尺度区域;而利用机载激光扫描(ALS)或自动化算法批量生成的衍生标注虽然规模庞大,却在密林区域伴随着高度结构化且空间相关的伪检(假阳性)与漏检(假阴性)。若直接采用刚性的逐像素均方误差(\(L_2\) 回归)或平滑的 KL 散度,微小的位置偏移就会导致巨大的梯度惩罚,且弱标注中的系统性噪声会被模型直接拟合;而若采用人群计数中常见的人工平衡最优传输(Balanced OT),又强行假设了预测质量与真值标注的总体质量绝对守恒,一旦面对标注缺失或过密就会诱发严重失真。
本文的切入视角在于:树木计数不应强求硬性的离散边界划分,而应建模为兼顾空间几何邻近与局部质量容差的连续空间测度匹配。核心 idea:将卫星单木计数表述为非平衡最优传输(UOT)空间密度匹配问题,利用传输解的边际残差在训练过程中动态自校正弱标注噪声,同时联合稀疏精确的人工标注实现全局计数与局部几何对齐。
方法详解¶
整体框架¶
TreeMatch 的整体流水线以 UNet(ResNet-50 骨干)为预测网络,接收卫星影像切片并输出单通道非负连续树木密度图 \(z \in \mathbb{R}^{H \times W}_+\),整图树木总数通过像素密度积分直接得到。在训练机制上,系统设计了结合强标注(人工高精校验点)与弱标注(LiDAR/高度模型自动派生图)的双轨学习范式:强标注提供全局计数 \(L_1\) 损失与 UOT 几何对齐损失;弱标注首先通过第一阶段无梯度的 UOT 求解获得空间传输计划,提取边际残差用于自动补偿漏检与抑制伪检,随后在修正后的伪真值上计算第二阶段反向传播的 UOT 损失。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["卫星多光谱影像 x"] --> B["UNet 密度预测网络 ϕ"]
B --> C["连续树木密度图 z"]
C --> D["非平衡最优传输匹配<br/>UOT 空间测度对准"]
E["弱监督标注 y (LiDAR/自动)"] --> F["边际残差计算<br/>r = γ⊤1 - y (无梯度)"]
C -.-> F
F --> G["动态目标自校正<br/>ỹ(t) = y + λ(t)r"]
G --> H["弱监督 UOT 损失计算<br/>反向传播更新网络"]
C --> H
I["强监督标注 y (人工精确)"] --> J["联合强监督损失<br/>全局计数 L1 + 几何 UOT"]
C --> J
关键设计¶
1. 非平衡最优传输密度匹配:解耦空间几何位移与质量守恒刚性约束
在卫星林冠场景中,人工或仪器标记的树中心往往存在数个像素的定位歧义,直接计算像素级误差(如 MSE 或 KL 散度)会对合理的局部平移施加毁灭性的惩罚。标准最优传输(OT)通过地基代价矩阵(以像素欧氏距离平方度量 \(C_{ij} = \|\text{pos}(i) - \text{pos}(j)\|_2^2\))能够平滑考量几何邻近性,但经典平衡 OT 强制要求预测测度与目标测度的总质量严格守恒(必须归一化为概率分布),这使得局部计数误差或漏标会被强制拉扯匹配到极远处的噪声。本文采用非平衡最优传输(Unbalanced Optimal Transport, UOT),将边界质量守恒放松为带权重的广义 KL 散度惩罚,其带熵正则化的松弛目标为:
$\(W_{C,\varepsilon,\tau}^{\text{UOT}}(z, y) = \min_{\gamma \ge 0} \langle C, \gamma \rangle + \varepsilon \mathrm{H}(\gamma) + \tau \Big( \mathrm{KL}(\gamma \mathbf{1} \parallel z) + \mathrm{KL}(\gamma^\top \mathbf{1} \parallel y) \Big)\)$
其中 \(\varepsilon > 0\) 为熵平滑因子(实际设定为 0.005,对应约 0.07 归一化网格半径的作用范围),\(\tau > 0\) 为质量偏差惩罚权重(根据区域取 0.1 至 0.5)。该设计允许模型在支付合理惩罚的代价下生成或销毁局部质量,既继承了 OT 宽容局部微小位移的几何对齐优势,又彻底解除了全局质量强制相等的刚性假设。
2. 边际残差自校正机制:从传输计划解中自举挖掘标注噪声
机载激光雷达等自动化手段提取的树冠弱标注包含两种主要误差:密林内树冠交织引起的漏标(漏检,树木真实存在但无标记)以及林间杂斑引起的伪标(过检,无树处出现标注)。由于这些错误在单木尺度高度不均匀,全局阈值过滤完全失效。TreeMatch 发现 UOT 求解输出的最优传输计划 \(\gamma\) 天然蕴含了模型预测与输入标注的空间博弈信息。传输矩阵的列边际 \(\gamma^\top \mathbf{1}\) 代表在当前几何代价与质量松弛约束下,真正匹配到标注位置 \(y\) 的预测质量分配。因此,定义边际残差向量为:
$\(r = \gamma^\top \mathbf{1} - y\)$
当 \(r_i > 0\) 时,表明网络预测的密集特征被传输机制认可并分配了超出原标注的质量,提示该处存在漏检树木;当 \(r_i < 0\) 时,表明原标注未能获得足够的预测质量支撑,提示该处存在伪标注。模型通过预热调度函数 \(\lambda(t)\)(在训练前 400 步通过 Sigmoid 曲线自 0 平滑递增至 \(\alpha = 0.8\))构建自校正目标:
$\(\tilde{y}(t) = y + \lambda(t) r\)$
在训练前中期模型尚未校准时主要依靠初始标注引导,随着模型特征逐渐稳定,校正项开始发挥纠偏作用。为避免自强化导致的循环偏差与梯度震荡,求解 \(\gamma\) 及残差的过程严格施加 stop_grad 截断,仅在最终校正后的 \(\tilde{y}\) 与预测 \(z\) 计算 UOT 时传递梯度。
3. 强弱协同的分层采样监督:兼顾全域覆盖与绝对尺度标定
纯靠弱标注训练易使模型在长尾稠密林区产生系统性计数漂移,而稀疏的强标注无法支撑大模型对于复杂地理环境的泛化。框架将训练集解耦为精准小样本强标注集 \(\mathcal{D}^\text{strong}\)(含逐木点人工校核与整图总计数)与大规模弱标注集 \(\mathcal{D}^\text{weak}\)。在 batch 组织中采用 1:1 分层均衡采样。对于强样本,同时施加全局总数计数损失 \(\mathcal{L}^\text{count} = |\sum_i z_i - \sum_i y_i|\) 与精准几何对齐损失 \(\mathcal{L}^\text{UOT}(z, y)\);对于弱样本,则完全依托自校正后的测度施加 \(\mathcal{L}^\text{UOT}(z, \text{stop\_grad}(\tilde{y}))\)。全局绝对数量约束锚定在强标注上,弱标注则负责提供大范围多样性纹理的空间密度先验,实现了小样本精确监督与大规模弱监督的有机协同。
损失函数 / 训练策略¶
总体训练目标函数为: $\(\mathcal{L} = \sum_{(x,y) \in \mathcal{D}^\text{strong}} \Big( |\sum_{i} \phi(x)_i - \sum_{i} y_i| + \mathcal{L}^\text{UOT}(\phi(x), y) \Big) + \sum_{(x,y) \in \mathcal{D}^\text{weak}} \mathcal{L}^\text{UOT}(\phi(x), \text{stop\_grad}(\tilde{y}))\)$ 网络采用 AdamW 优化器,基础学习率设为 \(8 \times 10^{-5}\),搭配 Cosine 退火策略训练 500 轮。在单张 NVIDIA RTX 3090 GPU 上,单个区域数据集的完整训练耗时低于 1 小时;推理阶段仅需单次前向传播,推理速度高达 99M 像素/秒(处理 PlanetScope 卫星影像时相当于 887 \(\text{km}^2/\text{s}\))。
实验关键数据¶
主实验¶
论文构建了首个卫星遥感单木计数基准 TinyTrees,涵盖中国温带林(高分二号,0.8m GSD)、卢旺达热带异构林(PlanetScope,3.4-4.2m GSD)与法国温带林(SPOT-6,1.5m GSD)三大洲数据集,总覆盖 25,890 \(\text{km}^2\)、包含逾 2.16 亿株树木标注(含 63.9 万株人工核验真值)。在 64×64 切片分辨率下,主要对比结果如下表(原论文 Table 3):
| 方法类别 | 模型方法 | 强监督 | 弱监督 | 中国 (高分2) RMSE↓ / \(R^2\)↑ / nMAE↓ | 卢旺达 (PlanetScope) RMSE↓ / \(R^2\)↑ / nMAE↓ | 法国 (SPOT6) RMSE↓ / \(R^2\)↑ / nMAE↓ |
|---|---|---|---|---|---|---|
| 基础回归 | 密度回归 (Gaussian \(L_2\)) | ✓ | 64.6 / 0.55 / 37.4% | 79.3 / 0.36 / 54.0% | 163.4 / 0.20 / 40.2% | |
| 基础回归 | 计数直接回归 (Sum Pool) | ✓ | ✓ | 67.9 / 0.50 / 43.7% | 75.8 / 0.42 / 53.8% | 149.2 / 0.33 / 39.1% |
| 基础回归 | 不确定性感知回归 | ✓ | 63.3 / 0.57 / 37.9% | 80.5 / 0.34 / 55.3% | 163.0 / 0.20 / 40.6% | |
| 目标检测 | YOLOv8 | ✓ | 未收敛 / - / - | 448.7 / -0.50 / 85.0% | n/a (格式不兼容) | |
| 目标检测 | CenterNet | ✓ | ✓ | 82.9 / 0.26 / 51.8% | 98.9 / 0.01 / 69.8% | 181.5 / 0.01 / 45.6% |
| 目标检测 | P2P (点对点检测) | ✓ | ✓ | 98.7 / -0.05 / 60.4% | 未收敛 / - / - | 177.2 / 0.06 / 45.6% |
| 目标检测 | TreeFormer | ✓ | 68.7 / 0.49 / 41.2% | 86.0 / 0.25 / 59.8% | 179.7 / 0.03 / 45.1% | |
| 分布匹配 | 贝叶斯人群计数 | ✓ | 168.8 / -2.06 / 134.1% | 80.5 / 0.34 / 60.9% | 162.0 / 0.21 / 43.7% | |
| 分布匹配 | VRSNet | ✓ | 67.5 / 0.51 / 41.2% | 81.7 / 0.32 / 56.9% | 165.1 / 0.18 / 40.3% | |
| 分布匹配 | DM-Count (平衡 OT) | ✓ | ✓ | 65.0 / 0.55 / 39.6% | 76.8 / 0.40 / 53.4% | 158.0 / 0.25 / 40.9% |
| 本文方法 | TreeMatch (Ours) | ✓ | ✓ | 60.6 / 0.60 / 36.6% | 72.4 / 0.47 / 51.1% | 147.2 / 0.35 / 37.4% |
消融实验¶
在挑战性最高的热带稠密林卢旺达数据集(PlanetScope,3.4-4.2m GSD)上对监督源、损失设计与骨干网络进行消融验证(原论文 Table 5):
| 消融组别 | 模型配置 | RMSE (株/公顷) ↓ | \(R^2\) ↑ | nMAE (%) ↓ | 配置说明与分析 |
|---|---|---|---|---|---|
| 完整模型 | TreeMatch (Full) | 72.4 | 0.47 | 51.1% | 默认 ResNet-50 + UOT + 边际残差自校正 |
| (a) 监督源消融 | 移除弱监督 (No Train-weak) | 76.1 | 0.41 | 52.9% | 仅用小样本人工标注,泛化与特征多样性受限 |
| (a) 监督源消融 | 移除强监督 (No Train-strong) | 82.4 | 0.31 | 57.0% | 缺失精准数量锚定,导致误差急剧增加 (+10.0 RMSE) |
| (a) 监督源消融 | 均匀随机采样 (Uniform sampling) | 71.4 | 0.48 | 50.8% | 改变采样比例在卢旺达略优,但在各数据集间鲁棒性不如 1:1 分层 |
| (b) 损失项消融 | 仅计数值监督 (\(\mathcal{L}^\text{count}\) only) | 75.5 | 0.42 | 53.5% | 缺失空间测度几何对齐约束 |
| (b) 损失项消融 | 平衡最优传输 (Balanced OT) | 78.3 | 0.38 | 53.6% | 刚性质量守恒导致面对弱标注噪声时产生过度置信失真 |
| (b) 损失项消融 | 移除残差校正 (No residuals) | 79.0 | 0.37 | 55.0% | 无法修正 LiDAR 漏检/伪检,直接拟合噪声导致掉点明显 (+6.6 RMSE) |
| (c) 骨干网消融 | 换用 ViT-S 骨干 | 72.5 | 0.47 | 51.6% | 性能与 ResNet-50 基本持平,对轻量参数变化不敏感 |
| (c) 骨干网消融 | 换用 Swin-S 骨干 | 71.0 | 0.49 | 50.6% | 分层自注意力机制更契合遥感林冠多尺度纹理 |
关键发现¶
- 实例检测模型在密林卫星遥感下发生结构性失效:以 YOLOv8 为代表的离散边框检测在卢旺达数据集产生高达 448.7 的 RMSE 与负相关系数(\(R^2 = -0.50\));CenterNet 点检测在密林区域几乎失去回归能力(\(R^2 \le 0.01\))。这表明在 3-4 米分辨率且林冠相连的环境下,预设树木具有离散封闭边界这一假设已不再成立。
- 非平衡传输与残差校正的协同威力:对比 Balanced OT(78.3 RMSE)和无残差校正(79.0 RMSE),TreeMatch(72.4 RMSE)验证了将质量守恒松弛化为带惩罚测度匹配的合理性。残差自校正机制有效遏制了错误标签在迭代中的误差累积。
- 跨区域迁移与联合训练特性:跨区域泛化评估显示,高分二号(0.8m)训练的模型具备更强外推能力(中国模型测试法国 nMAE 为 76.9%);而基于三地联合训练的模型(Joint Training)在全体测试集上取得 49.3% 的平均 nMAE,展现了构建通用卫星树木感知基础模型的潜力。
亮点与洞察¶
- UOT 边际残差的物理自举映射:巧妙地将数学优化解的副产物(列边际与原始测度差异 \(r = \gamma^\top \mathbf{1} - y\))转化为即插即用的漏检/伪检空间探测器,完全无需引入外挂的判别器或复杂的启发式聚类规则。
- 连续密度取代离散图元的范式转换:在自动驾驶远距离机载建图或星载地球观测中,当目标物体跨度小于传感器点扩散函数极限时,放弃离散实例分割转而采用几何测度场拟合是极具启发性的思路。
- 强弱分层采样的正交协同:强标签负责锁死整体积分尺度的量纲(\(L_1\) 计数惩罚),弱标签提供空间高频纹理与大地理维度的抗过拟合表征,两者通过 1:1 分层抽取和截断梯度实现了稳定解耦。
局限与展望¶
- 最优传输求解的二次空间复杂度:由于 Sinkhorn 矩阵在像素点积上的内存与计算复杂度随切片大小呈 \(\mathcal{O}(N^2)\) 扩张,当前切片被迫受限在 64×64 像素,难以直接捕捉更大空间上下文(如跨山脊、林地交界处的大范围生态纹理)。
- 树木计数与林冠高度的物理关联未完全闭环:当前模型仅预测平面密度,而林业生态中林木冠高与树径、胸径存在严格的异速生长标度律(Allometric Scaling)和自疏动态(Self-Thinning Rule)。未来若将 3D 冠高估计与平面 UOT 计数联合建模,有望构建出兼具物理一致性的全球森林生物量数字孪生系统。
相关工作与启发¶
- vs DM-Count (NeurIPS 2020):DM-Count 将标准平衡 OT 引入人群计数,但要求整图密度归一化为概率分布,在面对存在大量伪标、漏标的卫星林业数据时会导致过度自信的异常激化;TreeMatch 采用 UOT 松弛了总质量相等约束,并通过边际残差实现了标注的动态在线净化。
- vs TreeFormer (ISPRS 2023):TreeFormer 依赖局部窗口注意力回归伪密度图,但在缺乏显式传输几何约束的情况下容易产生过度平滑的模糊斑块;TreeMatch 借助代价矩阵显式引导预测响应向树木几何中心收拢。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(首次将非平衡最优传输与边际残差自举机制应用于卫星遥感单木计数,突破离散检测壁垒)
- 实验充分度: ⭐⭐⭐⭐⭐(横跨三大洲、三种传感器及 2.58 万平方公里实测林地,消融与跨域迁移完备)
- 写作质量: ⭐⭐⭐⭐⭐(数学推导严密清晰,问题阐述与设计动机逻辑严谨)
- 价值: ⭐⭐⭐⭐⭐(开源大规模基准 TinyTrees 与高效预训练权重,为全球森林碳储量量化提供坚实工具)