跳转至

Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5445
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/10658.pdf
代码: https://github.com/venkanna37/align-and-segment
领域: 遥感
关键词: 建筑分割、标签错位、空间配准、自监督一致性、几何增强

一句话总结

Align and Segment(AnS)通过联合学习建筑分割与标签几何校正,并用自监督一致性和成对几何增强阻止模型记住错误偏移,在不使用准确对齐标签训练的条件下,将 Las Vegas 系统错位测试集的分割 IoU 从朴素联合模型的 0.39 提高到 0.78。

研究背景与动机

卫星影像和建筑轮廓通常不是同时、同源制作的:影像来自遥感平台,轮廓可能来自 OpenStreetMap(OSM)或独立测绘成果。 把两者叠起来,不只是出现零散的错误像素,更常见的是一片建筑整体平移或旋转。 这种结构化噪声不能简单视为独立同分布的标签翻转;同一区域持续存在的方向性偏移,反而很容易被容量足够的分割网络学会。 于是,一个训练损失很低的模型,可能始终把建筑画在屋顶旁边,而不是屋顶上。

直觉上的修复是加一个配准网络:先预测错位量,再用纠正后的标签监督分割。 但两套网络联合优化也存在捷径:训练初期配准网络接近恒等变换,分割网络便开始拟合原始错位标签;一旦拟合成功,配准网络就没有必要再纠正偏移。 已有方法常依赖少量准确标签,或默认错位方向在数据中大致无偏,这些条件在真实地图数据里未必成立。 本文因此关注一个更具体的问题:只给影像及错位轮廓,怎样让“识别建筑”和“纠正坐标”真正分工,而不是互相掩盖错误?

AnS 不把重点放在重新设计分割骨干,而是约束训练过程中两个任务的职责。 它从现有标签自行构造具有已知变换的配准练习,再利用共同翻转、旋转改变数据里的偏移方向。 核心 idea:让配准网络从标签自身获得不依赖分割预测的几何监督,同时破坏分割网络可记忆的固定偏移,使两者在没有准确对齐训练标签时仍能共同收敛到正确位置。

方法详解

整体框架

训练输入是遥感影像与对应但错位的二值建筑掩码,输出包括影像的建筑分割预测以及重新对齐的已有标签。 “成对几何增强”先作用于影像和标签;“分割—配准联合学习”包含分割网络 SNet 与变换网络 TNet;“绝对变换一致性”另外为 TNet 提供自监督约束。 最后一项是并行训练支路,不是推理时必须串行执行的后处理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["影像与错位标签"] --> B["成对几何增强"]
    B --> C["分割—配准联合学习<br/>SNet 与 TNet"]
    B --> D["绝对变换一致性<br/>标签自变换练习"]
    D -->|约束 TNet| C
    C --> E["建筑预测与校正标签"]

只做新影像分割时,部署 SNet 即可,不需要输入 OSM 标签。 若任务是修复已有地图,则还需把原标签和 SNet 预测一起交给 TNet,得到校正后的标签。 两种输出各有作用:预测分割可发现影像中的建筑,几何校正则保留已有轮廓的形状与拓扑,但本身不会补出漏标建筑。

关键设计

1. 成对几何增强:打散可被记住的固定偏移方向

作者对影像与错位标签共同进行水平翻转、垂直翻转,以及 90°、180°、270° 旋转。 共同变换不会直接对齐两者,而是改变相对偏移在增强后坐标系中的方向。 例如,标签原本沿横轴偏移 50 像素,水平翻转整对数据后,这个偏移就变成反方向的 50 像素。 因此,网络不能靠“看到屋顶后总在固定方向输出轮廓”这一规则稳定降低训练损失。

这一步针对的是系统偏移的统计结构,而不是一般意义上的增加样本多样性。 随机、无偏的错位本来就没有同样强的固定方向,所以增强在两类噪声下的作用并不相同。 消融中,单独增强大幅改善系统错位,却使随机错位下的分割 IoU 从 0.71 降到 0.66。 这也说明,增强不是独立成立的万能校正器,需要与下面的配准约束结合。

2. 分割—配准联合学习:在掩码空间纠正监督,而不是让分割追着错位标签跑

SNet 是普通的语义分割模型,从影像预测建筑概率掩码。 TNet 不直接处理“RGB 影像—轮廓图”这一跨模态配准问题,而是接收 SNet 预测掩码和原始错位掩码这两个同类表示。 它估计一个作用于整块标签的变换,再利用空间变换模块重采样标签,以校正标签和 SNet 预测之间的交叉熵联合训练系统。 实验中的 SNet 使用 U-Net 解码结构与 ConvNeXt-Tiny 编码器,TNet 使用 ViT-Small。 空间变换模块的 STN 名称并不意味着其本身是注意力 Transformer;ViT 是这里选用的参数预测网络。

论文称之为仿射变换,但本文实际参数只有旋转角和两个方向的平移,共三个自由度,不应理解成完整的六参数仿射模型。 网络输出经过带缩放的 tanh 激活,限制预测的最大位移与角度,避免训练时出现不合理的大变形。 对于变换后图像边缘不再具有共同支持的区域,损失计算将其排除,避免用越界填充值误导监督。 与先离线修标签再训练不同,这里 TNet 会随着 SNet 的预测质量变化持续更新。 不过,这个联合结构本身不能保证正确解:如果 SNet 已经学会错位,双方仍可能在错误位置达成一致。

3. 绝对变换一致性:用标签自变换建立独立于分割质量的几何锚点

作者从已有错位掩码出发,额外施加一个随机、已知的变换,再把“变换后的掩码—原掩码”交给同一个 TNet。 原掩码不必与真实影像对齐,因为这次练习只要求恢复人为施加的变换,其正确逆变换是已知的。 这就把缺少准确建筑标签的问题,转成可以自行生成监督的几何恢复任务。 它也避免了训练早期 SNet 尚未识别出建筑时,TNet 完全没有可靠学习信号。

一致性损失结合变换矩阵元素的均方误差与恢复后掩码的 IoU 损失。 前者把估计参数拉向已知逆变换,即使两个掩码几乎没有重叠,也能提供几何误差信号;后者直接要求恢复后的建筑区域重合。 矩阵误差项的权重设为 100,使两个部分处于近似相同的数量级。 与仅要求两次预测相互一致相比,这里明确知道目标变换,不能通过给所有预测加同一个错误偏移来轻易满足约束。 新的随机变换在每个 epoch 重采样,使 TNet 不只是记住固定配对。

一个完整示例

考虑训练集中一块影像,其建筑标签整体向右偏移 50 像素,这是论文系统错位数据的构造方式。 一次水平翻转把影像和标签一起翻过去,标签相对建筑的偏移随之变成向左 50 像素。 SNet 先预测当前影像中的建筑,TNet 再根据两个掩码估计校正量,把错误标签拉回预测所在位置。 与此同时,一致性支路对标签额外生成一次已知随机变换,要求 TNet 把它撤销,从而不让 TNet 长期停留在“什么都不变”的解上。 训练结束后,新影像只经过 SNet 就能分割;需要校正原有轮廓时,才额外调用 TNet。 这个例子解释的是机制,并不是某个测试样本的精确恢复保证。

损失函数 / 训练策略

整体优化目标由分割交叉熵与一致性损失相加,两个网络端到端联合训练;SNet 的 DINOv3 预训练编码器保持冻结。 作者使用 AdamW,学习率为 \(10^{-5}\),训练 300 个 epoch,batch size 为 48。 输出激活的缩放系数为 0.35;论文对标准 320 像素 patch 给出的范围是横纵向各 ±112 像素、旋转约 ±20.06°。 模型按验证集的 \(\mathrm{IoU}_{learn}\) 选择最佳 epoch,不使用准确标签计算的分割或配准指标做选择。 这里的“无监督”指不使用准确对齐标签学习校正,并不意味着完全不使用任何建筑标注或预训练权重。

本地全文的式 (1)–(6) 存在抽取损坏,因此不重建其坐标矩阵或损失公式;以上机制依据 §3 的可读文字。 补充材料未包含在当前缓存中,替代编码器结果与补充实现细节不在本笔记证据范围内。

实验关键数据

主实验

合成数据来自 SpaceNet 2:\(D_{uni}\) 的横纵位移各在 ±50 像素内随机采样,旋转在 ±4.5° 内采样;\(D_{bias}\) 为横向统一偏移 50 像素。 这部分各城市按 patch 随机划分训练、验证、测试集,比例为 80% / 10% / 10%。 真实 ReBO 数据使用发布的测试集,以人工修正的屋顶轮廓作评估真值;不能把这些屋顶指标完全等同于地面建筑足迹指标。

三个指标均越大越好,但含义不同: - \(\mathrm{IoU}_{seg}\):SNet 预测与准确参考建筑掩码的交并比,衡量实际分割质量。 - \(\mathrm{IoU}_{align}\):使用准确掩码及其已知变换版本测试 TNet 的恢复结果,衡量理想分割条件下的配准能力,而非直接等于全流程地图修复精度。 - \(\mathrm{IoU}_{learn}\):SNet 预测与 TNet 校正后的训练标签之间的交并比,衡量两支路的一致程度,不能单独证明位置正确。

下表选自论文表 3,各行对应本数据集的测试集;MA 是不使用准确标签的 Map Alignment,便于同条件比较。

数据集 / 错位设置 AnS 分割 IoU ↑ MA 分割 IoU ↑ AnS 配准 IoU ↑ MA 配准 IoU ↑
Las Vegas / 随机 0.79 0.55 0.84 0.70
Las Vegas / 系统 0.78 0.49 0.88 0.47
Paris / 随机 0.56 0.49 0.67 0.51
ReBO / 真实错位 0.62 0.55 0.74 0.57

表 3 也包括有监督方法,不能把上述优势扩展为优于所有方法:ACN 在 Las Vegas 随机错位下的分割 IoU 为 0.94,高于 AnS 的 0.79,但使用准确标签训练,且推理时需要错位标签作为额外输入。 SC 虽在结果讨论中与无监督基线并列,§5 明确说明它使用验证集准确标签,因此也不是严格的无准确标签对照。

消融实验

下表选自论文表 2,均为 Las Vegas 测试集,使用同一冻结的 DINOv3 ConvNeXt-Tiny 编码器;所有行都含交叉熵,IoU 均越大越好。

一致性损失 几何增强 随机:分割 IoU 系统:分割 IoU 系统:配准 IoU 系统:学习 IoU
0.71 0.39 0.41 0.79
0.74 0.41 0.43 0.78
0.66 0.72 0.76 0.82
0.79 0.78 0.88 0.82

关键发现

  • 系统错位下,完整方法相对朴素联合模型的分割 IoU 增加 0.39,配准 IoU 增加 0.47;最大的单项帮助来自几何增强,一致性约束进一步提高结果。
  • 学习 IoU 可能掩盖失败:无增强、无一致性时它已有 0.79,但真实分割 IoU 只有 0.39,验证了两个网络在错误位置共同拟合的捷径。
  • §6 的两阶段实验先预训练并冻结 TNet,再训练 SNet;随机、系统错位及 ReBO 的分割 IoU 分别只有 0.48、0.44、0.38,支持持续联合适应而非固定配准器。
  • San Juan 只有 OSM 错位标签,没有准确参考标签;作者报告学习 IoU 为 0.70(§6),这不是可与上表直接比较的真实分割精度。

亮点与洞察

  • 监督来源与任务目标分开设计:无需知道建筑在影像中的准确位置,也能知道人为变换应如何撤销。这为配准支路提供了独立监督,而不是继续依赖尚不可靠的分割结果。
  • 增强直接针对误差方向:共同翻转并不减少单个样本的偏移幅度,却能破坏全数据集一致的方向偏差。消融把这种作用与通常的泛化收益区分开来。
  • 用三个 IoU 拆开内部一致与外部正确:训练目标拟合得好和建筑位置正确不是一回事。把这两种现象分别测量,是诊断联合系统捷径的重要思路。

局限与展望

  • 作者指出:通用分割解码器没有针对建筑边界优化,也未做后处理,预测轮廓仍可能模糊;校正原标签通常比直接预测更能保留原有形状。
  • 作者指出:没有处理漏标建筑等非几何标签噪声,当前仅预测 patch 级变换,无法分别纠正同一 patch 中每栋建筑的独立偏移。
  • 读者判断:主实验的三个合成城市分别训练、分别测试,不能据此宣称在一个城市训练后可直接跨城市部署;随机 patch 划分也不同于严格的空间外推评估。
  • 读者判断:验证模型仍依赖可能被捷径抬高的学习 IoU。方法改善了这个风险,但没有从理论上证明无需准确参考数据就能识别所有错误解。

相关工作与启发

  • 对比 AutoCorrect:它以影像与掩码进行跨模态配准,并使用变换一致性;AnS 把 TNet 输入统一为两个掩码,再用已知逆变换建立更明确的几何监督。
  • 对比 Map Alignment:它采用多轮标签修正,在每轮内固定随机变换;AnS 每个 epoch 重采样并与分割共同学习,不需要多轮重训才能更新标签。
  • 对比 ACN / MapRepair:这些有监督方法的高性能说明准确标签仍有价值。AnS 的贡献在于降低训练数据对齐要求,而不是在相同监督预算下替代所有专门模型。

评分

  • 新颖性:4/5。把掩码空间的绝对变换监督与系统偏移去偏结合起来,问题定位清楚,但基础网络与变换工具较成熟。
  • 实验充分度:4/5。包含随机与系统噪声、真实数据、消融及两阶段对照,但空间外推、非刚性错位与漏标噪声仍待检验。
  • 写作质量:4/5。对捷径失败的解释和多指标诊断较有说服力,需注意不同指标与监督条件的边界。
  • 价值:4/5。对利用已有地图训练遥感建筑分割具有实际意义,准确边界与复杂局部错位仍限制应用上限。