跳转至

DOGE: Differentiable Bézier Graph Optimization for Road Network Extraction

会议: ECCV2026
论文: https://eccv.ecva.net/virtual/2026/poster/4405
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/5775.pdf
领域: 遥感
关键词: 道路网络提取、Bézier 图、可微渲染、几何正则化、拓扑优化

一句话总结

DOGE 将遥感道路提取变成“用像素掩码指导曲线图优化”的问题,通过 DiffAlign 调整连续几何、TopoAdapt 修改离散连接,在不需要曲线级真值的条件下取得 SpaceNet 84.58、City-Scale 80.59 的 TOPO F1,并输出更紧凑的 Bézier 路网。

研究背景与动机

从卫星图像得到一张道路分割图,并不等于得到能用于路线规划的地图:后者必须知道哪些道路相连、交叉处能否转向,以及弯道如何连续延伸。Sat2Graph、RNGDet++ 和 SAMRoad 等方法主要输出折线图。折线可以通过增加顶点逼近弯道,但表达成本随曲率细节上升,顶点处也没有天然连续的切线;这使紧凑存储、局部编辑和光滑几何约束难以同时满足。

三次 Bézier 曲线更适合描述弯曲道路,但直接监督预测控制点又引出标注问题:同一条道路可以被切成不同数量的曲线,控制点也并不唯一。把现有折线标注转换为曲线,会把人为划分规则带进训练目标。另一种思路是从道路掩码做骨架化再拟合曲线,但掩码中的小断裂和锯齿会被固化为错误连接;反过来,只通过可微渲染追求像素重合,也可能得到大量重叠、自交、无法导航的曲线。

DOGE 因而把问题分成“当前边应该长成什么样”和“图里应该有哪些边及连接”两件事。前者适合梯度优化,后者需要显式修改离散结构;单独依赖任意一方都会留下另一方无法修复的错误。核心 idea:把掩码作为曲线图的渲染目标,用几何先验约束连续拟合,再交替执行连接、简化和增边操作,让路网形状与拓扑共同演化,而不是从一次性的骨架提取结果直接定稿。

方法详解

整体框架

输入是卫星图像,先由在相应数据集训练集上微调的 SAM2 产生道路分割掩码;DOGE 本身接收该掩码并逐图优化,而不是一次前向预测完整路网。它先建立“弦基 Bézier 参数化”的初始图,再用“DiffAlign 几何对齐”优化渲染结果与掩码的一致性,预热后在循环中加入“TopoAdapt 拓扑修整”。最终输出带道路宽度的 Bézier 图,评测时才沿曲线采样成折线。

这里的“无需真值”特指不需要曲线级矢量真值,并非整个系统没有监督。SAM2 的道路分割仍经过数据集内训练;图优化阶段不回归人工指定的曲线控制点,而是让几何参数接受掩码产生的像素损失。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["卫星图像<br/>微调 SAM2 掩码"] --> B["弦基 Bézier 参数化<br/>初始化曲线图"]
    B --> C["DiffAlign 几何对齐"]
    C -->|预热后继续迭代| D["TopoAdapt 拓扑修整"]
    D --> C
    C -->|结构与损失稳定| E["Bézier 路网<br/>采样折线用于评测"]

关键设计

1. 弦基 Bézier 参数化:让形状可优化,同时保留共享端点的连接关系

图的节点是可移动的二维位置,可以表示交叉口、道路端点或道路中间点;每条边是一条三次 Bézier 曲线,并有独立可学习的宽度。曲线两端直接绑定到图节点,因此两条边共享节点时,端点连接由表示本身维持,不需要靠渲染图中“看起来碰到一起”来猜测。与把端点切线绑定到节点共享方向的车道级 Bézier 图不同,DOGE 给每条边保留独立的内部控制点参数,适应标准道路地图中更自由的交叉结构。

它不直接更新四个控制点的所有坐标,而是把两个内部控制点放在“端点弦上的投影位置+垂直偏移”坐标系里。以下写法依据原文式(2)附近的文字定义整理;缓存中的公式排版有缺损,但投影、法向偏移和端点绑定关系均有明确说明:

\[ \begin{aligned} \boldsymbol P_{k,0}&=\boldsymbol p_i,\qquad \boldsymbol P_{k,3}=\boldsymbol p_j,\\ \boldsymbol P_{k,r+1}&=(1-\alpha_{k,r})\boldsymbol p_i +\alpha_{k,r}\boldsymbol p_j+d_{k,r}\boldsymbol n_{ij}, \qquad r\in\{0,1\}. \end{aligned} \]

其中 \(\alpha_{k,r}\in[0,1]\) 决定沿弦的位置,\(d_{k,r}\) 是有符号的垂直偏移,\(\boldsymbol n_{ij}\) 为弦的单位法向量。这样优化器调整的是“沿道路推进多少、向侧面弯多少”,而不是任意拖拽控制点;再配合后面的偏移和间距正则,抑制病态曲线。它提供的是结构化参数化与软约束,不能据此宣称所有跨边自交都被数学上排除,也不意味着交叉口自动具有高阶连续性。

2. DiffAlign 几何对齐:让像素误差更新曲线,但不给错误几何钻空子

DiffAlign 将带宽度的曲线道路段序列化成闭合多边形,再用基于 DiffVG 的可微光栅化器生成道路图像。损失对像素覆盖的梯度先传到控制点,再经参数化关系传到节点位置、道路宽度、沿弦投影和法向偏移。道路既能整体移动,也能改变弯曲程度与宽度,因此不像固定骨架拟合那样只能接受最初提取出的几何。

仅最小化像素误差并不足够:几条重复道路覆盖同一区域,也可能在最终并集图上表现得很好。DOGE 的覆盖损失比较各条边渲染并集与目标掩码的像素平方误差;重叠损失则检查各边渲染的累加,将超过单次覆盖的部分作为惩罚,并按边数归一化。两者分别回答“该有道路的地方是否覆盖”和“是否靠多条重复或不当交叉的道路来完成覆盖”,不能相互替代。

另一个先验是 \(G^1\) 连续性:在度为 2 的节点,比较前一条边的末端切线与后一条边的起始切线,推动近乎直行的连接方向一致。该惩罚只对切线夹角低于阈值的连接启用,避免把真实转弯也拉直;它是局部切线对齐,不是全路网曲率连续的保证。最后,偏移损失限制内部控制点相对于弦长的过大横向偏移,间距损失把两个投影位置推向弦上的 \(1/3\)\(2/3\),降低控制点聚集和曲线退化的机会。原文把这些项视为独立于目标掩码的几何先验。

3. TopoAdapt 拓扑修整:按先连接、再简化、后扩张的顺序改图

梯度可以把两个端点拉近,却不能把两个节点真正合并;也无法直接把一条道路变成带分叉的两条边。TopoAdapt 因此显式修改节点集和边集。首先合并距离过近的节点,清掉重复端点,再将靠近某条边的节点吸附到该边并拆边,形成真正的 T 形连接。先合点、后造分叉,是为了避免在重复端点还未整理时反复生成连接。

连接完成后,算法删除近乎共线、度为 2 的冗余中间节点并合并对应边,再剪除过短、过细的无效边和孤立节点。这一步不仅追求少几个节点,还能防止优化器把计算浪费在连接操作引出的碎片上。最后才检查目标掩码中置信度足够高、而当前渲染覆盖不足的位置,在这些未拟合区域采样新边,并随机偏移端点。相同的增边机制也负责从空图初始化;它不是在全图均匀堆叠曲线,而是让新增容量集中到当前遗漏的道路。

这些操作由空间网格加速,并使用固定的几何阈值;主文明确给出的节点合并与 T 形连接共用距离阈值为 4 m。必须注意,DOGE 避免的是一次性骨架化与曲线拟合决定最终图的做法,并没有消除全部手工规则。它的离散操作仍有阈值,只是会在后续几何优化中继续接受修正,且论文在两个数据集上保持拓扑超参数一致。

损失函数 / 训练策略

分割网络的微调与逐图曲线优化应分开理解:前者生成观测目标,后者用 Adam 调整当前图参数。根据主文列出的五项损失和权重,总目标可写为:

\[ \mathcal L_{\mathrm{total}} =\mathcal L_{\mathrm{cover}} +0.3\mathcal L_{\mathrm{overlap}} +0.012\mathcal L_{G1} +6\times10^{-3}\mathcal L_{\mathrm{offset}} +6\times10^{-3}\mathcal L_{\mathrm{spacing}}. \]

主实验使用 512×512 渲染分辨率,最多执行 300 次优化迭代,硬件为单张 NVIDIA RTX 4090。初始化后先预热几何,再启用周期性的拓扑修整;按原文算法,预热后的每轮先更新离散连接,再执行几何优化。当相邻轮损失变化低于容差、同时节点与边的结构保持不变,且连续满足耐心计数时提前停止。

主文没有列全学习率、预热长度、早停容差及所有拓扑阈值,而是将细节指向补充材料。本地全文缓存仅含主文与参考文献,因此这里不补写这些数值,也不根据残损的公式猜测偏移损失和间距损失的具体范数形式。

实验关键数据

主实验

City-Scale 使用 144/9/27 的训练/验证/测试划分,SpaceNet 使用 2042/127/382;两者按既有工作统一到 1 m/pixel。Bézier 边均匀采样成折线后交给公开评测实现。TOPO F1 汇总拓扑匹配的精确率与召回率;APLS 衡量预测路网与真值路网的最短路径长度一致性。下表四项指标均越高越好,数值直接取自主文表 1,不混用后文的同掩码对照实验。

数据集 方法 TOPO F1 ↑ 精确率 ↑ 召回率 ↑ APLS ↑
SpaceNet RNGDet++ 82.81 91.34 75.24 67.73
SpaceNet SAMRoad 80.52 93.03 70.97 71.64
SpaceNet SAMRoad++ 81.57 93.68 72.23 73.44
SpaceNet DOGE 84.58 93.55 78.43 73.48
City-Scale RNGDet++ 78.44 85.65 72.58 67.76
City-Scale SAMRoad 77.23 90.47 67.69 68.37
City-Scale SAMRoad++ 80.01 88.39 73.39 68.34
City-Scale DOGE 80.59 84.42 77.40 70.24

SpaceNet 的 TOPO F1 比 RNGDet++ 高 1.77 个百分点,但 APLS 比 SAMRoad++ 只高 0.04 个百分点,不能称为显著领先所有指标。City-Scale 相对 SAMRoad++ 的召回率增加 4.01 个百分点,同时精确率下降 3.97 个百分点;综合 F1 改善伴随明确的精确率取舍。

消融实验

下表来自主文表 2,均在 SpaceNet 上评估。ED 是每公里道路对应的边数,单位为 edges/km,用来描述表示的紧凑程度;只有在拓扑质量足够好时,较低 ED 才有意义,不能把漏掉道路造成的边数减少当作优势。两个下界方法使用与完整模型相同的 SAM2 掩码。

配置 TOPO F1 ↑ APLS ↑ ED ↓
完整 DOGE 84.58 73.48 22.62
去掉 TopoAdapt 82.80 69.45 66.60
去掉重叠损失 83.38 65.95 40.30
去掉 G1 损失 82.54 69.28 23.71
去掉两项曲线正则 82.57 65.97 23.48
去掉全部几何先验 74.58 51.18 44.17
Vanilla DiffRender 70.94 37.10 98.96
Standard Post-Processing 79.57 63.10 69.21

关键发现

  • 去掉 TopoAdapt 后 APLS 下降 4.03 个百分点,ED 从 22.62 增至 66.60;离散改图同时改善连接与紧凑度,不只是让图更好看。
  • 去掉重叠损失后 APLS 下降 7.53 个百分点,比单独去掉 TopoAdapt 的降幅更大;像素覆盖不能替代道路连接的结构约束。去掉全部几何先验与纯覆盖优化进一步说明这一点,但不同消融降幅不能简单相加。
  • 同一 SAM1 掩码下的额外对照中,DOGE/SAMRoad/SAMRoad++ 的 TOPO F1 分别为 83.20/80.08/79.68,ED 分别为 21.33/47.12/47.64。该对照支持矢量化机制有独立收益,不能把它与上表采用不同分割设置的行当作同一组结果。

亮点与洞察

  • 把可微渲染当作测量桥梁,而不是完整解法。 它把“图渲染得像不像道路”转为可优化信号;几何先验和离散拓扑操作才让低像素误差对应到可用的路网。
  • 表示的紧凑性来自曲线能力与结构简化的配合。 Bézier 边用少量参数表达弯道,TopoAdapt 再去除冗余节点;仅换成曲线而禁用拓扑更新,消融中依然留下很高的边密度。
  • 同掩码对照隔离了分割骨干的影响。 它比单看端到端榜单更能解释收益来源,也避免把更好的 SAM2 掩码全部记在图优化算法名下。

局限与展望

  • 作者指出,密集树冠等严重遮挡会污染掩码并造成断路,多层立交也缺少高度信息来判断真实连接;二维渲染匹配无法单独消除这些歧义。
  • 这是离线逐图优化,不是实时单次推理。主文报告 DOGE-512 在单张 RTX 4090 上处理 SpaceNet 测试集需要 302 min;更少的图边不代表提取过程本身更快。
  • 评测主要考察拓扑与路径,曲线需先离散化。主文将运动学平滑度、阈值敏感性等进一步分析指向未包含在本地缓存中的补充材料;不能仅凭曲线表示就断言下游规划、曲率连续性或延迟已得到全面验证。
  • 本笔记认为,需要区分“无需曲线真值”“无需任何监督”和“无需启发式规则”。本文满足前者,却仍依赖分割微调、几何先验和拓扑阈值;作者提出的遮挡先验、高度线索和效率改进正对应这些适用边界。

相关工作与启发

  • vs SAMRoad/SAMRoad++:它们提供基于基础分割模型的道路图提取参照;DOGE 把掩码后的步骤改为受约束的曲线图优化。同掩码实验支持这一后端差异的价值,但主榜单仍包含分割设置差异。
  • vs Bézier Everywhere All at Once:该工作面向车道级 Bézier 图,使用节点共享方向约束相邻边;DOGE 面向遥感标准路网,以每条边独立的弦基偏移提供更灵活的几何,并避免曲线控制点真值监督。
  • vs DiffVG 与骨架化拟合:DiffVG 提供像素到矢量参数的梯度,骨架化提供离散路径;DOGE 的关键不在重新发明二者,而在用道路先验限制梯度自由度、让离散结构持续修正,避免一次提取后错误被固定。

评分

  • 新颖性: 4/5。将弦基 Bézier 图、解析几何先验和有序拓扑编辑组合为掩码驱动的道路优化,贡献明确,但基础工具均有前序工作。
  • 实验充分度: 4/5。两个主基准、同掩码对照和细化消融较有说服力;部分几何与效率证据仍需补充材料核验。
  • 写作质量: 4/5。连续几何与离散拓扑的职责清楚,但“无需真值”的范围和较小的指标提升需要读者仔细区分。
  • 价值: 4/5。适合重视紧凑、可编辑曲线地图的离线建图任务,尚不能据此推断适合实时部署。