DOGE: Differentiable Bézier Graph Optimization for Road Network Extraction¶
会议: ECCV2026
论文: https://eccv.ecva.net/virtual/2026/poster/4405
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/5775.pdf
领域: 遥感
关键词: 道路网络提取、Bézier 图、可微渲染、几何正则化、拓扑优化
一句话总结¶
DOGE 将遥感道路提取变成“用像素掩码指导曲线图优化”的问题,通过 DiffAlign 调整连续几何、TopoAdapt 修改离散连接,在不需要曲线级真值的条件下取得 SpaceNet 84.58、City-Scale 80.59 的 TOPO F1,并输出更紧凑的 Bézier 路网。
研究背景与动机¶
从卫星图像得到一张道路分割图,并不等于得到能用于路线规划的地图:后者必须知道哪些道路相连、交叉处能否转向,以及弯道如何连续延伸。Sat2Graph、RNGDet++ 和 SAMRoad 等方法主要输出折线图。折线可以通过增加顶点逼近弯道,但表达成本随曲率细节上升,顶点处也没有天然连续的切线;这使紧凑存储、局部编辑和光滑几何约束难以同时满足。
三次 Bézier 曲线更适合描述弯曲道路,但直接监督预测控制点又引出标注问题:同一条道路可以被切成不同数量的曲线,控制点也并不唯一。把现有折线标注转换为曲线,会把人为划分规则带进训练目标。另一种思路是从道路掩码做骨架化再拟合曲线,但掩码中的小断裂和锯齿会被固化为错误连接;反过来,只通过可微渲染追求像素重合,也可能得到大量重叠、自交、无法导航的曲线。
DOGE 因而把问题分成“当前边应该长成什么样”和“图里应该有哪些边及连接”两件事。前者适合梯度优化,后者需要显式修改离散结构;单独依赖任意一方都会留下另一方无法修复的错误。核心 idea:把掩码作为曲线图的渲染目标,用几何先验约束连续拟合,再交替执行连接、简化和增边操作,让路网形状与拓扑共同演化,而不是从一次性的骨架提取结果直接定稿。
方法详解¶
整体框架¶
输入是卫星图像,先由在相应数据集训练集上微调的 SAM2 产生道路分割掩码;DOGE 本身接收该掩码并逐图优化,而不是一次前向预测完整路网。它先建立“弦基 Bézier 参数化”的初始图,再用“DiffAlign 几何对齐”优化渲染结果与掩码的一致性,预热后在循环中加入“TopoAdapt 拓扑修整”。最终输出带道路宽度的 Bézier 图,评测时才沿曲线采样成折线。
这里的“无需真值”特指不需要曲线级矢量真值,并非整个系统没有监督。SAM2 的道路分割仍经过数据集内训练;图优化阶段不回归人工指定的曲线控制点,而是让几何参数接受掩码产生的像素损失。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["卫星图像<br/>微调 SAM2 掩码"] --> B["弦基 Bézier 参数化<br/>初始化曲线图"]
B --> C["DiffAlign 几何对齐"]
C -->|预热后继续迭代| D["TopoAdapt 拓扑修整"]
D --> C
C -->|结构与损失稳定| E["Bézier 路网<br/>采样折线用于评测"]
关键设计¶
1. 弦基 Bézier 参数化:让形状可优化,同时保留共享端点的连接关系
图的节点是可移动的二维位置,可以表示交叉口、道路端点或道路中间点;每条边是一条三次 Bézier 曲线,并有独立可学习的宽度。曲线两端直接绑定到图节点,因此两条边共享节点时,端点连接由表示本身维持,不需要靠渲染图中“看起来碰到一起”来猜测。与把端点切线绑定到节点共享方向的车道级 Bézier 图不同,DOGE 给每条边保留独立的内部控制点参数,适应标准道路地图中更自由的交叉结构。
它不直接更新四个控制点的所有坐标,而是把两个内部控制点放在“端点弦上的投影位置+垂直偏移”坐标系里。以下写法依据原文式(2)附近的文字定义整理;缓存中的公式排版有缺损,但投影、法向偏移和端点绑定关系均有明确说明:
其中 \(\alpha_{k,r}\in[0,1]\) 决定沿弦的位置,\(d_{k,r}\) 是有符号的垂直偏移,\(\boldsymbol n_{ij}\) 为弦的单位法向量。这样优化器调整的是“沿道路推进多少、向侧面弯多少”,而不是任意拖拽控制点;再配合后面的偏移和间距正则,抑制病态曲线。它提供的是结构化参数化与软约束,不能据此宣称所有跨边自交都被数学上排除,也不意味着交叉口自动具有高阶连续性。
2. DiffAlign 几何对齐:让像素误差更新曲线,但不给错误几何钻空子
DiffAlign 将带宽度的曲线道路段序列化成闭合多边形,再用基于 DiffVG 的可微光栅化器生成道路图像。损失对像素覆盖的梯度先传到控制点,再经参数化关系传到节点位置、道路宽度、沿弦投影和法向偏移。道路既能整体移动,也能改变弯曲程度与宽度,因此不像固定骨架拟合那样只能接受最初提取出的几何。
仅最小化像素误差并不足够:几条重复道路覆盖同一区域,也可能在最终并集图上表现得很好。DOGE 的覆盖损失比较各条边渲染并集与目标掩码的像素平方误差;重叠损失则检查各边渲染的累加,将超过单次覆盖的部分作为惩罚,并按边数归一化。两者分别回答“该有道路的地方是否覆盖”和“是否靠多条重复或不当交叉的道路来完成覆盖”,不能相互替代。
另一个先验是 \(G^1\) 连续性:在度为 2 的节点,比较前一条边的末端切线与后一条边的起始切线,推动近乎直行的连接方向一致。该惩罚只对切线夹角低于阈值的连接启用,避免把真实转弯也拉直;它是局部切线对齐,不是全路网曲率连续的保证。最后,偏移损失限制内部控制点相对于弦长的过大横向偏移,间距损失把两个投影位置推向弦上的 \(1/3\) 与 \(2/3\),降低控制点聚集和曲线退化的机会。原文把这些项视为独立于目标掩码的几何先验。
3. TopoAdapt 拓扑修整:按先连接、再简化、后扩张的顺序改图
梯度可以把两个端点拉近,却不能把两个节点真正合并;也无法直接把一条道路变成带分叉的两条边。TopoAdapt 因此显式修改节点集和边集。首先合并距离过近的节点,清掉重复端点,再将靠近某条边的节点吸附到该边并拆边,形成真正的 T 形连接。先合点、后造分叉,是为了避免在重复端点还未整理时反复生成连接。
连接完成后,算法删除近乎共线、度为 2 的冗余中间节点并合并对应边,再剪除过短、过细的无效边和孤立节点。这一步不仅追求少几个节点,还能防止优化器把计算浪费在连接操作引出的碎片上。最后才检查目标掩码中置信度足够高、而当前渲染覆盖不足的位置,在这些未拟合区域采样新边,并随机偏移端点。相同的增边机制也负责从空图初始化;它不是在全图均匀堆叠曲线,而是让新增容量集中到当前遗漏的道路。
这些操作由空间网格加速,并使用固定的几何阈值;主文明确给出的节点合并与 T 形连接共用距离阈值为 4 m。必须注意,DOGE 避免的是一次性骨架化与曲线拟合决定最终图的做法,并没有消除全部手工规则。它的离散操作仍有阈值,只是会在后续几何优化中继续接受修正,且论文在两个数据集上保持拓扑超参数一致。
损失函数 / 训练策略¶
分割网络的微调与逐图曲线优化应分开理解:前者生成观测目标,后者用 Adam 调整当前图参数。根据主文列出的五项损失和权重,总目标可写为:
主实验使用 512×512 渲染分辨率,最多执行 300 次优化迭代,硬件为单张 NVIDIA RTX 4090。初始化后先预热几何,再启用周期性的拓扑修整;按原文算法,预热后的每轮先更新离散连接,再执行几何优化。当相邻轮损失变化低于容差、同时节点与边的结构保持不变,且连续满足耐心计数时提前停止。
主文没有列全学习率、预热长度、早停容差及所有拓扑阈值,而是将细节指向补充材料。本地全文缓存仅含主文与参考文献,因此这里不补写这些数值,也不根据残损的公式猜测偏移损失和间距损失的具体范数形式。
实验关键数据¶
主实验¶
City-Scale 使用 144/9/27 的训练/验证/测试划分,SpaceNet 使用 2042/127/382;两者按既有工作统一到 1 m/pixel。Bézier 边均匀采样成折线后交给公开评测实现。TOPO F1 汇总拓扑匹配的精确率与召回率;APLS 衡量预测路网与真值路网的最短路径长度一致性。下表四项指标均越高越好,数值直接取自主文表 1,不混用后文的同掩码对照实验。
| 数据集 | 方法 | TOPO F1 ↑ | 精确率 ↑ | 召回率 ↑ | APLS ↑ |
|---|---|---|---|---|---|
| SpaceNet | RNGDet++ | 82.81 | 91.34 | 75.24 | 67.73 |
| SpaceNet | SAMRoad | 80.52 | 93.03 | 70.97 | 71.64 |
| SpaceNet | SAMRoad++ | 81.57 | 93.68 | 72.23 | 73.44 |
| SpaceNet | DOGE | 84.58 | 93.55 | 78.43 | 73.48 |
| City-Scale | RNGDet++ | 78.44 | 85.65 | 72.58 | 67.76 |
| City-Scale | SAMRoad | 77.23 | 90.47 | 67.69 | 68.37 |
| City-Scale | SAMRoad++ | 80.01 | 88.39 | 73.39 | 68.34 |
| City-Scale | DOGE | 80.59 | 84.42 | 77.40 | 70.24 |
SpaceNet 的 TOPO F1 比 RNGDet++ 高 1.77 个百分点,但 APLS 比 SAMRoad++ 只高 0.04 个百分点,不能称为显著领先所有指标。City-Scale 相对 SAMRoad++ 的召回率增加 4.01 个百分点,同时精确率下降 3.97 个百分点;综合 F1 改善伴随明确的精确率取舍。
消融实验¶
下表来自主文表 2,均在 SpaceNet 上评估。ED 是每公里道路对应的边数,单位为 edges/km,用来描述表示的紧凑程度;只有在拓扑质量足够好时,较低 ED 才有意义,不能把漏掉道路造成的边数减少当作优势。两个下界方法使用与完整模型相同的 SAM2 掩码。
| 配置 | TOPO F1 ↑ | APLS ↑ | ED ↓ |
|---|---|---|---|
| 完整 DOGE | 84.58 | 73.48 | 22.62 |
| 去掉 TopoAdapt | 82.80 | 69.45 | 66.60 |
| 去掉重叠损失 | 83.38 | 65.95 | 40.30 |
| 去掉 G1 损失 | 82.54 | 69.28 | 23.71 |
| 去掉两项曲线正则 | 82.57 | 65.97 | 23.48 |
| 去掉全部几何先验 | 74.58 | 51.18 | 44.17 |
| Vanilla DiffRender | 70.94 | 37.10 | 98.96 |
| Standard Post-Processing | 79.57 | 63.10 | 69.21 |
关键发现¶
- 去掉 TopoAdapt 后 APLS 下降 4.03 个百分点,ED 从 22.62 增至 66.60;离散改图同时改善连接与紧凑度,不只是让图更好看。
- 去掉重叠损失后 APLS 下降 7.53 个百分点,比单独去掉 TopoAdapt 的降幅更大;像素覆盖不能替代道路连接的结构约束。去掉全部几何先验与纯覆盖优化进一步说明这一点,但不同消融降幅不能简单相加。
- 同一 SAM1 掩码下的额外对照中,DOGE/SAMRoad/SAMRoad++ 的 TOPO F1 分别为 83.20/80.08/79.68,ED 分别为 21.33/47.12/47.64。该对照支持矢量化机制有独立收益,不能把它与上表采用不同分割设置的行当作同一组结果。
亮点与洞察¶
- 把可微渲染当作测量桥梁,而不是完整解法。 它把“图渲染得像不像道路”转为可优化信号;几何先验和离散拓扑操作才让低像素误差对应到可用的路网。
- 表示的紧凑性来自曲线能力与结构简化的配合。 Bézier 边用少量参数表达弯道,TopoAdapt 再去除冗余节点;仅换成曲线而禁用拓扑更新,消融中依然留下很高的边密度。
- 同掩码对照隔离了分割骨干的影响。 它比单看端到端榜单更能解释收益来源,也避免把更好的 SAM2 掩码全部记在图优化算法名下。
局限与展望¶
- 作者指出,密集树冠等严重遮挡会污染掩码并造成断路,多层立交也缺少高度信息来判断真实连接;二维渲染匹配无法单独消除这些歧义。
- 这是离线逐图优化,不是实时单次推理。主文报告 DOGE-512 在单张 RTX 4090 上处理 SpaceNet 测试集需要 302 min;更少的图边不代表提取过程本身更快。
- 评测主要考察拓扑与路径,曲线需先离散化。主文将运动学平滑度、阈值敏感性等进一步分析指向未包含在本地缓存中的补充材料;不能仅凭曲线表示就断言下游规划、曲率连续性或延迟已得到全面验证。
- 本笔记认为,需要区分“无需曲线真值”“无需任何监督”和“无需启发式规则”。本文满足前者,却仍依赖分割微调、几何先验和拓扑阈值;作者提出的遮挡先验、高度线索和效率改进正对应这些适用边界。
相关工作与启发¶
- vs SAMRoad/SAMRoad++:它们提供基于基础分割模型的道路图提取参照;DOGE 把掩码后的步骤改为受约束的曲线图优化。同掩码实验支持这一后端差异的价值,但主榜单仍包含分割设置差异。
- vs Bézier Everywhere All at Once:该工作面向车道级 Bézier 图,使用节点共享方向约束相邻边;DOGE 面向遥感标准路网,以每条边独立的弦基偏移提供更灵活的几何,并避免曲线控制点真值监督。
- vs DiffVG 与骨架化拟合:DiffVG 提供像素到矢量参数的梯度,骨架化提供离散路径;DOGE 的关键不在重新发明二者,而在用道路先验限制梯度自由度、让离散结构持续修正,避免一次提取后错误被固定。
评分¶
- 新颖性: 4/5。将弦基 Bézier 图、解析几何先验和有序拓扑编辑组合为掩码驱动的道路优化,贡献明确,但基础工具均有前序工作。
- 实验充分度: 4/5。两个主基准、同掩码对照和细化消融较有说服力;部分几何与效率证据仍需补充材料核验。
- 写作质量: 4/5。连续几何与离散拓扑的职责清楚,但“无需真值”的范围和较小的指标提升需要读者仔细区分。
- 价值: 4/5。适合重视紧凑、可编辑曲线地图的离线建图任务,尚不能据此推断适合实时部署。