跳转至

Honey, I Shrunk the Arc de Triomphe!

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://metricscenes.github.io/
领域: 3D视觉 / 自动驾驶
关键词: 真实世界度量数据集、单目度量几何、单目度量深度、尺度坍缩、泊松补全

一句话总结

针对前沿单目度量几何模型在野外场景中远景地标严重缩放缩小的“尺度坍缩”缺陷,本文构建了首个利用地理元数据与已知双目基线锚定绝对物理尺度的真实世界数据集 MetricScenes,并提出两阶段边缘感知泊松深度补全算法,微调得到的 WildMoGe 在彻底解决远景尺度塌陷的同时保持了标准基准 SOTA 水平。

研究背景与动机

从单幅图像恢复绝对物理尺度的三维几何是一个严重不适定的逆问题。人类观察者在推断场景物理尺寸时,通常依赖于已知的语义先验(如人体身高、门窗标准尺寸或汽车轴距)。现代基于基础视觉模型的单目几何与深度估计系统(如 MoGe-2、Metric3D v2、UniDepth v2 等)理论上也应当能够内化这些语义线索。然而在实际开放的野外(in-the-wild)图像测试中,这些模型频繁遭遇严重的“尺度坍缩”(scale-collapse)现象:尽管近景前景主体的尺度相对合理(例如前景游客身高约为 1.4 米),但远处的宏伟建筑与地标却被大幅度压缩缩小并拉近至相机前方——例如现实中宽达 44.8 米的巴黎凯旋门,被 MoGe-2 预测为仅宽 18.8 米的微缩模型,尺度低估达两倍以上。

这一瓶颈的根源并不在模型网络架构的设计,而在现有训练数据的物理与传感器限制。目前具有绝对尺度真值的真实世界三维数据集几乎完全局限于车载激光雷达(如 KITTI、Argoverse 2,场景单一且仅占室外度量帧的 59%)以及短焦主动扫描仪(如 ScanNet++、ARKitScenes,受限于数米测量半径仅覆盖室内)。合成数据集虽然视角多变,却因程序化生成和资产缺乏而严重丢失物理真实感;而涵盖丰富互联网照片的传统 SfM 数据集(如 MegaDepth、BlendedMVS)虽具语义多样性,重建几何却丢失了绝对尺度因子。学术界至今缺乏一个兼具开阔自然/城市场景语义多样性与严密绝对米级真实标定的训练基准。

本文的切入角度是打破对专用测距硬件的依赖,充分挖掘海量公共互联网摄影集与网络双目立体视频中蕴含的几何弱监督先验。核心 idea:利用地理标记街景对齐海量地标 SfM 重建以赋予绝对物理尺度,结合已知物理基线的立体视频序列通过多视角一致性重建密集几何,再借助两阶段边缘感知泊松补全解决梯度指导与稀疏锚点的尺度冲突,构建首个真实世界开阔场景度量数据集 MetricScenes 并训练出克服尺度坍缩的 WildMoGe。

方法详解

整体框架

本文构建度量级三维训练数据并微调几何基础模型的完整流程包含三个核心阶段:首先,针对互联网多视角照片集(来自 AerialMegaDepth 与 MegaScenes),利用 Doppelganger 分类器过滤假对称特征对应,通过多视角立体(MVS)获得几何深度,并借助在线地图服务采集的带有绝对大地坐标(ECEF)的街景视图将重建模型刚性旋转对齐至曼哈顿坐标系并恢复绝对米级尺度;其次,针对 Stereo4D 网络双目立体视频,抽取已知相机硬件参数的子集,采用置换等变多视角重建模型 \(\pi^3\) 联合优化时空多帧位姿与几何,利用物理基线计算全局缩放因子;最后,由于上述阶段生成的深度图在前景动态物体或远景天空区域存在空洞,设计两阶段边缘感知泊松方程求解器,将单目模型预测的结构梯度与稀疏绝对度量锚点解耦融合,输出稠密、边缘锐利且全局尺度统一的高质量深度监督真值。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多源非标定视觉数据<br/>互联网地标像集 / Stereo4D视频"] --> B["地理元数据与基线几何锚定<br/>街景ECEF配准 + 双目物理基线缩放"]
    B --> C["几何一致性与深度漂移过滤<br/>Doppelganger剪枝 + 视差几何一致性检查"]
    C --> D["两阶段边缘感知泊松补全<br/>背景度量求解 + 前景边缘加权缝合"]
    D --> E["MetricScenes 数据集交付<br/>99.7k 稠密绝对度量深度图"]
    E --> F["WildMoGe 微调优化<br/>MoGe-2 大模型多尺度几何学习"]

关键设计

1. 地理元数据与双目基线几何锚定:摆脱硬件传感器的绝对尺度解耦

为了使原本无绝对尺度的 SfM 模型获得精确的公制尺寸,针对 MegaScenes 数据集,围绕地标轮廓均匀采样约 100 个朝向建筑中心的带地理标记街景全景图像,利用 MASt3R 特征描述子将其与历史照片点云进行匹配,并运行 Doppelganger 分类器剔除因建筑对称和重复纹理引起的错误关联。通过 COLMAP 模型对齐器旋转至曼哈顿坐标系后,使用 RANSAC 鲁棒拟合相机三维位置与 ECEF(地心地固)地理坐标之间的三维相似变换,计算精确的绝对缩放系数;针对 Stereo4D 双目视频,弃用容易在未标定广角镜头上产生发散失真的光流与双目匹配(如 SEA-RAFT 和 FoundationStereo),选取已知物理基线 \(b_{\text{gt}}\) 的片段,输入置换等变网络 \(\pi^3\) 处理连续 16 帧时空序列,通过多帧双目外参平移向量均值与物理基线强制对齐求得场景全局尺度因子: $\(s = \frac{b_{\text{gt}}}{\frac{1}{N+1}\sum_{i=0}^{N}\|\mathbf{t}_{\text{L}}^{(i)} - \mathbf{t}_{\text{R}}^{(i)}\|_2}\)$ 最终将预测几何深度按 \(d_{\text{metric}} = s \cdot d_{\text{pred}}\) 转换至真实物理单位。

2. 几何一致性与多层深度漂移过滤:去除假阳性与动态伪影

真实网络图像中存在大量移动行人、车辆以及光照突变,若直接用于深度监督将引入严重伪影。在互联网摄影数据中,MVS 重建后执行稳定性方差过滤剔除波动像素,并引入单目模型先验剔除背景深度“侵蚀”前景的深度渗透(depth-bleeding)区域;在立体视频中,基于中心帧的 Tenengrad 梯度能量与中值亮度剔除曝光不足或运动模糊的低质图像。更为关键的是执行立体几何投影检查:要求双目视点间深度重投影不一致像素比例严格低于 10%,且缩放后的立体基线漂移小于 10 毫米、相对旋转误差低于 1°。同时,利用近景稳健的单目预测尺度对比,滤除整体尺度因子偏差超过 2 倍或低于 0.5 倍的不可靠序列,确保监督标签的高置信度。

3. 两阶段边缘感知泊松补全:化解梯度场与尺度锚点的拉扯冲突

传统对数空间泊松深度补全通过最小化梯度场差异插值缺失深度,即: $\(\min_{d^*} \sum_{i \in \Omega} \|\nabla(\log d^*_i) - \nabla(\log \hat{d}_i)\|^2 \quad \text{s.t.} \quad d^*_i = d^{\text{gt}}_i, \, \forall i \in \partial\Omega\)$ 其中单目模型 \(\hat{d}\) 提供稠密局部梯度,实测发现若将带有尺度坍缩的单目模型作为全局连续梯度引导,背景锚点会将整图按比例放大,导致前景人物被错误拉大至 3.26 米的畸变巨人(BG only);若简单同时将前景单目锚点与背景 MVS 锚点混入单阶段求解,未锚定的建筑基座等过渡区域会被严重拉扯扭曲(FG+BG)。为此,本文提出两阶段解耦方案:Stage 1 仅以过滤后的稀疏 MVS 背景为固定边界求解泊松方程,恢复出物理尺度准确但丢弃受损前景的基础背景深度;Stage 2 将 Stage 1 得到的稠密背景深度与单目模型预测的可靠前景主体联合构造成完整锚点,采用边缘加权泊松目标函数进行平滑融合: $\(\min_{d^*} \sum_{i \in \Omega} \sum_{j \in \mathcal{N}(i)} w_{ij} \left| (\log d^*_i - \log d^*_j) - (\log \hat{d}_i - \log \hat{d}_j) \right|^2\)$ 其中加权系数 \(w_{ij}\) 在深度的显著突变边缘处迅速衰减至零,从而在保持前景与远景各自精准绝对物理尺度的同时,彻底杜绝了边界渗透与过渡区几何畸变。

损失函数 / 训练策略

基于构建完成的包含 99,711 张高质量物理尺度深度图的 MetricScenes 数据集,选用预训练的 MoGe-2 ViT-Large-Normal 架构作为基座模型进行 WildMoGe 微调。采用全尺寸随机裁剪与视角几何变换进行数据增强,批大小设为 32,共微调 10,000 次迭代(约 3 个 epoch)。骨干网络(backbone)采用极小学习率 \(1 \times 10^{-6}\) 以保护在数千万合成与标准数据上习得的丰富几何归纳偏置,其余预测头参数采用 \(1 \times 10^{-5}\) 的学习率,促使模型快速适应开阔自然场景的绝对尺度分布。

实验关键数据

主实验

论文在相对几何精度(评估单张图像重构三维形状的能力)与绝对度量几何精度(评估恢复物理世界真实尺寸的能力)两个维度,对比了 10 个标准基准集(NYUv2、KITTI、ETH3D、iBims-1、GSO、Sintel、DDAD、DIODE、Spring、HAMMER)以及留出的 MetricScenes 测试集。

表 1:标准基准与 MetricScenes 测试集上的相对与度量几何评估(节选自原论文 Table 1)

测试环境 / 评估方法 相对点误差 \(\text{Rel}_p\downarrow\) 尺度不变深度 \(\text{Rel}_d\downarrow\) 度量点误差(无真值相机) \(\text{Rel}_p\downarrow\) 度量深度误差 \(\text{Rel}_d\downarrow\) 阈值内点率 \(\delta_{d1}\uparrow\)
标准基准 (Standard Benchmarks)
Metric3D v2 - 7.92 - 18.3 (有真值内参) 73.9%
UniDepth v2 11.6 8.61 10.1 21.3 75.3%
Depth Pro 12.4 9.81 13.7 27.6 54.4%
MoGe-2 (Baseline) 10.8 7.35 8.19 15.7 76.8%
WildMoGe (本文) 10.1 7.49 8.39 15.6 73.4%
MetricScenes 测试集 (In-the-wild)
MoGe-2 (Baseline) 6.76 4.85 11.7 37.2 37.7%
WildMoGe (本文) 5.24 4.02 7.59 26.5 73.8%

注:在标准微观环境与自动驾驶测试中,WildMoGe 维持了与 MoGe-2 相当的极高水准;而在包含开阔远景与复杂地标的 MetricScenes 测试集上,WildMoGe 的度量深度内点率 \(\delta_{d1}\) 从 37.7% 暴涨至 73.8%,度量深度误差大幅降低 10.7 个绝对百分点。

消融实验

论文在标准基准和 MetricScenes 测试集上,深入分析了 MetricScenes 中各个数据来源对模型几何泛化性与物体边缘清晰度的独立贡献。

表 2:微调数据集各子集消融评估(源自原论文 Table 2)

训练子集配置 标准基准 \(\text{Rel}_p\downarrow\) 标准基准 \(\text{Rel}_d\downarrow\) 边缘锐度 Boundary \(F_1\uparrow\) MetricScenes \(\text{Rel}_p\downarrow\) MetricScenes \(\text{Rel}_d\downarrow\) MetricScenes \(\delta_{d1}\uparrow\)
仅 Stereo4D 11.3 7.50 15.6 6.23 34.0 39.3%
仅 AerialMegaDepth 9.81 7.41 14.5 6.33 41.0 58.7%
仅 MegaScenes 9.78 7.45 15.0 6.68 32.4 53.0%
AerialMD. + MegaSc. 9.73 7.40 14.9 6.66 32.7 65.0%
全量数据 (All) 10.1 7.49 15.5 5.24 26.5 73.8%

关键发现

  • 多源数据呈现互补增益:Stereo4D 提供了密集的视差感知与前景动态关系,显著赋予模型极高的物体边缘分割精度(\(F_1=15.6\));AerialMegaDepth 依托 Google Earth 空地协同标定,充当了坚固的超大范围度量锚;MegaScenes 则补足了开阔视角的语义与多样性。单独使用任意单一来源在开放场景测试集上内点率均不超过 58.7%,而三者联合训练跃升至 73.8%。
  • 并非简单放大尺度偏置:在 ETH3D 庭院场景的细粒度验证中,地面真实桌腿高度为 72 cm,原始 MoGe-2 过度高估为 81 cm,而 WildMoGe 预测为高精度的 71.6 cm;在标准室内门高(2.1 m)与车长(3.2 m)上 WildMoGe 保持完全一致的度量精度。这有力证明了 WildMoGe 是真正学会了场景几何结构的客观物理映射,而非盲目推大预测尺度。

亮点与洞察

  • 跳出硬件依赖的度量数据挖掘:巧妙地将地理信息系统(GIS/街景 ECEF 坐标)和商业消费级立体相机的物理基线转化为绝对尺度的监督信号,摆脱了激光雷达与 RGB-D 传感器几十米探测半径和特定载具视角的桎梏。
  • 解耦前景与背景尺度的边缘泊松补全:揭示了单目神经几何模型在连续网格优化中“梯度引导尺度坍缩”的机制,通过“背景单求、前景复用、边缘衰减”的两步法优雅消除了深度跳变缝合时的拉扯撕裂。
  • 可复用的数据提纯范式:将 Doppelganger 假对称剪枝、\(\pi^3\) 时空多视角刚性求解与几何重投影残差校验结合的闭环过滤管线,可直接推广至任意网络无序照片/视频的三维基础数据集自动构建。

局限与展望

  • 作者承认的局限:在极端野外无地标、无参照物或无纹理的大片戈壁、沙漠与海面场景中,缺乏足够的几何特征点或已知的地理锚点,绝对尺度推断仍存在歧义。
  • 评测标签精度的天然约束:测试集的伪真值仍然由离线几何算法与街景配准获得,在局部细节或极细线条处与纯硬件激光雷达测量相比存在细微噪声。
  • 未来改进方向:可进一步探索联合端到端训练框架(将泊松补全步骤内化为模型注意力机制中的可微层),或将视觉语言模型(VLM)的宏观语义常识与度量几何头直接交叉对齐。

相关工作与启发

  • vs MoGe-2 / Metric3D v2: 后者虽引入虚拟相机空间或解耦尺度头,但训练集受制于自动驾驶街景与室内扫描,遇到开阔地标时必然产生远景尺度坍缩;本文无需改动主干架构,仅通过微调纯净的 MetricScenes 数据集即彻底纠正了深层尺度认知。
  • vs UniDepth v2 / Depth Pro: UniDepth v2 具备自提示相机机制,但预测野外地标尺寸仍存在数十米系统性偏移;Depth Pro 在极端远景下尺度崩塌达数量级差异。本文构建的 WildMoGe 兼备高频边界与厘米级物理尺度精度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [敏锐指出并定性度量了几何基础模型的尺度坍缩难题,以极具创意的地理/基线锚定构建了首个开阔野外度量数据集]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 10 个经典学术基准与真实地标测量实测,跨尺度对比详实且定量消融完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [图文并茂,动机阐述切中要害,数学推导与两阶段演进逻辑极为严密]
  • 价值: ⭐⭐⭐⭐⭐ [为三维大模型在物理具身智能、高精地图重建与实景 AR/VR 落地扫清了关键尺度障碍]