One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Xiaohao-Xu/Ambiguity-in-Space
领域: 3D视觉
关键词: 单目深度估计, 多层几何, 视觉提示, 几何二义性, 基础模型
一句话总结¶
针对单目深度基础模型将多层几何强行坍缩为单层标量的固有二义性缺陷,本文构建了稀疏二层序数基准 MD-3k 并提出免微调的拉普拉斯视觉提示(LVP),在冻结权重下成功激发基础模型生成互补的深浅几何假设。
研究背景与动机¶
单目深度估计一直是连接二维图像与三维空间理解的关键桥梁。然而,几乎所有主流深度基础模型都沿用了一个默认的物理假设:穿过相机中心发射出的每条视线光线(Visual Ray)最终只对应一个物理表面,即每个像素点仅预测一个标量深度值。在纯不透明物体场景中,这一假设由于物理遮挡通常是自洽的;但在包含透明物体(如玻璃门、窗户、玻璃展柜)的日常场景中,光线穿透前景介质并观察到后方背景,导致单条光线同时携带两个真实且几何有效的物理表面信号。传统单深度监督强行要求网络在同一视线上只输出一个数值,使得模型学到的并非场景固有的客观几何,而是一种由传感器机制(如超声波检测到近处玻璃、而激光雷达穿透玻璃记录背景)或渲染截断规则人为塑造的“深度层偏好”(Depth-Layer Preference)。
这种将多层几何坍缩为单一标量的范式,不仅限制了系统对复杂分层环境的理解能力,更扭曲了现有的评估体系——常规单层评估指标往往只对齐某一种标注习惯,一旦模型预测出同样具有物理意义的另一层几何,就会被判定为预测错误。因此,在存在二义性的分层场景中,核心问题不再仅仅是“预测是否匹配标注”,而是“模型究竟倾向于汇报哪一层,以及模型内部是否潜藏着被单层 RGB 推理所掩盖的备选几何假设”。
为了系统性拆解这一难题,本文将透明场景作为可控的几何二义性试验场。核心 idea:构建稀疏双层序数基准 MD-3k 量化基础模型的层偏好,并引入免微调的高频拉普拉斯视觉提示(LVP)作为频谱探针,在不改变冻结模型权重的条件下激发互补的几何假设,从而超越单层深度预测的物理上限。
方法详解¶
整体框架¶
本文构建了一套从二义性度量到隐式假设激发的完整诊断体系。整个流程分为三个递进阶段:首先,将透明场景建模为前向透明表面与可见背景组成的双层几何,并通过无须稠密真值的稀疏点对相对序数关系进行数学表征;其次,在由 3,161 张真实图像组成的 MD-3k 基准上,测量冻结单目基础模型在标准 RGB 输入下的层偏好偏差 \(\alpha\) 与多层空间关系准确率(ML-SRA);最后,设计零参数的高频拉普拉斯视觉提示(LVP),对输入图像施加频谱重加权,生成与原始 RGB 互补的第二深度假设,组成双假设对联合满足相冲突的多层空间约束。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 I<br/>透明二义性场景"] --> B["稀疏双层序数基准建模<br/>定义双层序数真值与层偏好指标"]
A --> C["拉普拉斯频谱视觉提示<br/>离散二阶微分与动态范围归一化"]
B --> D["RGB 默认假设生成<br/>输入 I 经冻结基础模型输出 D_RGB"]
C --> E["LVP 互补假设生成<br/>输入 L(I) 经同一冻结模型输出 D_LVP"]
D --> F["全局排列与多层评估<br/>确定候选对最优分配并评测 ML-SRA"]
E --> F
关键设计¶
1. 稀疏双层序数基准建模:摆脱稠密传感器偏见并形式化层偏好 在真实透明场景中,获取稠密、传感器中立的绝对深度真值极其困难,因为不同物理传感器本身存在固有的探测偏差。本文借鉴相对深度理论,在图像二义性区域内采样稀疏点对 \(P = \{(u_m, v_m)\}_{m=1}^M\),分别人工标注透明前景层 \(D^{(1)}\) 和可见背景层 \(D^{(2)}\)(满足 \(D^{(1)} \le D^{(2)}\))的深度先后顺序: $\(y_m^{(k)} = \text{sign}\left(D^{(k)}(u_m) - D^{(k)}(v_m)\right), \quad k \in \{1, 2\}\)$ 在此基础上,定义基础模型的深度层偏好度量 \(\alpha(f_\theta)\),通过统计背景层与前景层序数预测准确率之差量化模型的默认倾向: $\(\alpha(f_\theta) = \frac{1}{|P|} \sum_{m=1}^M \left[ \mathbb{I}(\hat{D} \equiv y_m^{(2)}) - \mathbb{I}(\hat{D} \equiv y_m^{(1)}) \right]\)$ 其中 \(\alpha > 0\) 表示模型偏向背景,\(\alpha < 0\) 表示偏向前景。MD-3k 包含 3,161 张图像,分为两层序数一致的 Same 子集(1,783 对)和两层序数冲突的 Reverse 子集(1,378 对)。在 Reverse 子集中,单张深度图在数学上绝对不可能同时满足两层序数约束,从而为检验多假设表达能力提供了严格判据。
2. 拉普拉斯频谱视觉提示:免微调激发高频特征以反转层偏好 透明物体在成像中表现为前景反射/折射与背景透射的光度叠加(Radiometric Superposition),多层几何线索同时存在于同一输入信号中。本文发现模型对不同空间频率的敏感度直接决定了其深浅层注意力的分配。为了在完全冻结模型权重 \(\theta\) 的前提下探索其潜在几何假设,本文提出拉普拉斯视觉提示(LVP)。该方法利用离散拉普拉斯卷积核 \(K_L\) 对输入图像各通道进行二阶微分操作以提取高频残差: $\(K_L = \begin{bmatrix} 0 & 1 & 0 \\ 1 & -4 & 1 \\ 0 & 1 & 0 \end{bmatrix}, \quad R_{\text{raw}, c} = I_c * K_L\)$ 由于拉普拉斯响应包含带符号的浮点残差,无法直接作为标准图像输入,本文随后执行逐通道的空间最小最大范围归一化,将其无缝映射回模型的合法输入区间 \([a, b]\)(例如 \([0, 255]\)): $\(\mathcal{L}(I)_c(\mathbf{x}) = a + (b - a) \frac{R_{\text{raw}, c}(\mathbf{x}) - \min_{\mathbf{x}} R_{\text{raw}, c}(\mathbf{x})}{\max_{\mathbf{x}} R_{\text{raw}, c}(\mathbf{x}) - \min_{\mathbf{x}} R_{\text{raw}, c}(\mathbf{x}) + \epsilon}\)$ 将经过频谱重加权后的图像 \(\mathcal{L}(I)\) 送入原本的冻结深度模型,即可获得候选补充假设 \(\hat{D}_{\text{LVP}} = f_\theta(\mathcal{L}(I))\)。该过程完全不改动模型权重,也不引入任何可训练外挂参数,却能显著改变受体模型的高频特征激活,促使其将视线转向原本被忽略的深度层。
3. 全局排列与多层评估:以数据集级确定性校准衡量多假设互补性 对于生成的候选深度对 \(H = \{\hat{D}_{\text{RGB}}, \hat{D}_{\text{LVP}}\}\),系统必须评估其联合捕获两层几何的能力,而不能依赖每张图的后验真值进行单样本动态挑取(Oracle)。本文采用数据集级别的排列置换 \(\pi^\star \in S_2\),通过确定性标定准则分配角色:在整个验证基准上,将单层 SRA 更高的一路输入分配给其擅长的主层,将另一路分配给互补层,并在全部图像中严格固定该对应关系。多层空间关系准确率(ML-SRA)定义为两层序数同时预测正确的样本比例: $\(\text{ML-SRA} = \frac{1}{|P|} \sum_{m=1}^M \mathbb{I}\left( \bigwedge_{k=1}^2 \hat{D}_{\pi^\star(k)} \equiv y_m^{(k)} \right)\)$ 这种无作弊的全局校准机制保证了该评估衡量的是稳定的系统级互补能力,而非随机波动带来的假象。
实验关键数据¶
主实验¶
在 MD-3k 基准上评估各主流单目深度基础模型,对比其单图单层准确率以及 RGB/LVP 双假设组合下的多层空间关系准确率(ML-SRA)。理论上,单深度图在两层序数相悖的 Reverse 子集上准确率必为 0%,其在全集上的严格上限为 56.4%(Ideal Collapsed Baseline)。
| 模型类别 | 代表模型 | MD-3k 全集 ML-SRA (%) | Reverse 子集 (%) | Same 子集 (%) | DA-2K 参考 SRA (%) |
|---|---|---|---|---|---|
| 理论单层上限 | Ideal Collapsed Baseline | 56.4 | 0.0 | 100.0 | - |
| 生成式扩散模型 | Marigold | 57.4 | 15.3 | 89.8 | 88.9 |
| 生成式扩散模型 | GeoWizard | 59.5 | 17.6 | 91.9 | 90.3 |
| 判别式深度模型 | ZoeDepth | 68.8 | 45.4 | 86.8 | 86.7 |
| 判别式深度模型 | DPT | 70.2 | 46.4 | 88.7 | 83.2 |
| 度量深度模型 | Depth Pro | 66.3 | 31.1 | 93.5 | 95.8 |
| 度量深度模型 | UniDepth-v2-L | 61.3 | 13.6 | 93.7 | 95.4 |
| 度量深度模型 | UniK3D-L | 58.9 | 19.2 | 93.9 | 93.1 |
| 基础模型系列 | DAv1-L | 57.1 | 10.9 | 92.8 | 89.5 |
| 基础模型系列 | DAv2-O-L (室外微调) | 60.4 | 17.6 | 93.4 | 93.7 |
| 基础模型系列 | DAv2-I-L (室内微调) | 71.1 | 42.5 | 93.2 | 94.8 |
| 基础模型系列 | DAv2-S | 67.2 | 36.9 | 90.7 | 95.1 |
| 基础模型系列 | DAv2-B | 73.3 | 48.2 | 92.7 | 96.7 |
| 本文最佳组合 | DAv2-L (RGB + LVP) | 75.5 | 52.2 | 93.6 | 96.9 |
消融实验¶
为了验证 LVP 机制中高频成分的作用,对比了高频拉普拉斯提示与低通高斯滤波提示(Gaussian Prompt)在各模型下的 ML-SRA 表现;同时测试了不同高频算子变体。
| 输入提示类型 | 模型 | 全集 ML-SRA (%) | Reverse 子集 (%) | Same 子集 (%) | 说明 |
|---|---|---|---|---|---|
| LVP (默认拉普拉斯) | DAv2-L | 75.5 | 52.2 | 93.6 | 标准 4 邻域高频差分卷积 |
| 高斯低通滤波 (GAU) | DAv2-L | 56.4 | 4.5 | 98.2 | 仅保留低频,无法激发第二假设 |
| 高斯低通滤波 (GAU) | DPT | 54.0 | 0.3 | 94.3 | Reverse 接近归零,退化为单层复制 |
| 高斯低通滤波 (GAU) | ZoeDepth | 53.8 | 0.7 | 94.6 | 仅能维持同向一致几何 |
| 8 邻域变体 (LVP-2) | DAv2-L | 75.3 | 51.8 | 93.5 | 对卷积核模板变化保持鲁棒 |
| 卷积核符号翻转 (LVP-R) | DAv2-L | 75.0 | 51.1 | 93.4 | 算子正负对高频感知影响微弱 |
| 灰度单通道提示 (LVP-G) | DAv2-L | 74.8 | 50.4 | 93.7 | 颜色信息非几何激发所必需 |
| Sobel 梯度提示 | DAv2-L | 73.9 | 47.2 | 94.5 | 替代高频算子同样有效 |
| Fourier 高通滤波 | DAv2-L | 75.0 | 49.1 | 95.0 | 频域直接高通滤波表现相当 |
| 小波高频变换 (Wavelet) | DAv2-L | 74.8 | 50.4 | 93.7 | 验证高频激发的普遍性 |
关键发现¶
- 高频激发是打破单层坍缩的核心因素:消融实验显示,低通高斯滤波在 Reverse 子集上几乎全军覆没(ML-SRA 普遍低于 5%),说明仅保留低频信息只会反复激活模型的默认层偏好;而多种连续高频算子(Sobel、Fourier 高通、小波变换)均展现出显著的偏好反转效果,证实了通过强调边缘残差激发互补假设的机制有效性。
- 不同模型家族的内在偏好截然不同:在标准 RGB 输入下,通用 DAv2 和室内微调版 DAv2-I 显著偏好前景透明表面(\(\alpha < 0\)),而 DAv1、室外微调版 DAv2-O 以及扩散生成模型(Marigold、GeoWizard)则天然偏好后方背景场景(\(\alpha > 0\)),这深刻揭示了预训练数据集采集与标注分布对模型几何偏好的塑形作用。
- 模型架构与预训练对 LVP 感受性存在异质性:判别式骨干(DAv2、DPT、ZoeDepth)对 LVP 表现出极强的响应能力,DAv2-L 在 Reverse 子集上一举跃升至 52.2%(相比单图理论极限 0% 提升超 50 个百分点);但 DAv1 和 Marigold 等扩散模型对高频变换不敏感,表现出明显的架构差异。
- 无需显式语义掩码即可比拟专家流水线:在与基于透明检测掩码结合插值重建的启发式方案对比中,DAv2-L + LVP 无须引入任何外部透明分割网络,即可达到 75.5% 的 ML-SRA,逼近依赖预测掩码的传统分割插值流水线(75.8%)。
亮点与洞察¶
- 将几何二义性视为可度量、可激发的结构而非噪声:打破了单目深度估计“一像素一标量”的固有教条,首次在单目大模型中形式化定义了深度层偏好,指出了真实世界光度叠加场景下传统深度单值评价的固有缺陷。
- 零参数免训练的拉普拉斯频谱探针:巧妙利用二阶微分滤波与输入动态范围映射,仅在图像输入空间进行频谱变换,无需反向传播或微调权重,就揭示出冻结模型内部已经编码但被 RGB 偏好压制的多层几何假设。
- 下游可控生成与视频流解耦价值:输出的 RGB 与 LVP 双假设可以直接作为 ControlNet 结构条件,在同一视点下分别控制生成前景实体或透过窗户展示背景;在连续视频流中逐帧应用 LVP 亦可解耦出平滑的双层深度轨迹。
局限与展望¶
- 高度依赖骨干网络的频谱感受性:LVP 并非通用开关,在某些预训练模型(如 DAv1 或扩散模型)上几乎不起作用,其微观机制与特征层级响应机理仍有待进一步因果解释。
- 缺乏实例级的自适应分层判别器:目前 ML-SRA 采用基准级全局固定映射(\(\pi^\star\)),在实际无标注部署时,尚需配合额外的语义分割头或置信度不确定度估计器来自动识别像素级透明区域并分配层级。
- 半透明与高频混叠场景的退化:当遇到磨砂半透明表面或带有密集复杂纹理的曲面玻璃时,前景折射的高频纹理与背景高频信息严重缠绕,拉普拉斯微分可能产生几何歧义伪影,需探索更细粒度的局部解耦表征。
相关工作与启发¶
- vs 单目深度基础模型 (Depth Anything v1/v2, DPT):传统基线将整个网络优化目标锚定在单一标量深度上,强制抹除透明场景的多层共存性;本文通过设计 MD-3k 评测体系揭示了它们的默认层偏好,并通过 LVP 挖掘出冻结网络在不同频域输入下的互补表达能力。
- vs 透明物体专门检测与补全方案 (TransCG, TODE-Trans):传统方案通常设计专门的多阶段流水线(透明检测 \(\to\) 边界提取 \(\to\) 背景补齐),泛化性受限于特定领域数据;本文证明通用基础模型内部已蕴含多层几何表征,无需外挂复杂模型即可利用频域提示激发多层推断。
- vs 视觉提示工程 (Visual Prompting):传统视觉提示大多依赖在像素空间或特征空间训练可学习的扰动 patch 或 prompt token;本文采用确定性、零参数的经典拉普拉斯高频算子,将输入空间提示成功拓展到了三维几何感知与偏好调控任务中。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 概念极具启发性,首次系统性探究单目基础模型的几何多层二义性与层偏好,并提出零微调的频谱探针。
- 实验充分度: ⭐⭐⭐⭐☆ 构建了包含 3,161 对标注的 MD-3k 评测基准,全面评测了涵盖判别、生成、度量等十余种模型及丰富的高频消融。
- 写作质量: ⭐⭐⭐⭐⭐ 概念界定清晰准确,问题建模数学严谨,逻辑层层递进,批判性反思了现有单目深度单目标坍缩的理论局限。
- 价值: ⭐⭐⭐⭐⭐ 为单目 3D 视觉基础模型的架构设计、损失函数构建以及从“单值估计”走向“概率/多假设几何推断”开辟了全新的研究视角。