跳转至

The 3D Mirage: Probing and Taming 3D Hallucinations

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/hdnndh/The-3D-Mirage-Probing-and-Taming-3D-Hallucinations
领域: 3D视觉 / 幻觉检测
关键词: 单目深度估计、3D幻觉、上下文稳定性、自蒸馏、参数高效微调

一句话总结

针对单目深度估计大模型在平坦表面光学错觉及有限视场下严重虚构三维几何结构的“3D Mirage”系统性漏洞,本文构建了首个具备成对上下文变化与精细ROI标注的3D-Mirage基准,提出二阶幅度无参考评测指标(DCS与CCS),并通过仅含约1.2%参数量的Grounded Self-Distillation(GSD)在保留背景先验的同时将幻觉偏差降低94%以上。

研究背景与动机

单目深度估计(MDE)作为三维场景重建与具身感知系统的基石,近年来随着以 Depth Anything V2、ZoeDepth、Depth Pro 等为代表的基础模型的涌现,取得了显著的泛化进展。这些模型通常在海量、多源的无标注或伪真值数据集上完成预训练,学到了极其庞大的统计与语义先验。然而,这种泛化能力背后隐藏着未被充分揭示的系统性安全脆弱性:模型往往在几何保真度与语义一致性之间做出权衡,极度依赖图像全局上下文与语义特征来推断深度,而非依据真实的局部几何物理证据。

当面对现实世界中广泛存在的光学视错觉(如街头 3D 地画、强制透视壁画或广告牌)时,这种对语义先验的过度依赖就会演变为严重的 3D 幻觉。模型将低曲率或完全平坦的承载表面误判为存在显著的高低起伏甚至巨大障碍物;更致命的是,一旦视场受限或周围全局上下文线索被剥离(例如自动驾驶车载相机遭遇局部遮挡或变焦裁剪),模型原先尚能勉强维持平坦的区域会瞬间崩溃,激发出剧烈的虚假三维结构。现有主流 MDE 评测协议(如 MAE、RMSE、AbsRel)完全以全图像素绝对误差为中心,在缺乏真值深度的情况下根本无法度量这种纯粹由语义引发的虚假曲率,亦无法量化跨视角上下文变化带来的预测不稳定性。

针对这一空白,亟需一套集“探测诱发、定量度量、针对性抑制”于一体的端到端方案。核心 idea:本文构建了包含成对完整视角与局部裁剪的 3D-Mirage 基准并提出二阶曲率与混淆度指标,进而提出基于 LoRA 的双视角 Grounded Self-Distillation(GSD)框架,利用局部平面假说混合损失消除 ROI 内虚假曲率,同时借助冻结教师模型锁定背景稳定几何,在不发生灾难性遗忘的前提下实现 3D 幻觉的外科手术式消除。

方法详解

整体框架

本文框架涵盖三大部分:用于诱发并测量 3D 幻觉的 3D-Mirage 基准、量化二阶结构偏差与上下文漂移的无参考评测度量体系,以及基于参数高效适配的 Grounded Self-Distillation(GSD)缓解算法。

在训练阶段,输入包含成对的完整视场图像 \(x_{\text{full}}\) 和聚焦于错觉区域的受限裁剪图像 \(x_{\text{crop}}\)。预训练并完全冻结的 Depth-Anything-V2-Large 充当教师网络 \(T\),学生网络 \(S\) 则仅在 ViT 编码器的 Patch Embedding 与 MLP 线性层中注入少量 LoRA 适配器(约 4M 参数),其余参数及解码器完全冻结并与教师共享。双分支同时前向传播,通过幻觉知识重编辑损失(HKR)迫使学生网络在多边形错觉 ROI 内坍缩二阶虚假曲率并向邻近环形区域拟合的局部平面假说靠拢;同时,通过非幻觉知识保留损失(NKP)将教师网络在非错觉背景及过渡缝隙处的稳定特征蒸馏给学生,防止全局泛化性能退化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入样本对<br/>(完整视角 x_full 与 局部裁剪 x_crop)"] --> B["双分支特征前向传递<br/>(冻结教师 T 与 LoRA学生 S)"]
    B --> C["双视角投影与二阶响应度量<br/>(DCS 结构偏差 + CCS 上下文混淆度)"]
    C --> D["局部几何假说拟合与门控<br/>(多表面假设 π_k + 紧凑门控权重 w_j)"]
    D --> E["幻觉知识重编辑损失 HKR<br/>(二阶曲率惩罚 + 教师邻域多平面混合对齐)"]
    D --> F["非幻觉知识保留损失 NKP<br/>(背景绝对差约束 + 缝隙处平滑与边缘保真)"]
    E --> G["综合目标联合优化<br/>(LoRA参数高效微调 + 背景正样本交替防过平滑)"]
    F --> G

关键设计

1. 3D-Mirage 探测基准与二阶无参考度量:量化结构幻觉与上下文不稳定性

为精准定位视觉错觉在缺乏稠密真值时的虚构幅度,该基准采集了 468 处真实世界的 3D 绘画与街头艺术场景,人工绘制了多边形 ROI 掩码,并支持多表面独立多边形以及嵌套排除真实物体。针对每一图像,生成保留至少 40% ROI 对角线尺寸的 4 个随机裁剪,构成包含 1,872 对完整与受限视角的数据集。

在度量层面,针对两分支预测深度,通过仿射变换将全图预测采样对齐至裁剪坐标系,经过 ROI 条件下的 1%–99% 分位数归一化 \(\mathrm{QN}(\cdot; M_i)\) 后,应用可分离二阶差分幅度算子 \(\mathcal{L}(\cdot)\) 得到二阶响应图 \(R_i^{\text{full}}\) 与 \(R_i^{\text{crop}}\)。进而提取 ROI 内响应最大的前 10% 响应之和 \(t_{v,i}\) 以及去除前 10% 极端值后的稳健均值 \(\mu_{v,i}\),构建出两大评估指标: 1. 偏离综合得分(Deviation Composite Score, DCS):度量绝对几何幻觉强度,包含样本中心聚类偏离度与单样本平均偏离范数: $\(\mathrm{DCS} = \|\bar{\mathbf{t}}\|_2 + \frac{1}{N}\sum_{i=1}^N \|\mathbf{t}_i\|_2\)$ 其中 \(\mathbf{t}_i = [t_{\text{full},i}, t_{\text{crop},i}]^\top\)。DCS 越低,表明低曲率承载面上虚构的高阶几何曲率越少。 2. 混淆综合得分(Confusion Composite Score, CCS):度量视场上下文变化引起的几何漂移(即 Mirage 效应)。沿反对角线方向单位向量 \(\mathbf{u} = \frac{1}{\sqrt{2}}[1, -1]^\top\) 投影响应均值向量 \(\boldsymbol{\mu}_i\): $\(\mathrm{CCS} = |\mathbf{u}^\top \bar{\boldsymbol{\mu}}| + \frac{1}{N}\sum_{i=1}^N |\mathbf{u}^\top \boldsymbol{\mu}_i|\)$ CCS 越小,说明模型在上下文裁剪前后对同一物理区域的判断越稳定。

2. 幻觉知识重编辑(HKR):二阶曲率抑制与局部平面假设门控混合

为消除错觉区域的凸起或凹陷,不能暴力将其强制约束为全局单一平面(因为错觉可能跨越多面折角或地面与墙体相交)。HKR 采用二阶曲率抑制联合局部表面假设混合逼近机制。

针对每个错觉多边形实例 \(j \in \mathcal{R}\),在包围该 ROI 的膨胀环状邻域上,根据教师网络的深度拟合 \(K\) 个简单的候选局部平面假设 \(\{\pi_{j,k}\}_{k=1}^K\),并计算残差尺度 \(\sigma_{j,k}\)。由一个轻量级门控 MLP 根据 ROI 及其环域的统计量输出混合权重 \(w_j = \text{softmax}(G(\cdot))\),并由残差 \(\sigma_{j,k}\) 构造软标签目标计算交叉熵正则项。学生网络在实例掩码 \(m_j\) 上的预测与局部平面的偏差表示为 \(\ell_{j,k} = \overline{|z - \pi_{j,k}|}_{m_j}\)。最终的 HKR 损失将联合二阶差分惩罚与多平面混合约束: $\(\mathcal{L}_{\text{HKR}} = \alpha \overline{|\mathcal{L}(s)|}_m + \sum_{j \in \mathcal{R}} \sum_{k=1}^K w_{j,k} \ell_{j,k}\)$ 该项在裁剪分支与全图分支上分别计算,有效迫使学生模型在保持分段平滑几何的同时,将假想的 3D 凹凸平整化。

3. 非幻觉知识保留(NKP):环状边界平滑与背景教师几何自蒸馏

为了防止对 ROI 区域的展平惩罚侵蚀正常的物体结构(引发灾难性遗忘或导致全图过平滑),NKP 损失承担了外科手术级保护的关键角色。背景掩码 \(m_{\text{bg}} = (1 - m)(1 - r)(1 - r_g)\) 严格排除了错觉 ROI、ROI 膨胀外环 \(r\) 以及防护保护环 \(r_g\)。

在背景区域 \(m_{\text{bg}}\) 上,直接对齐归一化后的学生与教师深度绝对差与二阶导数;更精妙的是在过渡边界处:将外环 \(r\) 拆分为梯度最高的边缘子集 \(r_e\)(保留真实物体的锋利轮廓)与低梯度平滑缝隙 \(r_f\)。在缝隙 \(r_f\) 处,学生深度被锚定在教师的环域局部平滑深度 \(\tilde{z}_T\) 上;而在高梯度边缘 \(r_e\) 与保护环 \(r_g\) 上,则强约束二阶特征 \(\mathcal{L}(\cdot)\) 的匹配: $\(\mathcal{L}_{\text{NKP}} = \alpha_3 \overline{|z - z_T|}_{m_{\text{bg}}} + \alpha_4 \overline{|\mathcal{L}(z_T) - \mathcal{L}(z)|}_{m_{\text{bg}}} + \alpha_5 \overline{|z - \tilde{z}_T|}_{r_f} + \alpha_6 \overline{|\mathcal{L}(z) - \mathcal{L}(z_T)|}_{r_e} + \alpha_7 \overline{|\mathcal{L}(z) - \mathcal{L}(z_T)|}_{r_g}\)$ 这种渐进式环域正则彻底消除了 ROI 边界的缝隙伪影(Halo 伪影),实现了平滑无缝的几何过渡。

损失函数 / 训练策略

总训练目标为两分支的加权累加:\(\mathcal{L}_{\text{total}} = \lambda_C \mathcal{L}_{\text{crop}} + \lambda_F \mathcal{L}_{\text{full}}\),其中裁剪分支占据主导权重以强化抗上下文漂移能力。每分支包含 \(\mathcal{L}_{\text{HKR}} + \mathcal{L}_{\text{NKP}}\) 以及门控网络的交叉熵正则 \(\text{CE}(w, q)\) 与极小残差锚定项。

在训练优化中,采用 4:1 的正样本(3D-Mirage 错觉图)与负样本(Penn-Fudan 行人数据集和 CamVid 自动驾驶街景图像)交替采样,负样本由于不含错觉 ROI 因而仅激活 NKP 保留项,彻底杜绝了模型在正常街景中将真车或行人平整化的退化风险。采用 AdamW 优化器,学习率设为 \(1 \times 10^{-4}\),在单张 A100 GPU 上仅微调 1 个 epoch(Batch Size 8)即可收敛,耗时极短且推理阶段无需任何额外开销。

实验关键数据

主实验

在 3D-Mirage 测试集(47 个未见场景,188 对 full-crop 图像对)上对主流 MDE 基础模型与本文 GSD 方法展开基准评估(表 1)。指标越低越优。

模型 骨干类型 \(d_{\text{cluster}} \downarrow\) \(d_{\text{avg}} \downarrow\) DCS \(\downarrow\) \(D_{\text{cluster}} \downarrow\) \(D_{\text{avg}} \downarrow\) CCS \(\downarrow\)
DepthPro (ICLR'25) ViT Multi-scale 701.1 726.2 1427.3 \(2.294 \times 10^{-3}\) \(2.402 \times 10^{-3}\) \(4.696 \times 10^{-3}\)
Marigold (CVPR'24) 扩散模型 (LDM) 317.8 331.4 649.1 \(6.680 \times 10^{-4}\) \(9.290 \times 10^{-4}\) \(1.597 \times 10^{-3}\)
DepthFM (AAAI'25) 流匹配 (Flow Matching) 1020.0 1063.0 2083.0 \(4.914 \times 10^{-3}\) \(5.215 \times 10^{-3}\) \(1.013 \times 10^{-2}\)
ZoeDepth (arXiv'23) 相对+绝对混合 291.5 297.8 589.3 \(7.486 \times 10^{-4}\) \(7.560 \times 10^{-4}\) \(1.505 \times 10^{-3}\)
MiDaS (TPAMI'22) 卷积/ViT 混合 330.2 340.0 670.2 \(4.120 \times 10^{-4}\) \(5.090 \times 10^{-4}\) \(9.220 \times 10^{-4}\)
DAv2-S (NeurIPS'24) ViT-Small 495.9 511.2 1007.1 \(7.210 \times 10^{-4}\) \(7.900 \times 10^{-4}\) \(1.512 \times 10^{-3}\)
DAv2-B (NeurIPS'24) ViT-Base 431.7 449.3 881.0 \(6.320 \times 10^{-4}\) \(7.270 \times 10^{-4}\) \(1.359 \times 10^{-3}\)
DAv2-L (教师基线) ViT-Large 488.8 505.8 994.6 \(6.840 \times 10^{-4}\) \(7.820 \times 10^{-4}\) \(1.466 \times 10^{-3}\)
Ours (GSD) ViT-Large + LoRA 28.55 30.09 58.64 \(9.174 \times 10^{-5}\) \(9.894 \times 10^{-5}\) \(1.907 \times 10^{-4}\)
相对基线提升 \(\Delta\) - -94.16% -94.05% -94.10% -86.59% -87.35% -86.99%

同时,在包含真实视错觉的第三方独立基准 3D-Visual-Illusion (3DVI, NeurIPS'25) 测试集上评估零样本泛化能力。在单目/单视点输入赛道中,相较于 DAv2-Metric 的高误差(AbsRel 0.52,EPE 16.24,\(\delta_1\) 48.75%),本文方法达到了 Disparity 空间 EPE 1.75,bad2 26.67%,Depth 空间 AbsRel 0.03,RMSE 0.06,\(\delta_1\) 阈值准确率高达 99.50%,性能甚至比肩或超越部分双目立体匹配模型。

消融实验

为了严格分析框架中各模块的有效性与不可替代性,在 3D-Mirage、标准室内场景 NYU-v2、自动驾驶室外场景 KITTI 15 以及成对深度准确率基准 DA-2K 上进行损失项及不同微调策略消融(表 4 与表 5 整合)。

实验配置 / 策略 3D-Mirage DCS \(\downarrow\) 3D-Mirage CCS \(\downarrow\) NYU-v2 AbsRel \(\downarrow\) KITTI 15 AbsRel \(\downarrow\) DA-2K Pairwise Acc \(\uparrow\) 说明
Ours (完整 GSD 框架) 58.64 \(1.907 \times 10^{-4}\) 0.1597 0.3424 96.08% 最佳权衡:兼顾幻觉抑制与泛化
去掉重编辑损失 (w/o \(\mathcal{L}_{\text{HKR}}\)) 988.60 \(1.470 \times 10^{-3}\) 0.1623 0.3409 97.05% 幻觉无法消除,DCS残余高达988.6
去掉保留损失 (w/o \(\mathcal{L}_{\text{NKP}}\)) 42.83 \(1.410 \times 10^{-4}\) 0.1533 0.3510 94.00% 过度展平,边界及背景真实几何受损
简化直接 L1 平面拟合 (Simple L1) 59.68 \(2.118 \times 10^{-4}\) 0.5299 (RMSE) 7.10 (RMSE) 93.04% 强制单平面约束,欠拟合多表面折角
朴素全编码器微调 (Ftune Enc.) 27.85 \(9.389 \times 10^{-5}\) 0.9014 (RMSE) 8.54 (RMSE) 58.51% 严重灾难性遗忘,DA-2K精度暴跌至58%
仅微调解码器 (Ftune Dec.) 70.26 \(1.986 \times 10^{-4}\) 0.6487 (RMSE) 6.93 (RMSE) 87.48% 解码器参数无法有效扭转高维语义先验

关键发现

  • HKR 与 NKP 的动态博弈:去除去伪重编辑损失 \(\mathcal{L}_{\text{HKR}}\) 时,模型深度估计指标正常但面对幻觉完全不设防(DCS 仍高达 988.60);去掉知识保留损失 \(\mathcal{L}_{\text{NKP}}\) 时,DCS 虽然略有降低(42.83),但平整化惩罚渗透至非错觉背景,破坏了真实边界与尺度,导致 DA-2K 精度下滑。
  • 全微调导致灾难性崩溃:直接全量微调编码器(Ftune Enc.)使得 DA-2K 成对准确率从 96.08% 断崖式跌落至 58.51%,DIW WHDR 恶化至 32.15%,表明通过少量参数的低秩子空间(LoRA 仅约 4M 参数)介入是限制破坏性修改、阻断灾难性遗忘的必要手段。
  • 跨架构普适迁移:GSD 机制不依赖特定架构。在以 ZoeDepth(相对+绝对混合模型)与 Marigold(潜在扩散深度模型)为基准时,GSD 适配分别将 ZoeDepth 的 DCS 从 589.27 压缩至 335.12,将 Marigold 的 DCS 降低 44%、CCS 降低 40%,且未损耗普通街景与室内深度的预测保真度。

亮点与洞察

  • 提出针对单目基础模型 3D 幻觉的全新诊断视角:指出了当前 MDE 大模型“用语义先验压倒几何真实”的根本缺陷,揭示了视场限制与上下文缺失是激化几何虚构的关键触发因子。
  • 完全解耦真值依赖的二阶幅度评估体系:构建的 DCS 和 CCS 指标摆脱了对昂贵且难以获取的稠密 3D 点云真值的依赖,利用二阶差分对高曲率异常的极高敏锐度,为实际部署系统提供了无监督的几何安全体检工具。
  • 自适应多表面假设与局部环门控:避免将错觉 ROI 生硬拉直为单一轴对齐平面,通过从教师网络邻域环自适应拟合混合多平面,实现了对折角、多承载面乃至微曲表面的优雅解算。

局限与展望

  • 错觉类型的覆盖范围尚局限于低曲率纹理载体:基准目前主要集中于地画、壁画等低曲率承载面的纹理欺骗,尚未完全涵盖无纹理强反光(镜面、玻璃)、严重阴影遮蔽、雨雪极端恶劣天气等造成的复杂光学歧义。
  • 未覆盖真实突发道路物理陷阱的负向对比:当前测试侧重于“平坦地面被虚构为障碍物”的正向幻觉,未来需加入坑洼(Potholes)、减速带、路缘石等真实负高程障碍的保真度评估,确保去伪算法不会反向抹除细小安全威胁。

相关工作与启发

  • vs. Yao et al. (3DVI, NeurIPS 2025):3DVI 依赖外部大型多模态语言模型(VLM)协调双目视差与单目深度来消除视觉错觉,引入了极大的推理延迟与算力开销;本文深入单目模型内在缺陷,通过仅 1.2% 的轻量 LoRA 参数实现单目纯视觉的高效自矫正,推理零额外计算与内存负担。
  • vs. 常规对抗防御与全量微调 (Fine-tuning):传统防御多局限于特定对抗扰动模式且泛化度低,直接微调则不可避免地引发基础模型一般几何能力的灾难性遗忘;本文借助冻结教师网络的自蒸馏机制与环形过渡带正则,实现了局部去噪与全局保真的严密解耦。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次系统定义、度量并针对性解决了单目深度大模型的 3D Mirage 幻觉与上下文脆弱性问题]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖自建 3D-Mirage 基准、3DVI 零样本迁移、NYUv2/KITTI 保留评测及跨 Diffusion/Transformer 架构验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严谨闭环,从理论度量、架构图示到损失项数学推导层层推进]
  • 价值: ⭐⭐⭐⭐⭐ [直击自动驾驶与机器人三维感知的隐蔽安全隐患,为视觉基础模型结构鲁棒性提供了标准与解决范式]