跳转至

Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth Estimation

会议: ECCV 2026
论文: ECCV 原文
代码: 待确认
领域: 3D 视觉
关键词: 极线几何, 知识蒸馏, 单目深度估计, 立体视觉, 尺度模糊

一句话总结

针对多视角基础模型在单目推理时跨视角注意力退化导致尺度先验丢失的问题,提出 EpiDistill 框架,通过深度引导极线注意力与校正立体 Token 将多视角极线几何与度量尺度先验显式蒸馏到单视角 Transformer 中,大幅提升零样本绝对尺度估计能力。

研究背景与动机

单目深度基础模型凭借在大规模异构数据集上的预训练,展现出了卓越的相对几何泛化能力。然而,在开放多变场景中进行精准的度量尺度估计仍是业界的根本难题。单张图像固有的投影尺度多义性使得网络往往能精确重建相对起伏,却输出偏差严重的绝对距离。早期方法依赖推理时显式输入的相机内参来解耦焦距与深度,近期模型则尝试在单图特征中隐式联合回归内参与度量深度,但在复杂外景和极端视场变化下,仅靠单帧 2D 外观线索仍极易产生不可控的尺度漂移。

与此同时,近期兴起的多视角几何基础模型通过多帧跨视角全局注意力直接捕捉几何对应关系,在单次前向推理中即可构建尺度一致的三维点云。然而,这类多视角模型在面临单视角推理输入时遭遇了致命的「架构退化」:由于缺失辅助视角,原本建模立体几何关系的跨视图全局注意力直接退化成了普通的单帧自注意力。这种训练与推理阶段的几何结构不匹配,导致模型在多视角序列上学到的尺度感知先验瞬间失效,顺序逐帧累积点云时产生严重的尺度错位与结构塌陷。

面对单视角先验匮乏与多视角推理退化的核心矛盾,本文选择以蒸馏作为切入点:既然多视角的几何对应本质上遵循极线约束,能否构造虚拟的立体基线,让单目网络在推理时依然保留完整的极线注意力通路?核心 idea:提出几何蒸馏框架 EpiDistill,利用真实深度生成的空间高斯偏置构建深度引导极线注意力,并引入可学习的校正立体 Token 作为恒定几何锚点,在单帧输入下模拟水平极线搜索空间,将多视角多视几何尺度先验完整迁移至单目模型。

方法详解

整体框架

EpiDistill 旨在将多视角教师特征中的极线对应机制与度量尺度先验迁移至任意冻结主干的 ViT 单目深度基础模型(如 UniDepthV2 和 DepthPro)。在训练阶段,输入包含参考帧与重叠源帧的多视角三元组,多视角分支利用深度引导极线注意力显式匹配三维空间对应并建立绝对尺度;单视角分支则使用单张参考图,并引入一组可学习的校正立体 Token 代替缺失的源图。通过跨注意力将参考特征注入该 Token 形成引导表示后,二者在共享的极线注意力层中沿水平极线交互,并接受多视角特征与注意力的双重蒸馏约束。最后,模型采用结构解耦设计,分别预测密集结构残差、全局尺度因子和相机内参残差。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入图像<br/>多视角训练组 / 单视角参考图"] --> Ext["冻结 ViT 编码器<br/>提取空间 Token + 尺度 Token"]
    Ext --> DGEA["深度引导极线注意力<br/>真值深度投影 + 高斯空间偏置生成目标注意力"]
    Ext --> RST["极线校正立体 Token<br/>模拟立体对水平扫描线 + 跨视角特征蒸馏"]
    DGEA -.->|知识蒸馏监督| RST
    RST --> Dec["解耦预测头<br/>DPT预测结构残差 + MLP预测全局尺度与焦距"]
    Dec --> Out["最终输出<br/>尺度对齐度量深度图 + 校正相机焦距"]

关键设计

1. 深度引导极线注意力:将真实几何投影转化为精确极线软约束 标准多视角注意力往往在无约束的全图范围内计算相关性,易受弱纹理或重复图案干扰,且无法提供显式的几何监督。为让网络精准聚焦于物理空间中的真实对应点,本文构建了深度引导极线注意力。对于参考图上的任意查询像素,利用两相机间的相对位姿 \([R|t]\) 与内参矩阵计算基础矩阵 \(F\),并在源图上采样出候选极线段。在此基础上,利用参考像素的真实深度将其直接反投影至三维世界,再投影回源图平面获得理论上的精确匹配目标点 \(p^*_{src}\)

为了在注意力分布中强化该几何对应,本文设计了一个以匹配目标点为中心的高斯空间偏置 \(B_{ij} = -\gamma \|p_{src,ij} - p^*_{src,i}\|\)(实验设定 \(\gamma=50\)),将其叠加到原始查询-键点积 Logits 上,经 Softmax 归一化生成深度引导的教师注意力分布 \(A^*\)。随后切断 \(A^*\) 的梯度,通过交叉熵损失显式监督无引导的多视角预测注意力 \(\hat{A}\)

\[A^*_{ij} = \text{Softmax}_j\left(\frac{q_{ref,i}^\top k_{src,j}}{\sqrt{d}} + B_{ij}\right), \quad \mathcal{L}_{attn} = -\frac{1}{N}\sum_{i=1}^N \sum_{j=1}^M A^*_{ij} \log(\hat{A}_{ij})\]

这种设计迫使多视角注意力机制在极线采样线上严格对齐物理深度对应的几何分布,为后续向单目模型的知识蒸馏提供了高质量、无几何幻觉的监督信号。

2. 极线校正立体 Token:单目推理下的无源极线几何锚点 当多视角基础模型退化至单图输入时,由于缺乏配对的源视角特征,跨视图跨注意力层无法执行,退化为普通自注意力导致尺度感知先验荡然无存。针对这一结构断裂,本文借鉴了立体校正几何的物理特性:在理想校正立体对中,两相机光轴平行且仅存在水平基线偏移 \(t = [b, 0, 0]^\top\)。此时基础矩阵呈现为特殊的对角斜对称阵,参考像素 \([x_0, y_0, 1]^\top\) 在源视角的对应极线被严格限定在同名水平扫描线 \(y = y_0\) 上,且该水平约束完全独立于未知基线长度 \(b\)

基于这一优良性质,本文在单视角模型中引入可学习的校正立体 Token 网格 \(T_{rst} \in \mathbb{R}^{H \times W \times d}\)。在单目推理时,\(T_{rst}\) 首先通过一层交叉注意力以参考特征为查询键值,注入当前场景的语义与全局布局上下文,演进为参考引导 Token \(T_{rst-ref}\);随后,参考特征与 \(T_{rst-ref}\) 送入共享的极线注意力层,严格在同一行水平像素间执行相关性交互。\(T_{rst}\) 充当了一个结构化的虚拟几何锚点,不仅保持了多视角跨注意力通路的完整连贯,而且通过将二维搜索空间降维至一维水平线,使得单目模型能够稳定复现双目立体视差的几何推导过程。

3. 解耦结构与度量尺度的双重预测头:保留相对表征并消除尺度纠缠 直接从单图回归绝对米制深度极易破坏预训练模型原先优秀的相对深度辨识度,且导致物体的局部凹凸几何与场景的整体尺度因变量耦合而相互掣肘。本文将最终度量深度的生成显式解耦为无尺度的基准几何结构、局部几何偏移残差与全局缩放因子。首先将主干预训练输出的基础深度通过均值归一化转换为尺度不变的基准结构图 \(D_{base}\)

随后,极线注意力细化后的密集空间 Token 输入轻量级 DPT 解码头,回归用于修补复杂边缘与遮挡关系的结构微调残差 \(\Delta d\);同时,尺度 Token 经多视角蒸馏层富集了几何先验后,送入轻量 MLP 尺度头回归全局米制缩放系数 \(\hat{s}\)。最终的度量深度表达为两者的显式组合:

\[\mathbf{D}_{\text{adj}} = \hat{s} \cdot (\mathbf{D}_{\text{base}} + \Delta d)\]

此外,模型还配备了一个辅助相机头,直接从尺度 Token 预测归一化的焦距残差 \((\delta_x, \delta_y)\),从而动态修正相机等效内参 \(f_{adj} = f_{base} + (\delta_x W, \delta_y H)\),彻底解除了相机焦距与场景纵深之间的几何模糊。

损失函数 / 训练策略

模型采用端到端多任务联合监督策略,总损失由五项加权组成:

\[\mathcal{L}_{total} = \mathcal{L}_{rel} + \mathcal{L}_{scale} + \lambda_{ray}\mathcal{L}_{ray} + \lambda_{distill}\mathcal{L}_{distill} + \lambda_{attn}\mathcal{L}_{attn}\]

其中权重设定为 \(\lambda_{ray}=0.3, \lambda_{distill}=1.0, \lambda_{attn}=0.1\)。 - 相对深度损失 \(\mathcal{L}_{rel}\):包含对均值归一化后的相对预测 \(\tilde{D}_{rel} = D_{base} + \Delta d\) 与归一化真值在对数空间下的 L1 误差,以及基于 Sobel 滤波梯度的边缘感知损失 \(\mathcal{L}_{edge}\),确保几何边界锐利。 - 尺度损失 \(\mathcal{L}_{scale}\):在对数空间内计算预测标量尺度 \(\hat{s}\) 与有效区域真值深度均值之间的 L1 距离。 - 光线/内参损失 \(\mathcal{L}_{ray}\):约束预测焦距偏移量 \((\delta_x, \delta_y)\) 逼近真实内参。 - 特征蒸馏损失 \(\mathcal{L}_{distill}\):在极线注意力所确立的有效掩码区域内,结合余弦相似度方向对齐与特征范数惩罚,强制单视角 Token \(T_s\) 与多视角聚合特征 \(T_m\) 紧密一致。 - 注意力损失 \(\mathcal{L}_{attn}\):如前式所述,通过交叉熵对齐预测注意力图与高斯偏置目标图。

模型在涵盖室内外与合成场景的 7 个大规模数据集(Hypersim, Cityscapes, Eden, ScanNet, ScanNet++, Waymo, nuScenes)上联合训练,要求视角对之间至少有 20% 的视觉重叠,使用 8 张 NVIDIA H100 训练 100K 迭代。

实验关键数据

主实验

在代表极端尺度多义性与长尾视距挑战的室外与混合评测基准上,EpiDistill 均显著提升了基线单目模型的零样本度量精度(Tab. 1)。UniDepthV2 结合 EpiDistill 后综合排名位列第 1(3.1),不仅超越了原始基准,甚至超越了需在推理时依赖真实相机内参的 Metric3DV2 与 DepthAnything3。

数据集 指标 UniDepthV2 UniDepthV2+EpiDistill DepthPro DepthPro+EpiDistill Metric3DV2 (带GT内参)
KITTI A.Rel ↓ / \(\delta_1\) 0.080 / 0.945 0.074 / 0.951 0.141 / 0.838 0.123 / 0.875 0.054 / 0.975
DDAD A.Rel ↓ / \(\delta_1\) 0.144 / 0.859 0.132 / 0.854 0.391 / 0.233 0.348 / 0.353 0.122 / 0.858
DIODE A.Rel ↓ / \(\delta_1\) 0.716 / 0.549 0.396 / 0.641 0.386 / 0.419 0.357 / 0.462 0.536 / 0.077
ETH3D A.Rel ↓ / \(\delta_1\) 0.176 / 0.752 0.137 / 0.779 0.355 / 0.433 0.354 / 0.393 0.175 / 0.724
综合排名 Rank ↓ (共9个模型) 4.7 3.1 8.8 6.4 4.5

在受限室内基准(NYU, Bonn, Booster, IBims-1)上,EpiDistill 同样展现了稳健的跨域稳定性。在镜面与透明物体密集的 Booster 数据集上,UniDepthV2+EpiDistill 的 A.Rel 从 0.179 进一步下降至 0.171,平均排名达 2.4,与依赖真实内参的 DepthAnything3 相当。

消融实验

在 KITTI 与 ETH3D 的跨域平均指标上,以 UniDepthV2 为基线,逐步验证各模块的贡献(Tab. 4,推理显存与延迟测定于单张 RTX A6000 GPU):

配置 DGEA RST 显存占用 推理延迟 A.Rel ↓ RMS ↓ \(\delta_1\) 说明
Fine-tuned UniDepthV2 - - 57.87M 131ms 0.124 2.721 0.840 直接微调解码器作为对照基线
+ Global Attention - - 154.65M 180ms 0.119 2.649 0.858 传统多视角全局注意力,单目时退化为自注意力
+ DGEA (仅极线注意力) - 155.65M 190ms 0.113 2.419 0.866 仅用真实几何施加极线偏置约束
EpiDistill 完整框架 180.98M 218ms 0.101 2.206 0.870 极线注意力配合校正立体Token,RMSE降16.7%
多视角模型上限 - - 180.98M 396ms 0.100 2.102 0.880 输入三视角前向推理的理论精度上限

关键发现

  • 校正立体 Token 彻底打破了退化壁垒:单独引入深度引导极线注意力(DGEA)由于在单目推理时缺少成对特征,单视角下退化为自注意力形式,指标提升有限;而一旦配合 RST,A.Rel 从 0.113 跃升至 0.101,RMSE 相对基线下降 16.7%,证明可学习的几何锚点成功承接了多视角所学到的跨视图极线交互路径。
  • 单视角推理无限逼近多视角精度上限:完整 EpiDistill 在单目输入下的 A.Rel(0.101)与三视角联合前向的多视角上限(0.100)几乎一致,而推理延迟从 396ms 缩短至 218ms(降低近 45%),验证了知识蒸馏的高效性。
  • 在动态尺度扰动(Dolly Zoom)下具备极高解耦鲁棒性:在 DepthPerturb 评测中,镜头平移与焦距联动导致目标视面积不变,传统基线的内参和尺度全盘失效;UniDepthV2 结合 EpiDistill 后,A.Rel 从 0.241 剧降至 0.167,内参预测轨迹的皮尔逊线性相关系数 \(|PCorr|\) 提升至 0.965,表明模型真正习得了焦距与米制深度的独立感知能力。

亮点与洞察

  • 校正立体几何的巧妙降维映射:将多视几何中最纯粹的基线无关性质(校正立体对的极线方程退化为同一水平行 \(y = y_0\))抽象为一组可学习的 Token 网格,在不增加额外物理相机的前提下为单图推理提供了严格的空间对齐线索。
  • 几何偏置注入规避了软注意力幻觉:直接用三维投影真值构建高斯距离偏置调制交叉注意力 logits,既保留了注意力分布的连续梯度流动,又赋予了网络强烈的物理几何归纳偏置。
  • 模型无关且开箱即用的即插即用特性:无论是面向超分辨率细节的 DepthPro,还是主打度量泛化的 UniDepthV2,无需重新训练繁重的主干 ViT,仅通过轻量解码头和极线蒸馏层即可实现两位数百分比的误差降幅。

局限与展望

  • 计算与内存开销有所增加:引入 4 层极线注意力与 \(37 \times 37\) 的立体 Token 网格使得单目推理显存从 57.87M 增至 180.98M,推理时间由 131ms 上升至 218ms,对极端端侧低功耗部署提出了新的轻量化挑战。
  • 严重依赖训练集精确的 6-DoF 位姿与高质量深度:若训练数据中相机位姿漂移或深度真值过稀疏,反投影点定位偏差会导致空间高斯偏置产生错误引导,进而污染蒸馏过程。
  • 未来方向:可进一步探索自适应稀疏采样的立体 Token 机制,以及将极线蒸馏扩展至全景/鱼眼镜头等非针孔畸变相机的度量估计。

相关工作与启发

  • vs DepthAnything3 / VGGT: 后者依赖多帧图像通过全局跨注意力建立度量一致性,但在单图输入下遭遇注意机制塌陷;本文通过 RST 填补单图输入的视角空缺,在纯单目推理下完整继承了多视角模型的度量鲁棒性。
  • vs Metric3DV2: Metric3DV2 在推理时强依赖准确的相机内参真值作为尺度缩放的先验;本文通过联合训练辅助相机头与尺度蒸馏,在无内参纯 RGB 输入下在多个数据集上实现了反超。
  • vs UniDepthV2 / DepthPro: 原模型直接在单目特征上回归度量深度,在分布外开阔场景极易发生尺度漂移;本文作为即插即用增强模块,在其冻结表征上解耦微调,显著补齐了长尾度量盲区。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用校正立体几何的水平不变性设计可学习 Token,打破单双目特征断层。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 7 大训练域、8 大跨域测试集及 Dolly Zoom 尺度扰动实验,论据坚实。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰,问题切入点直击多视角模型单视角退化的核心痛点。
  • 价值: ⭐⭐⭐⭐⭐ 为单目度量深度估计与多视角基础模型的融合提供了极具启发性的蒸馏新范式。