Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 单目深度估计, 超构透镜, 深度基座模型, 计算光学, 偏振多路复用
一句话总结¶
通过定制可见光双折射超构透镜在单次单目曝光中将物理度量深度编码为正交偏振螺旋点扩散函数(PSF)的旋转位置偏移,并采用免网络修改的伪 RGB 输入适配方案微调单目深度基座模型(Depth Anything V2),实现了无需主动激光雷达的高精度度量单目深度估计。
研究背景与动机¶
单目深度估计近年来依靠深度基座模型(Depth Foundation Models, DFMs)取得了突破性进展。得益于在海量自然图像上的大规模预训练,模型学到了极强的单目相对几何先验与边缘纹理表征。然而,纯单目 RGB 成像在物理成像机理上缺乏绝对尺度的深度线索,导致单视角逆问题本质上严重欠定,模型输出不可避免地存在全局尺度与偏移歧义,无法直接可靠应用于机器人导航、三维重建或 AR/VR 等强依赖真实绝对度量尺度的任务。
为了打破这种尺度歧义,现有主流路线主要依赖外加主动传感器(如配置单点/稀疏激光雷达进行提示或深度补全),或者借助散焦深度(Depth-from-Defocus, DfD)进行推理期密集优化。然而,引入主动激光雷达增加了系统的体积、功耗与机械复杂度,破坏了轻量化单目相机的紧凑性;而基于传统透镜散焦的测试期迭代优化极其耗时(单张图往往需要数分钟计算),且常规对称散焦模糊会抹除高频细节,难以与基座模型的语义先验深度融合。
本文的切入点在于利用纳米光子学领域的超构透镜(Metalens)作为纯被动紧凑型波前调制器。通过设计超薄平面的各向异性纳米柱结构,在单次曝光下将深度信息直接物理调制进两路正交偏振光的波前旋转中。核心 idea:利用双折射超构透镜在单目单次曝光中生成深度相关的正交偏振旋转 PSF 偏移,结合即插即用的三通道输入适配策略直接微调单目深度基座模型,并在闭环物理仿真器中引入遮挡/去遮挡感知模型以消除仿真与真实之间的域鸿沟。
方法详解¶
整体框架¶
本文提出的物理落地单目深度估计系统包含三个核心要素:光学前端的双折射超构透镜、连接物理测量与深度基座模型的三通道输入适配层、以及用于大规模合成训练数据且弥合虚实差距的去遮挡感知光学正向仿真器。
系统整体工作流如下:场景入射光经过直径 3 mm 的双折射二氧化钛超构透镜,被分离为具有相反横向色散偏折与深度旋转 PSF 的 x 偏振与 y 偏振两束波前,投影到单色 CMOS 传感器的上下两个半区;采集到的双偏振灰度图经过通道自适应融合映射为伪 RGB 表征,输入预训练的 Depth Anything V2 骨干网络(DPT 架构)直接输出密集绝对度量深度。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单目入射光波前"] --> B["双折射超构透镜偏振编码<br/>700nm TiO2纳米柱调制正交波前"]
B --> C["单传感器单次曝光成像<br/>x/y正交偏振图对Ix与Iy"]
C --> D["输入适配与表征对齐<br/>(Ix, Iy, (Ix+Iy)/2)伪RGB"]
D --> E["深度基座模型密集预测<br/>Depth Anything V2 (DPT)微调"]
E --> F["绝对度量深度图输出"]
关键设计¶
1. 双折射超构透镜与偏振多路复用旋转 PSF:在无视差单目视角下将深度编码为旋转位移
针对传统单目光学无法提供单向单义度量线索且普通散焦模糊破坏高频细节的问题,本文设计并微纳加工了一块直径 3 mm、工作波长为 590 nm 的可见光双折射超构透镜。该透镜由高度 700 nm、间距 400 nm 的十字形各向异性 \(TiO_2\) 纳米柱阵列构成,可在亚波长尺度上独立调控 x 与 y 偏振方向的透射相位: $\(\psi_k = \psi_{f,k} + \psi_{r,k}, \quad k \in \{x, y\}\)$ 其中,聚焦相位 \(\psi_{f,k}\) 为两个正交偏振引入相反方向的垂直偏折分量,将两路波前无视差、同光路地聚焦在单色传感器的不同区域;旋转相位 \(\psi_{r,k}\) 则通过将光瞳划分为 \(N=8\) 个同心菲涅尔环形拓扑电荷区,使得点扩散函数(PSF)随着物距深度 \(z\) 绕光轴发生确定性旋转。由于 x 和 y 偏振的相位图案在空间上相差 180°,因此两幅偏振图像对中的对应共轭 PSF 产生与绝对物理深度单调对应的方向相反的微小像素偏移向量,实现了单镜头、单视角的几何视差级绝对深度编码。
2. 偏振观测的免结构修改输入适配:最大化无损复用视觉基座模型的自然图像先验
传统计算摄像方法通常为多通道光学测量设计复杂的多分支网络或从头训练 U-Net,这不仅丢失了通用视觉基座模型(如 ViT / DPT)在大规模真实图像上学到的丰富边缘、纹理与语义先验,而且由于物理实验数据难以大规模标注,容易引发过拟合。本文提出极简且对称的输入空间映射策略,将传感器捕获的水平与垂直偏振图像 \((I_x, I_y)\) 映射为伪三通道输入: $\((I_x, I_y) \Rightarrow \left(I_x, \; I_y, \; \frac{I_x + I_y}{2}\right)\)$ 该设计无需改变单目深度基座模型(Depth Anything V2)的第一层卷积/Patch 嵌入维度或添加任何解码侧融合旁路分支。平均通道兼具去偏振总光强图像的视觉语义,而 \(I_x\) 与 \(I_y\) 两通道则完整注入了包含相反 PSF 旋转位移的物理度量差分线索。中心化核对齐(CKA)表征分析证实,该适配形式在 ViT 深层与纯 RGB 输入的特征相似度超过 0.95,使基座模型能在零样本或微量微调下无缝解析物理波前线索。
3. 去遮挡感知的光学正向仿真与偏振数据增强:消除非对称 PSF 在深度边缘的虚实鸿沟
由于在物理真实世界采集密集像素级度量深度真值极其困难,模型训练高度依赖基于 RGB-D 数据集合成偏振图像对。然而,传统的切片线性卷积模型在处理非对称旋转 PSF 时会在深度跳变边缘产生严重的明亮重叠边缘与深色空洞伪影(去遮挡缝隙),陡峭表面还会因离散欠采样出现混叠条纹。为此,本文设计了去遮挡感知的正向仿真流水线:首先通过高斯平滑切片遮罩并与 PSF 卷积生成切片光强与不透明度图;显式检测深度不连续边缘,通过边缘外推与背景补全填补去遮挡盲区,并采用 Alpha 修正归一化消除欠采样条纹。在此基础上,流水线增加了偏振感知数据增强,模拟实际装配与环境中的全局/局部光照偏振失衡、传感器泊松-高斯噪声及制造像差引起的微小模糊,确保模型对真实物理缺陷具有强鲁棒性。
损失函数 / 训练策略¶
训练基于 Hypersim 合成数据集,使用本文正向仿真器将 RGB-D 合成为偏振图像对,并将深度范围线性映射至 0.2 m - 1.2 m。损失函数采用 \(L_1\) 深度误差与多尺度深度梯度损失的线性加权: $\(\mathcal{L} = \mathcal{L}_1 + 0.5 \mathcal{L}_{\text{grad}}\)$ 为了抹平合成域与真实物理域在材质反射率上的残余分布偏移,训练时以 0.05 的采样概率微量混入 5 帧具有手工平面分段标定深度的真实采集样本(Few-shot Real Adaptation)。优化器采用 AdamW,基础学习率为 \(4 \times 10^{-6}\),总计迭代 80k 步。
实验关键数据¶
主实验¶
在标准真实室内基准 NYU Depth V2 和强调无语义几何物理推断的合成基准 MIT-CGH-4k 上,本方法与当前最先进的单目度量深度估计模型(经后对齐处理)、深度基座模型以及外加 LiDAR 的双模态模型 PromptDA 进行了对比(见原论文 Table 1):
| 方法 | 额外输入 / 微调 | NYU MAE↓ | NYU RMSE↓ | NYU AbsRel↓ | NYU \(\delta_{0.5}\)↑ | MIT-CGH MAE↓ | MIT-CGH RMSE↓ | MIT-CGH AbsRel↓ | MIT-CGH \(\delta_{0.5}\)↑ |
|---|---|---|---|---|---|---|---|---|---|
| Ours-Large | 无 LiDAR (被动单目) | 0.023 | 0.040 | 0.039 | 0.951 | 0.067 | 0.126 | 0.105 | 0.764 |
| Ours-Base | 无 LiDAR (被动单目) | 0.022 | 0.039 | 0.036 | 0.957 | 0.068 | 0.129 | 0.102 | 0.772 |
| Ours-Small | 无 LiDAR (被动单目) | 0.025 | 0.043 | 0.043 | 0.936 | 0.076 | 0.137 | 0.125 | 0.724 |
| PromptDA | w/ 模拟 LiDAR (双传感器) | 0.021 | 0.042 | 0.036 | 0.955 | 0.058 | 0.113 | 0.099 | 0.802 |
| MoGe v2 | 纯单目 (尺度位移对齐) | 0.034 | 0.058 | 0.063 | 0.867 | 0.133 | 0.169 | 0.272 | 0.346 |
| UniDepth v2 | 纯单目 (尺度位移对齐) | 0.034 | 0.059 | 0.063 | 0.865 | 0.127 | 0.164 | 0.259 | 0.360 |
| DepthAny. v3 | 纯单目 (尺度位移对齐) | 0.037 | 0.062 | 0.069 | 0.846 | 0.134 | 0.172 | 0.276 | 0.349 |
| DepthAny. v2 | 纯单目 (尺度位移对齐) | 0.043 | 0.067 | 0.079 | 0.805 | 0.151 | 0.190 | 0.308 | 0.300 |
| DepthAny. v2* | 同数据集微调无物理编码 | 0.128 | 0.148 | 0.267 | 0.341 | 0.301 | 0.371 | 0.410 | 0.100 |
在实机搭建的 42 个物理真实测试场景(原论文 Table 2,覆盖 25 种不同物体)中,本文方案全面超越所有无激光雷达基线:Ours-Base 取得 MAE 0.032 m、RMSE 0.089 m、AbsRel 0.055、\(\delta_{0.5}\) 0.895,性能极度逼近配备主动激光雷达的 PromptDA(MAE 0.030 m、RMSE 0.086 m)。
消融实验¶
为明确性能提升的物理光学与先验来源,原论文在 FlyingThings3D 数据集上对超构透镜设计(Meta)、骨干网络(ViT vs U-Net)及预训练先验(Prior)进行了正交消融(见原论文 Table 4):
| 配置编号 | 超构透镜 (Meta) | ViT 架构 | 预训练先验 (Prior) | MAE↓ | RMSE↓ | \(\log_{10}\)↓ | \(\delta_1\)↑ |
|---|---|---|---|---|---|---|---|
| 1 (Ours-Small) | ✓ | ✓ | ✓ | 0.022 | 0.132 | 0.005 | 0.995 |
| 2 (DeepDfD光学+基座) | ✗ | ✓ | ✓ | 0.035 | 0.133 | 0.009 | 0.994 |
| 3 (无先验 ViT) | ✓ | ✓ | ✗ | 0.061 | 0.268 | 0.014 | 0.984 |
| 4 (无先验 U-Net) | ✓ | ✗ | ✗ | 0.063 | 0.254 | 0.014 | 0.983 |
| 5 (DeepDfD全套从头训) | ✗ | ✗ | ✗ | 0.089 | 0.191 | 0.034 | 0.941 |
同时,在输入适配方式的消融中(原论文 Table 5),本文的三通道伪 RGB 适配策略取得了 0.032 m MAE 与 0.895 \(\delta_{0.5}\);若放弃输入适配转而在解码器侧添加显式融合模块(类比 PromptDA),误差恶化至 MAE 0.063 m、\(\delta_{0.5}\) 0.727,证明了直接重用第一层网络权重的优越性。而在虚实迁移消融中(原论文 Table 6),去掉去遮挡处理会使真实场景下的 MAE 从 0.032 m 恶化至 0.046 m,在纯合成训练设置下更从 0.107 m 剧烈恶化至 0.121 m(\(\delta_{0.5}\) 从 0.546 骤降至 0.479)。
关键发现¶
- 预训练先验是核心性能引擎:消融表明,丢弃预训练先验会导致 MAE 误差从 0.022 m 激增至 0.061 m(恶化近 3 倍);而在同等预训练先验下,超构透镜的旋转 PSF 物理编码相较于传统散焦光学(DeepDfD)使 MAE 从 0.035 m 进一步压降至 0.022 m。
- 免修改输入适配优于复杂旁路融合:通过将正交偏振对重构为 \((I_x, I_y, (I_x+I_y)/2)\),网络能够在完全不破坏预训练 ViT 初始卷积核权重的情况下同时提取语义与视差偏移特征,效果显著优于额外引入解码器侧特征融合旁路。
- 偏振光强失衡增强对零样本虚实迁移至关重要:在合成数据训练中,去除偏振光强失衡数据增强会导致指标全面大幅回落,证明迫使神经网络关注波前位置相对偏移而非绝对光强差异是实现跨域泛化的关键物理抓手。
亮点与洞察¶
- 纳米光子学与深度基座模型的正交协同:巧妙利用可见光波段的双折射各向异性纳米柱,在单一 3 mm 光学元件上同时实现了聚焦、垂直空间分束与深度敏感的单螺旋 PSF 旋转,以极低光学开销为单目视觉赋予了原本缺失的绝对尺度物理基底。
- 输入层低成本表征对齐:无需为偏振测量定制复杂的新网络架构,而是通过构建伪三通道输入保留去偏振强度平均图与正交偏振图,直接继承了 Depth Anything V2 的海量视觉先验,CKA 分析在数学上揭示了这种通道映射未产生明显的表征漂移。
- 严格建模非对称 PSF 的去遮挡前向渲染:敏锐指出了传统散焦深度(DfD)仅考虑对称模糊遮挡的局限,建立了针对非对称旋转 PSF 在深度阶跃边缘处“重叠过亮、散开致盲”现象的外推补全机制,显著压降了 Sim-to-Real 的建模误差。
局限与展望¶
- 通量与光谱带宽瓶颈:当前原型透镜口径仅为 3 mm (\(f/11.3\)),且依赖 590 nm 处半高宽仅 10 nm 的窄带滤光片,系统集光能力受限,难以直接应用于弱光或快速动态场景。
- 有效视场与空间采样权衡:采用偏振多路复用在同一感光芯片的上下半区成像,实际上牺牲了一半的垂直有效像素面积或视场角,且单目焦距固定,工作测量范围限制在 0.2 m 至 1.2 m 之间。
- 高频非理想偏振干扰:尽管数据增强能缓解低频光照不平衡,但面对金属强镜面反射、高偏振表面或人造偏振光源时,反射率差异可能干扰 PSF 位移的准确提取。
相关工作与启发¶
- vs PromptDA (CVPR 2024):PromptDA 依靠外部的主动激光雷达向基座模型提供点云深度提示,系统需搭载激光发射与接收模组;本文全过程采用纯被动环境光与单一平面超构透镜,在保持完全单目紧凑物理形态的同时达到了媲美激光雷达的厘米级绝对测距精度。
- vs DeepDfD (ICCP 2021) / Split-Aperture (CVPR 2024):传统计算光学散焦测距大多使用定制振幅/相位掩膜并从头训练浅层 U-Net,存在严重的散焦边缘模糊与先验泛化能力差的问题;本文采用高透光率纳米光子波前编码,并首次成功桥接了预训练深度基座模型,在 FlyingThings3D 上将 MAE 相比 DeepDfD 降低了 75% 以上。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将双折射超构透镜的波前旋转偏振编码与现代深度基座模型相结合,光学与算法协同设计十分新颖。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 NYU Depth V2、MIT-CGH-4k、FlyingThings3D 模拟对比,并搭建了包含真实加工超构透镜与 42 组物理场景的完整硬件系统,消融实验扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨连贯,物理机制图示清晰,实验对齐公允。
- 价值: ⭐⭐⭐⭐⭐ 为超微型机器人、内窥镜微创医疗设备及 AR 穿戴设备提供了一条兼具超紧凑无源光学与高精度密集度量感知可行路径。