跳转至

Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/VISION-SJTU/Lapis
领域: 3D视觉
关键词: 单目深度估计, 扩散模型, 线性注意力, 像素空间扩散, 高分辨率感知

一句话总结

针对高分辨率生成式单目深度估计中二次复杂度与多步去噪带来的巨大计算瓶颈,Lapis 提出了首个基于线性注意力与单步像素空间扩散的几何生成框架,通过由粗到精的补丁级一致性与像素级精炼模块消除了线性化的保真度退化,实现了兼顾极致推理效率与细粒度几何边界的高质量深度估计。

研究背景与动机

单目深度估计(MDE)作为计算机视觉的基础任务,为现实世界的三维/四维感知与场景重建提供了关键的几何支撑。为了捕捉更精细的几何结构,该领域近期迅速从传统的判别式回归模型转向生成式扩散框架。相比容易产生过度平滑预测的回归模型,生成式模型在精细几何纹理上展现出显著优势。然而,随着自动驾驶、机器人等下游应用对高分辨率图像输入的需求不断提升,现有生成式框架在保真度与计算效率之间面临着不可调和的矛盾。

绝大多数主流生成式方法直接复用预训练图像生成器的潜在空间 U-Net 架构,这不仅受限于 VAE 降采样带来的不可逆几何信息丢失,而且 U-Net 难以捕获维持高分辨率全局几何一致性所需的长程依赖关系。另一方面,近期虽有探索在像素空间采用扩散 Transformer(DiT)以绕过 VAE 瓶颈,但标准注意力机制随分辨率二次方增长的 \(O(N^2)\) 计算复杂度以及多步迭代去噪过程,使得其在高分辨率下推理延迟极其高昂。若直观地引入线性注意力机制并结合单步采样,低秩核近似又会导致补丁级全局布局错位和深层迭代平滑造成的像素级细节丢失,同时像素空间常见的 v-prediction 轨迹在单步下极易产生严重噪声伪影。

针对上述多重困境,研究团队探寻如何在线性计算开销下实现单步高质量深度重建。核心 idea:构建首个基于线性注意力与单步像素空间扩散的生成框架 Lapis,利用流匹配直接进行面向干净数据流形的 x-prediction 单步去噪,并结合补丁级语义-空间先验与长程跳跃像素精炼,彻底化解线性化带来的结构与细节退化。

方法详解

整体框架

Lapis 采用单步像素空间扩散范式,模型直接输入拼接的含噪深度图与条件 RGB 图像,在无任何潜编码器压缩的像素空间中完成单步去噪预测。整个网络以前向线性复杂度的 DiT 为骨干网络,通过将标准 Softmax 注意力替换为线性注意力核,将自注意力计算开销从 \(O(N^2 d)\) 降至 \(O(N d^2)\)。为了补偿线性化带来的保真度损失,框架构建了由粗到精的双级补偿结构:在补丁尺度引入补丁级一致性模块(Patch-level Consistency Module, PCM),在像素尺度引入像素级精炼模块(Pixel-level Refinement Module, PRM)。

整个预测流程由输入 RGB 图像与高斯噪声扰动的深度图起步,先通过冻结语义编码器提取宏观语义先验,再经由交替调制的线性化 DiT 块建立全局协调的深度场骨架,最后通过跳跃连接在像素精炼块中恢复细颗粒度边缘并输出最终深度图。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入 RGB 图像与单步加噪深度"] --> B["单步像素空间扩散<br/>基于流匹配直接预测干净深度"]
    B --> C["补丁级一致性模块<br/>融合 DINOv2 语义先验与局部 ConvFFN 偏置"]
    C --> D["线性化 Transformer 骨干<br/>非负核函数无 Softmax 注意力"]
    D --> E["像素级精炼模块<br/>长程跳跃连接与 PixelShuffle 解码"]
    E --> F["输出高保真连续深度图"]

关键设计

1. 单步像素空间扩散:流匹配与干净数据流形直测 现有生成式模型采用多步迭代去噪带来了无法承受的时延,而潜在空间模型由于 VAE 分布强行向各向同性高斯正则化,破坏了真实几何数据的低维流形结构。基于流匹配(Flow Matching)范式与自然几何数据位于低维连续流形的假设,Lapis 摒弃在像素空间单步前向下极不稳定的速度场预测(v-prediction),直接采用目标值预测(x-prediction)策略。给定加噪深度 \(x_t = (1-t)x_0 + t\varepsilon\)(其中时间步 \(t \in [\tau, 1]\)),模型 \(x_\theta(x_t, t, c)\) 在单步前向中直接靶向干净流形上的目标深度 \(\hat{x}_0\)。这一设计直接消除了噪声在单步回归中的残余放大,避免了迭代去噪的巨大时间成本。

2. 补丁级一致性模块:双尺度语义锚定与局部网格消除 标准注意力通过 Softmax 的指数核获得长程尖锐聚焦能力,而线性注意力利用无 Softmax 的非负核函数(采用 \(\phi(x) = \text{elu}(x)+1\))使计算满足矩阵乘法结合律:

\[\text{Attn}_{\text{Linear}}(Q_i, K, V) = \frac{\phi(Q_i) \sum_{j=1}^N \phi(K_j)^T V_j}{\phi(Q_i) \sum_{j=1}^N \phi(K_j)^T}\]

这种线性低秩近似导致长程注意力的聚焦能力下降,极易造成补丁间的全局布局错位。为此,全局一致性机制从预训练 DINOv2 抽取高质量语义先验 \(z\),通过门控投影得到语义描述子 \(\hat{z}\),并借助扩展的 AdaLN-Zero 机制将其与时间步嵌入融合,对线性注意力与前馈层进行调制,从而将全局几何布局牢牢锚定在先验表征中。与此同时,针对线性注意力在相邻补丁交界处产生的伪影与断裂,局部一致性机制在前馈网络(FFN)中引入带有局部归纳偏置的 \(3 \times 3\) 残差深度可分离卷积(ConvFFN),迫使相邻 token 间建立平滑的空间几何关联,彻底消除网格化伪影。

3. 像素级精炼模块:高分辨率跳跃连接与逐像素引导解码 深度模型在深层线性注意力多层级联后会产生累积的平滑均值效应,使得离散补丁映射回连续像素空间时高频边界细节严重退化。像素级精炼模块(PRM)通过跨越深层骨干的长程跳跃连接,将包含原始丰富边缘纹理的浅层输入信息与可学习补丁位置编码拼接,经由 MLP 映射为高分辨率像素引导特征 \(y' \in \mathbb{R}^{D_{\text{pixel}} \times H \times W}\)。随后,骨干网络输出的低维补丁序列通过卷积重投影与 PixelShuffle 进行空间亚像素重排,上采样至全分辨率像素特征 \(s_{\text{pixel}}\)。PRM 内部堆叠多个像素精炼块(Pixel Refiner Blocks),以 \(s_{\text{pixel}}\) 动态回归调制参数,通过 AdaLN-Zero 调制的 ConvFFN 对 \(y'\) 逐级精化,最终由线性预测头生成边界极其锐利的高保真深度图。

损失函数 / 训练策略

Lapis 的训练目标由速度场流匹配损失与多尺度几何梯度正则化联合构成:

\[\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{velocity}} + \lambda_{\text{grad}} \mathcal{L}_{\text{grad}}\]

其中速度损失 \(\mathcal{L}_{\text{velocity}}\) 在 v 空间最小化预测速度 \(\hat{v}_t = (x_t - \hat{x}_0) / t\) 与真实速度 \(v_t = \varepsilon - x_0\) 之间的均方误差。为了进一步强化遮挡边缘与细小结构的锐利度,引入多尺度空间梯度匹配损失:

\[\mathcal{L}_{\text{grad}} = \mathbb{E}_{x_0, \varepsilon, t} \left[ \sum_{s \in S} w_s \left\lVert \nabla_s x_0 - \nabla_s \hat{x}_0 \right\rVert \right]\]

在具体实现中,超参数设为 \(\lambda_{\text{grad}} = 1.5\)。模型总参数量为 520M(骨干采用 DiT-Large 配置),在 4 块 NVIDIA RTX Pro 6000 Blackwell GPU 上使用 AdamW 优化器进行 400K 步训练,学习率恒定为 \(1 \times 10^{-4}\),并采用衰减率为 0.9999 的 EMA 权重用于最终评估。

实验关键数据

主实验

在 5 个主流未见过的真实场景数据集(NYUv2、KITTI、ETH3D、ScanNet、DIODE)的零样本相对深度估计评测中,Lapis 取得了超越经典判别式模型和最新生成式基线的综合最优表现(表 1 汇总):

数据集 指标 Lapis (本文) Pixel-Perfect Depth (前 SOTA) Depth Anything V2 MoGe-2
NYUv2 AbsRel↓ / \(\delta_1\) 3.8 / 98.2 3.7 / 98.1 4.5 / 97.9 3.5 / 98.0
KITTI AbsRel↓ / \(\delta_1\) 5.1 / 97.7 5.4 / 97.1 7.9 / 93.6 5.9 / 97.1
ETH3D AbsRel↓ / \(\delta_1\) 3.2 / 99.2 3.1 / 99.2 7.4 / 97.7 4.5 / 96.7
ScanNet AbsRel↓ / \(\delta_1\) 3.8 / 98.2 3.8 / 98.2 4.2 / 97.8 3.4 / 98.3
DIODE AbsRel↓ / \(\delta_1\) 4.8 / 97.9 4.9 / 97.5 10.0 / 94.9 6.7 / 95.5
全局平均 AbsRel↓ / \(\delta_1\) 4.1 / 98.2 4.2 / 98.0 6.8 / 96.4 4.8 / 97.1

进一步在高分辨率测试基准(Middlebury、Booster、Cityscapes 等,表 2)与计算效率(表 4)上,Lapis 展现出惊人的分辨率扩展优势:

测试分辨率 指标 Lapis (本文) Pixel-Perfect Depth Marigold v1.1 MoGe-2
1080P 平均 AbsRel↓ / \(\delta_1\) 5.1 / 97.1 5.7 / 97.1 13.0 / 83.8 6.3 / 95.3
1440P 平均 AbsRel↓ / \(\delta_1\) 5.2 / 96.9 6.5 / 96.6 18.3 / 76.2 6.4 / 95.1
1080P 延迟 / 显存 Latency↓ / Mem↓ 119.0 ms / 3.6 GB 905.5 ms / 3.5 GB 758.1 ms / 11.7 GB 115.3 ms / 1.7 GB
1440P 延迟 / 显存 Latency↓ / Mem↓ 224.7 ms / 3.9 GB 2457.0 ms / 3.8 GB 1479.0 ms / 16.9 GB 245.5 ms / 2.1 GB

消融实验

基于轻量化配置在 5 个数据集上的模块贡献消融分析(表 5):

配置 平均 AbsRel↓ 平均 \(\delta_1\) 影响与表现说明
完整模型 (Full Model) 4.8 97.7 具备全局一致性、连续补丁与锋利边界的最佳配置
去掉全局 PCM (w/o Global PCM) 19.8 70.1 失去 DINOv2 语义先验锚定,全局几何架构彻底崩溃,误差暴增超 300%
去掉局部 PCM (w/o Local PCM) 5.1 97.5 缺失 ConvFFN 局部归纳偏置,补丁过渡不平滑,出现明显网格条纹断裂
去掉 PRM 模块 (w/o PRM) 4.9 97.6 全局指标轻微下降,但高频薄结构与尖锐几何边界大幅模糊

关键发现

  • 全局 PCM 是线性注意力的生命线:消融实验显示,一旦去掉全局 PCM,模型平均 AbsRel 从 4.8 骤降至 19.8,证实线性注意力因缺乏 Softmax 强聚焦特性无法独立构建准确的全局场景宏观几何拓扑,必须借助高质量语义特征进行空间锚定。
  • 高分辨率下的速度与保真度双赢:在 1440P 超高分辨率测试下,Lapis 的推理延迟仅为 224.7 ms,相比标准注意力像素生成模型(Pixel-Perfect Depth 的 2457.0 ms)加速达 10.9 倍,同时保持了近乎单调提升的边界锐利度 F1 分数(20.5 → 27.2)。
  • x-prediction 与单步去噪的契合性:相比多步采样和 v-prediction,单步直接面向纯净数据流形的 x-prediction 不仅避免了速度积分中的误差累积,而且消除了像素空间的噪点污染,是单步生成式稠密感知的最优解。

亮点与洞察

  • 解耦宏观布局与微观细节的双层架构:将长程上下文建模分配给受语义先验约束的线性化 DiT,而将高频边缘恢复分配给带跨层像素跳跃连接的 PRM,优雅兼顾了计算复杂度的线性化与几何边界的锐利度。
  • 打破判别式与生成式的二元对立:传统观念认为判别模型快但平滑、生成模型细致但极其迟缓;Lapis 首次实现了兼备生成式模型的微观几何解析力与判别式模型的单步毫秒级推理速度。
  • 单步 x-prediction 在连续几何任务中的普适性:展示了稠密几何流形在单步去噪下的稳定性,该流形假设与设计范式可直接推广至单目法线估计、光流估计以及三维表面重建等其他密集预测任务。

局限与展望

  • 依赖预训练语义编码器质量:全局一致性高度依赖 DINOv2 语义特征,如果场景处于极端退化域(如强雾、极端低光或严重镜头污损),语义先验失真可能传递至全局深度布局。
  • 训练数据仍基于合成数据集:目前 122K 训练对均来自 Hypersim、TartanAir 等虚拟仿真环境,尽管零样本泛化能力强,但在极高动态反光、透明介质等真实物理光学特异场景下的泛化能力仍有进一步提升空间。
  • 未来方向:探索端到端联合微调轻量化语义提取器,并拓展至视频时序一致性深度估计与动态 4D 高斯生成中。

相关工作与启发

  • vs Pixel-Perfect Depth: 两者皆立足于像素空间 DiT 避免 VAE 信息损失;但 Pixel-Perfect Depth 依赖二次复杂度的标准注意力与多步去噪,1440P 下延迟近 2.5 秒,而 Lapis 引入线性注意力与单步 x-prediction,将延迟大幅压缩至 224.7 ms 并保持同等甚至更优的边缘锐度。
  • vs Depth Anything V2 / MoGe-2: 判别式回归方法虽然推理快速,但在复杂薄结构(如线缆、栏杆、树枝)处边界平滑且模糊;Lapis 保持相似吞吐量(1080P 下 119 ms vs 115 ms)的同时,在边界 F1 指标上实现断层式领先(27.2 vs 23.7)。
  • vs Marigold / Lotus-2: 基于潜在空间 Stable Diffusion / Flux 的微调方法受到 VAE 瓶颈限制无法恢复像素级真几何,且多步采样效率低下;Lapis 证明像素空间直接生成在架构得当的前提下不仅更清晰而且效率大幅占优。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将线性注意力 DiT 与单步像素空间扩散成功引入单目深度估计,结构设计自洽精炼。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 12 个真实与合成测试集,指标横跨多种分辨率、全局精度、边界锐度及显存延迟。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照极佳,消融设计直击痛点。
  • 价值: ⭐⭐⭐⭐⭐ 彻底解决了高分辨率生成式稠密 3D 感知的效率瓶颈,工程与学术价值极高。