跳转至

∂DIBR: Differentiable Depth Image-based Rendering for Fast Novel View Synthesis

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/LISA-VR/ddibr
领域: 3D视觉
关键词: 深度图像渲染 (DIBR), 可微渲染, 新视角合成, 三角面元, 实时渲染

一句话总结

将经典基于深度图像的渲染 (DIBR) 重构为端到端可微框架,以连通三角网格保证几何连通性与结构一致性,在消费级 GPU 上实现 277 FPS 的高速实时新视角合成。

研究背景与动机

现代新视角合成 (NVS) 正在经历由逆渲染驱动的表征革新,以 3D Gaussian Splatting (3DGS) 和 NeRF 为代表的显式/隐式基准,通过可微光栅化或体积积分,在图像质量上取得了突破。然而,这些新一代基元(如非结构化的高斯椭球或神经体素)在优化过程中相互独立演化,缺乏几何拓扑约束。优化往往为了迎合目标视角的色彩一致性而产生大量悬浮伪影、结构断裂以及视点过拟合,导致重建的真实几何表面往往严重失真、失去物理连通性。更为棘手的是,工业级图形管线(如 Vulkan、OpenGL 和标准着色器)是专为三角图元优化的,无法原生高效兼容高斯球或体积渲染,极大限制了这些技术在消费级终端、轻量级 VR/AR 及游戏引擎中的部署。

传统计算机图形学中的基于深度图像的渲染 (DIBR) 本身具备极高的工业友好度与显式网格连通性:它通过输入视角的深度图反投影得到连通三角网格,再变形投影到目标视角完成多视图融合。但经典 DIBR 面临两大根本瓶颈:一方面,传统流程依赖手工先验或外部深度估计,渲染过程中的离散遮挡剔除与 Z-Buffer 测试不可微,无法通过图像色彩误差进行端到端逆渲染反向传播;另一方面,视角拉大时产生的视差拉伸空洞(disocclusions)容易导致严重的伪影断裂。现有尝试引入三角图元的方法(如 Triangle Splatting)大多退化为离散断裂的“三角形碎片汤(triangle soup)”,依然破坏了拓扑连续性。

本文的切入点是回归经典图形学支持最广泛的连通三角网格图元,通过连续松弛化破除 DIBR 各环节的不可微障碍,同时设计多尺度视点与频率解耦策略驯服深度优化。核心 idea:将 DIBR 完整管线构建于可微着色器之上,通过 Sigmoid 概率松弛空洞剔除、像素内多重子采样平滑可见性跳变,并结合粗到细金字塔与色深解耦训练,实现兼具严格几何连通性与 277 FPS 极速渲染的可微逆渲染系统。

方法详解

整体框架

∂DIBR 接收一组稀疏多视角 RGB 图像及其初始深度图,直接在图形管线(基于 Slang/Vulkan)中执行前向可微渲染与逆渲染梯度更新。整体流水线主要包括五个步骤:双层视点筛选、网格前向投影变形、基于几何形变的概率质量评定、多重采样平滑光栅化以及加权色彩融合。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入多视角RGB图像与初始深度"] --> B["双层视点筛选与三角网格投影"]
    B --> C["软化质量因子"]
    C --> D["多重采样平滑光栅化"]
    D --> E["质量加权多视角混合"]
    E --> F["分级分频逆渲染优化"]
    F -->|反向传播色彩与TV正则梯度| A

在推理或训练每一帧时,算法首先执行双层视点选择:先利用 PAM 聚类选定具有代表性的几何视点基底集 \(\mathcal{S}\),再综合基线间距、视线夹角和视中心投影交并比三项准则,实时筛选出 \(|\mathcal{I}|\) 个与目标相机最相关的输入视点。每个输入视点像素网格化构建三角面,经相机矩阵与深度图向目标视网膜变换。紧接着,可微软化质量因子判定由于视差拉伸引起的破损三角形,多重采样缓冲解决前后面可见性跳变,加权合成目标图像。最终通过光度损失与各向异性总变差正则联合驱动端到端优化。

关键设计

1. 软化质量因子:将硬截断空洞剔除转化为可微概率权重 传统 DIBR 处理大视差视角时,深度边缘处的相邻像素因视差拉伸会产生狭长异常的破损三角形(即空洞拉伸,disocclusion triangles)。经典算法通过设定阈值直接剔除形变三角形,但硬截断会导致阶跃函数出现、梯度彻底断绝。∂DIBR 将确定性剔除重构为概率判别,引入平滑的 Sigmoid 连续松弛函数。具体而言,针对每个变换后的三角形 \(T_{i \rightarrow t}\),算法基于边长形变、面积畸变等几何形变量构建先验项 \(f_q(T_{i \rightarrow t})\),并通过逻辑斯蒂映射计算其置信质量因子: $\(Q_{i \rightarrow t} = \sigma\left(\sum_{q \in \mathcal{Q}} \omega_q f_q(T_{i \rightarrow t})^{\lambda_q}; k, x_0\right)\)$ 其中 \(k\) 控制 Sigmoid 的陡峭程度,\(x_0\) 为中心转移阈值。当三角形几何形态保持健康时,\(Q_{i \rightarrow t} \to 1\);当三角形因视差被剧烈拉长时,\(Q_{i \rightarrow t} \to 0\)。该设计不仅自动抑制了空洞边缘伪影,更关键的是赋予形变边缘处顶点连续可导的平滑梯度,使逆渲染能依据光度误差反向驱动深度边界收缩或修正。

2. 多重采样平滑光栅化:平滑离散三角面可见性测试的梯度跳变 在光栅化着色过程中,确定一个目标像素落在哪一个三角面内以及判断 Z-Buffer 可见性是强烈的非连续操作。当几何顶点微小变动时,像素中心采样的覆盖面骤然切换,会引发回传梯度的剧烈高频震荡与梯度噪声。为缓解这一离散跳变,∂DIBR 借鉴抗锯齿图形学机制,在每个目标像素内均匀布置 \(|N|=4\) 个亚像素采样点。每个子采样点独立判断三角形从属与深度可见性,并通过重心坐标插值获取纹理坐标: $\(C_{i \rightarrow t}(\vec{p}_t) = \frac{1}{|N|} \sum_{n=1}^{|N|} C_i(\vec{p}_{i, n})\)$ 随后在多视角融合阶段,目标像素的最终色彩由各输入视图的插值色彩以透明度 \(\alpha_{i \rightarrow t}\) 与软化质量 \(Q_{i \rightarrow t}\) 进行加权平均,并引入微小偏置项 \(\epsilon\) 衔接背景色 \(C_0\): $\(C_t = \frac{\sum_{i \in \mathcal{I}} \alpha_{i \rightarrow t} Q_{i \rightarrow t} C_{i \rightarrow t} + \epsilon C_0}{\sum_{i \in \mathcal{I}} \alpha_{i \rightarrow t} Q_{i \rightarrow t} + \epsilon}\)$ 多重采样子像素将原本单点阶跃的非可微开关平滑化为分段连续函数,大幅削减了可见性决策处的梯度方差。

3. 分级分频逆渲染优化:粗到细金字塔与色深学习率解耦避免局部最优 在逆渲染中直接联合优化 RGB 纹理与深度图极易陷入局部极小值。特别是针对高频重复纹理,初始深度偏差会使得纹理在视差投影后发生周期性错位,直接在全分辨率下优化往往会收敛至错误的几何;同时,由于色彩参数的自由度极高,网络极易通过直接涂改像素色彩来拟合投影错位,形成“假几何、真过拟合”。∂DIBR 为此提出两重协同机制:其一为从粗到细的分辨率金字塔,在低分辨率阶段消除高频细节干扰,确保深度大体结构跨越大步长收敛;其二为学习率解耦与频率调度,在训练最初阶段将色彩学习率设为深度学习率低三个数量级(\(10^{-5}\) 级 vs \(10^{-2}\) 级),强迫系统必须依靠调整几何深度来减小光度损失。待宏观几何稳定后,再逐级提高色彩学习率,在最细层级以相同频率微调残差、视点相关色彩与色彩校准偏差。

损失函数 / 训练策略

训练目标由光度重构损失 \(\mathcal{L}_c\) 与深度图的各向异性总变差正则项 \(\mathcal{L}_{ATV}\) 线性组合而成: $\(\mathcal{L} = \mathcal{L}_c + \gamma \mathcal{L}_{ATV} = \sum_{t} |C_t - \tilde{C}_t| + \gamma \sum_{i} (|\Delta_x D_i| + |\Delta_y D_i|)\)$ 其中 \(\mathcal{L}_c\) 采用 \(L_1\) 范数度量渲染视点与真实图像的差异,\(\mathcal{L}_{ATV}\) 惩罚深度图相邻像素间的突变以抑制刺状伪影并保持表面平滑。权重 \(\gamma\) 在初始阶段设为 4,最终微调阶段设为 12。

优化器采用 Adam (\(\beta_1=0.9, \beta_2=0.999\)),总计训练 40,000 步。三阶段的学习率配置分别为: - 阶段 1(粗分辨率):色彩 \(10^{-5}\),深度 \(10^{-2}\) - 阶段 2(中分辨率):色彩 \(5 \times 10^{-5}\),深度 \(10^{-2}\) - 阶段 3(全分辨率):色彩 \(5 \times 10^{-3}\),深度 \(5 \times 10^{-3}\)

实验关键数据

主实验

在 LLFF 和 Shiny 两个极具挑战的前向捕获数据集上,∂DIBR 与当前代表性的新型视角合成方法进行了客观画质与运行效率的全面评测。

数据集 评估指标 3DGS (SIGGRAPH 23) 2DGS (SIGGRAPH 24) TS (CVPR 24) ∂DIBR (本文)
LLFF (Average) PSNR (dB) ↑ 24.73 23.88 21.91 21.81
SSIM ↑ 0.816 0.799 0.739 0.722
LPIPS ↓ 0.114 0.150 0.197 0.202
Shiny (Average) PSNR (dB) ↑ 23.25 22.56 23.15 22.44
SSIM ↑ 0.788 0.778 0.766 0.735
LPIPS ↓ 0.128 0.140 0.110 0.171

在渲染效率、显存开销与模型尺寸方面,∂DIBR 展现出了压倒性的工业部署优势:

方法 PSNR (dB) 训练耗时 (min) 显存占用 (GB) 存储体积 (MB) 渲染帧率 (FPS) ↑
∂DIBR (Lvl 1 - 粗) 20.08 8 3.4 6 483
∂DIBR (Lvl 2 - 中) 20.55 +9 6.4 21 386
∂DIBR (Lvl 3 - 全) 21.81 +16 17.46 87 277
3DGS 24.73 8 4.2 246 168
2DGS 23.88 10 4.2 146 114
TS (Triangle Splatting) 21.91 22 12.4 353 110

消融实验

消融实验重点验证了深度初始化方案、各向异性正则化系数 \(\gamma\) 以及视点选取超参数的影响。

模块 / 变量 配置取值 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ 说明
深度初始化 无深度先验 (均值初始化) 21.52 0.706 0.218 收敛需 60k 步,仍能收敛出真实结构
DepthAnything 初始化 21.54 0.694 0.218 相比均值无明显提升
ZoeDepth 初始化 (默认) 21.81 0.722 0.202 引导初期快速收敛且最终画质最优
深度正则项 \(\gamma\) \(\gamma = 0.01\) 22.38 0.702 0.226 正则过弱导致深度图存在大量高频高噪
\(\gamma = 0.1\) 22.69 0.739 0.219 结构逐渐平滑
\(\gamma = 1.0\) 22.94 0.779 0.182 感知质量与几何保真度显著提升
\(\gamma = 4.0\) (默认) 22.69 0.782 0.178 LPIPS 最佳,消除锯齿破面与过拟合刺

此外,关于视点代表集大小 \(|\mathcal{S}|\) 与每帧融合视点数 \(|\mathcal{I}|\) 的组合测试显示:当 \(|\mathcal{I}|=6\) 时取得性能与质量的最佳平衡(PSNR 22.69 dB,190 FPS);若追求极速,选 \(|\mathcal{I}|=3\) 可达 321 FPS,仅损失约 1 dB 画质。

关键发现

  • 渲染速度翻倍:∂DIBR 在 RTX 4090 上达到了 277 FPS,是 3DGS (168 FPS) 的 1.65 倍、2DGS (114 FPS) 的 2.43 倍,且显卡通用管线兼容性好。
  • 存储开销大幅削减:相比点云与高斯体素动辄数百兆的参数量,∂DIBR 仅保存多视角 RGBD 结构(87 MB,甚至粗尺度仅 6 MB),易于在标准图形格式下流式分发。
  • 全局几何宏观一致性更强:尽管在高频边缘处出现部分模糊,但观察深度图可视化可见,3DGS 和 2DGS 在缺乏视点约束的盲区容易出现大片几何漂移与悬浮噪点(依靠球谐函数的视向颜色强行拟合),而 ∂DIBR 强制依附于拓扑连续的网格,全局几何结构更加真实稳健。

亮点与洞察

  • 将不可微图形流程概率化松弛:巧妙地将离散的三角形空洞硬剔除转化为逻辑斯蒂概率掩码,使原本非黑即白的剔除决策变成平滑的连续衰减因子,使得边界梯度能够穿透几何突变。
  • 逆渲染中几何与材质的频率防塌陷机制:通过学习率在初期的三阶解耦,解决了“色彩容量过剩迅速掩盖几何错误”的典型逆渲染退化难题,使深度能够主导大结构对齐。
  • 无缝对接传统图形渲染管线:直接依托标准三角形图元和 Slang/Vulkan 着色器,不仅为实时 3D 渲染提供了可直接嵌入游戏引擎的范式,也证明了传统 DIBR 结合可微计算仍具备极强生命力。

局限与展望

  • 画质相较高斯溅射仍有差距:在极细微结构(如植物叶片、薄结构边缘)上存在约 2-3 dB 的 PSNR 损失,主要受限于单层网格无法表达半透明效果和复杂的非连续深度折叠。
  • 视向依赖反射建模能力受限:目前主要依赖输入视图的几何加权混合,对于高光、镜面反射强烈的非朗伯体材质缺乏显式视向球谐或物理材质建模。
  • 未来方向:可考虑结合分层深度图像 (LDI) 或神经材质贴图,在保持三角图元与高帧率优势的同时进一步攻克薄结构遮挡与高光材质合成。

相关工作与启发

  • vs 3DGS / 2DGS: 3DGS 采用非结构化半透明椭球,通过密度累积合成图像,画质极为细腻但缺乏几何连续性且容易产生虚空悬浮伪影;2DGS 引入平面约束但基元依然离散。∂DIBR 直接使用拓扑连通的三角网格,虽然细微锐度略逊一筹,但渲染帧率翻倍且几何完整性显著占优。
  • vs Triangle Splatting (TS): TS 虽然采用了三角基元,但其三角形依然是自由漂浮、非连通的碎片汤。∂DIBR 依托 DIBR 的多视角深度网格,天然保持了图像空间的拓扑连接,消除了碎片拼凑感的伪影。
  • vs 传统 DIBR (如 Ravis / OpenDIBR): 传统 DIBR 仅作为前向几何投影工具,依赖不可变先验深度;∂DIBR 则通过平滑近似成功建立可微逆渲染通道,使深度能够在多视点光度误差驱动下端到端迭代校准。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将完整的经典 DIBR 管线转化为端到端可微着色架构,针对不可微空洞与光栅化跳变的设计简洁扎实。
  • 实验充分度: ⭐⭐⭐⭐☆ 在两个标准前向数据集上完成了多维度对比与深度消融,涵盖效率、显存、正则项及渲染画质。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密,数学表达与图示对不可微松弛机制阐述得非常透彻。
  • 价值: ⭐⭐⭐⭐⭐ 成功打通现代逆渲染优化与传统工业级三角渲染管线的壁垒,为超低延迟 VR/AR 新视角渲染提供了高价值路径。