跳转至

DANTE-W: Diffuse Albedo Neural Texturing in the Wild

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://dante-wild.github.io
领域: 3D视觉
关键词: 神经纹理映射、漫反射反照率估计、固有分解、多分辨率哈希编码、可重打光

一句话总结

针对非受控野外大规模场景多视角重建中阴影与光照烘焙的顽疾,Dante-w 将视角空间扩散反照率先验提升至 UV 空间神经纹理,并利用反照率与辐照度在频带分辨率上的显著差异实施物理神经渲染,实现了高保真、三维一致且无缝兼容传统图形管线的漫反射反照率恢复。

研究背景与动机

构建现实世界大规模场景的高质量带纹理 3D 资产,是虚拟现实、影视制作与数字孪生等应用的核心基础。然而,传统基于图像的多视角立体重建(MVS)与纹理映射管线(如 Metashape、Waechter 等)本质上仅对多视角观测像素进行加权混合或基于 MRF 的面片选视优化。这类方法完全缺乏内在材质解耦能力,无法将表面内在反射属性(如漫反射反照率 diffuse albedo)与外部照明效应(如漫反射辐照度 diffuse irradiance、自阴影与几何遮挡阴影)分离开来。这导致正午强光、树木投射阴影等光照效应被不可逆地“烘焙”(baked-in)进 UV 纹理贴图中,在下游自由视角任意光照重打光时出现极其违和的视觉伪影。

另一方面,虽然神经逆向渲染方法试图结合物理渲染方程与隐式神经表征联合重建物体几何、材质与环境光,但受制于光照-材质固有的二义性(lighting-material ambiguity)以及过度简化的光照假设,在非受控的大规模野外复杂场景中极易崩溃。最近兴起的生成式内在分解模型(如 RGB↔X、Cosmos-DiffusionRenderer)虽然借助大规模合成数据微调的扩散先验具备较强的单图/跨图材质推理泛化能力,但其在 2D/视频特征空间逐帧生成存在严重的三维多视角不一致性与高频闪烁,且受 VAE 潜在空间压缩损失限制导致纹理细节模糊,无法直接集成进现代渲染引擎。

针对上述挑战,清华大学团队提出 Dante-w 框架,将视角空间的生成式扩散先验与 3D 一致的紧凑神经表征相结合。团队的核心观察在于:在野外自然场景中,环境辐照度(光照漫射场)通常在空间上具有显著的低频平滑特性(如低阶球谐函数即可高精度近似),而物体的内在反照率则包含大量高频空间纹理细节。核心 idea:将视角空间扩散反照率先验显式蒸馏到 UV 空间的高分辨率多分辨率哈希神经纹理中,并通过设定反照率(高频 2D 哈希网格)与空间辐照度(低频 3D 哈希网格)的显式最大网格分辨率频带差异,利用物理神经渲染将原始图像中的三维一致高频细节单向引导注入反照率表征,最终直接烘焙为标准 UV 贴图。

方法详解

整体框架

Dante-w 以传统 3D 重建管线输出的三角网格几何及其参数化 UV 坐标、以及非受控无序图像集合为输入,输出可以直接用于工业级图形引擎(如 Blender Cycles)渲染的高保真漫反射反照率 UV 贴图。整体流程包含三大核心阶段:首先利用预训练生成式逆向渲染扩散模型为输入视点生成初步的反照率估计缓冲区;其次建立解耦的神经场表征——在 2D UV 参数空间用高分辨率多分辨率哈希网格表示漫反射反照率,在 3D 场景空间用低分辨率哈希网格结合相机曝光嵌入表示环境辐照度;最后通过先验蒸馏损失与基于色调映射的原始图像重渲染损失联合优化,完成高频反照率细节解耦并烘焙导出。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入多视角无序图像 + 参数化网格"] --> B["视角空间扩散反照率先验蒸馏<br/>多视角扩散先验投影对齐与一致性聚合"]
    B --> C["频带解耦神经表征构建<br/>高分辨率2D纹理哈希 vs 低分辨率3D光照哈希"]
    C --> D["物理约束神经渲染重投影<br/>辐照度与反照率分频带色调映射重建"]
    D --> E["标准UV反照率贴图烘焙<br/>直接对接Blender Cycles自由视点重打光"]

关键设计

1. 视角空间扩散反照率先验蒸馏:压制视角闪烁并锚定低频反照率基准 针对无序多视角输入下光照与材质严重二义性的难题,该设计引入先进的生成式内在分解扩散模型(如 Cosmos-DiffusionRenderer 或 RGB↔X)作为鲁棒的低频语义指导。首先离线批量推理输入图像 \(\{I_k\}\) 获得各视角的反照率图 \(\{A'_k\}\)。在训练迭代中,通过光栅化获取相机光线与网格表面交点的 UV 参数坐标 \(\hat{x}\),查询神经反照率解码值 \(a_d\),并构建屏幕空间蒸馏约束: $\(\mathcal{L}_a = \sum_{k} \sum_{r} \| a_d(\hat{x}_r) - A'_k(r) \|_1\)$ 由于 2D 扩散模型生成的图像在视角变换时存在闪烁且缺失跨视点几何约束,将其直接提升并投影聚合到紧凑共享的 2D UV 神经场中,能通过反向传播自动实现多视角证据平均,有效滤除单视角扩散先验的随机幻觉。

2. 频带解耦神经表征构建:利用空间频率差异消解光照-材质二义性 朴素提升扩散先验虽然解决了多视角一致性,但由于 VAE 潜空间下采样与扩散去噪的平滑性,会导致纹理细节极度模糊。为此,作者利用物理光学中“辐照度场空间变化极平缓,而材质纹理充满丰富高频边缘”的先验,对两者采用非对称分辨率的神经哈希编码架构。反照率表征定义在 2D 纹理空间,使用 \(L_a\) 层高分辨率 2D 哈希特征网格 \(\psi^{2D}_a(\hat{x})\) 并接入轻量 MLP \(F_{\Theta_a}\),其最高层网格分辨率设定为极大值 \(V_{L_a}^{(a)}\)(野外场景高达 8192);而空间漫反射辐照度 \(s_d\) 考虑到场景遮挡与多次光线反弹,建模为 3D 空间体积神经场 \(\psi^{3D}_s(x)\),最高网格分辨率被严格限制在低频范围 \(V_{L_s}^{(s)}\)(满足 \(V_{L_a}^{(a)} \gg V_{L_s}^{(s)}\)),并拼接可学习的单图像环境/相机曝光潜码 \(e_k\)。这种结构性瓶颈在架构层面彻底封堵了低频光照表征拟合高频锐利纹理的能力。

3. 物理约束神经渲染重投影:驱动原始图像高频信息定向注入反照率 在建立分频神经表征后,系统通过朗伯体漫反射物理成像模型 \(c = a_d \odot s_d\) 将反照率与辐照度逐像素合成预测辐射度。为兼容真实拍摄时的曝光变化与色彩空间,引入每视角可学习仿射增益与偏移标量 \((w_k, b_k)\) 以及固定的 sRGB 色调映射函数 \(\gamma(\cdot)\),将预测颜色拟合真实捕获像素 \(I_k(r)\): $\(\mathcal{L}_c = \sum_{k} \sum_{r} \| \gamma(w_k \cdot (a_d \odot s_d) + b_k) - I_k(r) \|_1\)$ 由于 \(s_d\) 受限于低分辨率哈希网格上限,无法容纳图像中如砖石裂纹、彩绘边缘、文字笔画等细微变化,重渲染损失 \(\mathcal{L}_c\) 产生的高频梯度流被纯粹、定向地逼入具有超高容量表达能力的 2D 神经纹理哈希网格中,从而在完全剥离复杂光照与浓重阴影的同时,完整找回了摄影级的微观质感。

损失函数 / 训练策略

系统全流程进行联合端到端优化,总损失函数定义为神经渲染重构损失与扩散反照率先验正则化项的加权和: $\(\mathcal{L} = \mathcal{L}_c + \lambda \mathcal{L}_a\)$ 在所有真实及合成实验中,平衡权重超参数均稳定设置为 \(\lambda = 1.0\)。训练前预先光栅化缓存所有视角的交点 3D 坐标、UV 坐标与前景有效掩码,在训练迭代中跨多视角全局随机采样前景有效光线批次。由于底层基于高效的 GPU 硬件级多分辨率哈希编码库 tiny-cuda-nn,针对包含数千张 4K 照片的大规模真实野外场景,单张 NVIDIA RTX 3090 显卡仅需 5 至 8 分钟即可完成全场景收敛,收敛后将连续神经网络纹理光栅化查询烘焙为 4K/8K 分辨率的漫反射 albedo 贴图文件。

实验关键数据

主实验

论文针对野外场景与高质量合成对象构建了 GigaLit 基准评测集(包含 10 个 4K 材质合成物体与 6 个高分辨率实拍复杂野外场景,涵盖多种光照变换与半球多距视点)。在漫反射反照率恢复(Diffuse Albedo)与自由视点重打光(Relighting)双任务上与传统纹理重建、生成式分解模型进行了系统定量评测。

方法类型 / 模型名称 反照率 PSNR (dB)↑ 反照率 SSIM↑ 反照率 LPIPS↓ 重打光 PSNR (dB)↑ 重打光 SSIM↑ 重打光 LPIPS↓
Waechter et al. (经典纹理映射) 21.43 0.889 0.103 23.78 0.915 0.092
Bi et al. (Patch 优化) 21.48 0.885 0.111 23.81 0.902 0.097
Metashape Pro (商业 MVS 软件) 21.50 0.892 0.103 23.83 0.917 0.089
LightSwitch (扩散材质估计) 16.89 0.807 0.185 17.79 0.808 0.189
RGB↔X (扩散反照率模型) 21.65 0.860 0.125 20.30 0.849 0.134
Cosmos-DiffusionRenderer (DR) 23.36 0.879 0.120 21.64 0.873 0.130
Dante-w [Ours + RGB↔X] (Full) 25.50 0.911 0.093 27.45 0.933 0.076
Dante-w [Ours + DR] (Full) 25.99 0.921 0.091 27.77 0.938 0.071

消融实验

论文围绕提出的物理神经渲染(Physically Principled Neural Rendering, PR)机制及其频带解耦假设展开了严谨的消融对比(数据来自 GigaLit 合成评测集平均):

实验配置方案 反照率 PSNR (dB)↑ 反照率 SSIM↑ 反照率 LPIPS↓ 重打光 PSNR (dB)↑ 重打光 LPIPS↓ 核心表现说明
Ours + RGB↔X (w/o PR,纯先验蒸馏) 25.32 0.890 0.120 27.27 0.099 纹理模糊,缺失高频结构
Ours + RGB↔X (Full,完整物理渲染) 25.50 0.911 0.093 27.45 0.076 恢复高保真细节,感知质量跃升
Ours + DR (w/o PR,纯先验蒸馏) 25.69 0.907 0.115 27.45 0.092 缺乏高频引导,纹理过渡平滑
Ours + DR (Full,完整物理渲染) 25.99 0.921 0.091 27.77 0.071 反照率与重打光全面达到最优
去除频带分辨率差异 (\(V_{L_a}^{(a)} \approx V_{L_s}^{(s)}\)) 定性退化 定性退化 定性退化 定性退化 定性退化 发生严重二义性,高频纹理渗漏入光照场

关键发现

  • 物理神经渲染(PR)对感知保真度至关重要:加入物理神经渲染使得反照率恢复的 LPIPS 从 0.115-0.120 大幅下降到 0.091-0.093(感知误差降低约 24%),重打光 LPIPS 下降超 20%,证明直接从原始图像抽取高频信号成功克服了扩散潜空间压缩带来的信息损失。
  • 大幅跨越 SOTA 生成式模型:相较于直接调用 Cosmos-DiffusionRenderer 输出,Dante-w 在反照率和重打光指标上分别取得 +2.63 dB 和 +6.13 dB 的显著提升,LPIPS 降低达 40% 以上,展现了 3D 几何与纹理空间正则化压制单帧幻觉的威力。
  • 极致的训练与渲染效率:在处理包含 2500+ 张高分辨率照片的超大型实拍场景(如滕王阁建筑)时,整体优化仅耗时 5-8 分钟,相较商业软件 Metashape Pro 的多视角纹理混合加速超过 7 倍,且显存占用仅为 0.8GB(合成物体)至 3.3GB(野外大场景)。

亮点与洞察

  • 以频带差异优雅解耦病态逆向物理方程:将光学中辐照度低频平滑的物理属性具象化为神经网络多分辨率哈希网格最大层级的物理约束,不需要设计极其繁复的手工平滑正则化,便让重构梯度自然把高频信息分配给材质纹理。
  • 连通 2D 生成先验与工业图形管线的实用范式:不采用沉重且难以编辑的隐式体素/NeRF/3DGS 渲染器,而是牢牢扎根于工业标准的三角网格与 UV 参数化空间,输出即可直接烘焙为标准贴图导入 Blender 等现代引擎,极具落地实用价值。
  • 揭示公开基准缺陷并建立高质量标杆:明确指出现存逆向渲染数据集(如 Stanford-ORB)在真值捕获过程中引入的剧烈噪声与细节缺失,通过 BlenderKit 4K 资产建立了首个具有挑战性光照与复杂细节的 GigaLit 基准。

局限与展望

  • 朗伯体表面假设的约束:模型目前聚焦于漫反射反照率分解,未对非朗伯体高光(specular)、金属度及粗糙度等非线性 BRDF 参数进行联合求解,在强镜面反射高光物体上仍存在一定近似误差。
  • 依赖上游网格与 UV 参数化质量:算法高度依赖于前序 MVS(如 Metashape/COLMAP)重建得到的几何表面与 UV 展开质量,若几何存在大面积缺失或拓扑重叠,神经纹理映射将受到不可逆影响。
  • 未来演进方向:作者指出可将该神经纹理频带解耦机制拓展至 3D Gaussian Splatting 等更为灵活的新型隐式/显式几何辐射场表征中,并扩展复杂非各向同性材质的完整 PBR 材质分解。

相关工作与启发

  • vs Metashape Pro / Waechter et al. (经典多视角纹理映射):传统方法直接在像素颜色空间进行多视角选择与缝合,无法剥离光照,导致强阴影被永久烘焙;Dante-w 引入深度扩散先验与逆向神经渲染,成功完成纯粹漫反射反照率分离。
  • vs RGB↔X / DiffusionRenderer (生成式内在分解模型):2D 扩散模型缺乏跨视点三维空间一致性与连续性,且 VAE 压缩导致纹理严重失真;Dante-w 将其作为低频先验蒸馏至 3D 表面神经纹理中,并通过原始图像物理神经渲染彻底补全高频真实细节。
  • vs LightSwitch / TensoIR (基于神经场/逆向渲染方法):传统神经逆渲染在野外大规模光照剧烈变化场景中极易陷入局部极小与材质二义性;Dante-w 利用跨领域预训练的大模型先验作为锚点,配合显式频带瓶颈,取得了前所未有的鲁棒性与速度优势。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用哈希网格分辨率瓶颈实现频带分离解耦光照与纹理,思路极其清晰且极具物理洞察。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖实拍大场景、合成 4K 复杂资产、公开数据集与完整的消融分析,评测基准扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层推进,问题定义直击痛点,系统框图与核心公式精简自洽。
  • 价值: ⭐⭐⭐⭐⭐ 完美兼容工业图形管线,显存极低、训练仅需数分钟,为虚拟制作与数字孪生提供了强劲的生产力工具。