跳转至

Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5513
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/11100.pdf
项目: https://razayunus.github.io/DIR
领域: 视频理解 / 三维重建与逆渲染
关键词: 动态逆渲染、材质光照分解、刚体位姿跟踪、SDF 高斯、重光照

一句话总结

DIR 将手持物体的刚体运动变成光照约束,以三阶段跟踪、几何精化和物理逆渲染恢复可重光照资产,在合成漫反射物体上,手持估计姿态的反照率 PSNR 为 40.33 dB,高于静态多视角使用真实姿态时的 32.68 dB。

研究背景与动机

拍摄一个物体并准确重现它的照片,不等于知道它本来是什么颜色。静态多视角重建改变的是观察方向,同一表面点的法线与环境光之间的关系基本不变,因此暗色可能来自低反照率,也可能来自阴影;优化器可以把物体颜色塞进环境贴图,或把阴影烘焙进材质。这样的模型在训练光照下仍能渲染得很好,换一个环境后却暴露出错误。现有逆渲染常用材质或照明先验、多环境采集、额外光源缓解这一问题,但需要额外数据、采集条件或更复杂的光照表示。

本文改问:如果环境不动,而物体在手中自由转动呢?同一个表面点会朝向不同的环境方向,原来能解释单帧的错误材质与光照组合,就未必能同时解释所有姿态。这里的重要区别不是视频帧更多,而是表面与光源的相对关系真正改变了。单轴转台也能提供这种变化,却没有任意轴旋转丰富;纯粹移动相机则主要增加视角约束,而不是入射光约束。

问题随之转移到跟踪:想利用大幅旋转,就必须同时恢复未知物体的形状和姿态,而错误法线又会污染材质估计。作者因此先用平滑表示获得稳定的粗跟踪,再引入细节更强的高斯,最后才放开物理材质与环境光。核心 idea:在一个共享且静止的远场环境中,用刚体运动产生的多样表面受光关系约束同一份材质,并通过由粗到细的重建让这些跨帧约束可靠地对齐。

方法详解

整体框架

输入是固定相机拍摄的单目 RGB 刚体运动序列和物体掩码,不要求预先提供物体 CAD 模型或逐帧姿态。输出包括规范空间中的几何、反照率和粗糙度、每帧物体姿态,以及跨时间共享的环境贴图。真实数据中的掩码由 SAM3 提取;手本身并没有成为被显式建模的光照遮挡体。

流程依次是渐进位姿与粗几何估计、SDF 高斯全局精化、动态物理逆渲染。前两个阶段先把“表面在哪里、此刻朝向哪里”估计好,第三阶段再要求不同姿态共享的材质解释所有照片,而不是允许每帧自由选择一套环境来吸收误差。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["RGB 序列与物体掩码"] --> B["渐进位姿与粗几何估计"]
    B --> C["SDF 高斯全局精化"]
    C --> D["动态物理逆渲染"]
    E["跨帧共享环境光"] --> D
    D --> F["几何、材质、姿态<br/>与可重光照资产"]

关键设计

1. 渐进位姿与粗几何估计

直接把精细几何、所有姿态和材质一起优化,容易让错误几何解释错误姿态,最后停在能够拟合照片但物理上错误的解。DIR 沿用 FMOV 的渐进思路,以 NeuS 的神经有符号距离场表示物体;MLP 的平滑性和单位球几何初始化,让稀疏观测时的表面不至于立即碎裂。每条射线的采样数保持较低,刻意只学习粗形状,避免姿态追随高频噪声。这里的视角相关颜色只是早期重建工具,还不是最终分解后的反照率。

序列按帧加入,每帧姿态由上一帧初始化,并由逐帧 pose MLP 表示。利用掩码把物体置于虚拟相机图像中心,可以先消去两个平移自由度,降低初始优化难度;这是一种便于跟踪的近似,并不是最终的完整物理相机模型。姿态变化足够大时重置几何,避免已经退化的表面继续拖累后续跟踪。RoMa v2、MASt3R 等学习式匹配器提供邻近帧的二维对应,以跨帧匹配损失辅助弱纹理、镜面物体的跟踪;每一步只更新当前帧及匹配帧的 pose MLP,而非立即进行全序列联合求解。

2. SDF 高斯全局精化

有了粗姿态后,DIR 切换到能表达细节的三维高斯,但并非直接使用自由不透明度的普通 3DGS。每个高斯还存储 SDF 值,由它决定不透明度,并通过全局可学习参数控制相关映射。高斯的最小尺度轴定义法线,背向法线的高斯在光栅化时被剔除,避免前后表面混在一起;深度由射线与高斯的三维交点计算,而不是简单取高斯中心。配合法线、深度方差和盘状形状约束,这一阶段的目的不只是照片更清晰,而是让后续 BRDF 所依赖的表面法线可信。

物体姿态作用于高斯位置和旋转,法线随高斯一起转动;球谐外观则通过反向旋转查询方向求值。这样保持环境坐标系不动,并让渲染梯度流回姿态网络。阶段一的虚拟相机估计先借助网格的三维到二维对应及 RANSAC EPnP,转换为完整 6-DoF 初始化,再由带逐姿态嵌入的全局 MLP 学习修正量,联合优化所有帧。FastGS 的多视角一致增密与剪枝把高斯集中在有效表面,控制下一阶段光线追踪的成本。本文的细化并不是单纯“增加高斯数量”,而是同时增强几何约束与位姿一致性。

3. 动态物理逆渲染

现在给每个高斯附加反照率与粗糙度,以 Lambertian 漫反射加 GGX 微表面镜面反射描述材质,并固定介电材质的正入射反射率为 \(F_0=0.04\)。沿用 SVG-IR,在高斯平面的四个角存储材质属性和法线,再在射线交点处插值,避免一个高斯只能表示完全均匀的局部表面。环境光始终是一张共享的远场贴图,先低分辨率优化再双线性上采样,以免高分辨率照明过早充当拟合误差的容器。

运动提供约束的关系可以写成下面的标准化表达。这里根据正文解释整理记号,不逐字复刻缓存中排版损坏的公式:规范空间同一点的材质不随时间变化,而位置与法线随刚体姿态变化。

\[ x_t=R_t x+t_t,\qquad \hat n_t=R_t\hat n. \]
\[ L_o(x_t,\omega_o)=\int_{\Omega_t} f_t(\omega_i,\omega_o)\left[L_{\mathrm{direct}}(\omega_i)V(x_t,\omega_i)+L_{\mathrm{indirect}}(x_t,\omega_i)\right](\omega_i\cdot\hat n_t)_+\,d\omega_i. \]

其中 \(f_t\) 是共享材质在当前姿态下的 BRDF,\(\Omega_t\) 是积分方向域,正部算子截去负余弦。共享环境中的同一光照方向,经过不同法线朝向和遮挡关系,会产生不同亮度;优化器需要让一组材质与一张环境图同时解释这些变化。如果把某处永久涂暗来解释一帧的阴影,转动后该处重新受光,就会产生跨帧误差。这是运动相较于静态多视角真正增加的信息。

为避免把自遮挡误认为低反照率,DIR 使用 3DGRT 对表面发出的次级光线进行高斯追踪:累积不透明度经阈值化得到环境可见性,追踪得到的颜色近似该方向的间接入射光。实际采用延迟着色,先光栅化变换后的高斯,得到深度、法线与材质图,再在这些表面点上进行物理渲染。优化时用 Fibonacci 球面采样,接受固定模式偏差以换取稳定性;替换环境进行重光照时改用 BRDF 与光照重要性采样。旧环境下学到的高斯辐射颜色不能继续作为新环境的间接光,所以重光照另用 split-sum 近似计算一次反弹的间接辐射。

一个完整示例

设想手持一个带白色区域的物体,在同一房间内绕不同轴转动。这是机制示例,不是额外实验:第一阶段用掩码和邻帧匹配确认该白色区域在不同帧对应同一片粗表面;第二阶段恢复它的细法线,并统一整个序列的姿态。第三阶段发现这一区域有时暗、有时亮,但其规范空间材质应不变,于是必须主要通过旋转后的受光方向和自遮挡解释变化。

如果只绕单轴转动,某些法线能接触到的照明方向仍然有限;如果环境是均匀白光,旋转本身也不能产生新的方向性照明证据。因此收益来自运动和非均匀环境的相互作用,不是“视频天然比图片好”。最终替换环境贴图时,固定恢复出的材质,重新计算直接光与近似的一次反弹光,检验这份材质是否真的脱离了拍摄时的明暗。

损失函数 / 训练策略

阶段一组合照片重建、NeuS 的 eikonal 正则、掩码和跨帧匹配损失;它优先稳定表面和顺序跟踪。阶段二组合照片重建、法线正则、深度方差、使高斯趋于盘状的 rank 约束、SDF 的 median 与 projection 损失以及掩码损失,开展全局几何与姿态精化。

阶段三以物理渲染后的照片重建损失为主,并加入环境图及材质图的平滑损失;方法总述还说明该阶段联合优化几何与姿态,并非彻底冻结前两个阶段的结果。当前本地缓存只含正文,损失权重、学习率、训练步数及环境图分辨率计划等实现细节未能从中核实,不能补成确定超参数;损坏的 SDF 不透明度公式也不强行恢复。

实验关键数据

主实验

合成数据使用 HOT3D 资产中的 10 个物体,分别保留通常更偏镜面的原始材质,或改为保持反照率纹理的 Lambertian 漫反射材质。三种采集方式共享一组用于评估的视图;合成手持序列只有任意轴物体旋转,不显式渲染手。反照率及重光照尺度使用真实反照率归一化,因此指标不是绝对辐射尺度恢复的证明。

下表为原文表 3 的四段手持序列对比。PSNR 单位为 dB,越高越好;法线 MAE 为平均角度误差,越低越好。星号表示为旋转物体适配后的静态方法,不能当作原方法未经修改的成绩。

方法 环境图数量 反照率 PSNR 重光照 PSNR 法线 MAE
ReCap 10 21.91 25.74 8.06
ReCap 40 22.42 25.58 8.01
ReCap 100 22.31 25.20 8.08
SVG-IR* 1 33.40 32.22 3.69
IRGS* 1 40.26 32.99 0.56
DIR 1 41.03 39.65 0.51

相较 IRGS*,DIR 的反照率与重光照 PSNR 分别提高 0.77 和 6.66 dB。ReCap 将连续帧分组共享环境图:共享太多会过度近似,共享太少则引入过多待优化照明;从 10 张增加到 100 张环境图并没有解决这种不适配。

原文表 2 还在静态 TensoIR 基准检查渲染管线本身,避免把全部优势都归因于动态输入。

方法 反照率 PSNR 重光照 PSNR 法线 MAE
SVG-IR 30.27 31.19 4.19
IRGS 33.41 30.63 3.99
DIR 33.96 32.17 4.19

DIR 的两个 PSNR 最高,但法线误差并非最低。这一区别很重要:本文证明的是更好的分解与重光照,不是所有几何指标全面领先。

消融实验

下表摘录原文表 1 的采集设置与姿态来源对照,属于采集条件消融,不是删除某个网络模块的消融。静态穹顶是物体不动、相机绕行上半球;转台是单轴转动;手持是任意轴旋转。缓存中设置图标未保留,名称按正文说明和原表分组顺序对应。

材质 采集方式 姿态 反照率 PSNR 重光照 PSNR 法线 MAE
原始 静态穹顶 真实 36.72 38.14 0.83
原始 转台 估计 34.10 33.02 2.45
原始 转台 真实 36.15 36.01 1.20
原始 手持 估计 40.37 38.54 1.56
原始 手持 真实 40.72 40.24 0.53
漫反射 静态穹顶 真实 32.68 34.85 1.59
漫反射 转台 估计 32.97 33.04 1.83
漫反射 转台 真实 35.65 35.10 1.42
漫反射 手持 估计 40.33 40.37 0.75
漫反射 手持 真实 40.55 41.29 0.58

关键发现

  • 漫反射条件下,手持估计姿态相较静态真实姿态,反照率提高 7.65 dB,重光照提高 5.52 dB;运动收益没有被跟踪误差完全抵消。
  • 原始材质下,手持估计姿态的法线误差 1.56 高于静态真实姿态的 0.83,却仍获得更好的反照率,说明更准的法线不是收益的唯一解释。
  • 将手持姿态从估计换成真实,原始材质重光照从 38.54 提升至 40.24 dB,漫反射从 40.37 提升至 41.29 dB;姿态精度仍是有意义的瓶颈。
  • 图 5 的粗糙度分析表明,尖锐镜面高光本身就能约束光照,漫反射物体更依赖旋转带来的方向性证据。图 6 表明均匀白光不提供额外运动照明信息,而复杂环境会拉开动态与静态分解的差距;缓存没有这些曲线的完整数值,不另造表格。
  • 真实实验只有 2 个物体,在相同环境下分别进行静态和手持采集,提供更干净反照率及更合理重光照的定性证据,没有真实材质指标可填。

亮点与洞察

  • 采集轨迹也可以是一种物理约束设计。与额外学习材质先验不同,本文通过主动改变物体朝向,为同一未知量获得更有辨识力的观测。
  • 表示切换服务于不同阶段的误差结构。初期需要 NeuS 的平滑性防止姿态追随噪声,后期需要 SDF 高斯的细节与稳定法线支撑材质估计。
  • 重光照不应照搬训练阶段的间接光缓存。环境改变后重新近似一次反弹,比继续使用旧辐射颜色更符合物理依赖关系,这一点也适用于其他可重光照高斯系统。

局限与展望

  • 作者明确把手部遮挡、近场光照和非刚体物体列为后续方向。当前模型强调物体自遮挡,不能据此认为已经解决手投影、手部反射或位置相关近场照明。
  • 远场且时间不变的环境是核心假设;均匀照明或受限旋转不足以提供丰富约束。运动改善条件性,但没有证明材质与光照分解在一般情况下唯一可辨识。
  • 固定 \(F_0=0.04\) 面向介电材质,不能直接推广为任意金属、透明或复杂散射材料的恢复方案。这是依据材质参数化得出的适用范围判断。
  • 10 个合成物体、4 段动态基线序列和 2 个真实物体支撑了可行性,但不足以说明大规模真实泛化。尺度归一化也保留了绝对照明强度恢复的证据缺口。
  • 本地正文没有可核实的模块删除消融、完整姿态基准和运行成本,不能断言 SDF、匹配器或光线追踪各自贡献了多少,也不能宣称实时。更有价值的后续实验是分别控制旋转覆盖、姿态噪声与手部遮挡。

相关工作与启发

  • FMOV:提供虚拟相机和渐进跟踪思路;DIR 换用更强匹配器,并增加 SDF 高斯全局精化及物理材质分解,最终目标从几何重建走向可重光照资产。
  • DiscretizedSDF、SVG-IR、FastGS 与 3DGRT:分别支撑 SDF 高斯几何、局部空间变化材质、高效密度控制和光线追踪。本文价值主要是把这些部件组织到可靠的动态逆渲染流程,并验证运动带来的分解收益,不应把所有底层组件都算成新发明。
  • ReCap 与 IRGS:前者通过多环境采集建模照明,后者关注相互反射。DIR 的关键约束是物体运动而环境共享;它不是简单地为视频每一帧拟合独立光照。
  • 可迁移启发:面向主动采集,可以优先选择让已观察表面接触新照明方向的姿态,而不仅追求相机覆盖率。这是由本文机制引出的研究方向,尚非作者已验证的自动采集算法。

评分

  • 新颖性: 4/5。把刚体运动作为分解约束的实证主张清晰,底层表示和渲染组件则主要建立在已有方法上。
  • 实验充分度: 4/5。兼有采集、姿态、材质与环境分析及静动态基线,但真实规模较小,当前缓存缺少细粒度模块消融。
  • 写作质量: 4/5。三阶段动机与实验逻辑清楚,复现级细节需补充材料;缓存公式损坏不等于原文公式有误。
  • 价值: 4/5。对低门槛手持资产采集和重光照有直接启发,但适用性受刚体、远场和材质假设约束。