跳转至

Differentiable Polarized Path Tracing

会议: ECCV 2026
论文: ECCV 原文
项目: https://vcai.mpi-inf.mpg.de/projects/DPPT/
领域: 3D 视觉 / 可微渲染
关键词: 可微渲染, 偏振光传输, 路径重放反向传播, 穆勒-斯托克斯演算, 逆向渲染

一句话总结

针对偏振光传输中穆勒矩阵普遍降秩导致标准路径重放反向传播(PRB)矩阵求逆崩溃的问题,提出一种结合后缀辐射度紧凑缓存与混合检查点重算的无偏可微偏振路径追踪框架,以恒定显存与更高效率实现材质、粗糙度、法线及偏振光学器件的高保真逆向重建。

研究背景与动机

基于物理的可微渲染(Physically Based Differentiable Rendering, PBDR)通过反向模式自动微分,能够端到端优化场景的复杂几何、材质纹理与光照参数。然而,绝大多数现存的 PBDR 方法仅建模标量辐射强度(Radiometric Intensity),完全舍弃了光波振幅、相位与偏振态等丰富的物理线索。在现实物理世界中,偏振光对物体的菲涅尔反射、漫反射退偏振以及表面微观法线几何极其敏感,是解耦镜面反射与漫反射、消除表面法线双义性、区分相似材质的关键约束。

将偏振特性引入可微光线追踪却面临极为严苛的计算与数学瓶颈。在正向模拟中,偏振传输由穆勒-斯托克斯演算(Mueller-Stokes Calculus)刻画:光辐射度被扩展为 4 维斯托克斯向量(Stokes Vector),而表面散射(BSDF)及光学滤波被表达为 \(4 \times 4\) 的穆勒矩阵(Mueller Matrix)。若直接套用传统反向自动微分(Conv. AD),渲染循环中庞大的计算图检查点会令系统显存迅速耗尽(OOM)。路径重放反向传播(Path Replay Backpropagation, PRB)本是通过局部数值可逆性消解显存开销的黄金法则,但它的核心假设是局部散射因子在伴随遍历阶段可除、可逆。然而在偏振传输中,理想漫反射仅有第零分量非零,线性偏振片会完全滤除正交偏振态——这些极其常见的偏振物理操作所对应的穆勒矩阵均为奇异降秩矩阵,数学上根本不存在逆算子。若强行套用噪声正则化等数值求逆手段,会导致梯度严重失真甚至发生除零爆炸。

本文的核心矛盾在于:如何在不存储整条渲染循环巨额计算图(维持近乎恒定的显存占用)的前提下,严谨规避不可逆穆勒算子的求逆操作,并求得数学无偏的偏振反向梯度。核心 idea:放弃在伴随反向遍历中依赖穆勒逆矩阵抵消局部贡献的传统思路,提出「后缀辐射度缓存重放」(Cached Suffix Replay),在正向采样完成时通过紧凑数组反向折叠出各顶点的后缀偏振辐射度,在伴随重放时直接点对点取回后缀状态以无偏累积梯度,并辅以自适应退偏振检测的混合检查点重算策略,在极低显存下实现长光路偏振可微渲染。

方法详解

整体框架

本文方法的计算流建立在正向蒙特卡洛偏振路径追踪与伴随反向传播两个阶段之上。在正向遍历时,算法在追踪光线顶点 \(i\) 的同时记录局部出射、局部斯托克斯辐射度以及分离(detached)的穆勒传输因子;正向循环结束后,利用反向折叠快速构造所有光路顶点的后缀辐射度缓存。在伴随重放阶段,算法使用相同的随机种子重构同一几何光路,利用缓存中直接索引的后缀偏振辐射度,仅对当前局部的穆勒 BSDF 执行可微自动微分求导,从而彻底避开穆勒矩阵的显式求逆,生成严格无偏的场景参数梯度。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:场景参数与入射偏振光线"] --> B["正向采样与局部状态记录<br/>发射项 Le 与穆勒矩阵 M"]
    B --> C["后缀辐射度反向折叠缓存<br/>构造后缀偏振状态 L[i+1]"]
    C --> D["伴随光路重放与无偏梯度求解<br/>直接读取后缀,规避穆勒矩阵求逆"]
    D --> E["块级退偏振判别与混合重算<br/>长光路依据 DI 判据自适应降存"]
    E --> F["输出:无偏场景参数梯度 δπ"]

关键设计

1. 奇异穆勒矩阵下的逆算子失效分析:揭示标准路径重放在偏振传输中的数值崩溃本质

标准标量 PRB 在伴随反向阶段能够以恒定显存运行,关键在于正向累加的辐射度可以通过除以局部标量 BSDF 因子逐步“剥离”后继光路的贡献。但在偏振传输中,光线状态由 4 维斯托克斯向量 \(\mathbf{s} = [s_0, s_1, s_2, s_3]^\top\) 表达,表面相互作用对应 \(4 \times 4\) 穆勒矩阵 \(\mathbf{M}\)。例如理想朗伯漫反射表面将入射光完全退偏,其穆勒矩阵仅有 \((0,0)\) 项即反照率 \(\alpha\) 非零,其余 15 个分量均为 0,矩阵秩仅为 1;用于调制偏振态的线偏振片滤除正交线偏振和圆偏振态,矩阵秩通常仅为 2。若机械地套用标准 PRB 算法(如对 \(\mathbf{M}\) 添加对角高斯噪声 \(\mathbf{M} + u\mathbf{I}_4\) 强行求逆),虽然理论上随机噪声期望为零,但在实际高维非凸优化中,病态矩阵条件数会引入灾难性的数值振荡与梯度方差,导致粗糙度和法线梯度相对误差飙升至 140% 以上。

2. 后缀辐射度缓存重放(Cached Suffix Replay):通过局部双向折叠消除矩阵求逆

为了在不产生求逆的前提下获得精确的伴随输入,本文提出一种基于光路后缀折叠的轻量化存储机制。在正向采样过程(sample_polarized_primal)中,系统仅需在每个路径顶点 \(i \in \{0, \dots, N-1\}\) 处使用紧凑局部数组保存分离的局部自发光项 \(\mathbf{L}_e\) 和局部归一化穆勒因子 \(\boldsymbol{\beta}_i = \mathbf{M}_i / p(\omega_i)\)。正向循环结束后,在离开局部作用域前执行一次从尾到头的反向线性折叠(Backward Fold):

\[\mathbf{L}[j] \leftarrow \mathbf{L}[j] + \boldsymbol{\beta}[j] \mathbf{L}[j+1], \quad \text{for } j = N-2, \dots, 0\]

这一折叠将当前顶点之后所有弹射贡献的偏振光累积结果直接浓缩为 4 维斯托克斯向量 \(\mathbf{L}[j]\)。在伴随阶段(sample_polarized_adjoint),当算法沿着相同光路正向重放推进至顶点 \(i\) 时,直接从缓存数组取回后缀入射辐射度 \(\mathbf{L}_i = \mathbf{L}[i+1]\),随后执行可微计算:

\[\delta \pi \mathrel{+}= \text{backward}\left( \delta \mathbf{L}^\top \boldsymbol{\beta}_{\text{replay}} \mathbf{M}_i \mathbf{L}[i+1] \right)\]

这种局部两阶段机制彻底规避了矩阵求逆,且只存 4 维斯托克斯向量而非整个计算图的节点闭包,相比于传统反向模式自动微分(Conv. AD),显存开销从与场景参数/循环复杂度成正比降低到了与光路深度呈浅层线性,同时保证导数数学无偏。

3. 块级检查点混合重放(Hybrid Cached Replay):依据去偏振指数动态平衡显存与重算开销

尽管后缀缓存重放对于常见渲染深度(如 \(N \le 32\))已经足够轻量,但在高弹射、复杂腔体等超长光路下,每个顶点都保存局部斯托克斯状态仍会使寄存器与显存占用随深度线性增加。为此,本文设计了带自适应退偏振检测的混合检查点重放。算法以固定步长 \(k\)(如 \(k > 1\))设置检查点,仅在检查点位置保存后缀辐射度。在两个检查点之间的中间顶点,算法计算该块累积穆勒吞吐量 \(\bar{\mathbf{M}}\) 的去偏振指数(Depolarization Index, \(\text{DI}(\bar{\mathbf{M}})\)):

\[\text{suffix recovery} = \begin{cases} \text{标量 PRB 更新}, & \text{若 } \text{DI}(\bar{\mathbf{M}}) < \gamma \\ \bar{\mathbf{M}}^{-1} \mathbf{L}, & \text{若 } \text{DI}(\bar{\mathbf{M}}) \ge \gamma \text{ 且 } \sigma_{\min}(\bar{\mathbf{M}}) > \varepsilon \\ \text{递归前向局部重算}, & \text{其他情况} \end{cases}\]

当介质发生强烈多次散射、去偏振指数低于阈值 \(\gamma\) 时,光束已退化为自然光,退化为无偏振标量 PRB 更新即可满足精度;当传输依然保持偏振但矩阵良态(最小奇异值大于 \(\varepsilon\))时,允许直接求逆;其余降秩或奇异情况则采用局部检查点向后重算。该混合机制在数十至上百次弹射的严苛极端场景下,有效压制了显存膨胀。

实验关键数据

主实验

实验在单张配备 24 GiB 显存的 NVIDIA GeForce RTX 4090 工作站上运行。首先,在梯度正确性评测中,以高精度传统自动微分(Conv. AD)为基准,使用相对误差(Relative Error, RE,能更敏感地度量微小梯度的相对偏差)对比了噪声正则化偏振 PRB(P-PRB)、偏振辐射反向传播(P-RB)以及本文方法:

评测场景 优化目标参数 P-PRB (RE) P-RB (RE) 本文方法 Ours (RE) 基准 Conv. AD (RE)
Living Room 漫反射纹理(Diffuse Texture) 1.4939 0.3907 0.3815 参考基准(0.0000)
Aluminium Vase 法线贴图(Normal Map) 0.6905 0.1398 0.1398 参考基准(0.0000)
Clock 粗糙度纹理(Roughness Texture) 2.7589 0.1235 0.1235 参考基准(0.0000)
Cornell Box 线偏振片旋转角 \(\theta\) 0.3269 0.0209 0.0210 参考基准(0.0000)

在偏振逆向渲染全流程优化任务中,对比了传统 Conv. AD、传统标量非偏振 PRB 与本文方法在参数恢复均方根误差(RMSE)上的表现:

逆向优化任务 核心挑战与优化参数 标量 PRB (RMSE) 本文偏振可微 (RMSE) 传统自动微分 Conv. AD
Kitchen 厨房消眩光 滤光片旋转角 \(\theta\) 消除灶台镜面高光 12.1848 3.9550 OOM(显存溢出)
Veach 复杂光照平板 漫反射与高光粗糙度联合解耦 0.2491 0.1274 0.1272
Living Room 地板重建 多次间接反射下的漫反射纹理恢复 0.2679 0.0069 OOM(显存溢出)
Marble Bust 雕像法线 多视角(12 视点)1K 高分辨率法线图 0.04761 0.04196 OOM(显存溢出)

消融实验与性能评测

结合投射采样(Projective Sampling)与偏振后缀重放的单视角 3D 几何与法线重建消融分析(7 个复杂网格几何平均):

渲染机制配置 倒角距离 Chamfer Distance ↓ 法线角度误差 Normal Error ↓ 几何边缘重构质量
纯标量非偏振基线(Unpolarized Baseline) 0.1874 65.61° 轮廓平滑退化,高频凹凸缺失
本文偏振可微几何优化(Polarized Ours) 0.0904(↓ 51.8%) 46.72°(↓ 18.89°) 边缘轮廓锐利,微细结构保真

在现代大厅(Modern Hall)场景中引入 85 组级联线偏振片构建极端长光路(分辨率 \(1280 \times 720\),1 spp),对地板反照率求梯度的性能测试显示: - 显存消耗(Memory Consumption):Conv. AD 在光路弹射增加时显存开销急剧飙升,在 NVIDIA RTX 5090 上迅速遭遇 OOM;本文后缀缓存法在弹射深度达到 32 之前显存近乎恒定,深层光路下仅有极为平缓的微弱增长。 - 运行时间(Runtime):P-PRB 耗时虽短但梯度完全错误(RE > 2.0);P-RB 虽保持无偏,但在长光路下的反向遍历开销极其昂贵;本文方法在保持无偏梯度的同时,运行速度约为 P-RB 的 2 倍(\(2\times\) 加速)。

关键发现

  • 奇异穆勒算子是偏振可微失败的根源:实验表明,单纯给奇异穆勒矩阵施加高斯对角噪声(P-PRB)无法解决求逆病态问题,在粗糙度优化中梯度相对误差高达 2.7589,反向优化彻底跑飞。
  • 偏振信号是解除材质解耦多义性的利器:在 Veach 平板任务中,标量 PRB 无法区分高漫反射低粗糙与低漫反射高粗糙的组合(RMSE 0.2491),而偏振测量利用正交与平行偏振光反射率差异直接锁死解空间,使误差减半降至 0.1274。
  • 无偏重放能够突破高分辨率逆向渲染的显存壁垒:Conv. AD 在 1K 多视角法线恢复和复杂多反场景中均因为要维持计算图而 OOM,本文方法则凭借常量级的局部缓存顺利完成全分辨率端到端迭代。

亮点与洞察

  • 后向折叠避免显式矩阵逆算:巧妙利用光路正向跟踪结束时的拓扑确定性,在正向退出前进行单次反向斯托克斯向量累积折叠,将原本在伴随阶段必须计算的逆算子求值转换为常量数组的顺序查表,简洁规避了降秩求逆难题。
  • 去偏振物理先验与算法分级的协同:引入去偏振指数 \(\text{DI}\) 作为光路混合检查点的自适应闸门,深刻契合了多重散射快速退偏的自然物理规律,将重算与求逆的取舍转化为物理状态自适应判定。
  • 无缝兼容不连续几何可微渲染:成功将偏振后缀缓存重放注入到处理可见性不连续边缘的投射采样积分器中,证明了偏振物理建模与几何边界可微并不冲突,可共同赋能单目 3D 几何的高精度雕刻。

局限与展望

  • 目前未涵盖次表面散射(BSSRDF)传输:论文当前的实现主要基于表面散射模型(BSDF),尚未将偏振可微追踪拓展至半透明介质内部的辐射传输方程(ERT)。由于大理石、玉石和人体皮肤在次表面传输中具有强烈的浅层偏振保留与深层各向同性退偏特性,未来拓展至 BSSRDF 将是分离表皮高光与半透明内散射的关键。
  • 计算图局部依然存在斯托克斯维度扩张:虽然消除了全局反向计算图,但单个顶点的局部状态从单通道/三通道标量扩展为了 \(4 \times 4 \times 3\) 的四维张量,在超大规模光子图或密集采样点云下的寄存器压力依然高于纯标量渲染器。
  • 计算光学器件设计的泛化探索:作者指出当前重点验证了材质与法线逆向问题,未来可拓展至精密超表面(Metasurface)、增强现实光波导(Waveguide Display)等偏振敏感型微纳光学系统的端到端逆向设计。

相关工作与启发

  • vs Path Replay Backpropagation (PRB) [Vicini et al. 2021]:标量 PRB 依赖局部散射标量值的代数可逆性来剥离后继辐射度。本文指出偏振 Mueller 算子的本质降秩性导致经典 PRB 彻底失效,通过引入正向反向折叠缓存打破了对局部逆算子的强假设。
  • vs Radiative Backpropagation (RB) [Nimier-David et al. 2020]:虽然 RB 的偏振拓展版 P-RB 同样能够产生无偏梯度,但其伴随双向方程的收敛速度与多次光路求值开销巨大;本文后缀缓存重放实现了近乎 \(2\times\) 的运行加速,且显存开销远低于传统 AD。
  • vs 传统 Shape from Polarization (SfP) 与 NeRSP [Han et al. 2024]:传统 SfP 和基于 NeRF/3DGS 的偏振工作大多仅将偏振角(AoP)或线偏振度(DoLP)作为损失函数中的几何法线伪标签正则项;本文则深入光线追踪积分底层,直接构建了偏振物理全输运的可微梯度传播引擎。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性攻克了偏振光传输中穆勒矩阵奇异降秩导致的求逆崩溃问题,提出了首个实用的可微偏振路径追踪框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖梯度数值相对误差对比、多参数逆向渲染、高精度单目 3D 几何优化及超长光路显存/速度基准测试,实验设计严谨完备。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义直切本质,算法伪代码逻辑清晰,图表展示与物理分析层次分明。
  • 价值: ⭐⭐⭐⭐⭐ 填补了基于物理的可微渲染从传统标量向全矢量偏振传输演进的底层基石空白,对逆向外观建模、材质解耦与光学逆设计具有重要通用价值。