Physics-Guided Deep Learning for Linear Mueller Matrix Acquisition¶
会议: ECCV 2026
论文: ECCV 原文
领域: 其他
关键词: 偏振成像、穆勒矩阵、pBRDF、物理引导深度学习、逆向渲染
一句话总结¶
针对传统穆勒矩阵成像需多次切换入射偏振态导致效率低下的难题,本文提出一种两阶段物理引导深度学习框架,仅凭固定已知入射偏振态下单次曝光的四通道偏振图像与目标掩模,联合估计 pBRDF 参数生成结构化先验并通过双分支残差网络重构出高保真、满足物理自洽约束的 \(3 \times 3\) 线性穆勒矩阵。
研究背景与动机¶
偏振作为光波区别于强度和相位的固有正交属性,能够精细刻画介质与物体表面的微观形貌、折射率及各向异性退偏特性。在偏振光学与计算机视觉中,穆勒矩阵(Mueller Matrix)提供了从入射斯托克斯矢量到出射斯托克斯矢量的完整线性变换算子,其内部元素由被测物本身的固有物理特性决定,完全独立于入射光偏振状态。因此,高精度获取穆勒矩阵在生物医学组织诊断、工业微纳缺陷检测以及三维表面法向测量等领域具有不可替代的价值。
然而,实用化的高精度穆勒矩阵获取一直受制于采集效率与物理可解释性两重瓶颈。从数学本质上看,完全求解一个局部穆勒矩阵至少需要四组互不共线的独立入射-出射偏振光对。即便是采用微偏振阵列(DoFP)焦平面相机实现单次曝光捕获四个线偏振方向(\(0^\circ, 45^\circ, 90^\circ, 135^\circ\)),传统时分时序测量仍必须在光源端机械或电光切换至少四次入射偏振态,采集耗时长、极易受运动模糊扰动。而基于分析型偏振双向反射分布函数(pBRDF)的正向物理拟合路线,虽然具有天然的矩阵参数化约束,却严重依赖先验已知的稠密表面法向量、粗糙度与双向几何关系,且因理想微表面假设无法适应真实世界的复杂散射与微观结构失配。反之,纯数据驱动的端到端神经网络虽具备单步映射能力,却常产生违反光学可实现性约束的退化算子。
本文的切入角度是:物理分析模型与神经网络并非替代关系,而是互为补充的骨架与肌肉——分析型 pBRDF 能够从稀疏观测中提供具备明确物理对称性与衰减规律的宏观初始化,而神经网络则专注于学习表面非理想散射与模型失配带来的残差修正。核心 idea:将单次曝光线性穆勒矩阵恢复解构为「先验参数化粗建 + 偏振解耦残差优化」的两阶段物理引导学习,利用 PIPNet 预测几何与反射参数构建分析型 pBRDF 穆勒矩阵初值,再由双分支 PMMNet 在色度解耦与通道分离约束下完成高保真度残差精修。
方法详解¶
整体框架¶
本文方法的输入为已知固定入射偏振态下单次 DoFP 相机采集的四幅线偏振图像 \(P = (I_0, I_{45}, I_{90}, I_{135})\) 及目标二值掩模 \(\text{Mask}\)。整个推理与恢复流水线由两级级联神经网络组成:第一阶段通过偏振初始化参数网络(PIPNet)从偏振图像中解耦估计稠密表面法向 \(\mathbf{n}\)、漫反射反照率 \(\mathbf{k}_d\)、表面粗糙度 \(\sigma\) 与入射光源方向 \(\boldsymbol{\omega}_i\);将上述参数代入解析式 pBRDF 模型中,生成具备宏观物理约束的粗略镜面穆勒矩阵 \(\mathbf{M}^s_{\text{init}}\) 与漫反射穆勒矩阵 \(\mathbf{M}^d_{\text{init}}\)。第二阶段由偏振穆勒矩阵网络(PMMNet)接收测量斯托克斯向量与初值矩阵,通过镜面与漫反射专用分支分别对有效偏振通道进行残差学习,最终与色度权重重组为 27 维全彩线性穆勒矩阵 \(\mathbf{M}_{\text{opt}}\)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单次曝光四通道偏振图像 P + 目标掩模 Mask<br/>(固定已知入射偏振态)"] --> B["阶段 1:PIPNet 物理参数估计<br/>解耦预测法向 n、漫反射 albedo kd、粗糙度 σ、光向 ωi"]
B --> C["解析型 pBRDF 模型初值构建<br/>生成结构化镜面 Ms_init 与漫反射 Md_init"]
C --> D["阶段 2:PMMNet 降维残差优化<br/>偏振-色度解耦与冗余通道分离双分支残差精修"]
D --> E["色度与通道复原组装<br/>输出 3×3 全彩线性穆勒矩阵 Mopt (27维)"]
关键设计¶
1. PIPNet 物理参数估计:多头共享骨干解耦几何与反射元
从单张单偏振态图像反演穆勒矩阵属于高度欠定逆问题,若直接预测高阶算子极易落入局部极小值。PIPNet 采用类 U-Net 编解码共享骨干网络,通过特征分叉实现几何形貌与辐射属性的多任务协同解耦。网络主干抽取多尺度偏振特征后,并行分化为三个全分辨率像素级回归分支,分别输出经单位化的三维表面法向场 \(\mathbf{n} \in \mathbb{R}^{H \times W \times 3}\)、三通道漫反射反照率 \(\mathbf{k}_d \in \mathbb{R}^{H \times W \times 3}\) 以及全局光照方向 \(\boldsymbol{\omega}_i \in \mathbb{R}^{H \times W \times 3}\)。针对全图共用的标量微表面粗糙度 \(\sigma\),在编码器尾端接入全局平均池化与多层感知机进行紧凑回归。这种设计显式将低级偏振观测量映射至标准 pBRDF 物理参数空间,消除了传统拟合方法对同轴光源假设或额外光度立体图集的严苛依赖。
2. 解析型 pBRDF 模型初值构建:以物理反射机制锚定基础几何结构
为了让深度网络免于在毫无先验的无界矩阵空间中盲目搜索,本文利用经典微表面 pBRDF 解析方程为每一点合成初始线性穆勒矩阵。将折射率固定为常见电介质基线 \(\eta = 1.5\)、镜面反射系数标称设为 \(k_s = 1\),出射方向 \(\boldsymbol{\omega}_o\) 由相机标定模型直接确定。将 PIPNet 输出的 \((\mathbf{n}_{\text{init}}, \mathbf{k}_{d,\text{init}}, \sigma_{\text{init}}, \boldsymbol{\omega}_{i,\text{init}})\) 馈入解析模型,解耦生成代表各向同性微表面菲涅尔镜面反射的矩阵场 \(\mathbf{M}^s_{\text{init}}\) 与次表面/多重散射漫反射矩阵场 \(\mathbf{M}^d_{\text{init}}\): $\(\mathbf{M} = k_s \mathbf{M}^s + \mathbf{k}^d \mathbf{M}^d\)$ 此初始化虽然由于理想化朗伯与菲涅尔假设存在模型失配误差,但其严格满足穆勒矩阵的迹定理、对角互易对称性以及出入角度几何约束,为后续残差网络构筑了坚固且不可穿透的物理边界。
3. PMMNet 降维残差优化:偏振-色度解耦与通道分离精修
直接回归三通道 RGB 对应的 \(3 \times 3 \times 3 = 27\) 维穆勒矩阵不仅参数量膨胀,更极易引发不同颜色通道间的偏振相位解耦失真。作者引入双重降维策略破解优化复杂度瓶颈:首先进行偏振-色度解耦,基于常见非色散介质材料偏振转移矩阵在可见光波段色差极弱的物理特性,将 27 维全彩张量剥离为波长无关的单通道 \(3 \times 3\) 基础偏振块,颜色转移完全由反照率标量承载;其次提出冗余通道分离,依据镜面与漫反射物理机制的元素稀疏性,镜面分支仅针对高频显著的 5 个关键元素 \(\{m_{00}, m_{11}, m_{12}, m_{21}, m_{22}\}\) 进行残差更新,而漫反射分支仅针对与去极化和保偏衰减直接相关的 5 个元素 \(\{m_{00}, m_{01}, m_{02}, m_{10}, m_{20}\}\) 学习残差。镜面分支集成高频注意力机制精准锁定反光高光区,漫反射分支采用多头通道注意力捕获全域能量分布。精修后将两组 5 维特征扩充回 9 维矩阵,漫反射项按三通道反照率广播乘法,最终合成紧凑精准的全局穆勒算子。
损失函数 / 训练策略¶
第一阶段 PIPNet 采用法向余弦相似度与物理参数的复合 \(L_1\) 损失进行监督: $\(\mathcal{L}_{\text{PIPNet}} = \mathcal{L}_{\cos}(\mathbf{n}_{\text{init}}, \mathbf{n}_{\text{GT}}) + 0.5\mathcal{L}_1(\mathbf{k}_{d,\text{init}}, \mathbf{k}_{d,\text{GT}}) + 0.5\mathcal{L}_1(\boldsymbol{\omega}_{i,\text{init}}, \boldsymbol{\omega}_{i,\text{GT}}) + 0.3\mathcal{L}_1(\sigma_{\text{init}}, \sigma_{\text{GT}})\)$
第二阶段 PMMNet 的训练不仅监督预测穆勒矩阵与真值间的绝对矩阵误差,更引入了关键的斯托克斯正向一致性损失 \(\mathcal{L}_{\text{Stokes}}\)。通过预先选取非偏振、水平线偏振与 \(45^\circ\) 线偏振构成的测试集 \(\mathcal{K} = \{[1,0,0]^T, [1,1,0]^T, [1,0,1]^T\}\),强迫网络生成的穆勒矩阵在虚拟正向投影下产生物理一致的出射偏振态: $\(\mathcal{L}_{\text{PMMNet}} = \mathcal{L}_1(\mathbf{M}, \mathbf{M}_{\text{GT}}) + \mathcal{L}_{\text{Stokes}}(\mathbf{S}^{\text{out}}_{\text{pred}}, \mathbf{S}^{\text{out}}_{\text{GT}})\)$ $\(\mathcal{L}_{\text{Stokes}} = \frac{1}{|\mathcal{K}| \cdot |\mathcal{V}|} \sum_{c \in \{R,G,B\}} \sum_{\mathbf{S}^{\text{in}} \in \mathcal{K}} \sum_{p \in \mathcal{V}} \left\| \mathbf{S}^{\text{out}}_{c,\text{pred}}(p) - \mathbf{S}^{\text{out}}_{c,\text{GT}}(p) \right\|_1\)$ 网络采用两阶段分步训练策略,优化器为 Adam,输入图像分辨率统一为 \(256 \times 256\)。PIPNet 训练 40 个 epoch,初始学习率 \(2 \times 10^{-4}\) 并在线性衰减;PMMNet 训练 20 个 epoch,在后 10 个 epoch 衰减学习率。
实验关键数据¶
主实验¶
评估在合成数据集(基于 Mitsuba 3 渲染和 KAIST 真实偏振反射测量集)与作者搭建转台自采的 12 目标真实偏振多角度数据集上展开。对比基线包括引入真值几何参数下经典分析型拟合方法 Baek 等人、Hwang 等人以及 Ichikawa 等人。评估指标包括穆勒矩阵 PSNR、重投影渲染 PSNR/SSIM、线偏振度(DoLP)平均绝对误差(MAE)以及线偏振角(AoLP)包裹角误差(度)。
| 数据集 | 方法 | 矩阵 PSNR (dB) ↑ | 渲染 PSNR (dB) ↑ | 渲染 SSIM ↑ | DoLP MAE ↓ | AoLP 角度误差 (deg) ↓ |
|---|---|---|---|---|---|---|
| Synthetic | Baek et al. [5] | 46.15 | 38.27 | 0.8892 | 0.0830 | 57.98 |
| Synthetic | Hwang et al. [19] | 48.56 | 38.12 | 0.9393 | 0.0801 | 57.08 |
| Synthetic | Ichikawa et al. [21] | / | 38.95 | 0.9058 | 0.0789 | 48.21 |
| Synthetic | Ours | 51.70 | 43.87 | 0.9950 | 0.0782 | 34.51 |
| Real | Baek et al. [5] | 26.63 | 23.11 | 0.8998 | 0.1610 | 71.62 |
| Real | Hwang et al. [19] | 28.27 | 23.80 | 0.8984 | 0.0865 | 74.03 |
| Real | Ichikawa et al. [21] | / | 26.67 | 0.9051 | 0.1057 | 65.49 |
| Real | Ours | 40.42 | 32.33 | 0.9895 | 0.0749 | 24.34 |
消融实验:未见入射态正向斯托克斯预测验证¶
为严格检验恢复得到的穆勒矩阵是否真正具备物理算子传递能力(而非单纯过拟合单次曝光下的特定数值匹配),作者设计了前所未见的 11 种入射偏振态正向预测实验。测试状态未参与任何网络前向推理或后验优化。对比模型包括纯分析型参数预测(PIPNet-pBRDF)、最优参数真值解析拟合(GT/Best-fit pBRDF)、多任务联合预测基线(Joint pBRDF/MM multi-task)、无物理先验的纯黑盒端到端映射(Direct Stokes→MM)以及完整本文框架。
| 数据集 | 模型配置 | 正向 Stokes \(L_2\) 误差 ↓ | DoLP MAE ↓ | AoLP 角度误差 (deg) ↓ | 说明 |
|---|---|---|---|---|---|
| Synthetic | PIPNet-pBRDF | 0.4065 | 0.1346 | 45.75 | 仅依赖预测物理参数做解析生成 |
| Synthetic | GT/Best-fit pBRDF | 0.2715 | 0.0963 | 44.60 | 理想参数拟合上限依然存在模型失配 |
| Synthetic | Joint pBRDF/MM multi-task | 0.0457 | 0.0614 | 44.92 | 并行多任务缺乏串行先验约束 |
| Synthetic | Direct Stokes→MM | 0.0433 | 0.0471 | 42.03 | 纯黑盒神经网络直接回归算子 |
| Synthetic | Ours (完整流水线) | 0.0214 | 0.0391 | 37.88 | 物理先验初值 + 残差精修带来最佳外推精度 |
| Real | PIPNet-pBRDF | 0.6450 | 0.1318 | 50.44 | 真实场景下参数与解析模型误差被放大 |
| Real | Best-fit pBRDF | 0.4953 | 0.0994 | 44.72 | 无法捕捉真实漫反射微结构退偏 |
| Real | Joint pBRDF/MM multi-task | 0.1965 | 0.0786 | 28.36 | 多任务难以化解严重欠定性 |
| Real | Direct Stokes→MM | 0.1615 | 0.0721 | 29.84 | 纯数据驱动外推误差显著 |
| Real | Ours (完整流水线) | 0.0926 | 0.0642 | 26.57 | 在真实数据上将正向误差大幅削减 42.7% |
关键发现¶
- 在矩阵级数值精度与正向渲染表现上,本文方法在真实数据上的穆勒矩阵 PSNR 达到 40.42 dB,相较表现最好的分析型基准 Hwang et al.(28.27 dB)实现了超过 12 dB 的跃升,且在真实数据上将 AoLP 误差由 \(74.03^\circ\) 压降至 \(24.34^\circ\)。
- 在外推泛化能力评测中,纯黑盒端到端映射(Direct Stokes→MM)的正向 Stokes \(L_2\) 误差(合成 0.0433 / 真实 0.1615)远劣于本文两阶段模型(合成 0.0214 / 真实 0.0926),证明 pBRDF 显式先验所注入的物理结构是保证算子可泛化性的关键。
- 物理合理性检验表明:在严格的 Givens-Kostinski(GK)物理判据下,传统分析型方法在真实数据上的像素通过率仅为 33.91%,而本文方法可达 86.94%(合成数据达 98.25%),且协方差半正定检验通过率达 100%,证明了预测矩阵绝非纯粹的数值拟合,而是高度符合物理真实光学算子法则。
亮点与洞察¶
- 物理与残差协同的解题范式:将传统需 4 次物理切换入射偏振态的病态欠定逆问题,重构为「解析参数化先验生成 + 稀疏残差精调」框架,在算子级实现了物理先验防发散与神经网络强表征的优势互补。
- 正交性降维设计避免过拟合:提出偏振-色度解耦与通道分离策略,将 27 维复杂张量压缩并解耦为镜面与漫反射各自独立的 5 维核心特征,以极简的目标空间大幅提升了收敛效率并避免了通道串扰。
- 可复用的物理正则化思想:引入多态入射虚拟正向投影的斯托克斯一致性损失 \(\mathcal{L}_{\text{Stokes}}\),强制神经网络学习到的线性算子在算子代数空间具备稳健的外推预测能力,该机制可直接迁移至一般偏振反演、双向散射表面重建等计算成像任务中。
局限与展望¶
- 主动点光源假设的约束:算法当前严重依赖于标定完备的单一主动点光源与已知入射偏振态,在室外自然漫射光、非均匀环境光或扩展光源下,初始 PIPNet 的法向与物理参数估计精度将面临挑战。
- 纯线偏振测量的维数局限:基于商业级 DoFP 微偏振阵列相机的硬件限制,算法仅重构 \(3 \times 3\) 线性穆勒矩阵,未考虑圆偏振分量(如第 4 行与第 4 列的相位延迟退偏项),无法表征强手性或具有显著光学旋光活性的特殊介质。
- 色散弱相关性假设的边界:偏振-色度解耦建立在大部分人造与自然材料可见光波段偏振效应弱色散的基础上;对于具有强烈波长选择性二向色性或复杂次表面色度散射特性的材质,该假设会导致色彩边缘处的轻微重建残差。
相关工作与启发¶
- vs Baek et al. [ACM TOG 2018]: Baek 等人依靠同轴偏振光与结构光进行极度耗时的多步非线性数值拟合以获取 pBRDF 参数。本文仅需单次曝光捕获四幅偏振图,结合神经网络秒级反演,并在拟合精度与泛化能力上全面大幅超越其解析模型。
- vs Hwang et al. [ACM TOG 2022] / Ichikawa et al. [CVPR 2023]: 现有先进物理模型通常聚焦于局部偏振特征(如 DoLP 拟合)或需要高密集采样序列。本文首次实现了面向通用三维目标的高阶线性穆勒矩阵单发全图重构,并在下游偏振三维重建(SfP)与材质分类中展示出高阶算子的信息保真增益。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将物理 pBRDF 分析模型与双分支残差网络相结合,实现单次曝光四通道线偏振图像下的高阶全彩线性穆勒矩阵恢复。
- 实验充分度: ⭐⭐⭐⭐⭐ 兼具合成数据与自研高精转台多光源真实数据集,测试涵盖矩阵误差、未见态正向预测、严格 GK 物理可实现性诊断以及下游法向优化与材质分类。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑推导层次清晰,物理公式定义严密,实验设置充分针对逆问题算子退化痛点。
- 价值: ⭐⭐⭐⭐⭐ 将传统笨重、耗时、机械切换的偏振测度仪体系精简至单镜头常规 DoFP 单发成像,为工业视觉检测与物理引导逆向渲染提供了全新算子级基础设施。