跳转至

SHINE-PPG: Non-Lambertian Intrinsic Decomposition for Illumination-Robust rPPG

会议: ECCV 2026
论文: ECCV 官方页面
代码: https://github.com/Edmond-Yang/SHINE-PPG
领域: 人体理解
关键词: 远程光电容积脉搏波描记 (rPPG), 非朗伯体本征图像分解, 镜面高光分离, 自监督学习, 对抗光照增强

一句话总结

针对非接触生理监测中环境光剧烈波动与面部皮肤油汗镜面高光导致的脉搏信号严重失真问题,SHINE-PPG 提出自监督非朗伯体本征分解框架,将面部视频解耦为漫反射率、环境照度与稀疏镜面高光,并在反射率表征上结合可学习 AdaIN 对抗光照增强,实现了极端与未见动态光照下的高保真 rPPG 信号提取。

研究背景与动机

远程光电容积脉搏波描记(Remote Photoplethysmography, rPPG)通过普通摄像头捕获心脏搏动周期在面部微血管中引起的微弱肤色强弱周期变化,在健康监护、人机交互与活体人脸防伪等领域展现出巨大的非接触感知潜力。然而,该生理波动极其脆弱,在真实非受控场景中极易被环境光照干扰所彻底淹没——例如车辆颠簸造成的日光光斑交替、车内阴影快速位移以及人工光源的交流频闪,其光强变化幅度往往比血流脉搏容积微变化高出数个数量级。近年来,主流研究尝试通过引入背景区域作为环境光照先验来抵消面部噪点(如 ND-DeeprPPG、Shao 等人的方法),或借助经典 Retinex 理论分解光照与反射分量以提升鲁棒性。

然而,现存光照感知方案存在两大核心物理瓶颈与理论缺陷:其一,基于背景先验的模型高度受制于训练数据的特定光线模式,当遇到未见或复杂的动态光照时域外泛化(OOD)能力严重退化;其二,现有的 Retinex 分解方法完全建立在理想的朗伯体(Lambertian)漫反射表面假设之上,将人体皮肤等效为绝对粗糙哑光表面。但现实中面部皮肤由于油脂分泌、汗液蒸发以及特定角度直射光,不可避免地产生强烈的非朗伯体镜面高光(Specular Highlights)。根据双色反射模型(Dichromatic Reflection Model, DRM),镜面反射直接映射光源色度与极高亮度,完全不包含皮下毛细血管微循环的脉搏容积生理信息。传统的朗伯体 Retinex 强行将这些未建模的镜面高光残差留在反射率分量中,形成局部过曝高亮伪影,彻底污染了反射率中的微弱生理周期信号。

针对这一本质物理矛盾,本文跳出传统朗伯体假说的束缚,直接拥抱非朗伯体光学成像机制。核心 idea:将面部视频自监督解耦为环境照度、本征反射率和镜面高光三路独立物理分量,依托暗通道先验与频域分异约束将无生理信息的镜面高光与低频光照彻底剥离,并利用可学习 AdaIN 动态合成最具挑战性的域外对抗光照,迫使生理估计器专精于本征反射率并实现超强 OOD 泛化。

方法详解

整体框架

SHINE-PPG 的整体流水线围绕视频序列的时空物理成像分解与对抗光照扩展展开。对于输入的 \(T\) 帧面部视频序列 \(V = \{V_t\}_{t=1}^T\),系统不再直接回归波形,而是通过三路专用的特征提取器与跳跃连接对称解码器结构,将其显式解耦为三个物理分量:表征环境光照时空分布的低频平滑照度分量 \(\bar{L} = \{\bar{L}_t\}_{t=1}^T\)、承载皮下血管脉动与固有肤色纹理的本征漫反射率分量 \(\bar{R} = \{\bar{R}_t\}_{t=1}^T\)、以及捕获面部油光与过曝反光的稀疏镜面高光分量 \(\bar{H} = \{\bar{H}_t\}_{t=1}^T\)。由于本征生理信号仅寄宿于漫反射率中,rPPG 估计器 \(E\) 仅以提纯后的反射率特征 \(F_R(V)\) 作为输入来推断脉搏波形 \(\bar{S}\)。

为了保证无物理真值标签下的自监督分解稳定性,框架引入色彩抖动(Color Jitter)生成成对样本 \(V^{\text{aug}}\) 驱动一致性约束;同时,构建了一个基于可学习自适应实例归一化(AdaIN)的对抗光照增强模块 \(A\),通过最大化 rPPG 估计误差动态生成困难且未见的光照分布 \(\bar{L}_{\text{adv}}\),与提纯后的 \(\bar{R}\) 重新合成对抗样本,全方位锤炼估计器在极端光照下的鲁棒性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    IN["输入面部视频 V<br/>及其扰动对 V_aug"] --> DEC["自监督非朗伯体三路本征分解<br/>提取器与解码器对 (F, D)"]
    subgraph S_DEC["本征物理分量解耦"]
        direction TB
        DEC --> L_COMP["平滑照度分量 L<br/>时空光照分布"]
        DEC --> R_COMP["本征反射率分量 R<br/>纯净生理与皮肤纹理"]
        DEC --> H_COMP["镜面高光分量 H<br/>局部稀疏反光"]
    end
    H_COMP --> SPEC_PHY["物理约束镜面高光分离<br/>L1稀疏 + 暗通道KL散度 + 光源色度一致性"]
    L_COMP --> FREQ_DEC["频域多尺度约束分异<br/>高斯低通照度 + 高通反射率互补正则"]
    R_COMP --> FREQ_DEC
    R_COMP --> REF_INV["本征反射率光照不变性约束<br/>L_reflect(R, R_aug)"]
    L_COMP --> ADAIN_ADV["对抗光照增强模块<br/>可学习 AdaIN 合成极值 OOD 光照 L_adv"]
    R_COMP --> REC_ADV["合成对抗样本 V_adv = R ◦ L_adv<br/>剥除镜面高光纯化光照扰动"]
    ADAIN_ADV --> REC_ADV
    REC_ADV --> PROG_TRAIN["渐进式四阶段训练策略<br/>初始化→高光分离→联合微调→对抗强化"]
    R_COMP --> EST_RPPG["生理脉搏波估计器 E<br/>仅从反射率特征提取纯净 rPPG 信号 S"]
    EST_RPPG --> OUT_HR["输出:抗光照高保真心率与脉搏波形"]

关键设计

1. 物理约束镜面高光分离:暗通道先验与色度一致性剔除油汗反光 在非朗伯体双色反射模型 \(V_t = R_t \circ L_t + H_t\) 中,镜面高光 \(H_t\) 反射率极高且不透过真皮层,完全属于生理无感噪声。由于公开 rPPG 视频均缺乏本征分量真值,本文构建了三项贴合光学特性的自监督约束。首先是空间稀疏性约束,利用 \(L_1\) 范数惩罚高光面积: $$ \mathcal{L}{\text{sparse}} = \sum}^T \left( |\bar{\mathbf{H}t|_1 + |\bar{\mathbf{H}}_t^{\text{aug}}|_1 \right) $$ 其次,观察到高光区域在彩色图像中通常呈现单通道或多通道极高亮饱和特征,本文借鉴暗通道先验构造像素级空间高光概率分布先验 \(W_t(p) = \frac{\min_{c \in \{r,g,b\}} \mathbf{V}_{t,c}(p)}{\sum_{p=1}^P \min_{c} \mathbf{V}_{t,c}(p)}\),并定义网络预测高光的空间归一化模长 \(\bar{M}_t(p) = \frac{\|\bar{\mathbf{H}}_t(p)\|_2}{\sum_{p=1}^P \|\bar{\mathbf{H}}_t(p)\|_2}\)。通过最小化二者之间的 Kullback-Leibler (KL) 散度,施加分布对齐约束: $$ \mathcal{L}) \right) $$ 最后,根据物理光学原理,镜面反光的色彩主要反映环境入射光源的色度而非物体固有色,因此定义以暗通道先验加权的余弦相似度损失 }} = \sum_{t=1}^T \left( \text{KL}(\mathbf{W}_t \parallel \bar{\mathbf{M}}_t) + \text{KL}(\mathbf{W}_t^{\text{aug}} \parallel \bar{\mathbf{M}}_t^{\text{aug}\(\mathcal{L}_{\text{color}} = \sum_{t,p} W_t(p) \cdot [1 - \cos(\bar{\mathbf{H}}_t(p), \bar{\mathbf{L}}_t(p))]\)。三者联合构筑高光损失 \(\mathcal{L}_{\text{specular}}\),迫使网络精准剥除面部油汗斑块,彻底消除朗伯假说下的过曝高光伪影。

2. 频域多尺度约束分异:傅里叶低通/高通互补滤波稳定本征解耦 本征图像分解本身属于严重欠定的逆向问题,若仅依靠对数域重构误差 \(\mathcal{L}_{\text{rec}} = \sum_{t,p} \|\log(\mathbf{V}_t(p) - \bar{\mathbf{H}}_t(p)) - \log\bar{\mathbf{L}}_t(p) - \log\bar{\mathbf{R}}_t(p)\|_1\),网络容易陷入平凡解或将微弱脉搏信号误归入照度分量中。为此,本文利用自然图像的物理频域先验:环境照度分量在空间维度呈现缓慢变化的低频平滑特性,而人脸漫反射率分量则富含边缘、毛孔等高频解剖纹理与毛细血管色彩梯度。模型引入多尺度频域约束损失: $$ \mathcal{L}{\text{freq}} = \sum; \sigma) \right) $$ 其中利用二维快速傅里叶变换(FFT)结合截止频率参数为 }^T \sum_{\sigma \in \mathcal{T}} \left( \mathcal{G}(\bar{\mathbf{R}}_t, \bar{\mathbf{R}}_t^{\text{aug}}; \sigma) + \hat{\mathcal{G}}(\bar{\mathbf{L}}_t, \bar{\mathbf{L}}_t^{\text{aug}\(\sigma\) 的高斯低通滤波器 \(M(u,v;\sigma) = \exp\left(-\frac{D^2(u,v)}{2\sigma^2}\right)\)。惩罚项 \(\mathcal{G}\) 通过低通核滤除低频能量,强迫漫反射率 \(\bar{R}\) 留存中高频微细特征;而互补项 \(\hat{\mathcal{G}}\) 则利用高通滤波器 \((1 - M)\) 严厉惩罚照度分量 \(\bar{L}\) 中的高频成分,确保照度场平滑无纹理泄漏。配合时间维度同一受试者在色彩抖动下反射率一致的 \(\mathcal{L}_{\text{reflect}} = \sum_{t} \|\bar{\mathbf{R}}_t - \bar{\mathbf{R}}_t^{\text{aug}}\|_1\),锁定了生理容积脉搏波在漫反射通道内的真实留存。

3. 对抗光照增强:基于可学习 AdaIN 的域外极端光照动态模拟 受限于现有 rPPG 数据集采集环境相对固定、光线模式有限的缺陷,模型在面对真实车载或室外光斑突变等域外(OOD)场景时泛化性能容易崩溃。常规的数据增强(如随机色彩扰动或静态特征混合)仅是对已知经验分布的浅层线性插值。本文设计了一种对抗式光照生成机制,采用由可学习参数 \(\alpha\) 和 \(\beta\) 控制的自适应实例归一化(AdaIN)层 \(A\),对分解出的照度分量进行仿射调制:\(\bar{\mathbf{L}}_{\text{adv}} = A(\bar{\mathbf{L}}) = \alpha \cdot \frac{\bar{\mathbf{L}} - \mu_{\bar{L}}}{\sigma_{\bar{L}}} + \beta\)。在对抗训练步中,固定反射率特征提取器 \(F_R\) 与估计器 \(E\),优化 \(\alpha, \beta\) 以最大化负皮尔逊相关损失(即最小化预测相关系数): $$ \mathcal{L}{\text{adv}} = \max) $$ 通过生成能够导致当前心率估计误差最大的极值照度 } \text{NP}(\bar{\mathbf{S}}^{\text{adv}}, \mathbf{S\(\bar{L}_{\text{adv}}\),并将其与纯净本征反射率重新相乘合成样本 \(V_t^{\text{adv}} = \bar{\mathbf{R}}_t \circ \bar{\mathbf{L}}_t^{\text{adv}}\)(注意故意剔除镜面分量以防止无关高光干扰)。随后在第二步中反向微调 \(F_R\) 与 \(E\) 最小化该对抗光照下的生理预测误差。这种动态极值对抗机制显著拓宽了光照特征空间,赋予网络对极端未见明暗波动的内在免疫力。

4. 渐进式四阶段训练策略:分步解耦防止分量退化与推理轻量化 若从初始状态直接端到端联合训练非朗伯体三路解码与对抗模块,由于参数耦合严重与梯度竞争,极易导致高光与照度相互吞噬造成模式崩溃。为此,本文设计了 progressive 四阶段优化流程: - 阶段 1(朗伯体基线初始化):仅激活照度、反射率与 rPPG 估计分支,使用 \(\mathcal{L}_{\text{reflect}} + \mathcal{L}_{\text{rec}} + \mathcal{L}_{\text{rPPG}} + \mathcal{L}_{\text{freq}}\) 完成双分量稳定初收敛。 - 阶段 2(镜面高光孤立解耦):冻结阶段 1 的所有参数,单独以高光损失 \(\mathcal{L}_{\text{specular}}\) 与重构损失驱动镜面解码器 \(\{F_H, D_H\}\),在不破坏已有漫反射基准的前提下精准学习高光分布。 - 阶段 3(全网络联合微调):解冻全部分支,开放所有物理先验损失进行联合反向传播,实现各分量边界的自洽精细校准。 - 阶段 4(对抗性光照强化):交替最大化对抗光照损失与最小化增强生理估计误差,提升域外适应能力。 特别地,在测试推理阶段,完全舍弃照度解码器 \(D_L\)、高光网络 \(\{F_H, D_H\}\) 及对抗模块 \(A\),仅运行反射率特征提取器 \(F_R\) 与脉搏估计器 \(E\),既享受了本征解耦带来的光照免疫红利,又避免了任何额外的推理显存与时延开销。

损失函数 / 训练策略

整个框架的自监督与监督损失由多项物理与生理目标构成。针对脉搏波形监督,采用负皮尔逊相关系数(Negative Pearson Correlation, NP)损失 \(\mathcal{L}_{\text{rPPG}} = \text{NP}(\bar{\mathbf{S}}, \mathbf{S}) + \text{NP}(\bar{\mathbf{S}}^{\text{aug}}, \mathbf{S})\),其中 \(\text{NP}(x, y) = 1 - \frac{\sum (x - \mu_x)(y - \mu_y)}{\sqrt{\sum (x - \mu_x)^2 \sum (y - \mu_y)^2}}\)。 总优化目标权重设定为:高光各子项权重 \((\lambda_{\text{prior}}, \lambda_{\text{color}}) = 2\)、\(\lambda_{\text{sparse}} = 1\);对抗项 \((\lambda_{\text{adv}}, \lambda_{\text{enh}}) = 1\);总高光损失权重 \(\lambda_{\text{specular}} = 5\);重构、反射率一致性、生理信号及频域惩罚项权重统一设为 \((\lambda_{\text{reflect}}, \lambda_{\text{rec}}, \lambda_{\text{rPPG}}, \lambda_{\text{freq}}) = 3\)。网络基于单张 NVIDIA RTX 4090 显卡采用 AdamW 优化器(学习率 \(1 \times 10^{-4}\))训练 100 轮,输入序列长度为 320 帧。

实验关键数据

主实验

论文在五大公开基准数据集(UBFC、PURE、COHFACE、MR-NIRP Indoor 以及极具挑战性的高动态车载光照数据集 MR-NIRP Car)上进行了严格评测,评测指标涵盖平均绝对误差(MAE,单位 bpm,越低越好)、均方根误差(RMSE,单位 bpm,越低越好)以及皮尔逊相关系数(\(R\),越高越好)。

下表为不同光照场景下的域内测试(Intra-domain Testing)对比结果:

方法类型 方法 UBFC (MAE / RMSE / R) PURE (MAE / RMSE / R) COHFACE (MAE / RMSE / R) Indoor (MAE / RMSE / R) Car (MAE / RMSE / R)
通用监督基线 PhysFormer (CVPR 22) 1.88 / 4.47 / 0.96 0.43 / 0.57 / 0.99 3.24 / 6.46 / 0.81 1.57 / 3.58 / 0.93 4.72 / 7.92 / 0.45
通用轻量基线 EfficientPhys (WACV 23) 0.72 / 1.77 / 0.99 0.30 / 0.36 / 0.99 2.75 / 6.99 / 0.81 1.16 / 3.06 / 0.96 4.79 / 9.76 / 0.48
时序周期注意力 RhythmFormer (PR 25) 0.49 / 1.37 / 0.99 0.16 / 0.21 / 0.99 1.17 / 3.36 / 0.97 0.67 / 1.57 / 0.98 2.87 / 6.16 / 0.72
状态空间序列模型 RhythmMamba (AAAI 25) 0.70 / 1.02 / 0.99 0.48 / 0.55 / 0.99 7.70 / 14.18 / 0.61 0.46 / 0.66 / 0.99 4.90 / 10.22 / 0.53
背景先验解耦 ND-DeeprPPG (TIP 23) 0.78 / 1.94 / 0.98 0.24 / 0.32 / 0.99 1.56 / 3.95 / 0.93 0.52 / 0.93 / 0.99 4.28 / 8.76 / 0.54
极端光照感知 Shao 等 (CVPR 25) 0.42 / 0.89 / 0.99 0.18 / 0.24 / 0.99 6.60 / 12.60 / 0.49 0.45 / 0.91 / 0.92 2.69 / 6.03 / 0.87
朗伯体 Retinex 增强 Chen 等 (CVPRW 23) 0.62 / 2.20 / 0.99 0.19 / 0.23 / 0.99 2.23 / 5.81 / 0.85 0.55 / 1.33 / 0.99 2.16 / 4.90 / 0.78
自适应低照度 Retinex Yang 等 (TCE 25) 1.18 / 2.01 / 0.99 1.69 / 2.97 / 0.86 12.59 / 16.29 / 0.10 1.79 / 5.81 / 0.87 4.42 / 8.26 / 0.62
非朗伯体本征分解 SHINE-PPG (本文) 0.34 / 0.47 / 0.99 0.13 / 0.17 / 0.99 1.47 / 4.03 / 0.93 0.32 / 0.45 / 0.99 1.68 / 3.55 / 0.89

下表为从受限平稳光源迁移至极端车载动态光源的跨域跨数据集(Cross-domain Testing)泛化能力评测结果:

方法类型 方法 UBFC \(\to\) Indoor PURE \(\to\) Indoor UBFC \(\to\) Car PURE \(\to\) Car
通用监督基线 PhysFormer [41] 2.67 / 4.43 / 0.92 0.69 / 1.42 / 0.98 16.33 / 22.85 / 0.11 6.25 / 9.07 / 0.41
通用轻量基线 EfficientPhys [22] 1.38 / 5.35 / 0.87 0.50 / 0.74 / 0.99 18.89 / 29.85 / 0.04 15.78 / 24.24 / 0.06
时序周期注意力 RhythmFormer [43] 1.08 / 3.98 / 0.91 0.21 / 0.27 / 0.99 11.08 / 17.11 / 0.18 4.64 / 8.62 / 0.53
状态空间序列模型 RhythmMamba [44] 0.85 / 1.74 / 0.98 0.56 / 0.77 / 0.99 9.80 / 16.30 / 0.24 9.37 / 16.62 / 0.28
背景先验解耦 ND-DeeprPPG [21] 1.03 / 3.09 / 0.96 0.34 / 0.35 / 0.99 12.36 / 20.64 / 0.28 7.85 / 13.53 / 0.38
空间对抗解耦 DD-rPPGNet [10] 1.22 / 2.67 / 0.96 0.63 / 1.50 / 0.98 14.92 / 21.33 / 0.15 7.47 / 11.78 / 0.43
朗伯体 Retinex 增强 Chen 等 [4] 2.27 / 9.44 / 0.63 0.38 / 0.58 / 0.99 15.86 / 24.01 / 0.01 6.81 / 13.91 / 0.29
非朗伯体本征分解 SHINE-PPG (本文) 0.30 / 0.42 / 0.99 0.16 / 0.19 / 0.99 7.64 / 14.42 / 0.30 3.24 / 6.59 / 0.74

消融实验

为了剖析各物理约束与对抗机制对解耦质量的独立贡献,论文在极其严苛的跨域设定 PURE \(\to\) Car(测试集约 11.9% 的面部像素为高光)下展开了消融分析。

表 1:分解损失函数项组合消融(验证非朗伯体约束与物理先验的作用) | \(\mathcal{L}_{\text{rPPG}}\) | \(\mathcal{L}_{\text{rec}}\) | \(\mathcal{L}_{\text{reflect}}\) | \(\mathcal{L}_{\text{freq}}\) | \(\mathcal{L}_{\text{specular}}\) | MAE (bpm) \(\downarrow\) | RMSE (bpm) \(\downarrow\) | \(R \uparrow\) | 说明与机理分析 | |:---:|:---:|:---:|:---:|:---:|:---:|:---:|:---:|---| | \(\checkmark\) | – | – | – | – | 8.65 | 14.03 | 0.32 | 纯监督基线:在动态车载光照下无法区分光强与生理信号 | | \(\checkmark\) | \(\checkmark\) | – | – | – | 9.97 | 17.81 | 0.19 | 无先验盲目重构:欠定问题导致生理微弱信号被重构过程摧毁 | | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | – | – | 6.23 | 11.52 | 0.39 | 引入反射率不变性:约束同受试者反射分量一致,抑制部分光变 | | \(\checkmark\) | \(\checkmark\) | – | \(\checkmark\) | – | 6.02 | 10.49 | 0.43 | 引入频域多尺度互补滤波:照度平滑与高频纹理分离生效 | | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | – | 4.17 | 8.77 | 0.48 | 朗伯体完全体:缺乏高光建模,残余镜面反光仍在反射率中造成伪影 | | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | 3.76 | 7.76 | 0.57 | 完整非朗伯体解耦:彻底剥离高光干扰,相关系数大幅攀升至 0.57 |

表 2:光照增强与对抗策略消融对比(在完整分解基线上引入) | 增强策略 | MAE (bpm) \(\downarrow\) | RMSE (bpm) \(\downarrow\) | \(R \uparrow\) | 说明 | |---|---|---|---|---| | 基准模型(Tab. 4 全约束,无额外增强) | 3.76 | 7.76 | 0.57 | 静态训练分布,未见光照适应不足 | | 传统色彩抖动(Color Jitter) | 3.56 | 7.74 | 0.58 | 全局色度扰动,无法表达真实复杂光照变化 | | 随机噪声注入(Noise Injection) | 3.73 | 7.80 | 0.58 | 高斯白噪与空间光照连续性脱节 | | 标准 AdaIN 风格迁移 | 3.53 | 7.28 | 0.61 | 依赖训练集内已有样本均值方差,仍被困在已知分布内 | | 可学习 AdaIN 对抗增强(本文) | 3.24 | 6.59 | 0.74 | 动态最大化误差生成极值光照,强迫表征实现 OOD 不变性 |

表 3:解耦物理分量中的 rPPG 生理信息留存审计(验证物理合理性) | 输入至 rPPG 估计网络的信号源 | MAE (bpm) \(\downarrow\) | RMSE (bpm) \(\downarrow\) | \(R \uparrow\) | 物理结论 | |---|---|---|---|---| | 解耦所得照度分量 \(\bar{L}\) | 15.91 | 21.32 | -0.04 | 几乎无脉搏相关性,证明光照分量成功吸收了环境干扰 | | 解耦所得镜面高光分量 \(\bar{H}\) | 18.46 | 23.64 | -0.03 | 相关性为负且误差极大,证明高光确实不含皮下微循环脉冲 | | 输入原始视频 \(V\)(基线对照) | 1.68 | 3.55 | 0.89 | 原始视频中生理信号与干扰混杂 |

关键发现

  • 朗伯体假设是导致既往模型在极端光照下失效的关键推手:消融数据显示,仅依靠朗伯体假设下的 Retinex 分解(表 1 第五行),相关系数停留在 0.48;唯有加入以暗通道和色度一致性支撑的 \(\mathcal{L}_{\text{specular}}\) 建立非朗伯体模型后,相关系数一跃提升至 0.57。在真实车载环境下,约 11.9% 的像素被镜面高光占据,忽视高光会导致反射率中残留大片局部高频噪声。
  • 欠定分解必须依托物理先验引导:单纯在网络中挂载分解头并执行无约束重构(\(\mathcal{L}_{\text{rec}}\)),不仅无法去噪,反而导致相关系数从 0.32 恶化暴跌至 0.19。这证明无先验引导的盲目重构会彻底稀释甚至抵消微弱的人体血流容积变化,只有频域低通/高通互补与反射率恒常性才能赋予解耦明确的物理流向。
  • 动态对抗探索远优于静态数据增广:在表 2 中,无论是色彩抖动还是常规样本间 AdaIN 风格迁移,相关系数最多达到 0.61。而可学习对抗 AdaIN 能够通过梯度上升专门寻找让脉搏估计器“最难受”的照度统计参数,以此训练出的生理特征具有极强的域外平移不变性,直接将相关系数提升至 0.74。

亮点与洞察

  • 将经典双色反射物理定律与现代自监督深度学习优雅缝合:不同于以往将 rPPG 视作纯黑盒视频序列建模的工作,SHINE-PPG 深刻洞察到人脸皮肤的非朗伯光学本质。将物理学暗通道先验、光源颜色守恒与傅里叶频域滤波转化为平滑损失项,在无需昂贵手工标注的前提下完成了高质量的物理三项本征分解。
  • 巧用“剥除高光”的对抗光照合成技巧:在合成对抗训练样本时,作者并没有盲目将对抗光照重新叠加镜面高光,而是明确设定 \(V_t^{\text{adv}} = \bar{\mathbf{R}}_t \circ \bar{\mathbf{L}}_t^{\text{adv}}\)。这一细节极其考究:高光已被证明不含生理信息且具有稀疏局部性,将高光排除在对抗循环之外,确保了对抗模块能够全力聚焦于模拟全场景复杂动态光照分布,避免了对抗生成器产生不切实际的局部杂波。
  • 极佳的测试期能效比设计:在训练阶段通过四阶段渐进式优化解决了七八个辅助损失项的收敛难题,而在推理阶段果断抛弃照度、高光解码器与对抗生成层,仅运行紧凑的反射率提取器与估计器,完全不增加前向推理显存与浮点计算量,极具车载嵌入式落地价值。

局限与展望

  • 空间全局照度调控对非均匀局部光斑的刻画有限:作者在文中坦承,当前对抗光照增强依赖 AdaIN 调节全局通道均值与方差,虽然能有效模拟全局变暗、过曝或色调偏转,但对于真实车载环境中林荫树影快速掠过、局部强反射条纹等空间非均匀高动态光斑,目前的全局统计量仍显单薄。未来可探索基于空间自适应或局部光流引导的对抗光照场生成。
  • 极端过曝导致的局部信息彻底饱和:当摄像头传感器因强光直射导致某些人脸区域完全饱和(像素值达到 255 截断)时,该区域的漫反射率与脉搏信号已在物理硬件层面丢失。此时本征分解只能依赖邻域空间上下文插值,这在剧烈头部运动与大面积强反光叠加时可能引发估算抖动。
  • 频域滤波超参数对不同分辨率视频的敏感度:频域多尺度约束设定了一组固定的截止频率阈值 \(\sigma \in \mathcal{T}\),当输入视频的人脸尺度、相机分辨率或模糊程度大幅变化时,空间频域响应曲线会发生偏移,未来引入可自适应图像尺度的动态频域核将进一步提升跨分辨率鲁棒性。

相关工作与启发

  • vs. 背景先验方法 (如 ND-DeeprPPG, DD-rPPGNet, Shao 等):背景先验方法假设人脸光照与背景光照强相关,试图借背景消除人脸光照干扰,但在车窗外动态掠影或纯黑/过曝背景下先验彻底失效;SHINE-PPG 完全基于人脸自身像素的内在物理规律解耦,不依赖任何背景先验,因而能够在跨场景泛化中取得压倒性优势。
  • vs. 传统 Retinex 方法 (如 Chen 等, Yang 等):传统 Retinex 固守朗伯体模型,强行忽略人脸油汗高光,导致高光伪影渗透进反射率分量损坏微血管搏动波;SHINE-PPG 显式扩展为非朗伯体三项解耦,彻底斩断了镜面反射对生理特征提取的干扰链条。
  • vs. 通用时空生理大模型 (如 PhysFormer, RhythmMamba):单纯依靠 Transformer 注意力或 Mamba 状态空间模型在大规模数据集上拟合,遇到剧烈未见光照时注意力分布容易被强光斑牵引漂移;SHINE-PPG 证明了在深度骨干网络之前引入物理机制约束,能够以极低代价赋予模型坚固的物理不变性边界。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次在深度自监督 rPPG 领域完整实现非朗伯体三项本征分解,打破传统朗伯体 Retinex 假说局限,设计精巧且物理自洽。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 大数据集,包含域内、严苛跨域、对抗色彩扰动、消融分析及各解耦分量生理信号留存量化,证据链极其闭环。
  • 写作质量: ⭐⭐⭐⭐⭐ 物理机理阐述透彻,公式推导严谨规范,图表清晰,逻辑层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 对自动驾驶疲劳监测、移动端非接触体检及人脸活体防伪等高动态光照场景具有极为重大的落地启发与实用价值。