跳转至

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/WJULYW/RPM-Distill
领域: 其他
关键词: 远程生理测量, 跨模态知识蒸馏, 毫米波雷达, 双层元学习, 频域生理先验

一句话总结

针对视频远程生理测量在光照、肤色与运动干扰下易失效且雷达推理部署代价高的问题,RPM-Distill 将同步毫米波雷达作为训练期特权信息,在频域解耦生理基频、背景噪声与形态尖锐度构建生理结构化蒸馏,并通过双层元学习驱动的谱策略网络自适应门控与加权,实现了纯视频推断下的高鲁棒生理测量。

研究背景与动机

基于面部视频的远程光电容积脉搏波描记(rPPG)能够以非接触、低侵入性的方式恢复心率与血容积脉搏波,在日常健康监护与智能驾驶中具有极高的应用价值。然而,纯视觉 rPPG 本质上依赖于面部皮肤毛细血管微弱的周期性反光变化,现实场景中的非刚性人脸运动、环境光照剧烈波动以及深色皮肤引发的光学衰减,会极度恶化光学信噪比,导致时域波形严重失真并在频域产生大量伪峰。相比之下,射频毫米波雷达通过检测胸腔纳微米级的周期性机械位移来捕获生理节律,天生不受光照强弱与肤色差异影响。为了弥补光学缺陷,近期的研究大多倾向于视频与雷达的多模态特征融合,但这要求在测试部署阶段必须同时挂载雷达硬件,极大限制了普通摄像头设备的大规模落地。

将雷达作为“特权信息”(LUPI)在训练阶段通过跨模态知识蒸馏指导视频学生模型是一个极具吸引力的设想,但直接套用现有蒸馏范式会面临三重物理与生理层面的核心矛盾:其一,视频反光与雷达相位调制的物理感知机制截然不同,导致两者在时域波形形态和深层特征语义上无法对齐,强行做时域或特征级拟合极易引发负迁移;其二,由于雷达多径效应、偶发运动伪影或传感器间的时间同步漂移,教师信号在样本级别的质量良莠不齐,无差别的全局蒸馏会反向污染学生网络;其三,生理退化在频域具有高度结构化的失效模式(基频漂移、宽带噪声抬升、谱线弥散),单一的全局频域距离难以兼顾不同的退化诱因。

本文的切入角度在于:虽然视频与雷达信号在时域物理形态上差异巨大,但两者在生理有效频段(如 45-180 bpm)内共同受控于人体统一的心脏搏动节律,在频域共享高度一致的周期性潜变量结构。核心 idea:将雷达特权知识的迁移锚定在带限频域空间,解耦出对齐基频峰值、抑制带外底噪与保持谱形态尖锐度三项生理结构化蒸馏损失,并由双层元学习优化的谱策略网络根据样本级信噪比自适应调节蒸馏门控与成分权重,实现兼具高保真与高抗扰的纯视频推断。

方法详解

整体框架

RPM-Distill 构建了一个在训练期引入同步雷达教师指导、但在测试推断期仅使用面部视频序列的特权蒸馏架构。训练时,系统输入配对的面部视频片段 \(v_i \in \mathbb{R}^{T \times H_v \times W_v \times C}\) 与雷达距离-时间相位特征 \(r_i \in \mathbb{R}^{T \times 2H_r}\)。冻结参数的预训练雷达教师网络 \(R(\cdot; \theta_R)\) 生成雷达脉搏波预测 \(\hat{y}^r\),视频学生网络 \(S(\cdot; \theta_S)\) 生成视频脉搏波预测 \(\hat{y}^v\)。两者分别经由离散傅里叶变换(DFT)计算带限归一化对数功率谱 \(\ell^r\) 与 \(\ell^v\)。

为了避免时域形态失配引起的负迁移,系统将两者的频谱差异解耦为三项生理约束:基频峰值锚定损失 \(\mathcal{L}_{\text{peak}}\)、背景噪声抑制损失 \(\mathcal{L}_{\text{off}}\) 以及谱形态一致性损失 \(\mathcal{L}_{\text{shape}}\)。同时,将学生谱、教师谱及二者绝对差值拼接为三通道谱关系图 \(X_{\text{policy}}\),送入轻量级谱策略网络 \(\Phi(\cdot; \phi)\) 动态预测样本级蒸馏总门控 \(g\) 与各损失项归一化权重 \(\boldsymbol{\alpha}\)。整个训练策略通过双层元学习机制在小规模有标注验证集上闭环驱动策略更新,确保教师仅在有益时介入。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
    subgraph INPUT["输入与特征提取阶段"]
        direction TB
        IN_V["面部视频输入<br/>v ∈ R^{T×H×W×C}"] --> S_NET["视频学生网络<br/>S(·; θ_S)"]
        IN_R["雷达时序输入<br/>r ∈ R^{T×2H_r}"] --> T_NET["冻结雷达教师<br/>R(·; θ_R)"]
        S_NET --> SPEC_V["学生带限对数谱<br/>ℓ^v = log(P^v + ε)"]
        T_NET --> SPEC_R["教师带限对数谱<br/>ℓ^r = log(P^r + ε)"]
    end

    subgraph POLICY_STAGE["谱关系图构建与自适应门控策略"]
        direction TB
        SPEC_V & SPEC_R --> REL_MAP["谱关系图构建<br/>X_policy = [ℓ^v, ℓ^r, Δ]^T"]
        REL_MAP --> POLICY_NET["谱策略网络<br/>1D残差卷积 + 矩阵分解解码器"]
        POLICY_NET --> OUT_WEIGHTS["预测样本动态系数<br/>门控 g ∈ (0,1) 与权重 α ∈ Δ^2"]
    end

    subgraph DISTILL_STAGE["生理结构化频域蒸馏约束"]
        direction TB
        SPEC_V & SPEC_R --> PEAK_NODE["基频峰值对齐<br/>高斯软窗聚焦教师心率主峰"]
        SPEC_V & SPEC_R --> OFF_NODE["背景噪声抑制<br/>带外能量抑制滤除环境噪声"]
        SPEC_V & SPEC_R --> SHAPE_NODE["谱形态与尖锐度保持<br/>质心漂移惩罚 + 谱熵锐度匹配"]
    end

    OUT_WEIGHTS --> WEIGHTED_LOSS["自适应加权蒸馏目标<br/>L_distill = g · Σ α_j L_j"]
    PEAK_NODE & OFF_NODE & SHAPE_NODE --> WEIGHTED_LOSS

    subgraph META_LOOP["双层元优化闭环更新"]
        direction TB
        WEIGHTED_LOSS --> VIRTUAL_STEP["训练集虚拟学生前向更新<br/>θ'_S = θ_S - η ∇ L_train"]
        VIRTUAL_STEP --> VAL_EVAL["验证集生理保真度评估<br/>计算 L_sup(θ'_S; D_val)"]
        VAL_EVAL --> META_UPDATE["策略反向传播更新<br/>φ* = φ - β ∇_φ L_sup"]
        META_UPDATE --> FINAL_STUDENT["真实学生参数更新<br/>θ_S* = θ_S - η ∇ L_train(θ_S, φ*)"]
    end

关键设计

1. 生理结构化频域解耦蒸馏:解决跨模态时域物理失配与特征语义鸿沟 针对光学反射与雷达相位微动在时域形态和特征空间无法直接对齐的物理壁垒,RPM-Distill 将知识传递完全建立在生理周期频段 \(\mathcal{B} = [45, 180]\text{ bpm}\) 的离散对数谱上。定义频域绝对偏差向量为 \(\Delta = |\boldsymbol{\ell}^v - \boldsymbol{\ell}^r| \in \mathbb{R}^K\)。为了将复杂的频域退化解构为独立的物理抑制项,方法利用教师归一化分布 \(\mathbf{s}^r = \text{softmax}(\boldsymbol{\ell}^r)\) 计算其可微软谱质心 \(\hat{k}^r = \sum_{k \in \mathcal{B}} k \cdot \mathbf{s}^r[k]\),进而构建以教师主峰为中心的高斯软窗口掩码: $$ \mathbf{m}{\mathrm{pk}}[k] = \exp\left(-\frac{(k - \hat{k}^r)^2}{2\sigma^2}\right), \quad \mathbf{m}}} = \max(0, 1 - \mathbf{m{\mathrm{pk}}) $$ 基于这对互补掩码,构建三个针对性生理损失:基频峰值对齐损失 \(\mathcal{L}_{\text{peak}} = \frac{\|\Delta \odot \mathbf{m}_{\mathrm{pk}}\|_1}{\|\mathbf{m}_{\mathrm{pk}}\|_1 + \epsilon}\) 专门矫正光照不足或深肤色导致的学生峰值漂移;背景噪声抑制损失 \(\mathcal{L}_{\text{off}} = \frac{\|\Delta \odot \mathbf{m}_{\mathrm{oth}}\|_1}{\|\mathbf{m}_{\mathrm{oth}}\|_1 + \epsilon}\) 压制头动与环境光引起的宽带噪声底,提升谱对比度;谱形态一致性损失 \(\mathcal{L}_{\text{shape}}\) 则通过质心距离与谱熵差值联合约束峰型宽度与能量聚集度: $$ H(\mathbf{s}) = -\frac{1}{\log K} \sum}} \mathbf{s}[k] \log(\mathbf{s}[k] + \epsilon), \quad \mathcal{L{\text{shape}} = \text{Smooth}^r)) $$ 该设计将蒸馏目标明确锚定在心率定位、去噪与谱聚集三大生理维度上,彻底规避了时域波形对齐时的错误形变诱导。}(\hat{k}^v, \hat{k}^r) + \text{Smooth}_{L1}(H(\mathbf{s}^v), H(\mathbf{s

2. 矩阵分解谱策略网络:自适应感知样本级跨模态关联与信号保真度 由于雷达易受多径干扰且传感器时间戳可能存在微秒级漂移,固定权重蒸馏极易将受损教师信号强加给学生,造成严重的负迁移。RPM-Distill 提出了基于三通道谱关系图 \(X_{\text{policy}} = [\boldsymbol{\ell}^v, \boldsymbol{\ell}^r, \Delta]^T \in \mathbb{R}^{3 \times K}\) 的自适应决策机制。该输入张量显式保留了逐频点的局部互相关信息。网络前端采用 1D 卷积和 Group Normalization 残差块提取多尺度谱结构表征;后端采用受矩阵分解启发的全局解码模块,沿频率轴学习基向量注意力与系数注意力以捕获低秩信号质量元(Tokens)。

解码特征经全局池化后送入双分支线性投影头,分别输出标量门控 \(g = \text{Sigmoid}(h_g) \in (0, 1)\) 与三分量概率向量 \(\boldsymbol{\alpha} = \text{Softmax}(h_\alpha) \in \Delta^2\)。总蒸馏损失形式化为: $$ \mathcal{L}{\text{distill}}(\hat{\mathbf{y}}^v, \hat{\mathbf{y}}^r; \phi) = g \cdot \sum_j $$ 当教师信号被剧烈体动破坏或与视频严重失配时,策略网络预测接近 0 的门控值 }, \text{off}, \text{shape}}} \alpha_j \mathcal{L\(g\),主动切断破坏性梯度的传播;而在光照微弱但雷达清晰时,网络自动调大 \(g\) 并大幅增加 \(\alpha_{\text{peak}}\) 的权重,精准指引学生找回心率基频。

3. 双层元学习驱动策略闭环:无显式蒸馏标签下的生理效用自监督寻优 在训练过程中,最优门控 \(g\) 与权重 \(\boldsymbol{\alpha}\) 并无现成的真实标签可供直接监督。手动调节或固定先验难以应对复杂的动态驾驶及光照变化。为此,RPM-Distill 将策略参数 \(\phi\) 视作可学习的归纳偏置,构建双层元优化框架(Bilevel Meta-Optimization)。外层目标是在保留的小规模标注验证集 \(\mathcal{D}_{\text{val}}\) 上最小化真实生理波形恢复损失 \(\mathcal{L}_{\text{sup}}\)(由负皮尔逊相关系数与信噪比损失组成),内层目标是在训练集 \(\mathcal{D}_{\text{tr}}\) 上优化学生网络参数 \(\theta_S\)。

算法通过在线一阶交替近似进行高效求解:首先基于当前策略 \(\phi\) 在训练集批次上进行一次虚拟梯度下降,获得临时虚拟学生参数 \(\theta'_S = \theta_S - \eta \nabla_{\theta_S} \mathcal{L}_{\text{train}}(\theta_S, \phi; \mathcal{D}_{\text{tr}})\);随后将虚拟学生 \(\theta'_S\) 推断验证集批次计算 \(\mathcal{L}_{\text{sup}}\),并对策略网络求导完成元更新 \(\phi^* \leftarrow \phi - \beta \nabla_\phi \mathcal{L}_{\text{sup}}(\theta'_S(\phi); \mathcal{D}_{\text{val}})\);最后以更新后的最优策略 \(\phi^*\) 对当前真实学生 \(\theta_S\) 实施物理更新。这一闭环流程将蒸馏策略的演进方向直接绑定在下游生理波形的真实泛化收益上,实现了全自动的可靠性判别。

损失函数 / 训练策略

学生模型的单步综合训练目标采用标签可选的形式: $$ \mathcal{L}{\text{train}} = \mathbb{I}} \mathcal{L{\text{sup}}(\hat{\mathbf{y}}^v, \mathbf{y}) + \lambda^r; \phi) $$ 其中 }} \mathcal{L}_{\text{distill}}(\hat{\mathbf{y}}^v, \hat{\mathbf{y}\(\mathbb{I}_{\{y\}}\) 为标签指示函数,当样本具备生理金标时纳入波形皮尔逊损失与 SNR 损失联合优化,未标注样本则纯靠 \(\mathcal{L}_{\text{distill}}\) 提供自监督。实验设定采样率为 30 Hz,生理分析频段 \(\mathcal{B} = [45, 180]\text{ bpm}\),视频片段长度 \(T=256\)。学生网络选用 FactorizePhys,教师网络选用预训练并冻结的雷达脉搏波回归器。学生模型使用 Adam 优化器(\(\eta = 5 \times 10^{-5}\),权重衰减 \(10^{-2}\)),策略网络使用 Adam 优化器(\(\beta = 10^{-4}\)),每隔 10 个学生优化步执行一次双层元更新。

实验关键数据

主实验

论文在跨数据集协议下验证模型的跨域鲁棒性:在 PhysDrive 与 EquiPleth 上分别进行交叉训练与验证,即在一个数据集上训练学生并在另一个数据集上盲测评估。评价指标包括心率误差的标准差(STD)、平均绝对误差(MAE)、均方根误差(RMSE)以及皮尔逊相关系数(\(r\))。

模态类型 方法 PhysDrive STD↓ PhysDrive MAE↓ PhysDrive RMSE↓ PhysDrive \(r\)↑ EquiPleth STD↓ EquiPleth MAE↓ EquiPleth RMSE↓ EquiPleth \(r\)↑
纯视频 (Video) CHROM 17.17 16.72 23.97 0.19 10.77 7.31 17.42 0.54
纯视频 (Video) POS 17.33 17.38 24.38 0.20 11.51 4.64 15.07 0.68
纯视频 (Video) PhysNet 12.73 18.45 25.45 0.15 11.10 7.93 13.64 0.55
纯视频 (Video) PhysFormer 17.10 18.87 21.36 0.16 12.56 9.47 13.20 0.34
纯视频 (Video) FactorizePhys 14.74 15.67 20.55 0.19 11.83 8.21 14.40 0.78
纯视频 (Video) BeatFormer 16.10 17.16 21.80 0.17 13.82 9.08 13.98 0.62
纯雷达 (RF) Vilesov et al. 13.60 15.21 20.42 0.21 7.79 8.46 9.44 0.78
视频-雷达融合 FusionPhys 15.91 15.35 22.48 0.23* 5.24 4.88 6.48 0.89
视频-雷达融合 SATM 15.22 13.79* 21.99 0.23* 5.75 3.92 6.62 0.88
传统跨模态KD FitNets 15.26 20.20 28.31 0.09 6.60 3.09 7.23 0.85
传统跨模态KD C2KD 13.21 18.25 25.37 0.12 6.92 2.45 6.88 0.90
传统跨模态KD MST-Distill 14.69 16.55 23.47 0.17 5.58 2.99 7.31 0.87
本文 (纯视频推断) RPM-Distill (Ours) 12.67* 14.15 20.24* 0.22 4.14* 1.57* 4.64* 0.94*

(注:表中带 * 标号表示经双样本配对 t 检验 \(p < 0.005\) 具有统计显著提升;最佳加粗显示。)

在 EquiPleth 数据集上,RPM-Distill 将纯视觉最强基线 FactorizePhys 的 MAE 从 8.21 bpm 骤降至 1.57 bpm(降低约 81%),相关系数 \(r\) 从 0.78 跃升至 0.94,甚至全面击败了在测试期必须同时挂载雷达的双模态融合方法 SATM(MAE 3.92 bpm)。在挑战极大的动态驾驶数据集 PhysDrive 上,RPM-Distill 同样取得了最低的 STD (12.67) 与 RMSE (20.24),显著优于传统特征级与输出级蒸馏方法。

消融实验

为了严格厘清频域各生理损失项、自适应策略组件以及双层元学习的独立贡献,论文在 PhysDrive 和 EquiPleth 跨数据集设置下执行了系统性消融。

实验配置模型 PhysDrive MAE↓ PhysDrive RMSE↓ PhysDrive \(r\)↑ EquiPleth MAE↓ EquiPleth RMSE↓ EquiPleth \(r\)↑ 说明
完整模型 (Full) 14.15 20.24 0.22 1.57 4.64 0.94 完整 RPM-Distill 框架
去掉基频对齐 (w/o \(\mathcal{L}_{\text{peak}}\)) 16.28 22.51 0.17 4.30 9.92 0.75 移除主峰高斯软窗对齐,掉点最剧烈
去掉带外去噪 (w/o \(\mathcal{L}_{\text{off}}\)) 16.10 22.37 0.16 3.40 8.29 0.82 移除带外底噪抑制,抗干扰能力下降
去掉形态约束 (w/o \(\mathcal{L}_{\text{shape}}\)) 15.95 22.29 0.16 3.13 7.93 0.83 移除谱质心与谱熵匹配,尖锐度变差
固定分量等权 (w/o weight) 15.83 22.06 0.17 3.25 8.19 0.83 策略网络不预测 \(\boldsymbol{\alpha}\),三项固定权重
去掉动态门控 (w/o gate) 15.47 21.66 0.18 3.45 8.53 0.81 移除全局门控 \(g\),不可靠样本导致负迁移
移除整个策略网络 (w/o \(\Phi\)) 15.68 21.89 0.18 2.78 7.35 0.85 完全移除策略学习与元优化
普通联合训练 (w/o bilevel) 16.15 22.54 0.16 3.07 7.74 0.84 策略网络与学生网络在训练集直接联合优化

此外,针对训练期雷达与视频的时间同步漂移(模拟 1s/30 帧不对齐),抗漂移实验表明:在时间偏移概率高达 1.0 时,无门控版本(w/o gate)的 MAE 从 15.47 恶化至 18.08 bpm(RMSE 飙升至 25.64 bpm),而 RPM-Distill 凭借自适应门控将 MAE 牢牢稳定在 14.80 bpm,证明了其出色的抗失步容错能力。

关键发现

  • 基频峰值对齐是生理恢复的核心命脉:消融实验显示,移除 \(\mathcal{L}_{\text{peak}}\) 对性能的摧毁最为致命(EquiPleth 上 MAE 从 1.57 退化至 4.30,RMSE 从 4.64 退化至 9.92)。这证实低光照和肤色衰减下视频学生的最主要失效模式是基频丢失或伪峰误选,雷达教师最核心的特权价值即在于频域定锚。
  • 动态门控在恶劣与失步场景下起决定性过滤作用:在传感器同步存在概率漂移的应力测试中,缺失门控 \(g\) 会使错误的时延梯度持续注入学生网络,引发不可逆的性能衰退;策略网络通过下调门控数值,成功化解了跨模态数据流失步的工程难题。
  • 有限标注反而能取得更优的蒸馏泛化权衡:在不同标注比例实验中,仅使用 40% 有标数据时模型表现最优(在夜间、谈话等极端场景下均显著超越全标监督的 FactorizePhys 基线)。过多依赖源域硬标签反而容易让学生过拟合源域表象特征,适度减少硬标签并借助雷达频域先验能够促使模型学到更纯粹的生理动力学规律。

亮点与洞察

  • 将不可通约的多模态时域波形对齐收敛至频域物理公共基底:视频与雷达的换能机制迥异,强行拉近特征或时域形态往往弊大于利。RPM-Distill 洞察到两者的统一性只存在于心律周期的频域拓扑中,以简明的频域解耦化解了跨模态知识迁移的物理不兼容性。
  • 通过双层元学习攻克了无标签自适应蒸馏决策的训练困境:针对“无法显式界定样本级蒸馏权重真值”的理论难题,将策略网络作为可导诱导偏置嵌入元优化,用小规模验证集的下游生理回报倒逼出最优的样本门控与成分权衡。
  • 以特权信息架构彻底摆脱了雷达硬件在推断侧的部署束缚:相比于追求 SOTA 却依赖双传感器输入的融合模型,该方案实现了“训练借力雷达先验、测试只需普通 RGB 相机”的工程目标,为可穿戴、智能座舱与远程医疗提供了低成本高精度的实用落地范本。

局限与展望

  • 预设生理频带限制了极端病理节律的自适应监测:当前方法将频带硬编码在 \([45, 180]\text{ bpm}\) 内,针对严重心动过缓(<45 bpm)或恶性心动过速(>180 bpm)的临床患者,硬性截断可能导致生理基频被错误过滤。
  • 对完全非配对数据的跨模态蒸馏尚待拓展:方法在训练时依赖相同被试的同步音视频/雷达配对序列。在完全缺乏配对雷达的大规模野外面部视频库上,如何借助非配对跨域生成或离线先验模型完成单向指导仍是有待攻克的难题。
  • 呼吸率及多生理指标联合蒸馏的扩展潜力:目前蒸馏目标集中在心率(HR)维度,未来可进一步将胸腔大幅度起伏对应的呼吸率(RR)以及微小血管脉搏波传导时间(PTT)纳入统一的频域多尺度蒸馏体系中。

相关工作与启发

  • vs 多模态融合方法 (如 SATM [Liang et al., 2025], FusionPhys [Ying et al., 2025]):融合模型通过设计跨模态注意力或空间对齐适配器在推断时聚合视频与雷达特征,但测试期对雷达硬件的强制绑定限制了其实用性;RPM-Distill 采用特权学习范式(LUPI),仅在训练期借助雷达,推断期彻底摆脱外挂硬件,且在跨域测试中性能甚至优于融合模型。
  • vs 通用跨模态知识蒸馏 (如 FitNets [Romero et al., 2015], C2KD [Huo et al., 2024], MST-Distill [Li et al., 2025]):通用 KD 大多集中在中间特征空间或全局分类输出的对齐,无法适配生理信号特有的低频周期物理规律;RPM-Distill 针对性提出频域解耦损失与基于双层元优化的自适应样本门控,有效解决了特征语义不对齐与不可靠教师造成的负迁移。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将射频雷达作为特权信息引入远程生理测量,频域解耦蒸馏与双层元学习策略设计巧妙且切中物理本质。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖跨数据集评测、有限标注分析、多模态时钟失步应力测试及消融实验,证据链完备扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,公式推导严谨,频域失效模式的物理剖析与可视化极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 兼顾了高精度学术探索与普通消费级摄像头落地应用,对生理计算和非接触式智能感知具有重大实践价值。