跳转至

DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/jolin830/DAP-Net
领域: 3D视觉
关键词: 毫米波雷达, 动作识别, 点云网络, 多普勒效应, 异构多源泛化

一句话总结

针对毫米波雷达人体动作识别中因硬件设备与频段差异导致的异构多源域偏移,本文构建了首个大规模多源基准 UniMM-HAR,并提出了双空间多普勒重参数化网络 DAP-Net,结合几何增密、特征重校准与文本语义锚定实现了卓越的跨源泛化性能。

研究背景与动机

基于毫米波(mmWave)雷达的人体动作识别(HAR)由于具备天然的隐私保护特性,且对光照变化、烟雾遮挡以及恶劣天气高度鲁棒,正在智慧养老、智能家居和人机交互中展现出巨大的部署价值。与传统的可见光视频或骨骼数据相比,毫米波雷达通过电磁波反射捕获人体微动,能够以三维点云的形式提供明确的空间几何结构与运动信息。近两年来,随着一系列雷达数据集的开源,基于点云的毫米波动作识别技术取得了快速进展。

然而,现有毫米波点云动作识别数据集规模普遍偏小,且绝大多数数据均在同质单一源(homogeneous single-source)设定下采集——即固定采用特定型号的雷达硬件设备(如 TI IWR1443 或 IWR6843)及单一工作频段(如 60–64 GHz 或 76–81 GHz)。在真实的工业部署与家庭应用中,雷达系统面临频繁的设备更新换代、不同厂商硬件混用以及多雷达协同等复杂的异构多源环境。当不同雷达设备观测同一人体动作时,由于天线阵列孔径、调频连续波(FMCW)带宽及信号处理管道的不同,点云在点密度、空间分布形态、多普勒速度统计范围以及硬件噪声特性上会产生巨大的分布偏移。

这种由硬件差异引发的领域偏移并非简单的加性高斯噪声,而是与传感器参数紧密耦合的结构性变化。现有模型往往过拟合于特定硬件源的低阶统计偏差,无法学习到与雷达来源解耦的本质动作语义,导致跨设备迁移时性能出现断崖式下跌。为攻克这一核心瓶颈,本文构建了首个针对异构多源毫米波点云的大规模基准数据集 UniMM-HAR,并洞察到尽管多普勒速度的绝对数值受硬件影响,但其反映人体运动学规律的相对时空演化模式(例如手臂摆动的周期性振荡、深蹲时正负速度的交替)在不同雷达间保持高度一致。核心 idea:以动作一致的多普勒时空模式作为物理运动先验锚点,在几何空间通过自适应软分位数进行三分支选择性增密,在特征空间通过仿射调制重校准动态响应,并结合预训练文本语义空间提供源无关语义锚点,实现异构多源毫米波点云的鲁棒跨源动作识别。

方法详解

整体框架

DAP-Net 的整体流程包含数据标准化重构、双空间多普勒重参数化(Dual-space Doppler Reparameterization, D²R)、点云骨干网络特征编码以及文本语义对齐模块(Text Alignment Module, TAM)。系统输入为多源毫米波雷达点云序列,每个点包含三维空间坐标与一维多普勒径向速度。首先,D²R 模块在几何空间通过多普勒导向几何重参数化(DGR)抑制噪声并自适应增密运动关键点,在特征空间通过运动感知特征重校准(MFR)注入全局运动先验;随后,处理后的稠密点云送入通用的点云骨干网络提取全局语义表示;最后,TAM 模块将全局特征映射至预训练文本嵌入空间,与动作文本原型计算余弦相似度,并将相似度分数与分类器预测对齐融合,输出最终的动作分类结果。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入毫米波点云序列<br/>(x, y, z, 多普勒速度)"] --> B["多分支几何重参数化 (DGR)<br/>软分位数划分 + 三分支选择性增密"]
    B --> C["运动感知特征重校准 (MFR)<br/>动态点运动先验 + 特征仿射调制"]
    C --> D["点云骨干网络 (Backbone)<br/>PointMLP / UST-SSM 编码全局特征"]
    D --> E["文本语义对齐模块 (TAM)<br/>CLIP 动作文本原型 + 相似度对齐融合"]
    E --> F["最终动作分类结果"]

关键设计

1. 多分支几何重参数化:自适应动静分离与受控增密

针对毫米波点云固有的极度稀疏性与设备诱发噪声,以及不同雷达源之间点数悬殊的痛点,传统固定规则的全局增密(如简单重复采样)会无差别放大噪声并加剧跨源偏差,而基于生成式或插值的方法在缺乏点级密集监督下极易生成虚假的物理伪影。为此,DGR 模块结合多普勒物理线索设计了两步处理机制: 首先是多普勒排序软分位数(Doppler-sorted Soft Quantile, DSQ)。传统硬阈值无法应对跨设备的动态速度范围差异,DSQ 引入可学习分位数参数 \(q \in (0, 1)\)。对每一帧内所有点的多普勒绝对速度升序排序后,目标分位索引为 \(P_t^{\text{tgt}} = q(P_t - 1)\),以此为中心构建高斯加权权重: $\(w_t^i \propto \exp\left(-\frac{(i - P_t^{\text{tgt}})^2}{2\sigma_t^2}\right)\)$ 从而计算出自适应动态阈值 \(\tau_t = \sum_{i=1}^{P_t} w_t^i v_t^i\)。随后通过 Sigmoid 激活与直通估计器(Straight-Through Estimator, STE)生成平滑且可导的运动指示置信度 \(s_t^i = \sigma((v_t^i - \tau_t)/\gamma)\)。 其次是三分支运动感知点增密(Tri-branch Motion-Aware Point Densification, TMPD)。依据置信度 \(s_i\) 将点集解耦为快速分支 \(\mathcal{P}_{\text{fast}}\)、慢速分支 \(\mathcal{P}_{\text{slow}}\) 与原始分支 \(\mathcal{P}_{\text{raw}}\)。对于包含高动态人体微动的快速分支,采用受控的 \(r\) 倍重复复制策略(\(r=5\)),大幅提升关键运动区域的采样密度;慢速分支保持几何原貌以保留人体躯干和背景结构;原始分支则均匀随机采样补齐剩余点数,使最终输出点数严格对齐到固定预设值 \(P_{\text{goal}} = 1024\)。该设计有效对齐了异构源点云的空间几何结构,消除了硬件引发的点密度失衡。

2. 运动感知特征重校准:多普勒物理动态引导的特征调制

现有点云分类骨干网络绝大部分针对激光雷达(LiDAR)或深度相机设计,主要建模静态三维欧氏坐标 \((x, y, z)\),对毫米波雷达特有的多普勒多维信号缺乏针对性特征提取机制,难以有效捕捉人体各关节细微的相对速度变化。为了在特征空间显式强化动态语义,MFR 模块利用 DGR 提取出的高动态点集合 \(\mathcal{P}_{\text{fast}}\),构建跨硬件源稳健的运动先验条件。 将快速点的高维嵌入 \(\mathcal{F}_{\text{fast}}\) 进行通道均值池化,聚合得到全局运动摘要向量: $\(c = \frac{1}{|\mathcal{F}_{\text{fast}}|} \sum_{i \in \mathcal{F}_{\text{fast}}} f_i\)$ 随后,利用轻量级多层感知机(MLP)网络以向量 \(c\) 为条件预测特征通道的仿射缩放系数 \(\gamma \in \mathbb{R}^C\) 与平移偏置 \(\beta \in \mathbb{R}^C\): $\(\gamma = \text{MLP}_\gamma(c), \quad \beta = \text{MLP}_\beta(c)\)$ 进而对骨干网络提取的稠密点云特征 \(\mathcal{F}_{\text{out}}\) 执行通道级特征重校准: $\(\mathcal{F} = \gamma \odot \mathcal{F}_{\text{out}} + \beta\)$ 这一类似 FiLM 条件层机制的自适应变换,根据动作实际运动剧烈程度动态激活与运动特征高度相关的通道表征,同时自适应抑制与设备相关的静态静态杂波响应,使得模型学到的特征对雷达发射机和射频差异具备极强的抗扰性。

3. 文本语义对齐模块:跨模态预训练知识提供不变语义锚点

在面临严峻的雷达硬件域迁移时,仅依靠雷达点云单模态训练容易受限于低信噪比和稀疏性,导致特征空间发生严重漂移与聚类发散。自然语言空间经过大规模跨模态预训练,具有极其清晰、稳定的动作语义拓扑结构,不受雷达底层物理信号与传感器差异的影响。TAM 模块创新性地将预训练语言模型的语义先验作为源无关的不变锚点(Invariant Semantic Anchor)。 具体而言,对于数据集中的 \(K\) 个动作类别,采用统一的提示词模板(如 "a mmWave point cloud of a person [CLS]"),通过冻结参数的 CLIP 文本编码器离线提取类别文本原型嵌入 \(F_{\text{text}} \in \mathbb{R}^{K \times C_{\text{text}}}\)。点云骨干提取的全局点云特征 \(\tilde{F}\) 经轻量投影层映射至文本嵌入空间得到 \(F_{\text{mmw}}\),随后计算雷达特征与文本原型的类别余弦相似度矩阵: $\(S = \text{Softmax}(F_{\text{mmw}} F_{\text{text}}^\top) \in \mathbb{R}^{K \times K}\)$ 提取对角线相似度向量 \(s = \text{diag}(S) \in \mathbb{R}^K\),将其作为语义相似度偏置与雷达骨干网络分类头输出的原始 Logits \(z \in \mathbb{R}^K\) 进行线性融合,最终生成鲁棒的预测分布 \(\hat{y}\)。这一跨模态正则化机制为异构多源特征映射提供了稳定的几何语义约束。

一个完整示例

以一段包含 32 帧深蹲(squat)动作的雷达序列为例(单帧初始点数 \(P=64\)): 1. 多普勒划分与几何增密:在深蹲下潜最快的一帧,DSQ 模块对 64 个点的径向多普勒速度排序,通过可学习分位数 \(q=0.3\) 计算高斯加权阈值 \(\tau_t\),STE 判决出 16 个高动态腿部/躯干点(快速分支)与 48 个低速点(慢速分支)。TMPD 将 16 个快速点执行 5 倍复制扩展为 80 个点,保留 48 个慢速点,并在原有点集中随机抽取 \(1024 - 80 - 48 = 896\) 个点,最终重组为 1024 个点的规整点云。 2. 特征调制与骨干抽取:快速点特征经全局均值池化压缩为 128 维运动条件向量 \(c\),经 MLP 预测出 128 维调制参数 \(\gamma\)\(\beta\),对 1024 个点的空间特征做通道级仿射变换,显著放大下潜方向的速度响应。PointMLP 骨干网络随后抽取 512 维的全局运动表征。 3. 跨模态对齐与决策:全局特征通过投影层与 CLIP 编码的 33 种动作文本描述比对,在 "a mmWave point cloud of a person squat" 对应维度产生高相似度得分,结合雷达分类器得分,最终以极高置信度命中深蹲类别。

损失函数 / 训练策略

模型采用端到端方式训练,以融合后的综合预测分布 \(\hat{y}\) 与动作真值标签 \(y\) 计算标准交叉熵损失函数: $\(\mathcal{L} = -\sum_{k=1}^K y_k \log \hat{y}_k\)$ 在实验配置中,采用两张 NVIDIA RTX 4090 GPU 训练 150 个 epoch,Batch Size 设置为 128,初始学习率设为 0.01,权重衰减系数为 \(1 \times 10^{-4}\)。骨干网络默认采用 PointMLP,DGR 输出目标点数 \(P_{\text{goal}} = 1024\)

实验关键数据

主实验

UniMM-HAR 包含 Cross-Subject(C-Sub,跨受试者)和 Cross-Set(C-Set,跨场景与跨设备配置)两种具有代表性的多源评估协议。下表给出了 DAP-Net 与当前主流点云网络(包括传统毫米波点云网络 MPC、静态点云网络 SPC 以及时空时序点云网络 TPC)在两项协议下的对比结果。

模型 来源会议/年份 原始点云类型 C-Sub 准确率 (%) C-Set 准确率 (%)
RadHAR mmNSS'19 MPC 42.49 48.47
FastHAR CIKM'24 MPC 53.72 61.16
PointNet CVPR'17 SPC 59.27 70.96
DGCNN NN'18 SPC 71.70 52.18
PointCLIP CVPR'22 SPC 67.82 69.82
Clip2point ICCV'23 SPC 64.17 59.56
PointMLP ICLR'22 SPC 71.06 78.13
PST-Transformer TPAMI'22 TPC 63.13 79.70
3DInAction CVPR'24 TPC 73.43 57.81
UST-SSM ICCV'25 TPC 71.50 48.40
DAP-Net (本文) ECCV 2026 MPC 80.72 81.82

消融实验

在 UniMM-HAR C-Sub 协议下,针对核心模块(D²R、TAM)以及不同骨干网络的通用有效性进行了细致消融:

骨干网络 模块配置 准确率 (%) 相对基线增益
PointMLP Baseline 71.06 -
PointMLP + DGR (单独几何重参数化) 76.97 +5.91%
PointMLP + MFR (单独特征重校准) 78.76 +7.70%
PointMLP + D²R (DGR + MFR) 80.00 +8.94%
PointMLP + D²R + TAM (完整 DAP-Net) 80.72 +9.66%
UST-SSM Baseline 71.50 -
UST-SSM + D²R 74.00 +2.50%
UST-SSM + D²R + TAM 74.94 +3.44%
PST-Transformer Baseline 63.13 -
PST-Transformer + D²R 76.73 +13.60%
PST-Transformer + D²R + TAM 78.21 +15.08%

此外,在点云增密策略的对比实验中,固定输出点数 \(P_{\text{goal}} = 1024\): - 重复采样(Repeat Sampling):71.06% - 超帧时空融合(Super-frame Fusion):59.72%(下降 11.34%) - MLP 生成式增密(MLP densification):43.54%(大幅下降 27.52%) - 本文 DGR 增密:76.97%(相对基线大幅提升 5.91%)

在分位数设计对比中,固定阈值 0.2 / 0.5 / 0.8 的准确率分别为 76.46%、76.14% 和 76.12%,而可学习软分位数 DSQ 达到 76.97%,证明自适应相对阈值的显著优越性。

关键发现

  • D²R 模块贡献最为核心:单独加入 D²R 即可为 PointMLP 带来 8.94% 的绝对增益,在时空 Transformer(PST-Transformer)上更是暴涨 13.60%,证实了多普勒先验对克服雷达稀疏性与异构域偏移的决定性作用。
  • 生成式插值增密在雷达点云上完全失效:通过 MLP 生成或连续帧融合增密导致精度暴跌(分别下降 27.52% 和 11.34%),原因在于雷达点云信噪比低且帧间缺乏稳定的几何对应,强行插值会构造出严重的物理非一致性伪影;相反,受控的动态点物理重复策略保持了真实电磁反射特征。
  • 跨源泛化指标显著提升:在特征中心距离(Centroid Distance)与域间协方差对齐误差(CORAL)指标上,DAP-Net 较基线均展现出成倍的域漂移收敛能力,证明学习到的特征高度源解耦。

亮点与洞察

  • 多普勒物理特性的深度解耦:不同于以往将多普勒速度单纯视作第四维静态特征或仅用于简单滤波的做法,本文将其作为运动强度的物理先验,分别驱动几何增密和通道级特征重校准,设计极具雷达领域针对性。
  • 即插即用的轻量化架构:D²R 模块本身计算开销和新增参数量极小(FLOPs 与 Params 增加微乎其微),却能普适性赋能 PointMLP、UST-SSM 和 Transformer 等各类点云骨干,具备极佳的工程实用价值。
  • 首个异构多源毫米波基准:打破了学术界长期在单一设备、单一频段合成干净环境下评测的温室效应,通过标准化三大经典数据集建立了涵盖 33 类动作、62 名受试者的大规模真实挑战基准。

局限与展望

  • 受试者与场景规模仍有拓展空间:尽管 UniMM-HAR 是目前最大的异构数据集,但受限于现有开源雷达数据源的整合,受试者总数仅为 62 人,且未涵盖更丰富室外极端场景或多人交互复杂动作。
  • 缺乏多角度雷达协同建模:DAP-Net 目前主要针对单雷达接收机的异构多源迁移,未显式处理空间中多雷达环视或异构雷达同时在线协同感知的联合标定与特征融合问题。
  • 未来方向:可进一步将多普勒时空先验拓展至多视角雷达网络,或结合多模态大语言模型(MLLM)实现少样本/零样本条件下的复杂跨源行为理解。

相关工作与启发

  • vs RadHAR / FastHAR 等专用雷达网络:传统毫米波 HAR 方法受限于单源实验设定,直接将点云输入浅层网络或手工提取微多普勒谱图,在异构硬件下严重退化(在 C-Sub 上仅获 42%~53%)。DAP-Net 通过动静解耦与文本锚定,准确率突破 80%。
  • vs PST-Transformer / 3DInAction 等通用时空点云网络:激光雷达点云骨干假定点云密集且几何表面连续,直接移植到稀疏低信噪比毫米波雷达上难以拟合。DAP-Net 作为即插即用前端,为稠密点云模型补足了毫米波物理运动先验,成功释放了 SOTA 骨干在雷达模态上的潜力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 提出首个多源异构毫米波基准,并将多普勒物理规律优雅融入几何增密与特征重校准。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 10 种代表性点云网络横向对比,提供跨骨干、分位数、增密方式和跨源指标的详尽消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题阐述清晰,图表绘制精美,技术方案层层递进且逻辑闭环。
  • 价值: ⭐⭐⭐⭐⭐ 推动毫米波感知从理想实验室迈向真实多设备协同部署,具有重要的产业应用落地价值。