Sound-based Multi-Person 3D Pose Estimation¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://oumi03.github.io/sound-mhpe/
领域: 人体理解
关键词: 声学传感, 多人3D姿态估计, 主动声学感知, 时空建模, DETR架构
一句话总结¶
首次探索仅利用主动声学信号实现多人3D人体姿态估计,提出SoundMHPE框架,通过多尺度声学编码器解耦时频混叠特征,并借助逐帧多查询时序姿态解码器建模个体时序演化与跨人体声学交互。
研究背景与动机¶
在复杂现实场景中感知与追踪多人体姿态是计算机视觉的基础任务,在智能监护、运动分析与灾后搜救等领域具有重要价值。传统多人体姿态估计高度依赖光学摄像头(RGB图像或视频),但在弱光乃至全黑环境、严重视线遮挡下性能急剧恶化,且在卧室、卫生间等私密空间部署易引发严峻的隐私泄露争议。基于射频(WiFi/毫米波/超宽带雷达)的无感感知技术虽然具备穿透非金属障碍物的能力,但射频信号极易被水体或金属屏蔽,且在医疗监护室、民航客机等对电磁辐射有严苛限制的特殊场景中难以广泛部署。主动声学传感通过扬声器发射可控声波并由麦克风阵列拾取人体反射信号,波长相对较长且不受光照干扰,具备穿透金属缝隙绕射探测的物理潜力,且天然规避了光学图像的面部隐私暴露。
然而,现有声学姿态估计方案均严格局限于单人场景。一旦将感知目标拓展至多人共存环境,声波信号会遭遇严重的物理混叠挑战:多个人体在同一空间内运动引发的声学扰动在接收端直接发生线性叠加,个体运动特征难以分离;更为棘手的是,声波在多个运动人体之间会产生复杂的多次反射,导致声波传播延迟呈非线性混叠,严重破坏了时域运动与声学特征之间的直接对应关系。
面对多人体反射声学信号的高度混叠与时序失配难题,本研究不再将整段多帧声学信号盲目压缩为单个隐式表征,而是从时频多分辨率分析与时空解耦交互切入。核心 idea:构建双端解耦的编码-解码架构,在编码端通过多尺度STFT与时频分离自注意力剥离重叠的多人声学纹理,在解码端为每位个体的每一预测帧分配独立姿态查询,通过显式分离的单人运动注意力与跨人交互注意力协同重建三维动作时序。
方法详解¶
整体框架¶
SoundMHPE接收一组双扬声器发射周期性时间拉伸脉冲(TSP, Time Stretched Pulse)后由四通道Ambisonics麦克风采集的声学回波信号 \(s\),端到端预测空间内多个主体的三维人体关节点时序序列。输入声学序列长度覆盖包含历史观测在内的 \(N_{\text{in}} = N_{\text{out}} + N_{\text{prev}}\) 帧所对应的采样点,模型同步输出后续 \(N_{\text{out}}\) 帧的多人三维骨骼序列。
整体管线由两大部分构成:声学多尺度编码器(Acoustic Multi-scale Encoder, AME)与时序姿态解码器(Temporal Pose Decoder, TPD)。AME首先通过多窗口STFT提取不同时频分辨率的log-Mel谱图,经过时序与频率分离自注意力网络提取声学特征图;TPD则为假定的 \(M\) 个潜在人体实例中的每一帧分别构造独立的学习型查询向量(Queries),在逐层交替计算单人时序演化与跨人交互后,经由交叉注意力从声学特征图中提取对应人体的动作线索,最后通过线性投影输出关节点坐标与实例置信度。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["四通道声学回波信号<br/>4-channel Ambisonics (W,X,Y,Z)"] --> B["多尺度STFT谱图提取<br/>Multi-Scale STFT (L, 2L, 4L)"]
B --> C["多尺度时频解耦编码<br/>AME Blocks (TSA + FSA)"]
C --> D["声学特征图<br/>Acoustic Feature Map"]
E["时空解耦姿态查询<br/>Pose Queries M × (Nout + 1)"] --> F["实例与时序解耦解码<br/>TPD Blocks (MSA + ISA)"]
D --> G["跨模态注意力融合<br/>Cross-Attention"]
F --> G
G --> H["二分图匹配与姿态回归<br/>Hungarian Match & 3D Pose"]
关键设计¶
1. 多尺度STFT与时频解耦编码:权衡快变动作时序与微弱频域扰动
在主动声学感知中,单帧窗口大小直接决定了时频分析的物理极限。短时间窗能精准捕捉快速肢体动作的起始时刻与瞬态变化,但频率分辨率受限;长时间窗则具备极高的频率分辨率,能够解析多人体细微位移产生的多普勒频移,却会平滑时域细节。为此,AME采用三种时间窗口 \(L\)、\(2L\) 和 \(4L\) 分别结合 \(B\)、\(2B\) 和 \(4B\) 个Mel滤波器组,生成具有高时间分辨率的谱图 \(a_{\text{high-time}} \in \mathbb{R}^{N_{\text{in}} \times C \times B}\)、中等分辨率谱图 \(a_{\text{mid}} \in \mathbb{R}^{(N_{\text{in}}/2) \times C \times 2B}\) 以及高频率分辨率谱图 \(a_{\text{high-freq}} \in \mathbb{R}^{(N_{\text{in}}/4) \times C \times 4B}\)。在频域对齐并投影至嵌入维度 \(E\) 后,若使用标准全局自注意力将所有时频Token混杂计算,网络难以理清跨尺度与跨时隙的相关性。AME设计了两级解耦注意力机制:时序自注意力(Temporal Self-Attention, TSA)仅在同一种时间窗口分辨率内的Token之间计算,锁定同一尺度内部的时序演进规律;频率自注意力(Frequency Self-Attention, FSA)则专门在对应相同物理时间片段(长度为 \(4L\))的跨尺度Token间计算(包含来自 \(a_{\text{high-time}}\) 的4个查询、来自 \(a_{\text{mid}}\) 的2个查询和来自 \(a_{\text{high-freq}}\) 的1个查询),使不同时频颗粒度的表征在局部时间锚点处深度互补。
2. 逐帧多查询时序姿态解码:避免多时态运动表征坍缩
标准DETR目标检测与多目标姿态估计范式通常为每个目标个体分配一个单一的实例查询向量。但在连续多帧时序姿态估计中,若仅为单个人体分配一个向量来囊括其在整个时段内的复杂轨迹,会造成时序维度严重坍缩,使得该查询向量在交叉注意力中无法精确对齐声波回波中的细微多路径延迟。TPD针对每个潜在人体 \(m \in \{1, \dots, M\}\) 引入 \(N_{\text{out}}\) 个连续帧姿态查询以及 1 个独立的全局实例查询,总计维持 \(M \times (N_{\text{out}} + 1)\) 个可学习查询向量。每个姿态查询均注入特定帧的时序位置编码与特定个体的身份编码,使得处于前序时刻的查询能精准索引回波特征图的前半段扰动,而后序时刻查询能定位后续反射特征。独立实例查询的输出通过线性层预测该实例的存在置信度 \(\hat{c}_i\),推理时剔除低于阈值的虚警实例。
3. 运动与交互分离自注意力:解耦单人体动作平滑与跨人体反射遮挡
当查询数量扩展至 \(M \times (N_{\text{out}} + 1)\) 时,若直接在所有实例的所有帧查询之间执行标准自注意力,不仅计算开销激增,而且会无差别地将单人体骨骼物理运动约束与跨人体的声学互反射效应纠缠在一起。TPD将解码器内部的自注意力严格拆解为两个正交维度:动作自注意力(Motion Self-Attention, MSA)将计算严格限制在归属于同一主体的 \(N_{\text{out}} + 1\) 个查询内部,专注于约束单人关节时序运动的平滑性与生物力学合理性;交互自注意力(Interaction Self-Attention, ISA)则计算第 \(i\) 个主体与其余 \((M - 1) \times (N_{\text{out}} + 1)\) 个属于其他主体的查询之间的注意力分布,引导网络专门感知多人近距离运动时的遮挡关系、相对空间位移以及声波在体表弹射造成的声学互干涉。
损失函数 / 训练策略¶
训练阶段采用二分图匈牙利匹配算法(Hungarian Algorithm),在预测的 \(M\) 个实例与实际存在的真实人体标签之间实现最优一一匹配。总损失函数 \(\mathcal{L}\) 由姿态几何误差与存在置信度分类误差线性加权构成:
其中 \(\mathcal{L}_{\text{pose}}\) 是针对匹配上的真实人体预测骨骼关节点与真实三维坐标之间的均方误差损失(MSE),\(\mathcal{L}_c\) 是针对所有 \(M\) 个实例置信度的二元交叉熵损失(BCE),超参数权重设为 \(\lambda = 0.5\)。模型采用 AdamW 优化器,基础学习率设为 \(5 \times 10^{-5}\),权重衰减为 \(1 \times 10^{-4}\),在自建数据集上训练 500 个 Epoch。
实验关键数据¶
主实验¶
论文在新建的 6 小时 AMP(Acoustic Multi-person Pose)多人声学姿态数据集上开展三折跨被试交叉验证,评估指标包括平均关节位置误差(MPJPE,单位 mm)、Procrustes对齐后平均关节位置误差(PA-MPJPE,单位 mm)以及正确关键点百分比([email protected])。对比基准包括将SOTA单人声学姿态估计模型扩展为多人回归头的 Adapted Shibata et al.,以及将经典的WiFi多人姿态估计网络输入替换为声学谱图的 Repurposed Yan et al.。
原论文 Table 2 主实验性能对比数据如下:
| 方法 | MPJPE [mm] (↓) | PA-MPJPE [mm] (↓) | [email protected] (↑) |
|---|---|---|---|
| Shibata et al. [24] (Adapted) | 121.7 | 71.5 | 0.36 |
| Yan et al. [30] (Repurposed) | 119.9 | 69.7 | 0.36 |
| SoundMHPE (本文) | 106.5 | 65.0 | 0.43 |
在单人与三人极端场景下的分解对比(原论文 Table 4)表明,SoundMHPE 在三人复杂混叠场景下的 MPJPE 达到 111.2 mm,显著优于 Shibata et al. 的 124.5 mm 与 Yan et al. 的 122.4 mm。
消融实验¶
论文系统验证了核心模块(AME 与 TPD)及各自解耦注意力机制的有效性。
原论文 Table 3 核心组件消融对比数据如下:
| 配置 | MPJPE [mm] (↓) | PA-MPJPE [mm] (↓) | [email protected] (↑) | 说明 |
|---|---|---|---|---|
| Ours w/o AME | 115.2 | 67.5 | 0.38 | 仅使用单尺度高时间分辨率STFT与标准自注意力 |
| Ours w/o TPD | 116.5 | 69.0 | 0.38 | 每个实例仅使用单查询向量压缩全时序序列 |
| Ours (完整模型) | 106.5 | 65.0 | 0.43 | 完整包含多尺度编码器与逐帧多查询解码器 |
在注意机制消融中(原论文 Table 5),编码器若退化为标准注意力(Standard + MSA/ISA),MPJPE 恶化至 111.7 mm;解码器若退化为标准注意力(TSA/FSA + Standard),MPJPE 大幅劣化至 114.4 mm。在STFT窗口组合实验中(原论文 Table 6),选用的 \((L, 2L, 4L)\) 配置达到最低误差 106.5 mm,若缩减窗口为 \((L/4, L/2, L)\) 则误差激增至 118.5 mm。
关键发现¶
- 移除 TPD 会造成最显著的性能衰退(MPJPE 从 106.5 mm 跃升至 116.5 mm),这表明为每个运动帧分配独立查询、建立细粒度时序对齐机制,是化解多人声学感知时序模糊的核心杠杆。
- 窗口消融实验表明,牺牲频域分辨率一味追求更短的时间窗口会导致精度大幅下降,证明高频多普勒细微变动对于分离多人复杂微小动作(如躯干扭转、双臂抬起)至关重要。
- 在跨模态WiFi姿态估计基准(Person-in-WiFi 3D)上,将TPD直接迁移至CSI特征后,三维姿态估计误差从 127.4 mm 降至 122.6 mm,[email protected] 从 0.13 大幅跃升至 0.31,验证了该架构在非视距波动信号时空建模上的通用性。
亮点与洞察¶
- 首次确立了仅依赖主动声学探测实现无感多人三维姿态估计的可行性,拓宽了声学隐蔽感知在视觉遮挡与电磁受限环境下的应用边界。
- 采用多尺度STFT联合TSA与FSA自注意力,打破了传统单一窗口STFT在时域瞬态追踪与频域微弱多普勒分辨上的物理冲突。
- 提出逐帧解耦多查询机制,打破了DETR类模型在时序姿态回归中“一目标一向量”的传统定势,将单人运动平滑先验与跨人遮挡交互显式正交化。
局限与展望¶
- 实验环境虽然引入了室内背景噪声与混响,但主要在相对固定受控的声学房间中进行,声学环境的墙壁材质与大范围未知房间反射特性变化仍会对回波产生剧烈扰动。
- 系统依赖于主动发射周期性TSP扫频声信号,在人耳听觉范围内可能产生微弱的可闻噪声,未来需进一步探索高频超声波或隐蔽环境背景音乐(如BGM)载波模式。
- 当前数据集最大被试人数为3人,在更密集的人群走动与更远探测距离下,声学衰减与多次散射指数级恶化,需要更大规模阵列麦克风提供更高的空间角分辨率。
相关工作与启发¶
- vs Shibata et al. [24] & Oumi et al. [18] (单人声学姿态估计):既有方法均针对单人场景设计,直接将全时序谱图映射至单一骨骼,无法应对多人回波叠加与体表互反射;本文通过 AME 与 TPD 显式解耦多人混叠信号,在三人场景下误差降低 13.3 mm。
- vs Yan et al. [30] (Person-in-WiFi 3D):WiFi工作利用CSI信号进行多人检测,但仅依赖单帧或简单拼接查询,在预测动态连续姿态时缺乏显式帧级声学关联;本文提出的逐帧查询与正交自注意力结构不仅在声学领域优异,反哺WiFi基准后亦取得大幅提升。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次打通仅凭主动声学信号实现多人3D姿态估计的技术路线,架构创新明确。
- 实验充分度: ⭐⭐⭐⭐⭐ 构建了首个 6 小时多视角动捕对照数据集,消融严谨,且给出了跨模态迁移验证。
- 写作质量: ⭐⭐⭐⭐⭐ 问题表述清晰,声学物理机理与深度架构结合紧密,图表详实。
- 价值: ⭐⭐⭐⭐☆ 为暗光、极端隐私与电磁敏感场景下的人体行为感知提供了全新的技术手段。