跳转至

MuCHeR: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/naver/multi-hmr2
领域: 3D视觉
关键词: 3D人体网格恢复, 多人检测, 相机坐标系定位, DETR, 人体跟踪

一句话总结

MuCHeR(Multi-HMR 2)提出了一个简单且鲁棒的单阶段 DETR 多人三维人体检测、网格恢复与跟踪框架,通过仅基于 2D 位置的二分图匹配实现轻量级高效训练并吸纳纯 2D 监督,结合垂直视场角预测在无真实相机内参下实现高精度相机坐标系绝对度量定位,并通过蒸馏 SAM2 记忆特征实现无需视频数据训练的在线人体网格跟踪。

研究背景与动机

从单张 RGB 图像中感知多人三维状态是具身智能、人机交互与社交场景理解的基础任务。传统多人三维人体网格恢复(Human Mesh Recovery, HMR)普遍遵循“自顶向下”的两阶段流程:首先利用通用目标检测器在画面中定位每个人体的 2D 边界框,随后对每个裁切区域独立回归三维人体网格。这种范式计算开销随着画面人数线性增长,切断了全局场景语境与人与人之间的物理空间约束,且后处理拼接无法恢复可靠的场景绝对度量定位。近年来以 CenterNet 为代表的单阶段方法虽然提升了推理速度,但当人群发生密集重叠或肢体严重遮挡时,落入同一特征网格的不同人体容易产生检测冲突与漏检。

与此同时,近期引入的 DETR 范式虽然改善了遮挡下的交互感知,但现有工作陷入了数个严重的工程与建模瓶颈。首先,AiOS 和 SAT-HMR 等方案在二分图匹配阶段,将所有预设 Query 强制通过可微人体参数化模型生成完整关节进行 3D 匹配,导致 GPU 显存膨胀至 27GB 以上且单步反向传播耗时剧增,不仅使得训练极为昂贵,而且完全无法利用缺少 3D 网格真值的海量 2D 关键点数据。其次,现有方法大多武断假定固定相机参数(如 AiOS 假定 5000mm 焦距,SAT-HMR 假定 60° 视场角),导致在真实多变视场角下相机坐标系的绝对度量深度(Abs-PVE)产生数米乃至数十米的巨大漂移。此外,传统 SMPL 模型仅能表征成年人体,面对儿童和婴儿时模型会强行放大深度将其预测为远距离成年人,带来不可逆的度量尺度失真;在视频跟踪扩展上,现有方法则高度依赖带时序标注的 3D 视频与骨骼序列。

面对上述系统性矛盾,本文的核心切入点在于重构端到端多任务解耦与感知表征:在训练阶段将 Query 匹配与耗时的人体参数前向计算解耦,在几何表征上联合估计相机内参与包容性人体模型,在时序关联上利用大模型的静态时空特征先验。核心 idea:构建基于 Anny 全年龄人体模型的单阶段 DETR 框架,采用轻量化 2D 位置二分图匹配大幅降本并兼容异构数据,通过 ViT CLS 回归视场角实现无真值内参的高精度相机空间度量定位,并蒸馏 SAM2 记忆编码器特征实现完全无需视频训练的免标注在线网格跟踪。

方法详解

整体框架

MuCHeR 的整体架构遵循单阶段 DETR 检测与回归范式。输入单张 RGB 图像(训练期采用随机长宽比居中裁剪,最大边长为 768 像素),首先通过 DINOv3 预训练初始化的 ViT-Large 骨干网络提取图像 Patch Token 序列与图像级 [CLS] Token。[CLS] Token 输入轻量级 MLP 头预测垂直视场角(vFOV),用于后续三维逆投影。解码器维护 100 个可学习人体 Query,通过 8 层交替堆叠的人体自注意力、图像跨注意力与前馈网络进行特征增强。解码后的 Query 分别接入四个预测头:检测分类置信度得分头、2D 像素中心与对数深度(Nearness)定位头、Anny 人体模型姿态与体型参数头,以及跟踪特征回归头。在训练期间,仅基于 2D 像素位置和分类损失进行匈牙利二分图匹配,仅有命中真值的人体 Query 才会输入可微 Anny 模型生成 3D 网格;在推理阶段,置信度阈值过滤后的 Query 直接驱动三维逆投影与人体网格生成,并利用蒸馏自 SAM2 的特征进行在线跨帧关联。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    IN["输入 RGB 图像<br/>可变长宽比裁剪 (最大边 768)"] --> ENC["ViT-Large 骨干网络<br/>提取图像 Token 序列与 CLS Token"]
    ENC --> D1["相机内参预测与反投影相机坐标系定位<br/>CLS Token 经 MLP 回归垂直 FOV 并计算逆投影"]
    ENC --> DEC["DETR 解码器<br/>100 个可学习 Query 经 8 层跨注意力交互"]
    DEC --> D2["2D 位置二分图匹配<br/>利用 2D 像素中心与分类得分完成匹配并过滤负样本"]
    D2 --> D3["包容性 Anny 人体模型与异构多源数据自适应监督<br/>回归 163 个关节旋转与 6 个人体参数,自适应多源损失微调"]
    DEC --> D4["SAM2 记忆特征蒸馏实现无视频跟踪<br/>回归 4096 维记忆特征,测试期融合骨盆脊回归在线跟踪"]
    D1 & D3 & D4 --> OUT["相机坐标系 3D 人体网格与时序轨迹<br/>输出绝对度量场景重建与多人身份关联"]

关键设计

1. 相机内参预测与反投影相机坐标系定位:从全局图像感知真实视场角与度量级 3D 空间

以往多人 HMR 方案直接假设相机焦距固定(如 AiOS 设为 5000mm)或视场角恒定为 60°,这使得模型预测的深度在非标准相机拍摄的图像中产生严重比例错位。为彻底解决这一问题,MuCHeR 利用 ViT 编码器的全局 [CLS] Token,经由一个 3 层 MLP 直接回归图像的垂直视场角 \(v\text{FOV}\),假设主点位于图像中心且横纵像素比为 1。对于每个人体实例,模型不直接回归绝对 3D 坐标,而是解耦为 2D 像素中心坐标 \(\hat{l}_i\) 和对数空间深度(Nearness \(n_i = \log(1/z_i)\))。通过预测的相机内参矩阵 \(K\) 执行连续可微的逆投影变换 \(\Pi_K^{-1}\),便可在相机坐标系中精准恢复绝对公制度量下的 3D 人体根节点位置。同时,为规避透视投影在极度远近时的奇异性,模型引入球面角投影损失计算 3D 射线与真值方向的夹角: $\(\mathcal{L}_{\text{2D angle}} = \frac{1}{s_K} \angle\left(\Pi_K^{-1}(\hat{u}_i), \Pi_K^{-1}(u_i)\right)\)$ 其中 \(s_K\) 为相机对角线视场角归一化因子。该设计使得预测的相机内参在视频序列中极为平滑稳定(标准差仅 2.5° 左右),且消除了对测试集相机真值的依赖。

2. 2D 位置二分图匹配:轻量化分配机制加速训练并解锁纯 2D 异构监督

先前的 DETR 式 HMR 架构(如 SAT-HMR 与 AiOS)将所有 \(N=100\) 个查询全部前向输入复杂的人体参数化骨骼运动树,计算高维 3D 关节欧氏距离以构造匹配成本矩阵。这导致单卡显存消耗高达 27GB,迭代时间长达 0.48s/step,且由于必须计算 3D 关节真值距离,无法直接利用海量只标注了 2D 边界框或关键点的自然图像。MuCHeR 大胆将二分图匹配前移:仅基于预测的 2D 像素坐标 \(\hat{l}_i\) 与分类置信度 \(\hat{c}_i\) 进行匈牙利匹配,形式化为带约束的最小化代价分配: $\(\min_{x_{ij}} \sum_{i=1}^N \sum_{j=1}^M x_{ij} \left( \|\hat{l}_i - l_j\|_1 + F_C(\hat{c}_i) \right)\)$ 其中 \(F_C(\hat{c}_i) = -\alpha(1-\hat{c}_i)^\gamma \log(\hat{c}_i)\) 为标准 Focal Loss(\(\alpha=0.25, \gamma=2\))。未被选中的负样本 Query 在匹配后直接丢弃,仅有匹配到真值的 Query(最多 \(M\) 个)才会输入可微人体模型进行姿态参数解码与网格生成。该策略将训练显存由 27GB 骤降至 7GB(降幅 74%),单步时间加速至 0.35s,不仅支持单卡一周内完成全量训练,更让利用 MS-COCO 和 OpenImages 等纯 2D 关键点数据集进行端到端协同训练成为可能。

3. 包容性 Anny 人体模型与异构多源数据自适应监督:覆盖全年龄体型差异并防止姿态先验坍塌

传统 SMPL 模型受限于成年人统计模板,在画面出现婴儿、儿童或特殊身材时,网络被迫通过篡改绝对深度来弥补尺寸差异,造成严重的度量漂移。MuCHeR 采用开源的 Anny 人体参数化模型,其包含全年龄段(涵盖婴儿至老年人)与多元体型的统一骨骼拓扑,仅通过 163 个关节的 6D 连续旋转参数与 6 个具备可解释性的宏观体型参数即可生成高保真人体网格。为了在海量异构数据上稳定收敛,论文构建了分级自适应监督策略:对带完美三维网格与相机标注的合成数据(Anny-One、BEDLAM)全面监督相机、检测、深度、姿态、网格顶点及其 2D 重投影;对真实场景下生成的稀疏伪真值数据(CameraHMR 拟合的 COCO/MPII/AIC),仅监督 3D 姿态与体型,不惩罚未被标注的真实人体检测结果;对纯 2D 关键点数据,仅监督检测与 2D 重投影误差。针对引入大规模 2D 弱监督时下半身遮挡易导致姿态坍塌为“假坐姿”的退化现象,MuCHeR.b 模型引入 3D 预训练基线(MuCHeR.a)作为正则化教师模型,通过姿态参数与 3D 关节的 L2 一致性损失维持刚性生物力学先验,在大幅提升 2D 召回率的同时守住了 3D 几何真实性。

4. SAM2 记忆特征蒸馏实现无视频跟踪:将时空分割大模型能力蒸馏为零视频训练的在线关联特征

视频中的多人 3D 人体网格跟踪传统上高度依赖时序连续的视频标注数据或人体动作捕捉序列,或者依赖对光照敏感的手工外观纹理贴图。MuCHeR 首次提出利用通用视频分割大模型 SAM2 的记忆编码先验。在仅有静态单张图片的训练过程中,利用人体的真值分割掩码(来自合成集或密集标注集),将原图通过 SAM2 图像编码器,并将特征图与人体掩码联合送入 SAM2 记忆编码器,生成 \(64 \times 64 \times 64\) 维度的记忆特征图。经过 \(8 \times 8\) 平均池化与展平操作,压缩为 4096 维的密集外观与空间表征向量,由 DETR 解码器的跟踪头直接回归。在视频在线推理时,无需输入任何时序帧,仅对每帧独立检测的人体提取该特征并存入过去 50 帧的特征库,通过 KNN(\(K=35\))加权余弦相似度匹配,并辅以过去 8 帧骨盆 3D 轨迹的岭回归运动平滑,即可实现高精度的跨遮挡多人 ID 持续追踪。

损失函数 / 训练策略

训练总损失函数结合了多模态联合任务的互补约束: $\(\mathcal{L} = \lambda_{\text{cls}} \mathcal{L}_{\text{cls}} + \lambda_{\text{loc}} \mathcal{L}_{\text{loc}} + \lambda_{\text{depth}} \mathcal{L}_{\text{depth}} + \lambda_{\text{cam}} \mathcal{L}_{\text{cam}} + \lambda_{\text{pose}} \mathcal{L}_{\text{pose}} + \lambda_{\text{mesh}} \mathcal{L}_{\text{mesh}} + \lambda_{\text{2D}} \mathcal{L}_{\text{2D angle}} + \lambda_{\text{track}} \mathcal{L}_{\text{track}}\)$ 具体包含分类 Focal Loss、2D 像素位置 L1 损失、对数空间 Nearness 深度 L1 损失、视场角非对称损失(对高估视场角施加更严厉惩罚以避免焦距欠估计)、Anny 姿态 6D 旋转参数与体型 L1 损失、骨盆对齐的 3D 关节与网格顶点 L1 损失、球形投影角误差 \(\mathcal{L}_{\text{2D angle}}\),以及 SAM2 跟踪特征向量的 L1 蒸馏损失。优化器采用 Adam,ViT 骨干网络以 DINOv3 权重初始化。分阶段训练:先在合成数据与 3D 伪真值上训练纯 3D 基础模型(MuCHeR.a),随后在引入大规模 2D 关键点数据时施加姿态正则化微调获得完整模型(MuCHeR.b)。

实验关键数据

主实验

在标准单目野外 HMR 基准 3DPW 与 EMDB 上,MuCHeR 展现了领先的姿态精度与断层式提升的相机坐标系度量定位性能(表 1);在密集交互基准 Hi4D 与 Harmony4D 上同样刷新了双人对齐误差(表 2);在 PoseTrack21 上实现了在不依赖视频训练数据下的 SOTA 跟踪精度(表 3)。

表 1: 野外 3D 人体网格恢复性能评估(3DPW 与 EMDB)

方法 相机参数 3DPW PA-MPJPE (mm) ↓ 3DPW PVE (mm) ↓ 3DPW TA-PVE (mm) ↓ EMDB PA-MPJPE (mm) ↓ EMDB PVE (mm) ↓ EMDB Abs-PVE (mm) ↓
AiOS 固定相机 (5000mm) 45.0 90.9 774.3 63.3 108.1 11962.1
SAT-HMR 固定相机 (60°) 52.7 94.5 174.5 71.0 126.7 1093.0
Multi-HMR 真实内参 (GT) 46.9 88.8 187.2 48.5 87.1 168.1
MuCHeR.a 预测内参 (Pred) 40.5 80.1 170.1 48.3 78.7 273.6
MuCHeR.b 预测内参 (Pred) 41.8 78.1 161.9 52.5 83.6 374.8
MuCHeR.a 真实内参 (GT) 40.2 79.9 149.8 48.3 78.7 129.4
MuCHeR.b 真实内参 (GT) 41.6 77.7 145.6 52.5 83.6 131.7

表 2: 紧密多人交互基准评测(Hi4D 与 Harmony4D)及视频跟踪评估(PoseTrack21)

评估场景 方法 基础设定 MPJPE (mm) ↓ Pair-PA-MPJPE (mm) ↓ TA-PVE (mm) ↓ 检测 F1 / Recall ↑
Hi4D (交互) AiOS 固定相机 72.9 239.0 694.4 98% (F1)
SAT-HMR 固定相机 88.2 85.5 132.4 100% (F1)
Multi-HMR 真实内参 69.2 82.2 116.2 98% (F1)
MuCHeR.a 预测内参 61.7 79.5 114.9 100% (F1)
MuCHeR.a 真实内参 61.7 78.3 113.1 100% (F1)
Harmony4D (复杂交互) AiOS 固定相机 130.5 304.8 3454.8 91% (Recall)
SAT-HMR 固定相机 140.3 144.0 676.3 97% (Recall)
Multi-HMR 真实内参 146.0 140.8 388.1 93% (Recall)
MuCHeR.a 预测内参 131.8 99.8 231.2 97% (Recall)
MuCHeR.a 真实内参 128.4 96.2 233.6 97% (Recall)
PoseTrack21 (跟踪) Humans4D 静态图像训练 (两阶段) - - - IDF1: 72.5% / MOTA: 60.2%
MuCHeR.b 静态图像训练 (零视频监督) - - - IDF1: 75.2% / MOTA: 65.5%
CoMotion 视频时序监督训练 - - - IDF1: 79.5% / MOTA: 70.1%

消融实验

论文系统探究了二分图匹配策略、数据配比、长宽比填充策略及相机设置对模型性能的影响(表 3)。

表 3: 核心组件消融实验(匹配方式、训练数据配比与相机假设对比)

消融维度 具体配置 3DPW PVE (mm) ↓ 3DPW PA-MPJPE (mm) ↓ Hi4D Pair-PA-MPJPE (mm) ↓ MS-COCO Keypoint AP ↑ MS-COCO Keypoint AR ↑
匹配策略 3D 关节匹配 (J3D, 类 AiOS) 104.5 55.1 84.8 8.6 16.7
3D 空间中心位置匹配 93.0 46.8 76.4 17.0 30.4
2D 像素位置匹配 (本文) 90.5 45.6 77.8 21.9 29.4
训练数据 仅合成数据 (S) 93.6 48.2 64.0 11.9 24.7
仅真实图像伪真值 (R) 88.7 45.7 75.7 21.3 26.6
合成 + 真实伪真值 (S+R, 即 MuCHeR.a) 90.5 45.6 77.8 21.9 29.4
朴素加入 2D 数据 (S+R+2D 无正则) 91.6 46.9 84.2 16.8 32.9
正则化微调 (MuCHeR.b) - - - 50.7 56.2
相机设定 训练 GT 内参 / 测试 GT 内参 90.5 (Abs: 148.0) 45.6 77.8 - -
训练 GT 内参 / 测试预测内参 92.4 (Abs: 609.8) - 91.0 - -
训练预测内参 / 测试预测内参 86.2 (Abs: 577.3) - 72.7 19.6 31.0

关键发现

  • 匹配机制并非越复杂越好:在固定训练计算预算下,采用 2D 像素中心进行二分图匹配的网格重建质量(PVE 90.5mm)显著优于耗时耗显存的 3D 关节匹配(PVE 104.5mm)。原因在于 2D 匹配解耦了姿态优化的前向搜索负担,极大释放了单卡训练 Batch Size 和收敛步数。
  • 相机自适应预测彻底打破度量瓶颈:在 EMDB 数据集上,AiOS 的绝对空间误差 Abs-PVE 达到惊人的 11962.1mm(近 12 米),SAT-HMR 为 1093.0mm,而 MuCHeR 在预测视场角下即达到 273.6mm,在输入真实相机下达到 129.4mm,实现了数量级的空间定位精度跃升。
  • 异构数据冲突与姿态先验正则化:直接向 3D 训练集中加入 2D 关键点标注(S+R+2D)虽然会提升远距离人体的检测召回率,但会导致下半身遮挡时的 3D 姿态先验发生破坏。通过 MuCHeR.b 中的教师姿态蒸馏正则化,模型在 COCO 关键点 AP 上由 34.0 跃升至 50.7,同时完好保持了 3D 几何的生理自洽性。

亮点与洞察

  • 2D 解耦匹配的计算与泛化双赢:传统 DETR HMR 方法盲目迷信 3D 全关节匹配,而 MuCHeR 证明仅基于 2D 位置二分图匹配不仅能让单步训练时间减少 27%、显存暴跌 74%,更直接打破了必须依赖 3D 标注才能构建匹配代价矩阵的藩篱,使得海量 2D 弱监督数据无缝融入 DETR 架构。
  • 静态大模型跨任务蒸馏的降维打击:利用 SAM2 图像与记忆编码器提取的 4096 维特征充当人体外观与时空连续性嵌入,巧妙避开了对昂贵 3D 动作捕捉视频数据集的重度依赖,实现了首个“纯静态图片训练即可在线跟踪 3D 人体网格”的优雅范式。
  • 包容性全年龄人体模型的度量刚性:通过引入 Anny 这一能够统一表征婴儿、儿童及老年人的通用模型,从根本上消除了“误将儿童视作远方成年人”引起的尺度-深度模糊,显著提升了社会场景中多人复杂交互的度量重建可信度。

局限与展望

  • 极端广角畸变与自拍视角的适应性不足:模型假设简单的针孔相机模型,未显式建模径向/切向镜头畸变。在手机超广角前置自拍或鱼眼车载相机等大畸变场景下,人体重投影精度会受到明显扰动。
  • 未建模复杂交互下的物理接触与防穿模约束:在 Hi4D 等极近距离拥抱或搏斗交互中,尽管 Pair-PA-MPJPE 达到先进水平,但网络缺乏显式的表面碰撞惩罚和接触流形建模,偶尔会出现肢体局部穿透。
  • DETR 收敛速度与加速架构探索:当前模型基于基础 DETR 架构开发,在单卡上收敛仍需约一周时间。未来可结合 DINO-DETR、Group DETR 或轻量化混合注意力机制进一步加速收敛速度。

相关工作与启发

  • vs AiOS (ECCV 2022):AiOS 是首个 DETR 式多人 HMR 方法,但其基于弱透视假设且固定焦距为 5000mm,且依赖多阶段裁切预测细节,全 Query 参与 3D 关节匹配导致显存开销极大;MuCHeR 则采用端到端无裁切单阶段结构,引入 2D 匹配与全局视场角预测,在绝对定位误差上将其从万毫米级压缩至百毫米级。
  • vs Multi-HMR (ECCV 2024):Multi-HMR 基于 CenterNet 框架,当多人身体中心重叠在同一图像块内时会产生严重漏检,且无法适应全年龄体型;MuCHeR 采用基于 Query 的 DETR 解码机制天然免疫中心重叠碰撞,结合 Anny 模型在密集交互场景(Hi4D/Harmony4D)中实现了大幅度性能反超。
  • vs Humans4D (ICCV 2023):Humans4D 采用传统的两阶段检测再拟合流程,需要繁重的手工纹理匹配算法实现追踪;MuCHeR 采用纯单阶段端到端网络,通过蒸馏 SAM2 记忆特征,在零视频监督训练的前提下取得了更高的 MOTA 与 IDF1 跟踪性能。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [创新的轻量化 2D 匹配解耦设计、端到端相机视场角联合感知以及首创的静态 SAM2 记忆特征蒸馏在线跟踪]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖单人野外、密集双人交互、单目绝对度量定位、2D 关键点检测以及视频追踪全维度,消融细致扎实]
  • 写作质量: ⭐⭐⭐⭐⭐ [叙述逻辑层层递进,对先前方法在相机假设与 3D 匹配成本上的盲点直击要害,图表整饬]
  • 价值: ⭐⭐⭐⭐⭐ [代码与模型完全开源,打破了三维人体恢复脱离度量坐标系与脱离视频无法跟踪的长期壁垒,极具工程与落地实用价值]