Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 3D 人体网格恢复, 多人跟踪, 多镜头视频, 行人重识别, 场景几何先验
一句话总结¶
针对真实多镜头视频中视角突变导致的身份丢失与人体网格漂移难题,Multi-THuMBS 利用几何基础模型在镜头切换边界构建共享 3D 场景锚点,结合三维距离、表观与姿态重识别及全局时空平滑,实现了跨镜头多人动作与身份的一致性重建。
研究背景与动机¶
从单目自然视频中重建并跟踪多人的全局 3D 人体网格(3D Human Mesh Recovery, HMR)是计算机视觉领域的核心任务,对影视动画生成、体育动作分析、具身智能交互及 AR/VR 等场景至关重要。近年来基于学习的全局姿态估计方法取得了长足进展,在单视角连续序列上能较好地应对人体遮挡、截断与深度歧义。然而,现有多人跟踪框架无一例外建立在「相机轨迹随时间连续平滑」的理想假设之上。
但真实世界的视频素材(例如电影、情景喜剧、转播比赛与自媒体剪辑)几乎全由多个机位离散剪辑而成。一旦遭遇镜头切换(shot change),相机会发生瞬时的大范围平移与旋转跃变,导致图像空间中人体表观与尺度剧烈改变、视野内人物数量出现增减,并且相机的世界坐标系基准发生断裂。若将现有多人模型盲目施加在多镜头视频上,模型因缺乏镜头感知而将视角跳跃误判为瞬间位移,强行施加时序平滑损失反而诱发严重的身体形变与滑步(foot sliding)伪影;同时,单纯依赖局部外观特征的传统 Re-ID 方法在剧烈视角跳跃下频繁错配甚至完全丢失跟踪链。
现有的跨镜头或跨视角重建方法陷入了两难困境:多视角重建技术(如 HSfM 等)仅能处理单时刻同步捕获的静态空间融合,缺乏时间运动连续性建模;少数探索跨镜头 3D 恢复的开创性工作(如 HumanMM、Multishot)则局限于单人假设,完全无法应对多人共存、交互与进出画面的复杂身份关联。核心 idea:将镜头边界帧之间的极短时差近似为静态多视角观测,利用 3D 场景大模型(VGGT)在边界构建共享三维几何空间作为空间锚点,通过渐进式网格-场景对齐、融合 3D 几何距离的混合 Re-ID 与跨相机重投影约束,将离散镜头下的多人运动与身份无缝缝合进统一世界坐标系。
方法详解¶
整体框架¶
Multi-THuMBS 的输入为一段包含多个镜头的单目视频,算法首先检测镜头切分点并将序列分割为子镜头片段,最终输出全局世界坐标系下具有时间连续性与身份一致性的多人 3D SMPL 网格轨迹。以两段镜头 \(S_1\) 与 \(S_2\)(分界处为 \(f_{t_b-1}\) 与 \(f_{t_b}\))为例,系统整体流程划分为五个核心步骤: 1. 初始信息提取:分镜头运行 4DHumans 得到局部人体网格与单镜头内连续 tracklet,利用 Grounded SAM 提取人物掩码,同时提取 ViTPose 2D 关键点。 2. 边界帧共享 3D 空间构建与网格渐进对齐:仅在切镜边界相邻帧调用 VGGT 构建包含稠密场景点云与相机外参的共享 3D 空间,并通过三阶段优化将两镜头的 SMPL 网格注册到统一几何场景中。 3. 相机轨迹与人体网格全局传播:利用 DROID-SLAM 估算各镜头内相机的局部平滑运动,借助边界相对变换矩阵将其统一映射至共享全局世界坐标系,同步传播 SMPL 姿态参数。 4. 几何驱动的多人跨镜头 Re-ID:以空间绝对距离为主导,结合 UV 贴图色彩差异与骨骼旋转相似度构建匹配代价,利用匈牙利算法完成两镜头间的人物身份关联,并依据距离阈值剔除进出画面的误匹配。 5. 全局联合时空平滑与后处理:构建融合多帧时序加速度平滑、人体物理先验正则以及边界跨相机重投影约束的联合优化,消除姿态抖动与几何缝隙。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入多镜头单目视频"] --> B["切镜检测与镜头内人体网格提取<br/>PySceneDetect + 4DHumans"]
B --> C["边界共享空间构建与渐进对齐<br/>VGGT 场景点云 + 三阶段优化"]
C --> D["相机位姿与人体参数时序传播<br/>DROID-SLAM + SE3 相对变换映射"]
D --> E["几何主导的混合特征重识别<br/>3D 距离 + UV 纹理 + 姿态相似度"]
E --> F["跨相机重投影与全局轨迹平滑<br/>时空联合平滑与物理约束"]
F --> G["输出:全局一致的多人 3D 人体网格轨迹"]
关键设计¶
1. 边界共享空间构建与尺度归一化:将镜头跳跃转化为静态多视角几何对齐 在连续帧上运行结构光或几何大模型计算成本极高且极易被动态人物运动干扰,但前后镜头交界处的两帧(\(f_{t_b-1}\) 与 \(f_{t_b}\))时间间隔极短(通常仅数十毫秒),人体位移微小。系统抓住这一物理特性,将这两帧视作同一物理场景下的两视角离散捕获,送入视觉几何基础模型 VGGT 构建共享的三维点云 \(P_{t_b-1}, P_{t_b}\) 与初始相机外参 \([R_t \mid C_t]\)。为解决神经点云与参数化人体网格(SMPL)之间的尺度模糊问题,算法计算网格质心至顶点的最大欧氏距离与对应人体分割掩码内场景点云的最大离散距离,求取二者比值并在所有人之间取均值,得到统一缩放因子对场景点云进行全局重缩放。
2. 三阶段网格-场景分步优化:消除非凸多参数耦合陷阱 将单镜头坐标系下的人体网格直接对齐到 VGGT 共享空间时,人体根节点平移 \(\Gamma_t^i\)、全局旋转 \(\Phi_t^i\) 以及相机位姿 \([R_t \mid C_t]\) 之间高度耦合,联合优化极易陷入病态局部极小。为此,算法设计了分步递进策略: - 阶段一(平移初值锚定):利用 VGGT 像素到三维点的精确单射映射,提取 ViTPose 预测的人体骨盆 2D 根关节点,直接索引对应三维像素点云坐标作为根平移 \(\Gamma_t^i\) 的初始值; - 阶段二(刚体姿态粗对齐):冻结相机外参,仅对每个人的根平移与全局旋转进行 500 次迭代,以 2D 关键点重投影损失 \(\mathcal{L}_{\text{2D}}\) 为驱动,拉齐人体投影与图像关键点; - 阶段三(场景几何与深度解歧):联合微调相机位姿与所有人的人体位姿 1500 次,引入深度一致性损失 \(\mathcal{L}_{\text{depth}}\) 与人体轮廓对齐损失 \(\mathcal{L}_{\text{sil}}\)。\(\mathcal{L}_{\text{depth}}\) 惩罚投影位于人体掩码内的人体网格顶点 \(v_k\) 到最近场景点云 \(p_k\) 的三维空间距离:
\(\mathcal{L}_{\text{sil}}\) 则利用预先计算的掩码距离变换矩阵惩罚越界顶点,彻底消除了深度不确定性引起的空间悬浮或穿模。
3. 基于相对 SE(3) 变换的双向时序传播:兼顾局部高帧率追踪与全局基准统一 为避免全视频运行计算繁重且难以泛化到动态序列的几何大模型,系统选用轻量级视觉 SLAM(DROID-SLAM)独立恢复每个镜头内平滑的相对相机运动 \([R^*_t \mid C^*_t]\)。随后,系统以边界优化后的高精相机 \([ \hat{R}_t \mid \hat{C}_t ]\) 与 DROID-SLAM 边界位姿的偏差,求解局部坐标系到全局坐标系的刚体变换:
将相对变换 \(\mathcal{R}_{t_b-1}\) 与 \(\mathcal{R}_{t_b}\) 分别作用于镜头 \(S_1\) 与 \(S_2\) 的各帧相机位姿与对应 SMPL 根位姿,实现了局部高精度跟踪向全局一致空间的低成本泛化与无缝拼接。
4. 融合 3D 几何距离的混合特征重识别:突破极端视角切换下的表观失效 镜头跳跃常伴随 90 度乃至 180 度的剧烈视角反转,导致单纯基于 2D 外观的 Re-ID 发生致命错误。但在共享世界坐标系中,人体在分界时刻的三维绝对位置具有强连续性。算法计算前后镜头各人物根平移间的 3D 欧氏距离:
在此基础上,结合展开为规范空间 UV 纹理图的表观不相似度 \(\mathbb{A}_{ij}\) 与重合关节旋转轴角差异的姿态不相似度 \(\mathbb{P}_{ij}\),构建综合匹配代价矩阵:
通过匈牙利匹配算法完成全局最优指派。更为关键的是,设定空间距离门限 \(\tau = 1.0\text{ m}\),一旦匹配对的空间欧氏距离超出阈值即判定为新进入或离开画面的个体,从机制上解决了视角切换伴随人员增减时的误配问题。
损失函数 / 训练策略¶
后处理阶段采用免训练的测试时联合优化策略(AdamW 优化器,学习率精细调度),在保持网络预测的人体局部体态前提下,微调全局 SMPL 参数以实现全局平滑: - 时序平滑与体态先验损失:惩罚相邻帧三维关节加速度,并约束 SMPL 形状参数 \(\beta\) 与 VPoser 姿态隐编码 \(\zeta\):
- 跨相机几何投影一致性损失:对边界匹配的人体对 \(i \in \mathcal{M}\),将镜头 1 的人体用镜头 2 的相机进行投影,并将镜头 2 的人体用镜头 1 的相机进行投影,迫使两视角重投影误差双向对齐:
在总目标 \(\min \lambda_{\text{smooth}}\mathcal{L}_{\text{smooth}} + \lambda_{\text{cross}}\mathcal{L}_{\text{cross}}\) 下,150 帧 1080P 视频在单张 RTX 3090 上耗时约 10 分钟即可完成全流程优化。
实验关键数据¶
主实验¶
论文在三个包含多人复杂交互与多视角的权威数据集(EgoHumans、EgoBody、Harmony4D)上构建了多镜头基准,涵盖人体位姿精度、时序平滑度、相机定位误差以及跨镜头身份切换次数(IDs)。
| 数据集 | 方法 | W-MPJPE↓ (mm) | WA-MPJPE↓ (mm) | MPJPE↓ (mm) | MPVPE↓ (mm) | Accel↓ (\(\text{m/s}^2\)) | ATE↓ (m) | IDs↓ (次) |
|---|---|---|---|---|---|---|---|---|
| EgoHumans | PromptHMR [41] | 1778.2 | 440.9 | 285.3 | 364.1 | 74.3 | 2.3 | 10.40 |
| Multishot [26] | 474.1 | 287.4 | 347.1 | 408.2 | 63.15 | - | - | |
| GVHMR [33] | 404.8 | 204.7 | 287.4 | 371.4 | 59.0 | - | - | |
| HSfM† [23] | 544.2 | 187.7 | 263.1 | 294.3 | 48.7 | 2.8 | 3.87 | |
| Ours | 279.0 | 166.0 | 228.3 | 262.2 | 27.3 | 0.7 | 0.97 | |
| EgoBody | PromptHMR [41] | 1228.1 | 395.3 | 99.0 | 133.9 | 17.4 | 1.6 | 1.29 |
| Multishot [26] | 185.1 | 144.1 | 147.1 | 166.5 | 17.9 | - | - | |
| GVHMR [33] | 174.0 | 133.3 | 108.0 | 147.1 | 14.7 | - | - | |
| HSfM† [23] | 113.1 | 96.3 | 113.3 | 123.2 | 10.9 | 2.9 | 0.20 | |
| Ours | 99.2 | 72.8 | 72.0 | 94.9 | 6.0 | 0.1 | 0.00 | |
| Harmony4D | PromptHMR [41] | 1746.3 | 399.8 | 675.7 | 746.0 | 66.8 | 2.3 | 8.00 |
| Multishot [26] | 248.0 | 231.6 | 511.2 | 609.5 | 37.1 | - | - | |
| GVHMR [33] | 244.9 | 166.7 | 244.7 | 334.1 | 29.6 | - | - | |
| HSfM† [23] | 372.0 | 178.4 | 225.6 | 257.6 | 28.3 | 3.2 | 1.58 | |
| Ours | 221.0 | 116.9 | 215.9 | 278.3 | 17.4 | 0.7 | 0.46 |
在无真值的人工剪辑真实视频(AVA、经典情景喜剧《老友记》Friends 与《生活大爆炸》The Big Bang Theory)上,评估跨镜头动作质量与视觉连续性:
| 数据集类型 | 方法 | \(\text{PCK}^*\)↑ (%) | Jitter↓ | Foot Sliding (FS)↓ |
|---|---|---|---|---|
| 真实剪辑视频 (AVA / Friends / TBBT) | PromptHMR [41] | 62.7 | 162.44 | 23.11 |
| Ours | 90.7 | 31.50 | 10.70 |
消融实验¶
在 EgoHumans 数据集上对核心模块进行的消融对比验证:
| 配置 | 说明 | W-MPJPE↓ (mm) | MPJPE↓ (mm) | MPVPE↓ (mm) | Accel↓ (\(\text{m/s}^2\)) | ATE↓ (m) |
|---|---|---|---|---|---|---|
| (1) w/o cam | 移除相机位姿联合优化 | 389.7 | 230.1 | 264.7 | 33.7 | 1.40 |
| (2) w/o post | 移除全局后处理平滑与跨视角约束 | 311.2 | 241.6 | 298.3 | 47.9 | 0.77 |
| (3) w/o stage | 禁用三阶段递进式优化,直接全参数联合微调 | 491.9 | 368.1 | 359.4 | 33.9 | 2.75 |
| (4) w/o align | 完全跳过边界网格-点云对齐环节 | 882.7 | 422.4 | 392.1 | 34.9 | 1.40 |
| Full Model (Ours) | 完整模型 | 278.8 | 228.3 | 262.1 | 27.3 | 0.77 |
关键发现¶
- 边界场景对齐是消除跨镜头全局漂移的决定性核心:移除
align模块后,轨迹级对齐误差 W-MPJPE 从 278.8 mm 暴增至 882.7 mm(恶化超 216%),证明缺乏共享 3D 空间的几何锚定时,各镜头完全处于孤立坐标系中,时序全局轨迹彻底崩溃。 - 阶段化优化策略有效避免非凸优化发散:若不采用阶段优化(
w/o stage),全参数强行耦合优化会导致 ATE 相机定位误差从 0.77 m 剧增至 2.75 m,MPJPE 增加超 140 mm,说明深度和旋转的强非凸耦合必须通过「平移初始化 → 刚体粗调 → 几何细调」逐步解耦收敛。 - 空间几何特征主导了复杂视角下的 Re-ID 鲁棒性:在 Re-ID 对比中,仅依赖 3D 距离的基准(Ours dist.)在 EgoHumans 上的 IDs(1.66)便已远超 SOTA 纯表观重识别模型 KPR(2.54)和 Pose2ID(4.62);再融合表观与姿态后,IDs 进一步降低至 0.97,在 EgoBody 上甚至实现了 0 身份切换,证明了几何空间绝对锚点在抵抗视角跳跃时的不可替代性。
亮点与洞察¶
- 将镜头跳跃视作零时差多视角的优雅降维:论文没有在长视频上重度运行庞大的 3D 场景重建模型,而是敏锐抓住切镜瞬间“画面跳跃但现实世界时间静止”的直觉,仅在交界处以两帧构建局部静态多视角先验,极具计算效率与工程美感。
- 几何锚点赋能跨模态 Re-ID:颠覆了传统行人重识别死磕 2D 特征不变性的思路,将 Re-ID 降维为三维世界坐标系下的近邻搜索,并在代价函数中融合 UV 解包纹理与姿态旋转,兼顾了近距离区分度与远距离连续性。
- 两级时序解耦与传播架构:通过 DROID-SLAM 维持镜头内局部轨迹的超高平滑性,通过 SE(3) 相对变换一键同步映射到 VGGT 全局坐标系,既规避了 SLAM 在切镜时的崩溃,又规避了静态场景模型无法处理动态运动的缺陷。
局限与展望¶
- 同场景依赖性(Intra-scene Assumption):算法强依赖于切镜前后发生在同一个具有重叠背景的物理空间中。若发生跨场景的大跨度转场(如从室内瞬间切换到室外广场),3D 共享空间无法建立,几何距离关联将彻底失效。
- 极端动态背景干扰:虽然仅采用边界两帧降低了动态物体的干扰,但若背景存在大面积快速运动物体或强反光剧烈变化,VGGT 点云重建可能出现几何形变,进而影响网格对齐。
- 两阶段串行流水线的累积误差:系统依赖 PySceneDetect、4DHumans、Grounded SAM、ViTPose、VGGT 和 DROID-SLAM 等多个离散上游模型,流水线较长,前序检测丢失或切镜漏检可能影响下游全局优化。
相关工作与启发¶
- vs. PromptHMR [41] / GVHMR [33]: 现有 SOTA 单镜头多人 HMR 假定相机连续移动,遇到镜头跳跃时将产生灾难性的跳帧与脚滑动伪影;Multi-THuMBS 显式建模镜头边界,利用场景几何锚点缝合轨迹,使真实剪辑视频上的滑步(FS)指标从 23.11 降至 10.70。
- vs. HumanMM [47] / Multishot [26]: 现有多镜头 3D 恢复方法局限于单人假设,无法处理多人复杂遮挡与身份分配;Multi-THuMBS 首次提出了针对多镜头场景的多人几何 Re-ID 与跨相机重投影约束,填补了多人多镜头重建的学术空白。
- vs. ShowMak3r [13]: ShowMak3r 虽然联合优化人体与神经辐射场,但重心在于新视角合成与画质渲染,计算成本高昂且无法保证精确的物理运动轨迹;Multi-THuMBS 侧重于精确的多人三维几何位姿与时序动力学生成。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次打通多人场景下的多镜头 3D 人体网格连续重建与几何 Re-ID,思路极具启发性。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖三大权威多视角数据集与三类真实剪辑影视剧,对比指标兼具三维位姿、相机轨迹、身份切换与运动平滑度。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然连贯,三阶段优化与全局时空传播公式推导严谨清晰。
- 价值: ⭐⭐⭐⭐⭐ 为影视自动化剪辑、全景动作捕捉及跨镜头视频三维理解提供了里程碑式的实用解决方案。