跳转至

DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes

会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 人体网格恢复, 多目标跟踪, 端到端Transformer, 交互式提示追踪, 跨帧Query机制

一句话总结

DETRAM 提出了一种单阶段统一 Transformer 架构,通过在单一解码器中并行协同检测 Query、跨帧时序跟踪 Query 与用户提示 Query,实现了无需外部检测器与独立跟踪模块的视频多人 3D 人体网格联合检测、跟踪与恢复。

研究背景与动机

在公共场所、体育赛事和密集城市场景的视频中,多人 3D 人体网格恢复(Human Mesh Recovery, HMR)与时序身份跟踪是混合现实、体育分析与行为理解等下游任务的核心使能技术。然而,真实视频中普遍存在频繁的相互遮挡、镜头移动、视角边缘截断以及人物随机进出画面等复杂动态,导致传统算法在长视频中极易发生身份漂移或 3D 姿态重建畸变。

长期以来,多人 HMR 与跟踪主要依赖多阶段串联管线(Top-Down Pipelines):系统先通过预训练目标检测器生成边界框,裁剪人体局部 patch 后送入姿态网格回归网络,最后依赖启发式特征关联或单独训练的跟踪模块完成时序轨迹串联。这种割裂的设计不仅带来了严重的多阶段误差累积与高额推理延迟,且裁剪操作会生硬破坏人际相对几何与全局场景上下文;近年基于 DETR 的单阶段全图 HMR 架构虽改善了单帧全局建模,却依旧把视频视为孤立帧序列,缺乏跨帧身份持久化机制,更无法支持用户按需定向交互跟踪指定目标。

本文的切入角度是打破检测、跟踪与 3D 网格恢复之间的架构壁垒,将三者抽象为单层 Transformer 解码器内的统一 Query 集合推断。核心 idea:在统一 Transformer 解码器内协同构建负责发现新人的检测 Query、跨帧继承身份与几何的跟踪 Query,以及响应用户框选的提示 Query,通过时序调制交叉注意力(TMCA)与轻量记忆库实现端到端联合检测、追踪与 3D 人体网格重建。

方法详解

整体框架

DETRAM 采用端到端的前向单阶段视频解码流程。对于输入的连续视频帧序列,骨干网络采用基于 DINOv2 的 ViT 将单帧图像编码为密集的二维图像特征 token。随后,统一 DETRAM 解码器同时接收三类具有显式锚框参数的 Query:负责在新帧中探测新增个体的检测 Query(Detection Queries)、承载历史帧位姿与身份的时序跟踪 Query(Tracking Queries),以及由用户在交互界面指定的提示 Query(Prompt Queries)。

在解码器内部,各 Query 先通过轨迹调制交叉注意力(TMCA)吸收当前帧的检测线索并完成内容刷新,再与图像特征进行自适应尺度与空间位置调制的交叉注意力计算。最终,统一预测头输出各目标的 2D 边界框、置信度以及 SMPL 3D 身体参数(关节旋转角度 \(\theta\)、体型系数 \(\beta\) 和相机系 3D 平移 \(\tau\))。针对跨长周期的遮挡挑战,系统维护轻量键值记忆库(Memory Bank)以供时序身份正则化更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入视频帧序列<br/>DINOv2 ViT 视觉 Token 化"] --> B["三类 Query 联合锚框初始化<br/>检测 / 历史跟踪 / 用户提示"]
    B --> C["轨迹调制交叉注意力 TMCA<br/>跟踪 Query 聚合关联检测线索"]
    C --> D["DETRAM 统一解码器<br/>多头自注意力 + 条件交叉注意力"]
    D --> E["多分支预测头<br/>2D Box / 3D SMPL / 置信度"]
    E --> F["轻量生命周期管理与键值记忆库<br/>新目标晋升 / 冻结 / 长期身份检索"]

关键设计

1. 三类 Query 协同表示与轨迹调制交叉注意力 (TMCA):解耦探测与跨帧身份维持 传统级联跟踪器必须在帧间重新匹配检测框,极易因形变发生 ID 切换。DETRAM 统一使用 4 维归一化几何锚框 \(A_q = (x_q, y_q, w_q, h_q)\)、内容嵌入 \(C_q\) 及正弦位置嵌入 \(P_q\) 统一表征三类 Query。检测 Query 采用网络可学习的先验锚框,负责捕获当前帧中新进入场景的个体;跟踪 Query 继承自前一帧成功跟踪的人体状态;提示 Query 则由用户给出的交互边界框直接初始化。

为让跟踪 Query 快速适应人体在当前帧中发生的位移与大幅姿态变化,模型在解码前引入轨迹调制交叉注意力(TMCA)。跟踪锚框 \(A_q^{\text{trk}}\) 与当前帧检测锚框 \(A_k^{\text{det}}\) 映射至共享嵌入空间,计算 Top-\(k\) 空间相似度权重,使跟踪 Query 动态聚合当前帧最相符的局部检测特征: $\(w_{qk} = \mathrm{Softmax}_k\left(\phi(A_q^{\text{trk}})^\top \psi(A_k^{\text{det}})\right), \quad C_q^{\text{trk}} = \sum_{k \in \mathcal{N}_k(q)} w_{qk} C_k^{\text{det}}\)$ 该机制使跟踪与提示 Query 在进入主解码器前即融合了最新的几何与表观线索,既保持了身份连续性,又消除了对启发式后处理关联算法的依赖。

2. 语义与尺度调制的统一 Transformer 解码器:精细化对齐全图空间证据 全图直接回归 3D 网格容易受到复杂背景和邻近行人的交叉干扰。DETRAM 在解码器中通过拼接操作实现检测与跟踪 Query 的并行联合推断,各 Query 在自注意力层充分交换人与人之间的防碰撞几何拓扑。在交叉注意力阶段,模型引入基于内容调制的条件交叉注意力机制(Conditional Cross-Attention): $\(Q_q = \mathrm{Cat}\big(C_q,\, \mathrm{PE}(x_q, y_q) \cdot \mathrm{MLP}^{(\mathrm{csq})}(C_q)\big), \quad K_{x,y} = \mathrm{Cat}\big(F_{x,y},\, \mathrm{PE}(x,y)\big)\)$ 内容调制网络 \(\mathrm{MLP}^{(\mathrm{csq})}\) 根据人体高阶语义自适应缩放位置编码,驱动 Query 聚焦于人体躯干与关键肢体对应的图像局部特征;多任务预测头(置信度 \(H_c\)、姿态 \(H_p\)、体型 \(H_s\)、平移 \(H_t\)、检测框 \(H_b\))协同输出最终的 SMPL 网格参数与边界框,彻底省去裁剪局部图像带来的肢体残缺问题。

3. 动态生命周期管理与键值记忆库:无参数维持长程时序鲁棒性 在长序列流式处理中,行人的反复出入和长时间严重遮挡会导致跟踪丢失。DETRAM 设计了轻量级的状态机机制与跨帧键值记忆库(Memory Bank)。解码输出置信度高于阈值 \(\tau_{\text{det}}\) 且与已有轨迹 IoU 小于 \(\tau_{\text{iou}}\) 的检测结果会自动激活为新跟踪 Query 并存入记忆库;当目标被遮挡或置信度下降时标记为非激活状态并冻结更新;若连续丢失超过 \(L_{\text{tol}}\) 帧则从活动列表中清除。

对于活动跟踪轨迹,系统保存过去帧的特征键 \(m_k\) 与特征值 \(m_v\)。当前 Query 键 \(q_k\) 与存储键计算余弦距离亲和度,通过 Top-\(k\) 归一化注意力权重检索并加权历史特征: $\(S = \frac{2 m_k^\top q_k - \|m_k\|^2}{\sqrt{D}}, \quad \mathrm{mem}_{b,n} = \sum_m \alpha_{b,n,m} m_v(b,m)\)$ 整个检索更新机制完全无额外学习参数,单条活跃轨迹仅占用 12–24 KB(FP32)显存,计算开销与视频总时长无关(仅与活跃人数 \(O(N_t M D)\) 呈线性关系),极大巩固了严重遮挡与形变下的身份重识别能力。

损失函数 / 训练策略

DETRAM 的训练由三部分目标联合监督: $\(\mathcal{L} = \lambda_{\text{matching}} \mathcal{L}_{\text{matching}} + \lambda_{\text{dn}} \mathcal{L}_{\text{dn}} + \lambda_{\text{trk}} \mathcal{L}_{\text{trk}}\)$ 针对检测 Query,采用二分图匈牙利匹配(Hungarian Matching)在 2D 框、投影 2D 关节与置信度上分配预测与真值;为加速训练收敛与抗噪能力,借鉴 DN-DETR 引入去噪损失 \(\mathcal{L}_{\text{dn}}\);针对跟踪 Query,通过在真值边界框中心与尺寸上施加高斯扰动并在训练步中随机采样部分轨迹,以自监督/监督形式端到端训练跟踪一致性损失 \(\mathcal{L}_{\text{trk}}\)

整个训练流程分为两阶段:第一阶段在 AGORA、BEDLAM、COCO、PoseTrack 与 3DPW 等混合数据集上进行单帧基础图像训练;第二阶段在包含连贯轨迹标注的 BEDLAM、PoseTrack 和 3DPW 上进行多帧视频片段(\(T=4\)\(8\))微调。

实验关键数据

主实验

在公开基准 PoseTrack21、MuPoTS-3D、BEDLAM 和 3DPW 上,DETRAM 全面展现了单阶段端到端架构的精度与速度优势。下表汇总了 PoseTrack21 跟踪评测与 BEDLAM 多人 3D 网格恢复/跟踪评测的核心表现:

数据集 方法类别 / 核心基线 MOTA (↑) IDF1 (↑) IDs (↓) MPJPE (mm, ↓) PA-MPJPE (mm, ↓) 推理 FPS / 延迟
PoseTrack21 4DHumans (ICCV 2023) 56.7 70.9 0.51 FPS
PoseTrack21 CoMotion (ICLR 2025) 71.4 79.5 5.68 FPS
PoseTrack21 DETRAM (Ours) 73.6 80.6 10.87 FPS
PoseTrack21 DETRAM + Prompts (Ours) 75.7 81.8 10.87 FPS
BEDLAM SMPLer-X + ByteTrack 78.83 81.09 1660 119.19 52.62 0.463 s/f
BEDLAM MaQ (CVPR 2025) 95.15 97.01 128 79.88 45.56 0.027 s/f
BEDLAM CoMotion (ICLR 2025) 95.22 97.39 885 55.40 24.50 0.239 s/f
BEDLAM DETRAM (Ours) 99.18 99.37 37 48.68 31.24 0.069 s/f

在 3DPW 数据集上,DETRAM 在 Dyna3DPW 跟踪评测中取得 99.8 MOTA、99.9 IDF1、79.1 HOTA 以及 0 ID 切换,同时 3D 恢复指标取得 60.0 mm MPJPE 与 70.1 mm PVE,全面超越前序 SOTA。

消融实验

消融实验深入验证了跟踪 Query、长程记忆库、TMCA 机制及内容条件空间调制的作用:

实验配置 / 变体 PoseTrack21 MOTA (↑) PoseTrack21 IDF1 (↑) BEDLAM MOTA (↑) BEDLAM IDs (↓) BEDLAM MPJPE (mm, ↓) 说明
DETRAM (Full Model) 73.6 80.6 99.18 37 48.68 完整模型:Track-Q + 记忆库 + TMCA
w/o Track-Q (纯检测重连) 68.3 77.1 96.70 58 46.91 缺少跨帧跟踪 Query,MOTA 显著下降 5.3
w/ Track-Q, w/o Mem Bank 73.3 80.3 99.10 32 47.33 仅用 Track-Q,跟踪精度略降但计算更轻
TMCA \(\to\) Direct Propagation 71.7 79.6 99.16 47 49.37 移除当前帧检测线索自适应刷新,跟踪性能受损
\(\mathrm{MLP}^{(\mathrm{csq})} \to\) Identity 70.2 77.1 98.38 305 52.73 去除内容空间调制,ID 切换暴增至 305 次

关键发现

  • 跟踪 Query 与记忆库的互补分工:仅使用跨帧跟踪 Query 即可提供绝大部分时序一致性(PoseTrack21 MOTA 达 73.3);轻量记忆库进一步提升了长期被遮挡个体的召回覆盖率(MOTA 提升至 73.6)。虽然召回更多遮挡极限样本略微拉高了重建均方误差(MPJPE 从 47.33 mm 增至 48.68 mm),但系统整体轨迹连续性与鲁棒性显著增强。
  • 拥挤场景下的高容忍度:在 PoseTrack21 密集人群分段评测(21 人以上极度密集子集)中,传统级联检测算法频繁漏检和误匹配,而 DETRAM 凭借全图端到端注意力交互,MOTA 相比 CoMotion 取得了超过 10% 的绝对优势(66.83 vs. 60.53)。
  • 用户提示与人机协同增益:通过引入用户边界框 Prompt,模型能够准确激活误检漏检实例并向前时序传播,使 PoseTrack21 上的 MOTA 从 73.6 进一步攀升至 75.7,验证了 Prompt Query 与自动化 Query 的良好共融性。

亮点与洞察

  • 一体化端到端单阶段架构:摒弃传统“检测器-裁剪-网格回归-ReID跟踪器”的多阶段冗长依赖,在单个 Transformer 解码器前向中完成 2D 检测、时序跟踪与 3D 人体网格重建,推理速度达 10.87 FPS,比 4DHumans 提速 21 倍以上。
  • 统一几何锚框的多角色 Query 机制:将检测(发现新人)、跟踪(历史延续)与提示(用户交互)抽象为统一规范化锚框与内容向量,使模型在单套权重中兼具全自动时序跟踪与可控交互式视频分析能力。
  • 可迁移的轻量级时序正则化设计:基于无参数键值记忆库(Memory Bank)的时序注意力检索机制每活跃人仅占 12–24 KB 内存,这种常数级显存占用策略对其他基于 Query 的单阶段 3D 感知和视频目标跟踪模型极具通用借鉴价值。

局限与展望

  • 时间平滑性显式约束的缺失:当前模型基于单帧解码前向推断,尽管身份匹配高度一致,但在快速相机晃动和极速动作下,帧间 3D 关节加速度与旋转角度仍存在微小抖动,未来可结合物理动理学先验或时序平滑损失进一步约束。
  • 多模态提示输入的扩展空间:当前系统仅支持 2D 矩形框作为用户 Prompt,在密集交叠场景下框选精度有限,后续可探索基于点击(Click/Point)、自然语言文本指令或特定关键点轨迹的细粒度提示控制。
  • 对非连续真值视频训练的依赖:视频微调阶段严格剔除了不连贯标注片段,限制了对开放互联网无标注视频的弱监督扩展能力。

相关工作与启发

  • vs CoMotion (ICLR 2025): CoMotion 采用两阶段姿态更新机制,需依赖预训练检测器与离线多阶段推理;DETRAM 在单阶段解码器内联合处理检测与跟踪,推理延迟减半且支持用户交互式提示追踪。
  • vs MaQ (CVPR 2025): MaQ 依赖跨时序长片段 Motion Query 做离线批处理预测;DETRAM 采用按帧流式前向解码结合轻量记忆库,原生支持在线实时流媒体处理。
  • vs SAM 3 (2025): SAM 3 专注于视频中多类别 2D 分割掩码的时序传播;DETRAM 则首次将交互式提示与 3D 参数化人体网格(SMPL)几何恢复与时序跟踪有机融合。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首个将交互式提示追踪与单阶段多人 3D 人体网格恢复端到端统一的 Transformer 架构,Query 设计优雅。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 PoseTrack21、MuPoTS-3D、BEDLAM、3DPW 四大权威基准,包含详细消融、分群密度分析与速度测试。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照清晰,动机阐述切中传统多阶段管线的结构痛点。
  • 价值: ⭐⭐⭐⭐⭐ 为实时视频人体动态捕捉、人机交互式元宇宙动作分析提供了极具实用价值的单阶段基线。