跳转至

Single-Query Person-Centric Bimanual Hand-Object Interaction Detection

会议: ECCV 2026
论文: ECCV 原文
代码: https://lgecto-ail-vil.github.io/SingleQuery-BHOI/
领域: 人体理解
关键词: 双手交互检测, 人-物交互, 单查询框架, 部位感知可变形注意力, 姿态估计

一句话总结

针对传统以手为中心的 HOI 方法在多人复杂场景中割裂双手归属与目标语义的缺陷,本文提出一种以人体为中心的单查询 Transformer 检测架构,结合部位感知多参考点可变形注意力和手-查询关系矩阵,端到端统一预测人体框、人体姿态、双手及对应交互目标的类别与边界框。

研究背景与动机

手是人类与物理世界交互的主要媒介,精确解析“谁用哪只手在操作什么物体”对细粒度动作理解、具身智能观察学习和辅助视觉至关重要。近年来,诸如 100DOH 和 Hands23 等大规模手部接触数据集极大地推动了手-物交互理解的发展。然而,这些现有方法大多采用以手为中心(hand-centric)的建模范式,将图像中的每只手视为独立的实例进行检测、手侧分类(左/右手)与接触预测。

在多人密集交互的实际场景中,以手为中心的范式暴露出致命缺陷:模型缺乏将左右手显式约束归属于同一个具体人体的机制,导致严重的归属歧义(ownership ambiguity)。模型即使检测到了两只手及其接触物体,也无法判断它们是否来自同一个人,造成交互主体身份的割裂。此外,直接回归交互物体边界框往往无法恢复物体的语义类别,在密集遮挡时关联极不稳定。

针对上述挑战,本文主张将人体实例作为首要预测单元,将左右手作为人体槽位进行显式绑定。核心 idea:提出一种单查询人体为中心的结构化预测架构,由单个查询联合预测人体框、全身姿态、左右手槽位及其交互目标,并借助部位感知多参考点注意力和包含离线 token 的手-查询关系矩阵,直接从检测到的实体集检索目标边界框与类别。

方法详解

整体框架

整体检测架构基于 DETR 风格的集合预测模型(以 RT-DETR 为基础检测器)。输入图像经过主干网络与 Transformer 编码器提取多尺度特征,并通过 top-K 候选查询初始化;进入可变形解码器后,单个查询同时承担整个人体实例、全身骨骼关键点以及左右两只手及其交互目标的特征解码。

为了让单个查询既能把握全局人体上下文,又能精确感知小尺度、高铰接的手部与关节点,解码层引入了部位感知多参考点可变形注意力机制;在交互推理阶段,模型预测手部嵌入与所有检测查询构成的关系矩阵,配合可学习的离线(off)token,直接判定无接触、自身接触或特定目标接触,无需独立的交互物体回归头。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 x"] --> B["CNN/ViT 主干 + Transformer 编码器"]
    B --> C["Top-K 候选查询初始化<br/>(实体查询集 + 可学习 off token)"]
    C --> D["部位感知可变形解码器<br/>(人体/左右手/关节多参考点采样)"]
    D --> E["多头并行预测<br/>人体框 / 关节点 / 双手框"]
    D --> F["手-查询交互关系矩阵<br/>(左右手嵌入与所有实体点积)"]
    E --> G["输出结构化预测元组<br/>(人-左右手-交互物体类别与边界框)"]
    F --> G

关键设计

1. 显式左右手槽位与单查询人体表征:消除双手归属歧义

以往方法将左右手打散为孤立目标,而本方法直接在人体查询上挂载左右手插槽,使输出天然满足“一个人、两只手”的物理拓扑约束。对于每个查询 \(i \in \{1, \dots, N\}\),网络预测类别分布 \(\hat{c}_i\) 和人体框 \(\hat{b}_i\)。当查询被判定为人时,附加的预测头同时输出全身 \(J\) 个骨骼关键点 \(\hat{K}_i \in [0, 1]^{J \times 2}\)、左/右手边界框 \(\hat{b}^L_i, \hat{b}^R_i \in [0, 1]^4\) 以及对应的手部特征嵌入 \(h^L_i, h^R_i \in \mathbb{R}^d\)。即使在多人重叠交错画面中,左右手与身体的归属也由单个查询显式锚定,杜绝了跨人错配。

2. 部位感知多参考点可变形注意力:跨越全局姿态与局部小手尺度的注意力分配

单个查询在可变形注意力解码中通常只依赖一个框中心参考点,极易因人体包围盒过大而忽略细微的手部与关节细节。本文提出将注意力头分配至多重部位参考区域:人体参考点 \(p^H_i = \phi(\hat{b}_i)\)、左手参考点 \(p^L_i = \phi(\hat{b}^L_i)\) 与右手参考点 \(p^R_i = \phi(\hat{b}^R_i)\)(其中 \(\phi\) 取中心坐标)。针对 \(J\) 个关节,进一步结合当前预测位置与由人体尺寸缩放的可学习尺度生成局部参考区域:

\[p^j_i = (\hat{k}^j_i, s^j_i), \quad s^j_i = (\gamma^j_w \hat{w}_i, \; \gamma^j_h \hat{h}_i)\]

解码器多头注意力被明确分配采样人体框、手部以及关节点局部,逐层迭代更新位置偏差与特征,实现单一查询对全局轮廓与末端肢体的高保真协同聚焦。

3. 基于关系矩阵与 off token 的统一目标解析:免回归的物体语义检索

直接从人体查询回归手部交互物体的边界框有两个弊端:一是无法识别该物体的语义类别,二是在杂乱物体聚集区容易生成虚假重叠框。本文将检测到的全部 \(N\) 个查询(涵盖人与其他物体)投影为关系嵌入 \(r_i \in \mathbb{R}^d\),并引入专门代表“无接触”的可学习离线嵌入 \(r_0 \in \mathbb{R}^d\)。对于手部侧向 \(s \in \{L, R\}\),将其嵌入 \(h^s_i\) 与候选目标集合 \(\{r_0, r_1, \dots, r_N\}\) 做点积和 Softmax:

\[\hat{t}^s_i = \arg\max_{j \in \{0, \dots, N\}} \text{Softmax}(h^s_i \cdot r_j)\]

\(\hat{t}^s_i = 0\) 判定为无接触(no-contact);若 \(\hat{t}^s_i = i\) 则自洽识别为自身肢体接触(self-contact);若 \(\hat{t}^s_i = j \; (j \neq i)\),则为与其他物体或他人接触,并直接复用第 \(j\) 个查询已有的目标框 \(\hat{b}_j\) 与分类 \(\arg\max \hat{c}_j\)。这一机制自然复用了目标检测分支的高质量框与语义,无需增加独立的物体回归分支。

损失函数 / 训练策略

模型采用端到端二分图匹配(Bipartite Matching)训练,损失函数联合了人体/物体分类交叉熵损失、边界框 GIoU 与 \(\ell_1\) 回归损失、人体姿态 OKS 关键点损失、双手边界框回归损失,以及手部交互目标选择的交叉熵损失。所有预测头均在前向传播中计算,但手部和姿态的损失仅对匹配至真实人体实例的查询生效。

实验关键数据

主实验

论文基于构建的 COCO 双手交互标注验证集(约 2K 张人工校验图像)以及 ContactHands 数据集进行系统评估。采用三种由松到严的评测标准: - Acc_soft:仅评估人体匹配情况下的手部接触状态二分类准确率; - Acc_mid:在接触状态正确的基础上,要求交互物体定位也正确(IoU \(\ge 0.5\)); - Acc_hard:进一步要求预测的手部边界框与真实手部边界框的 IoU \(\ge 0.5\)

方法变体 / 架构设定 COCO Det. mAP COCO Pose AP COCO Acc_soft (%) COCO Acc_mid (%) COCO Acc_hard (%) ContactHands Acc_soft (%)
DirectBox(直接回归框) 49.1 N/A 81.5 44.9 12.6 80.7
DirectBox + Pose 47.7 61.8 83.0 57.6 30.1 81.3
Relation(关系矩阵,本文) 48.8 N/A 80.0 60.8 28.9 81.7
Relation + Pose(完整本文方法) 47.1 62.3 83.8 64.6 31.3 82.2
Relation + Pose (+ 100DOH 数据) 48.6 63.2 84.0 66.2 32.7 81.2

注:数据摘自原论文 Table 2 与 Table 3,基础模型为 RT-DETR-R50-m。

消融实验:部位感知参考点分配(Part-Aware Allocation)

配置 Part-Aware Det. mAP Pose AP Acc_soft (%) Acc_mid (%) Acc_hard (%) ContactHands Acc_soft (%)
DirectBox + Pose 48.7 43.4 80.4 43.1 11.5 80.5
DirectBox + Pose 47.7 61.8 83.0 57.6 30.1 81.3
Relation + Pose 48.6 42.8 83.0 63.6 10.3 81.7
Relation + Pose 47.1 62.3 83.8 64.6 31.3 82.2

注:数据摘自原论文 Table 4。

关键发现

  • 关系矩阵比直接回归物体框具有压倒性优势:对比未加姿态时的 DirectBox 和 Relation,Acc_mid 从 44.9 飙升至 60.8(+15.9),Acc_hard 从 12.6 提升至 28.9(+16.3)。这证明复用检测到的实体集合避免了冗余且不稳定的物体框拟合。
  • 部位感知参考点机制是定位微小肢体的命脉:在 Table 4 中,若去除 Part-Aware 分配而仅让各 head 共享人体中心参考点,姿态 AP 骤降近 20 点(42.8 vs 62.3),且在严苛的 Acchard 指标上直接从 31.3 跌落至 10.3(-21.0)。
  • 联合姿态学习反哺手部结构感知:引入姿态监督使 Relation 模型的 Acc_mid 进一步提高 3.8%(60.8 → 64.6),Acc_hard 提高 2.4%(28.9 → 31.3),说明人体的动力学骨架为双手的空间分布提供了强先验支撑。
  • 人群密度拥挤度敏感性:在单人场景下模型的 Acc_soft / Acc_mid / Acc_hard 分别高达 90.28 / 79.42 / 54.00;而在人数 \(\ge 5\) 的高密集重叠场景下,Acc_hard 降低至 22.02,说明严重遮挡与交叠仍是双手细粒度解构的严峻瓶颈。

亮点与洞察

  • 将双手建模为主体插槽而非外挂实例:避免了后处理启发式将左右手聚类回人体的繁琐过程,从根本上消除了“同一人手部分配到他人”的归属错乱。
  • 利用目标检测池作为候选关系拓扑:把交互物体的类别识别和定位退化为已检实体上的注意力路由(Dot-Product Routing),并用单一 off token 优雅统一“接触/未接触/自接触”三种截然不同的状态。
  • 兼顾多粒度的多点变形注意力采样:不依赖庞大的分阶段级联网络或多类复杂 Query(如把人体 Query 和关键点 Query 拆开),在一个 Query 内部利用 Head 拆分实现多部位局部形变采样,保持推理高效。

局限与展望

  • 密集重叠人群下的遮挡瓶颈:实验显示当人数 \(\ge 5\) 时硬指标性能明显下滑,对于手部交叠(如两人握手、推搡)依然存在归属混淆。
  • 交互语义较为粗粒度:当前关系矩阵仅确定 contact 属于哪个实体(自接触、他人、某种物体),尚未进一步扩展到细粒度交互动词或 3D 抓握姿态类型(如 hold, push, pinch 等)。
  • 小物体与遮挡物体的伪标签依赖:对于未被 COCO 标注捕获的未知名交互物体,训练中需引入通用伪目标框,这在开放词表中可能引起泛化噪声。

相关工作与启发

  • vs 100DOH / Hands23: 传统手部交互工作均采用 hand-centric 单独预测手部边界框、接触状态及物体框,缺乏人体级别的双手归属约束;本文通过单查询人体槽位和整体元组评估,解决了多人交互时的归属混乱。
  • vs HOTR / HOI Transformer: 传统 HOI 检测通常基于人-物对(human-object pairs)预测动作谓词,粒度停留在整个人体层面,无法解析左手和右手分别在操作什么;本文深入到单人双手的精细化分工。
  • vs GroupPose / RelTR: 类似的多任务或关系检测通常需要设计多套专门的 Query(如人物 Query、按键点 Query、关系 Query)进行交叉级联;本文在单个 Query 内部利用注意力 Head 分解与多参考点机制完成端到端解析,架构更为精简。

评分

  • 新颖性: ⭐⭐⭐⭐ [以人体为中心的单查询双手机制与关系矩阵路由设计干净,极具启发性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建并人工校验了 COCO 双手交互测试集,消融对比细致,涵盖软/中/硬三层严苛指标]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑链严谨清晰,图表完备,消融实验直击痛点]
  • 价值: ⭐⭐⭐⭐ [为具身智能操作理解与视频细粒度人体行为分析提供了高内聚的统一基准]