Disentangling and Reusing Interaction Cues for Zero-Shot HOI Detection¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 零样本学习, 人-物交互检测, 视觉语言模型, 特征解耦, 背景捷径偏差
一句话总结¶
针对视觉语言模型在零样本 HOI 检测中细粒度交互线索被全局语义掩盖及深层易陷入背景捷径偏差的双重表征瓶颈,提出 DRIC 框架,通过正交残差解耦模块分离交互特异性线索,并利用分层局部融合机制聚合多层特征以恢复接触细节。
研究背景与动机¶
人-物交互(Human-Object Interaction, HOI)检测旨在定位图像中的人与物体并识别其交互动作,形式化表示为 \(\langle\text{human}, \text{object}, \text{action}\rangle\) 三元组,是具身智能感知、AR/VR 以及机器人协助等任务的核心基础。传统方法主要依赖封闭集合下的全监督训练范式,严重受限于预定义交互类别的密集标注成本,难以推广到未见动作(unseen verbs)或新颖的人物组合中。近年来,以 CLIP 为代表的视觉语言模型凭借海量图文对预训练展现出强大的开放词表迁移能力,推动了零样本 HOI 检测的发展。现有方法通常利用文本提示词和联合嵌入空间进行跨类别泛化,但在实际迁移中遭遇了深层次的表征瓶颈。
这种泛化受限本质上源于视觉语言模型在特征层与决策层的双重瓶颈。在特征层面,预训练视觉语言模型的全局表征天然侧重于宏观物体类别与场景布局,微弱而关键的局部交互线索(如细微的肢体接触、手部操作和细粒度姿态)往往被显著的高层全局语义所掩盖。例如在区分“骑自行车(ride bike)”与“修自行车(repair bike)”时,两者场景和人物物体高度相似,判别完全依赖接触部位的细粒度差异,高层特征极易失效。在决策层面,模型展现出强烈的背景捷径学习偏差(background shortcut bias),严重依赖场景共现先验而非真实交互证据(例如只要在户外背景就倾向于预测“骑行”)。随着视觉编码器层数加深,特征显著性迅速从局部交互细节漂移至背景捷径,使得模型在跨场景迁移或未见类别评估时出现灾难性性能退化。
面对全局语义掩蔽与背景捷径主导的困境,单纯依赖端到端全局微调或简单的图文蒸馏无法从根本上恢复丢失的局部判别力。核心 idea:解耦并重用交互线索(DRIC),通过构建上下文正交残差解耦(CORD)在全局原型子空间的正交补空间中显式剥离细粒度交互残差,并结合分层局部融合(SLF)自适应聚合视觉编码器浅层与中层的接触级几何细节,以两阶段渐进学习消除背景捷径并强化零样本交互判别。
方法详解¶
整体框架¶
DRIC 遵循经典的二阶段 HOI 检测范式:第一阶段利用预训练检测器定位人和物体,第二阶段利用增强的视觉语言模型实现交互关系分类。对于输入图像 \(I\),首先通过预训练 DETR 提取人和物体的候选检测框、类别与特征,经过轻量 MLP 映射构建候选人-物对(Human-Object, HO)标记 \(T \in \mathbb{R}^{N_{\text{pair}} \times D}\),并结合检测几何先验生成先验嵌入 \(p\)。在进入视觉编码器各层前,CORD 模块构建全局语义原型子空间并执行正交投影,将局部图像块特征解耦为全局共性分量与局部正交残差分量,通过门控调制将交互残差重新注入视觉特征,并利用交叉注意力机制将纯净的交互线索路由至 HO 标记。随后,SLF 机制在编码器各层抽取多深度 HO 标记,利用独立适配器对齐特征分布后执行层级自适应加权融合,最终将多层融合交互分数与全局零样本相似度分数联合输出。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 + DETR 候选框"] --> B["构建候选 HO Token 与空间先验"]
B --> C["上下文正交残差解耦<br/>构建全局原型并正交分离交互残差"]
C --> D["交互残差稀疏路由<br/>HO Token 交叉注意力聚集纯交互细节"]
D --> E["分层局部融合<br/>适配器对齐并加权融合多深度特征"]
E --> F["联合打分与零样本预测<br/>shoi 与 sfused 融合输出"]
关键设计¶
1. 上下文正交残差解耦:在全局原型子空间的正交补空间中提纯交互细节
针对高层全局语义对局部交互线索的掩盖问题,CORD 模块通过几何投影显式分离场景全局背景与细粒度动作残差。首先通过汇总 [CLS] 标记以及对背景、人体、物体、人-物联合区域做均值池化,构建包含 5 个关键语义原型的全局原型库 \(G = [g_{\text{cls}}; g_{\text{bg}}; g_h; g_o; g_{\text{union}}] \in \mathbb{R}^{K \times d}\)。将降维后的图像特征 \(\tilde{F} \in \mathbb{R}^{HW \times d}\) 投影到原型张成的子空间上,正交投影矩阵定义为: $\(P = G^\top (G G^\top + \varepsilon I)^{-1} G\)$ 任意图像 patch 特征 \(\tilde{f}\) 被显式分解为全局共性分量 \(\tilde{f}_\parallel = P \tilde{f}\) 与正交残差分量 \(\tilde{f}_\perp = \tilde{f} - \tilde{f}_\parallel\)。其中 \(\tilde{f}_\parallel\) 承载场景布局和宏观类别,而正交分量 \(\tilde{f}_\perp\) 剥离了全局偏置,纯化了局部交互动作差异。随后,利用全局分量通过门控网络生成自适应权重 \(m = \sigma(W_m \tilde{f}_\parallel)\),以 \(\tilde{f}' = \tilde{f} + \alpha (m \odot \tilde{f}_\perp)\) 形式调制回传至视觉特征,在保持宏观图文对齐稳定的同时显著增强局部判别性。
2. 交互残差稀疏路由:引导 HO Token 专属聚合正交交互线索
为了使人-物对标记能够专注感知具体交互区域,模型以 HO 标记 \(T_i\) 投影得到的查询向量 \(Q_i = W_q T_i\) 为驱动,设计了两步定向交叉注意力路由。首先,使查询向量与检测器提供的几何先验嵌入 \(p\) 进行交互,注入目标相对几何位置信息获得更新状态 \(T_i^{(1)}\);随后,将记忆键值严格限定在正交残差特征图 \(\tilde{F}_\perp\) 上进行第二阶段交叉注意力聚合: $\(T_i^{(2)} = \text{CrossAttn}(T_i^{(1)}, \tilde{F}_\perp)\)$ 由于记忆库排除了全局场景和宏观物体原型的干扰,HO 标记被迫将注意力权重集中于手部接触、局部受力点及姿态交互边缘。最终通过残差连接与层归一化更新 HO 标记:\(T_i' = T_i + \gamma \text{Norm}(T_i^{(2)} + Q_i)\),再将其送入后续 Transformer 块深入演化。
3. 分层局部融合:跨层级特征聚合逆转深层背景捷径偏置
针对深层特征注意力容易漂移至背景物体的捷径偏差问题,SLF 机制在视觉编码器的所有深度上建立侧路特征收集通道。在 ViT 骨干网络的各层提取对应同一人-物对的 HO 标记 \(T_i^{(l)}\),利用分层轻量线性适配器 \(\text{Adapter}^{(l)}\) 消除浅深层之间的特征分布鸿沟,得到层对齐特征 \(\tilde{T}_i^{(l)}\)。随后利用可学习的层次权重集 \(\{\beta_l\}\) 进行加权聚合: $\(\tilde{T}_i^{\text{fused}} = \sum_{l \in \mathcal{L}} \beta_l \tilde{T}_i^{(l)}\)$ 深层权重赋予较大初值以保留预训练图文对齐语义,中浅层特征则源源不断注入接触级的空间定位与边缘几何细节。多层融合标记经轻量 MLP 映射得到辅助判别分数 \(s^{\text{fused}}\),与顶层图文余弦相似度分数 \(s^{\text{hoi}}\) 直接相加构成最终交互得分 \(s = s^{\text{hoi}} + s^{\text{fused}}\),彻底扭转了单依赖顶层特征带来的背景虚假相关性。
损失函数 / 训练策略¶
由于分层融合机制的高效运作高度依赖底层解耦特征的纯净度,直接联合端到端训练会导致融合层梯度反向干扰正交投影子空间的建立。因此,DRIC 采用严谨的两阶段渐进优化策略: 1. 第一阶段(CORD 优化):仅激活 CORD 模块并冻结 SLF,模型仅基于零样本图文余弦相似度分数 \(s^{\text{hoi}}\) 计算二值 Focal 损失: $\(\mathcal{L}_{\text{stage1}} = \mathcal{L}_{\text{FocalBCE}}(s^{\text{hoi}}, y)\)$ 使正交解耦模块专注于从复杂场景中稳健分离出局部交互残差。 2. 第二阶段(SLF 集成):冻结 CORD 模块的所有参数,激活并专门训练 SLF 适配器与融合权重。总优化目标结合最终融合分数 \(s\) 的分类损失与相似度一致性正则化: $\(\mathcal{L}_{\text{stage2}} = \mathcal{L}_{\text{FocalBCE}}(s, y) + \lambda_{\text{sim}} \|s^{\text{hoi}} - s^{\text{fused}}\|_1\)$ 其中正则化系数设为 \(\lambda_{\text{sim}} = 1 \times 10^{-4}\),防止多层融合分支过度偏离预训练多模态对齐流形。
实验关键数据¶
主实验¶
在标准 HICO-DET 零样本基准的 5 种严格设定(RF-UC、NF-UC、UV、UO、UC)下与代表性 SOTA 方法(CMMP、EZ-HOI、LAIN、VDRP 等)进行横向对比(统一采用 ResNet-50 目标检测器与 ViT-B/16 视觉编码器):
| 数据集 / 设定 | 指标 | DRIC (本文) | LAIN (CVPR 2025) | 之前最佳基线 | 相对提升 |
|---|---|---|---|---|---|
| HICO-DET RF-UC | Unseen mAP / HM | 32.22 / 33.74 | 31.86 / 33.36 | 31.86 / 33.36 | +0.36 / +0.38 |
| HICO-DET NF-UC | Unseen mAP / HM | 38.59 / 35.28 | 36.41 / 34.31 | 36.45 / 34.31 (VDRP) | +2.14 / +0.97 |
| HICO-DET UV (未见动作) | Unseen mAP / HM | 29.49 / 31.87 | 28.96 / 31.19 | 28.96 / 31.19 | +0.53 / +0.68 |
| HICO-DET UO (未见物体) | Unseen mAP / HM | 38.51 / 36.04 | 37.88 / 35.58 | 37.88 / 35.58 | +0.63 / +0.46 |
| HICO-DET UC (未见组合) | Unseen mAP / HM | 32.58 / 34.08 | 31.64 / 33.25 | 31.64 / 33.25 | +0.94 / +0.83 |
| 全监督 HICO-DET | Full mAP | 36.30 | 36.02 | 36.02 | +0.28 |
| 全监督 V-COCO | \(AP_{\text{role}}^{S2}\) | 65.7 | 65.1 | 65.1 | +0.6 |
消融实验¶
在最具挑战性的 HICO-DET Unseen Verb (UV) 零样本动作泛化设定下评估各核心组件与设计策略:
| 配置 / 实验切片 | Unseen mAP | Seen mAP | Full mAP | 说明 |
|---|---|---|---|---|
| Baseline (原始两阶段 CLIP) | 24.88 | 31.06 | 30.19 | 缺乏局部解耦与多层融合 |
| + CORD (仅正交解耦) | 28.58 | 33.95 | 33.20 | 显著提升未见类别泛化能力 (+3.70) |
| + SLF (仅分层融合) | 27.19 | 32.87 | 32.07 | 缓解背景捷径,提升局部感知 (+2.31) |
| DRIC 完整模型 (CORD + SLF) | 29.49 | 34.67 | 33.95 | 两模块高度互补,达到最优性能 (+4.61) |
| CORD 特征拼接方案 (Concat) | 28.41 | 33.46 | 32.75 | 启发式拼接未实现严格子空间正交 |
| CORD 特征相减方案 (Subtract) | 28.05 | 32.91 | 32.23 | 粗暴相减破坏了表征几何结构 |
| CORD 交叉注意力方案 (CrossAttn) | 28.86 | 34.09 | 33.36 | 动态注意力仍受全局显著区域主导 |
| SLF 仅用顶层特征 (L12) | 28.58 | 33.95 | 33.20 | 缺乏浅层接触几何信息支持 |
| SLF 跨全部层级融合 (L1-L12) | 29.49 | 34.67 | 33.95 | 充分吸收浅中层局部交互细节 |
| 单阶段联合训练 (One-Stage Joint) | 28.78 | 33.90 | 33.18 | 融合层梯度干扰解耦空间,泛化下降 |
| 两阶段渐进训练 (Two-Stage, Ours) | 29.49 | 34.67 | 33.95 | 先筑牢特征基底再做层级融合 |
关键发现¶
- 正交子空间投影不可替代:在 CORD 解耦方案对比中,单纯拼接(28.41)或相减(28.05)均远逊于正交投影(29.49)。数学意义上的正交补空间能够严格抹平全局宏观语义,迫使模型只能利用非全局的细微形态变化进行预测。
- 浅中层特征是打破背景捷径的关键:将 SLF 融合层数由仅最深层(28.58)逐步扩展到全层级(29.49),未见动作性能获得近 1.0 mAP 的稳步提升。在背景扰动测试中(将测试背景替换为不相关场景),Baseline 性能断崖式下跌 12.26%,LAIN 下跌 3.56%,而 DRIC 仅微跌 2.18%(扰动后 Full mAP 仍达 33.21),证明多层局部融合彻底打破了虚假场景相关性。
- 两阶段优化的必要性:单阶段端到端训练使 Unseen mAP 从 29.49 跌落至 28.78,验证了先稳固解耦特征基底再进行层级自适应权重学习能有效避免梯度干扰。
亮点与洞察¶
- 正交补空间提纯局部交互残差:巧妙借助背景、人、物、人-物联合区域原型构建闭式正交投影算子,从数学形式上将视觉表征强制分解为全局共性与交互细节,彻底解决 VLM 中局部交互信号被全局语义淹没的痼疾。
- 显式攻克背景捷径偏差:通过可视化证实 CLIP 随着深度加深显著性逐步由人-物接触面漂移至整体背景,创造性地通过多深度轻量自适应侧路聚合将浅层接触定位证据重新拉回决策层,具有极佳的可解释性。
- 通用即插即用的表征增强思路:这种“原型正交解耦 + 多深度跨层聚合”的设计模式不仅适用于零样本 HOI,还可平移至稠密视听交互定位、微表情与细粒度动作识别、以及具身操控中接触状态判定等依赖微弱局部几何特征的多模态场景。
局限与展望¶
- 依赖上游两阶段目标检测器的精度:DRIC 依托 DETR 提取人和物体的候选边界框,若上游检测器在拥挤、严重遮挡或微小物体场景中漏检,后续正交解耦和特征路由将失去载体。
- 计算与内存开销增加:在 ViT 的每一层均引入 CORD 投影与正交补计算,且 SLF 需缓存并对齐 12 层的 HO 标记,推理与训练时的显存峰值与显存带宽消耗较原始 CLIP 均有一定程度增加。
- 未来改进方向:可进一步探索无检测器的单阶段全正交解耦架构,或通过轻量化低秩正交投影将模块参数量进一步压缩以适配边缘具身智能设备。
相关工作与启发¶
- vs LAIN (CVPR 2025):LAIN 主要通过聚合邻近图像 patch 与空间先验来增强局部感知,但在深层表征中依旧容易受到背景共现模式的干扰;本文 DRIC 通过数学正交投影从根源上剔除全局偏置,并显式引入全层级 SLF 逆转深层捷径漂移,在 NF-UC 和 UV 设定上均取得显著优势。
- vs VDRP (NeurIPS 2025):VDRP 依赖向上下文嵌入中注入视觉方差与高斯扰动来增强动作多样性,属于隐式表征扰动增强;DRIC 则是显式从几何子空间和特征层级两层入手提纯真实人-物接触线索,泛化依据更加坚实可解释。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用正交补子空间解耦全局语义与交互残差,并从多深度反制背景捷径,理论构思精巧。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 大零样本设定、全监督评估、背景扰动鲁棒性实验、分层渐进消融与 Grad-CAM 可视化,证据链极其闭环。
- 写作质量: ⭐⭐⭐⭐⭐ 动机严密,问题定义清晰,数学推导与架构图对应严谨,行文逻辑流畅。
- 价值: ⭐⭐⭐⭐⭐ 显著刷新了零样本 HOI 检测在各大公开基准的 SOTA,对多模态细粒度关系推理有重大借鉴价值。