跳转至

Context-Interactive Reasoning for Group Activity Detection

会议: ECCV 2026
论文: ECCV 原文
领域: 视频理解
关键词: 群体活动检测 / 社交交互理解 / 时空推理 / 场景上下文建模

一句话总结

针对密集人群与多视角视频中群体划分易产生虚假连接以及全局场景噪声干扰的难题,本文提出上下文交互推理框架,通过短期交互正则化器(STIR)显式施加可学习拓扑软约束,并借助长程上下文条件化器(LRCC)通过自适应门控动态注入全局场景语义,在复杂群体活动检测任务上刷新 SOTA。

研究背景与动机

群体活动检测(Group Activity Detection, GAD)旨在联合推断视频中个体的群体从属关系(谁和谁在一起)以及各群体的集体活动类别(他们在共同做什么)。相较于传统群体活动识别(GAR)通常假设单片段仅有一个预先指定成员的群体,现实监控与社交场景(如多视角密集餐厅 Café 数据集)往往存在多群体共存、频繁遮挡、密集人群以及大量离群者(outliers)。现有 GAD 方法普遍采用以个体为中心(actor-centric)的建模范式,主要依靠个体外观特征在自注意力机制下进行隐式交互推理。然而,在密集遮挡场景中,纯外观相似性极易引发跨群体的虚假关联,违背了社交交互的基本空间物理规律,导致群体边界严重模糊。

面对空间拓扑错乱,此前部分方案尝试引入固定的硬距离阈值截断交互,但这在多视角和不同人群密度下表现脆弱,极易误伤物理跨度较大但属于同组的合法交互。与此同时,集体活动的判定高度依赖场景语境与人-景共生关系(例如“就餐”与“自习”在局部姿态上难以区分,必须依赖桌面环境与背景线索)。现有方法要么完全忽略全局场景特征,要么通过简单的拼接或池化进行静态融合,在全局语义与当前活动相关度微弱时引入大量背景噪声。此外,仅升级底层视觉骨干(如 DINOv2、VideoMAE)并不能自发解决高层群体结构的划分歧义。

本文的核心切入点在于:将局部交互的空间拓扑归纳偏置与全局场景的自适应语义调制显式结合,分别在结构层面和语义层面解决局部聚集与全局推理的歧义。核心 idea:构建双流上下文交互推理架构,在局部帧级交互中通过短期交互正则化器(STIR)将显式空间拓扑转化为可学习的注意力软惩罚以压制虚假连接,在时序集成前通过长程上下文条件化器(LRCC)利用个体与群体解耦的自适应门控精准吸纳全局场景语义。

方法详解

整体框架

整体框架由双流特征提取、短期交互正则化(STIR)、集合预测组解码器、长程上下文条件化(LRCC)、时序编码器及多任务预测头组成。输入视频分为局部与全局两路采样:局部流在稀疏关键帧上通过部分微调的 DINOv2 提取特征图,并结合人体检测框经 RoIAlign 获得个体词元;全局流在更密集的整段视频上通过冻结的 VideoMAE-v2 提取全局时空表征并池化为片段级特征。在组推理之前,STIR 作用于每一局部帧,利用成对空间距离与相对尺度生成软拓扑偏置,修正个体间的注意力关联;随后个体词元与可学习组查询一同输入组解码器解耦交互;解耦后的个体与组词元经由 LRCC 独立门控自适应吸收全局场景特征;最后,时序卷积与自注意力模块聚合多帧轨迹,输出个体动作、组分配概率及集体活动分类。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入视频双流采样<br/>稀疏局部帧 + 密集全局片段"] --> B["双流特征抽取<br/>DINOv2 (局部 RoI) + VideoMAE-v2 (全局池化)"]
    B --> C["短期交互正则化(STIR)<br/>空间几何描述符 + 软距离自适应惩罚"]
    C --> D["组解码器交互推理<br/>个体词元与可学习组查询交叉注意力"]
    D --> E["长程上下文条件化(LRCC)<br/>个体/组双分支标量门控注入全局语义"]
    E --> F["时序聚合与建模<br/>轻量 TCN + 时序自注意力 (TSA) + 注意力池化"]
    F --> G["多任务预测输出<br/>个体动作 + 组从属匹配 + 集体活动分类"]

关键设计

1. 短期交互正则化(STIR):可学习软空间拓扑约束抑制虚假交互

在密集人群中,传统点积注意力仅依赖外观特征,极易在相隔较远或视线受阻的非同组个体间建立虚假边。STIR 在单帧内构建显式成对几何描述符,同时注入可学习空间偏置与距离平滑衰减项,替代传统不可导的硬截断。对于帧内任意两个个体框 \(b_i = (x_i, y_i, w_i, h_i)\) 与 \(b_j = (x_j, y_j, w_j, h_j)\),首先提取归一化中心偏移、对数相对尺寸及欧几里得中心距离,构建空间向量 \(s_{ij} = [\Delta x_{ij}, \Delta y_{ij}, \log(w_i/w_j), \log(h_i/h_j), \text{dist}_{ij}]\)。在多头注意力计算中,第 \(h\) 个注意力头的未归一化打分被显式重构为:

\[\mathrm{score}_{ij}^h = \frac{(W_q^h a_i)(W_k^h a_j)^\top}{\sqrt{d_k}} + \phi^h(s_{ij}) - \frac{\mathrm{dist}_{ij}^2}{\tau}\]

其中 \(\phi^h(s_{ij})\) 是由轻量 MLP 映射得到的多头几何偏置,用于自适应捕捉视角相关的相对方位模式;\(-\frac{\mathrm{dist}_{ij}^2}{\tau}\) 充当软平滑高斯型距离惩罚,温度系数参数化为 \(\tau = \exp(\rho)\) 且初始化为 1.0,保证惩罚范围可完全依据数据驱动端到端学习。该设计既保留了远距离合理交互的可能性,又极大抑制了密集场景下的跨组虚假拓扑。

2. 组解码器与时空集成:集合匹配与时序轨迹聚合

经过 STIR 拓扑正则化后的个体词元送入 DETR 风格的组解码器中,解码器维护一组固定的可学习组查询词元,通过交替执行个体与组词元联合自注意力以及对单帧视觉图的交叉注意力,实现组从属分配与群体表征抽取。为克服单视角遮挡和剧烈姿态变化带来的单帧不确定性,解码后的个体与组时序轨迹序列 \(U \in \mathbb{R}^{T \times d}\) 首先经过残差一维时间卷积网络(TCN)捕捉局部短程动态,再通过 \(L\) 层堆叠的多头时序自注意力(TSA)建立长程时间依赖:

\[U^{(0)} = U + \mathrm{TCN}(U) + P, \qquad U^{(l+1)} = \mathrm{TSA}^{(l)}(U^{(l)})\]

其中 \(P\) 为可学习时间位置编码。随后,利用基于注意力权重的加权时间池化算子从轨迹中提取片段级紧凑特征,为后续预测提供时空平滑的鲁棒表达。

3. 长程上下文条件化(LRCC):双分支解耦自适应门控注入全局语义

细粒度集体活动的辨识(如识别是“聚餐”还是“讨论”)离不开整体场景大环境语义,但非选择性地拼接背景特征会导致背景不相关的局部微动作被全局噪声淹没。LRCC 将离线抽取的 VideoMAE-v2 片段级特征 \(f_{\mathrm{mae}}\) 经线性投影、层归一化与激活函数映射为全局语义词元 \(z_{\mathrm{global}} \in \mathbb{R}^d\)。鉴于个体词元(侧重局部姿态与交互)与组词元(侧重群体结构与集体意图)对背景语义的依赖差异,LRCC 采用解耦的非共享双分支标量门控机制:

\[\alpha_i = \sigma\big(W_a [a_i; z_{\mathrm{global}}]\big), \quad \tilde{a}_i = a_i + \alpha_i z_{\mathrm{global}}\]
\[\beta_k = \sigma\big(W_g [g_k; z_{\mathrm{global}}]\big), \quad \tilde{g}_k = g_k + \beta_k z_{\mathrm{global}}\]

标量门控 \(\alpha_i, \beta_k \in (0, 1)\) 依据输入动态调节全局信息注入强度。相比通道级调制,标量门控在保持轻量化的同时提供了明确的调节解释性,避免在监督信号有限时引入过参数化噪声。

损失函数 / 训练策略

模型采用多任务端到端联合训练。组匹配过程沿用二分图匈牙利匹配,将预测组与真实标注对齐。总损失由个体动作分类损失 \(\mathcal{L}_{\mathrm{ind}}\)、群体活动分类损失 \(\mathcal{L}_{\mathrm{group}}\)、组从属二值交叉熵损失 \(\mathcal{L}_{\mathrm{mem}}\) 以及对比正则化损失 \(\mathcal{L}_{\mathrm{con}}\) 构成:

\[\mathcal{L} = \lambda_{\mathrm{ind}} \mathcal{L}_{\mathrm{ind}} + \lambda_{\mathrm{group}} \mathcal{L}_{\mathrm{group}} + \lambda_{\mathrm{mem}} \mathcal{L}_{\mathrm{mem}} + \lambda_{\mathrm{con}} \mathcal{L}_{\mathrm{con}}\]

其中 \(\mathcal{L}_{\mathrm{con}}\) 为 InfoNCE 对比损失,拉近属于同一组的个体表征距离,推远不同组个体的表征。在训练策略上,视觉基础模型 DINOv2-Base 仅微调后 2 个 Transformer 块,其学习率设为主干模块的 \(0.1\times\);全局 VideoMAE-v2 Giant 骨干全参数冻结,离线预抽取特征以降低显存开销。

实验关键数据

主实验

在代表性密集人群评测基准 Café(分为跨视角 split-by-view 与跨场景 split-by-place 两个协议)及传统基准 Social-CAD 上进行全方位对比。主要指标包括群组平均精度(Group mAP1.0、mAP0.5)与离群点平均交并比(Outlier mIoU)。

数据集 / 划分 方法 年份 骨干网络 Group mAP1.0 Group mAP0.5 Outlier mIoU 提升 (vs. SOTA)
Café (Split by view) Practical GAD 2024 ResNet-18 18.84 37.53 67.64 +11.63 / +16.97 / +8.34
VLCMTN 2025 ResNet-18 19.67 41.06 68.29 +10.80 / +13.44 / +7.69
ProGraD (frozen) 2026 DINOv2 16.85 43.42 70.42 +13.62 / +11.08 / +5.56
本文 (Ours) 2026 DINOv2+VideoMAE 30.47 54.50 75.98 +10.80 / +11.08 / +5.56
Café (Split by place) Practical GAD 2024 ResNet-18 10.85 30.90 63.84 +12.97 / +17.07 / +8.13
VLCMTN 2025 ResNet-18 11.58 30.98 65.48 +12.24 / +16.99 / +6.49
ProGraD (full FT) 2026 DINOv2 20.42 44.14 67.71 +3.40 / +3.83 / +4.26
本文 (Ours) 2026 DINOv2+VideoMAE 23.82 47.97 71.97 +3.40 / +3.83 / +4.26

在 Social-CAD 基准上,模型仅用 1 帧局部与 16 帧全局特征即达到 72.8% 社交活动准确率与 90.2% 个体动作准确率,超越此前最优的 ProGraD(70.0%)与 STIRM(69.6% / 83.1%)。

消融实验

组件消融与结构设计实验均在难度更高的 Café split-by-place 设置下进行,严格隔离核心模块贡献。

配置 骨干网络 STIR LRCC Group mAP1.0 Group mAP0.5 Outlier mIoU 说明
Baseline ResNet-18 ✗ ✗ 8.75 29.65 59.86 原始集合预测基线
Baseline DINOv2 ✗ ✗ 10.45 31.76 65.75 单纯更换更强骨干增益有限
+STIR Only ResNet-18 ✓ ✗ 15.86 36.71 68.44 拓扑约束显著提升组聚类
+STIR Only DINOv2 ✓ ✗ 15.69 35.16 69.71 消除密集跨组虚假交互
+LRCC Only ResNet-18 ✗ ✓ 12.71 34.83 66.97 全局语义助力活动判别
+LRCC Only DINOv2 ✗ ✓ 18.98 35.58 69.21 门控机制有效抑制噪声
Full Model ResNet-18 ✓ ✓ 17.14 34.45 69.64 双模块协同提升明显
Full Model DINOv2 ✓ ✓ 23.82 47.97 71.97 完整模型达成最优性能

针对 STIR 与 LRCC 内部模块设计的变体对比验证:

模块变体类别 具体设计方案 Group mAP1.0 Group mAP0.5 Outlier mIoU 设计效果分析
STIR 空间建模方案 无 STIR (w/o STIR) 18.98 35.58 69.21 缺乏几何约束,组边界模糊
仅空间偏置 (Spatial bias) 22.64 45.10 71.39 有序学习相对方位,但缺乏距离截断
硬距离掩码 (Hard mask) 20.70 43.66 70.00 启发式固定截断,误伤同组远距离交互
完整 STIR (偏置 + 软距离惩罚) 23.82 47.97 71.97 可微连续惩罚最贴合真实密度分布
LRCC 上下文融合方案 无 LRCC (w/o LRCC) 15.69 35.16 69.71 缺失宏观场景线索,细粒度活动易混淆
静态拼接 (Concat) 17.57 35.81 70.36 无选择注入,背景无关时引入干扰
静态相加 (Add) 16.59 38.31 68.21 特征空间混淆,离群点性能退化
全局均匀池化广播 (Global pooling) 22.90 43.28 70.93 均匀融合改善部分活动,但泛化不足
共享门控 (Shared gate) 16.45 32.41 68.31 个体与组角色不同,单门控产生竞争
解耦双分支门控 (Two-branch) 23.82 47.97 71.97 差异化吸收全局语义,效果最优

关键发现

  • 拓扑正则化决定组划分上限:单纯升级至 DINOv2 仅让 Baseline 的 Group mAP1.0 从 8.75 微升至 10.45,而引入 STIR 后不论何种骨干均带来 5~7 个百分点的跃升,证明无结构约束的纯外观注意力无法应对密集人群的遮挡歧义。
  • 软距离惩罚优于硬截断:硬距离掩码因采用固定阈值使得 mAP1.0 降低了 3.12(20.70 vs. 23.82),证实了可学习自适应有效交互半径 \(\tau\) 对不同机位缩放和拥挤程度的重要性。
  • 个体与组解耦门控不可或缺:若强行让个体与组词元共享相同的融合门控,mAP1.0 暴跌 7.37(16.45 vs. 23.82),说明个体动作分类与宏观群体决策在场景语义吸纳策略上存在明显差异,解耦调节才能两全其美。

亮点与洞察

  • 可微分空间交互先验:将相对几何尺寸与欧氏中心距离映射为多头偏置与对数可微距离衰减项,解决了传统硬阈值剪枝不可导且在多变视角下泛化差的痛点。
  • 轻量解耦的自适应场景门控:在个体级与组级表征之间采用独立的非共享标量门控,以极少参数量(仅两个线性映射)实现了环境语义的动态过滤,避免了高维通道调制在少量标注下的过拟合。
  • 无缝即插即用性:未修改底层 DETR 解码机制与二分图匹配损失,STIR 和 LRCC 分别作为前置拓扑滤波器与后置上下文调制器,可无缝迁移至任意图网络或 Transformer 架构中。

局限与展望

  • 依赖预标注人体框:当前实验遵循标准协议基于真实人体框输入,在实际闭环检测系统中,检测器漏检或框漂移可能会劣化 STIR 相对几何描述符的准确性。
  • 全局特征离线提取缺乏端到端交互:VideoMAE-v2 特征完全离线抽取且保持冻结,未能根据 GAD 任务反馈更新全局表示,限制了更深层次的端到端细粒度特征对齐。
  • 时序推理深度仍有拓展空间:目前主要依靠单帧密集拓扑与轻量 TCN 聚合,若能构建跨帧多体连续轨迹图拓扑,可望进一步提升长时间跨度群组变迁的辨析度。

相关工作与启发

  • vs. Practical GAD [ECCV 2024]:Practical GAD 奠定了集合预测 GAD 的基石,但其交互推理纯靠无约束注意力。本文保留其解码器结构,在其前后分别补全了显式空间先验(STIR)与环境自适应语义(LRCC),使得跨视角 mAP1.0 大幅拉升 11.63。
  • vs. ProGraD [CVPRW 2026]:ProGraD 尝试利用提示引导探索 VFM,但在密集多组划分时因缺乏空间物理约束依然存在错配。本文证明仅靠 VFM 骨干不够,针对性的轻量空间交互拓扑与解耦环境建模才是突破瓶颈的关键。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [将物理空间软惩罚与解耦环境门控有机融合,对 GAD 痛点分析精准到位]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在 Café 双重协议与 Social-CAD 上全面评测,消融分析与变体对比深入详实]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机明确,公式与图示规范,实验对比条理清晰]
  • 价值: ⭐⭐⭐⭐☆ [设计高度轻量化且即插即用,为拥挤场景视频理解与社交交互分析提供了优秀示范]