跳转至

SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos

会议: ECCV 2026
论文: CVF Open Access
代码: https://github.com/eth-siplab/SkillSpotter
领域: 视频理解
关键词: 第一人称与第三人称视频、动作技能评估、时序动作定位、姿态估计融合、自适应时序抑制

一句话总结

针对 Ego-Exo 视频中熟练动作时间戳定位与执行质量评价(良好 vs. 需改进)的联合评测任务,提出融合双向跨视角注意力、门控 3D 人体姿态与自适应时序抑制的统一框架 SkillSpotter,将类别特定 mAP 从 12.40 提升至 21.82,并在平衡准确率上逼近人类标注者一致性上限的 94%。

研究背景与动机

通过增强现实(AR)眼镜或固定多相机系统在体育、烹饪或乐器演奏等领域实现个性化实时技能指导,核心前提是系统不仅要识别出用户「在做什么」,更要评估其动作执行的「质量如何」。长久以来,时序动作检测(TAD)专注从未修剪视频中定位动作时间段,却完全不涉及质量评分;而动作质量评估(AQA)则普遍假设输入是预先裁剪好的单次动作片段,直接回归分数,无法应对连续流式交互场景中逐动作时刻的实时反馈需求。Ego-Exo4D 提出的熟练动作展示基准正式将该问题形式化为:在未修剪的同步第一人称与第三人称(Ego-Exo)视频中,不仅需要精准定位技能动作的时间戳,还需将其判定为优秀执行(good execution)或改进建议(tip for improvement)。

然而,直接将现有的 SOTA 时序动作定位架构迁移至该任务时面临严峻瓶颈。本文系统评估了 7 种主流 TAD 架构并解耦定位与质量评估指标,发现现有模型在细粒度质量判别上几乎处于随机猜测水平(平衡准确率仅 49.51%~55.99%,接近 50.9% 的随机基线)。这种崩溃主要源于三重结构性矛盾:首先,不同技能动作的时间密度差异巨大,篮球场景下超过 80% 的事件间隔在 0.5 秒以内,而乐器演奏场景中不到 20%,导致常规 TAD 固定的 NMS 半径要么在密集场景中误删真实共存事件,要么在稀疏场景中过度保留重复误检;其次,纯视觉外观特征容易受遮挡和视点剧烈移动影响,难以捕捉支撑技能判别的微小运动学差异;最后,简单拼接第一人称与第三人称特征会导致严重的跨视角表征混乱,反而引起分类精度的严重坍塌。

本文的切入角度是结合人体运动学生物力学先验,构建自适应场景密度与视角特异性的协同模型。核心 idea:构建姿态感知的多视角技能动作检测与分级框架 SkillSpotter,通过双向跨视角注意力建立视角交互并避免分类坍塌,引入门控 3D 骨骼运动学特征弥补外观质量信号的不足,并设计基于连续指数衰减的自适应时序抑制模块动态适应场景密度。

方法详解

整体框架

SkillSpotter 以未修剪的同步第一人称视频、第三人称视频及估计的 3D 人体姿态序列为输入,输出带有时间戳与质量分类(good 或 tip)的技能动作预测集。在特征输入阶段,模型采用冻结的 Omnivore 提取第一人称和第三人称视频时序特征,同时通过 Aria 相机轨迹预测或多视角三角测量获取 3D 人体骨骼坐标及衍生运动学特征。特征送入基于 ActionFormer 的多尺度时间特征金字塔(共 \(L=8\) 层),在金字塔每一层依次进行跨视角信息交互、姿态特征注入,最后由预测头输出分类 logits、时间回归与自适应抑制半径。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:同步第一人称/第三人称视频与3D姿态"] --> B["Omnivore 与姿态卷积时序特征提取"]
    B --> C["双向跨视角注意力<br/>全时间跨度多头注意力与自适应门控融合"]
    C --> D["门控 3D 人体姿态融合<br/>运动学特征金字塔与残差门控注入"]
    D --> E["分类与时间回归预测头<br/>生成候选时间戳、置信度与质量 logits"]
    E --> F["自适应时序抑制<br/>连续指数衰减与类别感知抑制"]
    F --> G["输出:时间戳级技能动作定位与质量等级判定"]

关键设计

1. 双向跨视角注意力:防止特征简单拼接引发分类性能退化

在处理 Ego-Exo 多视角输入时,基线模型若仅将第一人称与第三人称的外观特征沿通道维度直接拼接,会导致模型难以解耦不同视角下的几何形变与遮挡模式,实验中 ActionFormer 在拼接输入下的平衡准确率暴跌至 50.34%。为此,本设计保持两个视角的时序特征金字塔 \(\{f_{ego,l}\}\) 与 \(\{f_{exo,l}\}\) 独立,并在每个金字塔层级 \(l\) 引入跨越全局时间跨度的双向多头注意力机制(\(N_h=4\)),使得第一人称视角的局部细节能主动查询第三人称的全景上下文,反之亦然: $\(f_{ego,l}' = f_{ego,l} + \sigma(g_e^l) \cdot \text{MHA}(f_{ego,l}, f_{exo,l}), \quad f_{exo,l}' = f_{exo,l} + \sigma(g_x^l) \cdot \text{MHA}(f_{exo,l}, f_{ego,l})\)$ 随后将增强后的特征沿第一人称残差路径进行投影融合:\(f_l = f_{ego,l}' + \sigma(g_f^l) \cdot \text{Proj}([f_{ego,l}'; f_{exo,l}'])\),其中融合门控标量初始值设为 -1.0。这种设计既维持了第一人称的核心主导地位,又通过平滑交互彻底消除了特征拼接引起的分类崩溃现象。

2. 门控 3D 人体姿态融合:以骨骼运动学弥补视频外观的质量判别盲区

动作技能的优劣本质上取决于关节发力轨迹与身体协调机制,单纯的视频外观特征极易被复杂背景和视角漂移干扰。本设计构建了包含 51 维原始 3D 关节坐标(17 个 COCO 关键点 \(\times 3\))与 67 维物理运动学特征(关节角度、两两关节空间距离与帧间速度)共 118 维的姿态输入序列 \(P \in \mathbb{R}^{D_p \times T}\)。在推理阶段,第一人称通过 Aria 眼镜轨迹估计姿态,第三人称则经由 ViTPose 检测结合多视角 RANSAC-DLT 三角剖分重建,杜绝真值泄漏。姿态序列经一维卷积骨干映射为时间特征金字塔 \(p_l \in \mathbb{R}^{D \times T_l}\)(\(D=512\)),并在金字塔每一层通过门控残差网络注入视频表征: $\(f_l' = f_l + \sigma(g_p^l) \cdot \text{Proj}([f_l; p_l])\)$ 可学习标量门控 \(g_p^l\) 初始值设为 -2.0,使网络在训练初期保持平稳,逐步自适应调整人体动力学几何信息与宏观视觉外观之间的权重平衡。

3. 自适应时序抑制:基于连续指数衰减动态匹配多场景事件密度

传统 TAD 依赖固定半径的 Soft-NMS,但熟练动作的发生频率在不同活动间存在极端差异(例如篮球中连续过人或投篮动作的时间间隔极短,而烹饪或乐器按键则节奏平缓)。固定半径不仅容易误抹除高密度的真实技能点,也无法允许时间上重叠的 good 与 tip 两种正交反馈并存。本模块利用两层 MLP 基于候选动作特征预测连续的抑制半径,并结合场景级可学习偏置 \(e_s\): $\(r_k = \text{Softplus}(\text{MLP}(h_k)) + e_s\)$ 对于按置信度排序的候选检测对,高置信度候选 \(i\) 对低置信度候选 \(j\) 施加带有类别感知约束的连续指数平滑衰减: $\(w_{ij} = \exp\left(-\frac{|t_i - t_j|}{r_i}\right) \cdot \mathbb{I}[s_i > s_j] \cdot \mathbb{I}[y_i = y_j]\)$ 指示函数 \(\mathbb{I}[y_i = y_j]\) 确保不同质量类别的事件在时间重叠时不发生相互抑制,调整后得分为 \(\tilde{s}_j = s_j \cdot \exp(-\sum_i w_{ij} / \tau)\)。通过构建以真值时间戳为中心的高斯目标,模块利用二元交叉熵辅助损失 \(\mathcal{L}_{sup} = \text{BCE}(\text{logit}(\tilde{s}_k), \hat{y}_k)\) 实现端到端可微训练。

损失函数 / 训练策略

模型综合动作分类焦点损失、时序累积分布得分对齐损失以及自适应抑制辅助损失联合优化: $\(\mathcal{L} = \mathcal{L}_{cls} + \lambda_{reg} \mathcal{L}_{reg} + \lambda_{sup} \mathcal{L}_{sup}\)$ 其中超参数 \(\lambda_{reg} = \lambda_{sup} = 1.0\)。时序对齐项 \(\mathcal{L}_{reg} = \frac{1}{N_{pos}} \sum_{c=1}^{N_c} \sum_t (\text{CDF}_c^{pred}(t) - \text{CDF}_c^{gt}(t))^2\) 优化各类别时间累积分布函数(CDF)的吻合度。训练基于 AdamW 优化器(初始学习率 \(1 \times 10^{-3}\),权重衰减 0.05),采用 5 个预热 epoch 并总共训练 15 个 epoch,单张 NVIDIA H200 上耗时低于 15 分钟,Ego+Exos 完整配置参数量为 67.37M,推理速度可达 19.70 FPS。

实验关键数据

主实验

在 Ego-Exo4D 熟练度展示基准的三种视点设置(Ego、Exos、Ego+Exos)下,以类别特定平均精度(\(mAP_S\))、类别无关定位精度(\(mAP_A\))、平衡准确率(BA)和宏 F1(F1)评测,匹配容差在 \(\{0.25, 0.5, 1.0\}\text{s}\) 上取平均:

模型 Ego \(mAP_S\) Ego \(mAP_A\) Ego BA Exos \(mAP_S\) Exos BA Ego+Exos \(mAP_S\) Ego+Exos BA
Random Baseline 0.73 1.49 50.90 0.70 50.44 0.70 50.15
Ego-Exo4D Baseline 3.27 – – 3.84 – 3.57 –
VideoMambaSuite 7.63 8.65 49.51 7.06 46.03 3.69 52.70
TadTR 7.79 10.79 49.68 6.37 52.31 4.12 52.81
DyFADet 10.09 12.53 48.89 3.57 49.52 3.18 47.63
TriDet 10.35 14.79 49.17 8.99 50.06 8.23 48.92
CausalTAD 11.42 16.07 52.86 11.82 50.78 13.16 54.98
TemporalMaxer 12.34 16.69 54.34 10.38 52.18 11.27 50.09
ActionFormer 12.40 17.11 55.99 13.18 55.03 13.82 50.34
SkillSpotter (本文) 21.82 27.89 60.40 21.12 60.59 21.34 60.39
较最强基线提升 +9.42 +10.78 +4.41 +7.94 +5.56 +7.52 +5.41

消融实验

针对 ActionFormer 骨干逐步加入核心模块的渐进式消融评估:

模块配置 Ego \(mAP_S\) Ego \(mAP_A\) Ego BA Ego+Exos \(mAP_S\) Ego+Exos BA 说明
ActionFormer (Soft NMS) 12.12 16.85 55.34 13.71 50.24 默认 baseline
ActionFormer (No NMS) 13.96 22.50 54.81 17.30 51.79 移除传统 NMS,定位召回提升但分类受损
+ 自适应时序抑制 (Adaptive Supp.) 18.82 25.87 59.74 21.18 43.06 单视角下定位与分级双升;但拼接输入引发多视角分类坍塌
+ 门控姿态融合 (Pose Fusion) 21.82 27.89 60.40 21.99 45.77 注入 3D 动力学先验,单视角性能达到峰值
+ 双向跨视角注意力 (Cross-View Attn) – – – 21.34 60.39 解耦独立流双向交互,多视角 BA 暴涨 +14.62 恢复正常

关键发现

  • 各组件收益显著:自适应时序抑制带来最显著的整体指标跨越(Ego \(mAP_S\) +4.86,BA +4.93),模型学得的抑制半径与各活动的时间间隔真值具有高度统计相关性(Spearman 秩相关系数 \(\rho = 0.83, p = 0.010\)),在无直接密度标签监督下自发学会了篮球小半径(0.23)与音乐大半径(0.32)。
  • 跨视角注意力解决分类坍塌:在多视角直接拼接时,加入姿态和抑制后多视角 BA 仅 45.77,跨视角注意力通过独立建模与双向交互将 BA 大幅拉升至 60.39,完全消除了特征交织的负面干扰。
  • 任务难度与动作属性强相关:在全身大范围运动场景(篮球 \(mAP_S\) 40.76、攀岩 28.87)中收益巨大,而在以细粒度手物交互为主的场景(烹饪 \(mAP_S\) 3.08、音乐 1.57)中表现依然受限,说明宏观身体骨骼特征难以充分表达手指微操。
  • 逼近人类标注一致性上限:基准多专家标注重合时间戳下的互评平衡准确率仅为 64.6(Cohen's \(\kappa = 0.29\)),SkillSpotter 达到的 60.40 已占该天花板的 94%,表明质量分级进一步提升面临强烈的标签主观性制约。

亮点与洞察

  • 提出首个解耦评测协议与人类天花板基准:通过拆分类别无关检测精度(\(mAP_A\))与质量判定准确率(BA),揭示了传统 TAD 骨干在动作质量判别上近乎随机猜测的隐蔽缺陷,并首次标定了 Ego-Exo4D 人类标注的一致性上限(64.6 BA)。
  • 可微分自适应时序抑制策略:打破了传统目标检测/时序检测中一维离散或固定 NMS 启发式规则,采用带有类别共存掩码的连续指数衰减机制,通过辅助高斯分布损失实现全流程端到端梯度反传。
  • 模块具有通用即插即用迁移能力:自适应抑制与姿态融合不仅适用于 ActionFormer,迁移到 TriDet、CausalTAD、TemporalMaxer 等主流检测模型时均带来 8~10 个百分点的稳定性能增长,并在 HoloAssist 错步检测基准上验证了泛化性。

局限与展望

  • 细粒度手部交互表征缺失:当前模型基于全身 3D 骨架,在依赖精细指尖与工具交互的烹饪、乐器演奏等场景定位性能较低;尝试引入 POTTER 手部姿态后甚至产生微弱性能下降,亟需更鲁棒的手部-物体空间交互表征。
  • 多视角融合未超越单视角上限:虽然跨视角注意力解决了多视角特征直接拼接导致的精度坍塌,但多视角最终评测指标(\(mAP_S\) 21.34)仅恢复至与单第一人称视角相当(21.82),如何真正从多机位几何互补中挖掘增量增益仍是一个开放难题。
  • 未来方向:探索引入眼动注视点、心率变异性(EgoHRV)等自主神经反应生理信号辅助疲劳与技术评判,并结合多模态大模型实现从类别离散判定到自然语言指导建议(Actionable Feedback)的端到端生成。

相关工作与启发

  • vs. 传统时序动作定位(ActionFormer / TriDet / CausalTAD):传统方法只预测无质量属性的时序区间,且依赖固定阈值 Soft-NMS。SkillSpotter 针对细粒度技能时间戳定制了端到端可学习的自适应时序抑制与类别共存机制,将质量分类融入检测流程。
  • vs. 视频动作质量评估(AQA):传统 AQA 需依赖人工预剪辑的短视频片段进行打分回归。SkillSpotter 首次在未修剪的连续长视频流中完成了「何时发生」与「是否正确」的联合点位级判决,契合实时指导落地需求。
  • vs. HoloAssist / DR-MoE:现有错误动作检测通常仅在预裁剪片段上做二分类,SkillSpotter 证明其框架可直接跨数据集迁移至长视频未修剪检测任务,检测定位 \(mAP_S\) 较 ActionFormer 基线翻倍(3.33 提升至 7.24)。

评分

  • 新颖性: ⭐⭐⭐⭐ [针对 Ego-Exo 密集技能评估问题定制了端到端可微分抑制与跨视角交互架构]
  • 实验充分度: ⭐⭐⭐⭐⭐ [详尽评测 7 种 TAD 架构、多视角组合、跨骨干迁移与人类一致性上限]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严谨闭环,实验深入,动机与痛点直击要害]
  • 价值: ⭐⭐⭐⭐⭐ [为具身智能与 AR 实时辅导系统的技能检测提供了扎实标杆与技术支撑]