跳转至

Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/yaa1haa1/PartialVisGraph
领域: 视频理解
关键词: 骨骼动作识别, 受限视场, 超图神经网络, 可见性先验, 具身智能

一句话总结

针对第一人称具身设备、移动机器人与密集监控中因受限视场(FoV)导致的骨骼关节点大面积缺失问题,本文提出了首个面向受限视场骨骼动作识别的超图框架 PartialVisGraph,通过可学习虚拟超边构建软关联矩阵并结合可见性先验门控特征聚合,在极度遮挡下相较强基线取得了高达 68.8% 的准确率突破。

研究背景与动机

基于人体骨骼的动作识别依靠人体关节点坐标及其拓扑拓扑连接,具备对背景杂波、光照变化及视点偏移的天然鲁棒性,已在智能监控、康复医疗、人机交互与自动驾驶等场景中得到广泛应用。随着具身智能与可穿戴设备的兴起,动作识别系统需要部署在移动平台或紧凑端侧传感器上。然而,当前主流骨骼动作识别模型普遍假定输入骨骼是完整且干净的,严重依赖整身 25 个或更多关节点的全局协同。在真实具身与移动感知场景中,摄像机受限于自身安装角度、移动视角以及视野范围(Field-of-View, FoV),人体往往仅有局部躯干或肢体处于画面中,导致严重的关节点不可见和视野截断。

这种场景下的核心矛盾在于:传统图卷积网络(GCN)将骨骼建模为成对物理连边图,信息严格沿着骨骼物理连接传播;当关键躯干或支撑关节点超出视场边界时,原本的物理信息通路被切断,成对图结构直接面临拓扑碎裂与特征退化。更关键的是,人体动作本质上依赖多个身体部位高阶协调(如踢腿动作不仅依赖单腿运动,还需要对侧手臂的协同摆动来维持平衡)。当视野严重受限、仅能捕捉到局部微弱线索时,传统二元图模型无法聚合分散且不相邻的弱关联信息,导致分类器在视场受限下性能断崖式崩溃。

为了打破对完全可见骨骼的强假设,本文系统性地开辟了受限视场骨骼动作识别这一全新任务。作者认为,应对局部视场缺失的关键在于跨越物理图连边的限制,自适应挖掘多关节点之间的高阶超图依赖,同时对视野内外的关节点施加显式的可见性门控,避免不可见伪噪声污染可靠关节点。核心 idea:构建基于可学习虚拟超边词表的动态软超图结构,利用单头样本自适应 Transformer 结合对数可见性先验阻断不可见节点的信息扩散,并设计正交多样性与聚类正则化防止超图坍缩,实现受限视场下骨骼动作的高阶鲁棒推理。

方法详解

整体框架

PartialVisGraph 针对骨骼序列在受限视场下的部分可见性展开建模,整体网络由浅层时空位置编码、交替堆叠的混合图-超图块(HGH Block)与多尺度时间卷积网络(MS-TCN)、以及最终的时序池化与线性分类头组成。输入骨骼序列首先经过线性投影并叠加可学习位置编码,随后进入特征解耦与双分支空间建模:一部分通道保留传统 GCN 以保留人体骨骼原生的物理拓扑归纳偏置,其余大部分通道输入发明的超图分支以动态捕捉高阶交互。

在超图分支的核心——关联感知超图注意力模块(IAHA)中,模型借助一组全局可学习的虚拟超边向量,结合时序池化后的关节点特征计算余弦相似度并做稀疏归一化,动态构建软关联矩阵;随后通过单头样本自适应 Transformer 实现关节点向虚拟超边的主动聚合,并经由软关联矩阵反投影回关节点;多层时空特征提取后完成动作预测。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["受限视场骨骼序列<br/>X ∈ R^(T×V×Cr) 与 可见性掩码 vis"] --> B["线性投影与位置编码<br/>得到特征表示 Xe ∈ R^(T×V×Cf)"]
    B --> C["通道维度拆分<br/>Xgcn (Cf/4) 与 Xhyper (3Cf/4)"]
    C --> D["双支路空间建模<br/>GCN 物理拓扑支路 ∥ IAHA 软超图注意力支路"]
    D --> E["1. 软关联矩阵构建<br/>虚拟超边词表与时序关节点特征计算稀疏关联 Hsoft"]
    E --> F["2. 单头样本自适应 Transformer (SHSAT)<br/>关节点特征聚合至虚拟超边 + 对数可见性先验门控 Bvis"]
    F --> G["超边特征反投影与重分配<br/>Fj = Hsoft × Fe 映射回关节点并与 GCN 输出拼接"]
    G --> H["多尺度时间卷积与分类输出<br/>MS-TCN 时序建模 → 时序池化 → 线性层输出预测 ŷ"]

关键设计

1. 软关联矩阵构建:打破二元连接的虚拟超边自适应拓扑

传统超图方法通常受限于严格的结构先验(例如限定每个关节点仅属于单一边,或超边数量强制与关节点数量一致),无法泛化到不同体态与视野缺失下的动态关节点群组建模。针对这一瓶颈,IAHA 模块引入了一个可学习的虚拟超边词表 \(E_v \in \mathbb{R}^{K_v \times C_v}\)(默认设置 \(K_v = 10\) 个虚拟超边)。对于输入的骨骼特征 \(F_h \in \mathbb{R}^{T \times V \times C_v}\),先在时间维度进行均值池化,提炼出整段序列的紧凑关节点摘要 \(F_s = \text{Pool}_t(F_h) \in \mathbb{R}^{V \times C_v}\)。

接着,模型计算各关节点摘要向量与各虚拟超边向量之间的余弦相似度矩阵 \(S \in \mathbb{R}^{V \times K_v}\),并在行方向应用 sparsemax 激活函数生成连续归一化的软关联矩阵 \(H_{\text{soft}}\):

\[S_{j,k} = \frac{\langle F^{(j)}_s, E^{(k)}_v \rangle}{\|F^{(j)}_s\| \|E^{(k)}_v\|}, \quad H_{\text{soft}} = \text{sparsemax}_{\text{row}}(S) \in [0, 1]^{V \times K_v}\]

由于稀疏算子的截断性质,\(H_{\text{soft}}\) 诱导出了紧凑且可解释的关节点-超边隶属关系。当某一列全为零时表示该虚拟超边在当前动作下未激活,从而自适应地丢弃冗余高阶组合;而每一行连续的权重则允许关节点同时以不同隶属度参与多个高阶身体协同运动,消除了离散手工设定超图拓扑的僵化弊端。

2. 单头样本自适应 Transformer (SHSAT):融合可见性先验的信息流门控

在建立软关联矩阵后,如何安全地将离散关节点信息聚合到高阶超边上、且彻底阻止视野外或被遮挡关节点的不可见噪声污染特征,是受限视场下的核心挑战。为此,模型将时序展开后的虚拟超边标记 \(E_{vt} \in \mathbb{R}^{T \times K_v \times C_v}\) 与关节点特征 \(F_h\) 拼接为总长为 \(L = K_v + V\) 的序列,并根据 \(H_{\text{soft}}\) 构建二值连接掩码 \(M \in \{0, 1\}^{L \times L}\),规定关节点仅允许向其所隶属的虚拟超边单向传递信息。

更关键的是,算法引入了序列全局关节点可见性先验 \(vis \in [0, 1]^{T \times V}\)(可见关节点标为 1,不可见或越界点标为 0,随着深层 MS-TCN 时序下采样可能平滑为连续分数值)。为了在自注意力计算中绝对压制不可见关节点的贡献,模型将对数可见性偏置 \(B_{\text{vis}} = \log(vis + \varepsilon)\) 广播注入到注意力得分矩阵中:

\[\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^\top}{\sqrt{d}} + M + B_{\text{vis}}\right)V\]

通过这种对数加性偏置,处于不可见状态的关节点在注意力机制中 logits 会被拉至极负值,经 softmax 后权重归零,完全切断信息流向超边的途径。完成注意力聚合后,模型直接截取前 \(K_v\) 个更新后的虚拟超边表征 \(F_e\),并通过软关联矩阵加权投影回各关节点空间 \(F^{(t)}_j = H_{\text{soft}} F^{(t)}_e\),实现了“可见节点聚合至超边 \(\rightarrow\) 超边高阶协同融合 \(\rightarrow\) 全身关节点特征增强与填补”的闭环。

3. 多重超图正则化目标:杜绝分配退化与表征坍缩

数据驱动的动态超图容易陷入退化解——例如所有关节点均坍缩绑定到同一个超边上,或者所有虚拟超边学到高度同质化的表征。为此,模型在标准分类交叉熵损失 \(L_{ce}\) 之外,联合提出了三套针对性的辅助约束: - 超边多样性损失(\(L_{\text{pool}}\)):对超边词表向量进行 \(L_2\) 归一化并计算 Gram 矩阵 \(G = \tilde{P}\tilde{P}^\top \in \mathbb{R}^{K_v \times K_v}\),通过惩罚非对角线元素的平方和迫使虚拟超边相互正交,消除冗余特征通道: $\(L_{\text{pool}} = \frac{\|G - I\|_F^2}{K_v(K_v - 1)}\)$ - 分配均衡正则化(\(L_{\text{assign}}\)):对软关联矩阵沿关节点维度求和得到各超边的分配概率分布 \(p\)。损失包含两项:一是批次级平衡项 \(L_{\text{balance}}\),惩罚批次均值 \(\bar{p}\) 偏离均匀分布 \(u\) 的程度;二是样本级最大截断铰链损失 \(L_{\text{hinge}}\),限制单个超边的最大承载概率不超过阈值 \(\tau\),两项加权构成 \(L_{\text{assign}} = w_{\text{balance}}L_{\text{balance}} + w_{\text{hinge}}L_{\text{hinge}}\),有效阻断了“单一超边赢家通吃”的退化模式。 - 类中心聚类损失(\(L_{\text{cluster}}\)):将每个样本的软关联矩阵展平并投影为嵌入向量 \(z_n\),拉近同类样本超图拓扑到可学习类中心 \(c_k\)(针对时序 CutMix 线性插值),同时利用边界铰链损失推远不同类别的中心,保证同类动作具有相似的身体协同超图拓扑结构。

损失函数 / 训练策略

网络的整体联合优化损失定义为:

\[L_{\text{total}} = L_{\text{mix-ce}} + \alpha L_{\text{pool}} + \beta L_{\text{assign}} + \delta L_{\text{cluster}}\]

训练策略上,针对受限视场下的鲁棒学习设计了课程学习(Curriculum Learning)与时序 CutMix(Temporal CutMix): - 课程学习:训练初始阶段(第 1 个 epoch),骨骼可见度比例保持在 95%~100% 的几乎完全可见状态;随着 epoch 递增,模型逐步缩减可见 FoV 窗口,直到第 70 个 epoch 时平滑过渡到 20%~80% 的高难度受限视场,使模型在掌握基础动作模式后再攻坚局部极端情况。 - 时序 CutMix:以 0.3 的概率在样本对之间沿时序维度进行切段拼接,混合损失按帧长加权 \(L_{\text{mix}} = \frac{t}{T}L_a + \frac{T-t}{T}L_b\),强迫网络利用断续时序与局部姿态捕捉时空连续性。

实验关键数据

主实验

论文在 NTU RGB+D 60 和 NTU RGB+D 120 两个基准上,构建了以头部(Head, Joint 3)、胸椎(Spine, Joint 20)、脊柱基底(Base of Spine, Joint 0)为视场中心的三种受限视场场景,并划分为 Easy(约 75% 关节点可见)、Medium(约 50% 可见)、Hard(仅约 25% 可见)三种难度级别。所有对比方法均采用标准的 4-stream 集成策略。

下表展示了在 NTU RGB+D 60 上各方法在不同 FoV 中心与难度下的识别准确率对比:

FoV 中心 评估协议 难度划分 PartialVisGraph (本文) Hyper-GCN (ICCV 2025) Hyperformer (2022) FR-Head (CVPR 2023) 性能增益
Head (3) X-Sub Easy (%) 90.9 85.4 84.5 83.2 +5.5%
X-Sub Medium (%) 88.5 65.9 64.3 57.3 +22.6%
X-Sub Hard (%) 79.2 31.6 29.4 26.5 +47.6%
X-View Hard (%) 84.5 34.4 32.9 25.7 +50.1%
Spine (20) X-Sub Easy (%) 90.6 82.1 82.1 80.6 +8.5%
X-Sub Medium (%) 87.1 58.5 56.7 51.3 +28.6%
X-Sub Hard (%) 77.7 24.1 23.7 21.7 +53.6%
X-View Hard (%) 83.2 27.8 27.2 20.5 +55.4%
Base of Spine (0) X-Sub Easy (%) 89.2 65.1 68.8 61.9 +20.4%
X-Sub Medium (%) 83.8 34.1 40.0 33.8 +43.8%
X-Sub Hard (%) 71.4 7.3 10.8 9.0 +60.6%
X-View Hard (%) 76.5 7.7 9.5 7.2 +67.0%

在规模更大、动作更复杂的 NTU RGB+D 120 上,当视场中心为 Base of Spine、难度为 Hard 时,现有先进方法的准确率全线溃缩至 1.6%~4.7%,而 PartialVisGraph 在 X-Sub 和 X-Set 上分别保持了 66.7% 和 67.4% 的高准确度,相较次优方法实现了高达 +62.0% / +64.0% 的领先优势(最高单项对比增益达 68.8%)。

此外,在传统的完整视场(Full FoV)基准下,PartialVisGraph 同样展现出了极强的高阶建模能力:

模型 会议 / 年份 参数量 (M) 计算量 (GFLOPs) NTU 60 X-Sub (%) NTU 60 X-View (%) NTU 120 X-Sub (%) NTU 120 X-Set (%)
CTR-GCN ICCV 2021 1.5 1.97 92.4 96.4 88.9 90.6
FR-Head CVPR 2023 2.0 – 92.8 96.8 89.5 90.9
HD-GCN ICCV 2023 1.7 1.77 93.0 97.0 89.8 91.2
SkateFormer ECCV 2024 2.0 3.62 93.5 97.8 89.8 91.4
ProtoGCN CVPR 2025 – – 93.5 97.5 90.4 91.9
Hyper-GCN ICCV 2025 2.3 2.88 93.7 97.8 90.9 92.0
PartialVisGraph (本文) ECCV 2026 4.0 2.90 93.8 97.6 91.0 92.3

消融实验

消融实验均基于单关节(Joint)模态进行评估。下表分别列出在全视场(Full FoV)和受限视场(Constrained FoV,三级难度平均)下各模块剥离带来的性能影响:

配置 全视场准确率 (Full FoV, %) 受限视场平均准确率 (Constrained FoV, %) 说明
PartialVisGraph (完整模型) 92.0 78.8 完整模型配置
w/o \(L_{\text{pool}}\) 91.8 (-0.2) – 移除超边多样性正交损失,超边表征趋于冗余
w/o \(L_{\text{assign}}\) & \(L_{\text{cluster}}\) 91.2 (-0.8) – 移除分配与类中心正则,超图坍缩至单条超边
w/o Temporal CutMix 91.0 (-1.0) – 去除时序样本拼接增强,泛化能力明显下降
w/o \(B_{\text{vis}}\) (可见性先验) – 78.4 (-0.4) 取消对数可见性门控,受限视场下不可见噪声回流
w/o 课程学习 (Curriculum Learning) – 78.4 (-0.4) 直接进行全难度随机混合训练,早期训练不稳定

关键发现

  • 基线模型在严苛视场下灾难性崩溃:在 Hard 难度(仅 25% 关节点可见)下,无论 GCN(HD-GCN)还是先前的超图模型(Hyper-GCN、Hyperformer),准确率几乎全线骤降至 7%~34%。其根本原因在于这些方法缺乏可见性门控与防坍缩高阶聚合机制,不可见区域的补零或伪特征被强行当作正常关节点融入图卷积,产生毁灭性的噪声干扰。
  • 正则化项对超图拓扑结构的不可替代性:消融与可视化表明,若去掉 \(L_{\text{assign}}\),模型学到的软关联矩阵会直接退化为单一超边囊括全部关节点;引入正则化后,模型能够自发地将关节点划分为高层语义协调单元(如“双腿+脊柱”负责下肢姿态控制,“双臂”负责平衡调节)。
  • 可见性先验的抗噪屏障作用:对数可见性偏置 \(B_{\text{vis}}\) 在受限视场下提供了稳固的 0.4% 增益,它从算子底层直接把不可见节点的注意力权重清零,确保仅利用视野内可靠的关节点构建超图并推断全身动作。

亮点与洞察

  • 开辟具身受限视场这一高价值实用赛道:指出了现有学术界过分假设“整身骨骼无缝可见”的脱节缺陷,为巡检机器狗、头戴式 AR/VR、微型无人机等真实传感视角提供了强鲁棒的技术方案。
  • 设计了极其优雅的虚拟超边软投影闭环:通过可学习虚拟词表与 sparsemax 生成自适应超图,并用矩阵连乘实现“关节点 \(\rightarrow\) 超边特征汇聚 \(\rightarrow\) 关节点特征重构”,既避免了构造超图的高昂计算开销,又天然具备全局拓扑推理能力。
  • 对数可见性门控的跨模态适配性:利用 \(\log(vis + \varepsilon)\) 作为注意力 Bias 阻断信息流,该设计轻量、即插即用且数学性质严密,能够极为自然地推广至自动驾驶激光雷达遮挡、机器人手部遮挡等其他感知任务中。

局限与展望

  • 依赖给定的可见性掩码先验:本文设定假设关节点可见性二值标签 \(vis\) 由前端传感器或位姿估计器直接提供;但在极其昏暗或严重杂乱的真实野外环境中,位姿检测器自身输出的置信度可能不准,噪声掩码下的抗扰动能力仍待检验。
  • 超图参数量略有上升:相较于轻量 GCN(如 CTR-GCN 的 1.5M),PartialVisGraph 引入了 Transformer 交互层与正则化超边,参数量上升至 4.0M,在超低算力边缘微控制器上的部署需进一步轻量化剪枝。
  • 未来方向:探索结合生成式先验(如骨骼扩散模型),在受限视场下不仅做到隐式判别,还能显式推断并补全视野外丢失肢体的动态轨迹。

相关工作与启发

  • vs Hyperformer [Zhou et al., 2022] & Hyper-GCN [Zhou et al., ICCV 2025]:现有超图方法仅面向全视角骨骼设计,且超图构建存在硬性约束(如 Hyperformer 强制每个关节点只从属于单条超边,Hyper-GCN 限制超边数等于关节点数)。PartialVisGraph 通过解耦的虚拟超边池和连续 sparsemax 实现了非受限的高阶拓扑建模,并引入可见性门控,在 Hard 视场受限下准确率从 ~30% 提升至近 80%。
  • vs 遮挡动作识别方法 [Chen et al., ACM MM 2023]:传统遮挡研究主要针对随机关节点丢弃(如传感器噪点导致的点状丢失),而受限视场(FoV)具有强烈的空间局部连续截断特性(如整个下半身完全移出画框)。PartialVisGraph 的视场中心与窗口难度基准为真实空间视场截断提供了首个严格规范。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次形式化定义受限视场骨骼动作识别任务,提出基于虚拟超边的软关联矩阵与可见性偏置机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [详尽构建了 3 种 FoV 中心、3 种难度级别以及全视场基准,在大规模 NTU 60/120 上全方位超越 SOTA]
  • 写作质量: ⭐⭐⭐⭐⭐ [叙述条理清晰,公式推导严谨,对超图退化机理与消融分析极其透彻]
  • 价值: ⭐⭐⭐⭐⭐ [直击具身智能、服务机器人与穿戴设备在实际部署中的核心痛点,实用价值与落地前景巨大]