跳转至

Path-JEPA: Path Signature Based Predictive Learning for Skeleton Action Recognition

会议: ECCV 2026
论文: ECCV 原文
领域: 视频理解
关键词: 骨骼动作识别, 自监督学习, 路径签名, JEPA, 连续时间几何

一句话总结

Path-JEPA 首次将粗糙路径理论中的路径签名引入自监督骨骼动作识别,通过多尺度空间路径(关节点、骨骼边、运动链)与全局-局部时间视角的签名词元构建预测目标,配合消除泄漏的签名增强遮蔽与 JEPA 架构,在下游分类与变帧率扰动下均取得领先性能。

研究背景与动机

基于骨骼序列的人体动作识别在人机交互、智能监控以及行为分析等场景中扮演着关键角色。骨骼数据天然具备紧凑、注重隐私且保留人体运动学拓扑的优势。在自监督表征学习领域,骨骼动作识别已逐渐从早期的对比学习范式转向掩码预测学习范式。早期工作如 SkeletonMAE 和 MAMP 采用类似 MAE 的坐标重建机制,强制模型在像素级或坐标级空间恢复被遮蔽的关节点三维坐标;然而这类纯信号级重建任务极其容易受到传感器高频噪声和微小抖动的干扰,且往往使网络过度聚焦于低级几何细节。随后的 S-JEPA 与 GFP 等基于联合嵌入预测架构(JEPA)的方法进一步推动了表征空间的预测,改由学生网络在特征潜空间预测教师网络的高层表征,显著提高了高级语义建模能力。

尽管特征空间预测取得了长足进步,现有方法在预测目标的本质定义上仍面临着深层瓶颈。一方面,现有 JEPA 框架的输入与目标依然是基于孤立关节点坐标衍生的潜特征,忽略了人体运动本质上是由相连关节及肢体链条高度协同产生的显式时空关系几何;这迫使编码器在缺乏先验诱导的情况下隐式推断解剖学运动模式。另一方面,真实人类运动具有严格的连续时间物理属性,但现有算法均受制于离散采样的时间帧;一旦遇到测试环境的帧率波动、不规则掉帧或时序重采样,基于固定离散时间步构建的表征就会发生严重退化。

面对上述两重制约,引入一种兼具空间协同几何建模能力与连续时间重参数化不变性的数学工具成为破局的关键。源自粗糙路径理论(rough path theory)的路径签名(path signature)通过连续轨迹的迭代积分,能够以无坐标依赖的形式完整保留轨迹的几何外形,天然具备对时间重参数化的不变性;将其推广至关节点、骨骼边和运动学长链时,又能同时捕获位移、Lévy 面积以及高阶时空耦合。本文的核心 idea 是:将骨骼序列插值提升为连续空间轨迹并提取关节点-骨骼边-解剖链三级多尺度路径签名,以此作为 JEPA 框架的自监督预测目标,并提出签名依赖感知遮蔽机制阻断跨路径泄漏,从根本上建立几何扎根且抗时间离散扰动的连续运动表征。

方法详解

整体框架

Path-JEPA 的整体流程涵盖轨迹连续提升与签名词元提取、签名增强遮蔽机制以及自监督联合嵌入预测三部分。对于输入的离散骨骼序列,系统首先通过分段线性插值与 lead-lag 延迟增广,构建出覆盖关节点、相邻关节骨骼边、多关节运动链的三层级连续时间路径,并在每个时间窗口中拼接全局与局部对数签名以形成多尺度签名词元。在自监督训练阶段,基于关节运动幅度和解剖学子树生成的掩码会严格广播至所有依赖该关节的签名词元;仅有可见词元进入上下文学生编码器,轻量化预测器通过交叉注意力恢复被遮蔽词元的特征,并与观察完整序列的 EMA 教师编码器输出计算余弦相似度损失。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入骨骼序列 X ∈ R^(T×J×3)"] --> B["连续路径提升与签名提取<br/>分段线性插值 + Lead-Lag 增广"]
    B --> C["多尺度关系签名词元化<br/>关节点 / 骨骼边 / 运动链 × 全局-局部视图"]
    C --> D["签名增强掩码生成<br/>运动感知种子采样 + 运动学子树遮蔽广播"]
    D -->|可见上下文词元| E["学生上下文编码器 f_θ"]
    D -->|完整未遮蔽词元序列| F["EMA 教师编码器 f_bar_θ"]
    E --> G["轻量化预测器 g_ϕ<br/>可学习查询交叉注意力重建"]
    F -->|提取被遮蔽位置目标| H["中心化教师目标特征 Z*_I"]
    G --> I["余弦距离损失 L_JEPA 优化"]
    H --> I

关键设计

1. 连续路径提升与对数签名表示:克服时间离散化敏感

真实人体动作是物理上的连续平滑流形,离散采样的骨骼帧序列容易引入采样频率依赖。为了建立时间连续的运动表征,方法首先将每个关节点的离散三维轨迹 \(X_j \in \mathbb{R}^{T \times 3}\) 经由分段线性插值提升为连续时间路径 \(\tilde{X}_j: [0, \tau] \to \mathbb{R}^3\)。为了使连续路径能够显式感知瞬时运动速度与时序先后顺序,模型对路径引入了 lead-lag 变换,通过将原始路径与其时间滞后副本拼接构成增广路径: $\(\tilde{X}_j^{\text{LL}}(t) = [\tilde{X}_j(t), \tilde{X}_j(t-\delta)]^\top \in \mathbb{R}^6\)$ 两路信号的差值天然表征了速度维度的导数信息。随后,针对任意时间区间 \([s, t]\) 内的轨迹计算截断至 \(n\) 阶的路径签名 \(S(\mathbf{x})_{s,t}^{\le n}\)。其中 1 阶项表示区间内的整体位移差 \(S^{(1)}_i = x_i(t) - x_i(s)\),2 阶项对应二重迭代积分 \(S^{(2)}_{ij} = \int_s^t \int_s^{u_1} dx_i dx_j\),非对称项 \(i \neq j\) 则精准刻画了运动在二维投影平面扫过的 Lévy 签名面积(描述回旋与方向偏转)。为了消除直接展开导致的高维冗余,模型应用基于 Baker-Campbell-Hausdorff 结构的对数签名(log-signature)映射,将 \(d'=6\) 维、截断阶数 \(n=2\) 下原始签名的 43 个系数精简至仅 22 个无冗余基底系数,兼顾了数学充要性与轻量高效性。

2. 多尺度关系签名词元化:融合多层级空间拓扑与双重视角

针对过往方法仅将孤立关节点作为预测单元而丢失运动学协同关系的问题,Path-JEPA 构建了由空间三层级与时间双重视角交叉组成的统一词元集。在空间拓扑层面,设计了三套路径家族: - 关节点路径(Joint Paths, J-PSF):对人体各个关节点独立计算增广签名,保留各关节点自身的局部动态; - 骨骼边路径(Pairwise/Edge Paths, P-PSF):对运动学相连的关节对 \((u, v)\) 计算相对位移轨迹 \(Y_{u,v}(t) = \tilde{X}_v(t) - \tilde{X}_u(t)\),通过相对运动天然滤除了全局躯干平移所带来的干扰; - 解剖运动链路径(Chain Paths, C-PSF):顺次拼接肢体关键链条(如肩 \(\to\)\(\to\) 腕、髋 \(\to\)\(\to\) 踝)的骨骼位移,使高阶复杂协同(如挥臂投掷、跨步屈膝)能够通过高阶积分直接作为整体几何模式被感知。

在时间尺度层面,为了同时捕捉宏观动作趋势与瞬时微动态,序列在不同时间分辨率窗口 \(\omega_{\ell, k} = (t_{\ell, k-1}, t_{\ell, k}]\) 下切分,并将整个动作全程 \([0, T]\) 的全局对数签名与局部窗口内的对数签名向量直接拼接,构成多视角签名词元: $\(m_{p,\ell,k} = \Big[ \log S(\tilde{X}_p^{\text{LL}})_{0, T} \,,\, \log S(\tilde{X}_p^{\text{LL}})_{t_{\ell,k-1}, t_{\ell,k}} \Big] \in \mathbb{R}^{2 D_{\log}}\)$ 最后,所有词元经由对应类型专用的线性投影层映射至统一隐藏维度,并注入融合了时间尺度 \(\ell\) 与骨骼图根节点距离深度 \(d_G(p)\) 的时空结构位置编码。

3. 签名增强遮蔽机制:防止跨路径几何信息泄漏

在 JEPA 预测架构中,如果仅随机遮蔽部分词元,由于骨骼边路径和链式路径是由多个关节点运动联合生成的,未遮蔽的边或链词元极易泄露被遮蔽关节点的运动轨迹,从而使预测任务退化为简单的算术反解。为此,论文提出了严格的签名增强依赖遮蔽策略。首先在原始关节空间依照关节运动加速度与幅度加权采样种子关节点,并向外扩张至该关节所在的整个运动学子树分支,形成具有解剖学连贯性的遮蔽关节集合 \(\mathcal{M}\)。随后,将遮蔽规则严格广播到所有签名词元,定义遮蔽词元索引集: $\(\mathcal{I}(\mathcal{M}) = \{(p, \ell, k) : p \cap \mathcal{M} \neq \emptyset\}\)$ 这意味着:任何包含集合 \(\mathcal{M}\) 内关节点的关节词元、以其为端点的骨骼边词元、以及经过该关节点的肢体链词元,均被强制从上下文学生分支中彻底剔除,且其局域与全局多视角一同被隐藏。这种遮蔽机制强迫网络必须利用未受损的其他身体部位以及上下文运动学约束,从全局推理出缺失肢体的整体几何变化,从机制上杜绝了信息抄袭。

损失函数 / 训练策略

训练框架遵循非对称 JEPA 设定。学生编码器 \(f_\theta\)(6 层标准 Transformer,隐藏层维度 512)仅接收可见词元序列 \(\mathcal{C}\),输出其上下文隐表征。轻量化预测器 \(g_\phi\)(4 层 Transformer)以被遮蔽位置的可学习查询向量 \(Q_\mathcal{I}\) 为目标,通过交叉注意力从学生上下文隐表征中预测被遮蔽位置的高维向量 \(\hat{Z}_\mathcal{I}\)。教师编码器 \(\bar{f}_\theta\) 结构与学生相同但输入包含全部无遮蔽词元序列,提取对应位置的特征 \(Z^*_\mathcal{I} = Z_{\text{full}}[\mathcal{I}]\) 并减去运行均值中心 \(c\)(动量 decay 为 0.9)以防止表征塌陷。预训练通过余弦距离损失进行优化: $\(\mathcal{L}_{\text{JEPA}} = \frac{1}{|\mathcal{I}|} \sum_{i \in \mathcal{I}} \left( 1 - \frac{\hat{\mathbf{z}}_i^\top \mathbf{z}^*_i}{\|\hat{\mathbf{z}}_i\| \, \|\mathbf{z}^*_i\|} \right)\)$ 教师模型参数 \(\bar{\theta}\) 采用动量平滑更新(EMA 动量从 0.996 按余弦退火递增至 1.0)。预训练阶段在 NTU 数据集上执行 300 轮,下游任务中固定教师编码器提取特征用于线性探针或进行端到端微调。

实验关键数据

主实验

在 NTU RGB+D 60、NTU RGB+D 120 以及 PKU-MMD 等主流骨骼动作识别基准上进行了线性探测(Linear Evaluation)和微调(Fine-tuning)评估,全部仅采用关节点三维位置输入(Joint-only)。

表 1:线性探测评估准确率对比(%)(选自原论文 Table 1)

范式 / 方法 输入流 NTU60 X-Sub NTU60 X-View NTU120 X-Sub NTU120 X-Set PKU-MMD Ph-I PKU-MMD Ph-II
对比学习
CrosSCLR [25] J+B+M 77.8 83.4 67.9 66.7 84.9 21.2
AimCLR [18] J+B+M 78.9 83.8 68.2 68.8 87.4 39.5
ActCLR [28] J+B+M 84.3 88.8 74.3 75.7
HiCo [13] J 81.1 88.6 72.8 74.1 89.3 49.4
坐标重建
SkeletonMAE [52] J 74.8 77.7 72.5 73.5 82.8 36.1
MAMP [37] J 84.9 89.1 78.6 79.1 92.2 53.8
特征预测
GFP [48] J 85.9 92.0 79.1 80.3 56.2
S-JEPA [1] J 85.3 89.8 79.6 79.9 92.2 53.5
Path-JEPA (本文) J 87.6 92.9 81.5 81.8 93.4 56.7

表 2:全监督微调与自监督微调准确率对比(%)(选自原论文 Table 2)

训练范式 方法 输入流 NTU60 X-Sub NTU60 X-View NTU120 X-Sub NTU120 X-Set
全监督 ST-GCN [53] J 81.5 88.3 70.7 73.2
2s-AGCN [44] J 88.5 95.1 82.9 84.9
MS-G3D [32] J 91.5 96.2 86.9 88.4
CTR-GCN [9] J 92.6 96.9 88.9 90.8
自监督 SkeletonMAE [52] J 86.6 92.9 76.8 79.1
MotionBERT [58] J 93.0 97.2 84.8 86.4
MAMP [37] J 93.1 97.5 90.0 91.3
MaskCLR [22] J 93.5 97.5 90.5 91.9
GFP [48] J 93.9 97.0 89.6 91.2
S-JEPA [1] J 93.1 97.6 90.3 91.2
Path-JEPA (本文) J 94.4 98.2 90.8 91.9

消融实验

针对帧率扰动鲁棒性、多尺度签名构成以及掩码策略,论文在 NTU60 X-Sub 上进行了详尽的控制变量实验。

表 3:不同输入帧率下的鲁棒性对比(%)(选自原论文 Table 4)

方法 15fps 20fps 30fps (基线) 45fps 60fps 极差 (Max-Min)
SkeletonMAE [52] 69.9 73.2 74.8 71.1 70.3 4.9%
MAMP [37] 81.8 83.5 84.9 82.7 81.2 3.7%
S-JEPA [1] 82.4 82.9 85.3 84.7 84.5 2.9%
Path-JEPA (本文) 87.1 87.5 87.7 87.8 88.1 1.0%

表 4:签名词元化各组成模块贡献消融(选自原论文 Table 6)

全局视角 (Global) 局部视角 (Local) 关节点 (Joint) 骨骼边 (Edge) 运动链 (Chain) 准确率 Acc. (%) 性能说明
\(\checkmark\) \(\checkmark\) 84.4 仅单一全局粗粒度关节描述
\(\checkmark\) \(\checkmark\) 83.3 缺少全序列上下文造成大幅掉点 (-2.5%)
\(\checkmark\) \(\checkmark\) \(\checkmark\) 85.8 引入局部窗口动态 (+1.4%)
\(\checkmark\) \(\checkmark\) \(\checkmark\) \(\checkmark\) 86.4 引入成对相对运动几何 (+0.6%)
\(\checkmark\) \(\checkmark\) \(\checkmark\) \(\checkmark\) \(\checkmark\) 87.6 完整模型:引入长程肢体协同 (+1.2%)

关键发现

  • 签名层级递进增益显著:仅有关节点的全局签名 baseline 为 84.4%,依次叠加局部时间窗口、骨骼相对边以及解剖链后,性能稳步攀升至 87.6%,累计带来 3.2% 的增益;这证明粗糙路径理论能有效分工承载从局部关节点到位移链的高阶运动学关系。
  • 极端低资源半监督优势显著:在仅使用 1% 标签(约 400 条训练样本)的严苛场景下,Path-JEPA 在 NTU60 X-Sub 达到 72.2%,大幅领先 S-JEPA(67.5%)达 4.7 个百分点;这表明几何扎根的签名特征比黑盒潜表征更容易在线性层划分出分类超平面。
  • 时间重采样近乎绝对不变:当输入序列在 15fps 至 60fps 宽幅波动时,S-JEPA 性能波动达 2.9%,SkeletonMAE 波动达 4.9%,而 Path-JEPA 波动仅有 1.0%(87.1% 至 88.1%),实证验证了连续路径积分对时序采样的理论不变性。

亮点与洞察

  • 粗糙路径理论与 JEPA 预测的首次交汇:将原本用于时间序列特征提取的对数签名转化为 JEPA 的结构化潜特征目标,用具有严格数学解析性质的积分不变量取代了纯启发式的坐标或潜特征重构。
  • 防信息泄漏的签名广播遮蔽机制:敏锐地发现了空间图高阶特征在局部掩码下可能发生的“几何短路”泄漏问题,将关节遮蔽扩展为完整的子树切断与多层词元剔除,保证了自监督学习的纯正性。
  • 以纯 Transformer 架构超越复杂图卷积设计:仅使用 6 层简单 Transformer,微调精度在 NTU60 上达到 94.4%(X-Sub)和 98.2%(X-View),在无需构建复杂自适应图卷积核的前提下,超越了 CTR-GCN 和 MS-G3D 等主流 GCN 算法。

局限与展望

  • 签名超参数依赖人工经验启发式预设:当前的截断阶数 \(n=2\)、lead-lag 时间延迟 \(\delta\) 以及时间切片窗口大小均为手动设定,缺乏针对不同速度动作自适应调整阶数与窗口的动态机制。
  • 预计算开销与长序列扩展:尽管签名将整段序列抽象为紧凑词元,但对数签名的分段积分提取仍属于前处理环节;未来若能将连续签名的计算通过张量代数原生嵌入 GPU 算子,可进一步降低端到端延迟。
  • 跨模态扩展受限:目前框架完全立足于三维关节点几何流形,尚未与 RGB 视觉视频流或骨骼文本语义进行多模态融合预训练。

相关工作与启发

  • vs S-JEPA [1]: S-JEPA 在离散关节点上通过上下文预测教师隐空间表征,但其目标本质上缺乏显式的空间几何耦合且对采样率变化脆弱;Path-JEPA 利用路径签名构造了具备时空拓扑且重参数化不变的连续几何目标,NTU60 线性评估提升达 2.3%。
  • vs SkeletonMAE [52] / MAMP [37]: 坐标重建型方法强迫模型恢复每个离散帧的关节点三维位置,任务过于依赖局部细节且易受噪声干扰;Path-JEPA 转向抽象特征预测并提取区间级高阶几何积分,在 15fps 降采样下准确率高出 MAMP 达 5.3%。
  • vs CTR-GCN [9] 等有监督 GCN: GCN 侧重于显式构建节点邻接矩阵以传递消息,而 Path-JEPA 借助相对位移边与链签名直接在词元级完成了高阶几何关系的打包,使标准 Transformer 即可自发捕获复杂的全身运动耦合。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将粗糙路径理论的路径签名引入掩码 JEPA 自监督框架,构建了兼顾几何可解释性与连续时间不变性的预测目标。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖线性评估、微调、半监督数据效率、跨数据集迁移以及宽范围变帧率扰动实验,论据扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学推导严谨清晰,框架设计层层递进,问题动机与实验结果契合度极高。
  • 价值: ⭐⭐⭐⭐⭐ 为骨骼动作识别乃至通用时空多体运动建模提供了将几何积分理论与大模型自监督框架结合的优秀范式。