Remembering Across Blocks: Topology-Conditioned Block-Progressive Memory for Skeleton-Based Action Recognition¶
会议: ECCV 2026
论文: ECCV 原文
领域: 视频理解
关键词: 骨骼动作识别、图卷积网络、块递进记忆、过平滑缓解、拓扑重构损失
一句话总结¶
本文针对骨架图卷积网络在层级堆叠时因反复一阶邻域聚合导致的过平滑与早期细粒度时空线索衰减痛点,提出一种沿 GCN 块轴递进更新的拓扑条件记忆模块,通过自监督拓扑重构损失提取未被解释的“惊奇”信息,在训练期重塑主干表征,实现了在推理期完全脱离记忆模块(Mem-free)即可显著超越 SOTA 的优异表现。
研究背景与动机¶
基于人体骨骼序列的动作识别(Skeleton-based Human Action Recognition)直接利用关节点坐标序列对人体运动模式进行建模。相比于易受背景杂乱、光照剧变和衣着纹理干扰的 RGB 视频,骨骼数据具有轻量紧凑、对环境变化鲁棒以及天然保护隐私等优势,被广泛应用于智能监控、人机交互、虚拟现实与具身机器人等领域。该任务的主流研究高度依赖时空图卷积网络(ST-GCN 及各类变体),通过将关节点作为图节点、人体骨骼连通性作为图边缘,利用图结构的归纳偏置实现局部运动的结构化聚合。
为了捕获远距离关节间的协同依赖与长时程动态,经典 GCN 必须堆叠多层时空图卷积块,依赖反复的一阶单跳邻域消息传递实现长程信息的逐层接力;即使近年引入动态拓扑学习的方法(如 CTR-GCN、BlockGCN、ProtoGCN)能够按样本自适应调整关联权重,其核心运算仍然无法跳出逐块反复聚合的基本范式。这种多层反复聚合引发了两个严重的表征退化缺陷:一方面,深层节点特征不可避免地趋向同质化(即图神经网络中普遍存在的过平滑问题),关节间的特征差异性被严重抹平;另一方面,浅层图卷积块所捕获的高分辨率局部空间构型和短时程细粒度关键动态,在反复的特征混合与下采样中逐渐被稀释淡化,最终分类表征未能充分利用早期块所孕育的判别性线索。
受自然语言处理领域长序列神经记忆(如 Titans 沿时间轴借助惊奇信号选择性记忆历史上下文)的启发,本文转换了记忆展开的维度——不沿时间序列轴记忆,而是沿着 GCN 的“块层级轴”(Block Axis)构建跨块记忆机制。核心 idea:将各块学习到的样本特定图拓扑作为查询键,以自监督拓扑重构误差量化“未被前序记忆解释的惊奇分量”,沿 GCN 块递进轴自适应积累并补充浅层细粒度时空线索,利用内循环动态记忆在训练期反向重塑主干网络表征,使主干在推理期无需挂载记忆模块即可保持高判别性。
方法详解¶
整体框架¶
整个网络由经典的深层图卷积主干(L 个串联的 ST-GCN 块)、样本特异性拓扑条件块递进记忆模块(Memory Module)以及分类器头组成。在骨架序列输入模型后,各 GCN 块依次提取时空特征并动态生成对应的空间拓扑矩阵。记忆模块与 GCN 主干并行推进,在内循环(Inner Loop)中以当前块的拓扑矩阵为 Query 预测当前块特征,计算重构误差以提取新增的“惊奇”线索并更新记忆状态;在最末层,通过门控机制将记忆读出向量与主干最深层特征融合后送入分类器。在外部循环(Outer Loop)中,主干网络、分类器以及记忆更新超网络参数共同接受动作分类交叉熵损失的梯度监督,进而将细粒度特征保留能力内化至主干权重中。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["骨架序列输入<br/>(N 关节 × T 帧 × C 坐标)"] --> GCN["GCN 主干块 (l=1...L)<br/>动态学习块拓扑 A 与时空特征 H"]
GCN --> READ["拓扑条件记忆读取<br/>以拓扑 A 为查询重构当前块特征"]
READ --> SURPRISE["惊奇度量与内循环更新<br/>计算重构误差驱动动量记忆状态更新"]
SURPRISE --> FUSION["门控记忆特征融合<br/>末层特征与最终记忆读出自适应融合"]
FUSION --> CLS["动作分类预测<br/>外循环优化反向塑造主干网络表征"]
关键设计¶
1. 记忆状态双矩阵参数化与拓扑条件读取:构建基于图邻接拓扑的联想查询机制
为在网络层级推进过程中精确捕捉不同块对人体运动结构的不同关注点,模块将记忆状态参数化为编码键矩阵 \(M_{\text{key}}^{(l)} \in \mathbb{R}^{N^2 \times D}\) 与解码值矩阵 \(M_{\text{val}}^{(l)} \in \mathbb{R}^{D \times NT}\)。在第 \(l\) 个 GCN 块,将当前块学习到的空间邻接张量 \(A^{(l)} \in \mathbb{R}^{N \times N \times C^{(l)}}\) 展平为拓扑查询矩阵 \(\tilde{A}^{(l)} \in \mathbb{R}^{N^2 \times C^{(l)}}\)。记忆读取操作通过双矩阵乘法重构当前块的时空特征预测值:
该设计使得拓扑查询 \(\tilde{A}^{(l)}\) 首先在键矩阵中激活对应的隐藏特征成分,再由值矩阵投影回 \(N \times T\) 个时空节点位置,将关节点图拓扑这一“关系签名”作为提取记忆中时空先验的索引。
2. 惊奇驱动的内循环自监督更新:捕获未被前序记忆解释的新颖判别线索
如果前一阶段累积的记忆状态 \(M^{(l-1)}\) 配合当前块拓扑能够极好地重构当前特征 \(H^{(l)}\),说明当前块并未产生超越历史表征的全新信息;反之,若重构误差显著,则意味着当前块涌现出了早期尚未形成的崭新判别性运动线索。因此,内循环定义自监督重构损失作为“惊奇”度量:
通过计算 \(\mathcal{L}_{\text{mem}}^{(l)}\) 关于前序记忆参数 \(M^{(l-1)}\) 的重构梯度 \(\nabla_{M^{(l-1)}} \mathcal{L}_{\text{mem}}^{(l)}\),动态指导记忆状态的修正方向,确保记忆系统聚焦于沿网络深度方向新产生的高频互补信息。
3. 动量惊奇累积与自适应遗忘门控:消除高频噪声并维持跨层记忆稳定性
单步直接沿梯度覆写记忆极易受单层特定高频特征或批次噪声干扰,削弱对后续深层特征的兼顾能力。为此引入动量惊奇张量 \(S^{(l)}\) 与自适应门控机制,从当前块特征全局均值池化向量 \(h^{(l)} = \text{GAP}(H^{(l)})\) 出发,利用全连接层自适应预测遗忘门控 \(\alpha^{(l)}\)、状态衰减因子 \(\eta^{(l)}\) 和动量步长因子 \(\theta^{(l)}\):
其中 \(\alpha^{(l)}, \eta^{(l)}, \theta^{(l)} \in [0, 1]\) 均为样本和块自适应的标量调节门。该机制在平滑更新梯度的同时自适应遗忘过时的浅层细节,使多层时空特征的累积过程兼具稳定性与灵敏度。
4. 门控表征融合与训练期表征重塑:兼顾即插即用推理与低开销部署
在最末层 \(L\),记忆模块输出最终读取表征 \(O^{(L)} = \text{Read}(A^{(L)}; M^{(L)})\),与 GCN 最后一层骨干特征 \(H^{(L)}\) 经通道门控向量 \(g = \sigma(O^{(L)} w_1 + H^{(L)} w_2 + b)\) 融合为综合特征 \(Z = g \odot O^{(L)} + (1-g) \odot H^{(L)}\),送入全局池化与分类层。在外循环基于动作标签优化全网参数时,重构损失 \(\mathcal{L}_{\text{mem}}\) 诱导的元梯度能够将反向传播的关注度有效转移至浅层和中层块(显著提升各块梯度的信息熵),促使主干网络自身学会保留细粒度与多样化表征。因此,在部署阶段,模型不仅支持保留记忆更新的 Mem-enabled 模式,更支持直接关闭记忆模块、仅使用主干前向传播的 Mem-free 模式,以完全零额外参数和计算开销获得显著的精度增益。
损失函数 / 训练策略¶
系统采用内-外双循环解耦的优化策略: 1. 内循环(Inner Loop):针对单个样本,在各块前向传播时仅依靠无监督重构损失 \(\mathcal{L}_{\text{mem}}^{(l)}\) 在线更新临时变量 \(M^{(l)}\) 和 \(S^{(l)}\),无需标签参与; 2. 外循环(Outer Loop):在批次前向结束后,计算最终分类交叉熵损失 \(\mathcal{L}_{\text{cls}}\),联合优化 GCN 主干、动作分类头、初始记忆矩阵 \(M^{(0)}\)、门控生成网络 \(\{ \text{FC}_{\alpha}, \text{FC}_{\eta}, \text{FC}_{\theta} \}\) 以及融合门参数 \((w_1, w_2, b)\); 3. 优化参数:采用 SGD 优化器配合 Nesterov 动量 0.9,权重衰减为 \(5 \times 10^{-4}\),初始学习率 0.05 配合余弦退火策略训练 150 轮。对记忆门控全连接层施加 \(5 \times 10^{-5}\) 权重衰减与阈值为 1.0 的梯度范数裁剪以保障训练稳定性。
实验关键数据¶
主实验¶
评估覆盖 NTU RGB+D(NTU-60)、NTU RGB+D 120(NTU-120)及 Kinetics-Skeleton 三大标准骨架动作识别基准,并分别在 2 流(E2)、4 流(E4)和 6 流(E6)多流集成设置下与当前 SOTA 进行对比。
| 数据集 / 评估子集 | 指标 | 本文 (Mem-free) | 本文 (Mem-enabled) | 之前 SOTA (ProtoGCN) | 提升幅度 (Mem-enabled) |
|---|---|---|---|---|---|
| NTU-60 X-Sub (E2 / E4 / E6) | Top-1 (%) | 93.3 / 93.7 / 93.9 | 93.5 / 93.8 / 94.0 | 93.0 / 93.5 / 93.8 | +0.5 / +0.3 / +0.2 |
| NTU-60 X-View (E2 / E4 / E6) | Top-1 (%) | 97.3 / 97.7 / 97.9 | 97.3 / 97.7 / 97.9 | 97.2 / 97.5 / 97.8 | +0.1 / +0.2 / +0.1 |
| NTU-120 X-Sub (E2 / E4 / E6) | Top-1 (%) | 90.0 / 90.7 / 91.0 | 90.0 / 90.7 / 91.1 | 89.7 / 90.4 / 90.9 | +0.3 / +0.3 / +0.2 |
| NTU-120 X-Set (E2 / E4 / E6) | Top-1 (%) | 91.5 / 92.1 / 92.4 | 91.5 / 92.1 / 92.4 | 91.2 / 91.9 / 92.2 | +0.3 / +0.2 / +0.2 |
| Kinetics-Skeleton (Top-1 E2/E4/E6) | Top-1 (%) | 50.9 / 52.8 / 53.2 | 51.1 / 52.9 / 53.4 | 49.9 / 51.3 / 51.9 | +1.2 / +1.6 / +1.5 |
| Kinetics-Skeleton (Top-5 E2/E4/E6) | Top-5 (%) | 74.3 / 75.9 / 76.4 | 74.3 / 75.9 / 76.4 | 74.0 / 75.1 / 75.6 | +0.3 / +0.8 / +0.8 |
在单模态对比中(NTU-60 X-Sub 关节模态 J / 骨骼模态 B),本文 Mem-enabled 分别达到 91.9% 与 92.3%,优于 ProtoGCN 的 91.5% 与 92.0%;在 NTU-120 X-Sub 上达到 86.5%(J)与 88.9%(B),持续领跑骨架 GCN 性能榜单。
消融实验¶
下表展示了记忆组件各核心环节在 NTU-60 X-Sub 单关节模态(J)下的消融实验结果(基线模型精度为 91.3%):
| 配置 | 记忆模块 | 融合门控 | 遗忘因数 \(\alpha\) | 衰减因子 \(\eta\) | 动量因子 \(\theta\) | Top-1 准确率 (%) | 说明 |
|---|---|---|---|---|---|---|---|
| 基线模型 (Baseline) | × | × | × | × | × | 91.3 | 标准动态拓扑 GCN 主干 |
| 朴素惊奇更新 (w/o all components) | ✓ | × | × | × | × | 89.8 | 缺乏平滑滤波导致高频噪声过拟合 (-1.5%) |
| 去除遗忘因子 (w/o \(\alpha\)) | ✓ | ✓ | × | ✓ | ✓ | 90.4 | 无法清除早期过时状态导致容量饱和 (-0.9%) |
| 去除动量因子 (w/o \(\theta\)) | ✓ | ✓ | ✓ | ✓ | × | 91.3 | 步长无法自适应调整,退化至基线水准 |
| 去除衰减因子 (w/o \(\eta\)) | ✓ | ✓ | ✓ | × | ✓ | 91.4 | 历史动量无衰减累加引起梯度爆炸震荡 |
| 去除门控融合 (w/o gate) | ✓ | × | ✓ | ✓ | ✓ | 91.5 | 缺乏通道级选择性融合导致表达受限 |
| 完整模型 (Ours) | ✓ | ✓ | ✓ | ✓ | ✓ | 91.9 | 各组件协同达到最佳性能 (+0.6%) |
此外,在训练与推理开销对比中,Mem-free 模式在推理时保持与 Baseline 完全一致的吞吐量(70.2 samples/s)、参数量(3.95M)和计算量(7.48 GFLOPs),仅在训练阶段耗时由 9 小时微增至 12 小时;Mem-enabled 模式参数量为 4.36M(仅增 0.41M),FLOPs 增至 7.85 GFLOPs,提供了面向性能极限场景的额外选择。
关键发现¶
- 朴素记忆更新会导致严重的噪声过拟合:若仅采用原始重建梯度直接更新记忆状态,精度反而较基线急剧下跌 1.5%(89.8% vs 91.3%)。这证明未经过滤的高频局部变异会被误当作关键运动线索写入记忆,而引入自适应遗忘门 \(\alpha\) 与动量平滑因子是保证记忆有效性的决定性设计。
- 训练期记忆成功重塑了主干网络的特征敏感度:通过计算各块特征对于分类损失的梯度熵(Block-wise Feature Sensitivity Entropy),本文方法显著提高了各层梯度的均匀性,扭转了基线模型仅依赖末期几层大梯度的偏向,促使浅层与中层拓扑矩阵获得更加充实的梯度反向传播。
- 节点方差验证了过平滑现象的有效缓解:在测试集上跨关节点的特征范数方差统计中,本文在第 10 阶段输出处的关节点间特征方差相比基线高出数倍,定性相似度矩阵亦展现出清晰的关节点差异边界,确证了节点同质化被有效遏制。
亮点与洞察¶
- 将时序记忆维度重构为网络块递进轴:打破了序列模型中记忆仅用于延长时间跨度的思维定势,巧妙地将长上下文神经记忆机制平移至深层网络“块递进轴”,专门针对图神经网络逐层聚合的过平滑瓶颈开出良方。
- 自监督“惊奇度量”充当无标签信息过滤器:利用当前拓扑重构当前特征的残差作为自监督学习信号,自然界定了何为“当前层新涌现的判别线索”,无需额外的层级语义标注即可完成高价值特征的自主提炼。
- “训练期辅导、测试期脱挂”的高效落地模式:在训练期通过元梯度优化重塑了主干表征流向,使得测试时即便完全剥离记忆模块(Mem-free),主干网络依然内化了抗过平滑的判别能力,具备极高的工程落地与边缘设备部署价值。
局限与展望¶
- 作者承认的局限:在训练阶段需要沿块前向计算拓扑重构损失及其一阶梯度并维护动量状态,使得单次训练迭代开销较常规端到端 GCN 略有增加(训练时间从 9h 增加到 12h)。
- 潜在不足与边界:当前记忆键值矩阵的维度大小 \(D\)(默认 384)和空间展平方式固定假设了关节数 \(N\) 严格一致,当面对多尺度骨架抽取(如变动关节点拓扑或多主体人际互动密集交互)时,展平拓扑查询的维度对齐策略灵活性有待提升。
- 改进方向:可进一步探索轻量化的隐空间投影算子以完全避免 \(N^2\) 级别的矩阵展开,或将这种块递进跨层记忆机制迁移扩展至超深层 3D 点云卷积与分子图神经网络表征学习中。
相关工作与启发¶
- vs CTR-GCN / ProtoGCN: CTR-GCN 和 ProtoGCN 聚焦于在单块内部设计更精细的通道拓扑增强或原型对比,但骨架表征在跨块传播时依然无法摆脱反复聚合造成的早期线索衰减与节点同质化;本文与它们并不互斥,而是通过跨块记忆模块直接互补,在 ProtoGCN 强基线上进一步带来稳定提升。
- vs Titans: Titans 探索了在语言序列模型中沿时间步长维度的在线惊奇记忆更新;本文将其泛化为图卷积网络的“层级拓扑记忆”,将 Query 从自注意力特征替换为显式骨架图拓扑,证明了神经记忆在消除图过平滑问题上的强大潜力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次提出沿 GCN 块递进轴的拓扑条件自监督记忆,概念迁移极具启发性]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖三大权威数据集、单模态与多流集成、完备消融及深层过平滑方差量化分析]
- 写作质量: ⭐⭐⭐⭐⭐ [方法推导严谨流畅,动机痛点、内循环更新与推理分流论述高度清晰自洽]
- 价值: ⭐⭐⭐⭐⭐ [Mem-free 零推理开销模式实用性极强,为图神经网络过平滑治理提供了全新设计范式]