跳转至

S2Gest: Split-Scan State Space Models for Dynamic Hand Gesture Recognition

会议: ECCV 2026
论文: CVF / Official Poster
代码: https://github.com/Chen-Ke-Fan/S2Gest
领域: 人体理解
关键词: 动态手势识别, 状态空间模型, 双向时序建模, 轻量化网络

一句话总结

针对智能座舱和穿戴设备等资源受限场景,S2Gest结合空间优先嵌入与自适应特征调制,并引入通道切分双向扫描机制(Split-Scan S2-Block),在保持线性复杂度和零额外参数的前提下捕获全局双向手势动态,以亚3M参数量匹敌数十倍体量的大模型并实现超100 clips/s的消费级GPU推理速度。

研究背景与动机

动态手势识别(DHGR)作为人机交互与智能车载系统的核心交互接口,在智能座舱和虚拟现实中扮演着关键角色。由于车载夜间低照度、家庭私密环境等敏感场景对数据隐私与响应延迟的苛刻要求,手势识别算法必须以“常驻监测(always-on)”模式在消费级甚至边缘硬件上本地实时执行。然而,现有的两类主流方案陷入了计算能力与资源消耗的两难境地:重型3D卷积网络与视频Transformer虽然时序建模能力强大,但其密集的显存访问成本(MAC)以及Transformer二次方复杂度和动态KV-Cache开销,使得设备面临发热降频与显存溢出的风险;反之,紧凑轻量级2D卷积网络受限于时序感受野,难以准确解构复杂的手势运动学轨迹与时空演化过程。

这一困境的核心症结在于,离散采样的视频帧流与人体手势物理上平滑连续的运动学规律之间存在内在割裂,而现有轻量架构缺乏在严格显存与算力预算下捕捉长程时空连续性的有效机制。状态空间模型(SSM,如Mamba)凭借其常数级推理显存占用和线性计算复杂度,为连续运动学追踪提供了契机。然而,直接将通用SSM移植到动态手势任务中遭遇了双重结构性阻碍:一是稀疏深度图或噪点RGB输入需要兼具低开销与高表现力的空间先验抽取,二是标准SSM本质上遵循单向因果演化,无法回溯吸收非因果的全局后向手势上下文,而直接复制双向分支又会使内部参数量与显存翻倍。

针对上述瓶颈,本文从连续状态空间演化视角重构动态手势时序建模。核心 idea:通过构建空间优先多尺度主干与自适应上下文调制,并提出通道切分双向扫描机制(Split-Scan S2-Block),在通道维度正反向解耦特征并实现参数中立的全局双向扫描,以低于3M参数实现高鲁棒性连续手势轨迹建模。

方法详解

整体框架

S2Gest采用流式处理架构,对滑动窗口内的 \(T\) 帧连续视频切片进行端到端识别。如图所示,整个系统由三个串联阶段组成:首先,输入视频张量进入共享的视觉前干(Visual Stem),利用空间优先嵌入模块(MS-Block)抑制低级空间冗余并提取鲁棒特征;随后,网络分流为上下文感知双流架构(Context-Aware Dual-Stream),轻量级的上下文流提取全局时空先验序列,并通过自适应特征调制(AFM)模块对高分辨率焦点流实施通道重校准,再经由内容自适应位置编码(CPE)注入动态3D坐标偏置;最后,调制后的时空特征输入级联的S2-Block,利用管状分词器(PIT)将空间网格串行化为局部连续运动管,并借助通道切分双向状态空间引擎捕捉完备的前向触发与后向验证动态,最终由分类头预测手势类别概率。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["连续输入视频帧流<br/>C × T × H × W"] --> B["1. 视觉前干与多尺度空间嵌入<br/>MS-Block 空间优先降维与 Conv-BN 融合"]
    B --> C["2. 上下文感知双流与自适应调制<br/>轻量 Context 流提取先验 + AFM 仿射调制焦点流"]
    C --> D["动态 3D 位置编码 CPE<br/>3×3×3 深度卷积自适应外推序列长度"]
    D --> E["管状分词器 PIT<br/>Euler 视角 Tube-Major 保持空间孔径时序连续"]
    E --> F["3. 通道切分双向扫描 S2-Block<br/>正反向通道解耦 + 零参数开销双向 SSM"]
    F --> G["3D 深度卷积平滑与残差融合<br/>消除管状边界离散效应并聚合轨迹"]
    G --> H["分类头输出手势预测<br/>Gesture Class Probabilities"]

关键设计

1. 空间优先嵌入与MS-Block:在网络浅层压缩空间冗余并降低硬件访存

视频早期特征包含巨大的空间冗余,若直接在此阶段引入昂贵的三维立方卷积(\(k \times k \times k\)),不仅会浪费宝贵的FLOPs预算,更会导致极高的显存访问开销(MAC)。本文在视觉前干中确立了“空间优先(Spatial-First)”压缩策略,构建了基于Inception拓扑的多尺度空间块(MS-Block)。该模块摒弃致密3D卷积,将输入特征同时分流至多个异构轻量分支:包括 \(1 \times 1 \times 1\) 卷积、两个平行的 \(1 \times 3 \times 3\) 空间卷积分支(分别以不同卷积核配置提供丰富感受野),以及一个无参数的 \(3 \times 3 \times 3\) 最大池化(MaxPool)分支以捕获浅层运动初级线索。所有分支的输出在通道维拼接后经线性映射输出:

\[\operatorname{MS-Block}(\mathbf{X}) = \mathcal{H}_{\mathrm{proj}}\left( \operatorname{Concat}_{o \in \mathcal{O}} \mathcal{B}_o(\mathbf{X}) \right)\]

其中算子集 \(\mathcal{O} = \{\text{Conv}_{1\times 1\times 1}, \text{Conv}^{(1)}_{1\times 3\times 3}, \text{Conv}^{(2)}_{1\times 3\times 3}, \text{MaxPool}_{3\times 3\times 3}\}\)。尤为关键的是,该模块中所有的空间卷积与归一化层在部署推理阶段均可进行算子融合(Conv-BN Fusion),在极大提升推理吞吐率的同时,将宝贵的计算预算完整留给深层的动态时序推理。

2. 上下文感知双流与自适应特征调制(AFM):解耦全局背景先验与局部运动聚焦

车载座舱中复杂的光照变化和复杂的动态背景常常干扰手部微小运动的识别。若在全分辨率主干上进行全局注意力,计算成本不可承受。为此,S2Gest引入非对称双流结构:从视觉前干分出极低维的上下文流(Context Stream),通过激进的时空下采样与空间全局平均池化(GAP),以极微小的算力代价提取整体上下文时序表示 \(\mathbf{Z}_{\mathrm{ctx}} \in \mathbb{R}^{D_{\mathrm{ctx}} \times T}\)

随后,自适应特征调制模块(AFM)建立两流之间的语义过滤桥梁。AFM将 \(\mathbf{Z}_{\mathrm{ctx}}\) 经时序全局池化压缩后,通过可学习线性投影动态生成通道级的仿射缩放因子 \(\boldsymbol{\gamma} \in \mathbb{R}^C\) 和平移因子 \(\boldsymbol{\beta} \in \mathbb{R}^C\)

\[\mathbf{F}_{\mathrm{mod}} = \mathrm{AFM}(\mathbf{F}_{\mathrm{focal}}, \mathbf{Z}_{\mathrm{ctx}}) = \boldsymbol{\gamma} \odot \mathbf{F}_{\mathrm{focal}} + \boldsymbol{\beta}\]

与传统直接将全局上下文张量相加或拼接的做法相比,AFM作为自适应软门控语义滤波器,有选择性地重新校准通道响应,在深层时序扫描启动前主动抑制静态背景杂波并增强运动敏感通道。

3. 管状分词器(PIT)与通道切分双向扫描(Split-Scan S2-Block):零参数开销的全局非因果建模

标准序列化方式(如逐帧扫描全空间Token)强行打散了空间邻域,使一维SSM在跨帧跳跃时面临严重的隐状态记忆衰退。PIT改用“管状优先(Tube-Major)”组织形式,将 \(H \times W\) 划分为 \(N\)\(P \times P\) 大小的局部图块,沿时序排列构成连续时空管 \(\mathbf{X}_{\mathrm{tube}} \in \mathbb{R}^{N \times T \times D_{\mathrm{emb}}}\)。从Euler观察视角的角度,SSM在固定的空间孔径内持续观测局部动力学的演进,配合Mamba依赖输入的时钟尺度 \(\Delta(x_t)\),在管状边界自适应重置上下文,确保了管内运动特征的绝对连续。

针对标准因果SSM无法观测后向手势动作的局限,常规双向扩展(如Bi-Mamba)直接复制出整路反向SSM,导致参数量和显存翻倍。S2Gest提出“拆分-变换-合并(Split-Transform-Merge)”拓扑:将通道维度直接均分为前向组 \(\mathbf{U}_{\mathrm{fwd}}\) 和后向组 \(\mathbf{U}_{\mathrm{rev}}\),各占 \(D_{\mathrm{emb}} / 2\) 维度,送入互补的双向扫描分支:

\[\mathbf{H}_{\mathrm{fwd}} = \operatorname{SSM}(\mathbf{U}_{\mathrm{fwd}}), \quad \mathbf{H}_{\mathrm{rev}} = \operatorname{Flip}\left(\operatorname{SSM}\left(\operatorname{Flip}(\mathbf{U}_{\mathrm{rev}})\right)\right)\]
\[\mathbf{H} = \mathcal{F}_{\mathrm{mix}}\left( \operatorname{Norm}\left( \operatorname{Concat}[\mathbf{H}_{\mathrm{fwd}}, \mathbf{H}_{\mathrm{rev}}] \right) \right)\]

由于线性投影参数的二次方缩放性质,通道减半使单分支内部变换开销降为原来的 \(1/4\),双分支相加总计算量仅为全通道单向基线的 \(50\%\)\(2 \times (D/2)^2 = 0.5 D^2\)),后续混合层 \(\mathcal{F}_{\mathrm{mix}}\) 恢复全通道交互。特征可视化证实:前向分支呈现因果触发特性(在手势启动点形成锐利峰值),而后向分支充当反因果验证器(在手势收尾阶段达到峰值),二者分工明确,不仅完全不增加参数,反而充当结构正则化器,避免了特征表示坍缩。扫描后的特征经3D深度卷积进行局部空间滤波平滑,消除离散管状切分引入的边界效应。

损失函数 / 训练策略

网络采用标准交叉熵损失进行端到端优化:

\[\mathcal{L} = -\sum_{k=1}^K y_k \log \hat{y}_k\]

训练细节方面,输入视频固定均匀采样为 \(T = 40\) 帧,每帧分辨率重采样为 \(192 \times 256\)。RGB模态基于Jester预训练权重进行热启动,而深度(Depth)模态完全从零(from scratch)开始训练。采用AdamW优化器,初始学习率为 \(5 \times 10^{-5}\),权重衰减为 0.05,配合多步学习率衰减策略。作者特意采用极小的批大小(Batch Size = 4),利用其小批量梯度噪声作为隐式正则化,防止轻量模型在复杂视频高维分布下陷入局部极小值。

实验关键数据

主实验

在三个标准手势识别基准(NVGesture、EgoGesture、Briareo)上,S2Gest系列与现有主流SOTA模型的Top-1准确率和计算复杂度对比如下(见原论文Table 1):

方法 参数量 (M) FLOPs (G) NVGesture (RGB / Depth) EgoGesture (RGB / Depth) Briareo (RGB / Depth)
NAS 127.10 120.20 83.61% / 86.10% 93.31% / 94.13% — / —
ResNeXt-101 47.53 14.93 78.63% / 83.82% 93.75% / 94.03% — / —
MotionRGBD 38.14 73.85 89.58% / 90.62% — / — — / —
GestFormer 24.08 60.40 75.41% / 80.21% — / — 94.44% / 96.18%
MDRA 23.90 45.30 83.87% / 86.60% 93.96% / 94.20% 97.84% / 96.92%
MVTN 19.55 60.22 77.50% / 85.21% — / — 97.69% / 97.92%
ConvMixFormer 13.57 59.98 76.04% / 80.83% — / — 98.26% / 97.22%
DSTCNet 9.60 42.56 82.50% / 88.33% 93.70% / 94.26% 97.81% / 98.10%
MobileNetV2 1.0 2.38 4.76 74.07% / 75.73% 93.49% / 94.18% 93.52% / 91.20%
S2Gest-Small (本文) 2.59 14.90 86.10% / 90.66% 96.47% / 97.35% 97.69% / 98.15%
S2Gest-Tiny (本文) 1.17 4.53 85.06% / 87.76% 96.27% / 97.27% 97.69% / 98.61%
S2Gest-Nano (本文) 0.68 4.02 85.48% / 82.99% 95.94% / 97.07% 98.15% / 97.69%

消融实验

在NVGesture(Depth模态)上对核心架构组件进行逐项消融验证(见原论文Table 2):

配置编号 空间主干 时序模块 上下文引导 扫描策略 参数量 (M) 准确率 (%) 说明
Row 0 (完整基线) MS-Block S2-Block AFM Split-Scan 2.59 90.66% 完整模型最优效果
Row 1 (替换空间) 3D ResNet-18 同上 同上 同上 2.66 83.82% 掉点 6.84%,证实MS-Block多尺度与Conv-BN优势
Row 2 (替换时序) 同上 Transformer 同上 N/A 2.79 86.51% 掉点 4.15%,表明SSM连续建模优于离散注意力
Row 3 (无引导) 同上 同上 None 同上 2.24 88.80% 缺失全局先验导致性能受损
Row 4 (加法引导) 同上 同上 Add 同上 2.53 87.76% 无条件相加注入噪声,性能劣于None
Row 5 (拼接引导) 同上 同上 Concat 同上 2.52 89.21% 简单通道拼接逊于AFM仿射调制
Row 6 (单向扫描) 同上 同上 同上 Uni-Direct. 2.80 89.42% 缺乏后向反因果依赖,掉点 1.24%
Row 7 (全通道双向) 同上 同上 同上 Full Bi-Direct. 3.26 90.04% 参数量膨胀26%但通道冗余,反而劣于Split-Scan

关键发现

  • 通道切分的结构正则化效益显著:全通道双向扫描(Full Bi-Direct.,3.26M)不仅引入了冗余参数,精度(90.04%)反而比通道切分(Split-Scan,2.59M,90.66%)低 0.62%。这证明将 \(C\) 个通道解耦为前向与后向两组不重叠的子空间,能有效避免因果与反因果特征表示坍缩。
  • 极端轻量化的抗噪优势:在自遮挡和复杂背景严重的场景中,极度下采样的S2Gest-Nano(0.68M)在EgoGesture深度集上达到了97.07%,在Briareo RGB集上以98.15%超越了Tiny与Small版本。紧凑的参数空间充当了隐式正则项,强制模型聚焦于纯净的时序运动流,免疫背景高频噪声过拟合。
  • 真实硬件吞吐超越实时红线:在消费级GPU实测中,桌面RTX 3060在BS=1单序列实时交互模式下,Nano达到114.37 clips/s(8.74 ms延迟),Small达到65.45 clips/s;在笔记本端RTX 4060的BS=32批处理模式下,Tiny与Nano吞吐量突破170–175 clips/s,完全摆脱了Transformer由于KV-Cache引起的显存墙困境。

亮点与洞察

  • 通道切分实现参数中立的真双向时序扫描:将时序特征通道对半分流,利用SSM内部线性变换随维度平方缩放的数学特性,不仅没有使参数翻倍,反而将扫描内部计算量降至单向全通道的一半,以纯结构解耦优雅解决了Mamba因果单向性难题。
  • Eulerian视角的Tube-Major序列化:PIT分词器将图像沿空间图块排列成局部管状时间线,使SSM专注于特定固定空间孔径内的物理运动学连续演进,规避了逐帧Frame-Major带来的剧烈跨帧空间上下文遗忘。
  • 动态CPE赋予任意序列长度外推能力:通过 \(3 \times 3 \times 3\) 深度卷积动态生成位置编码,避免了固定绝对编码对时序长度的僵硬绑定,使轻量模型在面对不同帧率和不同时长的手势流时具备即插即用的泛化性。

局限与展望

  • 极端快速周期性手势下的时间混叠:模型依赖连续ZOH离散化假设手势速度平缓演变。在极快速、剧烈往复或不规则震颤动作中,固定的时间步离散可能干扰门控 \(\Delta(x_t)\) 的自适应步长,导致时序轨迹过早截断。
  • 视觉前干早期激进下采样导致细粒度关节模糊:为了兼顾极低算力预算,MS-Block较早降低了空间分辨率。在严重运动模糊伴随微小指尖运动时,模型较难分辨细微手势拓扑差(例如“双指滑动”误判为“三指滑动”)。
  • 未来改进方向:探索可微分的动态ODE求解器替代固定的零阶保持器,并在视觉前干中引入自适应显著Token保留机制以强化指尖几何细节。

相关工作与启发

  • vs VideoMamba / Bi-Mamba: 后者直接复制反向扫描分支对全通道特征进行重复计算,参数量与激活显存线性翻倍;S2Gest通过通道切分将前向动作启动与后向动作回溯分配给独立互补通道组,实现零参数开销的双向非因果全局感知。
  • vs GestFormer / ConvMixFormer: 基于Transformer的手势网络因二次方注意力和动态KV-Cache在连续滑动窗口交互时存在显存暴增和高延迟;S2Gest采用线性复杂度SSM配合连续ODE动力学,以亚3M参数量和常数级状态显存取得了相同甚至更优的准确度。
  • vs 轻量CNN (MobileNetV2): 纯2D轻量卷积受制于时序感受野碎片化,时序动作建模能力薄弱;S2Gest在参数量只有MobileNetV2约1/4至1/3(Nano 0.68M vs 2.38M)的情况下,在NVGesture深度集上大幅领先7.26%。

评分

  • 新颖性: ⭐⭐⭐⭐ [通道切分实现参数中立双向SSM设计优雅,Tube-Major时空管展开契合手势物理特性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖三套权威手势数据集,多模态完备,消融严谨,包含真实边缘端及消费级GPU吞吐与时延剖析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰,对因果/反因果神经元激活特性剖析深入透彻]
  • 价值: ⭐⭐⭐⭐⭐ [真正解决常驻监测与边缘算力显存墙冲突,在sub-3M级别确立了高帧率SOTA标杆]