Decoding Children’s Gait Behavior¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/pediamedai/ChildrenGait
领域: 医学图像
关键词: 儿童步态分析, 爱丁堡视觉步态评分, 视频基础模型, 运动学提示, 掩码剪枝
一句话总结¶
针对儿童神经肌肉与发育障碍步态筛查高度依赖主观肉眼评估且现有基础模型无法捕捉细粒度微小运动异常的痛点,本文构建了首个开源儿童步态多视角视频数据集 CGV(110 名患儿、1185 段视频、34 项双侧 EVGS 临床金标准标注),并提出了结合骨骼运动学提示与掩码引导空间补丁剪枝的端到端视频分析模型 ChildGait-Video,在全项步态评分预测上达到 84% 的平均准确率。
研究背景与动机¶
定量步态分析是脑瘫(CP)、偏瘫等儿童发育与神经肌肉疾病早期临床诊断、功能评估及康复监测的核心支柱。随着脑机接口(BCI)与神经假肢技术的发展,客观步态量化进一步成为评估运动功能恢复效果的关键指标。然而在当前临床实践中,儿童步态异常的早期识别仍严重依赖儿科医生在常规门诊中的主观肉眼观察。基于多相机光学动捕的 3D 步态分析与穿戴式惯性测量单元(IMU)虽然能提供精确的量化指标,但高昂的设备与空间成本限制了其在基层医院的普及;更重要的是,传感器贴合会引发患儿的抗拒与生理不适,甚至直接干扰儿童自然的行走模式。低成本、无负荷的标准 RGB 视频步态分析因而成为极具潜力的临床替代方案。
然而,现存的计算机视觉步态模型绝大多数是“成人中心”的,底层假设步态是一种成熟、稳定且高度周期性的运动。儿童处于快速骨骼发育期,其肢体相对比例、身体质心分布与成年人存在显著的非线性形态差异,且步态运动具有极高的时间熵、类内方差与不规则性。直接将基于成人预训练的大型步态模型或多模态大语言模型(MLLM)迁移到儿童群体时,会遭遇严重的骨骼形态域漂移与时间盲区;此外,真实临床视频中患儿常需家长或医护陪同步行协助,带来严重的背景杂物与人际动态遮挡。更棘手的是,临床评估是高度相位依赖(phase-dependent)的细粒度任务,要求在特定步态周期瞬时精准判断关节屈伸角度,现有通用模型只能给出粗粒度行为类别,难以捕捉微米级或亚秒级的运动学病理细节。
为突破儿童步态数据与专用建模算法的双重匮乏,本文旨在构建标准化临床儿童步态视觉基准,并探索从普通视频直接解码临床量化评分的可行技术路径。核心 idea:构建首个包含精细爱丁堡视觉步态评分(EVGS)及逐帧实例分割与 2D 骨骼位姿的高帧率儿童步态视频数据集 CGV,并设计端到端模型 ChildGait-Video,将人体骨骼关键点作为 token 级运动学提示渲染注入 RGB 帧,结合前景掩码引导的时空补丁确定性剪枝,强迫自注意力机制聚焦患儿肢体运动学动力学。
方法详解¶
整体框架¶
ChildGait-Video 摒弃了传统“关键点估计→关节角几何推导→规则映射”易发生多阶段误差累积的几何中心范式,构建了从原始多视角 RGB 视频到 34 项临床 EVGS 评分的端到端视觉映射系统。输入为冠状位(正面/背面)或矢状位(侧面)的标准视频流,统一降采样至 30 FPS。在训练阶段,模型从视频序列中随机裁剪 \(M=4\) 个时间窗口并各均匀抽取 \(T=16\) 帧;在测试阶段,从视频中心时间窗口确定性抽取 \(T=16\) 帧。预处理阶段利用 Sapiens-2B 估计的 2D 骨骼关键点执行 token 级运动学提示(TKP),利用 SAM 3 生成的精细身体分割掩码执行掩码引导补丁剪枝(MPP),最后将前景 patch tokens 传入预训练的 ViT 骨干网络(VideoMAE v2 架构),经时空全局平均池化后由线性分类头输出各 EVGS 项的预测概率。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入多视角儿童步态视频<br/>冠状位/矢状位,统一降采样至 30 FPS"] --> B["Token 级运动学提示 (TKP)<br/>将 2D 骨骼骨架图渲染叠加至原始 RGB 帧"]
B --> C["掩码引导补丁剪枝 (MPP)<br/>基于 SAM 3 前景掩码剔除纯背景杂斑 Token"]
C --> D["时空 ViT 视频编码器<br/>基于 Kinetics-710 预训练的时空自注意力"]
D --> E["时空全局平均池化与 MLP 分类头<br/>聚合前背景时空表征生成 Logits"]
E --> F["输出 EVGS 临床评分<br/>34 项双侧典型/非典型病理步态预测"]
关键设计¶
1. Token 级运动学提示:将骨骼拓扑先验直接内嵌于视觉嵌入
预训练视频基础模型虽然具备通用运动特征提取能力,但完全缺失儿童骨骼形态与临床解剖学先验,无法敏锐识别肢体末端或特定关节的细微运动学异常。传统两阶段方法仅使用稀疏骨骼坐标,又彻底丢弃了肢体肌肉轮廓、皮肤纹理等外观信息。针对这一矛盾,本文将 2D 人体姿态估计模型(Sapiens-2B)检测并经人工校验的关节坐标 \(K_t\) 及其骨架拓扑连接图,通过渲染操作 \(R(\cdot)\) 直接绘制在对应的原始 RGB 图像 \(I_t\) 上,得到增强帧 \(\hat{I}_t = R(I_t, K_t)\)。在 Vision Transformer 进行切块(patchifying)投影时,包含骨架线条与关节节点的 patch 会自然编码局部解剖拓扑与全局外观纹理,投影到嵌入空间后充当显式的 token 级运动学提示,引导自注意力机制关注临床医生评估关注的解剖关键轴线。
2. 掩码引导补丁剪枝:抑制临床杂物与陪同干扰并提升计算效率
儿童步态视频采集通常在复杂诊室环境下进行,患儿常常由家长或护士搀扶或在旁鼓励,背景中充斥着陪同人员、医疗器械和病床遮挡,导致通用模型在微调时极易过拟合于背景无关噪声。受 MAE 原生稀疏表示特性的启发,本文利用 SAM 3 提取患儿的二值实例分割掩码 \(M \in \{0, 1\}^{H \times W}\),设计了确定性的空间补丁剪枝。将增强图像 \(\hat{I}_t\) 划分为互不重叠的规则 patch 网格后,仅保留在掩码 \(M\) 中前景像素比例达到阈值的 patch,丢弃纯背景 patch。该设计使得保留的前景 patch 数量 \(N_{\text{foreground}} \ll N_{\text{total}}\),既强迫 Transformer 的自注意力计算严格分配在患儿躯干与肢体运动上,又大幅缩减了时空序列自注意力的显存与计算开销。
3. 临床目标导向的端到端学习策略
针对多阶段评估各关节独立打分忽视步态协同性(kinematic synergy)的问题,模型将最终 Transformer 块输出的特征张量 \(X \in \mathbb{R}^{B \times N_{\text{foreground}} \times D}\) 进行时空全局平均池化,聚合为全局向量后经由线性分类头投影为 2 维分类 logits:
其中 \(\mathbf{W}_{\text{head}} \in \mathbb{R}^{2 \times D}\)。为缓解临床中极端异常样本(标准 EVGS 2 分)天然稀疏引发的类别不平衡,任务采用二值化分类准则(将异常 1 分与 2 分合并为非典型,0 分为典型正常)。模型使用带正负样本先验平衡权重 \(q = (\lambda, 1 - \lambda)\) 的软目标交叉熵损失(Soft Target Cross-Entropy Loss)进行端到端优化:
损失函数 / 训练策略¶
模型采用两阶段适配训练范式:首先在包含大量通用人体运动的 Kinetics-710 数据集上完成时空基础预训练,使编码器掌握基础人体动力学;随后在 CGV 数据集上开展全参数微调。微调采用 AdamW 优化器,学习率设为 \(\eta = 10^{-4}\),权重衰减系数为 0.05,在训练前 5% 的 epoch 实施线性预热(linear warm-up)以稳定初始特征对齐,单个 GPU 的 batch size 为 8。
实验关键数据¶
主实验¶
实验在配备 10 张 NVIDIA L40S GPU 的集群上完成。为防止身份泄露与数据捷径,数据集按患者唯一 ID 进行严格的 6:1 划分,保证同一患儿的所有视频与步态周期仅出现在训练集或测试集。主实验涵盖了零样本通用 MLLM、微调视频 MLLM、传统步态识别模型、骨骼基线以及视频基础模型,评测指标为左右侧肢体 17 项 EVGS 的平均准确率与平均 F1-score。
| 方法 | 预训练数据集 | 左肢平均准确率 (%) | 右肢平均准确率 (%) | 左肢平均 F1 | 右肢平均 F1 |
|---|---|---|---|---|---|
| Gemini 3 Pro (Zero-shot) | - | 53 | 55 | - | - |
| GPT-5.2 (Zero-shot) | - | 53 | 56 | - | - |
| Qwen3-VL-235B (Zero-shot) | - | 54 | 59 | - | - |
| Qwen3-VL-4B (Fine-tuned) | CGV | 53 | 53 | - | - |
| GaitBase | GREW | 53 | 56 | - | - |
| BiggerGait (SOTA 步态识别) | CCPG | 54 | 53 | 0.53 | 0.51 |
| ScoNet (骨骼动作基线) | Scoliosis1K | 68 | 70 | 0.67 | 0.69 |
| VideoMAE v2 (直接微调) | Kinetics-710 | 69 | 72 | 0.70 | 0.71 |
| ChildGait-Video (本文) | Kinetics-710 | 84 | 84 | 0.83 | 0.83 |
注:在 McNemar 显著性检验中,ChildGait-Video 相比 VideoMAE v2 的 \(p\) 值为 \(2.3 \times 10^{-4} < 0.001\),证实性能飞跃具有极高的统计显著性。儿科医生人工评分上限基线为 93.8%(专家间 ICC = 0.93)。
消融实验¶
消融实验系统验证了输入采样帧数、运动学提示(TKP)与补丁剪枝策略(MPP)的独立贡献:
| 配置 / 变体 | 采样帧数 (T) | 左肢准确率 L-AVG (%) | 右肢准确率 R-AVG (%) | L-F1 / R-F1 | 说明 |
|---|---|---|---|---|---|
| ChildGait-Video (完整模型) | 16 | 84 | 84 | 0.83 / 0.83 | TKP + MPP 完整配置 |
| 仅时空编码器 (VideoMAE v2 Base) | 16 | 69 | 72 | 0.70 / 0.71 | 移除 TKP 与 MPP |
| VideoMAE v2 + TKP | 16 | 72 | 74 | 0.72 / 0.73 | 仅注入骨骼运动学提示 |
| VideoMAE v2 + MPP | 16 | 78 | 79 | 0.77 / 0.78 | 仅使用掩码引导空间剪枝 |
| VideoMAE v2 + Random Mask | 16 | 68 | 70 | 0.69 / 0.69 | 随机掩码(遮挡关键关节致性能下降) |
| VideoMAE v2 + Bounding Box Mask | 16 | 75 | 77 | 0.74 / 0.76 | 边界框背景粗剪枝 |
| 输入帧数消融 \(T=8\) (L/R-IC 项) | 8 | 74.1 | 74.1 | 0.73 | 时间跨度 0.26s,无法跨越步态相位 |
| 输入帧数消融 \(T=16\) (L/R-IC 项) | 16 | 87.0 | 87.0 | 0.89 | 时间跨度 0.53s,有效捕获相位转换 |
| 输入帧数消融 \(T=32\) (L/R-IC 项) | 32 | 90.7 | 90.7 | 0.92 | 时间跨度 1.06s,性能略增但算力翻倍 |
关键发现¶
- 大语言模型的多模态时间盲区:即便是参数量高达 235B 的先进闭源/开源 MLLM(如 GPT-5.2、Qwen3-VL-235B),零样本步态评估准确率仅徘徊在 50%~59%,接近二分类随机猜测。这揭示了通过因果文本自回归训练的 MLLM 擅长高维语义理解,但缺乏精确的亚秒级运动学生物力学解析能力;微调 Qwen3-VL-4B 后均分仅微增 1%~2%,无法胜任细粒度运动临床评估。
- 成人身份识别模型不等于临床运动评估:BiggerGait 等成人步态 SOTA 模型在 CGV 上表现低迷(均分仅 53%~54%),根源在于步态识别网络聚焦于跨视角全局身份不变性,而临床评估依赖肢体局部的瞬时关节夹角与相位转换。
- 前景掩码剪枝与骨架提示的强互补性:消融显示单纯引入 MPP 可带来 +9% 的准确率飞跃,证明阻断门诊背景及家属陪同噪声是视频学习的关键前提;叠加上 TKP 后准确率进一步提升至 84%,证实骨骼连线显式补齐了解剖学结构先验。
- 年龄分层敏感性:将测试集划分为低龄组(\(\le 8\) 岁)与大龄组(\(\ge 8\) 岁)后,模型平均准确率分别为 82.4% 与 85.2%,证实低龄儿童步态运动具有更高无序性与变异性,评估难度显著更高。
亮点与洞察¶
- 将视觉提示机制与解剖学骨架无缝融合:直接将 2D 骨架渲染到 RGB 图像上作为 ViT 的 Token 级运动学提示(TKP),巧妙规避了传统几何计算的累积误差与纯视觉 Transformer 对细长肢体结构的定位迟钝,是一种极低工程成本却异常有效的跨模态视觉嵌入范式。
- 确定性掩码空间剪枝变被动去噪为主动态力:借鉴 MAE 的 Patch 丢弃机制但改为由实例分割引导的确定性前景采样,在抹除诊室复杂人际遮挡的同时压缩了输入 Token 规模,实现了临床准确度与计算效率的双赢。
- 打破通用 MLLM 的临床泛化迷信:通过系统的零样本与微调对比实验,用确凿的数据证明了高维离散语义 token 训练的大模型在连续时空物理世界(特别是细粒度动力学量化)中的本质局限。
局限与展望¶
- 受控医院环境到真实开放场景的泛化:数据集全部采集自医院标准 8 米步态走廊,未来的临床推广需要将系统部署到家庭走廊、日间照护中心和社区康复室等完全无约束场景,需验证不同光照、穿戴与视角变化下的泛化鲁棒性。
- 严重病理形态的样本稀缺与长尾挑战:尽管通过二值化合并了极度异常(EVGS 2分),但罕见运动发育障碍的亚型依然存在长尾分布,未来需借助生成式虚拟步态模拟扩充罕见神经肌肉病理样本。
- 时序密集推理到 3D 关节动力学的延展:当前仅预测 2D 平面离散评分,未来可结合无标记 3D 姿态重建技术,同时估计下肢关节反作用力矩与地面反作用力(GRF),提供真正兼顾运动学(Kinematics)与动力学(Kinetics)的全维度客观报告。
相关工作与启发¶
- vs 传统成人步态识别模型(如 BiggerGait / GaitBase): 成人步态识别致力于提取与个体身份绑定的全局时空周期性特征,抵御衣着和视角干扰;而儿童临床评估需忽略身份、精准解耦肢体局部在各阶段的运动偏差。ChildGait-Video 专为病理异常敏感性设计,准确率大幅领先传统步态模型近 30 个百分点。
- vs 多模态大语言模型(如 GPT-5.2 / Qwen3-VL): MLLM 依托海量图文语料具备卓越的场景语义描述能力,但在缺乏密集时空帧间几何建模时无法精准测算关节转动范围。本文证实了纯粹依靠通用视觉-语言预训练无法直接解决细粒度医疗物理测量任务,领域专用的时空密集微调不可或缺。
- vs 纯骨骼动作识别网络(如 ScoNet / SkeletonGait++): 纯骨骼方法受制于 2D 关键点检测的微小抖动与深度缺失,丢失了肢体肌肉轮廓及脚掌触地细节;ChildGait-Video 保持高维 RGB 表征的同时将骨架作为软引导,在脚底触地(IC)与骨盆倾斜等末端指标上大幅领先骨骼基准。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出儿童步态细粒度临床评分的视觉基准与开源数据集,解密了 MLLM 在细粒度步态任务上的失效机理。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 大 MLLM、10 种视频与步态模型、2 种骨骼网络,完成了系统性的显著性检验与详尽消融。
- 写作质量: ⭐⭐⭐⭐⭐ 结构清晰,问题背景阐述透彻,临床动机与计算机视觉方法设计高度自洽。
- 价值: ⭐⭐⭐⭐⭐ 极大推动了低成本无感化儿童神经肌肉疾病早期筛查的实用化落地,对智慧儿科具有重要临床与社会意义。