PoseBridge: Bridging the Skeletonization Gap for Zero-Shot Skeleton-Based Action Recognition¶
会议: NeurIPS2026(任务清单归属;本文依据 arXiv v2)
arXiv: 2605.11497
领域: 人体理解
关键词: 零样本动作识别、骨架化缺口、姿态锚定语义、交叉注意力、语义原型适配
一句话总结¶
PoseBridge 不另加 RGB 动作识别分支,而是把姿态估计过程中尚未被关节坐标压缩掉的视觉语义保留下来,再用骨架条件桥接与语义原型适配完成零样本识别,在 Kinetics-200/400 的八个测试划分上比最强被比较基线提高 13.3–17.4 个百分点。
研究背景与动机¶
零样本骨架动作识别通常先把视频转为关节轨迹,再让骨架表示与动作文本靠近。这种流程能削弱背景、衣着和光照的影响,也方便把已见动作的运动规律迁移给未见类别;PURLS、TDSM 等方法因此主要改进骨架与语言之间的对齐。但关节坐标并不等于完整动作证据:“戴帽子”“戴耳机”“戴眼镜”都可能是手靠近头部的轨迹,真正区分类别的物体与手、头之间的关系,却没有显式留在坐标序列里。
论文把这个问题称为骨架化缺口:文本原型需要的语义比骨架保留的观察更丰富,信息损失发生在对齐之前。继续优化骨架—文本距离,不能保证重新获得已经丢掉的视觉证据。语言生成的物体或场景描述只能增加类别先验,无法直接回答这一段视频里实际出现了什么;额外 RGB 主干可以补证据,却改变输入协议,并增加外观捷径和计算负担。
姿态估计网络其实已经看过视频。浅层特征含局部视觉细节,深层特征含人体布局,但直接融合这些特征仍可能吸收背景而不是动作语义。核心 idea:把同一次人体姿态估计中的中间特征训练成围绕身体组织的语义证据,在骨架化上游保留信息,再同时校正识别查询和语言原型,而不是只在坐标输出之后补对齐。
方法详解¶
整体框架¶
输入是视频,输出是未见动作标签;广义零样本设置允许输出已见或未见标签。PoseBridge 分两阶段训练:先在 MS COCO 上训练姿态估计器及姿态锚定语义提取器,再冻结它们,为动作视频提取二维骨架和逐帧语义线索;后续识别只用已见动作样本学习桥接和对齐。
四个核心设计按数据流排列为层级姿态细化、身体感知池化、骨架条件桥接、语义原型适配。前两个把 HPE 中间特征变为可缓存的语义线索;后两个分别丰富测试查询与校正类别原型。语义原型适配使用线索的另一条时间池化路径,并非拿测试查询去动态修改类别中心。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["COCO 姿态与图文监督"] -.-> B["层级姿态细化"]
V["视频经 HPE<br/>训练后冻结提取"] --> B
B --> C["身体感知池化"]
A -.-> C
V --> S["二维骨架编码"]
C --> P["逐帧语义线索"]
S --> D["骨架条件桥接"]
P --> D
D --> Q["识别查询"]
P --> E["语义原型适配"]
T["动作文本原型"] --> E
Y["仅已见类训练样本"] -.-> E
E --> R["已见中心与<br/>未见邻域迁移原型"]
Q --> O["ZSL / GZSL 匹配"]
R --> O
图中虚线表示训练监督或已见类统计的来源,实线表示提取与匹配的数据流。未见类别只有文本,不能用未见动作视频建立中心。这里“无额外 RGB 分支”不是“完全不接触 RGB”:视频仍进入姿态估计器,识别阶段还保留其视觉中间表示。
关键设计¶
1. 层级姿态细化:把浅层细节送回深层人体结构
只取最深 HPE 特征可能保住人体姿态,却丢掉手旁物体等细粒度线索。PoseBridge 默认选取三个从浅到深的特征层,将当前浅层特征先做通道投影、再调整到下一层分辨率,经过卷积空间细化后,以系数 0.5 残差注入下一层;更新后的特征继续向更深层传递。
这不是把所有层简单拼接。逐级注入让细节进入已经由关键点任务组织好的深层表示,最后仍得到一张具有姿态结构的空间特征图。残差路径保留深层主干,避免浅层外观完全取代人体结构;但论文并没有据此保证背景信息全部被去除。
2. 身体感知池化:让视觉语义围绕预测身体聚合
深层图覆盖整个裁剪区域,普通全局平均池化会把背景和身体附近证据混在一起。模型将预测关节概率转换为热图,对关节热图取平均并归一化,得到身体注意力图。再用该图对细化特征做加权空间平均,并投影为一个帧级语义向量;分母中的小常数只用于数值稳定。
这种先验偏向身体与动作相关部位附近的响应。关节坐标本身不能表达手边是什么,但同一位置的 HPE 特征仍可能包含物体和局部交互,因此池化的是视觉特征,不是把关节坐标再次加权。也正因为依赖身体附近区域,离身体较远的物体或很小的交互目标可能仍被漏掉。
要使池化结果不仅描述衣着或外观,HPE 训练还加入图文语义监督:使用 COCO 的图像级 caption,经冻结 CLIP 文本编码器得到文本表示,与姿态锚定向量执行双向对比学习。caption 是弱图像级监督,不是逐人动作标签或手—物体关系标注;原有姿态损失与语义损失共同优化,使定位能力与语义保留同时受到约束。
3. 骨架条件桥接:由运动查询选择有用的时间语义
冻结 HPE 后,每个动作视频提供骨架序列和语义线索序列。Shift-GCN 编码骨架,投影后的骨架表示作为查询,逐帧姿态语义作为键和值,通过多头交叉注意力汇总。默认每段视频使用 16 个时间线索和四个注意力头,不是把每帧 RGB 再交给动作网络编码。
注意力输出经过可学习的逐元素 sigmoid 门控,以残差形式加入骨架表示,再经过层归一化、前馈网络及第二次残差归一化,得到最终桥接表示。运动因此仍是查询的起点,而时间视觉证据是按查询选择的补充;相较于直接拼接,更能针对当前骨架轨迹选择能消除语义歧义的线索。
同一线索序列还通过注意力时间池化得到视频级姿态语义表示。它承担已见类中心统计与训练中的姿态语义锚点角色;骨架表示是运动锚点,桥接表示才是最终用于零样本匹配的查询。三者的职责不能混为一个闭集分类输出。
4. 语义原型适配:用已见类位移校正未见类文本
增强查询并不自动消除另一端的语言—视觉偏差。模型先对每个已见类别的训练视频级姿态语义求中心,再将文本原型向中心移动,默认适配系数为 0.2。保留文本主导是为了不让原型变成只适用于已见类别的视觉模板。
未见类没有视觉中心,因而不能套用“平均该类视频”这一操作。模型在文本空间找出最相近的五个已见类,按文本相似度的温度 softmax 分配权重,迁移这些邻居的“姿态中心减文本原型”残差,而不是直接用邻居中心替代未见类。核心关系为:
其中 \(\boldsymbol\mu_j\) 只由已见类训练样本得到,\(\omega_{cj}\) 是所选文本邻居之间归一化的相似度权重。中心和适配原型均做 L2 归一化。这个迁移成立的前提是语义相近类别具有可迁移的文本—姿态偏差;邻居的物体关系若不相似,校正也可能失效。
一个完整示例¶
以一段手靠近头部的视频为例,骨架可能同时接近“戴帽子”和“戴眼镜”的文本语义,仅凭轨迹难以判定。HPE 的三个层级特征逐级细化,身体感知池化保留头部、手部附近的视觉响应,形成时间线索;这是方法的说明性例子,不是新增实测案例。
识别时,骨架查询通过交叉注意力从默认 16 个线索中汇总证据。若目标动作属于未见类,其文本原型已经用五个已见文本邻居的位移进行校正;最终将桥接查询与这些适配原型比较。全程不需要该未见动作的训练视频,也不需要额外检测出帽子或眼镜,但能否保留物体细节仍取决于 HPE 特征和裁剪范围。
损失函数 / 训练策略¶
HPE 阶段采用 RTMPose-s,输入分辨率为 \(256\times192\),在 COCO 上训练 420 个 epoch。总损失是原有 SimCC 姿态损失加权相加双向图文对比损失,语义权重为 0.1,对比温度为 0.07;文本监督使用冻结 CLIP ViT-B/32 文本编码器,语义维度为 512。其 top-down 流程使用 YOLOv11 人体检测器,因此“无外部物体检测器”不能扩大解释为“没有人体检测步骤”。
ZSSAR 阶段冻结 HPE 与 CLIP ViT-L/14 文本编码器,动作级描述预先编码缓存。骨架特征维度为 256,共享嵌入为 512,dropout 为 0.1。动作描述沿用 SMIE 风格的 ChatGPT 扩写,不额外构造部位或时间阶段提示,因此论文主要改变视觉证据与语义转移,而非强化描述工程。
骨架锚点和姿态语义锚点都使用已见类分类交叉熵、与已见文本原型匹配的交叉熵及监督对比损失。桥接表示只用语义匹配与监督对比损失,不接已见类闭集分类头,避免最终查询被强行限制在已见类别的决策边界中。
此外,通过余弦一致性拉近骨架与姿态语义表示,并把姿态分支在已见文本原型上的概率分布蒸馏给骨架分支。教师概率停止梯度,蒸馏温度为 4.0;这让骨架学习语义关系,但并不意味着测试时能完全删去 HPE 线索而保持报告性能。
识别训练使用 AdamW,30 个 epoch,batch size 128,学习率 \(10^{-3}\),权重衰减 \(2\times10^{-3}\);前五个 epoch 预热后余弦退火,并使用梯度裁剪与 EMA。测试时用归一化桥接表示和适配原型的点积评分。ZSL 只比较未见类;GZSL 比较两类集合,并给已见类评分减去校准系数 \(\kappa\) 以抑制已见偏置,不能把 ZSL 与 GZSL 的准确率混用。
实验关键数据¶
主实验¶
以下均为百分数,划分写作“已见/未见”。NTU 采用 Xsub;随机划分报告三次类别划分的平均结果。ZSL 是未见类 top-1 准确率,GZSL-H 使用已见准确率 \(S\) 和未见准确率 \(U\) 的调和平均:
| 数据集与协议 | 指标 | PoseBridge | 对照 | 对照结果 | 提升(百分点) |
|---|---|---|---|---|---|
| NTU60 标准 55/5 | ZSL | 88.8 | Neuron / FS-VAE | 86.9 | 1.9 |
| NTU60 标准 48/12 | ZSL | 73.2 | Neuron | 62.7 | 10.5 |
| NTU120 标准 110/10 | ZSL | 80.3 | BSZSL(额外 RGB) | 77.7 | 2.6 |
| NTU120 标准 96/24 | ZSL | 70.9 | TDSM | 65.1 | 5.8 |
| NTU60 标准 48/12 | GZSL-H | 68.0 | Neuron | 59.1 | 8.9 |
| NTU120 随机 110/10 | GZSL-H | 66.0 | SCoPLe | 54.1 | 11.9 |
| PKU-MMD 随机 46/5 | GZSL-H | 71.9 | FS-VAE | 59.0 | 12.9 |
| Kinetics-200 180/20 | ZSL | 55.6 | TDSM | 38.2 | 17.4 |
| Kinetics-200 160/40 | ZSL | 38.3 | TDSM | 24.4 | 13.9 |
| Kinetics-200 140/60 | ZSL | 28.6 | TDSM | 15.3 | 13.3 |
| Kinetics-200 120/80 | ZSL | 26.4 | TDSM | 13.1 | 13.3 |
| Kinetics-400 360/40 | ZSL | 52.3 | TDSM | 38.9 | 13.4 |
| Kinetics-400 320/80 | ZSL | 39.6 | TDSM | 26.2 | 13.4 |
| Kinetics-400 300/100 | ZSL | 32.9 | TDSM | 18.5 | 14.4 |
| Kinetics-400 280/120 | ZSL | 32.1 | TDSM | 16.1 | 16.0 |
来源:原文表 1–3。PoseBridge 的 NTU120 标准 110/10 GZSL-H 为 68.0,低于额外 RGB 方法 BSZSL 的 75.8,因此不能概括为所有模态、所有指标均最佳。
主表多数旧方法来自 Kinect 25 关节三维骨架协议,PoseBridge 使用 RTMPose 的 COCO-17 二维骨架。附录表 8 将 Neuron、TDSM、FS-VAE 重新置于相同二维骨架格式:NTU60 48/12 的 Neuron、TDSM、FS-VAE、PoseBridge ZSL 分别为 58.8、64.7、48.8、73.2。该控制排除了骨架格式差异,但仍未让基线获得同样的 HPE 语义线索,不能视为严格坐标-only 输入的等信息比较。
消融实验¶
表 5 固定 NTU60 Xsub 48/12;HR、BP、SB、PA 分别对应层级姿态细化、身体感知池化、骨架条件桥接和语义原型适配。
| HR | BP | SB | PA | ZSL | GZSL-H |
|---|---|---|---|---|---|
| 无 | 无 | 无 | 无 | 54.7 | 52.0 |
| 无 | 无 | 无 | 有 | 56.6 | 57.3 |
| 无 | 无 | 有 | 无 | 60.4 | 60.7 |
| 无 | 无 | 有 | 有 | 61.4 | 61.7 |
| 无 | 有 | 有 | 有 | 64.0 | 63.2 |
| 有 | 无 | 有 | 有 | 64.8 | 63.8 |
| 有 | 有 | 无 | 有 | 66.9 | 63.9 |
| 有 | 有 | 有 | 无 | 71.0 | 66.5 |
| 有 | 有 | 有 | 有 | 73.2 | 68.0 |
关键发现¶
- 完整模型较骨架基线提高 18.5 个 ZSL 点和 16.0 个 GZSL-H 点。移除 SB、HR、BP、PA 的 ZSL 分别降至 66.9、64.0、64.8、71.0,四个设计互补,不能用单独加模块的收益替代完整上下文中的作用。
- 原文图 4 用“折纸”与“键盘打字”展示身体轨迹相近时的区分;Grad-CAM 和 t-SNE 是定性证据,缓存没有这些图的可读像素或曲线点值,因此不据此编造定位精度或聚类指标。
- 效率必须区分已缓存线索的识别阶段和在线提取阶段。下表照录表 4、9、10 的对应范围,不把 1398.0 FPS 当作视频到标签的完整吞吐率。
| 测量范围与配置 | 参数量(M) | GFLOPs | FPS | 额外指标 |
|---|---|---|---|---|
| PoseBridge 识别阶段(表 4) | 128.2 总量;3.8 可训练 | 7.3 | 1398.0 | 含骨架与文本编码器 |
| 原始 RTMPose-s(表 9) | 5.47 | 0.68 | 4740.71 | COCO AP 70.86 |
| 增强 RTMPose-s(表 9) | 8.23 | 0.83 | 2534.7 | COCO AP 70.24 |
| 骨架基线在线流程(表 10) | 131.0 | 8.009 | 1101.9 | 论文定义的累计流程 |
| 完整 PoseBridge 在线流程(表 10) | 136.4 | 8.168 | 934.6 | 论文定义的累计流程 |
语义增强 HPE 的 AP 下降 0.62,在线累计流程 FPS 也低于骨架基线;更好的动作识别不是由更准确的姿态定位直接解释的。论文所列在线成本的帧/片段口径及人体检测、解码是否完整计入仍需实现核查。
亮点与洞察¶
- 先检查信息损失发生在哪里,再选择对齐位置。若输入已把目标任务的判别证据压缩掉,更复杂的下游映射也可能只是在不充分观察上拟合。
- 把姿态估计中间表示变成任务相关的可复用资源,而不是泛 RGB 特征。身体先验、语义监督与骨架查询共同约束其用途,可借鉴到依赖关键点却需要交互证据的任务。
- 同时调整查询和原型,避免把模态差距全交给单侧网络解决。未见原型迁移的是邻居的跨模态位移,保留目标文本自身语义,而不是复制一个已见视觉类别中心。
局限与展望¶
- 作者明确限定为 HPE-aware 协议,而不是严格坐标-only 协议。仅有既存骨架文件、没有原视频或 HPE 中间特征的数据无法直接复用完整方法。
- 严重遮挡、小物体、物体位于身体关注区域之外、运动模糊或拥挤场景会同时损害骨架与语义线索。更稳健的身体区域建模及低成本多尺度证据保留是具体改进方向。
- COCO caption 是图像级弱监督,可能包含未对应当前人物的描述;文本近邻也未必具有相同交互结构。需补充多人物 caption 关联、邻居可靠性及未见类别负迁移分析。
- 数值报告存在待核对处:表 1 的 ReViSE 55/5 写作 \(S=74.2\)、\(U=34.7\)、\(H=29.2\),按调和平均定义不能得到该 H;本文不重算替换作者数字。表 11 的 ViTPose 参数栏写 766.9 M,异常值亦不自行修正。
- 随机划分只报告三次平均,未给出方差;文字缓存也不能支持图 5–6 的精确超参数曲线复原。完整复现还需核实邻域温度、GZSL 校准及实现细节,代码在该版本中仅承诺公开,没有可核实仓库链接。
- 不增加 RGB 主干不等于消除视觉隐私或偏见:HPE 仍访问视频,并继承 COCO、caption 和预训练模型的偏差。部署前应做场景验证、数据最小化及人工监督。
相关工作与启发¶
- vs PURLS / TDSM:前者加强部位级骨架—文本关系,后者以扩散式机制改善对齐;PoseBridge 的介入点更早,补的是骨架输出前丢失的证据,两种路线并非互斥。
- vs Neuron / SkeletonContext:语言上下文丰富类别描述,PoseBridge 从当前视频的 HPE 流获取样本相关证据。关键区别是语义信息来源,而不只是采用何种文本编码器。
- vs BSZSL / SKI-VLM:额外 RGB 视觉路径可获得更丰富观察,但代价与输入协议不同;PoseBridge 复用 HPE 并保留二维骨架作为条件,不能因此声称与纯骨架方法具有完全相同的信息预算。
- vs PFMESR:都考虑姿态估计特征,PoseBridge 进一步加入姿态结构细化、身体池化、语义监督及未见原型适配,针对的是零样本语义转移而非一般特征融合。
评分¶
- 新颖性: 4/5。把零样本瓶颈前移到骨架化过程,并形成查询与原型两侧的语义桥接。
- 实验充分度: 4/5。覆盖标准、随机、野外、同骨架格式及组件消融,但协议边界和统计不确定性仍需注意。
- 写作质量: 4/5。方法与动机关系明确,附录补足训练和成本边界,少量表格数值仍待核对。
- 价值: 4/5。对能访问 HPE 流的动作识别很有启发,对只保留关节坐标的应用不直接适用。