Occlusion-Resilient Category-Agnostic Pose Estimation with Conditional Flow Matching¶
会议: ECCV 2026
论文: CVF Open Access
领域: 人体理解 / 3D视觉 / 图像生成
关键词: 类别不可知姿态估计, 流匹配, 遮挡鲁棒性, 图流编码器, 黎曼流形
一句话总结¶
FlowCape 将类别不可知姿态估计(CAPE)重构为条件流匹配驱动的结构化位姿输运过程,利用热图引导初始化定位初始位姿模态,并结合拓扑约束的黎曼位姿头与图流编码器协同推演,在严苛遮挡场景下实现了 SOTA 的鲁棒姿态估计。
研究背景与动机¶
类别不可知姿态估计(Category-Agnostic Pose Estimation, CAPE)旨在仅依据少量支持样本或语义描述,在未见类别的查询图像上定位特定关键点。与类别特定(Category-Specific)姿态估计不同,CAPE 无法依赖特定骨架结构或强外观先验在闭集监督下进行拟合,而是需要模型将关键点语义与几何拓扑灵活迁移到具有全新骨架拓扑、外形比例差异显著的未见类别上。当目标遭遇严重遮挡、自遮挡或局部视觉证据完全缺失时,这种泛化挑战被成倍放大。
现有主流 CAPE 方案大多遵循欧氏空间内的判别式范式,主要采用直接坐标回归或局部相似度热图匹配。这类方法在关键点清晰可见时表现优异,但在严重遮挡下面临两大核心瓶颈:其一,局部特征匹配在视觉证据消失时失去判别基础,且缺乏全局拓扑几何的强约束,导致隐蔽关节向随机或不合常理的区域漂移;其二,确定性回归模型在面对高度多模态的不确定性时存在“生成谬误”,倾向于给出过度自信的错误预测。尽管基于扩散模型的方法能建模不确定性,但多步去噪推断的高昂计算开销严重制约了实际落地。
针对上述挑战,连续流匹配(Flow Matching, FM)提供了一种高效且确定的输运建模路径,但简单引入 FM 会因无先验初值导致过长积分轨迹与漂移。本文的切入角度是:结合粗粒度跨模态相似度锚定合理起点,并在流场演化全程注入骨架拓扑与图像上下文交互。核心 idea:将严重遮挡下的 CAPE 建模为骨架拓扑几何空间内的条件流匹配输运,通过热图引导初始化提供稳定位姿锚点,并由融合图拓扑的共享黎曼位姿头预测条件速度场,在概率流 ODE 积分中实现由粗到细的遮挡鲁棒位姿恢复。
方法详解¶
整体框架¶
FlowCape 的核心流水线由热图引导初始化、条件流匹配速度场预测以及概率流常微分方程(ODE)数值积分三大部分构成。整体输入包含查询图像 \(I_q\)、骨架拓扑图 \(\mathcal{G}\) 以及支持关键点文本语义描述集合 \(T_s = \{d_i\}_{i=1}^N\)。图像编码器 \(\Phi_q\) 提取多尺度空间特征 \(F_q\),文本编码器提取关键点语义嵌入。首先,热图引导初始化模块评估查询特征与文本语义的跨模态互相关联,结合中心锚点生成可靠的初始位姿 \(x_0\);随后,共享参数的黎曼位姿头(Riemannian Pose Head)内嵌图流编码器(Graph Flow Encoder, GFE),以当前位姿状态、图像特征与骨架拓扑为条件预测速度场 \(v_\theta\);最后,在推断时通过概率流 ODE 逐步积分迭代更新关键点坐标,并利用热图势能梯度引导,输出最终的高精度几何位姿。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:查询图像 Iq + 文本描述 Ts + 骨架图 G"] --> B["特征提取<br/>SwinV2 图像特征 Fq 与 GTE 文本语义 di"]
B --> C["热图引导初始化<br/>计算跨模态相似度图并置信度自适应混合"]
C --> D["图流编码器速度场预测<br/>自注意力 + 交叉注意力 + 骨架拉普拉斯平滑"]
D --> E["骨架感知黎曼流匹配监督<br/>拉普拉斯度量约束 + 轨迹一致性损失"]
E --> F["概率流 ODE 积分展开<br/>Euler 步进 + 热图势能引导输出终态位姿"]
关键设计¶
1. 热图引导初始化:锚定局部邻域以消除输运漂移 标准流匹配通常从各向同性高斯先验或均匀分布中采样初始状态,但这在 CAPE 中会导致先验分布与目标位姿流形间的耦合距离过大,在 ODE 积分推演过程中积累严重的数值漂移,尤其在严重遮挡下后验分布高度多峰,易陷入局部极小。为此,FlowCape 复用黎曼位姿头预测跨模态相似度矩阵,计算归一化查询特征 token 与关键点文本描述向量间的点积相似度热图 \(H_{iuv} = \langle \hat{d}_i, \hat{f}_{uv} \rangle / \tau_h\)。通过可微的 Soft-argmax 操作将热图离散响应转化为连续初始坐标 \(x_{0,i}^{\mathrm{hm}}\)。为防止遮挡区域低置信度热图的虚假响应误导轨迹,系统引入图像中心几何锚点 \(q_0 = 0.5 \cdot \mathbf{1}^{N \times 2}\),并根据热图响应峰值 \(p_i = \max_{u,v} H_{iuv}\) 计算自适应置信度权重 \(\alpha_i = \sigma((\sigma(p_i) - \delta)\gamma)\),将初始状态构造为: $\(x_{0,i} = \alpha_i x_{0,i}^{\mathrm{hm}} + (1 - \alpha_i) q_{0,i}\)$ 在训练过程中,对该初始位姿执行截断梯度操作 \(x_0 = \text{sg}(x_0^{\mathrm{raw}})\),彻底解耦初始化参数学习与后续流匹配速度场的目标梯度,使输运轨迹始终稳定锚定在单实例局部合理邻域内。
2. 图流编码器:拓扑图结构与图像跨模态语义的协同流场建模 在连续流匹配过程中,中间状态 \(x_t\) 必须时刻感知图像局部上下文与未见类别骨架拓扑的全局几何约束。共享黎曼位姿头内部设计了图流编码器(Graph Flow Encoder, GFE)。首先,将当前时序的节点位姿坐标与语义描述投射构建联合节点 token \(z_i^{(0)} = W_d d_i + W_x x_{t,i}\),并注入连续时间正弦嵌入与全局语义平均向量 \(\bar{d}\) 驱动的自适应层归一化(AdaLN)。GFE 内部堆叠若干图流模块,交替执行三项关键操作:节点 token 间的密集自注意力(捕捉长程依赖)、以投影视觉特征 \(M\) 为 Key/Value 的空间交叉注意力(重新检索可见区域线索)、以及基于骨架邻接矩阵 \(\mathcal{G}\) 的图平滑卷积。这种设计保证了速度向量不仅受当前可见视觉线索驱动,还能借由拓扑图通道,将可见关节的刚性几何位置信息通过骨架边传递给不可见或遮挡关节,从而预测出兼顾局域外观与整体骨架一致性的速度场 \(v_\theta(x_t, t \mid c)\)。
3. 骨架感知黎曼流匹配监督与时序一致性约束 为了促使生成轨迹严格遵循类别的拓扑物理规律并抑制遮挡引起的变形,模型采用直线插值概率路径 \(x_t = (1-t)x_0 + tx_1\),其理想恒定速度为 \(u = x_1 - x_0\)。在此基础上,引入骨架拉普拉斯矩阵 \(L_{\mathcal{G}} = D - A\) 诱导的非欧黎曼度量损失 \(\mathcal{L}_{\mathrm{rfm}}\),对速度残差 \(r = v_\theta(x_t, t \mid c) - u\) 施加拓扑正则: $\(\mathcal{L}_{\mathrm{rfm}} = \frac{1}{\sum_{i=1}^N m_i} \mathbf{r}^T \mathbf{L}_{\mathcal{G}} \mathbf{r}\)$ 该损失直接惩罚相邻相连关节在速度方向上的剧烈形变与拉伸撕裂,与标准欧氏回归损失 \(\mathcal{L}_{\mathrm{flow}}\) 互为补充。此外,由于早期流向对 ODE 轨迹的最终收敛至关重要,FlowCape 在时间采样上采用 \(t \sim \mathcal{U}(0,1)^{1/2}\) 偏置采样策略强化 \(t\) 较小时的训练密度,并引入 \(t=0\) 处的初速度对齐损失 \(\mathcal{L}_{\mathrm{v0}}\) 以及在训练中展开 \(K_{\mathrm{tr}}\) 步的前向数值积分终点一致性损失 \(\mathcal{L}_{\mathrm{ode}}\),大幅压制了数值展开带来的分布偏移。
4. 关键度热图引导的概率流 ODE 数值求解推断 在推断部署阶段,模型从热图引导位姿 \(x^{(0)} = x_0\) 出发,执行 \(K_{\mathrm{te}}\) 步显式 Euler 积分迭代展开。为了在推断演化中充分利用共享黎曼位姿头同时输出的即时热图响应 \(H^{(k)}\),系统在位姿空间构建热图势能标量场 \(U(x; H^{(k)})\),通过双线性插值在当前坐标处计算势能梯度 \(g^{(k)} = \lambda_{\mathrm{kg}} \nabla_x U(x^{(k)}; H^{(k)})\),并将此引导偏置叠加至模型速度向量:\(\tilde{v}^{(k)} = v^{(k)} + g^{(k)}\)。该设计相当于为生成粒子在流动流形上注入局部特征吸引势阱,使关键点既在速度场带动下沿着连贯骨架轨迹移动,又被即时高置信度感知特征牢牢吸附,最终由粗到细收敛到目标真值坐标。
损失函数 / 训练策略¶
模型的总训练目标包含流场拟合、拓扑约束与多阶段一致性监督: $\(\mathcal{L} = \lambda_{\mathrm{flow}}\mathcal{L}_{\mathrm{flow}} + \lambda_{\mathrm{rfm}}\mathcal{L}_{\mathrm{rfm}} + \lambda_{\mathrm{init}}\mathcal{L}_{\mathrm{init}} + \lambda_{\mathrm{v0}}\mathcal{L}_{\mathrm{v0}} + \lambda_{\mathrm{ode}}\mathcal{L}_{\mathrm{ode}} + \lambda_{\mathrm{hm}}\mathcal{L}_{\mathrm{hm}}\)$ 各损失项权重为超参数配置(最佳消融设定为 \(\lambda_{\mathrm{init}}=0.1, \lambda_{\mathrm{traj}}=1.0\))。模型在 MMPose 框架下基于 Adam 优化器训练 200 个 epoch,batch size 为 16,初始学习率 \(1 \times 10^{-5}\),分别在第 160 和 180 epoch 衰减 10 倍。输入图像均归一化裁剪缩放至 \(256 \times 256\)。训练全程在一台配备 NVIDIA A100 GPU 的 Linux 服务器上完成。
实验关键数据¶
主实验¶
为了客观衡量严重遮挡场景下的鲁棒性,作者建立了包含 80 个类别、15,562 个严苛遮挡标注实例的 Occ80 基准数据集,划分为三个无重叠类别的评估划分(S1–S3)。下表展示了 Occ80 上的关键点正确概率([email protected])对比结果:
| 骨干网络 | 方法 | 来源 | S1 | S2 | S3 | 平均 (Avg) |
|---|---|---|---|---|---|---|
| ResNet-50 | CapeFormer | CVPR 2023 | 77.63 | 77.67 | 71.13 | 75.48 |
| DINOv2-ViT-B/14 | EdgeCape | ICLR 2026 | 82.23 | 81.21 | 76.35 | 79.93 |
| SwinV2-Tiny | GraphCape | ECCV 2024 | 84.78 | 84.68 | 79.35 | 82.94 |
| SwinV2-Tiny | CapeX | ICLR 2025 | 85.68 | 85.79 | 79.69 | 83.72 |
| SwinV2-Tiny | GenCape | ICLR 2026 | 78.59 | 79.60 | 73.63 | 77.27 |
| SwinV2-Tiny | FlowCape | ECCV 2026 | 86.72 | 86.59 | 80.23 | 84.51 |
| SwinV2-Small | GraphCape | ECCV 2024 | 84.97 | 85.23 | 79.92 | 83.37 |
| SwinV2-Small | CapeX | ICLR 2025 | 89.35 | 89.99 | 84.88 | 88.07 |
| SwinV2-Small | GenCape | ICLR 2026 | 87.61 | 84.35 | 80.66 | 84.21 |
| SwinV2-Small | FlowCape | ECCV 2026 | 91.56 | 90.49 | 85.32 | 89.12 |
在基准数据集 MP-100 上(1-shot 设定,5-split 平均 [email protected]),FlowCape-T 取得 88.40% 的平均 PCK(在 Split 3 和 Split 4 超过 CapeX-T),FlowCape-S 达到 91.65%,微幅超越 CapeX-S(91.50%),表明在通用无遮挡或弱遮挡常规分布下 FlowCape 同样保持顶尖的判别精度。
消融实验¶
在 Occ80 的 Split-1 上(SwinV2-Tiny 骨干),对系统核心模块与各项监督损失进行系统性消融验证:
| 配置 | \(\mathcal{L}_{\mathrm{ODE}}\) | H-Init | \(\mathcal{L}_{\mathrm{init}}\) | \(\mathcal{L}_{\mathrm{rfm}}\) | \(\mathcal{L}_{\mathrm{flow}}\) | \(\mathcal{L}_{v_0}\) | [email protected] | \(\Delta\) |
|---|---|---|---|---|---|---|---|---|
| 基线(CapeX) | - | - | - | - | - | - | 85.68 | 0.00 |
| 仅 ODE 轨迹(无引导) | ✓ | - | - | - | - | - | 72.81 | -13.31 |
| + 热图初始化引导 | ✓ | ✓ | ✓ | - | - | - | 85.56 | -0.12 |
| + 黎曼骨架度量损失 | ✓ | ✓ | ✓ | ✓ | - | - | 86.22 | +0.54 |
| + 欧氏流回归损失 | ✓ | ✓ | ✓ | ✓ | ✓ | - | 86.58 | +0.90 |
| + 初速度正规化 | ✓ | ✓ | ✓ | - | - | ✓ | 86.41 | +0.73 |
| 完整模型 FlowCape | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | 86.72 | +1.04 |
同时,针对初始化策略进行独立消融分析: - 20步图像中心初始化(20S-Query):83.13% - 30步图像中心初始化(Query):84.77% - 热图引导初始化(Heatmap-guided):86.72% - 置信度加权热图引导(Confidence-guided):86.71%
关键发现¶
- 初始化质量决定流匹配输运上限:未采用热图初始化的纯粹 ODE 积分性能剧烈下跌 13.31%(跌至 72.81%),根本原因在于严重遮挡场景下位姿后验高度多模态且模糊,长轨迹积累误差使无约束的速度场严重漂移;而一旦引入热图初始化(H-Init),性能即刻跃升回 85.56%,成功将多模态位姿搜索坍缩至局部可控邻域。
- 骨架拉普拉斯正则化有效保持刚性构型:引入 \(\mathcal{L}_{\mathrm{rfm}}\) 带来超过 0.5% 的净增益,定性结果证明其有效避免了严重遮挡下肢体关节在图像边缘的无规律错配,保证了未见物种四肢拓扑关系的合理解析。
- 参数敏感性与深度收益:黎曼位姿头深度 \(N_h=3\) 时达到性能峰值(86.72%),继续加深到 \(N_h=4\) 时性能反而微跌至 84.96%,表明过深的网络对于流场方向预测容易引起过参数化和冗余变换;特征隐藏维度 \(D_h=256\) 提供了性价比最优的表征能力。
亮点与洞察¶
- 生成流视角重塑 CAPE 遮挡难题:摒弃传统将关键点回归视为一阶判别映射的固有思维,巧妙借助连续时间流匹配将遮挡下的位姿恢复刻画为在先验流形上的概率连续输运,以 ODE 演化代替单步硬预测,优雅消解了过度自信问题。
- 拓扑感知黎曼度量无缝融入流场:不是机械地将图卷积拼接入网络,而是利用骨架图拉普拉斯矩阵构造非欧空间下的速度梯度损失,在数学层面把骨架物理连接约束直接编码为输运流场的曲率惩罚。
- 双模态共享头部架构设计:单个黎曼位姿头在 \(t=0\) 时作为跨模态特征相似度评分器,在 \(t>0\) 时复用为条件速度矢量场网络,模型参数高度紧凑且两阶段特征感知完全互通。
局限与展望¶
- 推断计算耗时随 ODE 步数增加:虽然相较扩散模型几十上百步的迭代,FlowCape 仅需 20~30 步 Euler 积分,但相比单步直接回归模型(如 CapeFormer 或 CapeX),推断延迟仍然偏高,在边缘机器人具身系统中实时运行面临挑战。
- 依赖文本描述的准确性:支持线索严重依赖关键点的细粒度文本描述(如 GTE 提取的语义),若未见类别具有生僻或难以文字界定的特殊解剖结构,文本匹配引导可能退化。
- 未来方向:可进一步探索基于一致性模型(Consistency Models)或整流流(Rectified Flow)的多步步进蒸馏算法,将 30 步 ODE 压缩至 1~2 步完成,兼顾生成输运的鲁棒性与实时推断吞吐。
相关工作与启发¶
- vs CapeX / CapeLLM: CapeX 开创性地采用文本点解释消除对视觉支持样本的依赖,但底层仍采用 DETR 式的直接坐标回归,在局部遮挡时极易受背景干扰漂移;FlowCape 继承了文本点描述作为条件先验的灵活性,同时采用生成式条件流匹配构建结构化输运轨迹,大幅增强了遮挡容忍度。
- vs GraphCape / GenCape: GraphCape 首次将图神经网络引入 CAPE 拓扑建模,GenCape 则探索了自适应图邻接学习;FlowCape 的本质区别在于并未把图仅作为特征增强模块,而是将其拉普拉斯矩阵作为黎曼速度场切空间的度量算子,实现了动力学与几何拓扑的内生统一。
- vs DiffPose / FMPose3D: DiffPose 将扩散模型用于姿态不确定性建模但训练与推理开销极大;FlowCape 采用更加轻量且积分轨迹直线的流匹配框架,并针对未见类别任意拓扑专门设计了非欧度量与引导势能。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将条件流匹配与非欧黎曼骨架度量引入类别不可知姿态估计,成功攻克严苛遮挡瓶颈。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 MP-100 全面评测,并专门构建包含 80 个类别、15,562 标注样本的严苛遮挡 Occ80 基准与详实消融。
- 写作质量: ⭐⭐⭐⭐⭐ 理论推导严密自洽,框架与方法动机阐述清晰透彻,图表呈现精细完备。
- 价值: ⭐⭐⭐⭐⭐ 为通用关键点检测、具身智能未见物体操作及动物姿态估计提供了极具启发性的鲁棒解题范式。