跳转至

MemPose: Category-level Object Pose Estimation with Memory

会议: ECCV 2026
论文: ECCV 原文
代码: 暂未开源
领域: 3D视觉
关键词: 类别级位姿估计, 几何记忆库, 3D视觉, 动态更新, 门控融合

一句话总结

MemPose 针对类别级物体位姿估计中静态先验与固定网络参数难以适应实例多样性的瓶颈,提出了显式整合非参数化几何记忆库的增强框架,通过相似度引导的动态更新机制与自适应门控检索融合,在零额外可学习先验权重的开销下显著提升了 9-DoF 位姿预测精度。

研究背景与动机

在人机协作与机器人具身操作等下游任务中,类别级物体位姿估计(Category-level Object Pose Estimation, COPE)要求模型在没有目标实例精确 CAD 模型的设定下,直接根据 RGB-D 观测预测未见物体在预定义类别内的 9-DoF 位姿(3D 旋转、3D 平移与 3D 尺寸)。然而,同一类别内的物体在几何构型、长宽比例以及表面纹理上往往存在极其剧烈的域内差异。面对这种多样性,人类视觉认知系统通常并不仅依赖瞬时感受,而是自发调动先验记忆进行类比联想,并在接触新实例的过程中持续动态更新经验库,以此辅助当前未知物体的理解与判断。

反观现有的类别级位姿估计方案,主要分为两条静态路线:第一类基于显式形状先验(如 SPD、SGPA、DPDN),通过对预先计算的类别平均模型进行变形来匹配输入点云,但这类形状先验在构建完成后便彻底固化,既需要昂贵的离线预处理,又像静态原型一样无法随新观测扩充演进;第二类则是基于深度神经网络的参数化路线(如 HS-Pose、AG-Pose、SpherePose 等),尽管引入了 PointNet++、图卷积乃至大规模 DINOv2 视觉基础模型,但类别级几何表征被完全隐式编码进固定的网络权重中,在测试推理阶段无法像人类记忆一样动态沉淀与复用结构经验。

这两类方法的共有缺陷,在于缺乏动态累积并复用类别级几何结构记忆的机制。既然同类别内物体的局部部件存在显著的结构共通性,何不将参数化感知网络与非参数化的动态经验库结合起来?核心 idea:构建一个解耦的类别级几何记忆库,将局部关键点特征提炼为结构化条目并随新观测动态更新,在推理中通过注意力交叉检索与自适应门控融合为当前实例注入全局几何上下文,实现经验增强的稳健位姿估计。

方法详解

整体框架

MemPose 的整体处理流水线包含特征提取、记忆库交互与位姿回归三大环节。首先,模型接收物体的局部裁剪 RGB 图像与反投影点云,分别通过冻结的 DINOv2 提取密集语义特征,并通过 PointNet++ 提取局部几何特征,二者拼接后利用可学习的类别嵌入通过交叉注意力自适应检测出 \(M\) 个局部几何关键点及其局部表征;接着,将池化后的局部特征作为记忆条目送入动态记忆模块,该模块维护每个类别的记忆缓冲区,在训练期经过热身填满后通过相似度扰动合并机制持续动态更新;最后,以当前实例的关键点全局聚合特征为查询向量,对类别记忆库进行交叉注意力检索,检索所得特征经自适应门控机制与当前全局特征自适应融合,最终送入预测头解耦回归出 NOCS 规范化坐标与 9-DoF 位姿参数。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入 RGB-D 图像与点云<br/>DINOv2 + PointNet++"] --> B["自适应关键点检测<br/>提取局部几何表征"]
    B --> C["局部几何记忆库构建<br/>局部特征平均池化与投影"]
    C --> D["相似度扰动更新机制<br/>Gumbel 噪声余弦加权合并"]
    D --> E["交叉注意力检索与门控融合<br/>全局查询与记忆特征动态混合"]
    E --> F["位姿与尺寸解耦预测<br/>NOCS 坐标与 9-DoF 回归"]

关键设计

1. 局部几何记忆库构建:以池化局部特征避免时间相近性偏置

传统记忆增强方法通常倾向于将网络的最终输出特征直接存入外部缓冲区,然而在位姿估计这类对精细几何结构高度敏感的任务中,最终输出特征与模型当前训练轮次的网络状态强绑定,注意力检索极易退化为受时间临近性驱动,即倾向于抓取最新入库的条目而非几何结构真正相似的条目。为克服该问题,MemPose 显式构建基于局部几何特征的类别独立记忆缓冲区 \(\mathcal{M}^{(c)} \in \mathbb{R}^{L \times C}\)(缓冲区长度设为 \(L=96\))。入库前,模型对提取出的 \(M\) 个局部关键点特征 \(\mathcal{F}_{local}\) 进行无参数的全局平均池化得到 \(\mathcal{F}^{avg}_{local} \in \mathbb{R}^{1 \times C}\),随后通过轻量 MLP 投影和归一化生成入库特征: $\(\mathcal{F}_{mem} = \text{Norm}(\text{MLP}(\text{AvgPool}(\mathcal{F}_{local})))\)$ 这种设计将各实例最本质且稳定的局部部件拓扑结构提炼为无偏几何凭证。此外,系统设置了容量热身策略(Warm-up):只有当对应类别的缓冲区被初始样本完全填满后,才正式激活检索与更新流程,有效规避了训练初期网络特征震荡带来的噪声污染。

2. 相似度扰动更新机制:抑制显存膨胀与高频条目倾斜

如果任由记忆库无节制堆叠样本,不仅会导致推理显存激增,还会因大量冗余构型拖慢检索效率。MemPose 引入了基于余弦相似度的前置更新策略,新样本特征在检索发生前先对记忆库实施更新,以保证检索到的始终是最新的代表性特征。为了找出最适合合并的已有条目,常规操作是选取与新特征 \(\mathcal{F}_{mem}\) 余弦相似度最大的记忆条目进行简单平权滑动平均。然而,直接贪心选取容易陷入马太效应,导致少数代表典型构型的“高频”条目被反复刷新,而边缘但重要的结构模式被长期忽视。为此,模型在计算余弦相似度时注入了轻量级的 Gumbel 随机扰动 \(g = -\log(-\log(u)), u \sim \mathcal{U}(0, 1)\): $\(\cos(\mathcal{F}_{mem}, \mathcal{M}^{(c)}_i) \leftarrow \cos(\mathcal{F}_{mem}, \mathcal{M}^{(c)}_i) + \lambda g\)$ 在扰动后选出最佳匹配索引 \(i^*\),并执行加权合并更新: $\(\mathcal{M}^{(c)}_{i^*} \leftarrow \frac{1}{2}\left(\mathcal{M}^{(c)}_{i^*} + \mathcal{F}_{mem}\right)\)$ 该机制在保留相似样本聚类压缩优势的同时,通过随机扰动鼓励对次优条目进行适度更新,有效维护了记忆库中几何条目的丰富性与多样性。

3. 交叉注意力检索与自适应门控融合:动态注入类别级几何上下文

检索阶段的核心诉求是从沉淀的同类记忆中提取与当前实例位姿和结构最匹配的几何上下文,且不能破坏当前实例独有的细粒度几何表征。为此,模型首先通过图卷积几何聚合将关键点局部特征与其 \(k\) 近邻结构融合成全局表征 \(\mathcal{F}_{global} \in \mathbb{R}^{M \times C}\),并将其投影为查询矩阵 \(q\);同时将当前类别记忆库 \(\mathcal{M}^{(c)}\) 中的所有条目拼合构成键矩阵 \(k\) 和值矩阵 \(v\)。通过缩放点积注意力,读出记忆增强特征: $\(\mathcal{F}_R = \text{Softmax}\left(\frac{1}{\sqrt{D_k}} q k^T\right) v\)$ 为避免直接相加或拼接破坏原始特征在未见物体上的敏感度,模型构建了一个基于 Sigmoid 的自适应门控权重标量向量 \(w_a = \sigma(\mathcal{F}_R W_R + \mathcal{F}_{global} W_f)\),据此执行动态加权混合: $\(\mathcal{F}_{aug} = w_a \odot \mathcal{F}_R + (1 - w_a) \odot \mathcal{F}_{global}\)$ 当记忆库中存在高置信度同质先验时,门控机制自动增大 \(w_a\) 借助历史经验消除重度遮挡或视角缺失的歧义;而在面对极其奇异的构型时则倾向于保留当前原始感知特征,赋予模型极强的泛化弹性。

损失函数 / 训练策略

整个网络采用端到端多任务联合监督。记忆缓冲区在 PyTorch 中通过 register_buffer 注册,不计算梯度亦不受优化器参数更新影响,仅通过上述合并规则前向演化。总损失函数 \(\mathcal{L}_{all}\) 包含五项加权约束: $\(\mathcal{L}_{all} = \alpha_1 \mathcal{L}_{pose} + \alpha_2 \mathcal{L}_{div} + \alpha_3 \mathcal{L}_{ocd} + \alpha_4 \mathcal{L}_{rec} + \alpha_5 \mathcal{L}_{nocs}\)$ 其中 \(\mathcal{L}_{pose} = \|R_{gt} - R\| + \|t_{gt} - t\| + \|s_{gt} - s\|\) 为平移、旋转及尺度的 \(L_2\) 范数损失;\(\mathcal{L}_{div}\) 为关键点多样性间距损失,强制检测到的局部关键点之间欧氏距离大于间距阈值 \(th_1 = 0.01\)\(\mathcal{L}_{ocd}\) 为物体感知倒角距离损失,驱使关键点紧贴去噪后的物体几何表面;\(\mathcal{L}_{rec}\) 为关键点反向重建原点云的 Chamfer 距离损失;\(\mathcal{L}_{nocs}\) 为预测 NOCS 关键点与真实投影 NOCS 坐标之间的 Smooth \(L_1\) 损失。超参数权重分别设为 \(\alpha_1=0.3, \alpha_2=10.0, \alpha_3=2.0, \alpha_4=15.0, \alpha_5=2.0\)。模型采用 Adam 优化器在单个 NVIDIA L40 GPU 上训练 120k 迭代,学习率在 \(2\times 10^{-5}\)\(5\times 10^{-4}\) 之间依据周期三角策略(triangular2)调整。

实验关键数据

主实验

在真实世界基准 REAL275 以及涵盖高遮挡和反光/餐具挑战的 Housecat6D 数据集上,MemPose 与包括显式先验(Prior-based)和无先验(Prior-free)在内的 SOTA 方法进行了系统对比:

数据集 方法 形状先验 IoU50 IoU75 5°2cm 5°5cm 10°2cm 10°5cm
REAL275 DPDN (ECCV'22) - 76.0 46.0 50.7 70.4 -
GCE-Pose (CVPR'25) - 79.8 57.0 65.1 75.6 -
AG-Pose (CVPR'24) - 80.1 57.0 64.6 75.1 -
KeyPose (AAAI'25) - 80.8 57.7 66.0 78.8 -
SpherePose (ICLR'25) - 79.0 58.2 67.4 76.2 -
MemPose (本文) - 81.0 59.9 67.7 79.0 -
Housecat6D GCE-Pose (CVPR'25) 76.1 55.6 22.2 - 49.3 53.5
FS-Net (CVPR'21) 48.0 14.8 3.3 - 17.1 21.6
VI-Net (ICCV'23) 56.4 20.4 8.4 - 20.5 29.1
SecondPose (CVPR'24) 66.1 24.9 11.0 - 25.3 35.7
AG-Pose (CVPR'24) 76.9 53.0 21.3 - 51.3 54.3
SpherePose (ICLR'25) 72.2 - 19.3 - 40.9 55.3
MemPose (本文) 81.5 56.4 23.1 - 52.6 57.3

在跨场景野外自监督评测基准 Wild6D 上,MemPose 同样表现优异:在未见过的 486 段背景视频及 162 个真实物体上,IoU75 达到 46.2%(相比此前最优的扩散模型 MH6D 的 41.9% 提升了 4.3%),并在 5°2cm 指标上从 27.0% 提升至 29.7%。

消融实验

在 REAL275 数据集上对记忆存储类型、更新机制、检索规模和融合模式进行拆解验证:

实验组别 配置选项 IoU75 (%) 5°2cm (%) 5°5cm (%) 说明
存储特征类型 全局特征 (Global) 80.5 58.0 66.5 易受场景瞬时全局信息干扰
融合特征 (Fused) 80.4 58.1 66.8 包含后处理权重,泛化略低
局部特征 (Local, 默认) 81.0 59.9 67.7 稳固提取细粒度几何拓扑,最优
构建与更新策略 随机初始化 (Random) 80.4 58.0 65.0 早期噪声损坏记忆质量
无热身直接更新 (w/o warm-up) 80.8 59.0 66.0 未填满即检索带来不稳定
经典先进先出 (FIFO) 80.7 59.1 66.0 容易遗忘早期代表性构型
检索后更新 (Post-update) 80.7 59.0 65.2 检索时未能用上最新观测信息
相似度合并 + Top-k 采样 81.0 59.2 65.3 平衡更新但细粒度匹配稍逊
相似度合并 + Gumbel 噪声 (默认) 81.0 59.9 67.7 平衡多样性与精确聚类,表现最佳
特征融合方式 直接相加 (Add) 80.4 58.5 65.3 刚性叠加,容易引入模态冲突
通道拼接 (Concat) 80.5 58.0 65.0 缺少自适应选择权
门控加权融合 (Gating, 默认) 81.0 59.9 67.7 动态权衡记忆与当前输入,最优
记忆库长度 \(L=0\) (无记忆库,基线 AG-Pose) 79.5 57.0 64.6 缺少历史上下文支持
\(L=16\) 79.6 57.2 64.9 容量太小无法覆盖构型变化
\(L=48\) 80.0 58.5 66.5 性能稳步上升
\(L=96\) (默认) 81.0 59.9 67.7 精度与显存/耗时的最佳平衡点
\(L=256\) 80.8 59.1 67.9 提升边际递减,计算负担加重

关键发现

  • 局部特征入库是避免时间相近性陷阱的核心:将存储对象从网络输出端最终特征改为局部池化特征,5°2cm 精度从 58.1% 大幅跃升至 59.9%,证明局部几何细节比高层全局判别特征更能抵抗网络训练权重漂移。
  • Gumbel 扰动有效解决了记忆集中倾斜:相比确定性最大相似度贪心合并,引入 Gumbel 噪声让 5°2cm 提升了 0.7%,消融验证了分散高频更新、保持几何多样性的必要性。
  • 计算性价比极高:在参数量上,MemPose 相比 baseline(AG-Pose)仅增加 2M(225M vs 223M,来源于轻量门控与注意力投影层,记忆库本身为非参数化 buffer),训练速度(47.8 vs 47.5 min/epoch)与推理帧率(33 vs 35 FPS)几乎完全保持一致。即使将 baseline 补齐等量 MLP 参数,其 5°2cm 也仅有 57.8%,证实增益纯粹来自记忆机制而非单纯的参数堆砌。
  • 测试期动态更新潜力:若在测试推理阶段允许记忆库继续依据输入流进行无监督在线更新,REAL275 的 5°2cm 可从 59.9% 进一步飙升至 63.6%(见原文 Tab. 8),展现了极其强悍的测试时自适应(TTA)潜力。

亮点与洞察

  • 将长期类别先验解耦为非参数化动态结构:摒弃了固定形状 CAD 变形的脆弱性与纯网络静态权重的固步自封,用轻量 buffer 实现了显式几何类比。
  • 设计了巧妙的带噪相似度合并策略:既通过余弦相近合并实现了几何原型的无损压缩,又用 Gumbel 扰动打破了代表性条目被无限强化的马太效应,简单却极其有效。
  • 可迁移至其他 3D 感知任务:该记忆模块机制独立于具体的检测/位姿头,完全可以无缝迁移至 3D 目标检测、少样本点云分割或机器人机械臂抓取位姿跟踪等场景。

局限与展望

  • 类别缓冲区依赖离线定义:目前的记忆库是按预定类别 ID 进行索引隔离的,在面对完全未知的开集(Open-vocabulary)物体时,无法自适应创建新类别记忆簇。
  • 缺乏显式的时间淘汰机制:当前仅依赖相似度加权合并,若混入质量极差的退化点云特征,其负面影响可能会在记忆库中长期残留。
  • 未来方向:探索与开放词表视觉语言模型(如 CLIP/OpenShape)结合,构建类别无关、语义驱动的连续流式记忆库;并在真实机械臂闭环抓取中验证推理期在线记忆演化的泛化能力。

相关工作与启发

  • vs SPD / SGPA / DPDN: 这类传统方法依赖固定的类别 CAD 形状先验,需要复杂的变形网络和严格的离线均值模型提取;MemPose 无需任何显式 CAD 先验,直接在训练流中动态构建并更新紧凑几何记忆库。
  • vs AG-Pose / SpherePose: 这类 SOTA 无先验方法仅通过静态网络权重拟合几何对应关系;MemPose 在几乎不增加模型参数与推理延迟的前提下,赋予网络跨实例动态调用历史经验的能力,在 REAL275 和 Housecat6D 上均取得了全方位的指标突破。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [首次将动态非参数化几何记忆系统引入类别级 6D/9-DoF 位姿估计,思路清晰且极具启发性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 大主流基准,详细对比了参数量、FPS、耗时,并提供了深入的模块拆解与案例可视化]
  • 写作质量: ⭐⭐⭐⭐⭐ [叙述条理连贯,动机阐释精准,图表详实严谨]
  • 价值: ⭐⭐⭐⭐⭐ [为解决 3D 视觉与机器人位姿感知中的类内多样性与开集适应问题指明了极佳的记忆增强范式]