跳转至

CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5196
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9340.pdf
项目: https://cea-list.github.io/cotograspweb/
领域: 机器人 / 灵巧抓取
关键词: 接触拓扑、规范工作空间、物体无关训练、条件变分自编码器、力闭合

一句话总结

CoToGrasp只用机器人手部几何学习指定接触拓扑,经规范工作空间迁移到未见物体,再筛选并优化抓取,在DexGraspNet上将拓扑平均成功率从21.13%提升至26.72%、拓扑遵从率从14.28%提升至17.18%,但并不在无条件抓取成功率上全面占优。

研究背景与动机

多指手的价值不只是把物体抓牢,还在于选择哪些手指、哪些指节和掌面参与接触,为后续操作留下空间。单纯优化稳定性或力闭合,容易反复得到包覆式力量抓取;对于需要精细捏持或特定工具接触方式的任务,即使生成很多稳定候选,也可能没有一个符合预期。关节姿态变化大,同样不代表接触功能丰富。

用人类抓取分类来控制生成是一条直接路线,但把每种抓取类型绑定到物体网格和固定关节模板,需要大量带类型标注的物体交互数据。新物体局部几何一旦容纳不了模板,优化器可能放弃原先的接触要求,退回更容易稳定的包覆抓取。CoToGrasp沿用物体无关的训练思路,将学习对象转向结构固定、运动范围有限的手部表面,而不是种类无限的物体表面。

这里的语义不是任意语言指令,而是明确的接触区域组合。核心 idea:先在手中心的规范工作空间学习“哪些手部区域应在哪里接触”,再把物体局部几何投影到同一空间,让接触拓扑决定目标、几何验证决定可行性、关节优化完成落地。

方法详解

整体框架

推理输入是物体点云、目标接触拓扑和候选全局手位姿,输出是在该候选位姿下实现接触要求的关节配置。训练只输入不同关节配置下的手部点云与拓扑标签,预测规范工作空间中的接触区域;推理则将物体逆变换到手坐标系,反转物体法向后使用同一几何编码和生成网络。

这不是端到端预测完整抓取位姿的模型。全局旋转与平移由外部规划器、操作者或论文的拓扑条件启发式采样提供;网络负责局部接触生成,后端筛掉不合适的候选并求解关节角。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["训练:手部点云<br/>推理:物体与候选位姿"] --> Topology["手中心接触拓扑"]
    Topology --> Workspace["规范工作空间迁移"]
    Workspace --> Generation["拓扑条件接触生成"]
    Generation --> Validation["级联验证与关节优化"]
    Validation --> Output["满足接触要求的<br/>关节配置或候选拒绝"]
    Validation -->|"力闭合失败,重采样潜变量"| Generation

关键设计

1. 手中心接触拓扑:用接触区域定义类型,而非固定手势

作者采用Gonzalez分类中的21种接触拓扑,将手部划分为22个解剖接触区域,并归入精细、力量及物体特定三组。所谓物体特定组是面向特定工具使用的强约束接触类型,并不意味着训练时需要输入那些工具的网格。每个拓扑规定哪些区域参与接触,未激活区域记为0,激活点保留相应区域ID。

手部表示不是完整网格的无差别采样,而是能够用于抓取的活动接触表面的离散点集,即handprint。点的索引及其区域归属固定,坐标和法向随关节角通过正向运动学变化。于是同一个接触模板可以标注多种手形:保留“哪些部位必须接触”,允许“手指弯多少”随物体调整。这种分离也解释了为何分类是标签接口,而不是一套不能变形的关节模板。

2. 规范工作空间迁移:让手部与物体几何进入同一组空间位置

训练只见手、测试只见物体,直接把两类点云交给生成器会面临明显的几何域差异。CoToGrasp固定手掌位于原点,用手坐标系内的一组固定三维基点定义规范工作空间。输入点包含位置和表面法向,由修改后的DGCNN提取逐点局部特征,再通过带对齐距离门控的k近邻聚合,投影到这些固定基点上。因此模型读取的是“固定位置附近具有什么接触几何”,而不是某个物体自身的点序列。

推理时,物体先按候选手位姿做逆刚体变换,再反转法向。反转的作用是把接触时方向相反的物体表面转成预期手部表面的负模,使训练和推理中的局部朝向有可比性。对齐距离同时考虑距离与方向,避免空间接近却朝向不适合的点被视为接触。训练监督也投影到同一工作空间:每个基点取最近的运动学对齐手点标签,超出阈值则标0;正文给出的阈值为0.8,但不能将它直接解释成米制接触距离。

这一步不是简单把点云归一化到同一尺寸。关键是固定空间基点承担共同索引,局部特征承担几何描述,方向门控承担接触可行性约束,让网络在有限的手部运动流形上学到的结构能够迁移到未见物体。缓存中的对齐距离和投影公式有提取损坏,这里只说明正文可核实的机制,不补写其精确权重形式。

3. 拓扑条件接触生成:先约束大类,再生成类内变化

投影后的每个工作空间点作为一个token,拼接可学习的拓扑嵌入并加入正弦位置编码,再进入Transformer。拓扑信息被复制到每个位置,是为了避免深层注意力处理中目标类型信号被稀释;自注意力则让分散的指尖、指节和掌面区域可以共同决定一组接触是否具有合理的空间关系,而非独立分类每个点。

训练时,真实接触模板另经MLP嵌入,与Transformer特征拼接,通过Set Transformer的多头注意力池化和集合注意力块形成全局描述,再由CVAE编码器给出潜变量后验。解码器通过AdaLN接受几何条件,预测各工作空间点的接触区域概率。推理不需要真实模板或后验编码器,而从标准高斯先验采样潜变量。其建模分工是:拓扑条件处理宏观抓取类别,多次潜变量采样处理同一类别内部的接触位置变化;它并非依靠一个无条件高斯同时发现所有抓取类型。

4. 级联验证与关节优化:既要求该接触,也避免额外接触

网络输出并不保证某个候选位姿真的支持目标类型。第一个标签一致性检查比较目标与预测的接触区域集合,最多容许一个区域缺失或凭空出现;这里检查的是区域组合,不是逐点掩码必须完全一致。通过后,系统提取非零区域的三维基点,以各区域的重心近似构建抓取扳手空间并做力闭合判断。力闭合失败时重新采样潜变量,最多20次,以免对不合适的候选位姿无限搜索。

只有通过两级检查才执行关节优化。目标包含接触距离、手物穿透、手部自碰撞、关节限位,以及针对未使用手指和掌面的排斥项。前四项使目标接触能够落地,排斥项则对不应接触的部位施加5毫米安全间隔,防止优化器偷偷增加掌面或其他手指接触来换取稳定性。这使“不该碰哪里”成为接触语义的一部分,而不仅是求解后再分类的附加条件。

一个完整示例

考虑一个未见物体及一个不使用掌面的精细抓取请求。外部候选位姿先决定手从哪里接近,模型把物体变到掌心固定的坐标系后,将表面特征投影到工作空间,并生成带区域ID的接触预测。如果本应出现的区域大量缺失,即使预测看起来像稳定包覆抓取,也会在标签检查时被拒绝。

区域组合基本正确后,系统检查接触分布是否具备力闭合潜力;不满足则换一次潜变量采样,而不是立即优化全部关节。通过验证后,关节优化让所需指面靠近预测接触区域,同时把不参与的掌面推离物体。这个例子说明控制流程,并非论文额外报告的一次成功试验;几何不兼容时,最终允许返回拒绝,而非强行生成指定类型。

损失函数 / 训练策略

训练先均匀采样10,000个满足运动学约束的关节配置,计算各自的handprint,再分别配对全部21种模板,得到210,000条训练样本。该数据生成不需要物体网格或物理仿真,但仍需要已知手部几何、运动学和接触区域映射;“物体无关”并不等于“没有手部先验”。

网络端到端采用工作空间点上的多类交叉熵重建损失,并加入由β加权的KL正则,使后验接近标准高斯先验。正文将详细损失、网络超参数、投影参数和后端能量权重交给补充材料;当前缓存只含正文与参考文献,因此不推测这些数值。

实验关键数据

主实验

仿真使用Shadow Hand,分类条件对比使用DexGraspNet测试集,并将Dexonomy的Feix分类映射到本文接触分类。SR表示按论文引用协议评估的物理抓取成功率;TC表示对每个请求拓扑计算符合该语义模板的尝试比例,再对拓扑取平均,不能与SR混为一谈。自动分类采用Tversky相似度,额外接触受到比缺失接触更重的惩罚;对所有模板得分均低于0.5的抓取记为unknown。具体非对称权重未在当前正文中展开。

下表数据来自原文表2。两种平均SR分别以拓扑和物体为平均单位,不能互换。

方法 力量SR (%) 精细SR (%) 物体特定SR (%) 拓扑平均SR (%) 物体平均SR (%) TC (%) 语义熵
Dexonomy 27.16 12.36 19.62 21.13 23.80 14.28 0.77
CoToGrasp 29.75 22.71 25.50 26.72 27.56 17.18 0.84

语义熵是各拓扑TC归一化后的Shannon熵,再除以拓扑数的自然对数;稳定性熵同理,但用各拓扑SR构造分布。接近1表示各类型更均衡,并不意味着绝对成功率高。CoToGrasp的稳定性熵为0.96,Dexonomy为0.91。

消融实验

以下同样来自原文表2,消融对象是推理时的验证环节,不是Transformer或规范工作空间本身。

配置 精细SR (%) 拓扑平均SR (%) 物体平均SR (%) TC (%) 语义熵
完整CoToGrasp 22.71 26.72 27.56 17.18 0.84
去掉标签一致性检查 14.77 21.14 22.97 14.45 0.81
去掉力闭合检查 14.87 22.08 23.65 16.26 0.81
两种检查均去掉 14.73 21.06 23.00 14.72 0.81

关键发现

  • 相比Dexonomy,完整模型的精细SR增加10.35个百分点、拓扑平均SR增加5.59个百分点、TC增加2.90个百分点。最明显的类别收益是精细抓取,而不是已经较容易稳定的力量抓取。
  • 单独去掉标签检查使TC降低2.73个百分点,去掉力闭合检查使TC降低0.92个百分点;两者都会明显降低精细SR。双去除的TC并非严格低于每个单项消融,不能把各模块贡献简单相加。
  • 在另一组MultiDex子集的无分类条件对比中,CoToGrasp的SR为36.94%、语义熵0.83、报告速度0.11秒/抓取,GOAG分别为77.90%、0.6527、0.20秒/抓取。这支持语义分布更丰富与报告生成速度更快,不支持物理成功率全面领先;两者承担的拓扑约束也不同。
  • 实机为UR10搭配四指Allegro Right Hand,在YCB物体上展示形成并静态保持多种抓取;需要五指的M6被禁用。正文未给实机成功率、重复次数或下游动态操作成绩,不能将示例照片视为完整部署评测。

亮点与洞察

  • 接触的几何对偶性改变了学习域:从变化无限的物体表面转向有限的手部能力空间。规范工作空间进一步解决了训练和推理点云不一致的问题,而不仅是减少物体标注。
  • 语义控制包含正、负两面约束。指定区域负责“应该碰”,未激活区域的排斥项负责“不应该碰”,这个思想可用于需要保留操作空间的功能性抓取。
  • 分布均衡与单次稳定性被分开报告。对抓取生成器,仅看关节多样性或总体SR会掩盖类型塌缩;加入TC和归一化熵后,能够检查模型是否真的遵从请求。

局限与展望

  • 绝对TC只有17.18%,远未达到可靠地实现任意指定拓扑。作者将部分原因归于仿真中微小接触变化受到严格惩罚,但这不能消除实际语义控制仍不稳定的问题。
  • 全局6D位姿来自外部先验或启发式,不是模型联合学习的结果。增加局部重采样无法修复所有不合适的接近方向,后续应把位姿可行性与接触生成更紧密地结合。
  • 正文消融主要证明验证有效,没有单独量化规范工作空间、注意力结构、AdaLN或排斥项的贡献。不能把全部提升归因于某一个网络模块。
  • 仿真采用Shadow Hand、实机采用Allegro,但这不等于同一个模型无需适配即可跨手迁移。接触区域映射依赖手型,M6禁用也表明人类分类并非所有机械手都能完整实现。
  • 实机证据限于静态形成与保持,尚不足以证明工具操作、指间换位或接触连续切换能力。下一步应报告按拓扑分组的重复试验、动态任务成功率和端到端延迟。

相关工作与启发

  • vs GOAG:继承物体无关训练与近似力闭合验证思路,进一步加入显式接触拓扑条件、规范空间特征和语义检查。因此不宜将“完全不使用物体训练”单独当作本文首次提出的贡献。
  • vs Dexonomy:对比的是与关节及物体几何紧密绑定的类型生成和基于活动接触区域的生成。后者对形变更灵活,但依然需要验证与优化,并没有消除几何可行性约束。
  • vs GenDexGrasp / RobotFingerPrint:共同关心接触中间表示及几何对齐。本文将显式拓扑请求与固定工作空间结合,强调“是否生成了被要求的接触方式”,而不只衡量抓稳没有。
  • 后续研究启发:可让高层任务规划器提供拓扑和接近位姿,再用局部模型检查接触可行性。这是本文模块化接口支持的方向,不是已经完成的语言到动作系统。

评分

  • 新颖性: 4/5。接触拓扑、规范工作空间和物体无关学习结合明确,但继承了既有手中心生成路线。
  • 实验充分度: 3/5。包含条件基线、无条件分析和验证消融,实机主要为定性静态展示,网络级消融不足。
  • 写作质量: 4/5。训练与推理的几何转换及语义动机清楚,关键参数和部分评价细节依赖补充材料。
  • 价值: 4/5。为功能性灵巧抓取提供有用的表示和评测视角,距离高可靠动态操作仍有明显差距。