Scalable Cross-embodiment Dexterous Grasping via Morphology-Prior Diffusion¶
会议: ECCV 2026
论文: ECCV 原文
领域: 机器人 / 具身智能
关键词: 跨本体灵巧抓取, 3D拼装, 形态先验扩散模型, 无标注零样本迁移, 逆运动学优化
一句话总结¶
将跨本体灵巧抓取重构为刚体Link的3D拼装问题,提出共享形态先验扩散模型SOMO,结合冻结的3D几何编码器与基于正向运动学自探索的无分类器引导训练,仅凭URDF即可实现对未见机械手的零样本高质量抓取合成。
研究背景与动机¶
多指灵巧抓取是机器人实现人类级别精细操作的基础能力,但现实中机械手构型高度多样,涵盖从双指平行夹爪、欠驱动手爪到高自由度仿人多指手的巨大形态跨度。传统针对单一特定手设计的专用模型难以应对日益丰富的机器人本体,迫切需要通用的跨本体(cross-embodiment)抓取合成方案。然而,现有跨本体抓取方法面临严峻的可扩展性瓶颈。以接触图或可形变场为代表的物体中心(object-oriented)方法,虽然在物体表面预测接触几何具备一定的跨手迁移潜力,但严重依赖后置的逆运动学(IK)求解以消除穿透并满足关节限位约束,面对复杂物体几何或视点受阻的残缺观测时收敛极慢且极易陷入局部极值;而以距离矩阵或交互图扩散为代表的交互中心(interaction-oriented)方法(如 D(R,O) 和 T(R,O)),往往将特定手的几何特征与交互模式深度耦合,受限于固定的图拓扑节点数或因面积加权采样导致微小指尖几何信息丢失,在拓展到多种异构机械手时性能急剧退化。
更根本的矛盾在于,现有方法普遍假定每个机械手本体都具备成对的“物体-抓取”真实交互标注数据。在仿真或真实世界中为每款新型机械手采集、清洗数十万条高质量抓取演示极其耗时耗力,使跨本体模型的部署成本随着硬件构型的增加呈线性膨胀。而若退而求其次将不同机械手映射到预定义的统一规范空间(如 UniMorphGrasp 映射至 24 自由度 ShadowHand),又不可避免地需要繁琐的人工关节对齐,且无法推广至拓扑结构迥异的非仿人手爪。如何在不增加特定硬件网络分支、无需人工关节映射的前提下,让单个生成模型原生支持任意拓扑与关节数量的机械手,并使新机械手无需任何抓取标注仅凭 URDF 描述即可实现零样本泛化,是跨本体灵巧抓取领域亟待突破的核心挑战。
针对这一瓶颈,本文将灵巧抓取重新解构为刚体零件在物体周围的“3D空间拼装”任务。既然机械手的每个刚体连杆(Link)本质上都是一个刚体构件,那么抓取构型便可直接参数化为一组变长刚体Link的 \(SE(3)\) 空间位姿集合。通过结合大规模预训练的几何编码器统一连杆与物体的形状空间,并借助正向运动学自探索学习机械手合法的空间几何构型分布,模型摆脱了对手部关节自由度与运动学树的显式依赖。核心 idea:将跨本体抓取解构为变长刚体Link的3D拼装生成,利用统一的3D几何特征空间与基于正向运动学自探索的无分类器形态先验扩散,仅凭机械手URDF即可实现无交互标注的跨本体零样本灵巧抓取合成。
方法详解¶
整体框架¶
SOMO(Scalable Morphology-Prior Diffusion)的整体流水线将跨本体抓取解耦为两个核心阶段:基于几何驱动的连杆位姿扩散生成阶段,以及确保物理可执行性的后置逆运动学(IK)联合优化阶段。输入包含待抓取物体的表面点云 \(O\) 以及由 URDF 文件描述的机械手本体 \(e\)。首先,机械手被解析为 \(L_e\) 个刚体连杆,每个连杆的点云与物体点云通过同一个冻结的大规模预训练 3D 形状感知编码器映射至共享几何潜空间;随后,去噪网络以物体几何特征为条件,通过自注意力与交叉注意力机制迭代预测所有连杆的去噪 \(SE(3)\) 位姿;最后,利用快速逆运动学求解器在关节角限位内将分散的连杆位姿重构为物理合法的机械手关节配置。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:物体点云与机械手URDF"] --> B["3D形状感知编码<br/>统一编码物体与连杆几何"]
B --> C["刚体连杆变长Token化<br/>构建SE(3)位姿与形态Token"]
C --> D["双路形态先验扩散去噪<br/>自注意力解耦运动学+交叉注意力注入物体"]
D --> E["预测各连杆SE(3)抓取位姿"]
E --> F["后置逆运动学优化<br/>Pyroki求解关节角与限位投影"]
F --> G["输出:可执行机械手抓取构型"]
关键设计¶
1. 3D拼装形式化与均匀刚体Link表征:打破运动学拓扑限制与指尖几何稀释 以往基于关节角生成的扩散模型将动作空间绑定在特定机械手的运动学拓扑上,一旦关节数量或拓扑发生变化,整个网络架构就必须重新定义或依赖人工对齐的规范化映射。SOMO 反其道而行之,从 URDF 解析出机械手的 \(L_e\) 个刚体连杆,直接在 \(SE(3)\) 刚体变换流形上进行建模,将每个连杆 \(l\) 的位姿表示为由平移向量 \(t_l \in \mathbb{R}^3\) 与轴角旋转向量 \(r_l \in \mathbb{R}^3\) 组成的 6 维向量 \(T_l = [t_l, r_l]\)。为了克服前作 T(R,O) 采用表面积加权采样导致指尖等细小但抓取关键连杆点云稀疏、特征被严重稀释的弊端,SOMO 引入均匀点云采样策略:对每个连杆网格严格均匀采样 \(K=512\) 个带法向量的表面点,确保所有连杆在特征表征上享有完全平等的表达容量。每个连杆经几何编码后得到固定的形态嵌入 \(e_l \in \mathbb{R}^{d_{link}}\),与扩散加噪位姿拼接为机械手 Token:
其中平移向量在以物体为中心的归一化坐标系中进行规范化。由于去噪主干采用标准的 Transformer 架构,变长的连杆集合被视作天然的 Token 序列,使得单一模型无需任何针对特定机械手的结构调整,即可无缝支持从 5 个连杆的双指夹爪到多达 21 个连杆的复杂多指灵巧手。
2. 共享3D形状感知几何编码空间:促进跨域连杆与物体互补性推理 在 3D 拼装任务中,零件之所以能紧密拼合,核心在于各零件接触表面几何特征的几何互补性。为了让去噪网络中的注意力机制能够有效推理出每个机械手连杆表面应如何与物体的局部凸凹结构相吻合,SOMO 摒弃了以往手部与物体分别采用 BPS 或不同 VQ-VAE 编码的异构表征,全面引入冻结的 TripoSG 大规模预训练 3D VAE 编码器 \(\Phi\)。该编码器在大规模 3D 资产库上预训练,具备极强的几何先验感知能力。物体的表面点云通过 \(\Phi\) 被编码为 \(P\) 个具有局部几何特征的补丁 Token \(V_O \in \mathbb{R}^{P \times d_O}\);同时,所有机械手连杆网格通过同一个 \(\Phi\) 提取几何潜向量,并经由两层轻量 MLP \(\phi_{link}\) 映射为连杆嵌入 \(e_l\)。由于连杆几何在给定机械手后完全固定,该嵌入在初始化阶段仅需离线计算一次并缓存。这种共享几何空间赋予模型两大核心优势:一是使模型在跨注意力计算中能够直接度量连杆几何与物体表面的契合度,二是能将任意新机械手的连杆几何天然投影至已知的同一潜空间中,奠定了零样本迁移的几何基础。
3. 基于正向运动学自探索的形态先验与无分类器扩散引导:消除跨本体标注依赖 为彻底解决每个新机械手都必须采集真实抓取演示的扩展难题,SOMO 创造性地重构了无分类器引导(Classifier-Free Guidance, CFG)范式。传统 CFG 的无条件分支仅是简单丢弃条件标签,而 SOMO 则将无条件分支改造为一个专门学习合法手部构型分布的“形态先验通路(Morphology-Prior Path)”。对于任何新机械手,无需任何物体抓取演示,只需从其 URDF 定义的关节限位 \([q_{min}, q_{max}]\) 内进行正向运动学(FK)随机自探索:首先随机采样手掌协同闭合系数 \(\alpha \sim (0.1, 0.9)\) 确定基底姿态 \(q_{base}\),再叠加密度适中的高斯扰动并硬截断至物理关节限位内,配合全空间随机根旋转,通过正向运动学生成海量运动学合法的连杆位姿目标。在此通路上,物体特征被置零(\(V_O = 0\))并关闭交叉注意力,仅依靠自注意力机制捕捉各连杆在真实机械手中内在的运动学协同约束。
在训练阶段,模型联合优化有监督抓取损失 \(\mathcal{L}_{GT}\) 与无标注机械手的形态先验损失 \(\mathcal{L}_{no-GT}\):
在推理阶段,对于从未参与过任何抓取标注训练的新手,模型执行双分支引导去噪采样:
无条件分支基于自探索先验牢牢锚定机械手的运动学有效性,防止连杆散落;条件分支则借助跨本体共享注意力将其他手学到的“物体-连杆接触规律”迁移至当前构型。通过设置适度的引导尺度(如 \(s=1.25\)),放大了物体引导强度,从而实现了仅凭 URDF 文件的真正零样本灵巧抓取。
损失函数 / 训练策略¶
SOMO 去噪主干为一个 8 层 Transformer(隐层维度 \(d=384\)),采用 AdaLN-Zero 调制时间步嵌入。扩散前向过程对平移和旋转拼合的 6 维位姿应用 1000 步线性加噪调度(\(\beta \in [10^{-4}, 0.02]\)),去噪网络分别输出平移噪声 \(\hat{\epsilon}_{t\theta,l}\) 和旋转噪声 \(\hat{\epsilon}_{r\theta,l}\)。由于不同机械手的连杆数量不同,损失函数按有效连杆平均均方误差进行归一化计算:
有监督数据以概率 \(p_{uncond}=0.1\) 随机丢弃物体条件。训练采用 Adam 优化器,基础学习率 \(10^{-4}\),梯度截断阈值为 1.0。推理时采用 100 步 DDIM 加速采样。去噪输出的 \(SE(3)\) 连杆位姿通过高效的 Pyroki 库调用 Levenberg-Marquardt 算法进行逆运动学求解,最小化正向运动学末端位置误差并投影至关节限位内,单手求解耗时低至数毫秒。
实验关键数据¶
主实验¶
实验基于 CMapDataset 扩充的抓取数据集,包含来自 ContactDB 和 YCB 的 48 个训练物体及 10 个完全未见测试物体。测试在 Isaac Gym 物理仿真引擎中执行,在施加 6 个方向的外力扰动下位移小于 2 cm 即判定为抓取成功。对比涵盖 3 手、4 手和 7 手三种不同跨本体复杂度规模,全面衡量成功率(Suc. %)、多样性(Div.)与单次抓取耗时(Eff. 秒)。
| 训练规模与方法 | Allegro (Suc./Eff.) | Barrett (Suc./Eff.) | ShadowHand (Suc./Eff.) | LEAPHand (Suc./Eff.) | Robotiq (Suc./Eff.) | EZGripper (Suc./Eff.) | 平均成功率 (Avg. Suc.↑) | 平均耗时 (Avg. Eff.↓) |
|---|---|---|---|---|---|---|---|---|
| 3 手配置 | ||||||||
| D(R, O) [33] | 92.10% / 0.19s | 87.50% / 0.42s | 83.00% / 0.78s | - | - | - | 87.53% | 0.46s |
| T(R, O) [6] | 93.50% / 0.03s | 91.90% / 0.03s | 94.49% / 0.03s | - | - | - | 93.90% | 0.03s |
| SOMO (本文) | 94.80% / 0.02s | 88.80% / 0.02s | 93.50% / 0.01s | - | - | - | 92.37% | 0.02s |
| 4 手配置 | ||||||||
| D(R, O) [33] | 89.90% / 0.20s | 85.00% / 0.40s | 83.70% / 0.73s | 20.10% / 0.34s | - | - | 69.69% | 0.42s |
| T(R, O) [6] | 97.20% / 0.03s | 86.20% / 0.03s | 94.00% / 0.03s | 36.30% / 0.03s | - | - | 78.42% | 0.03s |
| SOMO (本文) | 94.30% / 0.02s | 90.00% / 0.01s | 91.30% / 0.02s | 55.40% / 0.02s | - | - | 82.75% | 0.02s |
| 7 手配置 (基础数据) | ||||||||
| D(R, O) [33] | 92.70% / 0.21s | 87.20% / 0.41s | 73.10% / 0.72s | 42.00% / 0.34s | 12.90% / 0.30s | 78.80% / 0.32s | 64.45% | 0.39s |
| T(R, O) [6] | 94.40% / 0.03s | 91.30% / 0.03s | 89.70% / 0.03s | 59.00% / 0.03s | 8.60% / 0.04s | 39.30% / 0.04s | 63.72% | 0.03s |
| SOMO (本文) | 97.60% / 0.02s | 92.80% / 0.01s | 91.00% / 0.02s | 65.30% / 0.02s | 29.70% / 0.01s | 97.20% / 0.01s | 78.93% | 0.02s |
| 7 手配置 (扩展数据) | ||||||||
| D(R, O) [33] | 89.30% / 0.22s | 85.50% / 0.40s | 78.30% / 0.73s | 40.77% / 0.34s | 10.10% / 0.30s | 79.50% / 0.31s | 63.91% | 0.38s |
| T(R, O) [6] | 96.00% / 0.03s | 84.60% / 0.03s | 88.00% / 0.03s | 62.00% / 0.03s | 10.60% / 0.04s | 54.00% / 0.03s | 65.87% | 0.03s |
| SOMO (本文) | 91.20% / 0.02s | 90.80% / 0.01s | 94.80% / 0.02s | 67.70% / 0.02s | 44.20% / 0.02s | 97.40% / 0.01s | 81.02% / 0.02s |
消融实验¶
消融实验包含核心网络模块逐步引入的架构消融(4 手平均)以及无标注新手在推理时的无分类器引导尺度 \(s\) 敏感性测试。
| 配置 | 参数量 | 变长Token | Link编码器 | Object编码器 | 平均成功率 (Suc.↑) | 抓取多样性 (Div.↑) | 平均耗时 (Eff.↓) |
|---|---|---|---|---|---|---|---|
| T(R, O) 基线 | 28.06M | \(\times\) | BPS | VQ-VAE | 78.42% | 0.41 | 0.03s |
| 变体 I (固定拓扑+双VAE) | 23.80M | \(\times\) | 3D VAE | 3D VAE | 80.58% | 0.41 | 0.01s |
| 变体 II (变长Token+传统编码) | 23.80M | \(\checkmark\) | BPS | VQ-VAE | 79.38% | 0.40 | 0.02s |
| 变体 III (变长Token+Link VAE) | 23.80M | \(\checkmark\) | 3D VAE | VQ-VAE | 81.63% | 0.42 | 0.01s |
| SOMO 完整模型 | 23.80M | \(\checkmark\) | 3D VAE | 3D VAE | 82.75% | 0.42 | 0.01s |
在无标注新机械手(以 Barrett 为例,模型仅在其余手带标注训练)的推理引导尺度测试中: - 当 \(s=0.75\) 时,成功率为 80.8%(条件信号偏弱); - 当 \(s=1.00\) 时,成功率为 81.4%; - 当 \(s=1.25\) 时,成功率达到峰值 83.1%(适度放大来自其它本体迁移的条件线索,同时受形态先验稳定约束); - 当 \(s \ge 1.50\) 时性能逐步退化(\(s=1.5\) 为 81.7%,\(s=2.0\) 降至 79.9%,过强的外推扰乱了机械手的运动学一致性)。
此外,留一法(Leave-One-Out)零样本迁移评测表明:当某机械手完全剥离抓取标注、仅通过正向运动学自探索训练形态先验时,SOMO 在 Allegro 上取得 93.30% 成功率(基线 D(R,O) 仅 43.20%),在 Barrett 上达 80.40%(基线 60.80%),在 ShadowHand 上达 78.00%(基线 30.80%),在挑战性的 LEAPHand 上达 32.40%(基线近乎失效的 2.80%),平均超越最强预训练基线超过 36 个百分点。
关键发现¶
- 跨本体规模可扩展性断层领先:当机械手种类从 3 款扩充到 7 款时,基线 T(R,O) 的平均成功率断崖式下跌 30.18 个百分点(93.90% \(\rightarrow\) 63.72%),D(R,O) 下跌 23.08 个百分点;而 SOMO 仅轻微下降 13.44 个百分点,并在融入扩展数据后迅速反弹至 81.02%,证明 SOMO 能够真正吸收跨本体几何多样性,而非受本体间运动学差异的负面干扰。
- 共享几何度量空间是泛化的关键钥匙:架构消融表明,仅将连杆编码从 BPS 替换为 3D VAE 即可带来 +2.25 pp 提升,将物体编码同步统一后累积提升达 +3.37 pp,印证了在同一个潜空间内度量手部零件与物体表面的几何契合度至关重要。
- 逆运动学求解并非生成瓶颈:1000 次样本的失败归因分析显示,Pyroki IK 求解超时的比例极低(Allegro 仅 2.2%,Shadow/Barrett/EZGripper 均为 0.0%,LEAP 为 10.9%),绝大多数失败来自扩散模型生成了运动学上虽可达到、但物理交互上无法产生足够法向闭合力的亚优位姿。
亮点与洞察¶
- 3D拼装视角降维打击复杂运动学:跳过错综复杂的层级关节链、耦合传动与限位约束,将机械手解构为散装连杆的 3D 几何拼装,使扩散生成模型完全摆脱硬件特定维度的束缚,实现真正意义上的跨构型架构统一。
- 无分类器引导的降维妙用:摒弃传统 CFG 仅用于“条件丢弃”的单一思路,将无条件分支赋能为“基于正向运动学自探索的无监督物理形态流形拟合”,无需标注数据即可教会模型“手长什么样”,巧妙实现了零样本硬件迁移。
- 极度轻量与高吞吐部署潜力:全模型仅 23.8M 参数,结合 100 步 DDIM 与 Pyroki GPU/CPU 高速求解,单次抓取仅需 0.02 秒,较传统交互矩阵优化方法提速 10 到 40 倍,完全满足移动机械臂在线实时重规划的要求。
局限与展望¶
- 孤立物体假设与杂乱场景适应性:当前评测主要针对单物体孤立场景,面对密堆积、重度自遮挡与物体间多重交互的杂乱环境,点云分割与局部表面补全难度增大,可能影响几何互补性推理。
- 极端欠驱动机构的 IK 病态映射:对于机械连杆耦合度极高、关节自由度极少的特殊欠驱动手,从离散 \(SE(3)\) 空间到位姿空间的反解投影矩阵可能呈现严重病态,导致 IK 难以找到满足全部连杆位姿的全局最优解。
- URDF 连杆切分粒度的敏感性:若机械手 URDF 将指节切分为过多细碎零件,会显著增加扩散生成的 Token 数量与去噪难度;且对称互换构件(如同构指尖)容易产生拼装歧义性分配问题。
相关工作与启发¶
- vs D(R, O) [33]: D(R,O) 构建手部与物体点云密集对应的距离矩阵,参数开销随采样点呈二次方增长且对位姿初始化极其敏感;SOMO 采用稀疏的刚体连杆 Token 化表示,生成速度提升 10-40 倍,且跨本体扩展能力大幅占优。
- vs T(R, O) [6]: T(R,O) 依赖固定节点数的异构图网络与基于面积的连杆点云加权采样,严重丢失指尖细节且无法泛化到不同连杆数的机械手;SOMO 采用变长 Transformer 与均匀采样,天然适配任意连杆数的多样性手爪。
- vs UniMorphGrasp [36]: UniMorphGrasp 强行将所有机械手映射到统一的 ShadowHand 24 自由度规范空间并使用掩码丢弃不存在的关节,需要繁琐的手动对应且无法处理非仿人手;SOMO 直接利用 URDF 固有连杆,完全不需要人工关节对齐。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [将灵巧抓取重塑为3D拼装,并创新性将CFG无条件分支改造为FK形态先验,构思极其精巧]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖6+1款异构机械手、跨本体规模渐进扩展、完整的留一法零样本测试与真机验证]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑链路严密自洽,问题切入与设计对应清晰有力]
- 价值: ⭐⭐⭐⭐⭐ [彻底打破了跨本体灵巧抓取每手必须采集标注的数据墙,具备重大的工程应用与学术启发价值]