跳转至

RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation

会议: ECCV 2026
论文: ECCV 原文
领域: 机器人/具身智能
关键词: 机器人操作、关系可操作度、视觉基础模型、铰接物体操作、运动学约束流形

一句话总结

提出基于关系型 6D 可操作度图(Relational 6D Affordance Graph)的免训练机械臂操作框架,将语义拓扑推理与基于视觉基础模型的 SE(3) 位姿估计相结合,把下游执行重构为解析运动学流形约束满足与闭环重规划问题,在铰接物体与刚体任务上展现出强大的零样本泛化性能。

研究背景与动机

开放世界机器人操作的核心目标是让机械臂能够理解自如的自然语言指令,并可靠地与几何形态多样的未见物体进行交互。然而,连接高维多模态视觉感知与底层高精度物理控制之间始终存在显著的感知-动作鸿沟(perception-action gap)。近期的端到端数据驱动策略和基于视觉大模型的方法尝试通过大规模演示数据学习控制先验,但其在物体表示层面上陷入了表达能力与严格物理运动学约束之间的两难困境。

现有的物体表示在处理复杂的铰接物体(articulated objects,如微波炉、抽屉、笔记本电脑)时尤为脆弱。传统的 2D 像素级 affordance 热图缺乏真实的 3D 度量深度;基于稀疏点云或关键点的方法虽然能提供接触点坐标,却割裂了交互部件之间的连续几何关联,无法显式表示铰链旋转轴或滑轨移动方向;而密集 3D 描述符场虽然具有很高的空间表达力,但通常将操作建模为隐式能量场的梯度导航,根本缺乏刚体铰接机构不可或缺的硬性运动学约束。事实上,成功打开微波炉并不单取决于机械爪接触到把手,而是严格受制于炉门与炉身主体之间的相对刚体运动学边界。

本文的切入角度是:铰接操作的本质是由交互部件之间的相对刚体几何约束决定的,而非孤立的接触点。作者将操作目标拆解为主动交互部件与物理锚点部件构成的空间关系对。核心 idea:构建关系型 6D 可操作度图(Relational 6D Affordance Graph),将自然语言映射为主体-锚点部件的运动学语义拓扑,借助视觉基础模型将其具象化为度量 SE(3) 位姿,进而将下游执行完全重构为严格约束流形上的解析轨迹跟踪与闭环几何重规划。

方法详解

整体框架

RelAfford6D 包含三个核心阶段,形成从抽象语义到度量几何、再到严格物理控制的完整流水线: 1. 语义拓扑生成(Semantic Topology Generation):结合 LLM 语义推理与基于 PartNet-Mobility 构建的先验知识库检索(RAG),从未见物体的自然语言指令中推导出相互作用的主动部件(Primary Part \(s_p\))、物理锚点部件(Anchor Part \(s_a\))以及对应的运动学约束类型标记 \(a\)(如旋转或移动)。 2. 度量视觉定位(Metric Visual Grounding):利用开词表分割模型(SAM3)提取部件级 2D 掩码,再结合类别无关的位姿估计与跟踪模型(FoundationPose)推导出部件在世界坐标系下的绝对 6D 位姿 \(\mathbf{T}_P^*\)\(\mathbf{T}_A^*\),实例化空间关系图 \(\Psi\)。 3. 约束驱动运动学执行(Constraint-Driven Kinematic Execution):根据约束标记 \(a\) 与相对位姿解析推导螺旋轴与 1D 运动学流形(转动流形 \(\mathcal{M}_{\text{rev}}\) 或移动流形 \(\mathcal{M}_{\text{pris}}\)),结合全局 RRT-Connect 避障到达与局部流形轨迹跟踪,并在 5 Hz 视觉闭环反馈下实现动态在线重规划。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["自然语言指令 + RGB-D 观测"] --> B["语义拓扑生成<br/>知识库检索 + LLM 推断 (sp, sa, a)"]
    B --> C["度量视觉定位<br/>SAM3 分割 + FoundationPose 估计 SE(3) 位姿"]
    C --> D["运动学流形解析构建<br/>基于主体与锚点相对位姿推导螺旋轴与流形"]
    D --> E["双阶段轨迹生成<br/>RRT-Connect 全局到达 + 1D 流形跟踪离散路径"]
    E --> F{"闭环跟踪与扰动检测<br/>锚点漂移 > 5 cm?"}
    F -->|是| G["动态流形重规划<br/>重新解析流形并续接剩余路点"]
    F -->|否| H["执行完成并达到目标关节状态"]
    G --> H

关键设计

1. 语义拓扑生成:从开放语言推导物理有效的运动学链拓扑

开放世界 LLM 具备出色的常识推理能力,但直接生成的动作往往缺乏物理可执行性。为了解决这一痛点,该设计从 PartNet-Mobility 数据集中提炼构建了结构化运动学先验库 \(\mathcal{K} = \{((s_{pi}, s_{ai}), a_i)\}_{i=1}^N\)。当接收到用户指令时,LLM 先将其精简为语义查询 \(q\),通过语言编码器与知识库计算余弦相似度检索出 Top-\(k\) 个候选运动学链作为先验注入上下文,促使 LLM 生成严格的部件交互对 \(((s_p, s_a), a)\)。其中 \(s_p\)\(s_a\) 分别指定操作部件与基座锚点,而语义标记 \(a\) 直接担当运动学流形选择子(Kinematic Manifold Selector),杜绝了自由文本推理中将旋转门当成平移拉动、或丢失固定底座锚点的幻觉问题。

2. 度量视觉定位:级联基础模型实现部件级精确 SE(3) 空间实例化

将拓扑节点落地为物理控制需要高保真的度量位姿,而传统物体级位姿估计往往将整个物体视为刚体整体。该设计采用级联式解耦架构 \(g_{\text{percept}} = f_{\text{geo}} \circ f_{\text{sem}}\):首先使用概念分割模型 SAM3,以语言提示 \((s_p, s_a)\) 分割出部件级的独立 2D 掩码 \(\{M_p, M_a\}\);随后利用参考视角的深度观测重构出无类别 CAD 依赖的网格,输入类别无关的 FoundationPose,仅在对应的掩码区域内回归主动交互部件的 6D 位姿 \(\mathbf{T}_P^*\) 与锚点部件的位姿 \(\mathbf{T}_A^*\),得到实例化的空间关系图 \(\Psi = \{(\mathbf{T}_P^*, \mathbf{T}_A^*)\}\)。该设计摆脱了特定类别的 CAD 模板假设,在部件遮挡与复杂外观下依然提供了可解析的相对几何基准。

3. 约束流形跟踪与闭环动态重规划:将动作执行重构为解析几何求解

传统操作策略依赖大量示教轨迹回归端到端动作,在分布外场景极易因累积误差破坏机构关节。本文将操作执行直接建模为 SE(3) 运动学约束满足问题。末端执行器首先抓取主动部件建立初始刚体相对变换 \(\mathbf{T}_{\text{offset}} = (\mathbf{T}_P^*)^{-1}\mathbf{T}_{\text{ee}}(0)\)。随后根据动作类型 \(a\),运动被解析约束在锚点坐标系定义的 1D 子空间上: - 平移流形(\(a = \text{pull}\)):沿由主体与锚点相对几何推导出的螺旋轴 \(\xi_{\text{pris}} = (v, 0)\) 平移: $\(\mathcal{M}_{\text{pris}}(q) = \mathbf{T}_A^* \cdot \mathbf{Trans}(qv) \cdot (\mathbf{T}_A^*)^{-1} \mathbf{T}_P^* \cdot \mathbf{T}_{\text{offset}}\)$ - 旋转流形(\(a = \text{rotate}\)):绕锚定在 \(\mathbf{T}_A^*\) 的铰链转轴 \(\xi_{\text{rev}} = (u, p \times u)\) 旋转: $\(\mathcal{M}_{\text{rev}}(q) = \mathbf{T}_A^* \cdot \mathbf{Rot}(u, q) \cdot (\mathbf{T}_A^*)^{-1} \mathbf{T}_P^* \cdot \mathbf{T}_{\text{offset}}\)$

执行过程中采用两阶段规划:全局由 RRT-Connect 生成无碰撞抓取路径,局部则对 \(q \in [0, q_{\text{target}}]\) 均匀离散采样 \(N\) 个路点 \(\tau^* = \{\mathcal{M}_a(q_k)\}_{k=1}^N\) 严格沿流形运控。在执行期间,系统以 5 Hz 实时跟踪当前位姿 \(\hat{\mathbf{T}}_A(t)\);一旦检测到外部扰动引起锚点位姿偏差超过阈值 \(\delta = 5\text{ cm}\),立即在剩余区间 \([q_t, q_{\text{target}}]\) 内基于最新的物理边界条件动态更新流形并解析重算轨迹,无需启发式重启。

实验关键数据

主实验

在基于 SAPIEN 搭建的仿真环境中,部署 Franka Panda 机械臂(配备平行夹爪或吸盘)评测 10 类铰接物体操作任务。各学习型基准均在包含 20 类铰接物体的 10,000 条动作规划轨迹上统一训练,评测以关节状态变化量 \(|\theta_{\text{after}} - \theta_{\text{before}}| \ge 0.1\)(弧度或米)判定成功。RelAfford6D 保持完全零样本免训练。

方法 训练方式 铰接物体平均成功率 (%) 刚体-抓取 (PickCube) 刚体-堆叠 (StackCube) 刚体-推移 (PushCube)
Where2act 数据驱动 (10k 轨迹) 27.0 - - -
FlowBot3D 3D 流场预测 (10k 轨迹) 40.0 - - -
ManipLLM 多模态具身 LLM (10k 轨迹) 62.0 - - -
RoboMamba 具身 Mamba (10k 轨迹) 68.0 - - -
RDT-1B 扩散基座模型 (5k 示教) - 77.2 ± 0.48 74.0 ± 0.30 100.0 ± 0.00
OpenVLA VLA 基座模型 (5k 示教) - 8.0 ± 0.00 8.0 ± 0.00 8.0 ± 0.00
Diffusion-Policy 动作扩散策略 (5k 示教) - 40.0 ± 0.00 80.0 ± 0.00 88.0 ± 0.00
RelAfford6D (Ours) 完全免训练 (Zero-Shot) 74.0 100.0 ± 0.00 100.0 ± 0.00 100.0 ± 0.00

在真实世界环境(Realman RM75 机械臂 + 实感 D435 RGB-D)的 7 项任务评测中,RelAfford6D 同样取得领先表现:开微波炉达到 8/10,拉抽屉 8/10,压按压瓶 8/10,关笔记本 8/10,拧瓶盖 9/10,推叠方块 10/10,倒水/拿刮刀 9/10,平均成功率显著优于 ManipLLM(~60%)与 FlowBot3D(~30%)。

消融实验

在 10 项操作任务上进行系统性消融(每项任务 30 次试验),验证各组件对最终执行成功的贡献(数据引自原文 Table 4 与 Table 5):

配置 / 变体 成功率 (%) 机制说明与性能变化
完整模型 (Ours Full) 74.4 完整运动学检索 + SAM3 + 关系锚点约束 + 5 Hz 闭环重规划
无运动学先验检索 (No Retrieval) 65.0 仅依靠 LLM 裸提示词推理,出现丢失锚点或运动类型幻觉,掉点 9.4%
替换分割模型 (Grounding DINO 等) 68.5 边界框重叠导致细长部件位姿估计退化,掉点 5.9%
无物理锚点约束 (Anchor-Free) 48.5 仅跟踪操作部件 \(\mathbf{T}_P^*\),缺少锚点导致铰链轨迹偏离,暴跌 25.9%
无动态流形重规划 (No Replanning) 35.0 开环执行,外力扰动导致物体移位后轨迹彻底失效,暴跌 39.4%
视觉干扰鲁棒性 - 干净背景 78.0 / 82.0 开微波炉 / 拉抽屉任务基准
视觉干扰鲁棒性 - 30% 遮挡 72.0 / 74.0 严重局部遮挡下,仅发生 6-8% 的平缓退化

关键发现

  • 双部件锚点关系是铰接操作的生命线:去掉锚点跟踪(Anchor-Free)后,成功率从 74.4% 骤降至 48.5%。其原因在于只看把手无法定义旋转轴的物理原点与法向量,机械臂退化为沿固定向量直线拉扯,必定导致铰链卡死或夹爪打滑。
  • 闭环几何重规划是对抗动态扰动的核心机制:在外界施加位置扰动时,开环执行的成功率仅剩 35.0%,而闭环跟踪重规划将成功率维持在 74.4%。
  • 几何先验对感知误差具备天然容错能力:替换为粗粒度检测模型或增加 30% 局部遮挡时,系统表现仅温和下降,证明严格的 1D 运动学流形约束可以在执行阶段有效纠正感知端的微小噪声。

亮点与洞察

  • 将铰接操作解耦为关系拓扑与流形跟踪:巧妙之处在于避开了对端到端神经网络拟合复杂关节动力学的依赖,用大模型的语义理解提取关系拓扑,用解析几何流形保证物理真实性,兼顾了开词表灵活性与硬约束可靠性。
  • 即插即用的免训练工程架构:系统利用 SAM3 与 FoundationPose 完成零样本度量位姿定位,在不需要任何机器人真实轨迹微调的前提下,在仿真与实体机械臂上全面击败经过 10,000 条轨迹训练的专用基线。
  • 解耦高效的时间预算分配:耗时较长的语义拓扑生成与初始位姿估计集中在单次启动阶段(~20.7 s),而运行态的闭环跟踪保持在 5 Hz,流形重规划在 0.05 s 内完成,底层运动学控制小于 0.01 s,具备极佳的工程落地实用性。

局限与展望

  • 复杂多自由度与非刚性形变受限:当前工作主要针对 1 自由度的旋转副(Revolute)与移动副(Prismatic)进行了严格验证,虽然理论上螺旋副可泛化,但对于软体绳索、布料等可变形物体,刚体 SE(3) 流形假设不再成立。
  • 初始感知分割对恶劣遮挡的依赖:若初始帧中部件受到极端遮挡或强反光导致 SAM3 分割彻底失败,后续位姿估计将无法初始化,缺少感知失败时的自主探索与纠错机制。
  • 未来方向:结合时序 3D 高斯点云追踪、多视角主动感知融合以增强复杂杂乱场景下的感知鲁棒性,并将流形约束框架推广至多指灵巧手与非刚体操作任务中。

相关工作与启发

  • vs Where2act / FlowBot3D: 后者依赖网络回归局部的孤立接触点或 3D 点云瞬时流向量,执行过程中缺少刚体几何的全局旋转中心约束,极易在长程操作中累积漂移;RelAfford6D 引入锚点部件与显式 SE(3) 流形解析,保证整个轨迹严格落在物理运动轨道上。
  • vs ReKep / VoxPoser: ReKep 利用 3D 关键点约束优化,VoxPoser 利用语言构建体素能量场导航。它们对于开阔自由空间规划表现优异,但在硬接触机械关节处计算开销大且难以保证刚性铰链容差;RelAfford6D 直接将自由度压缩到 1D 流形,计算轻量且完全符合刚体机构学原理。
  • vs 端到端 VLA 模型 (OpenVLA / ManipLLM): VLA 模型在未见几何与跨域场景下泛化脆弱,极易出现幻觉动作;RelAfford6D 采用神经感知+符号运动学的混合结构,表现出出色的零样本跨实体泛化能力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (将关系型可操作度图与解析 SE(3) 约束流形闭环求解相结合,思路清晰严密)
  • 实验充分度: ⭐⭐⭐⭐⭐ (仿真涵盖铰接与刚体基准并对比多种最新基线,并在 Realman 机械臂上完成实物闭环验证)
  • 写作质量: ⭐⭐⭐⭐⭐ (方法论述严谨,数学公式与物理机制对应紧凑,图表逻辑极为清晰)
  • 价值: ⭐⭐⭐⭐⭐ (为开放世界机器人操作提供了一种切实可行的免训练物理接地范式,对具身智能落地启发显著)