StructPolicy: Structure-Guided Imitation Learning Robust to Visual Domain Shifts¶
会议: ECCV 2026
论文: ECCV 官方链接
项目主页: StructPolicy Homepage
领域: 机器人/具身智能
关键词: 模仿学习, 机器人操作, 视觉域偏移, 结构图, 可操作性 (Affordance)
一句话总结¶
StructPolicy 构建了一种由几何基元与物理约束组合而成的域不变结构图(Structure Map),并通过分层编码与可操作性引导,使机器人在光照、背景颜色、相机视点及视觉噪声等剧烈域偏移下依然保持高精度的鲁棒操作。
研究背景与动机¶
基于视觉的模仿学习(Imitation Learning, IL)已成为机器人操作领域的主流范式,它通过学习从视觉观测到动作轨迹的直接映射,在大量长程与多任务操作中展现出优异表现。然而,现有的端到端模仿学习策略通常脆弱地绑定在训练演示的特定视觉分布上。一旦遇到视觉域偏移(例如环境光照强度改变、桌面或背景颜色切换、相机拍摄视角倾斜或传感器渲染噪声),策略表征往往迅速失效崩溃,导致诸如拉抽屉、按开关等简单任务完全无法执行。
为了缓解域偏移的负面影响,近期的研究尝试引入以对象为中心的表征(Object-Centric Representations, OCRs),通过将图像分割为分离的物体实体或估计物体 6-DoF 位姿来滤除无关背景干扰。但现有的 OCRs 往往将物体抽象为粗粒度的整体包围盒或依赖脆弱的自监督视觉嵌入,无法在光照和视角剧变下保持完全不变,且严重缺乏物体内部的可动关节、功能接触表面以及拓扑连接等细粒度信息。受吉布森生态知觉理论(Gibson's ecological theory of perception)启发,生物在与物理环境交互时所依赖的可操作性(Affordance)根植于物体内在的几何结构,而物体的空间布局与几何拓扑恰恰是跨视觉域绝对不变且决定操作可行性的核心先验。
本文的切入角度是:不再强求直接从多变的底层 RGB 像素中提取抗扰视觉特征,而是显式引入解耦的结构化几何中介——结构图(Structure Map)。核心 idea:通过构建由结构基元组合而成的域不变结构图(Structure Map)并提取细粒度几何拓扑与可操作性抓取位姿特征,将模仿学习策略锚定于环境几何拓扑先验,从本质上阻断底层视觉域漂移对操作决策的干扰。
方法详解¶
整体框架¶
StructPolicy 作为一种即插即用的模块被无缝集成到标准的模仿学习策略(如 Diffusion Policy、Lift3D、MDT-V 等)中。整体框架包含两大核心模块:自动化结构图构建模块 StructCon,以及细粒度几何与可操作性特征提取模块 StructEncoder。
在推理过程中,环境的 RGB 图像和自然语言任务描述首先输入 StructCon;StructCon 借助视觉语言模型(VLM)与检索增强生成(RAG)从预构建的 ConceptFactory 几何规则库中检索出与任务物体对应的结构基元及初始模板,再由参数估计器回归精确的 3D 尺寸与空间位姿,实例化出包含拓扑结构和可操作性面片的结构图。随后,StructEncoder 通过结构编码流与可操作性编码流分别提取全局几何拓扑特征与抓取先验位姿特征,并将它们融合成统一的地图特征,与骨干策略自身的视觉特征拼接后输入策略头预测机器人的末端执行器动作。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入: RGB 图像 + 任务描述 + 机器人状态"] --> B["StructCon: 检索增强生成与基元检索<br/>VLM 提取类别 + BGE-M3 向量检索 ConceptFactory"]
B --> C["StructCon: 结构参数估计与实例化<br/>物理约束组合 + 回归 3D 尺度与位姿"]
C --> D["结构图 Structure Map<br/>基元拓扑点集 S_o + 可操作性三角面片 A_o"]
D --> E1["可操作性编码流<br/>法向量反向位姿生成 + MLP 提取 f_p"]
D --> E2["结构编码流<br/>基元注意力池化 + Transformer 提取 f_s"]
E1 --> F["特征融合与策略头输出<br/>MLP 融合地图特征 f_m + 拼接视觉特征 f_v 预测动作"]
E2 --> F
关键设计¶
1. 层次化结构图表达:基元采样与可操作性定义
结构图(Structure Map)在数学上被形式化为三层递进结构:最底层的结构基元、中间层的物体拓扑结构以及顶层的场景统一结构图。对于立方体等凸多面体基元,采用表面均匀三角网格化提取顶点;对于圆柱体等曲面基元,采用分辨率固定的平面圆弧截面采样。物体结构 \(\mathcal{S}_{\mathbf{o}}\) 定义为若干结构基元点集构成的空间并集: $\(\mathcal{S}_{\mathbf{o}} = \bigcup_{m=1}^{N_{\mathbf{o}}} \{(\mathbf{p}_i, \ell_i)\}_{i=1}^{N_m}\)$ 其中 \(\mathbf{p}_i \in \mathbb{R}^3\) 为采样点三维坐标,\(\ell_i\) 标记对应的基元类型(如长方体、圆柱、拱形槽等),物理规律施加于基元间以约束拓扑形态。同时,物体表面的可操作性区域被定义为一系列三角面片集合 \(\mathcal{A}_{\mathbf{o}} = \bigcup_{i=1}^{K_{\mathbf{o}}} \mathcal{F}_i\),每一个面片 \(\mathcal{F}_i = \{\mathbf{v}_{i,1}, \mathbf{v}_{i,2}, \mathbf{v}_{i,3}\}\) 明确指代能够引发特定操作行为的物理接触区域(如抽屉拉手表面、杯把边缘)。场景中全部 \(K\) 个任务相关物体的结构与可操作性并集即构成了完整的结构图 \(\mathcal{M} = \{(\mathcal{S}_{\mathbf{o}_k}, \mathcal{A}_{\mathbf{o}_k}, k)\}_{k=1}^K\)。
2. StructCon 结构图自动化构建:RAG 检索与物理约束参数估计
在面对复杂的开放式交互环境时,必须在存在视觉外观扰动的条件下稳定实例化正确的结构图。StructCon 首先采用 VLM 对输入图像和任务描述生成任务相关物体的文本摘要,并使用 BGE-M3 生成紧凑的查询向量,在包含 39 个类别、4380 种物体的 ConceptFactory 知识库中进行密集相似度检索,精准匹配物体类别模板。随后,系统获取该类别的结构基元组合规则及物理连接约束。为了赋予基元精确的三维尺寸与空间位姿,骨干策略提取的视觉特征被送入一个轻量 MLP 参数估计头,直接预测各基元的几何尺度参数与空间仿射变换矩阵。由于有预设的物理约束与强几何先验进行骨架约束,即使底层图像遭遇严重光照变化或背景干扰,预测出的三维结构图仍能保持极高的空间几何保真度。
3. StructEncoder 双流分层编码:拓扑全局聚合与可操作性位姿引导
为了使下游的动作预测头能充分吸收结构图所蕴含的高阶物理知识,StructEncoder 设计了并行的双流提取架构。在可操作性编码流中,算法针对结构图中的每个可操作性三角面片,将其几何中心设为初始粗粒度夹爪位姿位置 \((x, y, z)\),将面片外法向量的反方向作为初始进近方向 \((d_x, d_y, d_z)\),再由轻量 MLP 预测微调位置偏移量 \(\Delta (x, y, z)\),形成单位方向向量约束的粗位姿点集 \(\mathcal{P} = \{(x_i, y_i, z_i, d_i^x, d_i^y, d_i^z)\}\),经过 MLP 映射为可操作性先验特征 \(\mathbf{f}_p\)。在结构编码流中,算法先按基元标签划分局部点群,由基元编码器利用 MLP 和注意力池化提取局部几何特征,再输入 Transformer 结构编码器对跨基元的空间布局和拓扑关联进行自注意力建模,生成全局结构特征 \(\mathbf{f}_s\)。最后,\(\mathbf{f}_p\) 与 \(\mathbf{f}_s\) 拼接后经由 MLP 融合成地图特征 \(\mathbf{f}_m\),与策略视觉特征 \(\mathbf{f}_v\) 拼接后送入策略头完成动作输出。
损失函数 / 训练策略¶
StructPolicy 采用端到端联合训练框架,完全复用下游模仿学习主干网络(如基于条件去噪扩散过程的 Diffusion Policy 均方误差损失,或多任务 Transformer 的行为克隆回归损失),无需设计额外的辅助监督损失项或复杂的多阶段梯度截断策略。各模块的 MLP 均由三层带 ReLU 激活函数的线性层构成,结构编码器中的 Transformer 遵循标准点云 Transformer 设计。
实验关键数据¶
主实验¶
论文在标准仿真基准 CALVIN(长程序列任务)和 MetaWorld(15 个涵盖简单/中等/困难的操控任务)上,将 StructPolicy 挂载到多个主流模仿学习算法上进行对比。
原论文 Table 1 主实验对比(CALVIN 平均成功链长,满分 5.0;MetaWorld 平均成功率 %):
| 基准 / 骨干模型 | 原始 Baseline | + StructPolicy (本文) | 提升幅度 (\(\Delta\)) | 评估指标与设置 |
|---|---|---|---|---|
| CALVIN D \(\to\) D: TaKSIE | 3.18 | 3.34 | +0.16 | 平均连续任务完成链长 (Avg. Len.) |
| CALVIN D \(\to\) D: HULC++ | 3.30 | 3.45 | +0.15 | 平均连续任务完成链长 (Avg. Len.) |
| CALVIN D \(\to\) D: MDT | 3.59 | 3.70 | +0.11 | 平均连续任务完成链长 (Avg. Len.) |
| CALVIN D \(\to\) D: MDT-V | 3.72 | 3.86 | +0.14 | 平均连续任务完成链长 (Avg. Len.) |
| CALVIN D \(\to\) D: FLOWER | 4.35 | 4.42 | +0.07 | 平均连续任务完成链长 (Avg. Len.) |
| CALVIN ABCD \(\to\) D: DeeR | 4.13 | 4.22 | +0.09 | 平均连续任务完成链长 (Avg. Len.) |
| CALVIN ABCD \(\to\) D: MDT-V | 4.51 | 4.60 | +0.09 | 平均连续任务完成链长 (Avg. Len.) |
| CALVIN ABCD \(\to\) D: FLOWER | 4.67 | 4.70 | +0.03 | 平均连续任务完成链长 (Avg. Len.) |
| MetaWorld: Diffusion Policy (DP) | 65.2% | 77.5% | +12.3% | 15 项任务平均成功率 (S.R. %) |
| MetaWorld: 3D Diffusion Policy (DP3) | 66.7% | 79.2% | +12.5% | 15 项任务平均成功率 (S.R. %) |
| MetaWorld: Lift3D | 83.9% | 90.5% | +6.6% | 15 项任务平均成功率 (S.R. %) |
真实世界机械臂实验(原论文 Table 8 与 Table 9):在 Flexiv Rizon 4 机械臂的 8 个物理任务中,StructPolicy 均大幅提升成功率。在以 Lift3D 为骨干面对域偏移测试时,无变化环境下从 67.5% 提升至 83.3% (+15.8%);在光照变化下从 30.0% 提升至 65.8% (+35.8%);在背景变化下从 28.3% 提升至 69.1% (+40.8%);在相机视角扰动下从 24.2% 提升至 60.0% (+35.8%)。
消融实验¶
原论文 Table 6 对比了 Structure Map 与其他常见以对象为中心表征(OCRs)的增益差异(MetaWorld 15 任务平均成功率 %):
| 骨干策略配置 | 原始 Baseline | + Mask | + Keypoints | + 6D Pose | + 3D BBox | + Structure Map (本文) |
|---|---|---|---|---|---|---|
| Diffusion Policy (DP) | 65.2% | 69.6% (+4.4%) | 71.1% (+5.9%) | 67.8% (+2.6%) | 70.2% (+5.0%) | 77.5% (+12.3%) |
| 3D Diffusion Policy (DP3) | 66.7% | 70.2% (+3.5%) | 70.8% (+4.1%) | 73.6% (+6.9%) | 69.4% (+2.7%) | 79.2% (+12.5%) |
原论文 Table 4 与 Table 5 针对结构采样与 StructEncoder 设计的消融(MetaWorld 平均成功率 %): - 结构化采样 vs 均匀采样:在 StructEncoder 下,结构化采样达到 90.5%,而表面均匀点云采样仅为 80.5%(下降 10.0%),证明结构基元沿几何轮廓的规则采样对捕捉局部与拓扑信息至关重要。 - 模块剥离消融:仅保留可操作性位姿流(Ex1)成功率为 74.6%,仅保留结构编码流(Ex2)为 85.2%,二者结合并通过 MLP 融合(Ex8)达到最高值 90.5%。
关键发现¶
- 瓶颈分析(Table 3):当为系统注入 Ground-Truth 结构模板时,成功率仅从 90.5% 微增至 91.0% (+0.55%),说明前端 VLM + RAG 的类别检索极其可靠;而当注入 Ground-Truth 参数时,成功率激增至 98.4% (+8.73%),表明参数估计器的几何精度是目前系统的主要精度瓶颈。
- 视觉域偏移保真度(Table 2):在光照、背景、视点和光追噪声四类严重域偏移下,StructCon 生成的点云与真实点云之间的 F-Score 仍能维持在 50.2% ~ 53.7%(正常环境下为 61.6%),验证了基于先验规则的基元重组具备很强的跨域鲁棒性。
- 极低的计算开销(Table 7):平均单步推理延迟仅增加 2.99 ms(Lift3D 基线为 67.21 ms,加入 StructPolicy 后为 70.20 ms),完全满足 30 Hz 的实时机械臂控制要求。
亮点与洞察¶
- 解耦视觉表观与几何骨架:不盲目依赖大规模多模态大模型的底层特征泛化,而是把抗干扰的希望押注在物理学和几何学意义上“绝对不变”的拓扑基元上,思路极其扎实清晰。
- 几何反向法向量引导可操作性先验:利用三角面片法向量反向作为末端进近朝向,将可操作性转化为显式的粗粒度夹爪位姿空间点,给下游策略提供了物理直觉极强的动作搜索起点。
- 即插即用且开销极低:由于大量组合规律被预固化在 ConceptFactory 离线知识库中,在线推断只需估计少量几何变形参数,仅带来不到 3 ms 的推理延迟,工程实用性很高。
局限与展望¶
- 依赖预置几何基元库覆盖度:由于结构图依赖 ConceptFactory 提供的 39 类几何模板,若遇到非刚性变形物体(如衣物、面团)或未收录的复杂拓扑异形物体,基元组装机制可能会失效。
- 参数估计器为单帧前馈:当前系统从单视角或双视角图像直接回归 3D 几何与姿态参数,在大面积自遮挡或极低视差环境下容易产生参数估计漂移。
- 未来方向:可考虑结合多视角神经辐射隐式场或在线触觉反馈来动态校准结构图参数,并将结构图扩展至布料、缆绳等柔性物体的连续介质表征中。
相关工作与启发¶
- vs Lift3D / Perceiver-Actor (3D 视觉模仿学习): Lift3D 依赖提升后的 2D 基础模型特征或原始 3D 点云,当背景颜色或相机视点大变时点云表观特征依然受损;StructPolicy 将点云替换为参数化基元重构的语义结构图,跨域鲁棒性显著提高。
- vs VIOLA / SORNet (对象中心化表征): 传统 OCRs 停留在 2D/3D 检测框或孤立的实例分割掩码,缺少部件间拓扑连接与功能面;StructPolicy 建模内部铰接与可操作性面片,赋予策略更精细的物理交互指引。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (从几何基元拓扑与可操作性出发构建域不变中介表征,对具身智能域泛化有启发性)
- 实验充分度: ⭐⭐⭐⭐⭐ (覆盖仿真 49 项任务与 8 项真机任务,四类典型域偏移扰动与误差归因详实完备)
- 写作质量: ⭐⭐⭐⭐⭐ (结构极其清晰,逻辑层层递进,消融与系统瓶颈剖析十分诚恳透彻)
- 价值: ⭐⭐⭐⭐☆ (即插即用且延迟极低,为工业与家庭场景下抵抗复杂光照视点变化的机器人落地提供了实用路径)