Gripper-aware Vision Language Action Models¶
会议: ECCV 2026
论文: ECCV 官方海报
代码: https://airvlab.github.io/G-VLA/
领域: 机器人/具身智能
关键词: 视觉-语言-动作模型、夹爪感知、多夹爪操作、专家混合适配器、具身泛化
一句话总结¶
针对现有视觉-语言-动作模型(VLA)默认假定“末端执行器不变”而无法适应不同夹爪策略分歧的问题,本文构建了首个涵盖 5 类夹爪、10.3 万条轨迹的大规模多策略操作数据集 MiGA,并提出了结合多粒度软提示分词与双路混合适配器调控的 GVLA 架构,在模拟器与真实机械臂上实现了策略级夹爪感知与高效跨形态迁移。
研究背景与动机¶
近年来,视觉-语言-动作模型(VLA)在通用机械臂抓取与操作任务中展现出卓越的泛化潜能,机器人能够直接将自然语言指令与高维视觉输入映射到连续动作空间。然而,现有的通用 VLA 模型普遍存在一个未被充分正视的隐式假设——“夹爪不变性”(gripper invariance)。无论在模型架构设计还是训练数据组织中,系统往往默认相同的任务目标对应着统一的操作轨迹分布。现实中机器人的抓取与操纵策略具有极其严格的“具身依赖性”(embodiment-dependence):对于同一件物体,末端机械结构的几何形态、自由度与接触力学原理直接决定了物理交互的可行解空间。例如拾取平贴在桌面上的薄盒或光盘时,吸盘夹爪可直接垂直下探利用负压吸附提起,而传统的平行双指爪必须先将物体平推至桌沿借由边缘悬空再行侧向夹持,多指灵巧手则需要复杂的指尖滑移与底部托举组合动作。
导致这一能力缺位的核心矛盾在于,机器人策略学习极度依赖的数据资产呈现严重的单一具身偏置。诸如 Open X-Embodiment、DROID 以及 Bridge V2 等主流开源基准中,绝大多数轨迹均采集自平行双指夹爪(Parallel-Jaw Gripper),几乎完全缺乏吸盘、三指手、柔性夹爪或五指高自由度灵巧手的多形态覆盖。即便模型输入了机器人形态的元数据,简单的 MLP 映射或纯文本 Prompt 也会因特征空间退化或语义混淆,无法诱导出符合机械接触物理规律的策略分化。当机器人切换末端配置或面对新型夹爪时,策略便会因运动学不可达或接触模式错配而彻底崩溃。
为了打破夹爪不变性的虚假前提,必须让 VLA 模型学会在物理约束下理解“相同目标因末端形态不同而策略分流”的内在规律。核心 idea:构建首个包含 5 种异构夹爪与 103,000 条高质量轨迹的大规模多策略操作数据集 MiGA,并在 VLA 中引入分层解耦的平台-类型-实例三级软提示分词器与双路动作混合适配器(Dual MoA),在统一表征下精确调制具身依赖的操作策略。
方法详解¶
整体框架¶
GVLA 基于先进的流动匹配(Conditional Flow Matching)VLA 主干网络(以 \(\pi_{0.5}\) / \(\pi_0\) 为基础),端到端构建从视觉语言指令到形态感知动作序列的映射通道。系统接收当前多视角 RGB-D 视觉观测 \(O_t\)、自然语言任务指令以及机器人末端硬件配置描述。整体流程分为两大部分:在表征层面,多粒度夹爪分词器将连续硬件身份转化为平台层、类型层与实例层三段连续可微的软提示向量(Soft Prompts),与视觉语言观测特征拼接输入预训练骨干;在执行调控层面,双路混合适配器(Dual MoA)在动作专家(Action Expert)的末层利用平台路由器和夹爪路由器解耦分发动态权重,对动作流场实现残差式自适应调制。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["多视角视觉观测 + 文本指令 + 硬件配置"] --> B["多粒度夹爪软提示分词<br/>平台 / 类别 / 实例三级解耦嵌入"]
B --> C["VLA 骨干网络预训练编码<br/>图文特征交互与流场动作表征"]
C --> D["双路专家混合适配器调控<br/>平台路由器与夹爪路由器动态门控"]
D --> E["多任务协同优化目标<br/>流动匹配动作流 + 夹爪辅助判别 + 负载均衡"]
E --> F["输出夹爪策略对齐的连续控制动作"]
关键设计¶
1. 多粒度夹爪软提示分词:解耦硬件通用性与形态特异性 传统方法若直接使用文本提示(Language Prompt)描述夹爪,往往因语言模型对硬件符号的泛化语义模糊而退化为近乎重合的表示;而无约束的 MLP 或 VQ-VAE 编码则破坏了几何与力学上的近邻语义(如图 2 所示)。为兼顾不同机臂底座间的通用知识复用与极端异构末端的精准区隔,本文将硬件配置连续化映射为三级软提示矩阵: $\(P^{(h)} = \left[ P^{(r)};\, P^{(g)};\, P^{(u)} \right] \in \mathbb{R}^{(p_r + p_g + p_u) \times d}\)$ 其中平台分词 \(P^{(r)} \in \mathbb{R}^{p_r \times d}\) 索引机械臂本体(如 Franka Panda、UR5、xArm7),捕捉臂身基座的全局运动学结构;夹爪类别分词 \(P^{(g)} \in \mathbb{R}^{p_g \times d}\) 索引夹爪的接触原理大类(如平行双指、吸盘气泵、三指包络、高自由度灵巧手及柔性抓手),承载接触力学与接近路径的高阶策略先验;实例级分词 \(P^{(u)} \in \mathbb{R}^{p_u \times d}\) 则精确记录特定型号(如 Franka 手爪与 Robotiq 2F-85 虽然同属平行爪,但在指间距、行程极限与外壳碰撞体形上存在微小差异)。将该复合分词前置拼接至视觉语言序列输入 Transformer: $\(\tilde{X} = \left[ P^{(h)};\, X \right] \in \mathbb{R}^{(p_r + p_g + p_u + n_{\text{obs}}) \times d}\)$ 该解耦架构让模型在学习动作知识时,同一类别的夹爪自然在隐空间形成聚类簇,而面对新型号夹爪时仅需微调少量实例级提示即可快速对齐。
2. 双路专家混合适配器(Dual MoA):层级感知与动作执行解耦调制 仅仅在输入端提供软提示无法充分抑制多具身策略在深层生成时的模式冲突。本文通过层级探测(Linear Probing)对 VLA 内部动作专家(Action Expert)的逐层激活进行夹爪类型敏感度度量(图 6),发现特征对末端形态的敏感度在前十几层保持较低水平(负责视觉几何理解与物体语义对齐),而在动作生成的最后一层急剧飙升。基于该生理学式发现,GVLA 将 MoA 精确嵌入动作专家的最后一层。 为了防止机器人臂身运动学参数与末端操纵技巧混叠,设计了平行的平台门控 \(G^{(p)}\) 与夹爪门控 \(G^{(g)}\): $\(G(P) = \text{Softmax}\left(\text{TopK}\left(\text{MLP}(\text{mean}(P))\right)\right)\)$ 平台门控由 \(\text{mean}(P^{(r)})\) 驱动,从专属的平台适配器池中挑选前 \(k\) 个专家;夹爪门控则由类型与实例组合 \(\text{mean}([P^{(g)}; P^{(u)}])\) 驱动,路由至专属末端专家池。每个适配器采用轻量瓶颈变换 \(\mathcal{A}(x) = \mathcal{W}^{\text{up}}(\text{GeLU}(\mathcal{W}^{\text{down}}(x)))\),并在激活后进行残差加权融合: $\(x_{\text{out}} = x + \sum_i G^{(p)}_i \cdot \mathcal{A}^{(p)}_i + \sum_j G^{(g)}_j \cdot \mathcal{A}^{(g)}_j\)$ 这种双路残差调制既保障了底座本体动作的几何平滑度,又赋予了不同末端夹爪独立的运动流线塑形自由。
3. 多任务协同优化与抗坍塌负载均衡 为确保大模型共享视觉表征能够稳定抽取出对夹爪决策关键的环境几何线索,并避免 MoA 门控退化至单一专家的“富者愈富”现象,模型在全流程反向传播中采用联合损失函数驱动: $\(\mathcal{L} = \mathcal{L}_{\text{action}} + \lambda_{\text{gripper}}\mathcal{L}_{\text{gripper}} + \lambda_{\text{LB}}\mathcal{L}_{\text{LB}}\)$ 其中动作预测损失 \(\mathcal{L}_{\text{action}}\) 基于连续时间条件流动匹配(Conditional Flow Matching),直接回归从标准高斯噪声向量场 \(u(A_t^\tau | A_t) = \epsilon - A_t\) 映射到真实微细动作分布 \(A_t\) 的矢量速度场。辅助夹爪分类损失 \(\mathcal{L}_{\text{gripper}}\) 利用全局池化后的视觉观测表征 \(O_t\) 预测当前生效的夹爪类别标签 \(y_g\),强制视觉编码器内隐式保留与夹爪工作空间匹配的空间关系。负载均衡正则项 \(\mathcal{L}_{\text{LB}}\) 惩罚各专家池激活频率分布的方差,强制平台池与夹爪池内的各个专家获得均匀探索,维持了多形态调控架构的表达容量。
损失函数 / 训练策略¶
动作流场匹配权重为主导目标,辅助损失系数设定为平衡超参。骨干网络在多夹爪高质量数据集 MiGA 上先进行跨具身多任务预微调。训练时保持绝大多数 VLM 注意力权重冻结或低秩适配,重点更新三层可学习软提示向量、线性辅助投影头以及最后一层的双路 MoA 瓶颈权重,在保证基线大模型开放世界常识理解能力不被遗忘的同时,实现了极高的微调收敛效率。
实验关键数据¶
主实验¶
在 NVIDIA Isaac Lab 逼真仿真环境中,涵盖 5 种夹爪类型,针对单物平铺(Flat)、堆叠抓取(Stacked)、受限空间(Constrained)以及功能语义抓取(Semantic)四大最具策略分化特征的典型任务场景,对传统抓取检测模型与主流 VLA 基线进行了全方位对比评测(成功率 SR % 如表 2 所示)。
| 方法 | 平铺单物 (Flat) | 堆叠遮挡 (Stacked) | 狭窄受限 (Constrained) | 语义抓取 (Semantic) | 平均成功率 (Avg. %) |
|---|---|---|---|---|---|
| AnyGrasp | 0.00 | 0.00 | 46.00 | 0.00 | 11.50 |
| GraspMAS | 0.00 | 0.00 | 40.00 | 8.00 | 12.00 |
| GraspVLA | 1.50 | 0.00 | 30.00 | 0.00 | 7.88 |
| OpenVLA-OFT | 41.00 | 52.50 | 24.00 | 50.00 | 41.88 |
| \(\pi_0\) 基线 | 30.00 | 21.50 | 36.00 | 65.00 | 38.13 |
| \(\pi_{0.5}\) 基线 | 52.50 | 71.00 | 57.50 | 52.50 | 58.38 |
| GVLA (\(\pi_0\) 骨干) | 27.50 | 45.00 | 50.00 | 70.00 | 48.13 |
| GVLA (\(\pi_{0.5}\) 骨干) | 53.00 | 76.00 | 62.50 | 72.50 | 66.00 |
消融实验¶
为验证三级分词器与双路 MoA 架构各模块的独立效能,在 MiGA 上进行了组件剥离分析,测试预训练动作预测误差(PE ↓)以及在未见夹爪(Robotiq 2F-85)上微调 20K 步后的跨形态迁移适应率(Adapt. ↑,表 4 依据);同时对不同分词方法下的反事实行为分歧度(CAPD ↑)与夹爪贡献分(GCS ↑)进行了对比(表 3 依据)。
| 配置 / 分词方法 | 预测误差 (PE ↓) | 反事实分歧 (CAPD ↑) | 夹爪贡献分 (GCS ↑) | 跨夹爪适应率 (Adapt. ↑) | 说明 |
|---|---|---|---|---|---|
| GVLA 完整模型 | 0.032 | 1.34 | 0.249 | 0.92 | 完整架构,表现全面领先 |
| 无夹爪类别提示 (\(w/o\ P^{(g)}\)) | 0.037 | — | — | 0.86 | 失去类别先验,预测与迁移双重下滑 |
| 无平台基座提示 (\(w/o\ P^{(p)}\)) | 0.035 | — | — | 0.54 | 无法解耦底座,跨机械臂迁移发生严重坍塌 |
| 无特定实例提示 (\(w/o\ P^{(u)}\)) | 0.032 | — | — | 0.90 | 仅微幅降低新微细构型精度 |
| 移除双路 MoA (\(w/o\ \text{MoA}\)) | 0.037 | — | — | 0.52 | 仅靠软提示缺少执行层调控,迁移锐减 40% |
| 无夹爪路由器 (\(w/o\ \text{MoA}^{(g)}\)) | 0.033 | — | — | 0.56 | 失去夹爪针对性动作流适配 |
| 无平台路由器 (\(w/o\ \text{MoA}^{(p)}\)) | 0.034 | — | — | 0.54 | 臂身动态失配导致执行失败 |
| 分词基线:MLP 嵌入 | 0.053 | 0.82 | 0.014 | — | 映射混叠,夹爪特征无聚类性 |
| 分词基线:VQ-VAE | 0.051 | 0.70 | 0.002 | — | 离散码本无法区分同质夹爪结构 |
| 分词基线:Language Prompt | 0.053 | 0.64 | 0.225 | — | 文本语义在动作生成时发生特征坍塌 |
关键发现¶
- 双路 MoA 调控是跨形态泛化的核心支柱:剥离 MoA 机制后,新夹爪适应率从 0.92 断崖式下跌至 0.52,证实了高层语义提示若缺少执行层计算通道的参数化解耦,无法指导底层电机输出具有大跨度物理几何差异的操作轨迹。
- 平台与夹爪解耦至关重要:移除平台提示 \(P^{(p)}\) 虽然在原场景重构误差上变化微小(PE 0.032 → 0.035),但在迁移到异构臂座平台时成功率大幅腰斩至 0.54,说明本体运动学表征与末端接触机理必须在表征中彻底分离。
- 真实机械臂小样本迁移突破:在真实 UR5 机械臂搭载 Robotiq 2F-85 的零样本/少样本(10 条示教、20k 步微调)测试中,GVLA 在平铺、堆叠、受限及语义任务上分别取得了 0.50、0.90、0.90 与 0.85 的成功率,全方位碾压强基线 \(\pi_{0.5}\)(分别为 0.40、0.70、0.70、0.75)。
亮点与洞察¶
- 多夹爪策略分歧的第一性原理切入:打破了 VLA 社区长久以来默认的“夹爪无关”盲区,系统化揭示并形式化了吸盘、双指、三指、多指等机构在物理交互逻辑上的本质差异,填补了具身智能关键数据基石。
- 层级敏感度探针指导的精准 MoA 注入:未盲目在 Transformer 全层插入庞大适配器,而是通过严谨的逐层线性探测分析,定位出动作专家最终层才是夹爪敏感度爆发点,以此构建极具计算性价比的轻量残差注入点。
- 三级层次化软提示分词构架:将平台、类型与实例分层解耦,既保留了同一机制大类(如所有吸附类设备)的共享策略先验,又兼顾了型号微小物理形变的精细对准,为跨具身机器人泛化奠定了可扩展的设计范式。
局限与展望¶
- 物理接触与局部网格几何建模尚显隐式:当前 GVLA 依然将夹爪硬件依赖建立在策略级高维潜在向量上,缺乏显式的局部三维网格碰撞场或精细接触力学反馈,面对同类夹爪内的细微指尖倒角或粗糙度差异时容易发生毫米级对齐偏差(Intra-type misalignment)。
- 仿真到真实迁移下的视觉与形态纠缠:尽管双路 MoA 促进了专家分工,但在跨环境大域漂移(Domain Shift)时,视觉编码层仍可能对物体的视觉轮廓产生过拟合,导致新背景下动作生成对特定视觉提示过于敏感。未来可引入端到端点云显式 SDF 几何距离场或触觉多模态融合以增强物理级接触自适应。
相关工作与启发¶
- vs AnyGrasp / GraspMAS / GraspVLA: 传统两阶段抓取检测及开环规划模型完全依赖自顶向下的单一下探假设,在薄片物体的平推或拥挤空间的避障中完全失效(成功率近乎归零);GVLA 提供了全轨迹闭环预测并支持复杂前置规划(如推至桌沿再抓)。
- vs \(\pi_0\) / \(\pi_{0.5}\) / OpenVLA: 通用主流 VLA 模型受限于平行双指主流数据,将形态信息作为非结构化提示输入,导致多夹爪场景下策略混乱;GVLA 证明了显式建模形态解耦分词与低秩适配器调控能直接激活骨干网络的具身适应潜能。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性论证并攻克了 VLA 的“夹爪不变性”痛点,提出 MiGA 规模化基准与分层解耦 GVLA 架构。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 10.3 万条多形态轨迹、仿真与真实机械臂验证、严密的逐层探针分析与完备的消融对比。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑缜密,动机由真实操作案例生动展开,架构图与热力图对比具有极强说服力。
- 价值: ⭐⭐⭐⭐⭐ 对机器人跨具身通用大模型(VLA)向多样化工业、特种末端执行器的实际落地具有重大指导与推动价值。