跳转至

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/zhangzaibin/future-robots
领域: 机器人/具身智能
关键词: 多臂协作、组合泛化、视觉-语言-动作模型、原子动作分配、Arm Shuffle

一句话总结

针对现有 VLA 模型在多臂操控中高度绑定固定执行角色与静态全局指令的局限,MA-VLA 提出统一的多臂 VLA 架构,通过 VLM 规划器将复杂任务分解为每臂原子动作,并结合训练期“机械臂乱序”(Arm Shuffle)与视角丢弃策略,首次在未见协作模式下实现强健的多臂组合泛化。

研究背景与动机

具身智能正在经历从单臂操控向多臂协同操控的范式演进。在工业装配、家庭服务以及长时程复杂任务中,多臂系统通过并行执行与紧密协同,能够完成单臂物理上不可企及的操作。当前主流的视觉-语言-动作(VLA)模型虽然展现出强大的端到端感知控制能力,但在拓展至多臂操控时,绝大多数现有系统仍沿袭单臂范式:将整段自然语言作为单一、全局的静态指令输入给策略网络,强行让网络在隐空间中自主隐式推断任务分工与臂间协调。

这种黑盒化映射带来了严重的脆弱性。在实际训练中,模型极易产生对特定机械臂身份(Arm Identity)与固定空间角色的过度拟合——例如固定认为“左臂只负责抓取容器,右臂只负责放置物品”。一旦测试场景要求执行训练集未曾覆盖的全新协作拓扑(例如逆序堆叠、跨臂接力重排、主从角色互换),哪怕每个机械臂所需的底层原子动作完全在分布内,现有 VLA 策略也会由于缺乏显式的动作解耦与分配机制而彻底崩溃。

人类团队的高效协作依赖于清晰的劳动分工与原子技能组合:团队将复杂宏观目标拆分为明确的中层职责,再把各原子动作分配给具体成员执行。受此启发,多臂系统的关键在于构建“未见协作模式下的组合泛化能力”(Multi-Arm Compositional Generalization)。核心 idea:将多臂宏观指令显式解耦为时序对齐的每臂原子动作提示词,并在统一 VLA 模型中通过训练期 Arm Shuffle(机械臂输入与提示词的随机排列)消除模型对固定机械臂身份的偏置,实现角色无关的原子动作重组与零样本协作泛化。

方法详解

整体框架

MA-VLA 采用“分层语言引导 + 统一多臂执行”的架构设计。系统由两个核心部分组成:一是基于预训练大视觉语言模型(VLM)的高层任务规划器 \(\mathcal{P}_\phi\),负责接收全局指令并生成分阶段的各臂原子动作提示词(Atomic Prompts);二是基于流匹配(Flow Matching)的多臂 VLA 执行器 \(\pi_\theta\),负责在统一的前向传播中联合预测所有机械臂的平滑连续控制动作。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["高层自然语言指令 l + 多视角场景观测 I"] --> B["阶段任务规划器<br/>VLM 任务分解与各臂原子动作分配"]
    B --> C["时序原子动作提示词序列<br/>Arm0: prompt0, Arm1: prompt1, ..."]
    C --> D["输入数据扰动正则化<br/>训练期 Arm Shuffle 与 View Dropout"]
    D --> E["多臂联合 VLA 执行器<br/>多视角视觉编码 + 本体感觉 + 统一语言条件"]
    E --> F["流匹配动作生成专家<br/>多头投影层输出各臂连续动作序列"]

关键设计

1. 阶段任务规划器:原子动作分解与动态分配 传统方法让底层策略同时承担语义逻辑拆解与高维连续控制,导致分工严重耦合。MA-VLA 引入冻结参数的商业级/前沿 VLM(如 GPT-4.1)作为规划器 \(\mathcal{P}_\phi\)。规划器维护一个跨任务共享的规范化原子动作词表 \(\mathcal{A}\)(如抓取 grasp、提升 lift、对齐 align、放置 place 等基础谓词)。给定初始多视角图像 \(I\) 与高层指令 \(l\),规划器单次前向输出包含 \(T\) 个离散阶段的分配方案 \(\mathbf{l} = (\mathbf{p}_1, \dots, \mathbf{p}_T)\),其中每个阶段 \(\mathbf{p}_t = (p_t^1, \dots, p_t^N)\) 精确定义了第 \(t\) 阶段机械臂 \(i\) 需执行的原子提示词 \(p_t^i \in \mathcal{A}\)。各阶段执行直到底层达到终止判定条件后推进。此举将多臂时序逻辑显式化,且各臂分配高度透明可解释。

2. 统一多臂联合 VLA 执行器:共享表征与独立输出头 针对分散独立控制容易引发死锁和碰撞、且推理开销随臂数线性暴增的问题,MA-VLA 采用单一统一策略网络 \(\pi_\theta\)。在控制步 \(t\),各臂的原子提示词拼接为统一字符串: $\(u_t = \text{"Arm0: } p_t^0 \text{ Arm1: } p_t^1 \dots \text{ Arm}N: p_t^N\text{"}\)$ 执行器输入包含全场景多视角图像与各腕部相机视图 \(I_t\)、拼接后的各臂关节本体感觉状态 \(s_t = [s_t^1, \dots, s_t^N]\) 以及统一提示词 \(u_t\)。模型主干承袭 \(\pi_0\) 架构,利用多模态 Transformer 捕获多臂之间的空间交互与视觉上下文,最后通过多头动作投影层(Multi-Head Projection Layer)解耦映射为各臂的动作头。在流匹配(Flow Matching)去噪机制下,执行器预测向量场驱动噪声轨迹平滑收敛为全局协调的动作轨迹 \([a_t^1, \dots, a_t^N]\)

3. 机械臂乱序(Arm Shuffle):打破角色偏见与身份固化 在多臂演示数据中,左臂和右臂往往执行高度固定的子步骤,策略极易记住“Arm1 永远抓左边积木”。为强制模型根据语言提示词而非机械臂编号做决策,MA-VLA 提出了训练期随机排列策略 Arm Shuffle。在每次训练迭代中,以概率 \(p_{\text{shuffle}}\) 随机抽取机械臂索引的置换排列 \(\sigma \in \mathcal{S}_N\),对各臂的状态、局部腕部观测、分配的原子提示词与真实动作元组进行同步置换: $\((s_t^i, v_t^i, p_t^i, a_t^i) \xrightarrow{\text{shuffle}} (s_t^{\sigma(i)}, v_t^{\sigma(i)}, p_t^{\sigma(i)}, a_t^{\sigma(i)})\)$ 通过这种随机置换,任何机械臂在训练中都会以均等几率扮演主导者、协助者或执行任意原子动作。模型被迫学习“根据接收到的原子动作提示词与当前空间关系执行动作”,彻底解耦了机械臂拓扑标识与物理技能,为测试阶段未见过的组合模式(如倒序堆叠、反向传递)奠定了泛化基石。

4. 视角丢弃(View Dropout):增强空间冗余与抗遮挡鲁棒性 多臂协作环境中机械臂自身及被操作物体极易造成严重的视线遮挡。为防止策略过分依赖单一机位或固定腕部视角,训练过程中以概率 \(p_{\text{drop}}\) 随机将部分相机视角的图像张量置零: $\(\tilde{I}_t = \text{Mask}(I_t, \mathcal{M})\)$ 该数据增强强制策略网络充分利用全局第三人称相机与多腕部相机之间的空间几何冗余,在某机位发生遮挡或视场丢失时仍能借助互补视图维持高精度协同。

损失函数 / 训练策略

MA-VLA 采用流匹配目标函数的行为克隆(Behavioral Cloning)监督训练。对于加噪潜变量动作 \(x_t^\tau\) 与流匹配速度场预测向量 \(v_\theta\),在融入 Arm Shuffle 和 View Dropout 扰动后,计算所有机械臂的联合均方误差损失: $\(\mathcal{L}_{\text{BC}}(\theta) = \mathbb{E}_{(\tilde{I}_t, s_t, u_t, A_t, \tau)}\left[ \sum_{i=1}^N \left\| v_\theta^i(\tilde{I}_t, s_t^i, p_t^i, x_t^{\tau, i}, \tau) - u_t^{\text{target}, i} \right\|^2 \right]\)$ 在训练设置上,仿真与真机均采用两张 NVIDIA A800 GPU,批大小(Batch Size)为 32。RoboFactory 2 臂任务训练 10,000 步,3-4 臂任务训练 15,000 步,RoboTwin 2.0 Hard 任务训练 30,000 步;动作时域视界(Horizon)设为 50。

实验关键数据

主实验

论文在两个仿真基准(RoboFactory 多臂协作、RoboTwin 2.0 双臂高抗扰)和真实硬件双臂机器人(SO101 双臂平台,各臂 6 自由度,共 12 自由度)上进行了系统评测。

表 1: RoboFactory 仿真基准各任务平均成功率(对比基线模型) 涵盖 2 臂任务(Lift Barrier, Place Food, Two Arms Stack Cube, Pass Shoe)与 3-4 臂长时程协同任务(Three Arms Stack Cube, Camera Alignment, Long Pipeline Delivery, Take Photo)。

方法 2臂 Lift 2臂 Place 2臂 Stack2 2臂 Pass 2臂均值 3臂 Stack3 3臂 Align 4臂 Deliver 4臂 Photo 3-4臂均值
DP 58.0% 20.0% 20.0% 12.0% 27.5% 22.0% 19.0% 0.0% 20.0% 15.3%
Pi0-FAST 90.0% 27.0% 50.0% 63.0% 57.5% 3.0% 22.0% 10.0% 12.0% 11.8%
Pi0 97.0% 58.0% 82.0% 84.0% 80.3% 48.0% 94.0% 82.0% 82.0% 76.5%
MA-VLA (本文) 98.0% 59.0% 86.0% 91.0% 83.5% 58.0% 96.0% 97.0% 82.0% 83.3%

表 2: 未见协作模式下的域外组合泛化评测(Out-of-Domain Compositional Generalization) 测试集要求执行训练集从未出现过的积木堆叠颜色顺序(GBR、RGB、BRG)或全新的协作逻辑(Pass Two Shoes 跨臂接力、Stack Two Bowls 双碗堆叠),所有基线在此类结构性任务重构下完全崩溃。

方法 堆叠 GBR 堆叠 RGB 堆叠 BRG Pass Two Shoes Stack Two Bowls 平均成功率
DP 0.0% 0.0% 0.0% 0.0% 0.0% 0.0%
Pi0-FAST 0.0% 0.0% 0.0% 0.0% 0.0% 0.0%
Pi0 0.0% 0.0% 0.0% 0.0% 0.0% 0.0%
MA-VLA (本文) 28.0% 9.0% 9.0% 9.0% 10.0% 13.0%

表 3: SO101 真实双臂硬件平台操作成功次数(每项评估 20 次实验) 分别评估域内(ID)与包含角色互换、逆向传递的域外组合泛化(OOD)。

方法 Stack Bowls (ID) Stack Bowls (OOD) Place Cubes (ID) Place Cubes (OOD) Pass Toys (ID) Pass Toys (OOD) Stack Cubes (ID) Stack Cubes (OOD)
Pi0 9/20 0/20 12/20 0/20 3/20 0/20 5/20 0/20
MA-VLA (本文) 12/20 10/20 15/20 8/20 6/20 2/20 8/20 2/20

消融实验

表 4: 核心组件消融实验(在三臂积木乱序堆叠任务上的表现)

原子提示词 (Atom) 机械臂乱序 (Shuffle) 视角丢弃 (View Dropout) 域内成功率 (ID) 域外组合泛化 (OOD) 说明
48.0% 0.0% 原始 Pi0 基线
58.0% 0.0% 引入原子提示词大幅提升 ID,但 OOD 仍为 0
52.0% 7.3% Arm Shuffle 首次实现 OOD 突破 (0% → 7.3%)
53.0% 15.3% View Dropout 进一步增强鲁棒性,OOD 翻倍至 15.3%

表 5: 统一多臂模型 vs 独立单臂模型(Separate Pi0)对比

架构配置 模型实例数量 域内成功率 (ID) 域外组合泛化 (OOD) 平均成功率
Pi0 单模型(全局指令) 1 48.0% 0.0% 24.0%
独立单臂模型(Separate Pi0,每臂一个模型) 3 61.0% 0.0% 30.5%
MA-VLA 统一模型(本文) 1 53.0% 15.3% 34.2%

关键发现

  • 原子动作分解是域内协同的催化剂:在 3-4 臂复杂场景中,单纯提供全局指令会导致严重的分工歧义。引入原子动作分配后,3-4 臂的平均成功率由 Pi0 的 76.5% 跃升至 83.3%,在四臂长流水线投递任务(Deliver)中更从 82.0% 提升至 97.0%。
  • Arm Shuffle 是打破角色绑定的唯一关键:消融实验表明,如果不做 Arm Shuffle,无论语言提示多么细致,测试阶段在未见堆叠顺序(如绿-蓝-红)下的泛化成功率全部死锁在 0.0%;引入 Arm Shuffle 后立即解锁 7.3%~15.3% 的零样本泛化能力。
  • 独立单臂策略无法涌现协同泛化:将多臂拆分为 3 个独立单臂 VLA 虽然因关注点聚焦而在域内略微提升至 61.0%,但在 OOD 下彻底无法跨臂协商,成功率依然为 0.0%,且部署开销随机械臂数量成倍放大。

亮点与洞察

  • 训练期“乱序排列”化解“组合爆炸”:多臂协同的最大挑战在于可能出现的时空协作模式呈组合数爆炸,穷举数据完全不现实。MA-VLA 巧妙地在训练阶段将 \((state, view, prompt, action)\) 打包进行随机置换,迫使网络建立“以动作为中心”而非“以机械臂硬件槽位为中心”的因果关系。
  • 解耦认知规划与闭环控制:高层 VLM 规划器无需针对控制微调,仅依靠预设词表与语义推理进行粗粒度分工;底层 VLA 依托流匹配专注高频低层连续执行,避免了端到端大模型直接预测长时程关节电机的累积误差。
  • 轻量扰动实现无痛鲁棒性提升:Arm Shuffle 与 View Dropout 完全是数据管道层面的无参即插即用增强,不改变任何网络损失结构或参数量,却能使真实双臂机器人在从未见过的反转堆叠和反转放置中取得近 50% 的实操成功率。

局限与展望

  • 规划器开环与容错重规划机制缺失:当前高层 VLM 规划器在任务起始阶段单次前向生成全部阶段的原子动作序列,若底层执行器在中途发生滑落或机械碰撞,缺乏根据实时动态反馈触发局部重新规划的闭环机制。
  • 组合泛化绝对成功率仍有提升空间:在最难的三臂积木顺序泛化中,OOD 平均成功率为 13.0%~15.3%,相比域内的 50%+ 依然存在明显落差,复杂的物理接触与运动学干涉仍是泛化瓶颈。
  • 未来方向:引入轻量级状态感知检测器实现在线动态重规划;结合强化学习(RL)探索自主无碰撞多臂协同策略。

相关工作与启发

  • vs \(\pi_0\) / OpenVLA 等通用 VLA 模型:经典 VLA 针对单臂或固定双臂设计,将整条人类指令压缩为一个隐空间向量,无法应对复杂的多角色动态分配。MA-VLA 证明了为各臂提供显式、结构化的语言槽位(Arm-specific prompts)是实现可解释与可泛化操控的必由之路。
  • vs RoboBallet / RoboFactory 等多臂学习系统:RoboBallet 依赖昂贵的高维图强化学习在线交互,RoboFactory 则依赖单一 Diffusion Policy 缺乏语言交互能力。MA-VLA 将流匹配与语言大模型自然融合,兼具开放指令理解与高自由度连续控制能力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统研究多臂 VLA 系统的组合泛化,提出的 Arm Shuffle 思想优美且极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 2-4 臂仿真基准(RoboFactory, RoboTwin 2.0)及 SO101 真实双臂硬件,包含详实的消融与扰动分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,问题定义明确,图表表达直观。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能从单臂拓展至多智能体/多机械臂协作提供了标准化、可复现的设计范式。