跳转至

PARL-VLA: Pruning-Aware On-Policy Reinforcement Learning for Vision-Language-Action Model

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 机器人/具身智能
关键词: 视觉语言动作模型 / 视觉Token剪枝 / 在线强化学习 / GRPO / 具身智能鲁棒性

一句话总结

针对视觉-语言-动作(VLA)模型在在线强化学习后训练中直接引入剪枝会导致探索与利用配置不匹配并引发训练崩溃的问题,PARL-VLA 提出剪枝感知强化学习框架,通过记录轨迹采样剪枝配置并在策略梯度更新时精准回放以对齐似然比,同时构建跨保全率的谱剪枝训练课程,在丢弃 55% 视觉 Token 的同时实现端到端训练加速与显著的跨分布抗扰动鲁棒性。

研究背景与动机

视觉-语言-动作(VLA)模型已成为具身通用操作智能体的主流基础架构,能够将多模态视觉观测与自然语言任务指令端到端映射为低层机械臂控制动作。为了克服离线模仿学习在数据覆盖度与复合误差上的内在瓶颈,学术界广泛采用在线强化学习(如基于 GRPO 的强化微调)作为后训练阶段的核心手段。然而,基础多模态 Transformer 的前向推理与注意力计算极其昂贵,在强化学习频繁进行环境交互、在线采样数万条轨迹的背景下,计算开销与时间成本呈现爆炸式增长。

Token 剪枝是降低视觉注意力和多模态序列冗余的经典方法,此前多项工作表明机器人视觉观测中存在大量与操控意图无关的背景像素冗余。然而,将现有的推理时剪枝或离线微调剪枝策略直接迁移至在线强化学习框架却面临严重的训练崩溃危机。若仅在测试时剪枝,策略在训练阶段从未接触过稀疏观测,会产生显著的训练-测试分布偏移;若在环境采样 Rollout 阶段引入动态剪枝,而策略在计算重要性采样比率或动作对数似然更新时使用了不同的剪枝配置(例如使用全量 Token 或轻微偏离的 Token 预算),GRPO 的重要性权重比值 \(r_t(\theta)\) 将彻底脱离轨迹生成的采样分布,导致近端策略优化中的 KL 散度急剧发散、有效相对优势信号归零并最终导致策略退化崩溃。

本文的核心切入点在于:剪枝操作必须与策略优化在强化学习闭环中深度耦合与共同演化。核心 idea:提出剪枝感知在线强化学习框架 PARL-VLA,在环境交互采样时记录每个样本的具体剪枝配置与随机扰动并在策略参数更新时严格重放,确保探索与利用过程的剪枝一致性,并结合覆盖多种 Token 预算的谱剪枝课程训练,实现兼具高推理效率与强抗扰动鲁棒性的单一通用策略。

方法详解

整体框架

PARL-VLA 将可微分的视觉 Token 剪枝模块无缝嵌入到基于 OpenVLA-OFT 的在线 GRPO 强化学习流水线中。智能体在每个控制时间步接收图像观测与语言指令,视觉编码器提取的 Patch Token 序列在送入主干语言 Transformer 之前经过文本引导的评分网络打分,依据当前采样预算与随机扰动实施离散硬剪枝(Hard Top-k)。在 Rollout 采样阶段,轨迹元数据精确记录所使用的 Token 预算 \(k\) 与选择扰动 \(\epsilon_t\);在策略更新阶段,利用直通梯度估计(Straight-Through Estimator)联合反向传播更新策略参数与剪枝网络,并通过回放一致的剪枝配置保证重要性采样似然比严格对齐。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["环境多模态观测<br/>图像 It + 指令 x"] --> B["文本引导评分与直通估计选择<br/>门控聚合指令特征并计算余弦相似度"]
    B --> C["多保全率谱剪枝课程<br/>动态调度 Token 预算 k 与探索扰动 εt"]
    C --> D["轻量化输入序列<br/>截断视觉 Token 序列 + 指令 Token"]
    D --> E["VLA 骨干网络执行 Rollout<br/>记录轨迹及对应剪枝配置元数据"]
    E --> F["探索-利用剪枝一致性回放<br/>重放剪枝配置重算对数概率并对齐似然比"]
    F --> G["GRPO 策略更新与端到端协同优化<br/>动作 Token 代理损失与直通梯度反传"]

关键设计

1. 探索-利用剪枝一致性:解决采样与更新分布漂移导致的策略崩溃 在基于重要性采样的在线策略梯度(如 PPO 或 GRPO)中,策略更新依赖于行动概率比率 \(r_{i,t}(\theta) = \exp(\log \pi_\theta(a_{i,t}|s_{i,t}) - \log \pi_{\theta_{\text{old}}}(a_{i,t}|s_{i,t}))\)。若智能体在 Rollout 探索阶段基于剪枝后的状态观测 \(\tilde{V}_t\) 执行动作,而在利用阶段更新 \(\theta\) 时却使用未剪枝的全量 Token 或不一致的 Token 预算重新前向计算对数概率,就会破坏马尔可夫决策过程中的观测一致性假设。此时模型计算出的转移似然与经验采样的实际策略发生严重失配,导致经验 KL 散度迅速飙升至 1.0 以上,动作概率比剧烈震荡并破坏组内相对优势 \(\hat{A}_i\) 的有效信号。PARL-VLA 通过在轨迹缓存中为每个时间步挂载剪枝元数据 \((k, \epsilon_t)\),在计算策略梯度损失时显式强制利用相同的 Token 保留掩码重放前向传播,从而消除探索与利用之间的分布断裂,使近似 KL 稳定维持在 0.01 左右的平稳收敛区间。

2. 文本引导评分与直通估计选择:自适应保留任务关键线索 为了让模型在不同任务下自适应识别哪些视觉区域属于任务关键线索(如机械臂末端执行器、目标抓取物体),PARL-VLA 构建了轻量级文本-图像交叉评分投影层。设视觉 Token 序列为 \(V_t \in \mathbb{R}^{N \times d}\),指令 Token 为 \(X_t \in \mathbb{R}^{L \times d}\),二者分别经由可学习投影矩阵映射至共享度量空间并进行 \(L_2\) 归一化:\(q_{t,\ell} = \text{norm}(W_q x_{t,\ell})\),\(\kappa_{t,n} = \text{norm}(W_k v_{t,n})\)。针对自然语言指令中的填充符号与非核心词汇,设计门控标量权重 \(g_{t,\ell} = \sigma(f_{\text{gate}}(x_{t,\ell}))\) 对指令特征实施自适应加权池化,得到聚合查询向量 \(\bar{q}_t\):

\[\bar{q}_t = \frac{\sum_{\ell=1}^L g_{t,\ell} q_{t,\ell}}{\sum_{\ell=1}^L g_{t,\ell} + \epsilon}\]

每个视觉 Token 的相关性分数为 \(s_{t,n} = \bar{q}_t^\top \kappa_{t,n}\)。在前向传播中,对分数注入均匀探索扰动 \(\epsilon_{t,n} \sim \mathcal{U}(-\sigma_t/2, \sigma_t/2)\) 并选取分数最高的 Top-\(k\) 个 Token 物理拼接输入骨干网络;在反向传播中,采用直通估计器(STE)并借助带温度退火的 Softmax 松弛构建代理梯度,使得剪枝评分参数 \(\phi\) 能够跟随强化学习的末端环境奖励实现端到端梯度优化。

3. 多保全率谱剪枝课程:防止单一计算预算过拟合并强化抗扰动鲁棒性 若策略仅针对单一固定的剪枝比例(例如固定保留 40% 的 Token)进行强化训练,模型会过度特化于特定的信息密度分布,一旦测试时算力资源波动或环境出现视觉域偏移,性能会发生断崖式下跌。PARL-VLA 提出了谱剪枝(Spectrum Training)框架,将 Token 保全率 \(\rho = k/N\) 作为分布变量纳入优化目标。同时配合宽松到激进的训练课程:在训练初期(进度 0% 至 10%),保全率采样区间设定为 \(\rho \in [0.75, 1.0]\),引导策略在接近完整信息的环境下稳健启动探索;中期(进度 10% 至 20%)过渡至 \(\rho \in [0.5, 0.75]\);后期则推进至激进的高稀疏区间 \(\rho \in [0.25, 0.5]\)。这一谱系化扰动机制迫使策略学会在极低视觉线索下提取最本质的几何与空间关系,不仅显著削弱了背景纹理、全局光照等无意义扰动对控制决策的干扰,还赋予了单一模型在推理时按需动态调节 Token 预算的泛化能力。

损失函数 / 训练策略

PARL-VLA 依托分组相对策略优化(GRPO)框架更新 VLA 骨干参数 \(\theta\) 与剪枝参数 \(\phi\)。针对同一指令 \(x\) 采样包含 \(G\) 条轨迹的候选组 \(\{\tau_i\}_{i=1}^G\),环境返回标量回报 \(R_i\)。组内相对优势计算为:

\[\hat{A}_i = \frac{R_i - \text{mean}(\{R_j\}_{j=1}^G)}{\text{std}(\{R_j\}_{j=1}^G) + \epsilon}\]

策略更新目标采用截断代理损失函数(Clipped Surrogate Objective):

\[\mathcal{L}_{\text{GRPO}}(\theta, \phi) = -\mathbb{E}\left[ \min\left( r_{i,t}(\theta, \phi)\hat{A}_i, \, \text{clip}(r_{i,t}(\theta, \phi), 1-\epsilon_c, 1+\epsilon_c)\hat{A}_i \right) \right]\]

其中期望仅在有效的动作 Token(排除填充符及终止态之后的位置)上计算。全部实验基于 RLinf 框架与 FSDP 分布式引擎训练 100 个 epoch,由于主剪枝课程处于 \(\rho \in [0.25, 0.5]\) 的稀疏区间,统一选取第 75 epoch 检查点进行最终评测。

实验关键数据

主实验

在 LIBERO-Plus 评测基准上,PARL-VLA 与未剪枝全量基线 RLinf、测试期即插即用剪枝基线 FastV 及 VLA-Pruner 进行了严格的跨分布鲁棒性对比(包括光照条件、背景纹理、物体空间布局三大扰动类别)。在测试时,PARL-VLA 分别评估了低(保留 30%)、中(保留 50%)、高(保留 70%)三种不同 Token 预算配置。

扰动类别 评估方法 Spatial 成功率 (%) Object 成功率 (%) Goal 成功率 (%) Long 成功率 (%) 平均成功率 (%)
光照变化 (Light) RLinf (全量 Token) 83.9 44.1 63.8 59.1 62.7
光照变化 (Light) FastV 71.9 38.7 74.6 56.9 60.5
光照变化 (Light) VLA-Pruner 77.7 47.5 62.4 57.3 61.2
光照变化 (Light) PARL-VLA (Low, 保留30%) 86.6 44.1 74.9 61.7 66.8
光照变化 (Light) PARL-VLA (Medium, 保留50%) 84.9 49.8 76.3 57.3 67.1
光照变化 (Light) PARL-VLA (High, 保留70%) 82.9 51.2 75.6 65.0 68.7 (+6.0)
背景变化 (Background) RLinf (全量 Token) 91.9 81.0 79.0 69.6 80.4
背景变化 (Background) FastV 82.2 69.8 78.3 70.2 75.1
背景变化 (Background) VLA-Pruner 84.5 79.4 75.8 67.1 76.7
背景变化 (Background) PARL-VLA (Low, 保留30%) 95.3 82.3 83.3 73.0 83.5
背景变化 (Background) PARL-VLA (Medium, 保留50%) 96.5 82.3 85.8 71.6 84.1 (+3.7)
背景变化 (Background) PARL-VLA (High, 保留70%) 93.0 81.0 86.1 70.2 82.6
布局扰动 (Layout) RLinf (全量 Token) 87.0 62.0 57.2 63.5 67.4
布局扰动 (Layout) FastV 80.8 61.8 58.4 60.3 65.3
布局扰动 (Layout) VLA-Pruner 73.5 58.6 56.2 57.7 61.5
布局扰动 (Layout) PARL-VLA (Low, 保留30%) 89.4 60.3 59.1 62.8 67.9
布局扰动 (Layout) PARL-VLA (Medium, 保留50%) 90.1 64.5 58.6 64.1 69.3
布局扰动 (Layout) PARL-VLA (High, 保留70%) 93.0 63.5 58.8 67.3 70.6 (+3.2)
综合均值 (Mean) RLinf (全量 Token) 87.6 62.4 66.7 64.1 70.2
综合均值 (Mean) FastV 78.3 56.8 70.4 62.5 67.0
综合均值 (Mean) VLA-Pruner 78.6 61.8 64.8 60.7 66.5
综合均值 (Mean) PARL-VLA (Low, 保留30%) 90.4 62.2 72.4 65.8 72.7
综合均值 (Mean) PARL-VLA (Medium, 保留50%) 90.5 65.5 73.6 64.3 73.5
综合均值 (Mean) PARL-VLA (High, 保留70%) 89.6 65.2 73.5 67.5 74.0 (+3.8)

在真实物理环境(AgileX Piper 机械臂)的 RoboTwin2.0 基准测试中,经历光照、背景与布局多重扰动下的 405 次真实操作测试表明:PARL-VLA 达到 46.9% 的总体真机成功率(95% Wilson 置信区间为 42.1%–51.8%),大幅优于全量基线 RLinf(37.0%)、VLA-Pruner(26.7%)和 FastV(21.2%)。

消融实验

谱训练(Spectrum Training)与固定保全率训练消融对比: 该实验在 LIBERO-Plus 基准上评估不同训练保全率分布对于测试时多预算泛化能力的影响,结果展示于下表:

训练配置 (Training) 测试 \(\rho=0.30\) 成功率 (%) 测试 \(\rho=0.40\) 成功率 (%) 测试 \(\rho=0.50\) 成功率 (%) 跨预算平均 (%) 跨预算最差表现 (%) 说明
固定保全率 \(\rho = 0.30\) 63.9 71.1 72.7 69.2 63.9 训练过拟合单一极低预算,泛化受限
固定保全率 \(\rho = 0.40\) 69.2 71.9 72.1 71.1 69.2 最佳固定预算基线,低保全率下掉点
谱训练 (Spectrum, 本文) 72.7 74.4 73.5 73.5 72.7 全面超越固定设置,最差表现提升 +3.5%

训练效率与加速对比: 在训练吞吐量与耗时方面,PARL-VLA 平均裁撤 55% 视觉 Token,在各任务套件上展现出显著计算加速(见下表):

评估指标 全量基线 RLinf PARL-VLA (本文) 效率增益 / 加速比
视觉 Token 削减比例 (Token Reduction) 0.00% 55.0% 降低 55% 计算负载
Rollout 策略前向耗时 (Policy Forward) ~298 ms ~229 ms 1.30× 加速
Actor 参数更新反向耗时 (Actor Training Time) 432–453 ms 256–264 ms 1.66×–1.74× 加速
单步端到端总时间 (End-to-End Step Time) 0.81–0.84 s 0.67–0.70 s 1.21×–1.23× 端到端提速
LIBERO 任务分布内平均成功率 (In-distribution Success) 94.4% 94.7%–94.9% 无损维持原分布极高成功率

关键发现

  • 剪枝一致性是强化学习收敛的生命线:若更新阶段使用全量 Token 或偏离 Rollout 的剪枝配置,近似 KL 散度会在数个更新步内突破 1.0,导致组内优势估计彻底失效;只有精准重放 Rollout 剪枝配置,KL 才能平稳收敛在 0.01 附近。
  • 动态谱训练显著增强跨预算与跨域泛化:固定预算训练容易造成对特定信息密度的脆弱依赖,而谱训练课程使模型学会抓住极简的操纵核心因果线索,在最严苛的 \(\rho=0.30\) 评估中性能高出固定训练 8.8 个百分点(72.7% vs 63.9%)。
  • 剪枝具备天然的特征去噪与注意力正则化功效:在保留 30%–50% Token 的激进剪枝下,LIBERO-Plus 背景与光照扰动测试的成功率不仅未下滑,反而反超了未剪枝基准(例如背景测试中从 80.4% 攀升至 84.1%),注意力热图表明其滤除了与动作无关的环境光斑与杂波纹理。

亮点与洞察

  • 将 Token 剪枝配置纳入强化学习环境交互元数据:通过为每条轨迹附加 \((k, \epsilon_t)\) 并在利用期回放,用几乎零存储代价攻克了强化学习引入剪枝时普遍存在的似然比断裂难题。
  • 谱剪枝课程兼顾了探索稳定与极致算力压缩:从宽松到激进的三阶段保全率调度,既保障了策略初期能够探索到成功动作轨迹,又在后期最大化压榨多模态骨干的计算冗余,实现 1.7× 的参数反传加速。
  • 剪枝是提升具身模型 OOD 鲁棒性的低成本正则器:该范式展示了算力削减与鲁棒性提升并非零和博弈,通过强制模型基于稀疏 Token 进行动作解码,能够自然剥离对易受物理环境干扰特征的脆弱依赖。

局限与展望

  • 环境交互仍占端到端耗时大头:尽管策略模型前向与反向分别取得 1.3× 与 1.7× 加速,但受限于物理仿真器步进(Simulation Stepping)与视觉前端编码开销,端到端实际加速比为 1.2× 左右,未来需配合轻量化视觉编码器进一步释放端到端吞吐潜能。
  • 缺乏时序维度与跨视角的动态分配:当前剪枝独立在各单帧上进行,未能在多相机多视角或连续控制帧间自适应分配动态 Token 预算。
  • 动作执行目前依赖开环离散分块:在应对更加复杂的长程高频接触任务时,若视觉反馈受到过度剪枝,高精装配类动作的成功率仍存在波动风险。

相关工作与启发

  • vs RLinf / SimpleVLA-RL: RLinf 与 SimpleVLA-RL 奠定了 VLA 在线强化学习的分布式架构基础,但在轨迹收集与更新全流程处理未压缩的多模态 Patch,计算开销巨大且易受视觉扰动影响。PARL-VLA 证明通过在循环内部对齐剪枝元数据,能够以更低的训练与推理开销取得更高的泛化成功率。
  • vs FastV / VLA-Pruner: FastV 与 VLA-Pruner 主要聚焦于离线后处理或推理时即插即用式丢弃 Token,由于训练与测试时观测特征存在严重分布偏移,直接迁移到在线强化学习中导致性能大幅下跌(平均成功率落后 PARL-VLA 6–8 个点)。
  • vs DTP (Distracting Token Pruning): DTP 初步探索了视觉剪枝在去除背景干扰中的益处,但仅局限于监督微调阶段。PARL-VLA 首次打通了在在线 Policy Gradient 闭环中联合优化剪枝与动作策略的完整理论与工程路径。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次深入剖析在线 VLA-RL 剪枝的不一致性本质并提出配置重放与谱剪枝机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 LIBERO、LIBERO-Plus 三大类万种扰动以及 405 次真机测试,数据扎实完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,对探索利用不匹配与 KL 发散的机理解释极其清晰透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为具身通用智能体的大规模高效强化学习后训练提供了兼具实用性与泛化性的标准范式]