跳转至

Action Chunking Proximal Policy Optimization with Feedback Correction

会议: NeurIPS 2026(arXiv 清单中作者自报 accepted,未核实录用类型)
arXiv: 2609.36250
代码: https://github.com/hshhahn/ACPPO.git
领域: 机器人/具身智能
关键词: 动作分块、近端策略优化、闭环反馈、块级优势、残差正则化

一句话总结

ACPPO-Corr 用低频动作块规划器与逐步反馈校正器共同扩展 PPO,保留仅输入状态的价值网络,在 25 个模拟机器人任务上将最终归一化四分位均值相对 PPO 提升 30.4%,而不是提升 30.4 个成功率百分点。

研究背景与动机

动作分块让策略一次预测未来几步动作,而不是每一步都重新决定全部动作。在机器人模仿学习中,这有利于表达连贯的运动;在强化学习中,它还能把探索组织成短动作序列,让一个规划决策承担多步后果。然而,许多分块强化学习方法同时学习动作块价值函数:价值网络不仅要看状态,还要评价一个维度随动作自由度和块长共同增长的动作序列。对于高自由度双手操作,这比标准 PPO 的状态价值回归更难,且不少既有方法依赖离线数据或较重的序列架构。

另一个问题发生在执行阶段。动作块在起点看过状态之后,如果接下来完全开环执行,物体滑移、手指接触改变或落脚偏差都无法及时影响当前动作。这不是单纯把控制调用变少的问题:块内各步可以不同,却仍然是基于旧状态选好的动作。作者因此把两个问题分开处理,先用 ACPPO 证明可以给 PPO 的 actor 加入分块而不引入动作块 Q 网络,再用 ACPPO-Corr 补回块内反馈。主实验里开环 ACPPO 整体反而弱于 PPO,说明时间抽象本身并不足以应对这些接触丰富的任务。

本文关注从零开始、完全在线、同策略的训练,而不是给冻结的模仿学习控制器添加部署补丁。核心 idea:让低频规划器负责动作序列的时间结构,让每步读取新状态的校正器负责局部响应,再用整块联合概率比与块级优势共同训练两者,使分块规划不必以失去闭环反应为代价。

方法详解

整体框架

在动作块起点,规划器读取当前状态,输出长度为 \(h\) 的动作均值序列。普通 ACPPO 随后依次取出这些均值,并采样执行动作,不再根据块内新状态改动均值;ACPPO-Corr 则每一步都运行反馈校正器,把当前状态对应的修正加到当步计划上,同时提供该步高斯探索尺度。

训练仍然采集逐步状态、奖励、终止标记和动作概率。状态价值网络在每一步预测价值,标准逐步广义优势估计(GAE)用于构造价值回归目标;actor 的学习信号则汇总成一个块级优势,并配合整个有效动作块的联合重要性采样比。推理时只需要规划器和校正器,不需要价值网络或奖励。

下面实线表示采样执行的数据流,虚线表示轨迹到训练目标及参数更新的关系。规划器的块内输出是开环计划,校正器的输入才是实时反馈;训练节点不是额外的在线控制模块。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    S["块起点状态"] --> P["动作块规划"]
    P --> C["逐步反馈校正"]
    E["环境:动作、状态、奖励"] -->|每步新状态| C
    C -->|采样动作| E
    E -.-> A["投影价值与块级优势"]
    A -.-> J["联合块目标与分离更新"]
    J -.->|训练更新| P
    J -.->|训练更新| C

关键设计

1. 动作块规划:只把时间抽象放进 actor,不让价值输入随块长增长

规划器在每个块起点输出 \(h\) 个动作均值,每个均值仍具有原环境的动作维度。主实验取 \(h=4\):一次规划四步,但这四步并不是重复同一个动作。ACPPO 与 PPO-Repeat 的区别正在这里,前者能形成变化的动作序列,后者仅降低决策频率。网络实现沿用多层感知机,而非为分块引入 Transformer;ACPPO 主要扩大 actor 输出层,状态价值网络仍保持原有输入形式。

需要区分“预测均值序列”和“确定性地执行整块”。开环 ACPPO 在每一步仍从高斯分布采样执行动作,开环指的是均值不读取块内新状态,并不是取消随机探索。ACPPO-Corr 保留同一规划骨架,把后续响应交给校正器。规划器因此不必在每一步重新输出整块,也无需显式学习环境动力学,但它仍可能在接触状态发生根本变化时坚持已经过时的计划。

2. 逐步反馈校正:用新状态调整当步计划,而不是重新规划整个块

校正器每一步读取当前状态,输出一个与动作同维度的加性修正和探索尺度。它不以动作块作为显式输入;当步计划与校正器输出在策略均值处相加,形成实际执行的高斯策略。下面 \(u_{t_0,k}\) 表示块起点产生的第 \(k\) 步计划,\(c_t\) 和 \(\sigma_t\) 来自当步状态,\(t_0\) 是当前块起点:

\[ \pi_\theta(a_t\mid s_t,s_{t_0},k) =\mathcal{N}\!\left(u_{t_0,k}+c_t,\operatorname{diag}(\sigma_t^2)\right). \]

这个结构恢复的是块内闭环响应,不是让规划器每步刷新。比如手中物体稍微滑动,校正器可以根据新位置调整当步手指动作,而下一步仍从原计划取出下一项。探索也在逐步分支中产生,因此修正不是一个纯确定性的后处理器。两分支均从在线交互中学习,校正器不是叠加在冻结的预训练策略上。

仅有相加还不能保证分工成立。校正器若可以任意放大,就可能承担几乎全部动作,规划器退化成可忽略的背景项。作者用修正向量的平方范数惩罚约束这一倾向,而不是把校正幅度硬截断成固定阈值。这会鼓励规划器承担持续性的动作结构,把修正留给实时偏差;但正则过强也可能抑制必要反馈,所以强度需要按任务选择,不能理解成修正越小越好。

3. 投影价值与块级优势:保留逐步价值回归,让 actor 按整块后果分配信用

同一个物理状态若出现在不同动作块的中间,其后续回报可能不同,因为剩余计划、块起点和块内索引不同。严格的状态应包含这些活跃块变量;仅看物理状态的价值网络无法逐例恢复这个扩展状态价值。论文没有把它宣称为精确的 Markov 价值,而是解释为平方损失下的条件期望投影:

\[ V_*^\pi(s)=\mathbb{E}\!\left[\widetilde V^\pi(s_t,z_t)\mid s_t=s\right]. \]

这里 \(z_t\) 汇集活跃块信息,平均分布由当前策略产生。这个解释很重要:不学习块 Q 函数并不意味着完全消除了时间抽象带来的价值近似误差,而是选择了输入维度固定、训练成本较低的预测器。价值网络仍以逐步 GAE 加当前价值形成的回报目标回归,不改成直接回归每个动作块的 Q 值。

actor 则只在块起点形成一个优势。它先用折扣系数累积块内的逐步 TD 残差,再接上下一块边界的标准逐步 GAE 尾项。令 \(\delta_t=r_t+\gamma V_\phi(s_{t+1})-V_\phi(s_t)\),论文式 (1) 为:

\[ \hat A_{t_0}^{\mathrm{chunk}} =\sum_{j=0}^{h-1}\gamma^j\delta_{t_0+j} +\gamma^h\hat A_{t_0+h}^{\mathrm{GAE}}. \]

这不是把块内逐步 GAE 直接求平均,也不是把价值网络训练频率降到每块一次。块内头部使用 \(\gamma^j\),而标准 GAE 使用 \((\gamma\lambda)^j\);前者使中间价值项望远镜式抵消,把块内动作作为一个连贯决定评价。随后仍有 GAE 尾部,因此不能把它简化成没有后续信息的纯 \(h\) 步回报。

附录 C 进一步分析相对于投影价值的近似误差:中间价值误差抵消,剩余递归 bootstrap 误差项相对逐步 GAE 多乘一个 \(\gamma^h\)。这不是所有误差都消失,也不证明估计器处处更优。对于 \(\lambda<1\),块内奖励采用更大的权重,可能提高噪声方差;同一块的所有动作共享一个优势,也失去部分逐步信用分辨率。短块是在减少中间价值依赖与保留精细反馈之间的具体选择。

4. 联合块目标与分离更新:裁剪完整闭环轨迹比,同时约束两分支分工

更新 actor 时,不能把块内每一步独立做 PPO 裁剪后再当作块目标。ACPPO-Corr 对同一条已采样轨迹,逐步计算当前策略相对于行为策略的动作密度比,再将有效前缀的各项相乘:

\[ \rho_{t_0}^{\mathrm{corr}}(\theta) =\prod_{k\in\mathcal T_{t_0}} \frac{\pi_\theta(a_{t_0+k}\mid s_{t_0+k},s_{t_0},k)} {\pi_{\theta_{\mathrm{old}}}(a_{t_0+k}\mid s_{t_0+k},s_{t_0},k)}. \]

\(\mathcal T_{t_0}\) 是终止之前实际执行的有效偏移。附录 B 的依据不是假设块内状态固定,而是沿真实闭环轨迹分解联合密度:环境转移概率与策略参数无关,在新旧策略的轨迹比里抵消。因此,校正器读取不断变化的状态并不破坏这个乘积比的解释。PPO 裁剪作用于最终乘积,配对的是同一个块级优势,而不是逐项裁剪或给每步配不同优势。

若环境在块中间结束,未执行的后缀不参与概率比或正则项。向量化采样时,终止环境暂时作为非活跃填充,直到下一个全局块边界才再次调用规划器。这避免把新回合动作混进旧块,也意味着实现必须同时处理回报的终止边界与有效动作掩码,不能无条件把所有块都按完整长度计算。

共同目标包含负的块级 PPO surrogate、标准价值回归、熵与动作边界正则,以及修正幅度惩罚。每个 minibatch 中执行两次 Adam 更新:更新规划器时对校正和探索尺度停止梯度;更新校正器/价值分支时对计划停止梯度。两者仍通过同一个实际执行策略与同一个块优势协调,不是分别学习一个块目标和一个逐步 PPO 目标。

一个完整示例

以 \(h=4\) 的模拟手内操作为例,块起点的规划器一次给出四步手指动作均值。第一步校正器看见当前物体位置,加入局部修正后采样动作;第二步如果物体发生滑移,规划器不会重新运行,但校正器读取第二步的新状态,改变第二项计划的实际执行均值。第三、第四步同样处理,到下一块边界才产生新的四步计划。

训练时,这四步的奖励与边界后的 GAE 尾部形成一个块级优势;四个动作密度比组成一个联合比。价值网络却仍在四个逐步状态上接受价值回归。若第三步终止,则概率乘积只保留前三步,第四步是填充,不是一次真实动作。这个例子展示的是算法机制,并非论文报告的一次真实硬件轨迹。

损失函数 / 训练策略

用 \(J_{\mathrm{chunk}}\) 表示以联合块概率比和块级优势构造的 clipped surrogate,论文式 (3) 可写为:

\[ \mathcal L_{\mathrm{total}} =-J_{\mathrm{chunk}}+c_v\mathcal L_{\mathrm{value}} -c_e\mathcal H[\pi_\theta^{\mathrm{co}}] +\lambda_b\mathcal L_{\mathrm{bound}} +\lambda_r\mathbb E_t[\|c_t\|_2^2]. \]

价值损失是当前状态价值与逐步 GAE 回报目标之间的均方误差,熵项保持探索,动作边界项沿用机器人 PPO 实现。上式不是给两分支各加一套独立奖励;通过停止梯度,各次更新只改变相应变量。前 \(N/20\) 个训练 epoch 冻结规划器,继续训练校正器和价值分支,随后共同训练,以减少早期不稳定优势对块规划器的影响。

主实验继承任务特定 PPO 超参数,额外从 \(\lambda_r\in\{0.03,0.1,0.3\}\) 选择校正正则强度;QC-FQL 也使用三个候选行为正则系数,分别为 \(\{1,3,10\}\)。选择基于预备调参运行,之后固定参数进行五种随机种子的报告评估。多个 actor 分支缩小 MLP 第一层宽度以控制参数量,不应把增益简单归因于复制一个完整 PPO 网络。

为控制联合比的累积变化,学习率按实测平均 KL 自适应调整:超过阈值的两倍时除以 1.5,低于一半时乘以 1.5。附录 D 的高斯固定协方差分析只提供直觉,不能当作所有闭环轨迹都满足的严格独立性保证;较长块仍会累积更大的 KL 和裁剪压力。

实验关键数据

主实验

评测覆盖 IsaacGym 的 9 个任务与 Bi-DexHands 的 16 个任务,每个方法每任务使用 5 个随机种子。目标完成类任务用成功率,进展控制类任务用回合回报;先按任务上下界归一化,再在任务—种子分数中取排序后中间 50% 的均值,即 IQM。全 25 任务最终归一化 IQM 相对 PPO 提升 30.4%。

频率子集以 PPO 与 \(h=4\) 动作重复的最终归一化任务分数之相对绝对差划分,阈值为 0.3。为避免分母接近零,只在这个分析中排除 4 个任务,剩余 21 个分为 11 个敏感任务与 10 个中性任务;不是把主评测缩减为 21 个任务。下表是同一子集上相对于 PPO 的 IQM 比,而非逐任务比值的平均。

方法 频率敏感:相对 IQM,95% 区间 频率中性:相对 IQM,95% 区间
PPO 1.00 [1.00, 1.00] 1.00 [1.00, 1.00]
PPO-Repeat 0.61 [0.55, 0.68] 0.97 [0.92, 1.02]
SAC 0.33 [0.21, 0.44] 0.59 [0.49, 0.68]
QC-FQL 0.76 [0.64, 0.87] 0.77 [0.66, 0.87]
ACPPO 0.92 [0.87, 0.97] 0.97 [0.85, 1.10]
ACPPO-Corr 1.33 [1.24, 1.43] 1.24 [1.15, 1.34]

来源为图 2(b)。区间来自固定任务集合下的 seed bootstrap,不代表对未知机器人任务分布的泛化置信区间。附录表 3 按相对最强竞争方法的归一化分数差、以 0.03 为胜负阈值统计,全任务为 13 胜 / 8 平 / 4 负;敏感子集为 7 / 2 / 2,中性子集为 5 / 5 / 0。

消融实验

配置或分析 原文结果 解释与边界
仅评估时将校正器输入替换为块起点状态 保留完整模型表现的 84.0% 不改结构,但移除块内新观测;正文 §5.2
用块起点状态输入重新从零训练 保留完整模型表现的 88.1% 重训能部分恢复,仍弱于实时反馈;正文 §5.2
用逐步 GAE 替代块级优势 弱于完整模型,未列精确标量 图 4(a) 支持方向,不从曲线猜数字
去掉校正正则 聚合表现弱于完整模型,未列精确标量 图 4(a);校正器可能吸收主要动作信号
块长 \(h\in\{1,2,4,8\}\) \(h=4\) 聚合表现最好 图 4(b);\(h=1\) 仅略优于 PPO
块级 clip fraction:\(h=2/4/8\) 0.364 / 0.369 / 0.408 附录表 9;PPO 为 0.365,长块裁剪增多

校正正则的机制还可从修正范数与计划范数之比看出。下表按原文表 1 保留最终 correction ratio;该比率不是成功率,也不能跨任务直接推断最佳表现。正文将这组结果引用为“表 2”,但缓存实际表 1 是修正比率、表 2 是长块评测;这里依据表题及内容区分,不擅自更改原文数字。

任务 \(\lambda_r=0.03\) \(\lambda_r=0.1\) \(\lambda_r=0.3\)
AllegroHand 0.222 0.053 0.007
Humanoid 0.021 0.009 0.002
ShadowHand 0.163 0.029 0.009

关键发现

  • 闭环反馈与时间抽象共同起作用:开环 ACPPO 不足以超过 PPO,\(h=1\) 的双分支结构也只带来小幅改善;不能把贡献缩减为降频或增加校正网络。
  • 更强正则稳定地降低 correction ratio,但最佳强度依任务而变。AllegroHand 偏好更强正则,Humanoid 和 ShadowHand 偏好更弱正则。
  • 长块结果必须另读:五个支持长 rollout 的任务中,\(h=16\) 时 ACPPO-Corr、ACPPO、QC-FQL 的逐任务分数比均值分别为 1.21、0.68、0.29(表 2),不是全任务 IQM。\(h=32\) 仅在 FrankaCubeStack 与 Humanoid 上评测,ACPPO-Corr 比值为 1.09 与 0.65(表 8),并非处处超过 PPO。
  • 性能有计算代价:代表性训练实现中,ACPPO-Corr 为 41,714 steps/sec、1,557,258 参数,PPO 为 47,894 steps/sec、1,463,785 参数(附录表 5)。吞吐包含 rollout 与优化,不能当作真实硬件的推理控制频率。

亮点与洞察

  • 把“价值输入不分块”和“actor 的信用跨多步”分开设计。保留熟悉的状态价值训练接口,同时承认其投影性质,比宣称分块后仍有精确逐步价值更严谨。
  • 闭环动作块的概率比沿已实现轨迹计算,环境转移项可以抵消。它让实时校正成为训练中的策略组成,而不是训练之外的启发式执行补丁。
  • 残差正则控制的是规划与反馈的职责分配,而非单纯减少动作幅度。任务相关的 correction ratio 分析揭示了这个分工,但不提供通用最优阈值。

局限与展望

  • 只有状态观测、连续动作的模拟机器人实验;没有真实硬件、视觉或触觉策略验证,也不能直接推广到离散 token 动作。
  • 联合概率比随块长累积变化,\(h=8\) 裁剪比例已经增加。短块的稳定性不是任意长时间抽象的保证,可进一步研究自适应块长与专门的稳定化机制。
  • 校正是围绕既有计划相加,可能难以彻底放弃当前操作模式。ShadowHandUpsideDown 与 ShadowHandBottleCap 仅达到 PPO 分数的 0.706 与 0.829 倍;作者将重新抓取或整体手指重配置作为可能解释,而不是已证实因果。
  • ShadowHandPushBlock 所有方法均为零成功率,不能据此断言某个模块失效。ShadowHandDoorCloseOutward 中 QC-FQL 的非零表现也同时混杂策略类、replay 与 Q 优化差异,无法归因于单一设计。

相关工作与启发

  • vs PPO / PPO-Repeat:PPO 每步重新生成动作,Repeat 重复同一动作;ACPPO-Corr 低频生成不同的序列项,同时保持逐步新状态反馈,避免把规划频率与反应频率绑在一起。
  • vs QC-FQL 与动作块 Q 学习:这些比较方法学习动作序列价值,本文以状态价值投影和块级 actor surrogate 避免扩大 critic 输入。结论限于匹配的在线模拟协议,不否定离线或预训练场景中的块 Q 方法。
  • vs 残差 RL 与预训练块策略校正:既有路线常修正冻结的基础控制器或依赖视觉/触觉预训练策略,本文两分支从零在线共同训练。值得延伸的问题是,能否在允许“放弃计划”的条件下学习校正,而不仅围绕当前动作均值微调。

评分

  • 新颖性: 4/5。将块级 PPO、投影状态价值与在线反馈校正组织成统一训练方案,主要新意在组合及信用分配。
  • 实验充分度: 4/5。25 任务、五种子与多组消融较充分,但评测仍局限于状态输入模拟环境。
  • 写作质量: 4/5。附录解释概率比与误差抵消的边界;正文 correction ratio 的表号引用存在错位。
  • 价值: 4/5。对在线高自由度控制有可复用价值,真实硬件收益和更长块稳定性仍待验证。