跳转至

One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies

会议: ECCV2026
论文: ECCV 原文
领域: 机器人/具身智能
关键词: 视觉运动策略、自蒸馏、流匹配、单步生成、动作热启动

一句话总结

OFP 用区间自一致性、自引导正则化和动作热启动,将生成式机器人策略压缩为一次网络求值,在 56 项三维仿真操作任务上达到 71.6% 平均成功率,高于百步 DP3 的 66.4%,且动作块生成耗时从 3225.67 ms 降至 17.58 ms。

研究背景与动机

机器人模仿学习不能简单地把每幅图像映射到一个平均动作:同一物体可能有多条合理的接近路线,而精细操作又需要连续、精确的控制量。Diffusion Policy 和流匹配策略通过生成一段未来动作来表达这种多模态性,但每次决策通常要反复调用网络,把噪声逐渐变成动作。控制环路需要根据新观测不断纠偏,因而生成延迟不仅是吞吐量问题,也会让机器人依据过时状态执行计划。

现有加速路线各有不足。按作者的分析,一致性蒸馏擅长把长轨迹压缩成少量步骤,但单步输出可能过于平滑;得分蒸馏更偏向高概率动作模式,却可能损失多样性,而且 OneDP 一类单步生成器不能自然增加采样步骤来换取精度。MeanFlow 则直接学习平均速度,但其训练中的雅可比向量积(JVP)增加了计算负担和优化敏感性。OFP 希望同时保留连续动作分布、单步精度和少步可调性,也不再先训练一个独立教师。

作者把问题拆成两种互补约束:先让跨时间区间的运输预测彼此一致,再让单步结果偏向当前观测下可靠的专家动作;部署时进一步利用上一轮尚未执行的计划,减少从纯噪声重新生成的难度。核心 idea:用同一策略的 EMA 副本同时提供轨迹一致性监督和条件分布校正,再以动作热启动缩短单步运输距离。

方法详解

整体框架

输入是专家示范中的观测和动作块,观测可包含图像、点云、本体状态及语言,输出是预测长度为 \(H\) 的连续动作序列。与普通流匹配只预测某个时刻的瞬时速度不同,OFP 的网络同时接收起点和终点时间,预测整个区间的平均速度,因此一次调用即可跨越一个较长区间。

训练中,区间自一致性通过 EMA 教师构造目标,流匹配锚定则把瞬时速度约束在专家数据上;自引导正则化对单步动作重新加噪,并利用同一个 EMA 网络的条件与无条件输出差来校正学生。部署阶段不运行这两套监督分支,而是把训练好的网络用于动作热启动后的单次更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["训练:专家动作<br/>观测与噪声"] --> B["区间自一致性"]
    B -->|共享学生与 EMA 教师| C["自引导正则化"]
    C -.->|联合训练后的策略参数| D["动作热启动"]
    E["推理:新观测<br/>上一动作块与噪声"] --> D
    D --> F["单次区间更新<br/>生成新动作块"]
    F --> G["执行前缀<br/>保留未执行后缀"]
    G -->|下一控制周期| E

图中的虚线表示训练参数交付,不是推理时额外执行一次教师校正。没有可复用动作块时,文中也给出了从纯高斯噪声直接生成的单步形式。

关键设计

1. 区间自一致性:让网络直接学习跨区间运输,而不是粗糙积分瞬时速度

设当前动作空间状态为 \(z_t\),观测为 \(o\),网络输出 \(u_\theta(z_t,t,r\mid o)\),其中 \(0\leq t\leq r\leq1\)。它表示从时间 \(t\)\(r\) 的平均速度;原文式(4)的更新关系为:

\[ z_r=z_t+(r-t)u_\theta(z_t,t,r\mid o). \]

这不是把原来的流匹配模型少运行几次:普通网络学的是瞬时方向,而 OFP 学的是整个区间的净位移除以时间跨度。在训练样本中,专家动作与噪声按直线插值得到 \(z_t\) 和更靠后的 \(z_m\)。EMA 教师从 \(z_m\) 预测区间终点,学生则从 \(z_t\) 预测同一终点;监督目标就是教师终点与 \(z_t\) 的差除以 \(r-t\)。因此,学生把较短区间的预测能力吸收到较长区间中,EMA 副本无需预先单独训练。

从零训练时,教师也不可靠,所以中间时刻不能一开始就紧贴起点。作者让 \(m\)\([t,t+(r-t)\rho(s)]\) 均匀采样,其中 \(s\) 是训练步数,收缩因子逐渐减小。早期区间较宽,目标更多依靠带有专家信息的插值状态;后期 \(m\) 靠近 \(t\),目标转向局部一致性。相比 MeanFlow,这种目标构造不需要显式 JVP,但学生参数仍需正常反向传播,不能理解为整个训练只有前向计算。

仅让模型与自身相符,可能得到一致却不正确的解。因此,作者还在起终时间相同的对角线上加入流匹配锚定,以专家动作减去噪声作为瞬时速度监督。锚定提供外部数据依据,自一致性负责跨区间推广;理论命题还依赖速度场平滑、全局 Lipschitz 和 EMA 教师足够准确,不能将其当作任意训练状态下的收敛保证。

2. 自引导正则化:把单步输出推向当前观测对应的高密度动作模式

轨迹一致并不意味着终点足够精确,例如两个合理抓取方案之间的平均动作可能无法真正抓住物体。OFP 先从一个噪声与专家动作的插值状态出发,单步预测完整动作,再用独立噪声和另一个时间点对预测动作重新加噪。重新加噪后的状态交给 EMA 教师,分别查询有观测条件和空条件下的瞬时速度,使两种预测在相同状态、相同噪声尺度上可比较。

作者从反向 KL 的得分差出发,引入无分类器引导(CFG),将校正拆成分布匹配项和 CFG 增强项,但实际只保留后者。条件与无条件预测之差强化了“适合当前观测”的方向,并用于构造停止梯度的回归目标;学生拟合该目标时,获得偏向条件高密度区域的更新。这里利用的是同一模型内部的条件差异,而不是额外训练一个独立得分网络。

无条件分支通过训练时随机丢弃观测、替换为空条件来学习,不需要另一套网络。教师和停止梯度目标仅服务于训练,部署时仍可以只调用一次策略。这也限定了方法的理论表述:保留 CFG 增强项是实用的自引导近似,不意味着精确最小化完整反向 KL,也不能仅凭成功率就证明动作分布的多样性完全保留。

3. 动作热启动:复用尚未执行的计划,减少单步必须完成的位移

机器人采用滚动时域控制,每次生成 \(H\) 个动作,只执行前 \(h\) 个。下一周期中,上一动作块的未执行后缀仍然提供有用的短期计划。OFP 将其左移,并用最后一个动作重复填满尾部,形成同样长度的先验,再加入高斯噪声;新观测则用于修正这份旧计划,而不是盲目执行它。

将该先验记为 \(a_{\mathrm{warm}}\),文中清晰给出的热启动关系可写为:

\[ z_{t_w}=(1-t_w)\epsilon+t_w a_{\mathrm{warm}},\qquad \hat a=z_{t_w}+(1-t_w)u_\theta(z_{t_w},t_w,1\mid o). \]

与从纯噪声走完整条路径相比,这个初始状态已经带有近期动作结构,一步更新只需修正残余误差。热启动不增加新的训练阶段或网络求值次数,但原文实测中确有少量处理开销,因此不应表述为严格零耗时。它也依赖相邻控制周期的相关性:场景骤变或旧计划失败时,过强地信任先验可能不利于重新规划。

一个完整示例

为说明索引操作,假设某次生成长度为 8 的动作块并执行前 3 个动作;这些数字只是机制示例,不是论文报告的超参数。下一周期保留旧动作中的第 4 至第 8 个,共 5 个,再重复末动作 3 次,得到新的 8 动作先验。

随后给这个先验加噪,在新观测条件下做一次从 \(t_w\) 到 1 的区间更新,输出一整段修正后的动作,再执行前缀并重复循环。EMA 教师、条件丢弃和重新加噪的校正分支已经在训练中发挥作用,不在这个控制周期里额外运行。“一步”指动作块生成的一次网络求值,不是完成整个任务只需要一个物理动作。

损失函数 / 训练策略

联合训练包含流匹配锚定损失、自一致性损失和自引导损失,后两者分别由 \(\lambda_c\)\(\lambda_g\) 加权。每批次抽取专家观测与动作、时间变量和噪声,施加条件丢弃,计算三种监督后更新学生,最后更新 EMA 教师。没有预训练外部教师,不等于没有教师副本或训练额外开销。

当前缓存中式(6)、(13)至(15)存在公式抽取损坏,因此这里按清晰正文解释目标含义,不补写缺失括号、系数或精确回归表达式。正文也没有给出可核验的 EMA 衰减率、损失权重、条件丢弃概率和热启动时间的具体默认值,复现时仍需核对完整附录或实现。

推理可选择纯噪声到终点的一次更新,也可将时间轴拆成多个区间逐段调用同一网络。由此得到的是一个能在单步和少步之间切换的策略,而不是为每个采样预算训练独立模型。

实验关键数据

主实验

二维设置使用 Adroit 的 3 项和 DexArt 的 4 项任务;三维设置再加入 MetaWorld 的 49 项任务,共 56 项。表中成功率均为百分比,按 3 个随机种子报告均值与标准差;NFE 是生成动作块时的网络求值次数。下表提取原文表 1、表 2 的平均列,二维与三维是不同评测设置,不能混成一个总平均。

方法 NFE 2D 平均成功率(表 1) 3D 平均成功率(表 2)
DP / DP3 100 64.2 ± 2.3 66.4 ± 5.7
DP / DP3 10 60.9 ± 2.3 65.2 ± 2.8
FM Policy 100 67.2 ± 1.7 59.8 ± 4.6
FM Policy 10 64.0 ± 2.8 57.9 ± 7.0
CP 1 59.7 ± 2.6 54.7 ± 2.9
OneDP 1 63.3 ± 2.1 62.4 ± 3.0
MP1 1 60.5 ± 5.0 57.4 ± 5.8
OFP 1 68.3 ± 2.1 71.6 ± 4.1

在三维设置中,相对百步 DP3,OFP 提升 5.2 个百分点,按表中四舍五入数值计算约为 7.8% 相对增幅;相对百步 FM Policy 提升 11.8 个百分点,约为 19.7% 相对增幅。原文将前者概括为 8%,不能读成增加 8 个百分点。

主文第 4.2 节报告 OFP、百步 DP3、百步三维 FM Policy 的动作块生成时间分别为 17.58、3225.67、1865.72 ms,对应约 183 倍和 106 倍加速。这是所报告设置下的生成延迟,不代表机器人整套感知、规划、通信和执行链路均加速相同倍数。

消融实验

原文主文仅定性总结模块移除效果,并把详细消融放到附录;当前缓存没有该附录,因而不能给出逐模块下降数字。下面保留表 3 可核实的步数分析:同一方法增加 NFE 是否还能提升成功率,而不是把它冒充模块消融。

方法 NFE Bucket Faucet Laptop Toilet 平均成功率
OneDP 1 32.7 ± 5.8 44.7 ± 3.1 89.3 ± 3.8 83.3 ± 3.8 62.5 ± 4.1
CP 1 29.3 ± 3.5 44.3 ± 3.8 86.7 ± 2.5 82.3 ± 3.8 60.7 ± 3.4
CP 4 38.3 ± 4.2 43.7 ± 1.2 90.0 ± 3.5 84.7 ± 2.9 64.2 ± 2.9
OFP 1 39.3 ± 0.6 45.7 ± 3.8 91.7 ± 3.2 81.3 ± 3.2 64.5 ± 2.7
OFP 4 42.7 ± 2.1 47.0 ± 1.0 92.3 ± 4.2 83.0 ± 1.7 66.2 ± 2.2

OFP 从 1 步到 4 步提高 1.7 个百分点,CP 提高 3.5 个百分点,但 OFP 的单步平均值已略高于 CP 的四步结果。表 3 的 OFP 单步均值为 64.5%,与表 2 的 DexArt 列 64.3% 略有差异,正文没有解释;两处数值按原表保留,不强行统一。

关键发现

  • 单步精度与少步可调性可以共存,但平均领先不代表逐任务领先:表 3 的 Toilet 上,OFP 四步为 83.0%,低于 CP 四步的 84.7%。
  • 图 4 的 Faucet 数据规模实验中,OFP 从 20 个示范时的 32.7% 提升至 150 个示范时的 51.0%;这支持该任务上的数据扩展趋势,不代表所有任务都验证了相同规律。
  • 图 5 与第 4.3 节报告,接入 \(\pi_{0.5}\) 后,OFP 单步在 RoboTwin 2.0 四项任务上的平均成功率为 94.7%,高于原十步策略;缓存未提供基线柱子的清晰精确值,因此不计算差值。

亮点与洞察

  • 把“跨多远”变成网络输入。 区间平均速度直接承接采样预算,避免把降低 NFE 仅理解为更粗的数值积分;同一模型因而能兼容一步和少步控制。
  • 条件与无条件之差可成为内部评价信号。 自引导利用已经学到的观测依赖来校正单步动作,但需要明确区分这种校正与完整分布匹配,后者并未被严格实现。
  • 生成难度也由初始状态决定。 保留上轮计划中的有效后缀,是利用控制问题独有的时间结构,而非只在生成模型的求解器上做优化。

局限与展望

  • 尚无实机验证。 作者明确承认实验全部在仿真中;接触误差、传感延迟和执行器限制可能改变热启动与低延迟生成的实际收益。
  • 模块贡献缺少当前可核验的数值。 缓存没有详细消融附录,不能据主结果判断三个组件各贡献多少,也不能验证关键超参数的敏感性。
  • 分布质量与成功率不是同一指标。 论文强调保留多样性,但当前可读实验主要是任务成功率;仍需动作模式覆盖、失败恢复和多解任务上的专项评测。
  • 热启动可能继承错误计划。 基于方法机制的后续方向是按观测变化或执行误差自适应降低旧计划权重,并测试突发扰动下是否需要回退到纯噪声初始化;这不是本文已实现的模块。
  • VLA 扩展证据范围有限。 四项 RoboTwin 2.0 任务和域随机化支持初步迁移能力,尚不能等同于跨机器人或开放世界普适性;模型量化与剪枝也是作者提出的后续方向。

相关工作与启发

  • 与 Diffusion Policy / DP3、FM Policy 相比:它们依靠反复去噪或积分生成动作,OFP 重新设计训练目标以学习长区间更新;优势不只是减少原有采样器步数。
  • 与 Consistency Policy 相比:CP 采用预训练教师蒸馏,OFP 从零训练学生及其 EMA 副本,并额外用自引导改善单步动作精度;两者都能从增加采样步数中获益。
  • 与 OneDP 相比:OneDP 采用得分蒸馏,OFP 将条件得分启发的校正融入区间模型,保留少步推理接口;这不意味着无需担心模式偏好或分布偏移。
  • 与 MeanFlow / MP1 相比:两者都利用平均速度思想,但 OFP 用中间时刻的 EMA 预测构造自蒸馏目标,避开显式 JVP;这一差别针对的是训练路径,而非简单换一个骨干网络。

评分

  • 新颖性: 4/5。将无外部预训练教师的区间自蒸馏、条件校正与动作复用组合成可变步数策略,单个组成思想有明确前序工作。
  • 实验充分度: 4/5。覆盖 56 项三维任务、二维评测及四项 VLA 任务,但缺少实机证据,当前缓存也无法核验详细模块消融。
  • 写作质量: 4/5。方法分工清楚,理论假设与工程目标衔接较好;公式抽取损坏和部分跨表数值差异需回原版核对。
  • 价值: 4/5。单步动作生成与滚动时域复用具有实际部署吸引力,价值仍需由真实控制链路中的延迟和可靠性验证。