跳转至

Trajectory-Level Continuous Action Representation for Robotic Manipulation

会议: ECCV 2026
论文: ECCV 原文
领域: 机器人/具身智能
关键词: 连续动作表征, 轨迹级建模, 频率解耦, 具身控制, 视觉运动策略

一句话总结

针对传统具身智能策略中动作表征与控制频率严重绑定的痛点,提出轨迹级连续动作表征框架 CAT,将固定物理时间窗口内的动作序列映射为固定数量的连续潜变量 token,结合频率感知旋转位置编码与非对称因果解码,在 LIBERO、MimicGen、RoboTwin 2.0 及真实长程机械臂操作中全面超越步长级与离散化基线。

研究背景与动机

在机器人视觉运动策略学习中,任务的成败往往由轨迹中极少数关键交互片段决定,例如刚柔接触瞬间的转换、自由运动向约束操作的切换,以及执行末端的微小纠偏。相比之下,其余大部分轨迹往往只是平滑或重复的自由空间位移。然而,现有的大多数动作表征方法在建模时将表征容量均匀铺在整个时域网格上,导致平滑区域过度占据优化梯度,稀释了那些真正影响操作结果的关键动作片段的信息量。

更关键的问题在于动作表征与机器人底层控制频率的刚性耦合。以步长级离散化或动作块(action chunking)为代表的方法中,时序网格分辨率直接决定了表征序列长度。当硬件采样率由 10Hz 提升到 50Hz 时,轨迹序列长度线性膨胀,引入了大量时间冗余;而采用离散余弦变换(DCT)或 B 样条等预定义时序基函数重参数化的方法,虽然压制了序列长度的扩张,其表征能力却受制于预设的时空基函数假设,难以泛化到任意控制率或复杂多变的动态交互中。

本文的切入角度是打破动作表征与离散采样步长之间的依赖关系,直接在连续的真实物理时间窗口内建模轨迹语义。核心 idea:提出轨迹级连续动作表征框架 CAT,在固定物理时间跨度内将动作序列压缩至恒定数量的连续寄存器 token,并设计频率感知旋转位置编码(F-RoPE)统一不同控制率下的时间坐标,配合非对称因果解码与轨迹级对比正则化,实现控制频率解耦且判别力强的高效具身动作表征。

方法详解

整体框架

CAT 旨在为连续生成式策略(如 Flow-Matching 或扩散模型)提供一个表征维度恒定且频率解耦的紧凑动作隐空间。在固定物理时间跨度(\(T = 1\text{ s}\))内,无论采样频率 \(f_s\) 是 10Hz 还是 50Hz,轨迹包含的实际步长数 \(N = f_s T\) 发生变化,CAT 均将其统一映射到固定数量 \(K\) 个连续潜变量寄存器 token \(\{z_i\}_{i=1}^K\) 中。

整个系统由两部分组成:一是带有时钟归一化编码的 Transformer 编码器,利用频率感知旋转位置编码(F-RoPE)将动作序列与时间刻度对齐并汇聚至可学习寄存器 token;二是非对称因果 Transformer 解码器,由可学习动作嵌入与寄存器 token 交互,逐步自回归式还原连续执行动作。下方的流程图清晰展示了 CAT 的表征压缩、流匹配生成与跨频率动作解码的完整闭环:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入动作序列与控制频率<br/>{a_t}, 频率 f_s, 窗口 T=1s"] --> B["频率感知旋转位置编码 (F-RoPE)<br/>归一化物理时间坐标 t/f_s"]
    B --> C["结构解耦表征编码<br/>可学习寄存器汇聚至 K 个连续 latent token"]
    C --> D["轨迹级对比正则化与隐空间约束<br/>L_rec + λ_reg * L_reg 优化"]
    D --> E["Flow-Matching 策略潜空间去噪<br/>在固定长度 latent 空间预测速度场"]
    E --> F["非对称因果解码<br/>跨步长注意力与因果时序重构连续动作"]
    F --> G["多频率机器人底层控制执行"]

关键设计

1. 结构解耦表征编码:切断表征维度对时间步密度的依赖 现有步长级连续预测或离散 Tokenizer 会随采样频率提高而导致 Token 序列剧烈膨胀,CAT 通过设定固定长度的时域连续隐变量来消除这种依赖。给定物理时间窗口 \(T=1\text{ s}\) 内的动作序列 \(\{a_t\}_{t=1}^N\)(其中步长数 \(N = f_s T\) 取决于采样频率 \(f_s\)),CAT 引入 \(K\) 个可学习的连续寄存器 Token \(\{z_i\}_{i=1}^K\)(在实验中常设为 \(K=4\) 且固定不变)。寄存器 Token 在 Transformer 编码器中对所有时间步的动作进行全局双向自注意力交互,将轨迹全局语义与关键接触信息压缩进这组固定长度的连续向量中: $\(\{z_i\}_{i=1}^K = f_\theta(\{a_t\}_{t=1}^N, \{t / f_s\}_{t=1}^N)\)$ 由于 \(K \ll N\)\(K\) 不随 \(f_s\) 变化,下游策略网络(如扩散或流匹配模型)在生成动作时,只需预测这组紧凑的潜变量,大大降低了高频控制下的生成负担与时序漂移。

2. 频率感知旋转位置编码:构建跨控制频率的连续物理时间坐标 当机器人在不同控制频率下运行时,相同的离散步长索引 \(t\) 对应的实际物理时间完全不同,直接采用离散索引或标准位置编码会导致不同控制率下的运动语义割裂。CAT 提出频率感知旋转位置编码(F-RoPE),将每个步长的时间索引归一化为物理时间 \(t / f_s\),其步进间隔严格反映物理真实时间差 \(1 / f_s\)。形式上,对于步长 \(t\) 与控制频率 \(f_s\),第 \(i\) 组维度的旋转编码定义为: $\(\text{F-RoPE}\left(\frac{t}{f_s}\right) = \left[ \sin\left(\omega_i \frac{t}{f_s}\right), \cos\left(\omega_i \frac{t}{f_s}\right) \right]_{i=1}^{d/2}\)$ 其中 \(\omega_i\) 为预设的基础频率系数,\(d\) 为编码特征维度。该编码注入到编码器和解码器的 Query 与 Key 中,使得动作轨迹在连续的时域流形上天然保持尺度一致性,让模型既能捕捉跨控制率的宏观物理规律,又能识别由不同采样率引起的微观运动差异。

3. 非对称因果解码:兼顾全局轨迹约束与执行时序因果性 在将连续潜变量 \(\{z_i\}_{i=1}^K\) 还原为连续控制指令时,若采用全向双向注意力,容易造成时间倒流式的虚假关联,损害在线执行的鲁棒性。CAT 设计了一个非对称注意力掩码机制:解码器输入包含 \(K\) 个寄存器 Token 以及与目标时钟相匹配的 \(N\) 个可学习动作嵌入 \(\{e_t\}_{t=1}^N\)。在注意力矩阵中,所有动作嵌入均可全向观察 \(K\) 个寄存器 Token(获取全局轨迹语义先验),但在动作嵌入彼此之间严格施加因果单向掩码(即仅允许 \(t' \le t\) 的时序注意力流动)。该结构使得解码过程既受到整段轨迹规划的全局约束,又在动作步长推演上严格遵守时序因果性,显著提升了动作生成的物理平滑性与平稳过渡。

4. 轨迹级对比正则化:维持紧凑连续空间的轨迹判别力 将长序列高频动作强行压缩进极少数连续潜变量 Token 中,若单纯依靠均方误差重建损失 \(\mathcal{L}_{\text{rec}} = \frac{1}{N}\sum_{t=1}^N \|a_t - \hat{a}_t\|_2^2\),会导致潜变量空间发生坍缩或重叠——具有截然不同动力学语义的轨迹可能被挤压在邻近的潜空间区域,损害生成策略的判别力。为了在固定预算下保证潜空间的几何分布健康,CAT 引入了轨迹级对比正则化项。对于一个批次大小为 \(B\) 的轨迹集合,先拼接其所有寄存器 Token 得到全局轨迹表征 \(\bar{z} = [z_1 \parallel z_2 \parallel \dots \parallel z_K]\),随后构造样本间排斥正则项: $\(\mathcal{L}_{\text{reg}} = \frac{1}{B} \sum_{i=1}^B \log \left( 1 + \sum_{j \ne i}^B \exp\left( - \frac{\mathcal{D}(\bar{z}_i, \bar{z}_j)}{\eta} \right) \right)\)$ 其中 \(\mathcal{D}(\cdot, \cdot)\) 为距离度量(如欧氏距离或余弦距离),\(\eta\) 为控制排斥力度的温度系数。结合总优化目标 \(\mathcal{L}_{\text{CAT}} = \mathcal{L}_{\text{rec}} + \lambda_{\text{reg}} \mathcal{L}_{\text{reg}}\)(实验证明 \(\lambda_{\text{reg}}=0.1\) 为最优平衡点),该机制在确保单轨迹精确重建的同时,拉开不同运动语义轨迹之间的隐空间间距,为策略生成打下稳定的几何基础。

损失函数 / 训练策略

CAT 采用两阶段解耦训练范式: 1. 动作表征预训练:在多任务或大规模示教轨迹上(例如 Open X-Embodiment 跨机器本体数据集),采用 \(\mathcal{L}_{\text{CAT}} = \mathcal{L}_{\text{rec}} + \lambda_{\text{reg}}\mathcal{L}_{\text{reg}}\) 端到端预训练自编码架构(Encoder + Decoder),冻结或仅微调表征权重。 2. 策略流匹配学习:将训练好的 CAT 潜空间作为下游策略的动作动作目标。下游策略(如 SmolVLA 或 \(\pi_0\))采用 Flow-Matching 算法,在潜变量 \(Z = \{z_i\}_{i=1}^K\) 上学习去噪速度场 \(v_\psi(Z_\tau, \tau, c)\),在推理阶段仅需少步数去噪即可生成紧凑的潜变量,随后由 CAT 预训练解码器以目标控制频率 \(f_s\) 实时输出连续控制轨迹。

实验关键数据

主实验

论文在标准仿真基准 LIBERO、多任务长程基准 MimicGen、跨频率基准 RoboTwin 2.0 以及真实机械臂长程操控任务上展开了详尽的对比评测。

1. LIBERO 基准评测结果(表 1)

在 LIBERO 上,论文对比了自回归式 VLA 与基于扩散/流匹配的连续 VLA,重点对比相同主干下的性能增益:

范式 / 方法 Spatial Object Goal Long 平均成功率 (%)
自回归基线
Octo 78.9 85.7 84.6 51.1 75.1
OpenVLA 84.7 88.4 79.2 53.7 75.9
SmolVLA-FAST 87.0 93.0 90.0 68.0 84.5
\(\pi_0\)-FAST 96.4 96.8 88.6 60.2 85.0
SmolVLA-VQ-VLA 90.0 94.0 86.0 71.0 85.3
OmniSAT 94.1 98.7 94.6 86.0 93.4
扩散 / 流匹配基线
Diffusion Policy 78.3 92.5 68.3 50.5 72.4
4D-VLA 93.8 92.8 95.6 86.5 92.2
CogACT 97.2 98.0 90.2 88.8 93.2
SmolVLA (Baseline) 90.0 96.0 92.0 71.0 87.3
SmolVLA-CAT (本文) 95.0 97.0 94.0 77.0 90.8 (+3.5)
\(\pi_0\) (Baseline) 96.8 98.8 95.8 85.2 94.2
\(\pi_0\)-CAT (本文) 98.2 99.8 95.6 92.4 96.5 (+2.3)

2. RoboTwin 2.0 跨控制频率评测结果(表 3,节选与平均)

在 10Hz、16.7Hz、25Hz 与 50Hz 四种控制频率下评测 SmolVLA 与 SmolVLA-CAT 的平均成功率(%):

任务名称 10Hz (基线/本文) 16.7Hz (基线/本文) 25Hz (基线/本文) 50Hz (基线/本文) 任务平均 (基线 / 本文)
Grab Roller 17 / 47 46 / 66 49 / 58 56 / 71 42.0 / 60.5 (+18.5)
Press Stapler 33 / 52 36 / 52 19 / 50 50 / 48 34.5 / 50.5 (+16.0)
Place Container Plate 43 / 71 64 / 57 50 / 76 46 / 40 50.8 / 61.0 (+10.2)
Lift Pot 13 / 25 26 / 28 28 / 29 20 / 27 21.8 / 27.3 (+5.5)
Adjust Bottle 76 / 68 77 / 78 69 / 72 78 / 86 75.0 / 76.0 (+1.0)
Rotate QRcode 8 / 18 12 / 8 8 / 12 1 / 9 7.3 / 11.8 (+4.5)
频率总体平均 (%) 35.3 / 45.6 (+10.3) 42.1 / 46.1 (+4.0) 37.9 / 48.1 (+10.2) 40.0 / 45.3 (+5.3) -

3. 真实世界长程机械臂操作评测(表 4)

在 ARX R5 机械臂上对 4 个复杂的长程多步骤任务进行 10 次真实物理交互评测(标准归一化完成度得分,满分 100):

模型 Stack-5 (5块积木堆叠) Drawer (抽屉多阶段放取) Rope (穿双孔软绳操作) Flower (插两朵花入瓶) 平均得分 (%)
SmolVLA (Baseline) 29 49 62 40 45.0
SmolVLA-CAT (本文) 43 (+14) 61 (+12) 70 (+8) 68 (+28) 60.5 (+15.5)

消融实验

在 LIBERO 基准上针对核心架构超参进行了严格的控制变量消融(表 5):

消融维度 配置选项 Spatial Object Goal Long 平均成功率 (%)
寄存器数量 \(K\) \(K=2\) 91.0 98.0 91.0 72.0 88.0
\(K=4\) (本文默认) 95.0 97.0 94.0 77.0 90.8
\(K=6\) 92.0 98.0 93.0 74.0 89.3
\(K=8\) 90.0 96.0 92.0 71.0 87.3
正则化权重 \(\lambda_{\text{reg}}\) \(\lambda_{\text{reg}}=0\) (无对比正则) 91.0 98.0 93.0 75.0 89.3
\(\lambda_{\text{reg}}=0.1\) (默认) 95.0 97.0 94.0 77.0 90.8
\(\lambda_{\text{reg}}=0.2\) 92.0 97.0 92.0 76.0 89.3
\(\lambda_{\text{reg}}=0.3\) 90.0 95.0 91.0 76.0 88.0
解码器注意力方式 全向双向注意力 (Full) 90.0 95.0 93.0 76.0 88.5
因果单向注意力 (Causal) 95.0 97.0 94.0 77.0 90.8 (+2.3)

此外,在位置编码类型对比中(图 5):在多控制率跨度更大的 RoboTwin 2.0 评测中,F-RoPE 取得了 46.1% 的平均成功率,而标准可学习位置编码(Learned PE)断崖式跌至 19.5%(下降 26.6 个百分点),有力证实了显式物理时间归一化在跨频率控制中的不可替代性。

关键发现

  • 潜变量容量呈现非单调特性:寄存器数量并非越多越好。当 \(K\) 从 2 增至 4 时性能达到峰值(90.8%),继续增加到 8 反而降至 87.3%。这表明适度紧凑的表征有利于滤除高频抖动噪声并稳定流匹配学习,过度膨胀的潜变量空间会加剧下游策略的拟合负担。
  • 接触敏感型任务获益最大:在跨频率实验中,涉及精细对准和接触转换的任务(如 Grab Roller 提升 18.5 个百分点,Press Stapler 提升 16.0 个百分点)增益极其显著,而纯自由空间平移任务(Adjust Bottle 仅微增 1.0 个百分点)提升平缓,印证了轨迹级表征能精准保护关键时空接触信息的假设。
  • 不同任务的最优执行频率不同:实验揭示并非所有任务都在最高采样率(50Hz)下最优。如 Place Container Plate 在 25Hz 下达到 76% 成功率,50Hz 反而下降至 40%。CAT 的频率解耦特性赋予了系统根据物理交互特性灵活调整控制周期的自由。

亮点与洞察

  • 解耦控制率与表征长度:传统策略把离散时间步作为动作序列的唯一索引,导致硬件采样率与模型架构强耦合。CAT 巧妙地以物理时间窗口为基准,用固定数量的连续寄存器 token 表征任意时钟采样下的轨迹,做到了真正的频率无关性。
  • F-RoPE 赋能跨频率泛化:将步长索引除以采样频率(\(t / f_s\))并映射为旋转编码,使得连续轨迹的几何曲率在频域中具备统一参照系,彻底避免了跨频率微调时的灾难性动作退化。
  • 非对称因果解码保证执行稳定性:在解码阶段通过掩码隔离动作间的反向信息流,同时保留对全局轨迹潜变量的全局观察,既拥有宏观轨迹的统筹规划,又消除了非因果反向泄漏引起的物理抖动。

局限与展望

  • 物理时间窗口固定不变:当前 CAT 针对 \(T = 1\text{ s}\) 的固定时间跨度进行切分。对于某些极长周期的平滑运送或亚秒级的瞬时冲击动作,统一的 1 秒窗口可能并非最优粒度。未来可探索自适应物理时间跨度的变长轨迹表征。
  • 多本体(Multi-Embodiment)泛化尚未完全覆盖:虽然在真实 ARX 机械臂和仿真多任务中得到了验证,但在具有不同自由度、轮腿移动底盘或不同阻抗特性的异构机器人本体上,连续动作流形的对齐仍需进一步实验验证。

相关工作与启发

  • vs FAST / VQ-VLA: FAST 等方法依赖离散向量量化(VQ)将轨迹离散为有限字典索引,易面临量化精度丢失和动作跳变;CAT 采用全连续潜空间表征,保留了更精细的接触交互连续动力学。
  • vs B-Spline / DCT (如 OmniSAT / FreqPolicy): 基于固定时空或正交频域基函数的方法受限于先验数学假设,高频突变时难以拟合;CAT 采用基于数据自适应学习的连续 Transformer 寄存器,兼具表达自由度与紧凑性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (打破离散步长与控制频率的硬性绑定,提出 F-RoPE 连续时间归一化轨迹表征)
  • 实验充分度: ⭐⭐⭐⭐⭐ (仿真涵盖 LIBERO/MimicGen/RoboTwin 2.0,四种控制频率覆盖全面,并包含 4 项真实世界长程机械臂评测)
  • 写作质量: ⭐⭐⭐⭐⭐ (逻辑链条清晰,公式与图表表达规范,实验与消融针对性极强)
  • 价值: ⭐⭐⭐⭐⭐ (为大规模 VLA 具身大模型向异构控制频率、真实机械臂平滑部署提供了极具前景的表征范式)