跳转至

LEAP-VLA: Latent-Enhanced Action Prototyping via Continuous Residual Latent Spaces for Vision-Language-Action Models

会议: ECCV 2026
论文: ECCV 原文
领域: 机器人/具身智能
关键词: 视觉语言动作模型, 连续残差隐空间, 动作原型量化, 具身智能, 单阶段推理

一句话总结

针对视觉语言动作模型依赖庞大参数量与繁琐扩散解码的瓶颈,LEAP-VLA 提出动作解耦表征范式:阶段一通过多级软残差量化学习连续动作流形与原型基底,阶段二利用轻量外置对齐器实现单步前向原型软选择,以仅 1B 主干在 LIBERO 与 CALVIN 上超越数倍规模的 SOTA 模型。

研究背景与动机

视觉语言动作模型(VLA)近期取得了显著进展,但绝大多数性能增益依然高度依赖参数规模的无节制膨胀(如 7B 至 8.5B 的骨干网络)、海量具身演示数据(如 Open X-Embodiment 与 DROID)的暴力预训练,或是计算代价高昂的多步迭代去噪解码器(如 Diffusion / Flow-Matching 头)。然而,在这类追求规模化红利的浪潮背后,动作本身的表征空间设计却长期被视作次要工程选择:直接回归原始动作向量缺乏结构约束与流形正则化,容易在复杂多峰分布下崩溃;离散动作离散化(如 VQ-VAE 或分箱 Tokenization)虽然引入了原型先验,但其硬分配机制不可微、重度依赖直通估计器(STE)且极易发生码本坍缩(Codebook Collapse);扩散与流匹配策略虽然表达能力强,但推理时需要多步采样,在机器人实时闭环控制中引入了显著的延迟瓶颈。

这种困境的核心矛盾在于:现有 VLA 往往强行让高维多模态特征直接去拟合非结构化或离散碎片化的动作空间,使得视觉-语言到动作的映射本质上是在无序的高维输出流形中盲目搜索,严重依赖模型容量与数据规模进行“大力出奇迹”式的隐式对齐。如果不能从根本上重塑动作空间的物理连续性与语义层次结构,参数更轻量、未进行大规模具身预训练的模型就几乎无法在长程复杂操作任务中实现高精度与强泛化。

本文的切入角度是借鉴潜在扩散模型(Latent Diffusion)将图像生成从像素空间迁移到潜变量空间的经典思想,将机器人动作生成从原始轨迹空间解耦为“动作流形结构学习”与“多模态隐式对齐”两个阶段。核心 idea:通过多级软残差量化(MSRQ)从纯轨迹中构建连续、粗到细的动作原型隐空间,并利用轻量级 VLM 外置对齐器通过单次前向传播在固化的原型空间内进行软选择,实现无需迭代去噪、无需修改 VLM 主干的高精度动作生成。

方法详解

整体框架

LEAP-VLA 采用解耦的两阶段训练流水线:在阶段一(动作结构学习),模型仅利用专家示范动作轨迹训练一个由双向 CNN-Transformer(BiCT)构成的动作编解码器,并引入多级软残差量化(MSRQ),利用一组可学习原型在连续空间内自适应聚合动作基元,构建具备粗到细层次的连续动作流形;在阶段二(多模态隐空间对齐),冻结阶段一学到的动作原型与解码器,仅微调预训练视觉语言模型(InternVL3-1B)的轻量 LoRA 模块,并构建外置的潜在动作对齐器(Latent Action Aligner),接收多层视觉特征、压缩文本特征与本体感受状态,通过对齐注意力与原型感知预测头直接预测动作隐码,最终由阶段一解码器单步解出完整动作块(Action Chunk)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入观察: 图像 + 指令 + 机器人状态"] --> B["多级软残差量化 (MSRQ)<br/>纯动作预训练构建粗到细原型隐空间"]
    B --> C["双向 CNN-Transformer (BiCT)<br/>局部动力学与全局长程时序混合编解码"]
    C --> D["外置动作对齐器与原型感知预测头<br/>三路联合注意力 + 原型软加权单步推理"]
    D --> E["执行动作块: 阶段一解码器单次前向还原"]

关键设计

1. 多级软残差量化:基于连续平方欧氏距离的粗到细动作原型构建

传统离散矢量量化(VQ)使用 argmin 硬分配,梯度不可导且容易使多数码本单元休眠。MSRQ 摒弃硬分配,在 \(L\) 个残差层级上维护可学习的原型集合 \(P^{(l)} \in \mathbb{R}^{K \times D_c}\)(其中 \(K=256, D_c=32\))。与图像领域基于余弦相似度的软量化(会抹除动作物理幅度)不同,MSRQ 创新地采用平方 \(\ell_2\) 距离来衡量编码残差与原型间的相似度,自然保留了机械臂运动幅值信息。在每一级 \(l\),残差信号 \(r^{(l-1)}\) 经温度参数 \(\tau^{(l)}\) 缩放后通过 Softmax 计算对各个原型的软分配权重:

\[\boldsymbol{\alpha}^{(l)} = \mathrm{softmax}\left(-\frac{\|r^{(l-1)} - P^{(l)}\|_2^2}{\tau^{(l)}}\right)\]

各层级输出为原型矩阵的加权求和并辅以自适应缩放因子 \(s^{(l)}\),即 \(\Delta \mathbf{z}^{(l)} = s^{(l)} (\boldsymbol{\alpha}^{(l)} P^{(l)})\),随后更新残差 \(r^{(l)} = r^{(l-1)} - \Delta \mathbf{z}^{(l)}\)。最终连续隐码由所有层级输出求和聚合而成:\(\mathbf{z}_q = \sum_{l=1}^L \Delta \mathbf{z}^{(l)}\)。在训练过程中,温度与尺度系数自发呈现逐层递减趋势,严格对应从粗粒度基础动作到细粒度位姿微调的物理层次。该过程全流程可微,无需 STE 近似,从数学上彻底根除了码本坍缩问题。

2. 双向 CNN-Transformer 混合架构:兼顾局部平滑性与全局轨迹一致性

机器人轨迹控制在时间维度上同时表现出强局部相关性(相邻控制周期的平滑过渡)与跨视野全局因果性(如先平移对齐再张开夹爪下潜)。纯 MLP 缺乏归纳偏置,纯因果 Transformer 无法利用未来轨迹语义导致时序断裂,而纯 CNN 感受野有限。LEAP-VLA 为阶段一设计了双向 CNN-Transformer(BiCT)编解码器结构:编码器首先通过两层 1D 卷积块(卷积核大小为 3,配合 GroupNorm 与 GELU)将动作维度 \(D_a\) 投影到隐藏层维度 \(D_h\),迅速捕获相邻控制帧的高频动力学特征;紧接着串联 4 层 8 头的双向 Transformer,利用全局双向自注意力建模整段动作序列(长度 \(T=8\))的长程依赖;解码器采用严格镜像的逆序拓扑,先由双向 Transformer 统一重构轨迹上下文,再经 1D 反卷积及无激活函数的输出卷积映射回控制指令空间。这种混合设计将重构平均绝对误差(MAE)相比因果架构降低了接近 50 倍。

3. 外置动作对齐器与原型感知预测头:避免先验漂移的单步流形预测

为了不在多模态微调时破坏 VLM 原生预训练通用表征,LEAP-VLA 将对齐器完全独立置于 VLM 主干外部,仅在 InternVL3-1B 上挂载秩为 32 的轻量 LoRA。对齐器内部包含文本压缩器(通过跨注意力将变长指令映射为固定 \(k\) 个语义查询向量)、动作初始化器(聚合多层视觉特征并在时序与空间维度池化生成 \(T\) 个动作种子 Token),以及由多层对齐注意力(Aligner Attention)构成的融合主干。该注意力在单次 Softmax 中联合计算自身时序通道、语言-本体感受通道及视觉通道的注意力权重,并引入零初始化的 \(\tanh(g)\) 门控动态平衡庞大的视觉 Token 带来的早期梯度主导问题。更关键的是,在预测最终隐码时,模型并未采用无约束的线性回归,而是设计了原型感知预测头(Prototype-Aware Output Head):

\[\Delta \hat{\mathbf{z}}_q^{(l)} = s^{(l)} \cdot \mathrm{softmax}\left(\frac{\mathrm{Linear}_l(\mathbf{h})}{\tau^{(l)}}\right) P^{(l)}\]

直接在阶段一固化的原型矩阵 \(P^{(l)}\) 上计算软组合系数。由于预测的潜变量 \(\hat{\mathbf{z}}_q\) 在数学结构上永远受限于已验证有效的原型凸包内,杜绝了外推生成无效动作隐码的风险,最后仅需调用阶段一解码器单次前向即可解出物理动作,完全规避了扩散模型的反复迭代计算。

损失函数 / 训练策略

阶段一训练目标兼顾保真重构与表征多样性,总损失为 \(\mathcal{L}_{\mathrm{Stage1}} = \mathcal{L}_{\mathrm{recon}} + \lambda_{\mathrm{ent}} \mathcal{L}_{\mathrm{entropy}}\)。其中重构损失采用 L1 范数以避免 L2 损失过度惩罚离群大幅值动作(如夹爪突变)导致的平滑效应;熵正则化损失惩罚 Batch 内各原型的平均分配偏离均匀分布的程度:

\[\mathcal{L}_{\mathrm{entropy}} = 1 - \frac{1}{L} \sum_{l=1}^L \frac{\mathcal{H}(\bar{\boldsymbol{\alpha}}^{(l)})}{\log K}\]

强制所有原型保持高利用率。阶段二总损失在隐空间与物理空间双重监督:\(\mathcal{L}_{\mathrm{Stage2}} = \mathcal{L}_{\mathrm{align}} + \mathcal{L}_{\mathrm{action}}\)。其中隐空间对齐损失 \(\mathcal{L}_{\mathrm{align}} = \mathcal{L}_{\mathrm{prox}} + \lambda_{\mathrm{dir}} \mathcal{L}_{\mathrm{dir}}\) 结合了 MSE 欧氏邻近损失与余弦方向一致性损失(权重 \(\lambda_{\mathrm{dir}}=0.5\)),动作空间损失 \(\mathcal{L}_{\mathrm{action}}\) 则是还原动作与真实示范间的 L1 误差。

实验关键数据

主实验

在代表性操作基准 LIBERO(涵盖 4 个不同维度的子任务集,每任务评测 50 次 Rollout)以及长程多任务基准 CALVIN ABC→D(测试跨环境布局泛化)上,LEAP-VLA 与包含 7B~8.5B 大模型在内的 SOTA 策略进行了全面评测:

模型 会议/来源 参数量 (B) 具身预训练 LIBERO-Spatial LIBERO-Object LIBERO-Goal LIBERO-Long LIBERO-Avg
UD-VLA ICLR'26 8.5 △ (视频) 94.1% 95.7% 91.2% 89.6% 92.7%
OpenVLA CoRL'24 7.0 ✓ (OXE等) 84.7% 88.4% 79.2% 53.7% 76.5%
UniVLA RSS'25 7.0 ✓ (OXE等) 96.5% 96.8% 95.6% 92.0% 95.2%
CoT-VLA CVPR'25 7.0 ✓ (OXE等) 87.5% 91.6% 87.6% 69.0% 81.1%
ThinkAct NeurIPS'25 7.0 ✓ (OXE等) 88.3% 91.4% 87.1% 70.9% 84.4%
\(\pi_0\) (Flow-Matching) RSS'25 3.0 ✓ (OXE等) 96.8% 98.8% 95.8% 85.2% 94.2%
Fast-ThinkAct CVPR'26 3.0 ✓ (OXE等) 92.0% 97.2% 90.2% 79.4% 89.7%
LEAP-VLA (本文) ECCV 2026 1.0 ✗ (仅VLM) 98.4% 99.4% 97.6% 93.0% 97.1%

在 CALVIN ABC→D 长程多任务评测中,LEAP-VLA 连续完成任务的平均序列长度达到了 4.28(连续 5 步任务链成功率达 73.0%),超越了此前无需具身预训练的最优方案 VLM4VLA(4.06,8.3B 参数量)以及经过海量数据预训练的 OpenVLA-OFT(4.10,7B 参数量)。

消融实验

针对动作表征形式及输出头设计的核心消融实验(在 LIBERO-Spatial 上验证单阶段直接预测机制)如下表所示:

预测目标 输出头类型 空间任务成功率 (Spatial) 说明
原始动作向量 \(a\) 线性预测头 (Linear) 92.4% 基线无结构化约束直接回归
隐空间编码 \(z_q\) 线性预测头 (Linear) 94.6% 引入 MSRQ 隐空间带来 +2.2% 增益
隐空间编码 \(z_q\) 原型感知预测头 (Prototype-Aware) 98.4% 约束于原型凸包流形内,再获 +3.8% 飞跃

在动作隐空间量化性能与利用率方面,MSRQ 与主流离散及软量化基线的对比数据如下:

量化方案 层级配置 熵利用率 (Ent. Ratio) 有效原型数 (Eff. Count, max=256) 重构误差 MAE (\(\times 10^{-3}\))
VQ-VAE (梯度传播) 单层 (Single) 58.3% 25.3 86.6
OptVQ 单层 (Single) 98.6% 237.3 79.4
SoftVQ 单层 (Single) 90.6% 151.6 4.9
RVQ-Commit 4层残差 (4L) 81.5% 129.6 9.0
SoftRVQ 4层残差 (4L) 90.4% 151.5 6.0
MSRQ (本文) 4层残差 (4L) 99.6% 250.8 1.5

关键发现

  • 表征结构优于模型规模:消融表明将预测目标从非结构化的原始动作迁移至 MSRQ 连续隐空间即可获得 +2.2% 的稳固增益;而进一步用原型感知头替代普通的线性层再获 +3.8% 提升。这证明了在隐空间内对合法动作原型进行加权插值远比强行回归高维向量更有利于策略学习。
  • 码本利用率消除层级坍缩:在传统 RVQ 架构中,随着残差层级递增,浅层常发生严重坍缩(RVQ-Commit 第 0 层利用率骤降至 51.9%),而 MSRQ 依靠平方 \(\ell_2\) 软分配与熵正则项,在全部 4 个层级上维持了 \(\ge 99.5\%\) 的均匀使用率。
  • 架构时序归纳偏置不可或缺:编码器对比实验显示,若采用因果单向 Transformer,由于缺少前瞻未来语义的能力,MAE 骤升至 \(71.9 \times 10^{-3}\),证明 BiCT 的局部卷积结合双向全局注意力对于动作轨迹块至关重要。

亮点与洞察

  • 将连续流形约束直接编译进输出头结构:原型感知预测头强制以阶段一学习到的高保真动作为凸组合基底,使生成的动作天然满足机械臂连续位姿约束,从数学结构上封堵了策略漂移到非法奇异空间的漏洞。
  • 外置解耦对齐保护多模态基座先验:不同于在视觉语言模型内部强行插入虚拟动作 Token 扰乱文本自回归注意力,LEAP-VLA 保持 VLM 完全不变,仅用轻量对齐注意力协调多层视觉与本体状态,最大化利用了多模态表征潜力。
  • 轻量低延迟推理范式:仅需单次网络前向即可完成全量动作块(Chunk)的连续解码,在保持 97.1% 超高任务成功率的同时彻底摆脱了扩散策略数十步采样循环带来的推理延迟。

局限与展望

  • 物理真机闭环验证缺位:目前的实验评测主要集中在 LIBERO 和 CALVIN 两个高保真仿真基准上,真机部署时可能面临机械臂标定误差、动态光照变化以及非刚体接触力学等真实世界分布偏移。
  • 表征上限受底层 VLM 语义容量制约:虽然 1B 模型在常规操作中表现出色,但在处理需要极高常识推理或深层视觉几何推理的极端复杂场景时,轻量主干仍可能面临理解瓶颈。
  • 跨本体泛化潜力待挖掘:未来工作可进一步探索在阶段一将多类不同机械臂的控制规律映射进共享的 MSRQ 原型隐空间,探索通用的跨机型动作基元迁移。

相关工作与启发

  • vs OpenVLA / UniVLA: 他们采用离散动作 Tokenization 与自回归预测,存在离散硬量化误差与潜在码本坍缩;LEAP-VLA 提出连续多级软残差量化,梯度全程光滑可微,无需海量具身预训练即实现了更高的任务成功率。
  • vs \(\pi_0\) / Flow-Matching: 扩散策略依赖多步迭代去噪以逼近复杂动作分布,计算与时间开销较大;LEAP-VLA 通过学习高质量动作原型空间,在单次前向内完成原型软加权推理,极大提升了闭环控制频率。
  • vs ACT (Action Chunking Transformer): ACT 使用无结构的高斯分布假设并依赖 CVAE,在推理时直接取 \(z=0\) 会造成严重的训练-测试不对齐;LEAP-VLA 通过多级可学习原型构建真实的动作几何支撑集,预测始终锚定在有效流形上。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 提出 MSRQ 连续软残差动作隐空间与外置单阶段对齐范式,摆脱了硬离散量化与扩散去噪的固有窠臼。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 LIBERO 与 CALVIN 两大基准,进行了详尽的码本利用率分析、时序网络结构对比与表征消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密自洽,数学符号定义清晰,问题动机与实验结果呼应紧密。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量化 VLA 模型的动作表征与低延迟部署指明了高效可行的技术路径。