LaMP: Learning Vision-Language-Action Policies with 3D Scene Flow as Latent Motion Prior¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://summerwxk.github.io/lamp-project-page/
领域: 机器人/具身智能
关键词: 机器人具身操作、3D场景流、视觉-语言-动作模型、潜动作先验、流匹配
一句话总结¶
LaMP 提出了一个双专家 VLA 框架,引入条件流匹配 Motion Expert 预测紧凑的一步部分去噪 3D 场景流隐状态,并通过门控跨注意力注入动作策略,在 LIBERO、LIBERO-Plus 和真实机器人操作中显著提升空间推理与长程规划鲁棒性。
研究背景与动机¶
人类在执行物理抓取或环境交互时,通常不会将视网膜感知信号直接映射到底层关节电机命令,而是在脑中隐式构想物体运动与接触演变的世界模型,预判关键实体在哪里相交、沿何种轨迹展开。然而,当前的视觉-语言-动作(VLA)模型(如 OpenVLA、π0 等)普遍采用端到端直接映射范式,直接把预训练视觉语言骨干提取的 2D 语义表征回归为机器人控制指令。这种设计迫使策略网络仅凭稀疏的末端动作标签隐式推断 3D 物理交互规律,在遇到未见视点、视角旋转或空间布局变化时极易崩溃。
为了补齐 2D 感知到 3D 物理控制之间的几何鸿沟,近期工作尝试引入各种中间表征。以 FlowVLA 和 TraceVLA 为代表的方法利用 2D 光流或稀疏视觉轨迹作为引导,但 2D 像素层面的运动缺乏真实操作所必需的深度与接触距离感知;而基于点云的扩散策略(如 3D Diffusion Policy、RISE)虽然引入了 3D 几何,却通常将点云作为静态输入,缺乏对未来连续时空动态的显式生成预测;此外,基于像素预测的视频世界模型(如 F1)又耗费了过多表征容量在纹理外观重建上,反而削弱了与控制紧密关联的几何运动先验。
针对上述矛盾,本文提出密集 3D 场景流不应仅仅是动作执行的外在伴生结果,而应当作为主动引导动作生成的关键潜在运动先验。但若在推理时完整生成多步 3D 场景流,又会引入无法接受的推理延迟,且将 3D 特征粗暴拼接到 VLM 往往会破坏预训练语义表征。核心 idea:构建解耦的双专家架构,利用基于条件流匹配的 Motion Expert 快速提取一步部分去噪的 3D 场景流隐状态,再通过参数自适应的门控跨注意力机制注入 Action Expert,在零深度传感器推理的前提下赋予策略几何前瞻与时空物理常识。
方法详解¶
整体框架¶
LaMP 采用双专家协作架构,由负责几何动态前瞻的 Motion Expert(300M 参数的 CogVideoX 风格 3D Transformer)与负责策略生成的 Action Expert(300M 参数策略网络)组成,两者均挂载在预训练冻结的 Qwen3-VL(4.4B)骨干上。系统接收当前多视角图像观测与自然语言任务指令,通过 VLM 提取最后一层多模态语义表征;Motion Expert 以其为条件,仅需执行单步 ODE 去噪即可获得包含未来时空运动几何的隐层状态;随后,门控跨注意力模块将运动隐状态自适应注入 VLM 特征,最后交由 Action Expert 依据几何增强特征通过流匹配去噪生成连续的动作块。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多模态输入<br/>图像观测 Ot + 语言指令 l"] --> B["VLM 骨干编码<br/>Qwen3-VL 提取语义表征 zt"]
B --> C["密集 3D 场景流表征<br/>TraceForge 离线标签 + 统一参考系"]
C --> D["单步去噪 Motion Expert<br/>条件流匹配预测速度场 + 提取 zm"]
D --> E["门控跨注意力运动引导<br/>零初始化标量门控注入 zt"]
E --> F["Action Expert 动作去噪<br/>流匹配预测动作块 At:t+H"]
关键设计¶
1. 密集 3D 场景流表征:构建与相机视点解耦的统一时空运动空间
针对 2D 光流缺少深度维度、稀疏轨迹无法刻画接触面几何的问题,LaMP 将潜在运动定义为均匀网格上的密集 3D 场景流。模型在当前图像平面均匀采样 \(K_h \times K_w\)(默认 \(20 \times 20 = 400\))个关键点,并在未来的 \(T=32\) 步时序内跟踪每个点的位移增量 \(\Delta p = (\Delta u, \Delta v, \Delta d)\),构成完整的运动张量 \(M_t \in \mathbb{R}^{K \times T \times 3}\)。其中 \((\Delta u, \Delta v)\) 为图像坐标下的 2D 偏移,\(\Delta d\) 为深度增量。所有轨迹统一投影至基准相机坐标系 \(cam_{ref}\) 下,消除本体相机抖动带来的干扰。在离线训练阶段,密集时空对应关系由 TraceForge 自动提取并结合传感器深度或单目深度估计补全,使得训练阶段无需昂贵的人工 3D 标注,且推理部署时完全依赖 RGB 输入,不需要任何深度传感器。
2. 单步去噪 Motion Expert:以最小推理开销捕获可行动态前瞻
针对传统扩散/流匹配模型需要 10 至数十步迭代去噪、导致机器人闭环控制延迟不可接受的瓶颈,LaMP 提出了单步部分去噪特征提取机制。Motion Expert 采用 CogVideoX 风格的 3D Transformer 结构,将每 \(2 \times 2\) 的关键点块聚合为一个 patch token,每帧形成 \(10 \times 10\) 个空间 token。在训练时,给定真值运动 \(M_t\) 与高斯噪声 \(\epsilon \sim \mathcal{N}(0, I)\),构造连续时间插值 \(M^\tau = (1-\tau)\epsilon + \tau M_t\)(\(\tau \in [0, 1]\)),模型通过条件流匹配损失学习速度场:
在策略前向推理时,模型无需完整重建出干净的 3D 运动点云,而是从纯高斯噪声 \(M^0 \sim \mathcal{N}(0, I)\) 出发,仅利用 10 步 ODE 求解器执行第一步积分(从 \(\tau = 0\) 步进至 \(\tau = 0.1\)),直接提取此时 Transformer 最后一层的隐状态 \(z_m \in \mathbb{R}^{B \times N \times d_m}\)。这一步去噪表征已经充分吸收了针对当前指令和场景的粗粒度几何流动趋势,既消除了完整生成带来的高计算时延(相比原模型仅增加 1.35 倍延迟),又规避了强行生成完美点云带来的误差累积。
3. 门控跨注意力运动引导:自适应平衡语义认知与空间精度
由于直接将未经调和的 3D 运动特征拼接入预训练 VLM 的多层网络极易导致预训练语义表征坍塌,LaMP 创新性地在 VLM 最后一层引入单层门控跨注意力机制。将运动隐状态经过线性映射与归一化得到 \(\tilde{h}_{\mathrm{motion}} = \mathrm{LN}(W_{proj} z_m)\),与 VLM 输出 \(z\) 进行跨注意力交互:
其中 \(\mathrm{CA}\) 为多头跨注意力运算,\(g\) 是初始化为 0 的可学习标量门控,\(\sigma(\cdot)\) 为 Sigmoid 函数,将门控严格约束在 \((0, 1)\)。训练初期门控值接近 0,使得 Action Expert 能够平滑继承 VLM 的强大多模态常识理解能力;随着策略优化的进行,网络自适应地根据任务空间精度需求逐渐放大 3D 运动引导权重,在需要精密对齐的接触场景下提供强几何支撑,避免了过度干扰纯语义推理任务。
损失函数 / 训练策略¶
LaMP 采取严格解耦的两阶段训练范式: - Stage 1(运动先验预训练):在涵盖 LIBERO、BridgeV2、DROID 以及 InternData-A1 的 160 万观测-语言-运动(Obs-Language-Motion)三元组多机型数据上,仅优化 Motion Expert 的流匹配损失 \(\mathcal{L}_{\mathrm{motion}}\)。 - Stage 2(运动引导策略学习):彻底冻结预训练好的 Qwen3-VL 骨干与 Motion Expert,仅对门控跨注意力层与 Action Expert 进行微调。Action Expert 接收 \(z_{\mathrm{guided}}\),在动作空间优化连续流匹配目标:
两阶段训练均在 16 张 NVIDIA H100 GPU 上基于 starVLA 框架完成,确保了不同机器人机型下的高效解耦适配。
实验关键数据¶
主实验¶
在标准模拟基准 LIBERO(各子集 50 个评测 episode)以及跨域迁移基准 SimplerEnv-WidowX(在 BridgeV2 真实数据上预训练、零微调迁移至仿真 WidowX 臂)上,LaMP 与各大代表性 VLA 基线进行了系统评测。
| 评测基准 | 指标 | LaMP (本文) | 次优基线 | 最优前作性能 | 性能提升 |
|---|---|---|---|---|---|
| LIBERO-Spatial | 成功率 (%) | 99.4 | π0.5 (98.8) | 98.8 | +0.6 |
| LIBERO-Object | 成功率 (%) | 99.8 | GeoVLA (99.0) | 99.0 | +0.8 |
| LIBERO-Goal | 成功率 (%) | 97.4 | OpenVLA-OFT (97.9) | 97.9 | -0.5 |
| LIBERO-Long | 成功率 (%) | 96.7 | GeoVLA (96.6) | 96.6 | +0.1 |
| LIBERO 平均 | 成功率 (%) | 98.3 | GeoVLA (97.7) | 97.7 | +0.6 |
| SimplerEnv: Stack Block | 成功率 (%) | 75.0 | FlowVLA (62.5) | 62.5 | +12.5 |
| SimplerEnv: Put Carrot | 成功率 (%) | 66.7 | F1 (70.8) | 70.8 | -4.1 |
| SimplerEnv: Put Spoon | 成功率 (%) | 79.1 | UniVLA (83.3) | 83.3 | -4.2 |
| SimplerEnv: Put Eggplant | 成功率 (%) | 95.8 | UniVLA / FlowVLA (100.0) | 100.0 | -4.2 |
| SimplerEnv 平均 | 成功率 (%) | 79.2 | FlowVLA (74.0) | 74.0 | +5.2 |
消融实验¶
在 SimplerEnv-WidowX 以及 LIBERO-Plus 零样本分布外(OOD)扰动下的消融与特征融合对比:
| 评估配置 | SimplerEnv 平均 (%) | Stack Block 成功率 (%) | LIBERO-Plus 平均 (%) | 说明 |
|---|---|---|---|---|
| LaMP (完整模型) | 79.2 | 75.0 | 79.3 | 3D 场景流 + 门控跨注意力 + 1步去噪 |
| 移除 Motion 先验 (No-Motion) | 56.3 | 25.0 | 71.6 | 仅依靠 2D VLM 反应式预测,降幅达 22.9% |
| 替换为 2D 光流先验 (2D-Flow Prior) | 66.7 | 58.3 | - | 掩码深度维度,缺乏 3D 空间接触约束 |
| 特征直接相加 (Add 融合) | 56.3 | 33.3 | - | 无自适应门控,先验噪声干扰视觉语义 |
| 特征拼接投影 (Concat+MLP) | 62.5 | 45.8 | - | 粗暴拼接导致关键精密任务显著掉点 |
关键发现¶
- 3D 几何前瞻是消除长程误差累积的关键:在 LIBERO-Long 长程任务中,移除 Motion Expert 使成功率从 96.7% 断崖式跌落至 78.2%(下降 18.5%);在最具挑战性的 SimplerEnv Stack Block 任务中,缺少 3D 几何前瞻直接让策略崩溃(75.0% 降至 25.0%)。
- 深度维度对接触精密操作不可或缺:2D 光流在简单目标搬运(如 Put Eggplant,91.7% vs 95.8%)表现尚可,但在需要精确深度判断与接触规避的 Stack Block 上,3D 场景流比 2D 光流大幅高出 16.7 个百分点。
- 门控机制防止表征污染:直接相加或 Concat 投影在复杂操作上性能骤降(分别降至 33.3% 与 45.8%),证明零初始化的门控跨注意力在保护预训练 VLM 特征不被早期流预测噪声破坏方面至关重要。
- OOD 视点与机械臂泛化极其出众:在 LIBERO-Plus 基准中,面对相机视点漂移与机器人本体机构变化(Robot Perturbation),LaMP 分别取得了 64.5% 和 69.6% 的零样本成功率,其中 Robot 项高出此前最佳基线(π0-Fast,21.6%)达 48 个百分点。
亮点与洞察¶
- 单步部分去噪隐状态充当先验:放弃耗时耗资源的多步 ODE 点云还原,仅走一步去噪(\(\tau=0.1\))提取运动特征,以极低计算代价(仅 1.35x 延迟)捕捉了未来动态走势,兼顾了控制实时性与物理前瞻性。
- 解耦统一相机参考系的时空流:将多机型、多场景数据转换为相机坐标系下的 \((\Delta u, \Delta v, \Delta d)\) 格式,天然解耦了机器人内部电机参数与外界交互物理规律,为大规模具身跨本体预训练铺平了道路。
- 平滑自适应的零初始化门控注入:解决了具身多模态领域将新模态特征引入预训练大模型时容易“先验反噬”的普遍难题,为其他几何与触觉信号融合提供了范式参考。
局限与展望¶
- 固定空间分辨率与时序步长:目前预设统一的 400 个点与未来 32 步时序,难以自适应处理极小尺寸零件的微观操作或超长时序技能。
- 依赖离线时空标签管道:预训练仍依赖 TraceForge 工具链合成 3D 场景流,若能直接利用网络海量无标注人类操作视频自监督学习隐式场景流,将进一步释放规模定律红利。
- 仅在最后一层进行特征注入:为保护 VLM 语义仅在顶层注入,未来可探索层次化轻量跨注意力在浅层注入局部几何感知的可行性。
相关工作与启发¶
- vs FlowVLA / TraceVLA: 后者在 2D 像素空间预测光流或追踪点轨迹,缺乏物理空间显式深度;LaMP 将场景流显式扩展为屏幕对齐的 3D \((\Delta u, \Delta v, \Delta d)\),彻底解决了视线方向距离判断与接触盲区。
- vs F1 / mimic-video: 视频预测 VLA 倾向于在像素空间预测未来画面,耗费大量算力在无关纹理背景的生成上;LaMP 聚焦于物体的可操作运动流,表征更为紧凑且与控制直接对齐。
- vs 3D-VLA / 3D Diffusion Policy: 既往 3D 策略大多将当前帧静态点云作为输入,缺乏时空连续动态的生成式预测;LaMP 首次将生成式流匹配构建为通用的、跨机型可迁移的未来运动预测专家。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [将单步流匹配 3D 场景流作为通用 VLA 的潜在运动先验,思路新颖且工程优雅]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖仿真 LIBERO 4大子集、LIBERO-Plus 7维扰动、SimplerEnv 及真实物理机 3 类任务]
- 写作质量: ⭐⭐⭐⭐⭐ [问题提炼深刻,动机阐述切中要害,框架与消融逻辑严密]
- 价值: ⭐⭐⭐⭐⭐ [为解决 VLA 从 2D 语义到 3D 精准接触控制的表征失配问题提供了极具落地价值的技术路线]