LARY: A Latent Action Representation Yielding Benchmark¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://meituan-longcat.github.io/LARYBench/
领域: 机器人/具身智能
关键词: 潜动作表示、具身智能、基准评测、视界动作模型、运动回归
一句话总结¶
美团提出首个解耦策略评价的潜动作评测基准 LARYBench,涵盖 120 万视频与 151 类动作,实验证实无动作监督的通用视觉表征在语义与控制回归上系统性优于专用具身潜动作模型。
研究背景与动机¶
利用海量无标注人类活动视频克服机器人领域动作标注数据匮乏的“数据孤岛”难题,已成为具身智能与视界动作(VLA)模型的核心前沿。为了将连续视觉流转化为本体无关的统一控制信号,潜动作模型(LAM)通过离散量化或连续嵌入提取帧间视觉变化,作为通用物理控制的中间基元。然而,长期以来学术界缺乏直接、严谨衡量潜动作表征质量本身的评估基准,绝大多数工作仅依赖下游特定操控任务的最终成功率或隐空间聚类可视化。这种评价方式将策略学习与动作表征严重耦合,无法解耦表征本身的泛化能力与保真度。
现有评估无法跨越异构实体、复杂任务与多层级粒度,也未探明不同视觉特征架构和训练范式对动作语义与物理动力学建模的深层机理。此外,主流具身视频数据集普遍存在时间边界不精确、动作语义标注混乱等缺陷,严重阻碍了大规模标准化评测的建立。评估潜在表征究竟是精准捕获了“做什么(高层语义意图)”与“怎么做(低层物理控制轨迹)”,还是仅仅过拟合了静态背景线索,成为亟待解决的关键难题。
本文的切入角度是:建立一个将潜动作表征与下游策略完全解耦的双层级量化评测体系,并在统一多形态数据底座上直接探测高层语义分类与低层末端轨迹回归。核心 idea:构建包含 120 万视频剪辑与 151 动作类别的多实体基准 LARYBench,通过注意力探测与动作专家回归全面评测语义可分性与物理动力学映射,揭示通用视觉自监督特征在具身控制上系统性超越专用具身动作模型的演化规律。
方法详解¶
整体框架¶
LARYBench 旨在解耦下游策略网络,对潜动作特征空间 \(\mathcal{Z}\) 进行独立评测。给定连续视觉观测序列 \(o_{1:T}\),由各类待测模型提取出潜在动作特征 \(z \in \mathcal{Z}\)。评测框架主要分为两大核心任务分支:高层语义意图解码 \(f_{\text{sem}}: \mathcal{Z} \to \mathcal{C}\)(通过多分类探测器评估可分性),以及低层物理控制重构 \(f_{\text{dyn}}: \mathcal{Z} \to \mathcal{A}\)(通过动作专家回归连续末端位姿轨迹)。评测对象横跨四大范式共 11 种代表性模型,涵盖专用具身模型、通用自监督语义编码器、生成式像素编码器以及由通用骨干移植改造的通用潜动作模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["多模态视频与轨迹底座<br/>(1.2M 视频剪辑 / 11 种实体平台 / 151 动作类)"] --> B["自动化数据引擎<br/>时空分割 + 语义对齐 + 运动引导采样"]
B --> C["潜动作表征提取<br/>(4 大范式 / 11 种模型特征空间 Z)"]
C --> D["双层级动作探测与评估体系"]
subgraph D["双层级动作探测与评估体系"]
direction TB
E["层级化语义探测协议<br/>4 层注意力探测器分类 (Top-1 Acc)"]
F["物理执行映射评测<br/>残差 MLP 动作专家回归 (Normalized MSE)"]
end
E --> G["评测诊断与机理发现<br/>(语义编码强于像素 / 通用模型超越专用具身 LAM)"]
F --> G
关键设计¶
1. 自动化数据清洗引擎:跨形态与多粒度动作空间对齐 针对现有具身与人类视频数据时间切分模糊、标签不一致的问题,论文研发了一套基于强时空推理能力的视觉语言模型(以 Doubao-1.5-pro-vision API 为推理核心)的自动化清洗引擎。引擎首先对原始长视频执行粗粒度动作时空分割与动作描述生成,利用语言模型校验视频-动词一致性,辅以人工抽检,最终确立了包含 28 个运动学原子动作与 145 个任务级复合行为的统一分类体系。整个底座汇总了超过 120 万段短视频(累计时长超 1000 小时)、62 万对帧图像与 59.5 万条运动轨迹,涵盖从单臂 Franka(7-DoF)到双臂 Agilex、Realman 及半人形 AgiBot G1(12-DoF / 16-DoF)等 11 类机器人形态和第一人称人类交互。
2. 层级化语义探测协议:多粒度意图解码与动态采样 为衡量潜动作表征是否蕴含从瞬间状态突变到高层复合行为的完整语义,论文建立了分层探测协议。在原子级(Atomic Robot),基于 LIBERO 数据集严格根据末端在 \(z\) 轴与正交方向上的位移阈值切分出 28 类原子动作基元;在复合级(Composite Human / Robot),涵盖 145 类复杂交互行为。由于源视频帧率各异且运动速度非均匀,直接均值采样易导致运动信息丢失,评测引入动态运动引导采样器(MGSampler)自适应抽取 9 帧关键动态转移,并通过 4 层多头注意力探测器(Attentive Probe)执行分类评估。
3. 物理执行映射评测:绝对位姿与相对位移的动作专家回归 高层语义解决“做什么”,机械臂执行则必须回答“怎么做”。论文构建了基于残差多层感知机(具有 2 个残差块、隐藏层维度 4096)的轻量级动作专家(Action Expert),输入时间间隔为 \(s=5\) 的成对帧潜动作嵌入,直接预测末端执行器未来轨迹切片(Action Chunk)。评测严谨划分了绝对位姿回归(Absolute Regression,要求严格空间定位)与相对位姿增量回归(Delta Regression,侧重相对状态转移),并结合归一化均方误差(Normalized MSE)与无量纲的 SE(3) 物理误差系统衡量表征的几何动力学保真度。
4. 特征级通用潜动作模型构建:通用先验向离散潜空间的迁移 为了探究视觉大模型先验如何有效注入潜动作架构,论文打破了传统具身 LAM(如 LAPA、UniVLA)仅在像素级小规模数据上从头训练的局限,提出了通用潜动作模型(General LAM)范式。该范式冻结强大的通用语义编码器(如 DINOv2、DINOv3、SigLIP 2)或生成式编码器(MAGVIT2),替换 LAPA 中的原生像素编码器,在包含人类与非人类广泛环境运动的海量互联网数据上重新训练矢量量化变分自编码器(VQ-VAE)瓶颈。消融表明,合理约束码本容量(如 64)与序列长度(如 49)可彻底避免码本坍缩,兼顾高维特征容量与离散表征稳定性。
实验关键数据¶
主实验¶
在语义动作分类与低层控制回归两大核心任务上,LARYBench 系统对比了 11 种代表性模型。结果表明,未经过任何动作监督预训练的通用视觉基础模型(如 V-JEPA 2.1 与 DINOv3)在各项指标上全面碾压专用的具身 LAM。
| 模型 | 模型范式 | 参数量 (M) | 语义分类均值 (Avg. Acc↑) | CALVIN 绝对回归 (MSE↓) | VLABench 绝对回归 (MSE↓) | AgiBot 绝对回归 (MSE↓) | Delta 回归均值 (MSE↓) |
|---|---|---|---|---|---|---|---|
| V-JEPA 2.1 | 语义编码器 | 304.68 | 76.29% | 0.18 | 0.04 | 0.28 | 0.50 |
| DINOv3 | 语义编码器 | 303.13 | 72.63% | 0.20 | 0.06 | 0.24 | 0.63 |
| Wan2.2 | 像素编码器 | 704.69 | 66.58% | 0.38 | 0.09 | 0.40 | 0.84 |
| FLUX.2-dev | 像素编码器 | 84.05 | 45.24% | 0.56 | 0.32 | 0.63 | 0.84 |
| LAPA | 具身 LAM | 343.80 | 19.13% | 0.94 | 0.90 | 1.00 | 0.94 |
| UniVLA | 具身 LAM | 287.75 | 18.82% | 0.82 | 0.73 | 0.97 | 0.82 |
| villa-X | 具身 LAM | 238.71 | 23.85% | 0.86 | 0.71 | 0.97 | 0.82 |
| LAPA-DINOv3 | 通用 LAM | 472.45 | 62.73% | 0.50 | 0.22 | 0.84 | 0.57 |
| LAPA-DINOv2 | 通用 LAM | 473.69 | 57.41% | 0.55 | 0.27 | 0.84 | 0.60 |
消融实验¶
基于 LAPA-DINOv3 架构,论文深入剖析了码本大小(Codebook Size, cs)、时间序列长度(Sequence Length, sl)与潜变量维度(Latent Dimension, dim)对动作重构与真实机器人控制的影响(基准设置:cs=64, sl=49, dim=256)。
| 消融维度 | 具体设置 | 重构损失 (Recon Loss↓) | 码本利用率 (Utilization %) | 人类复合分类 Acc↑ | 机器人复合分类 Acc↑ | AgiBot 回归 MSE↓ |
|---|---|---|---|---|---|---|
| 码本大小 (cs) | 8 | 0.00808 | 100.0% | 71.31% | 64.89% | 0.88 |
| 64 (默认) | 0.00751 | 100.0% | 70.15% | 64.04% | 0.83 | |
| 256 | 0.00758 | 89.5% | 69.84% | 63.82% | 0.85 | |
| 序列长度 (sl) | 16 | 0.00908 | 1.6% (坍缩) | 69.23% | 63.33% | 0.79 |
| 49 (默认) | 0.00751 | 100.0% | 70.15% | 64.04% | 0.83 | |
| 64 | 0.00773 | 79.7% | 71.37% | 64.70% | 0.72 | |
| 潜变量维度 (dim) | 32 | 0.01141 | 3.1% (坍缩) | 60.94% | 57.69% | 0.87 |
| 64 | 0.00967 | 100.0% | 66.94% | 63.07% | 0.83 | |
| 256 (默认) | 0.00751 | 100.0% | 70.15% | 64.04% | 0.83 | |
| 512 | 0.00732 | 1.6% (坍缩) | 71.25% | 64.97% | 0.80 |
关键发现¶
- 通用视觉表征天然内嵌丰富动作控制先验:在未引入任何机械臂动作监督的情况下,V-JEPA 2.1 与 DINOv3 实现了最优的动作分类精度(76.29%)与绝对轨迹误差(0.18-0.19),而现存专用的具身 LAM(LAPA、UniVLA)平均分类准确率仅在 18%–24% 之间徘徊,发生严重的表征退化。
- 隐式特征空间远胜于像素重建空间:以 V-JEPA 2.1 为代表的潜在特征自监督学习全面优于 Wan2.2 和 FLUX 等基于像素扩散/重建的生成模型,证明物理控制更依赖几何与语义层面的高维抽象,而非微观像素的完美复现。
- 相对增量控制大幅缩减模型差距:在 Delta 回归模式下,以帧间变化为训练目标的 General LAM(LAPA-DINOv3)将与最佳通用编码器的差距从绝对回归的 0.42 骤降至 0.07,展现出对局部相对转移建模的独特适配性。
- 跨步长长时程稳健性:在采样步长由 5 扩大至 30 的实验中,纯空间生成模型 FLUX 误差从 0.04 剧增至 0.62,而 LAM 架构展现出极强的时序稳定性(误差波动不超过 0.08),证明潜动作有效捕获了高阶运动轨迹动态。
亮点与洞察¶
- 解耦式独立评测基准体系:将潜动作表征的优劣从复杂多变的下游下游策略微调成功率中剥离,建立了由多层注意力探测(语义)与轻量残差动作专家(动力学)构成的标准化检验工具链。
- 通用特征移植验证有效:提出将通用视觉表征接入 VQ-VAE 瓶颈训练 General LAM,利用跨域互联网运动数据显著超越了传统在小规模具身数据上拟合的原生 LAM(平均分类从 19.13% 跃升至 62.73%)。
- 码本瓶颈与动态崩塌边界界定:实验明确指出了离散量化过程中的脆弱性——短序列和过大维度极易引发码本坍缩(利用率骤跌至 1.6%),揭示了构建鲁棒离散物理控制空间的关键超参边界。
局限与展望¶
- 灵巧手微观接触建模受限:由于视觉遮挡与极度细粒度的指尖关节逆解过于病态,基准在 RoboCOIN 等多形态数据中对灵巧手机构进行了遮蔽,仅评估宏观手臂末端位移,尚未覆盖高精度触觉与接触动力学。
- 机器人场景泛化轻微回落:通用 LAM 在人类视频动作分类上提升显著,但在机器人领域因跨域数据分布差异出现一定程度的性能滑坡,需要进一步探究跨形态对齐蒸馏技术。
- 离散与连续表征权衡:离散 Tokenization 便于自回归大语言模型联合建模,但不可避免引入信息损失;未来需深入探索兼顾生成离散兼容性与连续轨迹高保真度的混合表征。
相关工作与启发¶
- vs LAPA / Moto / LAPO: 早期 LAM 均假设通过小规模具身视频自监督离散量化即可习得控制基元,本文证实这种独立训练方案因数据受限极易坍缩,证明直接迁移通用大模型视觉特征才是更优解。
- vs UniVLA / villa-X: 现有具身多模态模型强行在有限机器人轨迹上过早绑定控制约束,限制了视觉泛化性;本文揭示保持通用特征无偏性并在潜在表征层对齐策略是更具扩展性的范式。
- vs V-JEPA 2 / DINOv3: 论文首次在统一平台验证了通用视频理解模型对物理世界动态的内在建模能力,为下一代端到端具身大脑提供了坚实的基础表征选型指引。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出将潜动作质量与策略解耦的基准,构建了跨 11 种形态与 151 动作类别的多粒度底座。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 11 种主流模型,详尽测试了绝对/相对回归、不同步长演化、长尾分布及码本超参消融。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,对语义解耦与物理控制映射的机理剖析极其深刻透彻。
- 价值: ⭐⭐⭐⭐⭐ 彻底澄清了通用视觉特征与专用具身表征的优劣关系,对 VLA 与机器人世界模型构建具有关键指导意义。