跳转至

Less is More: Reducing Complexity in Vision-Language-Action Systems

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/starVLA/starVLA
领域: 机器人 / 具身智能
关键词: 具身智能, 视觉-语言-动作模型, Qwen3-VL, 跨具身泛化, 极简系统设计

一句话总结

针对现有视觉-语言-动作(VLA)系统架构碎片化、重度依赖特定评测微调与繁杂数据工程的痛点,本文提出极简基准 StarVLA-α,证明强大的预训练 VLM 底座配合轻量 MLP 连续动作头与朴素零填充,无需专用预训练和繁复工程即可在多基准与真实机器人上刷新顶尖性能。

研究背景与动机

近年来,视觉-语言-动作(Vision-Language-Action, VLA)模型已成为构建通用具身智能体的核心范式。从 RT-1、RT-2 到近期的大规模系统,研究界通过融合视觉语言大模型(VLM)、扩充机器人操作轨迹以及引入通用多模态监督,使机器人策略在任务泛化与多环境迁移上取得了显著突破。然而,与多模态大语言模型(VLM)领域已逐渐形成相对标准的训练流程不同,当前的 VLA 研究生态呈现高度碎片化和过度复杂的趋势。现有工作在视觉编码器选择、离散/扩散/流匹配动作头、双系统分层架构、本体感知状态堆叠、多帧历史拼接以及坐标系转换等维度各行其道,且极度依赖特定基准的超参数微调。

这种高度碎片化的系统构建方式引发了一个核心矛盾:各个系统报告的性能提升往往与特定的数据集划分、繁琐的预处理管线和评测调优深度交织,使研究者无法厘清究竟是建模机制的创新带来了增益,还是基准相关的工程调优与实验偏差在起主导作用。许多针对特定评测精心设计的复合模块,在脱离特定机体或面对分布偏移时往往泛化脆弱;同时,过高的复现门槛和工程复杂度也严重阻碍了具身智能社区的方法学共识建立。

针对这一困境,本文采取了奥卡姆剃刀式的探索视角:在拥有强大预训练 VLM 的前提下,能否彻底剥除繁杂的外部架构与数据工程组件,回归最纯粹的系统形态?核心 idea:提出极简且强韧的基线系统 StarVLA-α,采用预训练 Qwen3-VL 统一底座与轻量 MLP 连续动作头,在统一数据流与无特定基准调优的严格受控条件下,重新审视动作头、机器人预训练及数据工程的必要性,并以统一零填充策略实现多具身全合一通用智能体。

方法详解

整体框架

StarVLA-α 严格遵循“最小充分性假设”(minimal-sufficiency hypothesis),即一个能力完备的现代 VLM 底座配合极简的动作解码头,已经足以捕获以往归因于复杂架构设计的绝大部分性能增益。整个系统由三层极简流水线构成:输入端接收未经特殊处理的原始 RGB 图像与自然语言任务指令;核心表征层由统一的 Qwen3-VL 骨干网络直接处理多模态上下文,避免外挂额外视觉编码器;输出端仅基于动作 token 的隐藏状态通过轻量 MLP 直接回归连续动作分块(action chunk)。在多具身多任务联合评测时,各机器人的不同动作自由度统一零填充到固定维度,彻底废弃机体专属动作头。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多具身多任务输入<br/>原始单帧RGB图像 + 任务语言指令"] --> B["零冗余数据流与极简动作归一化<br/>移除本体感知/历史帧,仅在训练集做零均值单位方差归一"]
    B --> C["极简统一VLM骨干与连续动作头<br/>Qwen3-VL原生多模态隐状态 + 轻量MLP连续回归Action Chunk"]
    C --> D["跨具身统一零填充动作表征<br/>动作空间统一Zero-Padding至32维,单模型联合优化"]
    D --> E["多具身控制输出<br/>单臂/双臂/轮式移动/人形机器人动作轨迹执行"]

关键设计

1. 零冗余数据流与极简动作归一化:剥离冗余感知输入与复杂坐标变换

主流 VLA 系统通常假定机器人策略必须强依赖丰富的本体感知状态(如关节角度、夹爪宽度)和历史图像帧序列,并在动作空间设计上反复纠结于绝对坐标、Delta 动作或末端执行器相对坐标系。这些繁琐的数据工程不仅增加了跨平台部署的接口异构性,还常常因时间对齐误差引发策略不稳定。StarVLA-α 彻底舍弃了这些复杂输入:不拼接多帧历史,不接入本体感知向量,直接使用当前时间步的原始 RGB 图像与任务指令作为输入。在动作数值处理上,仅对训练集各维度的真实动作计算均值与方差并进行标准归一化,推理时遵循官方基准环境原始定义。实验证明,强 VLM 的上下文感知与空间理解能力足以从单帧视觉中隐式推断操作状态,当下游示范数据达到常规规模后,繁杂的数据工程带来的收益迅速衰减至可忽略水平。

2. 极简统一 VLM 骨干与连续动作头:以强多模态底座与轻量 MLP 取代复杂动作专家

现有文献在动作生成架构上分化严重,主流方案包括基于离散词表的自回归生成(FAST 风格)、扩散/流匹配生成(\(\pi_0\) 风格)以及结合 System 1 / System 2 的分层双系统模型(GR00T 风格)。这些设计大幅增加了训练开销与推理延迟。StarVLA-α 选用具备强大多模态通用能力的开源预训练大模型 Qwen3-VL-4B 作为骨干,其原生架构已将视觉与语言表征无缝对齐,避免了像 CLIP 或 SigLIP 外接 LLM 时带来的跨模态拼接损失。模型在输入序列末端放置专用的 Action Token,在骨干网络计算后直接抽取该 token 对应的隐藏特征向量 \(\mathbf{h}_{\text{act}}\),随后输入一个轻量级多层感知机(MLP)网络,单步前向直接回归出未来时序的连续动作块 \(\hat{\mathbf{A}} = \text{MLP}(\mathbf{h}_{\text{act}})\)。这一设计彻底将架构复杂度压缩至极限,消除了迭代采样、分步去噪及复杂注意力交互的计算冗余。

3. 跨具身统一零填充动作表征:以朴素维度对齐替代专用多动作头

在构建能够驾驭多机器人机体(单臂 Franka/UR5、轮式双臂、人形机器人 GR1 等)的通用策略(Generalist)时,传统方案(如 ABot-VLA、LingBot-VLA 或 RDT)通常设计复杂的机体专属多动作分支(Multi-Action Heads)或构建庞大的统一空间映射表,导致模型参数碎片化且难以扩展新机器人。StarVLA-α 摒弃了针对特定机体的硬编码解耦设计,采用极度朴素的零填充(Zero-Padding)机制:选定能够覆盖所涉最大自由度机器人的全局统一动作维度 \(D_{\max} = 32\),对于控制维度较低的机器人(如 7 自由度单臂),将其真实动作向量右侧直接填补零至 32 维。由于 Qwen3-VL 具备充足的表征容量与模式识别能力,模型能够基于视觉输入的形态特征与任务描述自主识别机器人类型并输出对应维度的控制信号,从而使单个通用模型能够在完全共享的参数空间下联合消化异构机体数据。

损失函数 / 训练策略

StarVLA-α 采用全端到端有监督模仿学习进行优化。对于从演示数据中提取的真实动作分块 \(\mathbf{A} \in \mathbb{R}^{T \times D_{\max}}\),模型预测动作分块 \(\hat{\mathbf{A}} = \text{MLP}(\mathbf{h}_{\text{act}})\)。在连续动作回归目标上,采用标准的均方误差损失(MSE Loss)或 \(\mathcal{L}_1\) 平滑回归损失计算有效动作维度的误差:

\[\mathcal{L}_{\text{action}} = \frac{1}{T \cdot D_{\text{valid}}} \sum_{t=1}^{T} \sum_{d=1}^{D_{\text{valid}}} \|\mathbf{A}_{t, d} - \hat{\mathbf{A}}_{t, d}\|^2\]

在通用多基准联合训练(Generalist Setting)中,模型使用全局 Batch Size 512,学习率设为 \(1 \times 10^{-4}\),在混合的 5 大数据集上端到端联合微调,无需对特定任务单独调整优化超参数。消融表明,大批次训练对多具身联合泛化至关重要,能有效防止梯度在局部模式间剧烈震荡。

实验关键数据

主实验

在四大公认基准 LIBERO(单臂操作知识迁移)、SimplerEnv(真实世界仿真评测,覆盖 WidowX 与 Google Robot)、RoboTwin 2.0(双臂协同操作)以及 RoboCasa-GR1(人形机器人 24 项复杂家政任务)上,与代表性 SOTA VLA 模型全面对比。

方法类型 模型名称 LIBERO avg (%) Simpler WidowX (%) Simpler Google VM (%) RoboTwin 2.0 Clean* (%) RoboCasa-GR1 24任务均值 (%)
Specialist OpenVLA-OFT 97.1 31.3 63.0
Specialist \(\pi_0\) 94.1 27.1 58.8 65.9
Specialist \(\pi_0\)+FAST 85.5 39.5 61.9
Specialist \(\pi_{0.5}\) 96.9 46.9 72.7 82.7 37.0
Specialist GR00T-N1.6 97.0 62.0 67.7 47.6
Specialist StarVLA-α (本文) 98.8 64.6 76.0 88.2 53.8
Generalist StarVLA-α Generalist (本文) 97.8 65.2 74.3 88.7 57.3

注:Clean* 表示在 RoboTwin 2.0 中混合使用 Clean 和 Random 数据训练;所有基准均采用官方评测协议。

消融实验

系统评估了动作头设计、外部动作预训练、数据工程以及跨具身参数化方式对最终性能的影响。

表 1:动作头架构设计受控对比(固定 Qwen3-VL 骨干与训练协议)

动作头变体 核心机制 LIBERO avg (%) Simpler WidowX (%) Simpler Google VM (%) RoboCasa-GR1 (24任务均值, %)
StarVLA-α-FAST 离散 Token 自回归预测 97.8 35.6 60.1 45.0
StarVLA-α-\(\pi\) Diffusion / 流匹配连续生成 98.0 65.9 76.6 48.9
StarVLA-α-GR00T System 2 VLM + System 1 流匹配 98.6 65.3 75.3 52.8
StarVLA-α (MLP) 单层/双层 MLP 直接连续回归 98.8 64.6 76.0 53.8

表 2:跨具身多任务动作参数化策略对比(Generalist 联合训练模式)

参数化方案 设计机制 LIBERO Avg (%) Simpler WidowX (%) Simpler Google VM (%) RoboTwin 2.0 Random* (%) RoboCasa-GR1 Avg (%)
RDT Action 统一连续高维拓扑对齐 97.2 63.9 71.4 86.6 52.3
Multi-Action Head 针对每个机体分配独立解耦头 97.2 60.6 67.8 86.1 53.5
Simple Padding (本文) 统一零填充至 32 维由单头预测 97.8 65.2 74.3 87.8 57.3

表 3:真实世界机器人标准化评测(RoboChallenge 平台,ARX5 机械臂 11 项操作任务)

评测模型 平均成功率 (Success Rate, %) 平均任务进度分 (Progress Score) 核心任务表现亮点 (插花 / 摆放鞋子 / 水杯入垫)
\(\pi_0\) 3.6 14.7 0.0% / 0.0% / 0.0%
\(\pi_{0.5}\) 12.7 27.6 0.0% / 0.0% / 70.0%
StarVLA-α (本文) 33.6 54.5 40.0% / 50.0% / 100.0%

关键发现

  • 连续建模全面碾压离散建模,但复杂连续头收益边际极其微弱:在相同底座下,MLP 连续回归相比离散 FAST 架构在 WidowX 上提升接近 30%(64.6% vs 35.6%),在 RoboCasa-GR1 上高出 8.8%;但在连续动作头内部,朴素 MLP 的表现完全媲美甚至微幅领先复杂的扩散流匹配(\(\pi_0\))与分层双系统(GR00T),表明以往将性能提升归因于扩散/流匹配的结论主要源自更强的底座或非受控工程调优。
  • 异构动作预训练是柄“双刃剑”:在已有强预训练 VLM 前提下,引入大规模 OXE 数据进行二次中置预训练不仅未带来增益,反而导致 RoboTwin 性能暴跌(从 50.3% 降至 30.2%),并在 RoboCasa 上出现严重退化;同域预训练(如 RoboTwin-Rand)虽在极少样本下有益,但会损害向未见机体(RoboCasa)的泛化能力。
  • 通用模型反超专家模型:单模型跨基准联合训练(Generalist)不仅没有出现负迁移,反而借助数据多样性提升了最复杂任务的泛化能力,在 RoboCasa-GR1 上由 Specialist 的 53.8% 进一步提升至 57.3%,展现出大 batch size(512/1024)与强底座结合下的正向 scaling 潜力。
  • 模型参数缩放存在明显的平台期:将骨干网络由 2B 扩展至 4B 带来了跨维度的性能跃升(Simpler Google VM 成功率由 58.8% 飙升至 79.3%),但从 4B 进一步扩展至 8B 时提升不足 1%,表明 4B 规模是当前算力与数据规模下的最优性价比拐点。

亮点与洞察

  • 极简主义证伪行业惯性:系统性证实了现代强通用 VLM(如 Qwen3-VL)已内置足够的空间几何与语义交互常识,以往耗费大量工程设计的复合动作头、本体感知拼接与历史帧输入并非不可或缺。
  • 跨机体对齐回归大道至简:证明了完全无需为不同机械臂构建复杂的分离动作头或高维流形对齐,简单的右侧零填充(Zero-Padding)即可让 VLM 自然习得不同机体的动作维度边界。
  • 受控基准消除归因偏差:构建了统一的 StarVLA 开源生态框架,排除了底层模型不一致、数据泄露与超参偏向等干扰项,为具身智能领域提供了高质量的标准化科研基线。

局限与展望

  • 物理接触与刚性反馈推断局限:模型完全基于单帧 RGB 输入推断控制信号,在面临长程重度遮挡、高速动态交互或高精度力控装配任务时,缺乏触觉传感器及闭环力反馈的硬性物理约束。
  • 动作平滑性与高频控制约束:采用无时序重叠去噪的直接 MLP 分块回归,虽然推理开销与延迟极低,但在特定高精度轨迹衔接处可能出现加速度跳变,未来可结合轻量时序平滑后处理进一步优化。
  • 实物评测场景覆盖面:尽管在 RoboChallenge 的 11 项任务上大幅超越现有基准,但真实世界操作仍受限于单臂台面场景,多足双臂协同及复杂户外环境下的实机泛化仍有待验证。

相关工作与启发

  • vs OpenVLA / OpenVLA-OFT: OpenVLA 依赖离散 Token 自回归且需大规模 OXE 预训练,计算负担重且连续精度受限;OpenVLA-OFT 虽然转向连续动作头,但依然绑定复杂的预训练管线。StarVLA-α 表明直接采用 Qwen3-VL 原生表征配合 MLP,无需动作预训练即可实现大幅超越。
  • vs \(\pi_0\) / \(\pi_{0.5}\): \(\pi\) 系列强力推崇流匹配动作专家与多模态海量预训练网络,但带来了极高的训练与采样复杂度。StarVLA-α 表明其核心性能优势很大程度上源于强底座与数据规模,在同等底座下,简单的 MLP 动作头足以达到同等甚至更优的成功率。
  • vs GR00T-N1.5 / N1.6: GR00T 采用 System 1 (流匹配执行) + System 2 (VLM 推理) 双系统架构与特定机体参数化方案。StarVLA-α 证明单一端到端 VLM 配合极简零填充动作头在人形机器人任务(RoboCasa-GR1)上表现更胜一筹,架构更加精炼。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 虽未引入全新模型架构,但通过极为严谨的受控实验与“反向简化”视角,有力证伪了多个行业流行假说,方法学贡献突出。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 四大基准与 RoboChallenge 实机评测,包含四大维度的深度消融与扩展性分析,实验极其扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 论证逻辑严密,写作结构清晰明了,消融图表直观详实,直击当前领域痛点。
  • 价值: ⭐⭐⭐⭐⭐ 为快速膨胀而混乱的 VLA 领域提供了一剂清醒剂与坚实的开源基准(StarVLA),对推动具身智能标准化发展意义重大。