跳转至

Grounding Sim-to-Real Generalization in Dexterous Manipulation: An Empirical Study with Vision-Language-Action Models

会议: ECCV 2026
论文: ECCV 原文
领域: 机器人/具身智能
关键词: Sim-to-Real 泛化, 视觉-语言-动作模型 (VLA), 域随机化 (Domain Randomization), 具身操作, 强化学习微调 (RFT)

一句话总结

通过在双臂机器人平台上开展超过 10,000 次真实世界评测实验,系统性解耦并揭示了空间域随机化、逐帧采样粒度、渲染真实感与强化学习微调对 VLA 模型零样本 Sim-to-Real 泛化的决定性影响。

研究背景与动机

构建通用具身操作策略是实现通用人工智能(AGI)的核心里程碑。视觉-语言-动作(VLA)模型通过将多模态大模型与连续底层机器人动作空间无缝融合,展现出了强大的语义理解、开放任务规划与少样本泛化能力。然而,VLA 模型的高容量与数据驱动属性高度依赖海量轨迹示范;而在实体机器人上采集真实数据成本极高、面临硬件磨损风险且缺乏环境多样性。基于物理引擎(如 Isaac Lab、MuJoCo、RoboTwin 2.0)合成交互数据虽具备低成本无限扩展的潜力,但仿真与现实在渲染光照、表面纹理、相机位姿、接触摩擦与动力学响应等方面的显著差异,导致仿真训练的 VLA 策略在直接部署到物理世界时性能大幅崩溃。

以往机器人学中的 Sim-to-Real 研究虽提出了域随机化(Domain Randomization)、特征域自适应、高保真渲染以及强化学习微调(RFT)等多种技术方案,但绝大多数工作仍停留在传统强化学习控制或特定小模型上,且通常将多种随机化技巧整体打包混合使用。当前领域缺乏严谨的因果解耦研究来回答:究竟哪些仿真设计要素对大容量 VLA 模型的现实迁移起决定性作用?外观扰动与空间几何扰动的相对重要性如何?采样的时序粒度与渲染物理保真度是否存在瓶颈?缺乏机理性认知直接阻碍了 Sim-to-Real 策略的高效设计与现实落地诊断。

针对上述空白,本文从零样本 Sim-to-Real 泛化视角切入,基于统一的机器人操作基准体系,对域随机化多维因子、时序采样粒度、视觉与物理渲染真实感,以及强化学习后训练进行了细粒度的因子化实验。核心 idea:通过解耦多层级域随机化因子、时序粒度与策略优化方式,结合逾万次实体机器人部署试验,揭示空间几何扰动(视角/台高)相较于表面外观扰动对 VLA 跨域迁移具有决定性优势,并证明逐帧随机化与基于强化学习的探索能显著放大 Sim-to-Real 鲁棒性。

方法详解

整体框架

本文构建了针对 VLA 模型零样本 Sim-to-Real 泛化的因子分解评估框架,评测平台覆盖 RoboTwin 2.0 仿真环境与实体双臂机器人(Cobot Magic / Piper)。整个方法流水线包括四个核心剖析维度:结构化多因子域随机化(解耦外观与空间因子)、时序采样粒度控制(Episode 级 vs Frame 级)、仿真保真度调节(光线追踪渲染级与动力学参数扰动),以及策略后训练范式(行为克隆 SFT vs 基于组相对策略优化的强化学习微调 RFT)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["仿真环境配置<br/>RoboTwin 2.0 + 5类双臂操作任务"] --> B["空间主导的结构化域随机化<br/>外观因子与空间几何因子正交解耦"]
    B --> C["高频逐帧随机化注入<br/>破坏背景虚假相关 + 聚焦操作主体"]
    C --> D["仿真渲染保真度阶梯调控<br/>光线追踪视觉渲染 + 物理接触保真"]
    D --> E["组相对强化学习微调 (RFT)<br/>无KL约束GRPO相对优势优化"]
    E --> F["真实世界零样本迁移评测<br/>实体双臂机器人 >10k 次真机测试"]

关键设计

1. 空间主导的结构化域随机化:解耦视觉外观与三维几何扰动的泛化影响 传统的域随机化往往将纹理、光照、外形和物理参数混杂随机,无法明确单一因子的贡献。本文将仿真环境随机化参数空间分解为结构化元组 \(\xi = \{\xi_{\text{BG}}, \xi_{\text{TD}}, \xi_{\text{CP}}, \xi_{\text{LT}}, \xi_{\text{TH}}\}\)。其中,外观因子包括背景与桌面纹理扰动 \(\xi_{\text{BG}}\)、非操作干扰物采样 \(\xi_{\text{TD}}\)、点光源颜色与方位扰动 \(\xi_{\text{LT}}\);空间几何因子则包括相机外参位姿平移偏移 \(\xi_{\text{CP}}\) 和操作台绝对高度调节 \(\xi_{\text{TH}}\)。训练目标要求策略在扩展的仿真分布 \(p(\xi)\) 下最小化动作回归误差: $\(\mathcal{L}_{\text{DR}}(\phi) = \mathbb{E}_{\xi \sim p(\xi)} \left[ \mathbb{E}_{x \sim p(x \mid \xi)} \ell(f_\phi(x), y) \right]\)$ 实验机制表明,空间几何扰动(尤其是台面高度 \(\xi_{\text{TH}}\) 与相机位姿 \(\xi_{\text{CP}}\))能够迫使 VLA 模型学习到具备空间鲁棒性的手眼协调表征与 3D 几何相对关系,其现实增益远超单纯更换桌面壁纸或调整色彩,成为填补现实泛化鸿沟的第一要素;而外观因子则在空间因子完备的基础上提供正交互补增益。

2. 高频逐帧随机化注入:打破时间序列中的虚假背景关联 在常规机器人模仿学习中,域随机化大多遵循回合级(Episode-wise)采样,即在每一个 episode 开始时随机采样一组参数并在整条轨迹中保持恒定。然而,VLA 模型的高表达能力容易将特定轨迹中的静态背景假象或局部阴影隐式编码为动作触发凭据。本文引入逐帧(Frame-wise)采样粒度,在环境模拟的每个离散控制步长内动态重新采样背景纹理 \(\xi_{\text{BG}}\)、光照 \(\xi_{\text{LT}}\) 与相机微小位姿 \(\xi_{\text{CP}}\)。高频扰动破坏了视频序列中背景特征的时序自相关性,强迫视觉编码器的空间交叉注意力机制聚焦于操作工件与机械臂末端执行器的接触状态,从而实现注意力向任务关键区域的稳定坍缩。

3. 仿真渲染保真度阶梯调控:探寻光追视觉与物理动力学真实感的饱和阈值 为探明仿真外观与动力学模型在逼近真实世界时的边际收益,本文设置了低保真(关闭光线追踪 RT、低采样率与光路深度)、中保真(开启 RT、引入全局光照与阴影)、高保真(大幅提高单像素采样数 SPP 与光追深度)的三级视觉阶梯,并构建了扭曲重力、摩擦因数和恢复系数的非真实动力学对比基准。分析表明,视觉保真度对于预训练 VLA 特征转移具有前置主导作用,但当达到中保真(覆盖真实全局光照与阴影渐变)后性能提升逐步饱和;相比之下,接触动力学真实度的扰动虽会造成操作打滑,但在准静态桌面抓取与推移任务中,其对跨域整体成功率的衰减幅度次于视觉失真。

4. 组相对强化学习微调 (RFT):跳出单纯模仿记忆的鲁棒策略后训练 监督微调(SFT)仅仅让模型机械记忆专家演示流形,在遭遇真机环境外分布扰动时动作累积误差容易迅速发散。本文在仿真环境中采用无参考模型 KL 约束的组相对策略优化(GRPO)进行在线策略改进。在每个更新步中,模型并行采样 \(G\) 条轨迹 \(\{\tau_i\}_{i=1}^G\),根据最终稀疏任务回报 \(R_i\) 计算组内归一化优势值 \(\hat{A}_i = \frac{R_i - \text{mean}(\{R_j\})}{\text{std}(\{R_j\})}\),并利用策略似然比 \(r_{i,t}(\theta)\) 实施 PPO 式截断优化: $\(\mathcal{J}_{\text{RFT}}(\theta) = \mathbb{E} \left[ \frac{1}{G} \sum_{i=1}^G \frac{1}{|\tau_i|} \sum_{t=1}^{|\tau_i|} \min \left( r_{i,t}(\theta)\hat{A}_i, \, \text{clip}(r_{i,t}(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_i \right) \right]\)$ 该目标筛选出组内同时包含成功与失败样本的轨迹进行针对性对比梯度更新。强化学习使策略在仿真环境中主动探索多种误差恢复路径,赋予了 VLA 模型应对现实执行扰动与微小打滑时的闭环纠错韧性。

损失函数 / 训练策略

基础模仿学习阶段采用 OpenVLA-OFT 架构,采用连续动作空间并优化多步动作预测的 L1 损失函数: $\(\mathcal{L}_{\text{SFT}}(\theta) = \mathbb{E}_{(o_t, a_{t:t+M}, l) \sim \mathcal{D}} \left[ \left\| \pi_\theta(o_t, l) - a_{t:t+M} \right\|_1 \right]\)$ 在 RL 微调分支中,模型将连续动作头替换为离散动作 token 头,以自回归交叉熵目标为基础,结合上述 GRPO 组相对优势强化学习算法进行多任务在线微调。

实验关键数据

主实验

实验在 5 项代表性双臂操作任务中开展全面评测:按响铃铛(Click Bell)、放置空杯(Place Empty Cup)、积木敲击(Beat Block Hammer)、双碗叠放(Stack Bowls Two)与双瓶抓放(Pick Dual Bottles)。涵盖仿真 OOD 环境与实体机器人真机零样本部署。

下表汇总了不同域随机化因子组合在各任务下的真实世界部署与仿真 OOD 成功率对比(均来自论文 Table 1):

数据配置 Click Bell (Sim / Real) Place Cup (Sim / Real) Beat Block (Sim / Real) Stack Bowls (Sim / Real) Dual Bottles (Sim / Real)
Clean(无随机化基准) 14% / 2.7% 11% / 5.4% 17% / 0.0% 36% / 26.2% 19% / 1.5%
BG(仅背景纹理) 23% / 11.5% 15% / 10.2% 30% / 2.7% 42% / 40.4% 27% / 12.3%
LT(仅光照条件) 22% / 12.3% 12% / 8.6% 29% / 4.6% 43% / 31.5% 24% / 7.3%
TD(仅桌面干扰物) 15% / 3.1% 12% / 6.9% 23% / 0.0% 38% / 27.3% 21% / 4.6%
CP(仅相机位姿偏移) 34% / 23.5% 20% / 17.5% 32% / 4.6% 47% / 42.3% 30% / 16.2%
TH(仅操作台高度) 40% / 36.9% 26% / 24.8% 37% / 6.5% 58% / 49.6% 32% / 15.4%
TH + CP + BG 50% / 47.7% 34% / 33.5% 43% / 8.5% 62% / 60.0% 42% / 21.2%
TH + CP + LT 48% / 44.2% 31% / 27.9% 46% / 7.3% 60% / 54.6% 39% / 20.0%
TH + CP + TD 43% / 40.0% 29% / 26.3% 38% / 6.5% 56% / 52.7% 32% / 16.5%
All Factors(全部随机化) 54% / 49.7% 44% / 41.0% 49% / 11.5% 65% / 63.1% 52% / 23.8%

消融实验

下表考察强化学习后训练(RL)与域随机化(DR)在离散动作头架构下的相互协同效果(来自论文 Table 3):

训练变体方案 Click Bell (Sim / Real) Place Cup (Sim / Real) Beat Block (Sim / Real) Stack Bowls (Sim / Real) Dual Bottles (Sim / Real) 真机平均成功率
SFT(仅洁净仿真示范) 11% / 0.0% 23% / 6.8% 15% / 0.0% 33% / 21.2% 10% / 0.0% 5.6%
SFT + RL(洁净仿真RL微调) 42% / 36.9% 65% / 34.8% 52% / 9.6% 60% / 59.2% 48% / 26.5% 33.4%
SFT + RL + DR(随机化环境RL微调) 60% / 50.8% 87% / 51.4% 72% / 16.2% 68% / 64.6% 67% / 30.8% 42.8%

此外,在时序采样粒度消融实验中,逐帧随机化(Frame-wise)相比回合级(Episode-wise)在相机位姿(CP)上带来真实世界 +3.4% 至 +8.4% 的提升,在背景纹理(BG)上最高带来真实世界 +12.9% 的跨越式增益(Place Empty Cup 从 10.2% 跃升至 23.1%)。

关键发现

  • 空间几何扰动占据绝对支配地位:单个因子中,台面高度(TH)与相机位姿(CP)带来的零样本真机提升最为剧烈(TH 使 Stack Bowls 成功率从 26.2% 提升至 49.6%),大幅超越单一光照(LT)或干扰物(TD)。
  • 粒度增强突破时序静态过拟合:逐帧随机化能迫使模型切断对静态全局纹理的依赖,显著强化了时序动作生成的聚焦能力,尤其在强视觉混淆任务中增益翻倍。
  • 强化学习展现自主纠偏超强泛化:纯净仿真环境下的 RL 微调(SFT + RL)即可将真实世界平均成功率从 5.6% 骤升至 33.4%,且与域随机化(DR)展现出极强的正交叠加效应,结合后真机平均成功率达到 42.8%。

亮点与洞察

  • 解耦式的大规模实体机器人评测标杆:突破以往研究将 DR 技巧粗糙打包的做法,首次在双臂实体机器人上完成逾万次真实轨迹验证,得出了高信度的 Sim-to-Real 因果性结论。
  • 破除单纯堆叠光影外观的认知偏差:明确指出了在具身操作任务中,三维空间与视点几何变换对跨域闭环控制的意义远高于低层视觉像素分布匹配。
  • SFT与RL的泛化本质差异:模仿学习倾向于记忆静态视觉相关性,而强化学习通过主动试错构建了对真实世界执行偏差的动态代偿与自恢复能力。

局限与展望

  • 抓取与接触密集型任务的绝对上限受限:对于涉及极高精度的接触动力学任务(如 Beat Block Hammer),即使全要素随机化后真机成功率也仅有 11.5%,说明极度复杂的撞击与物理接触在纯仿真生成中仍存在难以逾越的微观鸿沟。
  • 缺乏多视角与触觉多模态融合:评测目前基于单目前向 RGB 相机(RealSense D435),尚未纳入腕部眼在手上(eye-in-hand)相机或触觉力传感器信号。
  • 未来方向:探索引入触觉反馈与接触感知以填补高刚度接触任务的现实鸿沟,并研究如何将仿真强化学习探索策略迁移至真机端的主动适应闭环。

相关工作与启发

  • vs RoboTwin 2.0 [4] / MimicGen [28]: 后者主要聚焦于仿真数据的大规模自动化流水线生成与基准构建,本文则以其为基础,深入解耦并验证了各生成随机化因子对 VLA 架构真机落地的定量边际贡献。
  • vs SimpleVLA-RL [19]: 该工作验证了强化学习在 VLA 规模化训练中的潜力,本文进一步揭示了 RL 在完全零样本(Zero-Shot)现实迁移中抵御未见环境扰动的泛化本质,并证明其能与环境域随机化产生高度互补。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次针对 VLA 大模型进行了万次级、系统化解耦的 Sim-to-Real 泛化机理评测]
  • 实验充分度: ⭐⭐⭐⭐⭐ [仿真与实体双臂机器人覆盖 5 项任务,包含逾 10,000 次真实世界试错,评测极其扎实严谨]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密清晰,图表数据详实,因果解耦剖析透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为具身大模型低成本合成数据训练与真机零样本无缝落地提供了重要的工程与理论指引]