跳转至

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/hananshafi/RoboTALES
领域: 机器人/具身智能
关键词: 视频世界模型, 具身控制, 层次化规划, 扩散策略, 强化学习表征对齐

一句话总结

提出单阶段机器人学习框架 RoboTALES,通过大模型层次化子目标分解引导视频扩散模型生成模拟未来,并借助视觉语言评价器(VLM Critic)通过可微策略优化(DDPO)对隐空间表征实施语义对齐,驱动动作扩散网络实现高成功率的长程操作控制。

研究背景与动机

人类在执行复杂操作时极少依赖纯反应式行为,而是先将长程目标分解为有次序的子任务,并在大脑中推演模拟各种可能的未来,在排除不良后果后才落实为具体动作。近年来,以扩散模型为代表的视频生成网络被广泛尝试用作机器人具身控制的世界模型基座,试图借助视频预训练蕴含的物理演变与因果规律来监督或条件化动作生成。然而,纯视觉驱动的视频生成器本质上是以像素重建或视觉真实度为优化目标,其模拟的未来帧容易脱离任务意图,且无法可靠地与低层动作条件绑定,导致模型在长时程多阶段任务中不可避免地出现严重的语义漂移(Semantic Drift)。

在另一技术路线上,大语言模型(LLM)展现出了卓越的长程规划与符号推理能力,能够将抽象任务拆解为可执行的子目标。但现存方法大多将语言规划与视觉动态预测割裂开来:语言仅作为顶层离散动作或高层指引,未能直接介入并塑造世界模型内部的隐式预测表征。这就导致智能体“脑中所想的推理逻辑”、“推演预测的视觉未来”与“底层执行的机械动作”之间处于开环状态,缺乏端到端的语义约束闭环。

本文的切入角度是:必须将抽象层级的层次化推理作为结构化脚手架直接锚定到视频扩散模型的隐空间中,并通过语义奖励直接约束模拟未来的表征动力学。核心 idea:构建单阶段联合优化框架 RoboTALES,由 LLM 规划器生成结构化子目标链约束视频扩散模拟,利用冻结的 VLM Critic 经由 DDPO 对视频隐空间进行语义对齐表征引导,并无停截梯度地将动作扩散损失反向传播至视频解码层,实现“为动作而想象,依想象而执行”的紧耦合具身策略。

方法详解

整体框架

RoboTALES 将长程具身控制拆解为一个紧密协作的层次化系统,包含四大核心模块:高层推理 LLM 规划器 \(F_P\)、视频生成世界模型 \(G_\theta\)(基于 Stable Video Diffusion 改造)、冻结的 VLM 评价器 \(F_R\) 以及底层 1D 动作扩散策略 \(\pi_\phi\)。模型端到端协同运行,其输入为多视角当前视觉观测 \(s_t\) 与自然语言任务指令 \(\tau\),输出为连续时序动作序列 \(a_{t:t+H}\)。在训练阶段,视频生成器与动作策略进行单阶段联合优化(Single-stage Joint Training),动作扩散梯度直接穿透回传至视频解码器层,迫使视觉生成隐表征自适应满足下游物理控制需求。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["任务指令与当前多视角观测"] --> B["层次化规划与目标锚定<br/>LLM 规划器生成增强子任务链"]
    B --> C["条件化视频扩散模拟<br/>交叉注意力注入文本与视觉隐变量"]
    C --> D["评价器引导的表征对齐<br/>冻结 VLM 打分与 DDPO 梯度反传"]
    D --> E["耦合梯度驱动的动作扩散<br/>动作损失直接反传优化视频解码器"]
    E --> F["连续可执行机器人轨迹输出"]

关键设计

1. 层次化规划与目标锚定:消除长程模糊性并提供时序脚手架 直接依赖宽泛的自然语言指令 \(\tau\)(如“准备烹饪西葫芦咖喱的食材”)条件化生成模型往往因语义空间过大而引发发散。LLM 规划器 \(F_P\) 基于当前观测 \(s_t\) 将 \(\tau\) 显式分解为 \(K\) 个具有时序连续性与明确物理语义的短期子目标 \(C = \{c^{(1)}, \dots, c^{(K)}\}\)(\(K \in [2, 5]\)),并拼接成增强任务规划: $\(C^* = [\,\tau\,;\;c^{(1)}\,;\;c^{(2)}\,;\;\dots\,;\;c^{(K)}\,]\)$ 该结构化子任务链通过 CLIP 文本编码器注入视频生成器 \(G_\theta\) 的交叉注意力层,作为中间里程碑锚点,将无约束的视频推演转化为受阶段逻辑严格约束的结构化模拟未来。

2. 评价器引导的表征对齐:通过可微策略优化约束潜空间语义演化 单纯依靠无监督视频扩散损失只能保证视觉统计特征的保真度,无法强约束生成画面严格符合任务意图。RoboTALES 将视频去噪扩散过程形式化为多步马尔可夫决策过程(MDP),利用冻结的 VLM 评价器 \(F_R\) 在像素空间中对去噪关键帧 \(\hat{s}_{t:t+\Delta}\) 相对任务指令 \(\tau\) 进行语义对齐打分,输出标量奖励 \(r = F_R(\hat{s}_{t:t+\Delta}, \tau)\)。引入指令级基线 \(b(\tau)\) 构建优势函数 \(A = r - b(\tau)\),并通过 DDPO 策略梯度目标直接对视频生成器的特定参数 \(\theta^*\) 进行反向微调: $\(L_{\mathrm{DDPO}}(\theta^*) = - \mathbb{E}\left[ A \cdot \frac{1}{|\mathcal{T}_K|} \sum_{t \in \mathcal{T}_K} \nabla_{\theta^*} \log p_{\mathcal{G}_{\theta^*}}(x_{t-1} \mid x_t, C^*) \right]\)$ 该目标将高层语义反馈注入扩散去噪转移核中,惩罚脱离任务逻辑的幻觉分支,强化能够达成本阶段操作的隐空间表征。

3. 耦合梯度驱动的动作扩散:打通“想象”到“执行”的单阶段端到端反馈 以往两阶段方案先独立训练视频世界模型再冻结其提取特征,导致视觉表征缺乏对物理控制细节(接触点、末端位姿、几何间隙)的敏感性。RoboTALES 采用 1D 动作扩散 UNet \(\pi_\phi\),以视频生成器选定解码层的高维隐藏特征 \(f_{\mathcal{G}_{\theta^*}, C^*}^{\{l\}}\) 作为条件输入预测动作噪声。在联合训练中,模型不对动作网络与视频模型之间设置截断(No Stop-Gradient),动作扩散损失 \(L_{\mathrm{action}}\) 的梯度直接无阻碍地反传至视频生成器选定的解码层 \(\theta^*\): $\(L_{\mathrm{total}}(\theta^*, \phi) = L_{\mathrm{video}}(\theta^*) + \beta L_{\mathrm{DDPO}}(\theta^*) + \gamma L_{\mathrm{action}}(\phi, \theta^*)\)$ 这种双向共适应机制使视频世界模型不仅追求“视觉生成真实”,更主动优化“利于动作决策”的表征动力学,在推理时带来极低抖动(Jerk)和极高轨迹平滑度。

损失函数 / 训练策略

训练过程采用单阶段多目标端到端优化。联合损失函数包含三项:标准视频扩散噪声预测损失 \(L_{\mathrm{video}}\) 保障视觉时空连续性,DDPO 强化学习损失 \(L_{\mathrm{DDPO}}\) 保障高层语义对齐,以及动作去噪扩散损失 \(L_{\mathrm{action}}\) 确保末端动作精度,超参数 \(\beta\) 和 \(\gamma\) 用于平衡多任务梯度量级。参数更新严格受控:视频主干(SVD)大部分卷积与注意力权重冻结,仅更新文本交叉注意力模块与用于动作特征提取的选定解码层块 \(\theta^*\),在防止大模型灾难性遗忘的同时大幅降低显存开销与计算代价。

实验关键数据

主实验

在真实物理渲染环境 RoboCasa 上的 24 项长程复杂操作任务(涵盖抓取放置、开闭门窗、抽屉操作、旋钮拧动、杠杆拨动、按钮按压和插拔等)与 LIBERO10 基准上进行了全面评测,每项任务评估 50 次完整环境 rollout。

表 1:RoboCasa 模拟基准验证集上的各类别操作任务成功率对比(50 次演示数据训练)

任务类别 / 代表任务 DP-3D DP-ResNet DP-CLIP GR00T FPV OpenVLA UVA VideoPolicy 本文 (RoboTALES)
抓放 (Pick and Place)
PnPCabToCounter 0.04 0.06 0.00 0.20 0.10 0.10 0.26 0.16 0.44
PnPCounterToCab 0.02 0.06 0.02 0.36 0.14 0.32 0.18 0.38 0.44
PnPCounterToSink 0.00 0.14 0.08 0.10 0.08 0.30 0.16 0.32 0.50
PnPSinkToCounter 0.00 0.10 0.22 0.33 0.30 0.56 0.38 0.52 0.56
PnPStoveToCounter 0.00 0.02 0.06 0.29 0.26 0.62 0.24 0.64 0.66
门类操作 (Doors)
OpenSingleDoor 0.24 0.42 0.32 0.59 0.74 0.42 0.54 0.78 0.80
OpenDoubleDoor 0.20 0.70 0.82 0.15 0.92 0.80 0.90 0.92 0.94
CloseDoubleDoor 0.56 0.78 0.84 0.75 0.78 0.84 0.76 0.90 0.94
CloseSingleDoor 0.62 0.78 0.48 0.83 0.84 1.00 0.88 0.98 0.98
抽屉操作 (Drawers)
OpenDrawer 0.36 0.64 0.60 0.79 0.72 0.66 0.28 0.40 0.80
CloseDrawer 0.48 0.82 0.96 0.99 0.94 1.00 0.72 0.88 1.00
旋钮与杠杆 (Knobs & Levers)
TurnOnStove 0.24 0.38 0.28 0.56 0.66 0.64 0.50 0.34 0.40
TurnOnSinkFaucet 0.32 0.66 0.66 0.63 0.70 0.56 0.62 0.80 0.84
TurnOffSinkFaucet 0.42 0.68 0.70 0.73 0.78 0.72 0.64 0.68 0.78
按键操作 (Buttons)
CoffeePressButton 0.16 0.76 0.68 0.85 0.90 0.86 0.84 0.92 0.96
TurnOnMicrowave 0.38 0.68 0.88 0.78 0.68 0.84 0.94 0.86 0.96
TurnOffMicrowave 0.54 0.62 1.00 0.71 0.96 0.86 0.96 0.94 0.96
全 24 项任务平均成功率 0.23 0.41 0.43 0.50 0.51 0.57 0.50 0.575 0.64

表 2:LIBERO10 基准上的多方法平均成功率对比

模型 DP-C DP-T OpenVLA \(\pi_0\) \(\pi_0\)-FAST UVA VideoPolicy 本文 (RoboTALES)
平均成功率 (%) 53% 58% 54% 85% 60% 90% 94% 97%

消融实验

针对核心设计组件在 RoboCasa 典型任务集上的增量贡献进行了系统消融(结合论文 Fig. 4 与 Fig. 5 的消融数据分析)。

表 3:RoboTALES 关键组件消融对比(RoboCasa 任务平均)

模型配置方案 规划器引导机制 VLM Critic 对齐损失 端到端动作反传 平均成功率 / 表现特征
VideoPolicy 基线 无(仅原始指令 \(\tau\)) 无 解耦特征提取 0.575(长程易产生语义漂移)
未经适配的 Planner 零样本注入 推理时强行拼接 \(C^*\) 无 解耦特征提取 最低水平(模型未学过子目标格式,出现理解断裂)
仅加入 Planner 条件化训练 联合微调交叉注意力 无 解耦特征提取 表现显著超越基线(提供显式时序里程碑)
完整模型 (RoboTALES) 联合微调交叉注意力 引入 DDPO 奖励对齐 单阶段端到端反传 0.640(末端抖动最小、抗噪性最高)

关键发现

  • 双向协同是关键:直接在未训练的基线模型上暴力拼接 LLM 子目标会导致性能崩溃,说明视频世界模型必须通过跨注意力训练来学会消费离散推理 token;而加入 VLM Critic 之后,模型进一步纠正了视觉幻觉,确保生成未来在语义上严格符合目标。
  • 极高的数据采样效率:在仅使用 50 条人类演示轨迹的严苛设定下,RoboTALES(64% 平均成功率)大幅超越了使用 300 条演示数据的强 baseline(如 OpenVLA 的 57% 与 UVA 的 50%)。即使在仅有 10 条演示时,成功率仍维持在 43% 左右。
  • 物理运动质量跃升:在末端抖动(Latent Jerk)指标上,Critic 引导优化后的策略展现出极低的机械抖动;在向视觉输入注入高斯噪声(\(\sigma = 0.06\))的鲁棒性测试中,传统 Diffusion Policy 和 VideoPolicy 性能几乎彻底归零,而 RoboTALES 仍保持高度稳健的成功率。

亮点与洞察

  • 将扩散去噪转化为 MDP 策略优化:巧妙地将 SVD 图像去噪多步扩散过程视作强化学习中的转移序列,利用 DDPO 将 VLM 标量打分作为环境奖励回传,直接对连续隐空间表征做语义整流,绕开了直接在视频像素上算不可导判别损失的死结。
  • 消除两阶段特征割裂:摒弃以往“先冻结视频模型再学动作头”的传统思维,打通动作扩散损失至视频解码层的梯度流,让“视觉想象”为“物理控制”量身定制表征空间。
  • 极低的在线推理延迟代价:尽管引入了强大的前置 LLM 推理规划,但在部署推理阶段仅需在初始阶段调用一次 Planner,推理单轮耗时仅微增约 1 秒,完全保证了在线闭环控制的实时性。

局限与展望

  • Critic 奖励粒度受限:当前采用冻结的 VLM 提供粗粒度标量奖励,在捕捉微小的物理接触几何与连续接触力学状态时仍显不足,容易在精细插拔任务中出现微小对准偏差。
  • 算力开销相对偏高:联合优化 SVD 解码层与扩散策略在两张 A100 80GB 上仍需 6–7 天完整训练,训练效率制约了向数千小时实机超大规模数据集的低成本扩展。
  • 未来方向:探索可学习且与策略共同进化的动态 Critic 网络,并将纯仿真 RoboCasa / LIBERO 策略零样本迁移至双臂人形实机平台上。

相关工作与启发

  • vs VideoPolicy (Liang et al., 2025):VideoPolicy 直接以 SVD 提取特征后冻结并单向输入给动作 UNet,缺乏对任务目标的高层推理约束与反馈对齐,长程任务中极易漂移;RoboTALES 引入了 LLM 层次化规划与 VLM Critic 引导,并通过单阶段端到端反向传播让动作梯度重塑视频生成器解码层,平均成功率提升 6.5 个百分点。
  • vs Diffusion Policy (Chi et al., 2024):DP 为纯反应式行为克隆策略,无内部视觉未来世界模型,在长程步骤转移与未见遮挡时缺乏预判能力;RoboTALES 以视频世界模型作为预测基座,显著提升了鲁棒性与轨迹平滑度。
  • vs OpenVLA / \(\pi_0\):通用 VLA 采用自回归输出离散 action token,面临上下文长度限制与高频连续控制开销;RoboTALES 结合高层 LLM 规划与底层连续扩散动作生成,在 50 条演示极低样本场景下展现出更优的泛化力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次打通“LLM 离散规划-视频扩散隐空间想象-VLM 可微强化学习表征对齐-连续动作扩散”四位一体单阶段闭环]
  • 实验充分度: ⭐⭐⭐⭐⭐ [横跨 RoboCasa 24 项长程复杂交互任务与 LIBERO10,多基准全面对比,消融包含动力学抖动与抗噪性深度量化]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题定义高度清晰,公式推导严谨自洽,系统架构与实验图表极具说服力]
  • 价值: ⭐⭐⭐⭐⭐ [为视频世界模型走向机器人高精度、长时程可靠控制提供了极具启发性的通用范式]