跳转至

Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/chen-siyao/T2VLA
领域: 机器人/具身智能
关键词: 视觉语言动作模型, 测试时强化学习, 内在奖励, 动态时间规整, 自启动优化

一句话总结

针对传统具身 VLA 模型强化学习严重依赖外部环境成功反馈的瓶颈,本文揭示了离散动作 VLA 生成置信度与物理执行成功率的强正相关性,提出无需外部奖励的测试时强化学习框架 T2VLA,通过置信度驱动的双专家自启动机制与 DTW 混合相似度内在奖励,在离散与连续流匹配 VLA 上均实现显著的自主策略跃升。

研究背景与动机

视觉语言动作(VLA)模型通过将多模态视觉感知、语言指令理解与底层动作生成端到端联合建模,已成为具身智能领域的核心基础架构。然而,传统依赖离线演示数据的监督微调(SFT)方法面临高昂的数据采集成本与严峻的分布外泛化瓶颈。为突破静态模仿学习的上限,强化学习(RL)被广泛引入以驱动策略的主动闭环交互。尽管现有的在线 RL-VLA 方法取得了亮眼表现,但它们高度依赖外部监督信号——要么来自仿真环境预定义的二值成功标志,要么由额外训练的价值批判网络或昂贵的人类反馈提供。这种对外部显式奖励函数的重度依赖,严重限制了机器人走出受限仿真沙盒并在非结构化开放世界中实现自主终身进化的能力。

在自然语言推理与代码生成领域,“经验时代”的测试时强化学习(Test-Time RL)已通过生成多条轨迹并基于确定性答案进行自洽性多数投票取得了巨大突破。然而,将这一范式直接移植到具身操作面临着根本性挑战:离散数学或代码问题存在唯一的客观判定真值,而连续的物理机器人操控任务具有非凸的多模态解空间,到达相同目标物可能存在无数条几何形态和时间节奏各异的有效轨迹,环境在缺乏外部反馈时无法直接提供用于反思自洽的确定性客观答案。

本文的切入视角建立在一个关键的实证发现之上:通过对数千条离散动作 VLA 交互轨迹的系统审计,作者发现轨迹级的生成置信度(即动作序列的长度归一化对数概率均值)与实际物理操作的成功率之间存在极为显著的强正相关。换言之,模型对自身生成分布的内在确定性本身就是一种高质量的物理可行性隐式估计。核心 idea:利用 VLA 自身的生成置信度作为内在评估锚点,构建由局部批次伪专家与全局动态专家池构成的双专家自启动机制,并借助动态时间规整(DTW)将轨迹时空相似度转化为致密内在奖励,在 GRPO 优化下实现完全无需外部环境反馈的测试时自主策略演进。

方法详解

整体框架

T2VLA 提出了一套端到端的自启动测试时强化学习流水线,其核心目标是消除环境外部奖励 \(R_{\text{env}}(\tau)\),转而完全利用模型内部自生成的内在奖励 \(R_{\text{self}}(\tau)\) 引导策略参数 \(\theta\) 的迭代更新。输入为当前多模态观测状态与自然语言任务指令,输出为物理机械臂的高维连续动作序列。整个框架在每次测试时交互中由三个核心阶段紧密协同运作:首先,模型基于当前策略采样一批探索轨迹,并按动作表示范式计算长度归一化的生成置信度;其次,通过置信度驱动的双专家机制从探索轨迹中自适应遴选即时局部专家并维护长程全局专家池;最后,利用容忍时间拉伸的 DTW 计算轨迹几何相似度,经过平滑置信度插值得到内在优势函数,并通过群体相对策略优化(GRPO)更新策略权重。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["环境观测与语言指令输入<br/>多模态状态感知"] --> B["长度归一化置信度评估<br/>离散对数概率均值 / 流匹配去噪似然"]
    B --> C["双专家自启动挖掘<br/>任务条件局部伪专家 + 动态全局专家池"]
    C --> D["DTW 混合相似度内在奖励计算<br/>非线性时间规整 + Min-Max 平滑动态加权"]
    D --> E["群体相对策略优化 GRPO<br/>组内优势归一化 + 截断目标更新"]
    E -->|持续迭代进化| A

关键设计

1. 长度归一化置信度评估:消除视界长度偏差的内在质量标尺

为了在没有外部成功标志的环境中量化探索轨迹的质量,必须从模型的内部生成概率中提取鲁棒的标量分数。然而,在离散自回归 VLA 中,直接累加各个时间步的动作对数似然会导致指标对轨迹步长极度敏感,无偏向地惩罚长视界复杂任务,促使策略蜕化为生成无意义的短视界死锁行为。T2VLA 针对离散与连续两类主流 VLA 架构分别设计了长度归一化置信度计算机制。对于离散 Token 架构(如 OpenVLA-OFT),在剔除环境终止后的 Padding 填充后,根据有效物理步长 \(T_i\) 计算平均对数概率: $\(c_i^{\text{disc}} = \frac{1}{T_i} \sum_{t=1}^{T_i} \log \pi_\theta(a_{i,t} \mid s_{i,t})\)$ 对于连续流匹配(Flow Matching)架构(如 \(\pi_0\)\(\pi_{0.5}\)),单步去噪过程不显式输出离散词表概率,T2VLA 利用中间去噪步 \(k\) 上的高斯转移对数似然 \(\ell_{i,j}^{\text{flow}}\) 表征流场的去噪一致性,并对有效动作块(action-chunk)预测步数 \(L_i\) 进行平均得到 \(c_i^{\text{flow}} = \frac{1}{L_i}\sum_{j=1}^{L_i} \ell_{i,j}^{\text{flow}}\)。这种归一化将概率密度映射至跨不同物理执行视界下可严格比对的置信度标尺,为后续的自主专家选举奠定了客观依据。

2. 双专家自启动挖掘:局部激进探索与全局历史稳定的动态协同

单次批量采样中的最高置信度轨迹虽然代表了当前策略的最优探索模式,但在训练初期或偶发扰动下,整个批次的探索质量可能整体偏低,若完全以局部最优为导向会引发误差累积甚至策略崩溃;反之,若仅依赖历史保存的静态演示,则会导致优化过早陷入历史次优局限,丧失持续自我突破的能力。为此,T2VLA 设计了双专家协同机制。首先,对批次样本按语言指令 \(l\) 进行任务级子集切分 \(\mathcal{D}_l\),在局部子集中选举出置信度最高的轨迹作为任务专属的局部伪专家: $\(\tau_{local,l}^* = \arg\max_{\tau_i \in \mathcal{D}_l} c_i\)$ 局部专家充当紧跟当前策略分布的即时优化锚点,迅速捕捉最新涌现的成功模式。与此同时,系统为每个任务动态维护一个容量为 \(K\)(实现中设为 \(K=5\))的全局专家池 \(\mathcal{P}_l\)。全局专家池严格限定只有各批次选举出的局部伪专家方有资格竞争准入,并依据其置信度分数实施优先级排序,自动挤出并淘汰落后的历史过期轨迹: $\(\mathcal{P}_l \leftarrow \text{Top-}K\left(\mathcal{P}_l \cup \{\tau_{local,l}^*\}\right)\)$ 双层机制构成了兼顾激进创新与防范崩溃的自洽闭环,确保参考轨迹池在策略演进全流程中始终具备高纯度与代表性。

3. DTW 混合相似度内在奖励计算:抗时序偏差的空间几何对齐与平滑融合

具身操作中机器人由于接触状态变化或控制抖动,即使执行完全相同的几何操纵轨迹,其在时间轴上也往往呈现出不同步的节奏快慢与局部相位平移。若采用刚性的欧氏距离(Euclidean Distance)进行点对点比对,微小的时序错位将导致距离惩罚急剧放大,将优质探索错误惩罚为低相似度样本。T2VLA 采用动态时间规整(DTW)在归一化动作空间内对轨迹进行非线性时间弹性映射,解耦空间几何构型与绝对执行时间轴: $\(\text{Sim}_{\text{DTW}}(\tau_A, \tau_B) = \frac{1}{1 + \frac{D_{\text{DTW}}(\tau_A, \tau_B)}{\max(M, T)}}\)$ 在确定局部专家与全局专家池后,轨迹 \(\tau_i\) 的最终相似度奖励通过连续 Min-Max 归一化权重 \(w\) 进行动态平滑插值: $\(r_i^{\text{sim}} = w \cdot \text{Sim}_{\text{DTW}}(\tau_i, \tau_{local,l}^*) + (1-w) \cdot \max_{\tau_p \in \mathcal{P}_l} \text{Sim}_{\text{DTW}}(\tau_i, \tau_p)\)$ 其中插值权重 \(w = \text{clip}\left(\frac{c_{local,l}^* - c_{\min,l}}{c_{\max,l} - c_{\min,l} + \epsilon}, 0, 1\right)\),以全局专家池内部的历史最高与最低置信度为动态区间。当局部批次探索极为自信时,\(w \to 1\),模型全力向最新模式靠拢;当批次探索处于高度不确定状态时,\(w \to 0\),模型平滑回退至全局历史底线。最终奖励引入参考策略约束以防过拟合:\(r_i = r_i^{\text{sim}} - \beta D_{\text{KL}}(\pi_\theta \parallel \pi_{\text{ref}})\)

损失函数 / 训练策略

在获得各批次轨迹的内在复合奖励 \(\{r_1, \ldots, r_N\}\) 后,T2VLA 采用群体相对策略优化(GRPO)框架更新策略参数。与依赖额外价值 Critic 网络估计基线的方法不同,GRPO 直接在当前采样群体内部计算优势函数,显著节省了训练显存开销: $\(A_i = \frac{r_i - \mu(r)}{\sigma(r) + \epsilon}\)$ 策略参数 \(\theta\) 通过最大化 PPO 风格的截断代理目标进行迭代优化: $\(\mathcal{L}(\theta) = \frac{1}{N} \sum_{i=1}^N \sum_{t=1}^{T_i} \min\left( \rho_{i,t}(\theta) A_i, \; \text{clip}(\rho_{i,t}(\theta), 1-\epsilon_{\text{clip}}, 1+\epsilon_{\text{clip}}) A_i \right)\)$ 其中重要性权重为 \(\rho_{i,t}(\theta) = \frac{\pi_\theta(a_{i,t} \mid s_{i,t})}{\pi_{\text{old}}(a_{i,t} \mid s_{i,t})}\)。训练超参数方面,优化器采用 AdamW,峰值学习率设为 \(5 \times 10^{-6}\),KL 散度惩罚系数初始化为 \(\beta = 0.02\)。OpenVLA-OFT 的采样温度设为 1.6,PPO 截断区间设为 \([0.2, 0.28]\);连续流匹配模型 \(\pi_0/\pi_{0.5}\) 采样温度设为 1.0,截断阈值设为 0.2。

实验关键数据

主实验

论文在两套极具代表性的机器人基准上进行了全面评测:涵盖多任务、长视界与空间推理的 LIBERO(包含 Spatial、Object、Goal、Long 四大套件),以及面向高维度双臂协调操纵的 RoboTwin 2.0 基准。

模型与方法 奖励来源 LIBERO-Spatial LIBERO-Object LIBERO-Goal LIBERO-Long 平均成功率 (%)
Octo (SFT) 无 (SFT) 78.9 84.6 85.7 51.1 75.1
OpenVLA (SFT) 无 (SFT) 84.7 79.2 88.4 53.7 76.5
UniVLA (SFT) 无 (SFT) 96.5 96.8 95.6 92.0 95.2
VLA-RL 外部环境真值 90.2 94.3 91.8 82.2 89.6
SimpleVLA-RL (Oracle) 外部环境真值 99.4 99.1 99.2 98.5 99.1
EVOLVE-VLA 预训练 Critic 95.4 97.4 95.8 94.4 95.8
OpenVLA-OFT 基线 无 (SFT) 91.6 95.3 90.6 86.5 91.0
Ours (OpenVLA-OFT) 内在自生成 97.7 (+6.1) 99.6 (+4.3) 96.1 (+5.5) 95.3 (+8.8) 97.2 (+6.2)
\(\pi_0\) 基线 无 (SFT) 65.3 64.4 49.8 51.2 57.7
Ours (\(\pi_0\)) 内在自生成 86.3 (+21.0) 91.0 (+26.6) 82.0 (+32.2) 68.0 (+16.8) 81.9 (+24.2)
\(\pi_{0.5}\) 基线 无 (SFT) 84.6 95.4 84.6 43.9 77.1
Ours (\(\pi_{0.5}\)) 内在自生成 94.9 (+10.3) 98.4 (+3.0) 91.8 (+7.2) 55.1 (+11.2) 85.1 (+8.0)

在 RoboTwin 2.0 双臂机器人操作任务中,采用 OpenVLA-OFT 骨干架构,T2VLA 展现出优异的跨步长适应性:短视界任务(Lift Pot, Beat Hammer)成功率由 19.1% 飙升至 53.9%(Beat Hammer 达 68.0%,提升 +39.9%);中视界任务(Place Empty Cup)达到 84.8%(提升 +7.5%);长视界与超长视界任务(Handover Block, Stack Bowls)平均由 36.8% 提升至 51.55%,五项任务全集平均成功率由 37.8% 攀升至 59.1%,取得 +21.3% 的绝对飞跃。

消融实验

消融实验重点验证了双专家自启动架构、专家池容量 \(K\)、融合门控函数以及轨迹相似度度量方式的必要性(基于 LIBERO-Long 套件)。

实验模块 / 策略变体 配置说明 LIBERO-Long 成功率 (%) 现象与机理说明
专家源消融 仅使用局部伪专家 (Local Only) 94.5 具备快速适应能力,但偶遇低质批次易受扰动
专家源消融 仅使用全局专家池 (Global Only) 93.0 维持基础稳定性,但过分固化历史模式,演进迟缓
专家源消融 双专家完整架构 (Dual Expert) 95.3 局部探索与全局底线互补,达到最优表现
专家池容量 \(K = 3\) 93.4 历史专家多样性受限,覆盖的成功构型不足
专家池容量 \(K = 5\) (默认最优) 95.3 在模式多样性与质量时效性之间取得理想平衡
专家池容量 \(K = 10\) 91.4 滞留过多早期低质历史轨迹,稀释奖励指导质量
融合门控机制 静态固定权重 (\(w = 0.5\)) 88.3 早期训练剧烈震荡,百轮内发生严重策略崩溃
融合门控机制 最大硬路由 (Max Routing) 87.5 离散阶跃切换导致梯度突变,引发早期崩溃
融合门控机制 自适应间隔回退 (AMF) 90.0 硬阈值截断虽避免崩溃,但缺乏细粒度自适应
融合门控机制 Sigmoid 软门控 (Sigmoid Gate) 92.6 平滑过渡显著稳定训练,但缺乏基于极值的动态跨度
融合门控机制 Min-Max 动态归一化 (Ours) 95.3 连续映射非平稳对数概率,平滑权衡两套专家
轨迹距离度量 刚性欧氏距离 (Euclidean) 相似度得分 0.6914 几何重合轨迹因时间相位微小偏移导致惩罚爆炸
轨迹距离度量 动态时间规整 (DTW) 相似度得分 0.9460 弹性时间轴非线性对齐,精准捕获真实空间同构

关键发现

  • 双专家与连续软门控是防范无监督自强化崩溃的核心基石:消融表明,任何静态分配(\(w=0.5\))或非连续硬切换策略(Max Routing)均在 100 轮以内引发策略崩溃(标注为 \(\dagger\))。这是因为在无外部真值监督的 RL 中,奖励尺度的突兀阶跃会引发破坏性梯度震荡。通过 Min-Max 将对数概率连续投影至 \([0, 1]\) 构成了不可或缺的平滑阻尼器。
  • 流匹配策略展现出惊人的自启动提升弹性:在 SFT 表现较弱的 \(\pi_0\) 基线上,T2VLA 凭借去噪对数似然挖掘专家,在无需任何外界干预下取得了高达 +24.2% 的全任务跃升(LIBERO-Goal 更是暴涨 +32.2%),证明了基于概率密度的内在置信度在扩散/流匹配模型上具有普适的引导潜能。
  • 自启动进化的“先验临界阈值”规律:极度匮乏条件(1-Shot SFT)测试表明,在 Spatial、Object、Goal 等中小视界任务上,仅需 1 条先验演示,T2VLA 即可自主放大出约 20% 的性能收益;然而在超长视界任务 LIBERO-Long 上,成功率由 17.3% 反常滑落至 11.0%。这揭示出无监督 RL 存在一个临界先验阈值:当初始策略极其脆弱、随机探索全盘脱轨时,最高置信度的伪专家亦是错误行为,DTW 奖励沦为随机噪声,导致策略漂移。

亮点与洞察

  • 将大语言模型的置信度自评估拓展至具身连续动作空间:论文首次严谨验证了离散与连续 VLA 模型的内部生成概率密度能够高度保真地反映物理操作的成功率,为打破具身智能对昂贵外部标注与交互模拟器的依赖开辟了新途径。
  • 以 DTW 空间形态相似度取代标量置信度直接惩罚:单纯将标量置信度用作 RL 奖励极易诱导模型欺骗概率分布(Policy Gaming),导致过拟合;T2VLA 巧妙地将置信度降维降级为“候选专家选举资格”,再以几何维度的 DTW 相似度作为反馈,实现了从概率到几何行为的稳健过渡。
  • 即插即用且广泛适配世界模型仿真演练:不仅无缝兼容自回归 Token 离散控制与 Flow-Matching 连续生成两代主流 VLA 范式,T2VLA 还能在由 OpenSora 构建的视频世界模型“脑内想象”探索中稳定实现自主进化(LIBERO-Spatial 提升 +2.1%),展现出强劲的物理与生成式世界通用性。

局限与展望

  • 先验依赖与长视界探索冷启动盲区:在先验极其匮乏且探索空间巨大的极端场景下(如 1-Shot 下的复杂长序列任务),模型难以自主探索出哪怕一次成功轨迹,此时置信度驱动的伪专家可能锁定在局部次优甚至完全无效的死胡同中,引发漂移崩溃。
  • DTW 仅度量末端执行器轨迹而忽略动态接触丰富度:当前的 DTW 相似度主要基于末端执行器(End-Effector)位姿序列构建,对于涉及复杂非刚体变形、精密微力控交互的精细动作,单纯的运动学几何相似无法完全等同于动力学任务成功。
  • 未来方向:探索在自启动过程中融入视觉环境状态变化预测(如引入潜空间动力学模型互验),构建接触感知与环境反馈的多模态自评估准则,以突破极端低先验任务下的冷启动瓶颈。

相关工作与启发

  • vs EVOLVE-VLA:EVOLVE-VLA 依赖额外训练的大规模通用 Critic 模型来估计执行进度并提供测试时梯度;T2VLA 完全不引入任何外部评估器或辅助模型,仅凭 VLA 模型自身内置的生成概率即可闭环自进化,部署更加轻量纯粹。
  • vs SimpleVLA-RL / \(\pi\)RL:这类前沿在线 RL 工作在训练阶段必须持续调用模拟器内部预设的硬编码 reward/done 判定逻辑;T2VLA 则完全剥离了外部成功信号,性能却逼近了真值监督的 Oracle 水平(LIBERO 平均 97.2% vs 99.1%),为机器人真机在真实世界无标环境下自主演进提供了可行路线。
  • vs V-GPS / TACO 等免训练测试时搜索(TTA):测试时适应方法主要依靠多次采样与静态加权重排序(Re-ranking),不更新网络参数;T2VLA 是真正的参数级测试时学习(TTL),通过 GRPO 强化学习实时将高质轨迹的先验固化至模型参数中。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统揭示并利用 VLA 内部置信度与物理成功率的强相关性,构建了首个无需外部奖励的具身测试时 RL 范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖离散/连续双范式 VLA、单臂/双臂全场景、极低先验与世界模型拓展,消融设计极其详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,图文与数学形式化严谨自洽,对关键失效机理(如崩溃与先验阈值)分析坦诚透彻。
  • 价值: ⭐⭐⭐⭐⭐ 摆脱外部奖励函数是具身智能走向开放真实环境的必经之路,本文的方法论与实证结论极具开创性与启发意义。