TDSR-VLA: Transition-aware Denoising Sequence Representations for Vision-Language-Action¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 机器人/具身智能
关键词: 视觉-语言-动作模型、子目标规划、流匹配、去噪序列表征、双臂协作操纵
一句话总结¶
TDSR-VLA 提出解耦视觉规划与动作生成的 VLA 架构,复用 Stable Diffusion 3 视觉规划器在去噪过程中产生的早期序列表征(SR)与迭代更新序列表征(USR),通过分层 Prefix-KV 注入引导流匹配动作专家生成连续动作块,在极小真实示范数据下显著提升了长时程双臂协同操纵性能。
研究背景与动机¶
视觉-语言-动作(Vision-Language-Action, VLA)模型通过在大规模预训练视觉-语言骨干网络上联合微调机器人示范数据,赋予了具身智能体强大的语义理解与零样本泛化潜力。然而,现有端到端 VLA 策略在真实场景落地时面临严峻的分布偏移与数据饥渴瓶颈:当仅有几十到上百条目标域轨迹示范时,单体网络必须同时学习「下一步要做什么(语义与空间规划)」与「底层具体怎么做(连续低级轨迹控制)」,参数耦合导致策略极易在长任务执行中出现累积误差漂移或停滞。
为了缓解这一矛盾,基于子目标图像(Subgoal Image)的层级规划控制接口逐渐成为主流,通过扩散模型预先生成未来 \(\Delta\) 步的视觉观测作为目标指导动作执行。然而,静态子目标图像仅定义了未来到达的「目标外观状态」,却严重欠约束了从当前状态向目标状态过渡的「转换动态与纠错路径」。现有方案尝试引入密集光流、视频特征或生成人类视频来补充时序动态,但这不仅需要引入笨重的额外模型,还割裂了子目标生成器自身的内部特征。
本文的核心切入点在于:扩散视觉规划器在迭代去噪合成子目标图像的过程中,其多模态注意力流已内生性地计算并精炼了当前场景向未来演化的上下文演进轨迹。核心 idea:将 VLA 解耦为视觉规划器与动作专家,直接复用扩散规划器内部去噪伴随生成的当前锚定序列表征(SR)与目标更新序列表征(USR),以分层 Prefix-KV 条件引导流匹配生成连续动作块,实现无需预训练动作数据的高鲁棒长时程操纵。
方法详解¶
整体框架¶
TDSR-VLA 采用显式解耦的双模块架构,将依赖大规模视觉先验的未来视觉推理与对小样本示范敏感的连续低级控制解耦。系统在每个控制周期接收当前多视角图像、机器人本体状态与任务语言指令,首先由视觉规划器预测未来固定视界的子目标图像,并抽取出两组不同去噪阶段的隐藏序列表征;随后动作专家以这两组表征和视觉 token 作为分层前缀键值(Prefix-KV),通过条件流匹配(Conditional Flow Matching, CFM)生成多步平滑动作块。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["当前多视角观测与语言指令<br/>$o_t = [I_t^1, \dots, I_t^n, q_t], \ell$"] --> DGF["解耦生成因式分解<br/>规划与控制解耦: $P_\psi(S_{t+\Delta}, R_t \mid I_t^1, q_t, \ell) \cdot P_\varphi(A_{t:t+H-1} \mid S_{t+\Delta}, R_t, o_t, \ell)$"]
DGF --> DSR["扩散去噪序列表征<br/>MM-DiT 提取当前锚定 SR 与去噪精炼 USR"]
DSR --> PKV["分层 Prefix-KV 条件注入<br/>低层 0-11 注入 SR/当前观测,高层 12-17 注入 USR/子目标"]
PKV --> CFM["连续流匹配动作块生成<br/>Gemma 骨干 + AdaRMS 调制 + 10 步 ODE 积分"]
CFM --> Out["连续动作块输出并执行<br/>$A_{t:t+H-1} \in \mathbb{R}^{H \times d_a}, H=50$"]
关键设计¶
1. 解耦生成因式分解:解耦视觉规划与动作控制 针对端到端策略在少样本场景下同时拟合高层语义规划与底层电机控制容易出现过拟合和崩溃的痛点,TDSR-VLA 将动作块 \(A_{t:t+H-1}\) 与规划信号的联合分布显式解耦为视觉规划策略与低层执行策略两个串联项: $\(P_\theta(A_{t:t+H-1}, S_{t+\Delta}, R_t \mid o_t, \ell) = P_\psi(S_{t+\Delta}, R_t \mid I_t^1, q_t, \ell) \cdot P_\varphi(A_{t:t+H-1} \mid S_{t+\Delta}, R_t, o_t, \ell)\)$ 其中 \(S_{t+\Delta}\) 是固定预测时界 \(\Delta\) 步(默认 10 帧)后的未来子目标图像,\(R_t = (SR_t, USR_t)\) 为规划器内部状态。通过这种因子分解,视觉规划器 \(P_\psi\) 得以充分承接预训练图像生成大模型丰富的物理与常识先验,而低层动作专家 \(P_\varphi\) 则专注于在给定明确局部视觉目标与转换表征下的动作分布建模,显著降低了策略对大规模跨机器人预训练数据的依赖。
2. 扩散去噪序列表征:提取当前锚定与状态转换线索 静态子目标图像仅呈现未来画面,无法提供如何过渡到该画面的动作纠偏线索。TDSR-VLA 改造基于 MM-DiT 骨干的 Stable Diffusion 3,除文本指令外,将当前主视角图像 \(I_t^1\) 经 SigLIP 编码为视觉 token,连同浮点序列化状态 \(q_t\) 拼接进条件序列。在多步整流流(Rectified Flow)去噪过程中,条件流 token 与含噪图像潜码持续进行联合交叉自注意力交互。作者发现,去噪过程中被常规扩散模型丢弃的条件流隐藏状态蕴含了丰富的时序动力学演化信息。模型从中抽取维度为 \(L_p \times d_p^{\text{SD3}}\)(\(333 \times 1536\))的两组表征: - 序列化表征(Sequence Representation, SR):去噪初始阶段的条件隐藏序列,忠实锚定当前真实观测 \(I_t^1\)、本体状态 \(q_t\) 与文本语义; - 更新序列表征(Updated Sequence Representation, USR):经历全部去噪步数后、经由与未来图像潜码多轮交互精炼的最终条件隐藏序列,深层编码了从当前场景转换至预测子目标的动作演化意图。
3. 分层 Prefix-KV 条件注入:低层状态锚定与高层目标引导 为了让动作专家网络能够兼顾「当前物理约束的稳定性」与「目标导向的轨迹前瞻性」,TDSR-VLA 设计了一种依层划分的 Prefix-KV 机制。在基于 Gemma 搭建的 18 层动作专家 Transformer 中,第 \(i\) 层的 Prefix Key 与 Value 严格按层级职责隔离: $\(\begin{aligned} \text{Layer}^{0:11}_{\text{current}}: \quad & K^{\text{pre}}_i = \text{MLP}(SR_t), \quad & V^{\text{pre}}_i = \text{MLP}(\text{SigLIP}(I_t^{1:n})) \\ \text{Layer}^{12:17}_{\text{subgoal}}: \quad & K^{\text{pre}}_i = \text{MLP}(USR_t), \quad & V^{\text{pre}}_i = \text{MLP}(\text{SigLIP}(S_{t+\Delta})) \end{aligned}\)$ 前 12 层(0–11 层)作为当前层,以当前状态锚定表征 \(SR_t\) 为索引键、当前多视角相机(俯视主相机与双腕相机)的 SigLIP 特征为内容值,确保动作生成牢牢立足于机械臂当前的实际几何位姿;后 6 层(12–17 层)作为子目标层,将动态转换表征 \(USR_t\) 作为键、生成子目标图像的 SigLIP 特征作为值,直接引导动作轨迹向预定目标靠拢。动作 token 与前缀 KV 在自注意力层拼接后双向全连通交互,使得每个 action token 均能在全局感受野下权衡当前与未来。
4. 连续流匹配动作块生成:双向时序协同与无模拟器优化 在动作建模范式上,TDSR-VLA 摒弃了计算昂贵且存在累积离散误差的自回归 Tokenizer,采用基于条件流匹配(CFM)的连续动作块生成机制。动作向量统一零填充至 \(d_{\max}=32\),通过线性层映射为长度 \(H=50\) 的动作潜码序列。模型利用正弦位置编码结合 MLP 处理连续流时间 \(\tau \sim \text{Beta}(1.5, 1.0)\),并通过自适应 RMSNorm(AdaRMS)注入各 Transformer 块调制向量场速度。在推理阶段,仅需使用极少的 ODE 欧拉步数(默认 \(K=10\))即可从标准高斯噪声中快速回溯生成流畅、无抖动的连续轨迹块,天然克服了自回归模型由于单向因果掩码导致的动作步间缺乏协同的问题。
损失函数 / 训练策略¶
训练采用两阶段解耦与预计算冻结策略: 1. 视觉规划器微调:冻结 VAE 及文本/视觉编码器,仅对 MM-DiT 应用 LoRA,采用整流流均方误差损失进行优化: $\(\mathcal{L}_{\text{RF}} = \mathbb{E}_{\tau, x_0^S, \epsilon} \left[ \| v_\psi(x_\tau^S, \tau \mid I_t^1, q_t, \ell) - u_\tau^S \|_2^2 \right]\)$ 其中目标流速度场为 \(u_\tau^S = \epsilon - x_0^S\)。 2. 预计算缓存与动作专家训练:为了避免在动作训练循环中重复进行高耗时的扩散去噪采样,预先使用训练好的视觉规划器对整套训练集离线推理,将子目标图像 \(S_{t+\Delta}\) 及中间表征 \((SR_t, USR_t)\) 固化到磁盘。训练动作专家时完全冻结规划器,直接加载缓存特征,以条件流匹配目标进行单阶段端到端优化: $\(\mathcal{L}_{\text{CFM}} = \mathbb{E}_{\tau, x_0, z} \left[ \| v_\varphi(x_\tau, \tau \mid \{K_i^{\text{pre}}, V_i^{\text{pre}}\}_{i=0}^{17}) - u_\tau \|_2^2 \right]\)$ 其中加噪动作 \(x_\tau = (1-\tau)x_0 + \tau z\),目标速度 \(u_\tau = z - x_0\)。此举彻底消除了两阶段联合优化的不稳定性。
实验关键数据¶
主实验¶
在仿真基准 LIBERO 上,评估了 10 个任务的 Goal 与 10 个长序列任务的 Long 测试集(每任务仅 50 条示范,500 个评测 episode)。在完全没有经过大规模机器人跨本体预训练的前提下,TDSR-VLA 全面超越了具有海量预训练的 OpenVLA,并在长时程任务上显著反超同样无预训练的 \(\pi_0\)。
| 模型 | 机器人示范预训练 | LIBERO-Goal 成功率 (%) | LIBERO-Long 成功率 (%) | 平均提升说明 |
|---|---|---|---|---|
| OpenVLA | 是 (Open X-Embodiment) | 79.2 | 53.7 | 基线(自回归 VLA) |
| \(\pi_0\) | 否 | 89.0 | 48.0 | 流匹配单体模型,长时程长尾衰退 |
| TDSR-VLA (本文) | 否 | 82.0 | 56.0 | 相比 OpenVLA 分别提升 +2.8% / +2.3%;长时程超 \(\pi_0\) +8.0% |
在真实世界双臂 OpenArm v0.3(14-DOF 双臂 + 2 个 1-DOF 夹爪,共 16 维控制)平台上,针对 6 项复杂双臂任务(4 项时序任务、2 项双臂物体协作任务,每任务 100 条示范微调 10 个 epoch,各评测 20 轮,双臂 0.5+0.5 打分制)开展对比:
| 评测任务类型 | SmolVLA (得分) | \(\pi_0\) (得分) | GR00T N1.5 (得分) | TDSR-VLA (本文得分) | 对比最强基线提升 |
|---|---|---|---|---|---|
| 时序任务均分 (Tasks a, b, d, e) | 0.58 | 0.76 | 0.76 | 0.80 | +0.04 |
| 物体协作任务均分 (Tasks c, f) | 0.59 | 0.63 | 0.70 | 0.88 | +0.18 |
| 全任务综合平均分 (Overall) | 0.58 | 0.71 | 0.74 | 0.825 (95% CI: [0.767, 0.879]) | +0.083 (配对提升 CI: [0.004, 0.163]) |
消融实验¶
消融实验深入验证了子目标注入深度配置以及更新序列表征(USR)的关键作用。
| 配置变体 | 注入方式 / USR 设置 | OpenArm 平均得分 | 说明与分析 |
|---|---|---|---|
| 0 层子目标 (0 Subgoal Layers) | 仅使用前 18 层注入当前观测与 SR | ~0.71 | 缺乏子目标前瞻视觉引导,策略易陷入局部停滞 |
| 3 层子目标 (3 Subgoal Layers) | 15 层当前 + 3 层子目标 | ~0.81 | 初步建立前瞻引导,表现接近 6 层 |
| 6 层子目标 (Full Model) | 12 层当前 (SR) + 6 层子目标 (USR) | 0.83 | 最佳配比:底层稳态锚定与高层目标引导平衡 |
| 9 层子目标 (9 Subgoal Layers) | 9 层当前 + 9 层子目标 | ~0.73 | 子目标层过多削弱了对当前机械臂真实位姿的锚定能力 |
| 替换为全 SR (w/o USR) | 子目标层 Key 改用初始阶段的 SR | 0.70 | 直接暴跌 0.13 分,证明去噪更新过程蕴含关键时序转移信息 |
关键发现¶
- USR 是动态转换与容错修正的核心来源:在线性探测(Linear Probing)分析中,在未见过的 LIBERO 轨迹上评估特征表征能力,发现冻结的 USR 特征对未来 10 步末端位移预测的判定系数达到 \(R^2 = 0.48\),未来动作均值预测达到 \(R^2 = 0.40\),阶段进度分类宏平均 F1 达 0.74,均大幅碾压单纯的机械臂状态、子目标图像 SigLIP 特征以及打乱时序的 Shuffled USR。这证实了 USR 确实保留了当前到子目标之间的流形转换动力学,而非静态外观。
- 高难度双臂交接/协作任务收益显著最大:在双臂魔方传递(Task c)与高脚杯交接(Task f)等极度依赖两臂亚厘米级相对位姿协同的任务中,TDSR-VLA 斩获 0.88 的超高分,远超此前最顶尖的人形基础模型 GR00T N1.5(0.70)与 \(\pi_0\)(0.63),验证了显式视觉子目标与时序过渡线索在多智能体/多执行器协同动作中的不可替代性。
亮点与洞察¶
- 将扩散去噪的「副产物」转化为动作策略的「推进剂」:传统方法将生成模型视为单纯输出像素的黑盒,而 TDSR-VLA 独辟蹊径地重用 MM-DiT 在去噪过程中多模态注意力流自发沉淀出的条件表征(USR),不需额外训练光流网络或视频生成器就免费获得了时序状态转换先验。
- 离线预计算彻底打破规划-控制联合训练瓶颈:通过将视觉规划器的生成结果与内部表征离线固化到磁盘,训练动作专家时无需进行极其昂贵的扩散多步反向传播或采样,既大幅削减了显存开销与训练时间,又从根本上避免了动作与规划梯度互相拉扯导致的训练发散。
局限与展望¶
- 同步规划与推理延迟瓶颈:单 chunk 动作生成的端到端耗时达 3453.4 ms,其中视觉规划器的扩散去噪耗时占比高达约 87%(3014.8 ms),在 30 Hz 的控制闭环下会导致约 1.79 秒的机械臂静止停顿(Idle Time),在双杯分拣这类需要超高频敏捷连续操作的任务中得分略受拖累(0.55 vs GR00T 的 0.58)。
- 未来改进方向:亟需引入异步子目标生成机制(Asynchronous Subgoal Generation),在当前动作块执行期间于后台并行预计算下一阶段的子目标与 USR,实现无缝流水线式重规划控制;同时可探索少步甚至单步一致性蒸馏(Consistency Distillation)规划器以压缩推理开销。
相关工作与启发¶
- vs FlowVLA / VideoVLA: FlowVLA 额外训练光流生成模型来表征运动 token,VideoVLA 依赖庞大的视频扩散模型提取逐帧特征;TDSR-VLA 仅使用单张子目标图像生成器,通过直接复用其去噪内部状态(SR 与 USR)获取时序动态,计算架构更轻简且与动作专家解耦更彻底。
- vs \(\pi_0\) / GR00T: \(\pi_0\) 与 GR00T 采用端到端架构直接将视觉语言输入映射为动作流,在缺乏海量多机器人数据预训练时应对长时程任务容易退化;TDSR-VLA 证明在数据受限(每任务 50-100 条示范)场景下,显式引入具有视觉常识先验的解耦子目标规划器具备压倒性优势。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙重用扩散规划器内部去噪伴随生成的 SR/USR 序列表征作为动作条件,构思非常独到。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 LIBERO 仿真基准、真实世界 14-DOF 双臂 6 项长时程任务,并包含扎实的层级消融、冻结探测与时延系统分析。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,解耦因式分解与网络数据流交代清晰,图表数据完整翔实。
- 价值: ⭐⭐⭐⭐⭐ 为小样本数据下的长时程多臂具身控制提供了一条兼顾视觉常识泛化与控制稳定性的可行技术路径。