跳转至

title: >- RoboStream:以时空几何锚定与因果记忆支持长程机器人操作 description: >- ECCV2026 RoboStream 通过 STF-Tokens 绑定物体外观与三维几何,以 CSTG 保存动作引发的状态变化,无需任务微调,在八项 RLBench 长程操作任务上达到 90.5% 平均成功率。 tags: - ECCV2026 - 机器人/具身智能 - 视觉语言模型 - 时空推理 - 因果记忆 date: 2026-09-17


RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

会议: ECCV2026
论文: ECCV 官方页面
项目: RoboStream
领域: 机器人/具身智能;视觉语言模型推理
关键词: 长程操作、时空几何锚定、因果记忆、物体恒存性、视觉语言模型

一句话总结

RoboStream 将物体级视觉证据与三维几何绑定为 STF-Tokens,再用 CSTG 持续记录动作与状态变化,使无需任务微调的视觉语言模型能够检查操作前提、追踪遮挡物体,并在八项 RLBench 长程任务上取得 90.5% 平均成功率。

研究背景与动机

机器人完成一次抓取,与完成“搭建、遮盖、移开遮挡物、恢复原状”并不是同一层次的问题。 单步规划可以依赖当前图像判断抓哪里,但长程操作还要知道某个物体为什么出现在这里、它支撑着谁,以及下一步是否会破坏已经满足的条件。 VoxPoser 用三维价值图连接语言与运动规划,SoFar 将语言约束关联到位置和朝向,已经加强了单步操作的空间表达。 本文关注的剩余问题是:如果每次都从新图像重新推断场景,那么一次微小的位置误判会影响后续堆叠,而刚被盒子遮住的积木也容易从规划上下文中消失。 因此,失败可能并非指令理解错误,而是规划器丢失了执行过程中不断改变的世界状态。

仅保存过去的图片并不直接解决问题,因为模型仍要重新识别跨帧物体,并从像素推断可执行的几何关系。 反过来,只给当前物体附上三维坐标,也无法解释被遮挡对象的去向,或区分计划内移动与意外碰撞。 这形成两个相互依赖的需求:当前观测必须关联到稳定的物体身份,历史记录必须说明动作如何改变这些物体。 例如,恢复最初的堆叠需要先取回藏在容器下的底层积木,而不是把当前可见的容器误当成新的支撑面。 RoboStream 因而把改进位置放在 VLM 的输入表示与执行记忆上,而不是重新训练一个动作策略。

其目标不是让模型凭语言“想得更久”,而是让每次推理都能查到有几何依据的当前状态和可追溯的历史。 视觉表征回答物体是什么,三维属性约束它在哪里及占多大空间,事件日志则说明这些状态是如何形成的。 这三类信息在逐步执行中持续更新,才能支撑遮挡后的检索、操作顺序检查与失败后的重规划。 核心 idea:把逐帧观察改成带稳定物体身份的几何状态流,再用动作关联的事件记忆维持长程操作的因果连续性。

方法详解

整体框架

输入包括当前 RGB-D 观测、目标图像或自然语言指令,以及此前维护的场景记忆。 输出不是最终文字答案,而是可以交给机器人执行的六自由度动作;语言规划与数值几何解析分开完成。 系统先进行目标相关的物体识别和分割,随后依次经过时空融合令牌、因果时空图、因果推理与动作实例化三个环节。 这三个环节分别负责提供可靠的单物体状态、维护跨时刻关系与事件,以及据此选择和落地下一步动作。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["RGB-D + 目标"] --> Perception["物体识别与分割"]
        Perception --> Tokens["时空融合令牌"]
        Tokens --> Graph["因果时空图"]
        Graph --> Planning["因果推理与动作实例化"]
        Input -->|目标与标注观测| Planning
        Planning --> Execution["六自由度动作执行"]
        Execution -->|新观测| Perception
        Graph -->|历史身份与状态| Perception

图中的闭环发生在推理和执行阶段,不代表反向传播或策略训练。 前端 VLM 根据观测、目标和历史记忆给出任务相关物体的开放词汇描述,再由 SAM3 生成实例掩码。 掩码与深度图结合,得到每个物体的点云,同时让后续视觉处理聚焦于相关对象。 目标图像适合描述难以用文字完整枚举的搭建结果,自然语言则适合表达遮挡与恢复这类时间要求。 记忆参与物体描述生成,有助于跨步骤沿用身份,但正文没有完整给出身份匹配与冲突处理算法。 因此,持久身份是框架的重要设计目标,不应被读成已经形式化证明的跟踪保证。

关键设计

1. 时空融合令牌:把物体外观与可查询的几何绑定起来

STF-Tokens 的基本单位是物体实例,而不是整张场景图或一句模糊的位置描述。 对每个物体,系统将掩码作用于 RGB 图像,通过 VLM 视觉编码器得到 \(16\times16\) 的 patch 网格。 接着按 patch 与掩码的 IoU 阈值 \(I_{th}\) 保留相关视觉证据,并投影、聚合到语言表示空间。 这样做旨在减少重复背景的干扰,让“这个物体”的外观与其后面的几何字段处于同一上下文中。 正文没有给出 \(I_{th}\) 的具体取值,也没有报告不同阈值下的敏感性,不能据此补出确定的保留比例。 几何支路则从物体点云提取三维中心和形状描述,不要求模型从物体照片再次估计所有数值关系。

其中,“中心”采用点云坐标的中位数,而不是通常意义上的算术平均质心。 形状描述沿三个空间轴分别记录均值、标准差、最小值和最大值;以下直接对应第 3.3 节的定义:

\[ \mathbf{c}_i^t=\operatorname{median}(P_i),\qquad \mathbf{s}_i^t=\{(\mu_a,\sigma_a,a_{\min},a_{\max})\mid a\in\{x,y,z\}\}. \]

均值与标准差描述点的主要分布,极值补充几何范围,避免只用高斯近似遗漏物体延伸部分。 这些量与视觉证据、时间戳一起形成物体状态;几何字段经文本 tokenizer 序列化,与视觉表示进入同一模型上下文。 这里的“融合”不是新增一个需要训练的多模态网络,而是利用已有视觉投影与文本接口组织证据。 它也不是完整三维网格或完整协方差模型,不应把轴向统计量理解为对任意物体形状的精确重建。 其价值在于后续动作可以通过物体身份检索数值几何,而不必让 VLM 自由生成未经约束的坐标。

2. 因果时空图:同时保存空间关系与动作改变状态的历史

CSTG 由当前空间场景图和因果记忆日志组成,所谓“4D”指三维状态沿时间展开,并非一个新的四维传感器。 场景图节点对应物体身份,每个节点保留长度为 \(K\) 的 STF-Token 滑动窗口。 边以中心间的欧氏距离与方向偏移描述物体之间的空间关系,第 3.4 节给出的几何量为:

\[ d_{ij}=\|\mathbf{c}_i-\mathbf{c}_j\|_2,\qquad \Delta\mathbf{c}_{ij}=\mathbf{c}_j-\mathbf{c}_i. \]

这些关系让规划器能检查对象之间的相对位置,而不仅是逐个读取孤立坐标。 但距离与方向本身并不等价于完整的物理支撑模型,正文没有为稳定性检查给出独立力学求解器。 系统比较时间窗口内的状态变化,记录计划移动、意外碰撞、遮挡,以及动作执行、子任务完成等事件。 每条事件包含时间戳、位置和因果来源,把“物体移动了”进一步关联到“由哪次动作或外部干扰触发”。

当物体暂时不可见时,历史身份、最后观测位置及遮挡事件仍可进入后续规划上下文。 这让模型有依据提出先移开遮挡物,而不是把看不见的对象当成不存在。 不过,最后已知位置只是有条件的历史证据;若物体在遮挡期间受到未观测扰动,日志不会自动保证其位置仍正确。 这里的“因果”主要指动作与状态变化的结构化关联,不是通过干预实验识别出的通用因果世界模型。 论文没有明确给出窗口 \(K\) 的取值、事件检测阈值或长期历史的压缩规则,这些是复现时仍需补足的细节。 该结构提供的是检查动作前提和触发重规划的依据,而非无条件正确的隐状态估计。

3. 因果推理与动作实例化:先检查语义前提,再解析执行几何

规划时,VLM 同时接收 CSTG、带物体身份标记的观测,以及任务目标。 模型利用思维链(chain-of-thought,CoT)回顾历史状态、检查操作前提,并处理遮挡或动作依赖造成的冲突。 例如,“拿底层积木”不能只看它是否属于目标集合,还要考虑上面是否仍有需要先移走的对象。 若观测与预期不一致,系统可据状态和事件记录重新规划,而不是继续执行原先的整段动作序列。 这一过程属于有结构化证据支持的语言推理;正文没有提供形式验证器来保证所有 CoT 判断都正确。 模型首先输出引用具体物体的语义动作指令,几何解析阶段再根据图中的 STF-Tokens 实例化六自由度动作。

分开这两步,是为了保留 VLM 对任务语义的泛化能力,同时减少由语言模型凭空给出精确坐标的误差。 这种解耦并不表示物体中心和轴向统计量已经充分决定任意抓取与旋转策略。 在空间推理评测中,论文明确沿用 SoFar 的设定,引入 PointSO 进行六自由度预测。 因此,“无需训练”不能等同于“不依赖感知模块、几何工具或底层控制器”。 实际执行后重新获取观测,再更新令牌、图与事件日志,闭环是否可靠仍取决于这些模块的误差。 尤其是抓取失败,即便语义动作选择正确,也可能改变后续状态并要求重新检查任务前提。

一个完整示例

以“藏起一个积木,再恢复初始堆叠”为例,下面是依据论文任务机制整理的说明性流程,不是新增测量记录。 初始观测先为目标积木、上方积木和遮挡容器建立身份与三维状态,并保留初始堆叠关系。 系统若要移动底层积木,先通过当前关系判断是否需要移走上方对象,避免违反取放前提。 目标积木移动到指定区域后,新观测确认位置变化,日志记录移动及其动作来源。 容器盖住目标积木时,模型失去直接视觉证据,但事件记忆仍保留其身份与最后已知位置。 收到恢复要求后,规划器可结合这一历史先移开容器,再用重新出现的视觉与深度证据更新几何。 最后按初始关系安排取放,而不是把当前可见对象直接排列成一个“看起来像完成”的状态。 这个例子体现出几何与记忆的分工:前者使每次放置更有依据,后者使动作顺序能够依赖过去。

损失函数 / 训练策略

RoboStream 不提出新的损失函数,也不进行针对这些评测环境的适应训练或微调。 论文分别使用 Qwen3-VL-8B、Qwen3-VL-32B、Qwen3-VL-235B 作为规划骨干,对应三个模型规模。 这里的零样本指框架在目标任务上无需域内微调,不意味着基础模型和 SAM3 等组件从未接受训练。 STF-Tokens、CSTG 和提示组织发生在推理时,执行历史也是运行中积累,而非监督学习标签。 读取的正文公式存在若干提取损坏,本笔记仅保留可以从文字定义明确核对的几何式,不重建损坏的规划算子公式。

实验关键数据

主实验

原文表 2(第 12 页)评估八项由 RLBench 原生资产扩展、重组的长程任务,每种方法每项任务运行 25 个不同随机种子的 episode。 指标为整项任务成功率(%),各任务试验数相同;这不是 RLBench 所有原生任务的总体结果。 五项复杂构型任务使用目标图像,遮盖顶层/底层积木与先拆后搭三项任务使用文本指令。

RLBench 任务 SoFar VoxPoser RoboStream-8B RoboStream-32B RoboStream-235B
Bridge Between Towers 52.0 8.0 76.0 88.0 88.0
Cover Top Block with Box 4.0 4.0 40.0 84.0 92.0
Cover Bottom Block with Box 0.0 0.0 16.0 68.0 96.0
Place Blocks in Two Containers 100.0 96.0 100.0 100.0 100.0
Place Blocks in Two Cont. (Hard) 4.0 4.0 24.0 76.0 88.0
Stack Five Colors 4.0 4.0 60.0 72.0 80.0
Stack Three Colors 60.0 96.0 96.0 96.0 96.0
Unstack then Stack Four Colors 0.0 0.0 52.0 76.0 84.0
平均 28.0 26.5 58.0 82.5 90.5

RoboStream-235B 相比 SoFar 的平均提升为 62.5 个百分点,相比 VoxPoser 为 64.0 个百分点。 优势集中在遮挡、长序列堆叠和拆后重建,简单的双容器放置并没有提供同等区分度。 8B 到 235B 的性能随模型规模提升,但表 2 本身不是所有基线统一骨干的纯表示消融,不能把全部差距归因于记忆。

消融实验

原文表 5(第 13 页)固定 RoboStream-235B,在相同八项长程任务上移除 STF-Tokens、CSTG 或两者。 下表保留平均成功率和两个有代表性的任务,所有数值单位均为 %。

STF-Tokens CSTG 遮盖底层积木 先拆后搭 平均成功率
0.0 0.0 12.0
0.0 0.0 14.5
88.0 64.0 79.5
96.0 84.0 90.5

移除 CSTG 后平均成功率下降 76.0 个百分点,移除 STF-Tokens 后下降 11.0 个百分点。 仅有 STF-Tokens 比两者都无高 2.5 个百分点;有 CSTG 时加入 STF-Tokens 则高 11.0 个百分点。 这支持几何与记忆互补的解释:单步几何改善不足以弥补丢失的长程状态,而记忆使几何优势能在多步执行中持续发挥。 不过,CSTG 同时包含状态历史、关系和事件,并非只有一个文本日志,因此该消融不能进一步分离各类记忆信息的贡献。

关键发现

真实实验使用 Franka Research 3、平行夹爪和前视 Intel RealSense D435i,涉及 17 个彩色物体、21 项任务,每项重复三次。 第 4.2 节与图 4(第 10 页)报告:Hard 搭建中 235B 成功率为 44.4%,SoFar 和 VoxPoser 均为 11.1%;Hard 拆卸为 66.7%。 同处报告遮藏恢复任务中 235B 为 88.9%、8B 为 33.3%,两个基线均为 0%,但小规模真实试验不等于通用开放世界可靠性。 表 1(b)(第 11 页)的 SIMPLER WidowX + Bridge 四任务平均成功率为 74.8%(RoboStream-8B)对 58.3%(零样本 SoFar),说明收益不只出现在长程任务。 空间评测提供另一条证据:表 3、4(第 13 页)中 32B 在 SpatialBench 总准确率为 48.9%,在 Open6DOR V2 的综合六自由度成功率为 52.2%。 对应 SoFar-32B 分别为 45.3% 和 48.4%;这些是不同评测定义的指标,不能与 RLBench 的任务成功率直接合并。

亮点与洞察

  • 将外观与几何绑定到同一身份。 关键不只是增加坐标字段,而是让坐标始终属于可在下一步继续引用的同一个物体,从而降低视觉指代与执行几何脱节的风险。
  • 记住变化原因,而不只是最近一帧。 动作关联的事件让“移走遮挡物”具有历史依据,为恢复类任务提供单帧模型缺少的信息。
  • 推理与数值解析分工明确。 VLM 选择语义动作,几何记录参与动作实例化,这种接口可用于其他需要精确位置但不希望重新训练规划器的操作系统。
  • 消融揭示条件性收益。 STF-Tokens 在没有 CSTG 时作用有限,说明单步空间能力的价值取决于长程执行是否维护了正确状态,而非模块性能可以简单相加。

局限与展望

  • 作者承认的执行瓶颈。 第 5 节指出抓取不稳定或感知不确定性仍会导致失败,规划正确不能保证物理控制成功。
  • 记忆机制的复现细节不足。 正文未明确跨帧关联规则、窗口长度、事件阈值,以及不可见物体被外力移动时如何表达置信度;这是阅读正文后的复现疑问。
  • 效率证据有限。 令牌压缩有减少背景处理的动机,但正文未给出端到端延迟、显存或上下文增长曲线,不能据此声称实时部署。
  • 因果能力仍有边界。 日志能够追踪动作与状态变化,但没有证明对未观测干扰、复杂接触或错误归因具有通用因果推断能力。
  • 评测范围需保留。 真实任务主要围绕彩色物体搭建、拆卸与遮藏,且重复次数有限;作者提出接触密集、灵巧和开放世界操作作为未来方向。
  • 可行的后续路线。 作者建议使用 VLA 作为下游控制器,或让端到端 VLA 内化时空推理与因果记忆;读者还可考虑为历史状态加入不确定性及主动重观测机制。

相关工作与启发

  • 与 SoFar 对比。 SoFar 强调语言关联的朝向及六自由度操作;本文增加跨步骤物体状态与事件追踪,并在空间评测中沿用 PointSO,因此并非完全独立的低层几何系统。
  • 与 VoxPoser 对比。 VoxPoser 用三维价值图表达动作目标;本文的重点是保留这些目标所依赖的状态变化,使当前规划能够利用先前操作的后果。
  • 与 Inner Monologue 对比。 感知反馈支持自我纠错,而 CSTG 进一步将反馈组织成对象、时间、位置和事件来源,减少只依赖无结构历史描述的负担。
  • 与 SAM2Act、MemoryVLA 对比。 原文第 4.4 节声称在四个 RLBench 案例中优于这两种记忆方法,但所给正文未列对应数字表,本笔记不据此扩展量化结论。
  • 研究启发。 可以分别消融几何状态、动作来源和遮挡事件,并加入受控外力扰动,以检验收益究竟来自历史信息量、结构化表示还是正确的因果归因;这是读者提出的研究方向。

评分

  • 新颖性: 4/5。将持久物体几何与动作事件接入免微调规划闭环有清晰针对性,但场景图、记忆和几何工具本身均有先例。
  • 实验充分度: 4/5。覆盖五类评测并有固定骨干消融,但真实试验较小,记忆细项和计算成本的分析不足。
  • 写作质量: 3/5。两个核心缺陷与模块对应明确,但身份匹配、事件判定和若干接口细节解释不够完整。
  • 价值: 4/5。对遮挡、恢复和多步堆叠具有实际启发,适合作为显式状态管理的机器人规划框架参考。