title: >- R3DP 论文笔记:面向具身操作的实时 3D 感知策略 description: >- ECCV2026 R3DP 以 VGGT 稀疏关键帧、时序特征预测和相机几何融合增强扩散策略,在 RoboTwin 达到 69.0% 平均成功率,并降低观测编码延迟。 tags: - ECCV2026 - 3D 视觉 - 机器人操作 - 扩散策略 - 时序特征预测 date: 2026-09-17
R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation¶
会议: ECCV2026
论文: ECCV 原文
项目: R3DP 项目页
领域: 3D 视觉 / 机器人操作
关键词: 模仿学习、扩散策略、3D 基础模型、时序特征预测、多视角融合
一句话总结¶
R3DP 把 VGGT 的昂贵几何理解改为稀疏关键帧计算,用轻量时序网络持续更新特征并融合相机几何,使 RGB 扩散策略在 RoboTwin 十任务上达到 69.0% 平均成功率,同时在另一运行配置下将观测编码延迟从 73.1 ms 降到 40.3 ms。
研究背景与动机¶
扩散策略擅长从演示中学习多种可行动作,但动作生成能力不等于空间理解能力。 标准 Diffusion Policy(DP)用二维编码器处理 RGB,再根据视觉特征和机器人状态生成动作序列;物体距离、遮挡和跨相机对应关系需要间接学出来。 把多幅图像的特征直接拼接,也没有告诉策略两个相机究竟从哪里观察同一个物体。 本文的多视角 DP 基线甚至弱于单视角版本,这说明在其训练设置中,增加相机输入并不自动带来更好的几何表征。
点云策略 DP3 为动作学习提供显式三维结构,但其质量依赖深度观测和点云预处理。 透明杯、反光表面或不完整深度会把感知误差传到抓取和放置动作中,而仿真真值深度可能掩盖这种脆弱性。 VGGT 等 3D 基础模型提供另一条路线:直接从 RGB 提取带几何先验的中间特征,不必先依赖传感器深度构造点云。 问题是逐帧运行大模型会拖慢策略,且独立处理每帧得到的尺度还可能随时间波动;更强的静态感知不必然意味着更稳定的连续控制。
R3DP 因此把问题改写成:哪些信息必须每次重新计算,哪些可以从上一次几何理解中更新? 场景结构在相邻策略调用之间通常具有连续性,但物体和机械臂又确实会运动,因此既不能每帧都支付完整 VGGT 成本,也不能简单复用一张过期特征图。 作者选择让当前 RGB 驱动轻量更新、让历史几何作为时序先验,再用已知相机参数约束跨视角融合。 核心 idea:用稀疏的高质量几何锚点和逐次更新的时序特征共同支撑动作生成,把昂贵的三维理解与高频策略调用解耦。
方法详解¶
整体框架¶
输入是多视角 RGB、相机内外参和机器人自身状态,输出是未来动作序列,而不是深度图或重建网格。 仿真多视角设置使用头部与前方相机,单视角 DP 只使用头部相机。 视觉部分保留当前图像的二维编码,并增加三条相互衔接的设计:异步快慢协作、时序特征预测、多视角特征融合。 慢分支 VGGT 在稀疏关键帧上产生慢速 3D 感知特征(S3DF);快分支 TFPNet 根据历史特征和当前图像产生实时 3D 感知特征(R3DF)。 多视角特征融合器 MVFF 将 R3DF 与二维特征结合,并利用相机参数得到扩散头使用的视觉条件。 这里的“三维”首先存在于潜在特征中,不要求每个控制周期都解码显式点云;论文中的深度图主要用于分析几何信息是否保留下来。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Images["多视角 RGB"] --> Schedule["异步快慢协作<br/>稀疏 VGGT 锚点"]
Schedule --> Predict["时序特征预测<br/>TFPNet 更新 R3DF"]
Images --> Predict
Predict --> Fuse["多视角特征融合<br/>MVFF 与 PRoPE"]
Images --> Encoder["ResNet 二维特征"]
Encoder --> Fuse
Cameras["相机内外参"] --> Fuse
Fuse --> Policy["扩散头 + 机器人状态<br/>未来动作序列"]
Predict -.->|历史特征递推| Predict
Teacher["训练时 VGGT<br/>逐帧教师特征"] -.->|仅预训练监督| Predict
实线概括部署时的数据流,教师虚线只表示 TFPNet 的预训练监督,不是每次策略调用都要执行的额外教师分支。 慢分支的关键帧刷新间隔由 \(\tau\) 控制,其单位是策略推断次数,不应直接等同于相机帧率或机械臂伺服周期。 策略一次可以执行一个动作块,因此时序采样中也要考虑两次观测之间可能隔着多步动作。
关键设计¶
1. 异步快慢协作:让大模型只提供稀疏几何锚点
AFSC 将 VGGT 作为慢系统,每隔 \(\tau\) 次推断处理当前多视角图像,得到高质量 S3DF。 中间调用不再对每张图像完整运行 VGGT,而由快系统将先前几何信息推进到当前时刻。 这不是缓存复用:新的观测仍然进入轻量网络,以便特征随物体运动和遮挡变化而更新。 周期性 VGGT 刷新则为递推过程重新提供几何依据,避免部署完全依赖无限延长的历史预测。 计算节省发生在观测编码路径,后面的动作扩散模型依然需要采样和去噪。 因此,论文所说的实时优势不能只用编码延迟的倒数替代完整控制频率。
这一设计还把刷新频率变成可部署调节的参数。 策略训练使用 \(\tau=8\),测试同时报告 \(\tau=4\) 和 \(\tau=8\),无需为每个间隔重新训练策略。 较小间隔意味着更频繁地校正几何特征,较大间隔则减少重模型调用。 在十任务平均结果中,间隔由 4 增至 8 时成功率从 69.0% 变为 65.7%,并非完全不损失性能。 正文没有详细交代异步线程、慢结果到达时的队列管理或过期特征处理,所以能确定的是快慢特征协作机制,而不是某一种具体并发实现。
2. 时序特征预测:用当前图像修正历史几何,而非逐帧独立蒸馏
TFPNet 首先用 DINOv2-S 编码各视角图像,再经过 4 个 Alternating-Attention Transformer 块聚合视角信息。 随后通过交叉注意力结合历史 3D 特征,输出当前时刻的 R3DF。 第一个时间步以 VGGT 特征作为初始化依据,后续步骤递归使用此前预测结果和当前图像。 这使快速网络面对的是“已有场景理解发生了什么变化”,而不是每次都从零恢复整幅场景的空间结构。 历史状态承担几何连续性,当前图像承担变化证据;两者缺一,便分别退化为独立预测或陈旧缓存。 论文图 3 与第 4.2 节的文字对交叉注意力查询方向的表达并不完全一致,本笔记不据此断言历史特征必定是键值或查询。
预训练时,作者从同一 episode 按时间顺序抽取 4 帧,相邻抽样间隔随机取 1–8 帧。 VGGT 为所有这些帧提供教师特征,教师目标来自其 24 层密集输出所用的统一 token 表征。 学生在整个序列上展开,第一帧获得教师锚点,后续帧使用自己已经预测的历史特征继续更新。 这样训练能让学生接触递推误差,而不只是学习一个条件独立的 RGB 到 VGGT 特征映射。 监督使用预测特征与教师特征的余弦相似度损失,目标是保留特征方向上的几何信息。 缓存中的原式 (9)–(10) 已损坏,无法可靠确认完整符号、归约方式或损失常数,因此不将补写的标准余弦公式冒充作者原式。
3. 多视角特征融合:让相机关系参与二维与三维信息整合
VGGT 的多视角 token 虽包含统一场景信息,仍保留各视角特性,例如可分别解码对应深度图。 MVFF 因而先做视角内融合:ResNet 提供当前二维外观,R3DF 提供几何上下文,交叉注意力将两者结合成混合特征。 第 4.3 节公式文字将二维特征投影为查询,将 R3DF 投影为键和值;图 2 的 Q/K/V 标注看起来采用另一方向。 本笔记按公式说明计算关系,并保留这一图文不一致,不把它当作已经核对过代码的实现事实。 机制的关键是让当前外观能够利用几何特征,而不是将二维输入完全替换成纯点云表示。
接下来使用投影位置编码 PRoPE,把相机内参与外参注入多视角聚合。 外参提供相机之间的姿态关系,内参提供焦距等成像信息;只编码 SE(3) 位姿无法覆盖不同相机视锥的差异。 PRoPE 用相对投影关系组织注意力,而非把相机编号当作绝对位置,所以几何关系比任意视角顺序更重要。 它继承已有的相机位置编码方法,并非本文另行发明的一套几何定理。 作者强调真实相机参数比完全依赖 VGGT 内隐估计更可靠,但这也意味着“不需要深度传感器”不等于“不需要相机标定”。 融合后的视觉嵌入连同机器人状态作为扩散去噪条件,产生可执行的未来动作块。
一个完整示例¶
以双臂 Block Handover 为例,以下只是按论文架构解释信息流,不是作者额外公开的一条轨迹。 在关键观测处,头部和前方 RGB 一起进入 VGGT,建立物块、机械臂及背景的几何特征锚点。 执行一段动作后,物块已经移动,下一次策略调用将当前两视角图像交给 TFPNet,并读取上一次的历史特征。 快网络据此更新物块附近的表征,不把旧的物块位置原封不动交给策略。 MVFF 将更新后的几何特征与当前 ResNet 外观特征融合,并用两相机参数约束跨视角关系。 扩散头在视觉条件和机器人状态下生成新的交接动作序列;达到刷新间隔后,慢分支再提供新锚点。 表 1 中此任务在 \(\tau=4\) 时成功率为 95%,但该结果不能单独证明每次交接中的遮挡恢复都来自某一模块。
损失函数 / 训练策略¶
训练分为几何特征预训练与下游模仿学习两步,教师特征监督和动作监督不是同一个损失。 TFPNet 先学习预测 VGGT 特征,随后与 VGGT 一起作为冻结视觉骨干用于策略训练。 策略阶段使用扩散噪声预测目标,让去噪网络学习演示动作分布;缓存中的扩散式 (1)–(2) 有缺项,不复写其损坏表达。 第 4.1 节明确写到此阶段只更新 diffusion head,同时使用“端到端”表述;这不应被解释为 VGGT 和 TFPNet 也参与联合微调。 该段没有单独澄清 ResNet 和 MVFF 的参数归属及是否更新,复现时仍需核实这些模块的优化器设置。
下游训练元组包含 8 帧,相邻取样跨 8 个时间步,而不是原来的 3 个连续观测。 论文将其称为有效 64 帧窗口;严格按采样位置计算,首末观测索引相隔 56 步,两种说法对应不同计数约定。 每个元组第一帧运行 VGGT,后续依次运行 TFPNet,元组内部串行、不同 batch 样本之间并行。 作者报告策略训练 600 epochs,使用 4 张 NVIDIA 4090、Adam、学习率 2e-5、batch size 8;通用 TFPNet 在 8 张 NVIDIA A800 上训练。 涉及 VGGT 输出的部分使用 bfloat16;真实机器人实验采用 DDIM,训练噪声调度为 100 步,采样去噪为 10 步。 这些设置说明部署时的轻量快速分支并不意味着整个训练流程成本低。
实验关键数据¶
主实验¶
下表来自原文表 1,第 10 页,指标均为成功率;每个任务、每个模型在相同环境配置下执行 100 次。 平均值覆盖全部 10 个任务,任务行只摘录 4 个有代表性的例子,不是用这 4 行重新计算平均值。 DP3 使用仿真真值深度及裁剪框,DP3-DA2 使用估计深度,因此两者的输入条件不同。
| 任务 / 汇总 | DP-single | DP-multi | DP3 | DP3-DA2 | R3DP (\(\tau=4\)) | R3DP (\(\tau=8\)) | \(\pi_0\) | \(\pi_{0.5}\) |
|---|---|---|---|---|---|---|---|---|
| Block Handover | 1% | 2% | 48% | 31% | 95% | 93% | 71% | 41% |
| Blocks Stack Easy | 6% | 7% | 26% | 3% | 69% | 62% | 79% | 86% |
| Diverse Bottles Pick | 16% | 17% | 34% | 7% | 31% | 32% | 47% | 66% |
| Tube Insert | 92% | 64% | 97% | 32% | 97% | 97% | 68% | 75% |
| 全部 10 任务平均 | 36.1% | 17.6% | 57.6% | 28.2% | 69.0% | 65.7% | 59.9% | 66.7% |
69.0% 对比 36.1% 和 17.6% 分别增加 32.9 与 51.4 个百分点,不能写成相对提升 32.9% 与 51.4%。 R3DP 平均优于两个 VLA 基线,但在堆叠和多样瓶抓取上并不占优;原文关于“所有任务一致提升”的泛化措辞需结合逐行结果理解。 SpatialVLA 因兼容性问题另在 RoboTwin 2.0 的 4 个任务上比较,表 2 报告 R3DP 63.8%、SpatialVLA 52.8%,不能将它们并入表 1 的十任务排名。
消融实验¶
下表来自原文表 4,第 12 页,是 4 个任务的逐步加模块消融,指标仍为成功率。 最后一列 R3DP 的逐任务结果对应表 1 的 \(\tau=4\) 配置;表内平均值保留作者的一位小数表示。
| 任务 | DP-multi | DP+VGGT | DP+VGGT+MVFF | R3DP |
|---|---|---|---|---|
| Blocks Stack Easy | 7% | 30% | 51% | 69% |
| Block Hammer Beat | 0% | 44% | 74% | 77% |
| Shoe Place | 19% | 55% | 66% | 72% |
| Diverse Bottles Pick | 17% | 30% | 30% | 31% |
| 平均 | 10.8% | 39.8% | 55.3% | 62.3% |
引入 VGGT、再加 MVFF、最后加 AFSC 的平均增益依次为 29.0、15.5 和 7.0 个百分点,均由表中显示值相减得到。 这支持几何先验、显式多视角融合与时序处理都有帮助,但不是全组合因子实验,不能证明三个作用完全独立。 特别是 Diverse Bottles Pick 从 30% 到 30% 再到 31%,说明这些模块并未解决所有任务瓶颈。
原文表 3,第 11 页,在同一组 4 个消融任务上统计延迟;观测编码指原始多视角图像到最终融合特征,不包括后续动作专家。
| 延迟项,ms,越低越好 | DP+VGGT | DP+VGGT+MVFF | R3DP (\(\tau=4\)) | R3DP (\(\tau=8\)) |
|---|---|---|---|---|
| 观测编码 | 73.1 | 78.3 | 50.5 | 40.3 |
| 动作专家 | 56.6 | 57.7 | 55.3 | 56.7 |
从 73.1 ms 到 40.3 ms 是观测编码延迟降低 44.8%,该最低延迟对应 \(\tau=8\),而 69.0% 的最高平均成功率对应 \(\tau=4\)。 动作专家仍需约 56 ms,因此不可把 40.3 ms 宣称为从相机到动作的完整端到端延迟。
关键发现¶
- 真实实验表 5(第 14 页)中,4 任务平均成功率为 DP 30.8%、DP3 48.4%、DP+VGGT+MVFF 66.7%、R3DP 71.7%。双臂任务各用 100 条演示,单臂任务各用 50 条,每任务测试 30 次。
- 同表 RTX 4090 上的 R3DP 观测编码为 62.18 ms,动作专家为 69.78 ms。不能把真实环境编码时间与仿真表 3 的 40.3 ms 混为一个配置。
- 表 6(第 15 页)报告相邻帧 Log Drift:VGGT 为 0.0272,TFPNet 为 0.0066,越低表示尺度越稳定。它衡量将预测深度对齐真值所需的最优尺度因子在相邻帧间的对数变化,不等于绝对深度准确率;缓存式 (14) 的绝对值或其他归约符号不完整,因此不猜补精确公式。
亮点与洞察¶
- 快网络不只是加速器,也显式使用历史信息。消融中它在降低编码开销的同时提高成功率,使“以更便宜的网络替代大模型”变成“以更适合时序任务的表征服务控制”。
- 三维先验与相机标定是互补信息。VGGT 提供可迁移的空间表征,MVFF 再用本机器人已知的成像关系减少跨视角融合的不确定性。
- 刷新间隔是部署层面的调节手段。本文的启发是优先减少昂贵表征的重算频率,但需要同时检查动作质量和完整控制链路,而非只优化单个编码器耗时。
局限与展望¶
- 作者计划扩展到更接触密集、更长时程和强化学习驱动的操作;现有结论主要来自任务级模仿学习,不能直接等同于开放世界通用机器人能力。
- 真实实验只有 4 个任务、每任务 30 次评测,结果表未提供多种子置信区间。读者应谨慎解读小幅差异,尤其是增加一个成功样本即可明显改变百分比的设置。
- 相机内外参必须可靠,快分支也可能在突发遮挡、快速形变或大幅视角变化下累计误差。基于不确定性触发关键帧是读者提出的改进方向,不是论文已经验证的模块。
- 缓存多处公式损坏,注意力方向的图文表述及 MVFF 的优化器归属不够明确。当前材料足以理解方法与核对表格,但不足以无歧义复现全部实现细节。
相关工作与启发¶
- 与 Diffusion Policy 相比:保留动作扩散框架,改进条件视觉表征,因此创新主要落在感知与时序协作,而不是新的动作生成分布。
- 与 DP3 相比:从 RGB 潜在几何特征出发,减少对实际深度质量和点云预处理的依赖;但在仿真真值深度可靠时,DP3 在部分任务仍然很强。
- 与 eVGGT 相比:同样关注几何编码效率,本文进一步把历史特征递推和稀疏教师刷新纳入控制流程,而非仅强调单帧编码器压缩。
- 与 PRoPE 相比:复用完整相机几何的相对位置编码思想,将其用于策略视觉条件的多视角融合;启发在于让已有的可靠几何信息直接参与注意力计算。
评分¶
- 新颖性:4/5。将稀疏几何锚点、递推预测和标定感知融合组合为清晰的策略感知模块,但依赖现有骨干与编码方法。
- 实验充分度:4/5。包含仿真、真实任务、组件消融和时序尺度分析,但真实任务数量与统计不确定性报告有限。
- 写作质量:3/5。整体论证容易跟随,但图文方向、部分训练边界和百分比措辞需要更准确;公式损坏另属于缓存提取问题。
- 价值:4/5。对将高成本几何基础模型接入机器人策略具有实用参考意义,部署评估仍需覆盖完整动作链路。