跳转至

Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction

会议: NeurIPS2026(任务归档;阅读版本为 arXiv v3,2026-09-29)
arXiv: 2605.16981
论文: https://arxiv.org/abs/2605.16981
领域: 3D 视觉
关键词: 流式重建、循环状态、帧级门控、长期漂移、记忆保留

一句话总结

AFG 在冻结的 CUT3R/TTT3R 推理流程中,用相邻帧内部特征的变化生成一个正值帧级写入权重,与 token 门相乘以减少重复帧覆盖历史,在不丢帧、不再训练且保持恒定记忆的条件下将 KITTI 平均 ATE 从 68.54 m 降至 43.96 m,但并非所有序列和误差指标都改善。

研究背景与动机

流式 3D 重建需要一边接收 RGB 图像,一边输出相机位姿、内参和像素对齐的几何。离线全局注意力模型可以同时利用多帧,但难以满足长视频的在线内存约束;CUT3R 则把历史压进固定数量的状态 token,每帧通过双流交叉注意力读取历史并生成写回残差。内存不随序列增长,却不意味着早期几何信息能稳定保留:重复画面也会持续扰动状态,最终表现为轨迹漂移和碎裂点云。

TTT3R 给每个状态 token 一个由交叉注意力 logits 得到的门,调节当前残差写入哪些位置。本文在五个数据集、39 条序列、18.15M 个观测上发现,这个门的中位数为 0.31、最大观测值为 0.558;各序列均值只落在 0.27–0.34。代表性 ScanNet 序列中,所有帧-token 值的标准差为 0.055,而逐帧均值的标准差为 0.024。它能区分同一帧内的状态槽,却较少区分不同帧的信息价值。这里的“结构瓶颈”有统计与机制分析支持,但观测到小于 0.6 不能当作 sigmoid 的数学上界。

经典 SLAM 用关键帧选择限制地图增长,但固定尺寸循环状态不需要通过拒收帧来限制地图大小;真正需要控制的是每帧覆盖历史的力度。重复帧应该仍然产生输出和小幅写入,场景或视角明显变化时才恢复较强写入。核心 idea:保留 TTT3R 的 token 选择性,再用已有特征的相邻帧变化补上帧级写入强度,使有限状态对冗余观察遗忘得更慢,而不是让所有帧等强度地更新。

方法详解

整体框架

输入仍是逐帧 RGB 视频,输出仍是基座的相机位姿、内参和 pointmap。AFG 不替换编码器或解码器:当前帧照常前向计算,从已经生成的编码器全局特征或解码器 pose token 取得新颖性信号,生成标量门,再在最终状态写回处缩放 TTT3R 的残差。除固定尺寸状态外,只需保留上一帧所选特征;不建立随视频增长的帧列表或 KV cache。

两种信号构成两个独立变体:AFG-Img 用图像特征,AFG-Pose 用位姿相关表征。它们不是自动切换的双分支系统,也没有一个已验证的融合策略;部署时选择哪个变体是外部配置。下面的训练节点仅说明检查点来源,虚线不代表本文执行训练或使用真值监督。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    W["既有预训练<br/>CUT3R 检查点"] -.->|冻结;本文不再训练| D["当前帧与旧状态<br/>基座前向计算"]
    I["RGB 视频逐帧输入"] --> D
    D --> N["内部特征新颖性<br/>Img 或 Pose"]
    P["上一帧所选特征"] --> N
    N --> G["正值有界门控"]
    G --> U["因子化状态写回"]
    D -->|残差与 token 门| U
    D --> O["逐帧位姿与几何"]
    U -->|下一帧固定状态| D

关键设计

1. 内部特征新颖性:不增加一次前向计算,也不借用真值运动

AFG-Img 对当前图像编码器的 patch tokens 做空间平均,得到全局特征,再取它与上一帧全局特征的欧氏距离。CUT3R 已把该特征用于 LocalMemory 查询,因而这里复用已有激活,而不是另加光流、特征匹配或新颖性预测器。距离关注画面内容变化;它不读取循环状态,也就没有“状态误差导致门变化”的直接路径。

AFG-Pose 改用最终解码层中用于位姿预测的首行状态表征,取相邻帧 pose token 的欧氏距离。这里的 token 不是输出相机平移,也不是由真值位姿计算的旋转角;它是基座当前前向产生的位姿相关隐表征,在写回处应用门之前即可使用。因此,虽然后文将状态更新解释成测试时学习,实际没有额外优化循环。

Pose 信号包含当前图像和旧状态的共同影响,可能同时反映几何变化和模型自身不稳定。附录只在 TUM walking_xyz 上作针对性检查:门与真值相邻旋转的 Spearman 相关为 +0.50,与对齐后位姿误差的相关为 −0.12。这支持该序列中门更多跟随运动,但不能证明所有场景都不存在状态耦合。Img 避开该耦合,Pose 则可能更敏感地响应运动;这是两变体互补的原因,不是自动识别运动类型的保证。

2. 正值有界门控:把新颖性变成连续写入力度,而不是关键帧开关

两种变体都把特征距离送入同一个 sigmoid 形式,只使用不同尺度常数。以所选内部特征 \(f_t\) 表示 Img 的全局特征或 Pose 的 pose token,原文机制可统一写为:

\[ \alpha_t=\sigma\!\left(\kappa\left(\|f_t-f_{t-1}\|_2-\tau\right)\right),\qquad (\kappa,\tau)= \begin{cases} (1,1.5),&\text{AFG-Img},\\ (3,1.0),&\text{AFG-Pose}. \end{cases} \]

\(\tau\) 是 sigmoid 中心:距离恰好达到它时,门为 0.5;\(\kappa\) 决定响应陡峭程度。这些是手设常数,不是可学习参数,全文实验使用同一组默认值而不按场景调节。距离趋大时门趋近 1,含义是恢复原 TTT3R 的写入力度,而不是把 novel frame 放大到基线以上。

因为欧氏距离非负,零变化时门仍至少为 \(\sigma(-\kappa\tau)\):Img 约 0.18,Pose 约 0.047。对于有限输入,sigmoid 严格小于 1;论文用 \((0,1]\) 表示其有界取值范围。正下界保证 AFG 不因帧级门为零而拒收某帧,但不意味着每帧在每个 token 上都一定有非零残差。

这一差别决定了它不是丢帧算法。所有图像仍被编码、解码并评估;只改变随后保存给下一帧的状态。相邻帧差异被低估时,当前帧仍能弱写入,并可能在后续观察中继续积累证据。原文对首帧缺少前驱特征时的初始化处理没有给出明确规则,不能据此补写一个作者未说明的实现细节。

有界性还限制了冻结检查点的更新尺度。附录把新颖帧的上限提高到 2 或 5,KITTI 平均 ATE 分别变成 55.88 和 97.71 m,默认上限为 1 时为 43.96 m。室内某些深度、旋转指标反而受益,所以这是稳健部署选择,不是“放大永远有害”的普遍结论。单次写入不超过 TTT3R,也不等于最终轨迹误差不会超过 TTT3R。

3. 因子化状态写回:帧门管力度,token 门管空间选择

TTT3R 从多层、多头及图像 tokens 的交叉注意力 logits 平均值中生成 token 门 \(\beta_t\),对各状态槽分别缩放残差。AFG 不另造一个 token 选择器,而是给同一帧所有槽再乘上标量 \(\alpha_t\)。核心更新式为:

\[ S_t=S_{t-1}+\alpha_t\,\beta_t\odot\Delta S_t. \]

\(\Delta S_t\) 是基座当前帧前向得到的候选状态减去旧状态,\(\odot\) 表示对状态 token 的逐项缩放。帧门小,整个帧对持久状态的影响都减弱;帧门大,仍由 token 门决定写到哪些槽。计算门只需相邻特征向量及固定维度状态,新增存储不随序列长度增长。“零额外前向”也不是“零算术开销”:均值、距离、sigmoid 和乘法仍需执行,原文没有给出单独的延迟测量。

作者把更新写成旧状态与候选状态的凸组合,用指数移动平均(EMA)解释记忆视野。若把候选写入当作独立输入,并将有效门近似视为恒定,旧状态项经过 \(k\) 步的显式系数为 \((1-\alpha\beta)^k\)。在这个标量化解释下,达到 \(1/e\) 的滞后及其小门近似是:

\[ H_{1/e}=-\frac{1}{\log(1-\alpha\beta)} \;\approx\;\frac{1}{\alpha\beta}. \]

上式精确滞后是对论文几何衰减表达的条件性展开,不是作者对完整网络给出的记忆定理。真实候选状态和门都依赖此前状态,信息可能经非线性路径重新进入候选;因此,不能把显式 EMA 系数直接等同于整个重建器真实信息影响的消失速度。特别是 \(\beta\approx0.31\) 并非很小,论文的约 3 帧采用 \(1/\beta\) 近似,而非精确滞后。

冗余段中 Pose 门约 0.048,使近似有效步长显著缩小。附录测得 \(\bar\beta=0.352\),于是作者报告视野约 60 帧,并以独立漂移衰减测量的约 64 帧作机制支持;代入上述倒数近似实际约为 59.2 帧。该结果针对人为重复输入,不代表所有自然视频都获得固定 60 帧记忆,更不代表无限保留完整历史。

一个完整示例

考虑附录 A1 的输入:先送入 TUM walking_xyz 的前 500 帧,再把第 499 帧复制 100 次,真值相机保持静止。这段重复观察仍逐帧前向计算、输出位姿,并非跳过计算或减少评估点。

TTT3R 的平均 token 门在重复段仍约为 0.352;仅靠残差自然缩小,状态更新范数仍约为 0.31。Img 的相邻编码器特征不变,使帧门落到约 0.18;Pose 信号随循环状态仍可能有小幅变化,但实测门接近 0.048,更新范数降至 0.043。它保护的是进入重复段前的状态,而不是找到一个新地图关键帧。

重复段中,原文报告 TTT3R 的位置漂移约 9 cm、AFG-Pose 低于 0.5 cm,并称约 18 倍下降。这是单序列受控实验,不是全基准平均提升;“低于 0.5 cm”本身也不足以精确复算一个等号成立的 18 倍比值。

损失函数 / 训练策略

AFG 没有新增损失、训练样本、可学习参数或微调。全部实验在同一个冻结 CUT3R 检查点上叠加 TTT3R 与 AFG,使用单张 NVIDIA A100 80 GB。这里的测试时学习是状态写回的解释,不能写成推理阶段对检查点权重再训练。

实验关键数据

主实验

相机轨迹使用 Sim(3) Umeyama 对齐,ATE 为对齐后绝对轨迹误差,越低越好。Bonn 主实验为 metric alignment,不补偿逐帧尺度与偏移;AbsRel 是相对深度绝对误差,越低越好。下表选取原文 Table 1、附录 Tables 11、12、14 的结果;不同数据集的数值不宜直接横向排序。

评估条件 / 指标 TTT3R TTSA3R MeMix AFG-Img AFG-Pose
TUM,1000 帧,ATE (m) 0.109 0.093 0.101 0.084 0.054
ScanNet,100 帧,ATE (m) 0.072 0.063 0.075 0.071 0.084
ScanNet,500 帧,ATE (m) 0.278 0.259 0.261 0.212 0.250
ScanNet,1000 帧,ATE (m) 0.405 0.388 0.367 0.282 0.281
Bonn,500 帧,AbsRel 0.0997 0.0942 0.1009 0.0970 0.0863
KITTI,11 序列均值,ATE (m) 68.54 未报告 未报告 56.60 43.96

KITTI 的 LongStream 和 Keyframe-VO 平均 ATE 分别为 51.90 和 87.00 m;基线数字取自各自论文,不是同一实验中全部重跑。AFG-Pose 相对 TTT3R 的平均下降为 35.9%,但序列 04 从 4.51 升到 6.49 m,05 从 31.62 升到 35.16 m,07 从 12.00 升到 17.44 m,10 也从 29.82 升到 31.09 m。

三维重建使用每两帧取一帧的稀疏采样。以下只保留附录 Table 18 的 500 帧均值:Acc 为重建精度误差,Comp 为完整度误差,均越低越好;NC 为法向一致性,越高越好。稀疏采样是评估输入协议,不是 AFG 的帧拒收机制。

数据集,500 帧 方法 Acc Comp NC
7-Scenes-S TTT3R 0.065 0.031 0.550
7-Scenes-S TTSA3R 0.044 0.024 0.557
7-Scenes-S AFG-Pose 0.031 0.022 0.558
7-Scenes-S AFG-Img 0.024 0.021 0.554
NRGBD-S TTT3R 0.166 0.087 0.588
NRGBD-S TTSA3R 0.121 0.049 0.604
NRGBD-S AFG-Pose 0.101 0.033 0.611
NRGBD-S AFG-Img 0.092 0.027 0.614

Img 在重建误差上更强,但并非所有指标最优:7-Scenes 的 NC 为 0.554,低于 TTSA3R 的 0.557 和 Pose 的 0.558。VGGT 在该协议的 300/400/500 帧均 OOM;这不等于所有全局模型在所有硬件和设置都无法运行。

消融实验

原文 Table 2:TUM 位姿为 1000 帧,Bonn 深度为 500 帧。RPEr 是局部相对旋转误差,越低越好;深度 \(\delta<1.25\) 是预测与真值深度比值及其倒数的较大者小于 1.25 的像素百分比,越高越好。“未测”不是零。

配置 TUM ATE TUM RPEr Bonn AbsRel Bonn \(\delta<1.25\) (%)
TTT3R,无帧门 0.109 0.443 0.100 92.1
固定帧门 0.1 0.082 1.849 0.089 未测
固定帧门 0.3 0.066 0.854 0.095 93.2
固定帧门 0.7 0.093 0.429 0.100 92.3
每第 3 帧写状态,仍逐帧评估 0.066 0.648 0.098 92.7
只有自适应帧门,不用 token 门 0.063 0.376 0.085 95.1
AFG-Pose,帧门与 token 门 0.054 0.520 0.086 94.7

自适应门相对最佳常数门的 ATE 从 0.066 降到 0.054,但不能宣称所有指标同时更优。加 token 门进一步改善 ATE,却使仅帧门方案的旋转和深度略退化。附录阈值扫描中,Pose 的 \(\tau=0.5\) 可得到 ATE 0.064、RPEr 0.376,说明默认点更偏向低长期漂移而非最佳局部旋转。

关键发现

  • TUM 长度不小于 600 帧的报告平均 ATE 降幅为 51%;Bonn 全部测试长度的平均 AbsRel 降幅为 13.0%。它们不是每条序列或每个长度的统一降幅。
  • 固定减少写入也有帮助,但内容依赖写入仍更强。附录 A4 中,二值门低值设为 0 时,TUM ATE/RPEr 为 0.061/0.880;低值设为 0.05 时为 0.052/0.647;连续门为 0.054/0.520。连续门不是每个单指标都胜过二值门。
  • 输入先按 stride 3 下采样后,TUM 的 AFG-Pose 反而比 TTT3R 差:ATE 0.0650 对 0.0604,RPEr 1.137 对 0.934。减少输入帧与减少状态写入不可混称。
  • 原文称 ScanNet 在 \(L\geq300\) 时 Img 最好,但 Table 12 的 1000 帧为 Pose 0.281、Img 0.282;应保留这处细小排序冲突,不改写表中数字。
  • 原文称阈值增大“逐渐改善 ATE”,但 Table 4 从 \(\tau=1.25\) 的 0.051 回升到 \(\tau=1.5\) 的 0.058;它只是总体有益,非严格单调。

亮点与洞察

  • 把空间选择和时间力度分开。 token 门回答当前信息写进哪些槽,帧门回答这一帧值得写多重。这个分解比继续在同一个 token 轴上加掩码更直接地针对重复观察。
  • 弱写入是关键帧思想的另一种落点。 关键帧新颖性不一定必须用于减少计算,也可以用于保护固定记忆。正值连续门保留了被低估观察的后续作用,但不提供无损恢复保证。
  • 受控重复输入比只看长视频曲线更有解释力。 静止真值下仍出现漂移,说明问题不仅是相机运动难。它支持冗余写入的机制解释,但不能替代跨场景的因果验证。

局限与展望

  • 持续新颖内容仍会占满有限状态;AFG 不增加容量,也没有回环闭合或全局地图优化。恒定记忆是存储复杂度性质,不是完整历史信息保留的保证。
  • 默认 Pose 降低 ATE 却提高 TUM RPEr:0.520 对 0.443。KITTI 多条序列退化,说明写入保护对短期精细旋转或部分运动模式会有成本。
  • 相邻特征距离不是显式几何新信息;光照变化、动态物体或状态误差都可能干扰它。Pose 的耦合证据只来自一个序列,未来应测试更广泛的失败场景。
  • Img/Pose 没有经验证的自动选择策略。OR、乘积和加权融合没有严格超过最优单门,不能把两种变体写成一个自适应切换模型。
  • EMA 视野是条件性诊断,原文把它称为更新规则的精确性质,但完整非线性状态依赖未被该近似覆盖。附录 A1 的约 60/64 帧也不能推出通用记忆时长。
  • 原文声明阈值扫描“所有配置优于 TTT3R”,只对 ATE/AbsRel成立;默认及更高阈值的 RPEr 并不成立。保留此指标边界,也不以单步更新上限推导最终误差安全界。

相关工作与启发

  • vs CUT3R / TTT3R:CUT3R 提供固定状态基座,TTT3R 用 token 门调节残差;AFG 使用相同冻结检查点,在写回处增加帧标量,不是重训练的新重建网络。
  • vs TTSA3R / MeMix:这些对照主要调节 token 级写入。本文补充帧级轴,但短 ScanNet、短 Bonn 和部分 NC 指标仍可能由其他方法更优;MeMix 叠加 TTT3R 与叠加 TTSA3R 的结果也应区分。
  • vs Keyframe-VO / 经典 SLAM:前者学习离散接收/跳过策略,后者选择进入地图的关键帧;AFG 从已有激活闭式算连续权重,所有输入仍被处理。它共享新颖性信号,却不共享地图管理和计算节省功能。
  • vs LongStream:原文将其列为重训练长序列模型;AFG 的训练成本较低且保持固定状态,但 KITTI 优势来自对齐后平均 ATE,不代表原始尺度漂移或所有序列全面胜出。
  • 研究启发:可将帧级软写入用于其他固定记忆在线模型,并分别测量冗余、持续新颖和噪声变化的响应。这是迁移方向,不是本文已经验证的跨任务结果。

评分

  • 新颖性: 4/5。帧级与 token 级因子化切入明确,但门函数本身很简单,受关键帧思想启发。
  • 实验充分度: 4/5。六个基准、多种消融和受控重复探针覆盖较广,缺少完整网络记忆证明及独立延迟测量。
  • 写作质量: 3/5。主线清晰,但精确视野措辞、ScanNet 排序和阈值单调性存在需要保留的边界或冲突。
  • 价值: 4/5。冻结基座的低成本长流改造很实用,但默认旋转退化和部分轨迹损失限制了直接泛用。