Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction¶
会议: NeurIPS2026(任务归档;阅读版本为 arXiv v3,2026-09-29)
arXiv: 2605.16981
论文: https://arxiv.org/abs/2605.16981
领域: 3D 视觉
关键词: 流式重建、循环状态、帧级门控、长期漂移、记忆保留
一句话总结¶
AFG 在冻结的 CUT3R/TTT3R 推理流程中,用相邻帧内部特征的变化生成一个正值帧级写入权重,与 token 门相乘以减少重复帧覆盖历史,在不丢帧、不再训练且保持恒定记忆的条件下将 KITTI 平均 ATE 从 68.54 m 降至 43.96 m,但并非所有序列和误差指标都改善。
研究背景与动机¶
流式 3D 重建需要一边接收 RGB 图像,一边输出相机位姿、内参和像素对齐的几何。离线全局注意力模型可以同时利用多帧,但难以满足长视频的在线内存约束;CUT3R 则把历史压进固定数量的状态 token,每帧通过双流交叉注意力读取历史并生成写回残差。内存不随序列增长,却不意味着早期几何信息能稳定保留:重复画面也会持续扰动状态,最终表现为轨迹漂移和碎裂点云。
TTT3R 给每个状态 token 一个由交叉注意力 logits 得到的门,调节当前残差写入哪些位置。本文在五个数据集、39 条序列、18.15M 个观测上发现,这个门的中位数为 0.31、最大观测值为 0.558;各序列均值只落在 0.27–0.34。代表性 ScanNet 序列中,所有帧-token 值的标准差为 0.055,而逐帧均值的标准差为 0.024。它能区分同一帧内的状态槽,却较少区分不同帧的信息价值。这里的“结构瓶颈”有统计与机制分析支持,但观测到小于 0.6 不能当作 sigmoid 的数学上界。
经典 SLAM 用关键帧选择限制地图增长,但固定尺寸循环状态不需要通过拒收帧来限制地图大小;真正需要控制的是每帧覆盖历史的力度。重复帧应该仍然产生输出和小幅写入,场景或视角明显变化时才恢复较强写入。核心 idea:保留 TTT3R 的 token 选择性,再用已有特征的相邻帧变化补上帧级写入强度,使有限状态对冗余观察遗忘得更慢,而不是让所有帧等强度地更新。
方法详解¶
整体框架¶
输入仍是逐帧 RGB 视频,输出仍是基座的相机位姿、内参和 pointmap。AFG 不替换编码器或解码器:当前帧照常前向计算,从已经生成的编码器全局特征或解码器 pose token 取得新颖性信号,生成标量门,再在最终状态写回处缩放 TTT3R 的残差。除固定尺寸状态外,只需保留上一帧所选特征;不建立随视频增长的帧列表或 KV cache。
两种信号构成两个独立变体:AFG-Img 用图像特征,AFG-Pose 用位姿相关表征。它们不是自动切换的双分支系统,也没有一个已验证的融合策略;部署时选择哪个变体是外部配置。下面的训练节点仅说明检查点来源,虚线不代表本文执行训练或使用真值监督。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
W["既有预训练<br/>CUT3R 检查点"] -.->|冻结;本文不再训练| D["当前帧与旧状态<br/>基座前向计算"]
I["RGB 视频逐帧输入"] --> D
D --> N["内部特征新颖性<br/>Img 或 Pose"]
P["上一帧所选特征"] --> N
N --> G["正值有界门控"]
G --> U["因子化状态写回"]
D -->|残差与 token 门| U
D --> O["逐帧位姿与几何"]
U -->|下一帧固定状态| D
关键设计¶
1. 内部特征新颖性:不增加一次前向计算,也不借用真值运动
AFG-Img 对当前图像编码器的 patch tokens 做空间平均,得到全局特征,再取它与上一帧全局特征的欧氏距离。CUT3R 已把该特征用于 LocalMemory 查询,因而这里复用已有激活,而不是另加光流、特征匹配或新颖性预测器。距离关注画面内容变化;它不读取循环状态,也就没有“状态误差导致门变化”的直接路径。
AFG-Pose 改用最终解码层中用于位姿预测的首行状态表征,取相邻帧 pose token 的欧氏距离。这里的 token 不是输出相机平移,也不是由真值位姿计算的旋转角;它是基座当前前向产生的位姿相关隐表征,在写回处应用门之前即可使用。因此,虽然后文将状态更新解释成测试时学习,实际没有额外优化循环。
Pose 信号包含当前图像和旧状态的共同影响,可能同时反映几何变化和模型自身不稳定。附录只在 TUM walking_xyz 上作针对性检查:门与真值相邻旋转的 Spearman 相关为 +0.50,与对齐后位姿误差的相关为 −0.12。这支持该序列中门更多跟随运动,但不能证明所有场景都不存在状态耦合。Img 避开该耦合,Pose 则可能更敏感地响应运动;这是两变体互补的原因,不是自动识别运动类型的保证。
2. 正值有界门控:把新颖性变成连续写入力度,而不是关键帧开关
两种变体都把特征距离送入同一个 sigmoid 形式,只使用不同尺度常数。以所选内部特征 \(f_t\) 表示 Img 的全局特征或 Pose 的 pose token,原文机制可统一写为:
\(\tau\) 是 sigmoid 中心:距离恰好达到它时,门为 0.5;\(\kappa\) 决定响应陡峭程度。这些是手设常数,不是可学习参数,全文实验使用同一组默认值而不按场景调节。距离趋大时门趋近 1,含义是恢复原 TTT3R 的写入力度,而不是把 novel frame 放大到基线以上。
因为欧氏距离非负,零变化时门仍至少为 \(\sigma(-\kappa\tau)\):Img 约 0.18,Pose 约 0.047。对于有限输入,sigmoid 严格小于 1;论文用 \((0,1]\) 表示其有界取值范围。正下界保证 AFG 不因帧级门为零而拒收某帧,但不意味着每帧在每个 token 上都一定有非零残差。
这一差别决定了它不是丢帧算法。所有图像仍被编码、解码并评估;只改变随后保存给下一帧的状态。相邻帧差异被低估时,当前帧仍能弱写入,并可能在后续观察中继续积累证据。原文对首帧缺少前驱特征时的初始化处理没有给出明确规则,不能据此补写一个作者未说明的实现细节。
有界性还限制了冻结检查点的更新尺度。附录把新颖帧的上限提高到 2 或 5,KITTI 平均 ATE 分别变成 55.88 和 97.71 m,默认上限为 1 时为 43.96 m。室内某些深度、旋转指标反而受益,所以这是稳健部署选择,不是“放大永远有害”的普遍结论。单次写入不超过 TTT3R,也不等于最终轨迹误差不会超过 TTT3R。
3. 因子化状态写回:帧门管力度,token 门管空间选择
TTT3R 从多层、多头及图像 tokens 的交叉注意力 logits 平均值中生成 token 门 \(\beta_t\),对各状态槽分别缩放残差。AFG 不另造一个 token 选择器,而是给同一帧所有槽再乘上标量 \(\alpha_t\)。核心更新式为:
\(\Delta S_t\) 是基座当前帧前向得到的候选状态减去旧状态,\(\odot\) 表示对状态 token 的逐项缩放。帧门小,整个帧对持久状态的影响都减弱;帧门大,仍由 token 门决定写到哪些槽。计算门只需相邻特征向量及固定维度状态,新增存储不随序列长度增长。“零额外前向”也不是“零算术开销”:均值、距离、sigmoid 和乘法仍需执行,原文没有给出单独的延迟测量。
作者把更新写成旧状态与候选状态的凸组合,用指数移动平均(EMA)解释记忆视野。若把候选写入当作独立输入,并将有效门近似视为恒定,旧状态项经过 \(k\) 步的显式系数为 \((1-\alpha\beta)^k\)。在这个标量化解释下,达到 \(1/e\) 的滞后及其小门近似是:
上式精确滞后是对论文几何衰减表达的条件性展开,不是作者对完整网络给出的记忆定理。真实候选状态和门都依赖此前状态,信息可能经非线性路径重新进入候选;因此,不能把显式 EMA 系数直接等同于整个重建器真实信息影响的消失速度。特别是 \(\beta\approx0.31\) 并非很小,论文的约 3 帧采用 \(1/\beta\) 近似,而非精确滞后。
冗余段中 Pose 门约 0.048,使近似有效步长显著缩小。附录测得 \(\bar\beta=0.352\),于是作者报告视野约 60 帧,并以独立漂移衰减测量的约 64 帧作机制支持;代入上述倒数近似实际约为 59.2 帧。该结果针对人为重复输入,不代表所有自然视频都获得固定 60 帧记忆,更不代表无限保留完整历史。
一个完整示例¶
考虑附录 A1 的输入:先送入 TUM walking_xyz 的前 500 帧,再把第 499 帧复制 100 次,真值相机保持静止。这段重复观察仍逐帧前向计算、输出位姿,并非跳过计算或减少评估点。
TTT3R 的平均 token 门在重复段仍约为 0.352;仅靠残差自然缩小,状态更新范数仍约为 0.31。Img 的相邻编码器特征不变,使帧门落到约 0.18;Pose 信号随循环状态仍可能有小幅变化,但实测门接近 0.048,更新范数降至 0.043。它保护的是进入重复段前的状态,而不是找到一个新地图关键帧。
重复段中,原文报告 TTT3R 的位置漂移约 9 cm、AFG-Pose 低于 0.5 cm,并称约 18 倍下降。这是单序列受控实验,不是全基准平均提升;“低于 0.5 cm”本身也不足以精确复算一个等号成立的 18 倍比值。
损失函数 / 训练策略¶
AFG 没有新增损失、训练样本、可学习参数或微调。全部实验在同一个冻结 CUT3R 检查点上叠加 TTT3R 与 AFG,使用单张 NVIDIA A100 80 GB。这里的测试时学习是状态写回的解释,不能写成推理阶段对检查点权重再训练。
实验关键数据¶
主实验¶
相机轨迹使用 Sim(3) Umeyama 对齐,ATE 为对齐后绝对轨迹误差,越低越好。Bonn 主实验为 metric alignment,不补偿逐帧尺度与偏移;AbsRel 是相对深度绝对误差,越低越好。下表选取原文 Table 1、附录 Tables 11、12、14 的结果;不同数据集的数值不宜直接横向排序。
| 评估条件 / 指标 | TTT3R | TTSA3R | MeMix | AFG-Img | AFG-Pose |
|---|---|---|---|---|---|
| TUM,1000 帧,ATE (m) | 0.109 | 0.093 | 0.101 | 0.084 | 0.054 |
| ScanNet,100 帧,ATE (m) | 0.072 | 0.063 | 0.075 | 0.071 | 0.084 |
| ScanNet,500 帧,ATE (m) | 0.278 | 0.259 | 0.261 | 0.212 | 0.250 |
| ScanNet,1000 帧,ATE (m) | 0.405 | 0.388 | 0.367 | 0.282 | 0.281 |
| Bonn,500 帧,AbsRel | 0.0997 | 0.0942 | 0.1009 | 0.0970 | 0.0863 |
| KITTI,11 序列均值,ATE (m) | 68.54 | 未报告 | 未报告 | 56.60 | 43.96 |
KITTI 的 LongStream 和 Keyframe-VO 平均 ATE 分别为 51.90 和 87.00 m;基线数字取自各自论文,不是同一实验中全部重跑。AFG-Pose 相对 TTT3R 的平均下降为 35.9%,但序列 04 从 4.51 升到 6.49 m,05 从 31.62 升到 35.16 m,07 从 12.00 升到 17.44 m,10 也从 29.82 升到 31.09 m。
三维重建使用每两帧取一帧的稀疏采样。以下只保留附录 Table 18 的 500 帧均值:Acc 为重建精度误差,Comp 为完整度误差,均越低越好;NC 为法向一致性,越高越好。稀疏采样是评估输入协议,不是 AFG 的帧拒收机制。
| 数据集,500 帧 | 方法 | Acc | Comp | NC |
|---|---|---|---|---|
| 7-Scenes-S | TTT3R | 0.065 | 0.031 | 0.550 |
| 7-Scenes-S | TTSA3R | 0.044 | 0.024 | 0.557 |
| 7-Scenes-S | AFG-Pose | 0.031 | 0.022 | 0.558 |
| 7-Scenes-S | AFG-Img | 0.024 | 0.021 | 0.554 |
| NRGBD-S | TTT3R | 0.166 | 0.087 | 0.588 |
| NRGBD-S | TTSA3R | 0.121 | 0.049 | 0.604 |
| NRGBD-S | AFG-Pose | 0.101 | 0.033 | 0.611 |
| NRGBD-S | AFG-Img | 0.092 | 0.027 | 0.614 |
Img 在重建误差上更强,但并非所有指标最优:7-Scenes 的 NC 为 0.554,低于 TTSA3R 的 0.557 和 Pose 的 0.558。VGGT 在该协议的 300/400/500 帧均 OOM;这不等于所有全局模型在所有硬件和设置都无法运行。
消融实验¶
原文 Table 2:TUM 位姿为 1000 帧,Bonn 深度为 500 帧。RPEr 是局部相对旋转误差,越低越好;深度 \(\delta<1.25\) 是预测与真值深度比值及其倒数的较大者小于 1.25 的像素百分比,越高越好。“未测”不是零。
| 配置 | TUM ATE | TUM RPEr | Bonn AbsRel | Bonn \(\delta<1.25\) (%) |
|---|---|---|---|---|
| TTT3R,无帧门 | 0.109 | 0.443 | 0.100 | 92.1 |
| 固定帧门 0.1 | 0.082 | 1.849 | 0.089 | 未测 |
| 固定帧门 0.3 | 0.066 | 0.854 | 0.095 | 93.2 |
| 固定帧门 0.7 | 0.093 | 0.429 | 0.100 | 92.3 |
| 每第 3 帧写状态,仍逐帧评估 | 0.066 | 0.648 | 0.098 | 92.7 |
| 只有自适应帧门,不用 token 门 | 0.063 | 0.376 | 0.085 | 95.1 |
| AFG-Pose,帧门与 token 门 | 0.054 | 0.520 | 0.086 | 94.7 |
自适应门相对最佳常数门的 ATE 从 0.066 降到 0.054,但不能宣称所有指标同时更优。加 token 门进一步改善 ATE,却使仅帧门方案的旋转和深度略退化。附录阈值扫描中,Pose 的 \(\tau=0.5\) 可得到 ATE 0.064、RPEr 0.376,说明默认点更偏向低长期漂移而非最佳局部旋转。
关键发现¶
- TUM 长度不小于 600 帧的报告平均 ATE 降幅为 51%;Bonn 全部测试长度的平均 AbsRel 降幅为 13.0%。它们不是每条序列或每个长度的统一降幅。
- 固定减少写入也有帮助,但内容依赖写入仍更强。附录 A4 中,二值门低值设为 0 时,TUM ATE/RPEr 为 0.061/0.880;低值设为 0.05 时为 0.052/0.647;连续门为 0.054/0.520。连续门不是每个单指标都胜过二值门。
- 输入先按 stride 3 下采样后,TUM 的 AFG-Pose 反而比 TTT3R 差:ATE 0.0650 对 0.0604,RPEr 1.137 对 0.934。减少输入帧与减少状态写入不可混称。
- 原文称 ScanNet 在 \(L\geq300\) 时 Img 最好,但 Table 12 的 1000 帧为 Pose 0.281、Img 0.282;应保留这处细小排序冲突,不改写表中数字。
- 原文称阈值增大“逐渐改善 ATE”,但 Table 4 从 \(\tau=1.25\) 的 0.051 回升到 \(\tau=1.5\) 的 0.058;它只是总体有益,非严格单调。
亮点与洞察¶
- 把空间选择和时间力度分开。 token 门回答当前信息写进哪些槽,帧门回答这一帧值得写多重。这个分解比继续在同一个 token 轴上加掩码更直接地针对重复观察。
- 弱写入是关键帧思想的另一种落点。 关键帧新颖性不一定必须用于减少计算,也可以用于保护固定记忆。正值连续门保留了被低估观察的后续作用,但不提供无损恢复保证。
- 受控重复输入比只看长视频曲线更有解释力。 静止真值下仍出现漂移,说明问题不仅是相机运动难。它支持冗余写入的机制解释,但不能替代跨场景的因果验证。
局限与展望¶
- 持续新颖内容仍会占满有限状态;AFG 不增加容量,也没有回环闭合或全局地图优化。恒定记忆是存储复杂度性质,不是完整历史信息保留的保证。
- 默认 Pose 降低 ATE 却提高 TUM RPEr:0.520 对 0.443。KITTI 多条序列退化,说明写入保护对短期精细旋转或部分运动模式会有成本。
- 相邻特征距离不是显式几何新信息;光照变化、动态物体或状态误差都可能干扰它。Pose 的耦合证据只来自一个序列,未来应测试更广泛的失败场景。
- Img/Pose 没有经验证的自动选择策略。OR、乘积和加权融合没有严格超过最优单门,不能把两种变体写成一个自适应切换模型。
- EMA 视野是条件性诊断,原文把它称为更新规则的精确性质,但完整非线性状态依赖未被该近似覆盖。附录 A1 的约 60/64 帧也不能推出通用记忆时长。
- 原文声明阈值扫描“所有配置优于 TTT3R”,只对 ATE/AbsRel成立;默认及更高阈值的 RPEr 并不成立。保留此指标边界,也不以单步更新上限推导最终误差安全界。
相关工作与启发¶
- vs CUT3R / TTT3R:CUT3R 提供固定状态基座,TTT3R 用 token 门调节残差;AFG 使用相同冻结检查点,在写回处增加帧标量,不是重训练的新重建网络。
- vs TTSA3R / MeMix:这些对照主要调节 token 级写入。本文补充帧级轴,但短 ScanNet、短 Bonn 和部分 NC 指标仍可能由其他方法更优;MeMix 叠加 TTT3R 与叠加 TTSA3R 的结果也应区分。
- vs Keyframe-VO / 经典 SLAM:前者学习离散接收/跳过策略,后者选择进入地图的关键帧;AFG 从已有激活闭式算连续权重,所有输入仍被处理。它共享新颖性信号,却不共享地图管理和计算节省功能。
- vs LongStream:原文将其列为重训练长序列模型;AFG 的训练成本较低且保持固定状态,但 KITTI 优势来自对齐后平均 ATE,不代表原始尺度漂移或所有序列全面胜出。
- 研究启发:可将帧级软写入用于其他固定记忆在线模型,并分别测量冗余、持续新颖和噪声变化的响应。这是迁移方向,不是本文已经验证的跨任务结果。
评分¶
- 新颖性: 4/5。帧级与 token 级因子化切入明确,但门函数本身很简单,受关键帧思想启发。
- 实验充分度: 4/5。六个基准、多种消融和受控重复探针覆盖较广,缺少完整网络记忆证明及独立延迟测量。
- 写作质量: 3/5。主线清晰,但精确视野措辞、ScanNet 排序和阈值单调性存在需要保留的边界或冲突。
- 价值: 4/5。冻结基座的低成本长流改造很实用,但默认旋转退化和部分轨迹损失限制了直接泛用。