跳转至

REON-NVS: Real-Time Online Novel-View Synthesis from Sparse-View Videos

会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 在线新视角合成、动态场景重建、状态空间模型、隐式位姿估计、稀疏视角视频

一句话总结

针对稀疏视角流式视频动态新视角合成计算慢、依赖繁琐相机位姿优化与大量视角的瓶颈,REON-NVS 提出了首个纯前向在线 NVS 框架,通过自监督隐式位姿预测、参考尺度位姿映射,以及基于双向 Mamba2 状态空间模型(Bi-SSM)的时序记忆融合与视图精炼模块,在单张 A100 GPU 上实现无需迭代优化、超 30 FPS(32 FPS)的实时自由视角渲染。

研究背景与动机

从多视角视频流中在线重建动态 3D 场景并实时合成任意新视角,是自由视点视频(Free-Viewpoint Video)、增强现实(AR)与虚拟现实(VR)实时交互体验的核心基石。随着 NeRF 与 3D 高斯泼溅(3DGS)的兴起,静态与离线动态场景的新视角合成取得了令人瞩目的图像保真度。然而,主流动态重建方案大多属于离线优化范式,必须在整段视频录制完成后耗费数十分钟甚至数小时进行离线迭代优化,完全无法支持如直播流分发、远程全息会议等需要随帧到达、即插即用的在线交互场景。

为此,近期以 3DGStream、HiCoM 以及 IGS 为代表的流式在线方法尝试引入增量更新机制,试图在视频流输入时逐帧微调场景高斯表示。然而这类方法在稀疏视角的实际流式应用中依然深陷两大核心瓶颈:其一,它们极度依赖密集的输入视点(通常需要十几个以上视点)来维持 3D 表征的几何稳定性,在只有 2-3 个摄像头的极端稀疏视角下极易发散崩溃;其二,由于其底层仍包含逐帧的迭代梯度优化,每帧处理速度往往仅在零点几到几 FPS,严重落后于标准 30 FPS 的帧率要求,导致渲染延迟随时间无限累积。此外,这些方法必须前置运行 COLMAP 等高耗时的外置运动恢复结构(SfM)位姿求解流程,使得“在线端到端处理”在现实场景中沦为空谈。

本文的切入视角在于:既然显式 3D 几何构建与迭代位姿求解是阻碍流式实时的罪魁祸首,那么是否可以直接构建一个从像素到像素的端到端纯前向网络?本文的核心 idea 是:完全摒弃迭代位姿与显式几何优化,构建一个集“自监督前向隐式位姿估计”、“参考锚定位姿映射”与“Bi-SSM 时序状态传播重建”于一体的端到端纯前向在线 NVS 框架,以线性的计算复杂度维持跨帧长程记忆,实现真正的无累积延迟与 32 FPS 实时流式渲染。

方法详解

整体框架

REON-NVS 的推理流程完全遵循流式单向时间推进。在每个时间步 \(t\),系统接收极稀疏的多视角视频帧 \(\{I_t^k\}_{k=1}^n\)(实验中默认为 \(n=2\) 个稀疏视点)以及用户交互指定的物理目标相机位姿 \(p_t^T\)。系统端到端执行两阶段处理:首先,轻量化前向位姿估计器直接根据当前输入帧与初始帧预测 9 维隐式位姿,并由位姿映射器将物理控制位姿映射至该隐式空间;随后,场景重建器将多视角输入像素与其 Plücker 射线编码切块打平,先由基于 Mamba2 的双向时序历史融合模块(History Fusion)通过隐状态记忆整合历史时序上下文生成粗糙目标帧,再由混合架构的视图精炼模块(View Refinement)恢复高频边缘纹理,最终单向输出高质量目标视角图像 \(I_t^T\)

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入流式多视角帧及目标位姿<br/>{I_t^k} 及物理位姿 p_t^T"] --> B["前向自监督隐式位姿估计<br/>预测当前帧与初始参考帧相对 9D 隐式位姿"]
    B --> C["参考锚定位姿空间映射<br/>解耦尺度模糊并映射物理目标位姿至隐式空间"]
    C --> D["双向状态空间时序历史融合<br/>Bi-SSM 隐状态跨步递推生成粗糙目标帧 I_t^H"]
    D --> E["混合架构无时序视图精炼<br/>结合当前输入帧与粗糙预测恢复高频纹理细节"]
    E --> F["输出高保真目标新视角视频帧 I_t^T<br/>端到端纯前向推理 (32 FPS)"]

关键设计

1. 前向自监督隐式位姿估计:摆脱传统外置 SfM 与有监督退化瓶颈

传统在线方法依赖 COLMAP 等离线 SfM 算法提前标定位姿,这在移动摄像头或不可控直播流中根本不可行。而直接训练回归网络拟合真实物理位姿(如微调 SE(3) 矩阵)往往因位姿参数流形的非欧几何限制以及训练标签中存在的噪点而表现不稳定。REON-NVS 借鉴了 RayZer 的自监督设计思想,将首帧图像 \(I_0^1\) 设为规范参考帧 \(I_r\)(定义其旋转为单位矩阵、平移为零)。对于任意时间步 \(t\) 的输入视点帧 \(I_t^k\),轻量卷积前向位姿预测网络 \(\mathcal{P}\) 单次推断即可输出相对于 \(I_r\) 的 9 维隐式位姿向量: $$ \tilde{p}_t^k = \mathcal{P}(I_t^k, I_r) $$ 该隐式位姿包含 3 维平移与 6 维连续旋转表征。模型在训练阶段完全不施加任何物理真实位姿的损失函数监督,而是通过后续新视角重投影的 RGB 重建误差驱动网络自发涌现出一个紧凑连续的隐式位姿流形。该设计既消除了每帧昂贵的数值优化,又避免了外部标注噪声导致的姿态崩塌。

2. 参考锚定位姿空间映射:化解隐式空间与物理控制的尺度模糊

自监督隐式位姿虽然推断极快,但其潜空间不具备直观的物理意义,用户在交互式自由视角漫游时只能给出物理世界中的欧式坐标与旋转角度 \(p_t^T\)。此外,单目/稀疏几何中天然存在“大场景远相机”与“小场景近相机”产生的绝对尺度模糊性(Scale Ambiguity)。为建立物理目标位姿与隐式位姿空间的精准可控映射,REON-NVS 设计了一个基于 MLP 的轻量级位姿映射器 \(\mathcal{M}\)。为了消除尺度模糊,映射器额外接收一对预先确定的基准位姿对 \((\tilde{p}', p')\) 作为锚点示例: $$ \tilde{p}_t^T = \mathcal{M}(p_t^T, (\tilde{p}', p')) $$ 其中,参考对来自初始第二视角帧 \(I_0^2\) 相对于参考帧 \(I_r\) 的关系,\(\tilde{p}' = \mathcal{P}(I_0^2, I_r)\) 由隐式位姿估计器给出,而 \(p'\) 则通过如 Depth Anything 3(DA3)等单目前向位姿估计工具确定。由于 \(p_t^T\)\(p'\) 处于同一物理尺度空间,映射器能够准确校准潜空间的几何比例,使得虚拟摄像机的自由平滑运镜能够无缝驱动隐式新视角生成。

3. 双向状态空间时序历史融合:以 \(O(1)\) 递推开销捕获长程跨视角记忆

在稀疏视角视频中,当前视角视野外(Out-of-view)或被动态前景遮挡的区域往往已经在先前的历史帧中被观察到。然而,自注意力 Transformer 在处理长视频序列时计算复杂度随帧数呈二次方爆炸,只能采用滑窗机制,割裂了窗口间的长期时序一致性。REON-NVS 采用基于 Mamba2 架构构建的 Bi-SSM 块来构建历史融合模块(History Fusion Module)。对于时间步 \(t\) 的每个输入帧 \(I_t^k\) 及其由隐式位姿计算出的 6 维 Plücker 射线编码 \(\tilde{P}_t^k\),以及目标射线编码 \(\tilde{P}_t^T\),将其划分为不重叠的小 Patch 线性映射为 \(kn + n\) 个视觉 Token。

为了在 2D 视觉与因果时间流间取得平衡,模块采用双向扫描策略,将目标 Token 置于序列末端以确保其能聚合所有观测视点的信息。更关键的是,模块将第 \(N\) 层 Bi-SSM 的隐状态矩阵 \(H_{t-1}\) 作为时序记忆无缝传递至当前帧的初始隐状态: $$ I_t^H, H_t = \mathcal{H}\left({[I_t^k, \tilde{P}t^k]}, \tilde{P}_t^T, H\right) $$ 前向分支初始状态满足 \(h_{1,f}^t = h_{kn+n,f}^{t-1}\)。状态空间模型的恒定递归更新特性使得网络能够跨越数百帧检索历史观测区域,且每增加一帧的计算耗时恒定,完全不存在计算爆炸问题。

4. 混合架构无时序视图精炼:补偿 SSM 循环压缩损耗以重构锐利边缘

状态空间模型(SSM)的时序隐状态虽然高效,但在数十帧乃至数百帧的连续递归传递中,不可避免地会表现出类似低通滤波器的平滑效应,导致粗糙渲染帧 \(I_t^H\) 丢失局部高频细节并出现纹理模糊。如果单纯堆叠更宽的 SSM 难以完全克服这种局部退化。为此,REON-NVS 紧接一个专门的视图精炼模块(View Refinement Module \(\mathcal{R}\)): $$ I_t^T = \mathcal{R}\left({[I_t^k, \tilde{P}_t^k]}, [I_t^H, \tilde{P}_t^T]\right) $$ 精炼模块完全切断历史时序隐状态的连接,仅专注于将当前时间步的原始高保真多视角观测帧 \(\{I_t^k\}\) 与粗糙预测 \(I_t^H\) 进行局部信息对齐。在架构上,作者创造性地采用了 Bi-SSM 与 Transformer 的混合交错架构。单个 Bi-SSM 模块的参数量仅约为等效 Transformer 的一半,这允许在严格的实时参数预算内堆叠更深的网络层级,同时利用 Transformer 自注意力的全连接局部比较能力,从当前输入视图中迅速挖掘高频纹理注入到目标新视角中,最终生成边缘锐利、光影自然的最终目标帧 \(I_t^T\)

损失函数 / 训练策略

REON-NVS 采用两阶段渐进式训练方案: 1. 第一阶段(自监督预训练):在无位姿真值的大规模静态室内外数据集 RealEstate10K(约 8 万个视频片段)上,联合训练位姿估计器与场景重建器,迭代 100K 次,每次采样连续 8 帧。目标隐式位姿通过将未知的目标视图真值 \(I_t^{GT}\) 送入位姿估计器提取得到。 2. 第二阶段(长序列混合微调与映射器训练):将训练序列扩展至 64 帧,在 RealEstate10K(静态)与本文提出的新数据集 + SelfCap(动态)混合数据上微调 20K 次,极大地增强了动态物体与非刚性运动的泛化鲁棒性;最后冻结全部重建网络,单独使用光度损失训练位姿映射器 20K 次(Batch Size 64)。

整体训练目标联合作用于粗糙输出 \(I_t^H\) 与精炼输出 \(I_t^T\): $$ \mathcal{L} = \mathcal{L}{\text{photo}}(I_t^T, I_t^{GT}) + \lambda}} \mathcal{L{\text{flicker}}(I_t^T, I_t^{GT}) $$ 其中光度损失由均方误差(MSE)与感知损失(LPIPS)组成:\(\mathcal{L}_{\text{photo}} = \mathcal{L}_{\text{MSE}} + \lambda_{\text{per}} \mathcal{L}_{\text{per}}\)。针对视频合成中因逐帧独立重建造成的时序抖动,作者引入了基于预训练 VGG 特征帧间差分的频闪损失(Flicker Loss): $$ \mathcal{L})] \right|_1 $$ 该损失约束预测序列高层语义特征的动态变化与真实视频的流变趋势一致,显著抑制了视频中的高频闪烁。}} = \left| [\phi(I_t^T) - \phi(I_{t-1}^T)] - [\phi(I_t^{GT}) - \phi(I_{t-1}^{GT

实验关键数据

主实验

论文在两套差异化评测协议下进行了严格对比:一是经典的固定相机动态场景数据集 Neural 3D Video(6 个室内场景,每个场景输入视点仅设为 2 个,分辨率 256);二是作者新采集的 30 个包含手持移动摄像头与剧烈动态前景的真实世界场景测试集。所有实验均在单张 NVIDIA A100 GPU 上实测。

表 1:Neural 3D Video 固定相机动态场景对比(原论文 Table 1) 注:IGS 仅在剩余 2 个未见场景上测试,表中 † 标识对应 2 场景下的严格同口径对比。

方法 是否需已知位姿 是否需每场景初始化 FPS (A100) ↑ PSNR (dB) ↑ SSIM ↑ LPIPS ↓ Flicker ↓
3DGS (逐帧优化) 0.1 19.22 0.532 0.394 85.10
3DGStream 0.6 20.38 0.580 0.536 14.88
HiCoM 0.7 19.63 0.583 0.420 13.96
DepthSplat (前向) 9.7 19.81 0.692 0.324 19.26
RayZer (无位姿前向) 19.0 21.97 0.596 0.287 24.16
REON-NVS (Ours) 32.0 23.63 0.715 0.199 8.97
IGS† 5.5 21.23 0.653 0.425 6.40
REON-NVS (Ours)† 32.0 24.62 0.737 0.191 8.76

表 2:移动相机手持动态场景对比(原论文 Table 2) 包含复杂的手持晃动、光照变化以及背景连续切换。

方法 是否需已知位姿 是否需每场景初始化 FPS (A100) ↑ PSNR (dB) ↑ SSIM ↑ LPIPS ↓ Flicker ↓
3DGStream 0.6 19.52 0.491 0.501 50.24
HiCoM 0.7 18.19 0.441 0.599 62.88
IGS 5.5 19.96 0.466 0.508 62.12
DepthSplat 9.7 19.72 0.561 0.386 49.51
RayZer 19.0 21.57 0.503 0.434 52.66
REON-NVS (Ours) 32.0 23.26 0.617 0.274 45.45

消融实验

表 3:频闪损失(Flicker Loss)在不同数据集上的消融结果(原论文 Table 3)

数据集 配置 PSNR ↑ SSIM ↑ LPIPS ↓ Flicker ↓
Neural 3D Video w/o \(\mathcal{L}_{\text{flicker}}\) 23.41 0.706 0.211 10.27
Neural 3D Video w/ \(\mathcal{L}_{\text{flicker}}\) (Full) 23.63 0.715 0.199 8.97
移动相机数据集 w/o \(\mathcal{L}_{\text{flicker}}\) 23.09 0.601 0.295 46.30
移动相机数据集 w/ \(\mathcal{L}_{\text{flicker}}\) (Full) 23.26 0.617 0.274 45.45
RealEstate10K w/o \(\mathcal{L}_{\text{flicker}}\) 26.67 0.874 0.119 20.96
RealEstate10K w/ \(\mathcal{L}_{\text{flicker}}\) (Full) 27.22 0.882 0.112 19.91

表 4:历史融合模块中不同 SSM 架构配置消融(原论文 Table 4,RealEstate10K)

双向扫描 (Bidirection) 交叉换向 (Cross) Token 合并方式 (Token Merge) PSNR (dB) ↑
✗ (单向基线 Vanilla Mamba2) - 19.79
Concat 20.82
Add 21.60
Concat 21.08
Add (Ours) 22.04

关键发现

  1. 实时性与无位姿前向推理的绝对优势:在单卡 A100 环境下,基于 3DGS 逐帧迭代的流式方法(3DGStream 0.6 FPS、HiCoM 0.7 FPS)甚至不及 1 FPS,且其 FPS 数据尚未计入耗时数分钟的离线位姿估计和初始高斯拟合;而 REON-NVS 包含位姿估计在内的全流程纯前向帧率达到 32 FPS,实现了真正零等待的 30 FPS 实时推流。
  2. 时序状态空间记忆(SSM Hidden State)的长效召回能力:在长达 190 帧的时间跨度召回测试中(图 6),当目标相机视角重新扫过当前视点无法观测、但在百余帧前曾经出现过的场景区域时,未携带时序状态传播的基线模型 PSNR 急剧崩塌(降至 16-18 dB 以下),而 REON-NVS 凭借 SSM 隐状态记忆几乎无衰减地维持在 24-25 dB,且每帧额外计算开销为 0。
  3. 移动摄像机环境下的泛化鲁棒性:在移动相机测试集上,传统流式 3D 高斯方法由于依赖初始帧静态背景高斯的先验假设,一旦摄像头大幅平移转动、暴露出新背景或新物体时,渲染严重破损失真(PSNR < 20 dB);REON-NVS 凭借纯前向去几何化直接合成与双视角 Plücker 射线指引,PSNR 达到 23.26 dB,超出此前流式最佳方案 +3.3 dB。

亮点与洞察

  • 将自监督隐式位姿与物理交互控制巧妙解耦:利用重建自监督在无 GT 位姿下训练位姿估计网络以避免流形退化,再通过一个接收初始参考对的轻量 MLP 映射器解决绝对尺度不确定性,兼顾了前向推理速度与用户自由视角交互的可控性。
  • 状态空间模型(Mamba2)在 4D 视频表征中的创新落地:成功打破了 Transformer 在流式视频中由于显存与复杂度限制必须采用滑动局部时间窗口的束缚,利用 SSM 隐状态在恒定内存占用与计算量下实现了长达数百帧的历史跨视角连续记忆。
  • 历史融合与局部精炼的双轨互补设计:精准识别出 SSM 递归时序压缩造成的低通高频滤波退化,采用“带记忆的 Bi-SSM 负责时序一致粗构 + 无记忆深层混合网络负责当前帧纹理锐化”的分工,有效平衡了长程一致性与超清局部画质。

局限与展望

  • 极端视角外推与视差过大时的结构畸变:当目标相机视角严重偏离两个输入摄像头基线构成的可见锥台、且历史序列中完全从未出现过该区域时,纯前向无显式 3D 几何先验可能导致画面出现类似于 2D 生成模型的拉伸或轻微伪影。
  • 超长序列中隐状态的不可避免信息衰减:尽管 SSM 理论上支持无限递推,但有限维度的隐状态向量在经历数千帧之后,极早期的细粒度静态几何与高频纹理依然会逐渐遗忘,未来可结合外部稀疏键值记忆检索(Sparse Keyframe Memory)进行长期兜底。
  • 依赖双目同步视频流输入:目前框架针对 2 视角流式输入设计,未来可进一步扩展至灵活支持单目手持视频的在线动态 NVS,或自适应任意可变数量摄像头的输入广播协议。

相关工作与启发

  • vs 3DGStream / HiCoM / IGS:传统流式 3DGS 方案在每一帧到来时均需对高斯属性进行数步至数十步的梯度反向传播优化,在稀疏视角下容易局部过拟合,且帧率极低;REON-NVS 采用端到端纯前向网络,单卡 32 FPS,无需每场景预初始化或在线梯度更新。
  • vs RayZer:RayZer 同样采用无位姿自监督策略,但其面向静态单目图像,缺乏时序建模机制,在处理连续视频时逐帧独立预测导致严重的画面抖动与时序撕裂(Flicker 高达 24-52);REON-NVS 引入 Bi-SSM 隐状态时序递推与频闪损失,在提升 +1.6~1.7 dB PSNR 的同时,将闪烁度降低了 15%~60% 以上。
  • vs DepthSplat:DepthSplat 依赖外部真值物理相机位姿并强行构建显式 3D 高斯点云,在极端稀疏或遮挡场景下深度预测误差会被显式投影放大;REON-NVS 证明了在稀疏流式动态场景下,去几何化的端到端隐式映射与射线融合能够实现更高的视觉逼真度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出面向未定姿稀疏视频流的实时端到端纯前向在线动态 NVS 框架,并创新引入 Bi-SSM 时序隐状态记忆。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建了包含 150 个手持多视角动态场景的全新数据集,在 Neural 3D Video 与移动相机两大基准上提供了详实的定量、定性与消融证据。
  • 写作质量: ⭐⭐⭐⭐⭐ 论文逻辑清晰严密,对传统显式 3D 优化在流式环境下的致命痛点剖析深刻,框架图与实验可视化极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 为低延迟实时自由视点视频(FVV)、全息通话与具身感知开辟了纯前向、高帧率的全新范式,极具工程与学术落地价值。