RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://compvis.github.io/rayder
领域: 3D视觉
关键词: 新视角合成 / 自监督学习 / 视频几何学习 / Transformer / 动态建模
一句话总结¶
RayDer 将相机位姿估计、场景重建与新视角渲染完全整合进单一前馈 Transformer 主干网络,通过将场景动态建模为干扰因子并配合状态 Dropout,彻底打破了自监督新视角合成依赖静态场景的扩展瓶颈,在海量无标注动态视频上实现了可预测的幂律扩展与强大的零样本泛化性能。
研究背景与动机¶
新视角合成(Novel View Synthesis, NVS)在计算机视觉与三维几何生成中占据核心地位。理论上,NVS 具备成为高可扩展自监督学习范式的理想潜质:仅需利用视频序列中不同视角的观测,联合学习相机位姿与几何表征,即可直接将互联网上海量无标注的真实视频转化为有效监督信号。然而,现有的自监督 NVS 方法(如 RayZer、Pensieve、Less3Depend 等)面临着严峻的数据瓶颈与训练不稳定性。它们普遍建立在一个严苛的前提假设之上——训练数据必须来自经过严格清洗的纯静态场景视频。一旦将这类模型直接部署到包含人、车辆或物体运动的真实互联网动态视频上,模型为了最小化像素重构误差,不可避免地会将物体时序位移错误地“藏”进相机位姿变量中,导致严重的表征漂移、梯度骤增甚至训练发散。
除了数据分布的严苛限制,现存自监督 NVS 系统在架构设计上也存在根本性的可扩展性缺陷。以 RayZer 为代表的经典方案通常被拆分为相互独立的级联子网络:一个负责估计相机位姿的编码器、一个构建场景隐式表征的重构器,以及一个解码生成目标画面的渲染器。这种多网络分离架构在小模型规模下虽能运转,但当系统向数亿参数扩展时,不同模块间复杂的梯度传递与容量分配变得极其脆弱和难以预测,需要耗费极其高昂的调参成本,阻碍了类似大语言模型那样清晰可预测的 Scaling Law 的形成。
本文的切入点在于重新界定自监督学习下的动态建模哲学与系统架构:学习的目标始终是稳健的“静态场景 NVS”,而非昂贵的 4D 动态场景重建;因此动态内容不应作为重构目标,而应被视为训练过程中的“干扰因子(nuisance factor)”予以吸收和解耦;同时,将离散的几何与渲染流水线整合为单一统一主干。核心 idea:将相机估计、场景重构与图像渲染彻底收敛至单一 Transformer 主干网络,引入极简的时序动态状态变量作为干扰因子吸收动态内容并施加状态 Dropout,使自监督 NVS 能够直接在真实世界未约束动态视频上进行端到端稳定训练,首次呈现跨数据规模、模型容量与算力的标准幂律扩展定律。
方法详解¶
整体框架¶
RayDer 的核心设计思想是彻底摒弃传统自监督 NVS 中“位姿估计网络 - 场景表征网络 - 视角渲染网络”三权分立的多模型级联范式,将其完全重构为单一前馈 Transformer 模型 \(\mathcal{M}\)。输入一组未经校准与位姿标注的图像序列 \(\{I_i\}\),模型在同一个自注意力主干中自适应完成两项协同作业:首先预测每帧图像对应的相机位姿编码 \(p_i \in SE(3)\)(以 Plücker 射线参数化)以及伴随的动态状态嵌入 \(s_i \in \mathbb{R}^{d_{\text{state}}}\);随后,利用统一特征表征,基于给定的查询视角位姿 \(p_{\text{target}}\) 渲染出对应的目标视角画面 \(\hat{I}_{\text{target}}\)。
为了兼顾训练稳定性、跨视角泛化能力与高分辨率渲染效率,RayDer 在统一主干周围配置了时序动态状态解耦、目标并行注意力因式分解、随机视角自回归训练以及局部浅层高分辨率注意力层。其整体流程如下图所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入未校准动态视频帧序列 {I_i}"] --> B["动态状态变量与状态 Dropout<br/>联合预测位姿与动态状态 (p_i, s_i)"]
B --> C["单一主干网络整合与并行目标注意力<br/>统一 Transformer 特征空间与因式分解注意力"]
C --> D["视角间随机顺序自回归训练<br/>切断时间轴位姿捷径,强制几何对齐"]
D --> E["浅层高分辨率局部注意力层<br/>邻域注意力模块注入高频细节"]
E --> F["输出目标新视角预测画面 I_target"]
关键设计¶
1. 动态状态变量与状态 Dropout:将场景动态建模为干扰因子
在真实世界动态视频中,目标视角 \(j\) 相对于输入视角 \(i\) 的外观变化由两种因素交织产生:相机的相对位姿变化 \(p_i \to p_j\) 以及场景内物体的动态状态演变 \(s_i \to s_j\)。早期方法仅暴露相机位姿作为渲染条件,迫使模型在均方误差(MSE)损失的驱使下,将物体的局部动态形变强行编码到位姿表示中,引发致命的位姿表征漂移与训练发散。RayDer 并不追求代价高昂的 4D 动态场景显式重建(那需要成对的多视角动态视频,违背了大规模自监督的初衷),而是设计了一个极简的动态状态变量 \(s_i \in \mathbb{R}^{d_{\text{state}}}\),将其纯粹作为“干扰因子”处理:
动态状态向量仅以额外的 condition token 形式输入给渲染器,专职吸收时序变化与前景物体运动,从而将位姿通道彻底净化为纯粹的刚性空间几何。为了避免模型在推理阶段产生对真实目标状态 \(s_{\text{target}}\) 的依赖,作者在训练中引入状态 Dropout 机制:以固定概率随机将 \(s_{\text{target}}\) 替换为全零向量 \(\mathbf{0}\)。这一设计迫使主干网络在无动态条件输入时,依然能够稳健地仅依赖空间位姿合成出物理一致的静态背景;在测试阶段,输入真实动态场景时,静态背景被几何正确地渲染出来,而动态区域则自然退化为合理的低频平滑均值,彻底消除了动态视频训练中的梯度震荡。
2. 单一主干网络整合与并行目标注意力:消除多网络架构的扩展瓶颈
传统多网络架构将位姿估计与场景渲染强行割裂,不仅割裂了底层几何特征的跨任务共享,而且在扩展模型大小时造成了不可控的超参数爆炸。RayDer 将所有重度计算集中于单一 Transformer 主干 \(\mathcal{M}\)。通过自适应层归一化(Adaptive Normalization)注入 token 角色标识,同一个网络既能在前向传播中处理输入图像集合抽取位姿与场景潜空间特征,又能在查询阶段无缝切换至视角渲染:
如果直接将该统一模型作为标准的 Decoder-Only 架构运行,每个目标视角的查询都需要重新扫描全部输入视角的 token,导致推理与多目标计算代价呈二次方增长。为此,RayDer 提出了因式分解的“并行目标注意力(Parallel-Target Attention)”掩码模式:在自注意力矩阵中,输入视角的 token 仅相互进行双向全局注意力交互,构建紧凑且不变的场景几何上下文;而任意目标视角的查询 token 仅对自身及全部输入 token 进行交叉注意力,目标 token 之间彼此屏蔽。这使得所有输入视角的键值对(KV Cache)在单次前向后即可全量冻结复用,训练时支持多目标视角瞬时并行预测,将单目标渲染算力消耗骤降约 \(7\times\)。
3. 视角间随机顺序自回归训练:切断时序捷径并对齐真实几何
当使用视频切片训练大规模视角模型时,若同时提供密集帧序列,模型极易退化出一种投机取巧的“时间轴位姿捷径(Temporal Shortcut)”:由于相机沿轨迹连续运动,网络无需理解深层空间几何,仅需根据帧在序列中的索引次序(即隐式时间轴)即可拟合位姿插值。然而,这种依靠时序平滑性学到的位姿完全无法泛化到真实测试中稀疏或单视角(Single-View / Few-View)的苛刻 NVS 场景。
为了破除时序依赖,RayDer 将视角序列的学习形式化为视角维度的自回归过程。不同于按自然时间顺序进行序列展开的普通自回归,RayDer 采用了“随机顺序自回归(Random-Order Autoregression)”策略:每次从输入集合中随机打乱视角次序,使输入视图数量在 \(|I_{\text{input}}| \in \{1, 2, \dots, |I_{\text{total}}| - 1\}\) 范围内动态变换,并强制注意力沿随机打乱的顺序进行因果遮蔽。这一策略强迫模型在极度稀疏的单视角输入下,也必须凭借纯粹的视觉透视与几何线索推断三维位姿;随着输入视角随机递增,位姿精度逐步累积。实测表明,随机顺序自回归将相机旋转估计精度 \(R@10^\circ\) 从常规因果模型的 70.1% 大幅跃升至 84.4%。
4. 浅层高分辨率局部注意力层:低计算成本恢复高频细节
标准 Vision Transformer 在输入端采用较大 Patch 分块(如 \(16 \times 16\))时,会导致高频纹理与精细几何细节严重丢失;但若直接将 Patch 缩小(如缩至 \(4 \times 4\) 或像素级),全局全自注意力的计算复杂度将随分辨率呈四次方 \(O(p^4)\) 爆发式增长。RayDer 借鉴沙漏扩散架构的轻量化思想,在核心统一 Transformer 主干前后分别架设了浅层的局部高分辨率编码与解码层。
这些浅层结构采用邻域注意力(Neighborhood Attention, NAT)机制,仅在单个图像帧内的局部空间窗口内执行受限注意力。底层局部高分辨率编码器迅速将高像素密度的局部纹理聚合后降采样送入全局主干;全局主干专心完成跨视角的长程几何对应与视差推演;最后由局部高分辨率解码器借助残差连接跳跃传递的高频线索完成局部像素还原。该设计在几乎不增加全局计算延迟的前提下,大幅提升了物体边缘与精细高频结构的合成清晰度。
损失函数 / 训练策略¶
RayDer 纯粹基于目标视角的图像空间光度重构误差驱动端到端优化,无需任何显式三维监督、深度先验、光流约束或预训练几何大模型权重。训练损失包含目标画面的均方误差(MSE)光度损失与感知损失(LPIPS):
模型采用 AdamW 优化器,在未标注的大规模视频数据集(SpatialVid,约 270 万条视频)上以批大小 256、图像分辨率 \(256 \times 256\) 开展训练。每条视频片段以约 0.5 秒间隔随机抽取 8 个视角帧作为训练样本。根据模型规模,共定义了 XS(59M)、S(145M)、B(422M)、L(743M)四种不同深宽度的层级架构。
实验关键数据¶
主实验¶
RayDer 在开放领域(Open-Set)与跨数据集零样本迁移场景下展现了优异的新视角合成能力。在无需任何真实相机位姿辅助输入、完全依靠自身网络预测位姿的前提下,RayDer-L 在多种严苛基准上超越或匹敌了依赖视频扩散预训练甚至具有三维监督的 SOTA 模型。
表 1:跨多数据集开放领域新视角合成对比 (PSNR ↑)
(测试涵盖窄基线小视角与大视角变化,输入视角数分别为 1、3 或 6 帧。RayDer 使用自身预测位姿)
| 模型 | 参数量 | 自监督 | 输入视图数 | LLFF (3-view) | DTU (3-view) | CO3D (3-view) | WRGBD (3-view) | Mip360 (3-view) | T&T (3-view) |
|---|---|---|---|---|---|---|---|---|---|
| MVSplat | 12M | ✗ | 3 | 12.50 | 15.52 | 13.52 | 12.54 | 13.56 | 13.22 |
| DepthSplat | 354M | ✗ | 3 | 12.62 | 16.24 | 13.77 | 14.23 | 14.01 | 14.35 |
| ViewCrafter | 1.4B | ✗ | 3 | 13.52 | 16.40 | 14.72 | 12.66 | 14.59 | 18.07 |
| SEVA | 1.3B | ✗ | 3 | 19.48 | 20.82 | 19.25 | 18.91 | 16.70 | 15.16 |
| Kaleido | 3.1B | ✗ | 3 | 20.71 | – | – | – | 18.03 | – |
| E-RayZer | 246M | ✓ | 3 | 18.01 | 16.97 | 17.76 | 16.18 | 15.86 | 10.36 |
| RayDer-L (Ours) | 743M | ✓ | 3 | 21.38 | 17.92 | 19.09 | 17.23 | 16.25 | 18.74 |
此外,针对“能否直接借助现有伪位姿估计工具进行有监督训练”这一核心疑问,作者在相同动态视频训练集(SpatialVid)上对比了 RayDer-B 与基于 MegaSaM 提取伪真值位姿的有监督基线 LVSM:
表 2:动态视频训练下自监督 vs 伪位姿有监督对比 (RE10K 零样本评测)
| 模型 | 训练数据 | 位姿监督方式 | 位姿生成算力开销 | PSNR ↑ | LPIPS ↓ | SSIM ↑ |
|---|---|---|---|---|---|---|
| LVSM | SpatialVid (~2.7M) | MegaSaM 伪真值位姿 | ~69,000 GPU-h | 25.44 | 0.184 | 0.729 |
| RayDer-B (Ours) | SpatialVid (~2.7M) | 完全自监督(无位姿标签) | 0 GPU-h (免位姿抽取) | 28.35 | 0.151 | 0.879 |
注:RayDer-B 仅耗费约 1,200 GPU-h 训练,却在 PSNR 上大幅反超依赖耗资 69,000 GPU-h 位姿工具的 LVSM 达 +2.91 dB。
消融实验¶
通过在 SA-V(开放域动态视频)和 SpatialVid-HQ 数据集上逐步引入核心技术模块,表 3 验证了从发散基线到高保真可扩展模型的演化路径:
表 3:RayDer 各核心组件渐进式消融实验(零样本评测 RE10K NVS 与 DL3DV-10K 相机位姿)
| 配置编号 | 架构配置 | 训练稳定性 | SA-V: NVS PSNR (无状态) ↑ | SA-V: NVS PSNR (有状态) ↑ | SA-V: 相机 R@10° ↑ | SA-V: 相机 [email protected] ↑ | SV-HQ: NVS PSNR (无状态) ↑ | SV-HQ: 相机 R@10° ↑ |
|---|---|---|---|---|---|---|---|---|
| A | RayZer 基准 (~140M) | 发散(极不稳定) | 22.53* | – | 59.8* | 6.5* | 22.69* | 66.0* |
| B | + 动态状态预测 | 完全稳定 ✓ | 13.42† | 24.01 | 56.1 | 7.0 | 13.48† | 54.4 |
| C | + 状态 Dropout | 完全稳定 ✓ | 23.01 | 23.76 | 62.4 | 8.1 | 23.02 | 69.2 |
| D | + 单网络整合 | 完全稳定 ✓ | 24.93 | 25.33 | 68.8 | 16.3 | 26.98 | 74.1 |
| E | + 并行目标注意力 | 完全稳定 ✓ | 24.04 | 25.12 | 70.1 | 15.6 | 25.91 | 70.9 |
| F | + 顺序自回归 | 完全稳定 ✓ | 23.08‡ | 24.49‡ | 73.6 | 24.9 | 23.53‡ | 76.5 |
| G | + 随机顺序自回归 | 完全稳定 ✓ | 25.45 | 26.28 | 84.4 | 37.2 | 27.27 | 86.0 |
| H | + 浅层高分辨率局部层 | 完全稳定 ✓ | 25.61 | 26.87 | 85.0 | 40.2 | 27.78 | 88.7 |
注:为挑选未发散 checkpoint 评估;†无 Dropout 导致推理强依赖不可见的目标状态;‡顺序自回归在标准 NVS 评测下存在分布偏移。*
关键发现¶
- 动态状态与 Dropout 是实现大规模自监督稳定训练的第一前提:基准 RayZer 在未经筛选的动态视频上频繁发生梯度爆炸,而仅引入极简动态状态向量(B)即可使训练稳定性达到 100%;搭配状态 Dropout(C)后,模型彻底摆脱对测试时动态状态真值的依赖,PSNR 从严重退化的 13.42 dB 恢复至 23.01 dB。
- 单网络整合兼顾效率与质量双重增益:将多网络系统收敛至统一单一 Transformer(C \(\to\) D)不仅使跨层级算力分配变得清晰,更带来了显著的几何与合成性能跨越,在 SV-HQ 上 PSNR 直接提升近 4.0 dB(23.02 \(\to\) 26.98 dB),平移精度 \([email protected]\) 翻倍(8.2 \(\to\) 19.7)。并行注意力机制(D \(\to\) E)虽带来微弱的精度折损(24.93 \(\to\) 24.04 dB),却换取了单目标推理 \(7\times\) 的算力加速,极大提升了训练吞吐。
- 随机自回归粉碎了时序位姿捷径:从固定顺序自回归过渡到随机顺序自回归(F \(\to\) G),相机旋转准确率 \(R@10^\circ\) 产生质的飞跃(73.6% 跃升至 84.4%),平移精度提升超过 50%(24.9 升至 37.2),这证明了迫使模型面对任意子集重构任意视角能够强有力地激活真正的 3D 几何常识。
- 自监督 NVS 服从精准的数据与算力联合幂律法则:作者通过拟合扩展公式 \(L(C, D) = L_\infty + A C^{-\alpha} + B D^{-\beta}\) 获得了拟合优度 \(R^2 > 0.99\) 的 Pareto 最优前沿。算力与数据必须协同增加——在 1% 数据(约 2.7 万条视频)下,大模型极易过拟合,甚至弱于小型模型;而在 100% 数据(270 万条)下,大模型能力完全释放。使用海量含有动态的视频训练(SpatialVid 2.7M)所取得的 29.38 dB,显著超越了整合公开发布的所有静态场景数据集总和(25 万条)所达到的 28.68 dB。
亮点与洞察¶
- 将动态内容界定为“干扰变量”而非“重建对象”的高维思路:许多研究试图直面 4D 动态 NVS,却在稀缺的动态多视角数据前寸步难行。RayDer 敏锐地洞察到:要想在互联网百亿级视频上实现自监督规模化,最高效的路线是守住“静态场景 NVS”这一基础任务底盘,将动态内容降维吸收为不需要显式解算的干扰变量,从而以极低代价吞吐无上限的动态视频数据源。
- “单一主干”在 3D 几何建模中的统一红利:与近年 2D 领域的 Vision Transformer 及大语言模型演进如出一辙,级联式分立小网络在Scaling时代注定遭遇瓶颈。RayDer 证明了无需把位姿估计和神经渲染当成物理隔离的异构流水线,在同一个 Transformer 隐式空间中进行跨视角自注意力交互,反向传播的梯度信号反而更加纯净协调。
- 自监督学习超越昂贵离线伪标签的计算经济学:在真实动态视频中,使用离线 Structure-from-Motion(如 MegaSaM)提取伪位姿不仅消耗了比模型训练自身多达 50 倍的巨量 GPU 工时,而且由于动态遮挡与特征错配,伪标签的系统性噪声会彻底锁死有监督模型(如 LVSM)的上限。RayDer 凭借端到端自监督机制直接越过了这一昂贵门槛,在效果与算力上实现了对伪标签监督的双重碾压。
局限与展望¶
- 未观测区域回归均值的模糊伪影:由于纯粹基于均方误差(MSE)光度回归损失进行训练,对于在任何输入参考视角中均未出现过的物理盲区,模型倾向于塌陷到空间所有可能颜色的统计均值,呈现出无高频纹理的平滑模糊面,缺乏生成式扩散模型那样的纹理脑补(Hallucination)能力。未来结合统一主干接入生成式扩散或流匹配解码头是解决该问题的有效路径。
- 混合动静态场景下的动态内容退化:由于模型并未显式构建可解耦的时空 4D 场,在面对具有复杂移动实体的测试视频时,模型虽能精确锁定背景刚性几何并沿目标视角正确旋转,但前景运动物体会退化为低频半透明残影。如何在维持通用无标注单目视频训练可扩展性的同时,无缝过渡至完整 4D 动态 NVS,仍是开放挑战。
- 极端无纹理人工合成实验室环境的泛化受限:在 DTU 等纯净白色背景、无自然光照散射与周围语义参照的工业级评测集上,RayDer 的位姿推断偶尔会出现漂移,表现弱于在纯室内静态扫描集上过拟合的专有基线。这主要归因于真实互联网视频与无纹理实验室暗室之间的巨大域差距。
相关工作与启发¶
- vs RayZer [28]: RayZer 首次展示了单目静态视频自监督 NVS 的可行性,但依赖“位姿-场景-渲染”三套分立 ViT,且只能在精心筛选的静态场景视频上训练,遇动态视频立刻发散。RayDer 通过动态状态干扰吸收与单一 Transformer 主干整合,不仅彻底攻破了动态视频训练发散的难题,更解锁了平滑的算力与数据扩展曲线。
- vs LVSM [29] / VGGT [70]: LVSM 依赖外部真实或伪真值相机位姿作为强监督,无法利用无标定海量网络视频;VGGT 虽将几何多任务统一到单一主干,但依然属于重度依赖三维真实标签的有监督阵营。RayDer 吸收了统一主干的思想,却将其坚决推向了无需任何相机内参、外参标签的纯自监督前沿。
- vs 视频扩散生成模型 (SEVA [91] / ViewCrafter [84] / Kaleido [41]): 这类模型借助百亿级视频生成大模型的先验来实现视角变换,计算代价高昂且往往依赖外部输入位姿。RayDer 完全从零开始单阶段自监督训练,不仅模型体量更轻(743M vs 1.3B-3.1B),在推理时无需任何外部位姿输入,在大部分标准基准上取得了可比甚至更优的几何保真度。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(巧妙将动态内容降维为干扰因子破除动态视频发散魔咒,首度实现自监督 NVS 的单主干整合与 Scaling Law 验证)
- 实验充分度: ⭐⭐⭐⭐⭐(覆盖 4 种模型规模、3 个数量级数据切片、数十个开放域基准及全套消融,算力与数据扩展分析扎实完整)
- 写作质量: ⭐⭐⭐⭐⭐(逻辑链条严密自洽,从痛点剖析到架构演进条理极为清晰,图表完备)
- 价值: ⭐⭐⭐⭐⭐(为三维视觉与物理世界表征学习打破了静态场景数据集壁垒,指明了利用无限真实视频训练 3D 基础模型的可行路线)