Novel View Synthesis as Video Completion¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://frame-crafter.github.io
领域: 3D 视觉
关键词: 新视角合成 / 视频扩散模型 / 置换不变性 / 普吕克射线 / LoRA微调
一句话总结¶
FrameCrafter 将稀疏新视角合成重构成低帧率视频补全任务,通过单视角独立 VAE 编码、目标视角中心普吕克射线条件注入以及剥离时序 RoPE,将预训练视频扩散模型转化为严格置换不变的多视角生成器,仅用 1K 场景微调即超越在海量多视角数据上训练的图像扩散基线。
研究背景与动机¶
稀疏输入下的新视角合成(Novel View Synthesis, NVS)要求模型在仅给定数张未稠密覆盖场景的离散图像(如 \(K \approx 5\) 张)及相机位姿的前提下,幻化并推断出全新目标视角下的逼真几何与外观。传统基于神经辐射场(NeRF)或 3D 高斯泼溅(3DGS)的前向回归方法严重依赖密集的几何约束,在观测稀疏或存在大基线视差时极易产生空洞与浮球伪影。近年来,以 SEVA 和 EscherNet 为代表的生成式方法开始引入大规模预训练的 2D 图像扩散模型先验,尽管显著提升了未见区域的生成质感,但由于单图像生成模型本身缺乏多视角几何一致性感知,必须在成千上万个带精确位姿标注的多视角数据集(如包含数十万物体的 Objaverse、80K 场景的真实捕获)上进行重度微调,才能从零学习跨视角几何对齐。
这一技术范式忽视了一个极为天然且规模庞大的物理世界先验来源:网络级视频数据。视频序列本身随时间连续记录了相机运动与视角平滑过渡,预训练视频扩散模型(如 Wan2.1、CogVideoX)在海量视频学习中已经自发涌现出了强大的隐式 3D 空间结构理解与时空几何一致性。然而,直接将视频扩散模型迁移到稀疏多视角合成任务中存在深层的机制冲突:现代视频扩散模型的骨干网络内嵌了强烈的时序因果归纳偏置——其 3D 卷积 VAE 存在时序因果缓存和跨帧下采样压缩(如 4:1 压缩),且 Transformer 内部普遍采用 3D RoPE 旋转位置编码绑定时间索引。但在稀疏 NVS 场景下,输入的 \(K\) 张图像本质上是一个无序的离散视角集合,视角之间跨度极大且毫无时间先后因果关系;强行按时序送入视频模型会导致空间信息被因果压缩稀释,且不同输入排列会导致完全不一致的几何推断。
针对视频先验与无序多视角输入之间的这一核心矛盾,本文的目标并非从头训练专有多视角网络,而是以极轻量化的改造使预训练视频大模型“遗忘”时间维度。核心 idea:将稀疏新视角合成表述为低帧率视频补全问题,通过单视角独立 VAE 编码阻断因果时序压缩、采用以目标视角为原点的普吕克射线映射实现无损几何注入,并完全剥离时序 RoPE 位置编码,在保持预训练视频几何先验的同时构建出严格的置换不变多视角生成器。
方法详解¶
整体框架¶
FrameCrafter 的整体架构由冻结的视频 VAE 编解码器与引入 LoRA 微调的视频扩散 Transformer(Video-DiT)组成。对于给定的 \(K\) 个稀疏无序输入视角 \(\{ \mathbf{I}_k \}_{k=1}^K\) 与已知相机位姿 \(\{ \boldsymbol{\pi}_k \}_{k=1}^K\),以及待生成的目标视角位姿 \(\boldsymbol{\pi}_{\text{tgt}}\),模型首先通过单视角独立编码将每张图像映射到潜空间,同时将位姿转换为规范化的普吕克射线图并无损重组;接着拼接入携带掩码的上下文特征,在 DiT 中通过自注意力跨视角检索几何信息并预测速度场;最后仅截取目标视角的去噪潜变量进行单帧解码,得到逼真的新视角图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["稀疏无序输入图像 + 目标相机位姿"] --> D1["独立单视角 VAE 编码<br/>单帧解耦前向,阻断因果时序压缩与特征缓存"]
D1 --> D2["目标视角中心普吕克射线条件注入<br/>以目标位姿为世界原点,Pixel Unshuffle 无损拼接"]
D2 --> D3["零时序位置编码与目标单帧监督<br/>置零时间 RoPE 消除顺序偏差,仅对目标视角计算流匹配损失"]
D3 --> OUT["预测目标视角潜变量与独立解码<br/>输出几何一致的高清目标视角图像"]
关键设计¶
1. 独立单视角 VAE 编码:消除因果时序压缩与视角顺序耦合 现代视频生成模型(如 Wan2.1)的 3D VAE 普遍采用因果时序卷积设计,第 1 帧独立处理,后续每 4 帧被步长卷积压缩为一个隐式时间步,且后帧特征依赖前帧特征缓存。若直接将 \(K\) 张稀疏输入作为视频序列送入,不仅会使大基线下的独立视角被错误地跨帧均质化混合,导致精细纹理丢失,还会因因果顺序导致输入排列不同时 latent 截然不同。为消除这一结构偏置,FrameCrafter 将每个输入视角 \(\mathbf{I}_k\) 独立视作仅含 1 帧的微型视频送入 VAE 编码器: $\(\mathbf{z}_k = \mathcal{E}(\mathbf{I}_k) \in \mathbb{R}^{d_z \times 1 \times h \times w}, \quad k = 1, \dots, K\)$ 目标视角则以全零图像占位符输入 \(\mathbf{z}_{\text{tgt}} = \mathcal{E}(\mathbf{0})\),并在时间维度上拼接成 \(\mathbf{z}_{\text{all}} = [\mathbf{z}_1; \dots; \mathbf{z}_K; \mathbf{z}_{\text{tgt}}] \in \mathbb{R}^{d_z \times (K+1) \times h \times w}\)。解码端同样仅对预测出的目标潜变量执行单帧独立解码 \(\hat{\mathbf{I}}_{\text{tgt}} = \mathcal{D}(\mathbf{z}_{\text{tgt}})\)。此举从底层确保了各视角编码在数学上严格独立于输入排列顺序,且各视角完整保留空间分辨率,杜绝了时序步长压缩带来的高频损失。
2. 目标视角中心普吕克射线条件注入:无损几何对齐与绝对坐标解耦 为使视频模型理解视角的几何相对关系,以往方法多将第一张输入视角的相机位姿设为世界坐标系原点,但这会直接破坏输入的置换不变性(改变输入次序即改变了世界坐标基准)。FrameCrafter 改为以目标视角(Query View)的相机为世界坐标系原点,将所有输入相机的位姿统一变换至目标视角坐标系下,并将输入相机中心到原点的平均距离归一化为单位长度,彻底切断了坐标基准对输入顺序的依赖。针对每个像素 \((u, v)\),利用反投影计算归一化射线方向 \(\hat{\mathbf{d}}\) 与原点 \(\mathbf{o}\),构建 6 维普吕克射线表示 \(\mathbf{p}(u, v) = [\hat{\mathbf{d}}; \mathbf{o} \times \hat{\mathbf{d}}]\)。为了将 \(H \times W \times 6\) 的射线图对齐至潜空间分辨率 \(h \times w\),传统双线性插值会导致光线方向被平滑模糊,丧失几何硬边界。模型引入 Pixel Unshuffle 操作,将空间相邻像素重组至通道维度,得到通道数为 \(6 f_s^2\)(如 \(6 \times 8^2 = 384\) 维)的无损射线特征,与加噪潜变量 \(\mathbf{z}_t\)、上下文图像特征及目标二值掩码沿通道维度拼接,作为 DiT 的联合输入。
3. 零时序位置编码与目标单帧监督:强迫模型依赖真实相机几何推理 预训练视频 DiT 普遍采用 3D RoPE(旋转位置编码)注入时间序号,诱导模型形成沿时间轴单向演化的生成惯性。在离散无序 NVS 场景中,这种时序偏置会严重误导网络对视差的判断。FrameCrafter 在注意力计算中直接将 RoPE 的时间分量置零(Zero-out Temporal RoPE),使 \((K+1)\) 个帧 token 在自注意力层中完全呈现为等价的无序集合,迫使 Transformer 放弃时间轴位置先验,转而完全依靠普吕克射线提供的物理几何线索在多视角间建立对应。同时,在训练监督上摒弃同时重构输入帧的常规做法,采用目标单帧 Flow Matching 损失: $\(\mathcal{L} = \mathbb{E}_{t, \epsilon, \mathbf{z}_0} \left\| \epsilon_\theta(\mathbf{z}_t, t, \mathbf{c}) - (\epsilon - \mathbf{z}_0) \right\|_{2, \text{tgt}}^2\)$ 其中 \(\mathbf{c}\) 包含输入上下文 latent、指示掩码和普吕克射线图。若在输入帧上施加损失,梯度会迅速被简单的上下文重建项主导,从而削弱对目标视角的几何推理;仅监督目标帧能将有限的微调容量全力聚焦于未见视角的补全合成。
损失函数 / 训练策略¶
模型以 Wan2.1-I2V-14B 为骨干,仅在 DiT 的注意力与前馈层插入秩 \(r=32\) 的 LoRA 模块,并重新初始化输入通道扩充后的 Patch Embedding 卷积层进行全量梯度更新,其余骨干参数完全冻结(可训练参数仅占约 1%)。训练采用两阶段递进分辨率策略:先在 \(192 \times 336\) 分辨率下快速预热收敛,再提升至 \(480 \times 832\) 高分辨率下细化几何细节。训练样本从 DL3DV-10K 的 1,000 个场景中采样,每步以 80% 概率全视频全局均匀采样帧、20% 概率局部窗口采样帧,以兼顾大视差外推与近邻视差插值。
实验关键数据¶
主实验¶
在 6 视角稀疏输入设定下,模型在 DL3DV-Benchmark 和 Mip-NeRF 360 数据集上与主流前向回归基线(LVSM、E-RayZer)及顶尖生成式方法(EscherNet、Aether、SEVA)展开对比。所有模型输出均裁剪/缩放至统一的 \(480 \times 480\) 评估指标。
| 数据集 | 方法 | 骨干模型 | 训练场景数 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | DreamSim ↓ |
|---|---|---|---|---|---|---|---|
| DL3DV | LVSM | – | – | 17.09 | 0.478 | 0.333 | 0.204 |
| E-RayZer | – | – | 16.85 | 0.442 | 0.455 | 0.254 | |
| EscherNet | SD1.5 | 10K | 12.07 | 0.251 | 0.484 | 0.227 | |
| Aether | CogVideoX-5B | – | 12.66 | 0.258 | 0.469 | 0.140 | |
| SEVA | SD2.1 | 80K | 16.15 | 0.470 | 0.253 | 0.088 | |
| Ours | CogVideoX-5B | 1K | 13.65 | 0.272 | 0.389 | 0.113 | |
| Ours | Wan2.1-14B | 1K | 17.18 | 0.445 | 0.223 | 0.066 | |
| Mip360 | LVSM | – | – | 15.25 | 0.317 | 0.609 | 0.577 |
| E-RayZer | – | – | 16.56 | 0.343 | 0.621 | 0.340 | |
| EscherNet | SD1.5 | 10K | 11.14 | 0.126 | 0.540 | 0.315 | |
| Aether | CogVideoX-5B | – | 12.60 | 0.220 | 0.651 | 0.334 | |
| SEVA | SD2.1 | 80K | 14.59 | 0.294 | 0.372 | 0.137 | |
| Ours | CogVideoX-5B | 1K | 13.09 | 0.209 | 0.540 | 0.204 | |
| Ours | Wan2.1-14B | 1K | 15.64 | 0.279 | 0.365 | 0.111 |
消融实验¶
在 DL3DV-Benchmark(\(192 \times 336\) 分辨率)上系统验证核心组件的作用:
| 配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | DreamSim ↓ | 说明 |
|---|---|---|---|---|---|
| Full model (完整模型) | 15.69 | 0.326 | 0.246 | 0.114 | 完整设计,各感知指标最佳 |
| ✗ 独立单视角 VAE 编码 | 11.50 | 0.147 | 0.676 | 0.656 | 采用因果联合编码,性能崩溃(LPIPS 恶化 0.43) |
| ✗ Pixel Unshuffle | 13.53 | 0.212 | 0.359 | 0.129 | 替换为普通插值降采样,射线几何损失显著 |
| ✗ 仅监督目标帧 (全序列监督) | 15.08 | 0.287 | 0.270 | 0.116 | 同时监督输入帧,主任务梯度被稀释 |
| w/ PRoPE 投影位置编码 | 14.91 | 0.289 | 0.315 | 0.174 | 显式相机视锥注意力难以在 LoRA 下轻量适应 |
| w/ 原始时序 RoPE | 15.30 | 0.300 | 0.265 | 0.122 | 保留时间顺序偏置,泛化性与指标全面落后 |
此外,在 10 次随机打乱输入顺序的置换不变性评估中: - 采用首图为参考坐标系的模型:PSNR 为 \(15.67 \pm 0.4730\),LPIPS 为 \(0.262 \pm 0.0203\),因坐标随首图变化而剧烈波动; - 保留原始时序 RoPE 的模型:PSNR 为 \(15.61 \pm 0.3106\),LPIPS 为 \(0.254 \pm 0.0095\); - 本文方案:PSNR 达到 \(16.21 \pm 0.0081\),LPIPS 降至 \(0.224 \pm 0.0003\),方差几乎归零,展现了极强的数学置换不变性。
关键发现¶
- 单视角独立编码是决定成败的最关键支柱:消融实验显示,一旦去掉独立单视角编码、改回标准因果 3D VAE 跨帧压缩,DreamSim 误差由 0.114 飙升至 0.656,PSNR 暴跌逾 4 dB。这证实了视频 VAE 的时序因果压缩对稀疏大视差多视角图是破坏性的。
- 数据效率极高,跨越式超越图像扩散:在数据缩放分析中,FrameCrafter 仅在 20 个场景 上训练得到的模型(PSNR 约 14.2 dB),就已全面碾压在 10,000 个场景上训练的 EscherNet(12.07 dB),展现出多达 500 倍的数据效率优势。
- 置换不变性带来隐式阶乘级数据增广:在按原时序排列的评测集上,置换不变训练模型的表现(PSNR 15.69 / LPIPS 0.246)显著高于强行用时序有序数据训练的模型(PSNR 15.04 / LPIPS 0.276)。这表明将输入视作无序集合不仅符合物理本质,还赋予了模型 \(K!\) 倍的数据组合增广红利。
亮点与洞察¶
- 将视角外推统一于低帧率视频补全:巧妙地指出视频扩散模型内部早已蕴含三维一致性,避免了像 SEVA 那样消耗数十万带姿态的 3D 数据从头灌注三维先验。
- 结构极简但处处切中要害:不引入复杂的 3D 几何显式表征(如点云投影或对极几何注意力),仅靠“独立编码 + 零时序 RoPE + 目标中心普吕克射线”三记轻量手术,就将视频模型的时间轴平滑转换为纯几何视差轴。
- 端到端随视频基座共同缩放:从 CogVideoX-5B 升级到 Wan2.1-14B 时,DL3DV 上的 LPIPS 从 0.389 大幅降至 0.223,证明该范式能无缝搭乘开源视频基础模型演进的快车。
局限与展望¶
- 推理开销与内存占用受限于大模型骨干:依赖 14B 级别的视频 DiT 骨干,在显存受限设备上的单次推理延迟显著高于小型回归网络,实时交互渲染难度较大。
- 极稀疏单视角与完全遮挡下的幻觉不可控:当输入视角退化至 1-2 张且目标视角处于大范围背光/遮挡盲区时,扩散模型虽然能生成逼真纹理,但可能背离场景真实三维几何。
- 未来方向:可进一步将 FrameCrafter 与前向 3DGS 结合,利用扩散补全的多视角潜变量初始化并快速正则化显式三维高斯球,兼顾生成的生成式质感与毫秒级即时漫游渲染。
相关工作与启发¶
- vs SEVA: SEVA 基于 SD2.1 图像扩散模型,依靠 80K 真实场景与 340K 物体合成数据强行训练跨视角注意力;本文基于预训练视频模型,仅用 1K 真实场景即在感知指标上反超,证明视频预训练是更优的 3D 几何先验源。
- vs Aether: Aether 沿时序轨迹生成连续视频帧以控制相机,仍保留因果时序依赖与时间压缩;本文解耦时序偏置,直接面向离散稀疏视角进行置换不变补全,视角对齐更精准、边界更锐利。
- vs EscherNet: EscherNet 在图像扩散中以第一视角为基准引入隐式变换;本文采用目标视角中心与普吕克射线无损排布,避免了首图基准引发的排序方差。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 颠覆了“图像扩散+海量多视角数据”的既有路径,优雅地将视频因果大模型转化为无序视角生成器。
- 实验充分度: ⭐⭐⭐⭐⭐ 提供了详实的跨数据集主客观对比、多项消融、置换方差检验及数据规模缩放曲线。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻严密,架构图与关键设计逻辑严密闭环,论证极具说服力。
- 价值: ⭐⭐⭐⭐⭐ 开辟了利用网络级开源视频基础模型直接赋能稀疏三维重建的新方向,实用性极强。