NEOMAP: Novel-View Synthesis via Noise Initialization by Manifold Alternating Projection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/vLAR-group/NeoMap
领域: 3D视觉
关键词: 新视角合成, 视频生成模型, 流匹配, 流形交替投影, 免训练
一句话总结¶
针对单图与单目视频新视角合成中视角不对齐与生成伪影并存的难题,NeoMap 提出直接在预训练视频生成模型的数据流形中寻找最优解,通过流形交替投影迭代优化初始高斯噪声,在无需额外训练和生成引导的情况下实现了高保真且视角一致的新视角视频合成。
研究背景与动机¶
从单张图像或无约束单目视频合成逼真的未见视角视频(Novel View Synthesis, NVS)是计算机视觉的核心任务之一,在虚拟现实/增强现实、3D/4D 内容创作和具身感知中具有重要应用。然而,单目输入不可避免地存在严重的视角遮挡、场景信息缺失以及深度多义性,传统基于几何重建的三维表示方法(如 NeRF 和 3D Gaussian Splatting)在稀疏或单视角输入下面临严重的空洞与几何畸变。近年来,基于大规模真实视频预训练的视频生成大模型(如 Wan、HunyuanVideo、CogVideoX)展现出惊人的时空物理规律理解与内容补全能力,为解决长久以来的新视角合成难题带来了全新的契机。
然而,现有结合预训练视频模型的方法普遍建立在一个核心假设之上:预训练视频模型缺乏原生的视角合成与精确相机控制能力,必须对生成映射关系进行任务特定的重塑。基于该假设,现有路线主要分为两类:一是微调模型以引入相机位姿参数或轨迹条件(如 TrajectoryAttention、ReCamMaster),但极易对训练集中受限的相机运动分布与深度估计噪声过拟合,在开阔复杂场景下泛化性差;二是基于深度投影的“变换+修补”(Warping & Inpainting)免训练策略(如 NVS-Solver),在去噪过程中逐时间步硬性融合几何先验特征,但这严重打乱了预训练模型固有的连续去噪轨迹,导致内容缺失、结构坍塌与语义断裂。
本文的切入视角跳出了“修改去噪轨迹”或“微调网络映射”的思维定势:在大规模真实视频上预训练的基础模型,其输出数据流形本身就已经覆盖了丰富的 3D 几何结构与逼真的相机运镜,优质的新视角合成视频早已天然蕴含在其原生输出流形之中,核心挑战仅仅在于如何在巨大的流形空间中“定位”该特定解。鉴于扩散模型与流匹配(Flow Matching)模型在数学上均为从高斯噪声空间到视频数据流形的确定性常微分方程(ODE)映射,在流形中寻找特定视频等价于在高斯噪声空间中寻找对应的初始噪声。核心 idea:将单目新视角合成转化为初始噪声优化问题,通过锚定流形投影与像素约束投影构成的流形交替投影迭代,使初始噪声自然收敛至语义真实性流形与三维几何约束子空间的交集。
方法详解¶
整体框架¶
NeoMap 的输入为单张参考图像或单目视频序列,以及给定的目标相机位姿轨迹,输出为在目标视角下几何一致、时空连续的高分辨率逼真视频。方法首先利用基础几何模型(VGGT、VIPE)估计参考视角的密集深度与相机位姿,通过 3D 逆向投影将源视角像素变换到目标轨迹,构建出带有可见性掩码的不完整目标视角先验。随后,算法进入核心的流形交替投影循环,在近噪声时间步与数据流形之间交替迭代优化噪声编码,最后辅以早期去噪步的轨迹重锚定策略完成最终生成。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单目参考输入<br/>图像/单目视频 + 目标相机轨迹"] --> B["新视角先验构建<br/>深度位姿估计与3D投影扭曲"]
B --> C["锚定流形投影<br/>单步欧拉反向流向流形投影与相似度动态融合"]
C --> D["像素约束投影<br/>像素空间掩码强制覆盖与VAE重编码投影"]
D -->|交替投影迭代 K 次| E["最优初始噪声<br/>收敛至真实视频流形与几何约束交集"]
E --> F["辅助轨迹重锚定<br/>前若干去噪步施加流形校准防止ODE漂移"]
F --> G["目标新视角视频<br/>高保真度与几何视角完全一致"]
关键设计¶
1. 新视角先验构建:几何投影与潜空间映射初始粗糙先验
为了给无约束生成提供初始的空间锚点,系统首先使用基础几何感知模型联合恢复参考视角的深度图与外参位姿。借助给定的目标相机轨迹,通过标准 3D 扭曲变换将参考视角的可见几何投影至目标视角,得到粗糙的目标视频图像 \(\boldsymbol{X}_c\) 以及对应的二值可见性掩码 \(\boldsymbol{M}_c\)。随后通过预训练视频 VAE 编码器将其映射为潜空间特征 \(\boldsymbol{z}_c = \text{Enc}(\boldsymbol{X}_c)\)。直接对 \(\boldsymbol{z}_c\) 加噪作为初始噪声会带来灾难性退化,因为深度噪声会导致可见区存在剧烈的域外伪影,而未见遮挡区则完全处于黑色未约束状态。为此,系统通过前向流将其映射至靠近噪声端的早期时间步 \(\tau = 1 - \Delta t\),作为交替投影迭代优化的起点 \(\boldsymbol{z}_\tau^0\)。
2. 锚定流形投影:单步反向流补全未见区域与特征级相似度锚定
锚定流形投影(Anchored Manifold Projection, AMP)模块负责将当前带噪声的潜编码推向自然视频流形 \(\mathcal{M}\),以利用视频模型的生成先验对未见区域进行合理补全并修正可见区域伪影。为了避免完整求解反向 ODE 的巨大计算开销,AMP 采用大步长单步欧拉反向流近似: $\(\boldsymbol{z}_\mathcal{M}^k = \Phi_{\tau \to 0}(\boldsymbol{z}_\tau^k) \approx \boldsymbol{z}_\tau^k - \tau \boldsymbol{v}_\theta(\boldsymbol{z}_\tau^k, \tau)\)$ 然而,视频模型中的时空自注意力机制在向不可见区域广播信息的同时,也会将未约束区域的无序噪声反向扩散到高置信度的可见区域。为防止可见几何被不可逆破坏,AMP 计算流形预测值 \(\boldsymbol{z}_\mathcal{M}^k\) 与初始几何先验 \(\boldsymbol{z}_c\) 之间的特征余弦相似度,利用阈值 \(\lambda\) 生成自适应锚定掩码 \(\boldsymbol{S}_\lambda\): $\(\boldsymbol{S}_\lambda = \mathbb{I}(\text{CosSim}(\boldsymbol{z}_\mathcal{M}^k, \boldsymbol{z}_c) > \lambda)\)$ $\(\hat{\boldsymbol{z}}_\mathcal{M}^k = \boldsymbol{S}_\lambda \odot \boldsymbol{z}_c + (1 - \boldsymbol{S}_\lambda) \odot \boldsymbol{z}_\mathcal{M}^k\)$ 该机制保证了模型倾向于修正的潜变量被判定为存在伪影并保留生成补全,而稳定的先验特征被强制锚定。随后通过标准前向扰动映射回时间步 \(\tau\)。
3. 像素约束投影:像素级硬几何约束与流形交替收敛保障
尽管 AMP 能够生成连贯语义,但在早期迭代中相似度掩码往往过于稀疏;更重要的是,VAE 潜空间的高维压缩非完全解耦特性导致潜层特征融合极易产生边界模糊与空间溢出(Spatial Bleeding),使潜编码偏离几何约束子空间 \(\mathcal{V}\)。像素约束投影(Pixel-Constrained Projection, PCP)通过 VAE 解码器将融合特征解码回像素空间,严格按照精确的投影可见性掩码 \(\boldsymbol{M}_c\) 覆盖原始参考像素: $\(\tilde{\boldsymbol{z}}_\mathcal{M}^k = \text{Enc}\big(\boldsymbol{M}_c \odot \boldsymbol{X}_c + (1 - \boldsymbol{M}_c) \odot \text{Dec}(\hat{\boldsymbol{z}}_\mathcal{M}^k)\big)\)$ 在数学本质上,AMP 是向自然视频数据流形 \(\mathcal{M}\) 的投影算子,而 PCP 是向严苛三维几何约束子空间 \(\mathcal{V}\) 的投影算子。两者单步执行均会导致状态向其中一侧偏离,但通过交替执行 \(\boldsymbol{z}_\tau^k \to \hat{\boldsymbol{z}}_\mathcal{M}^k \to \tilde{\boldsymbol{z}}_\mathcal{M}^k \to \boldsymbol{z}_\tau^{k+1}\),交替投影定理从理论上保障了潜编码单调收敛至两集合的最优交集 \(\mathcal{M} \cap \mathcal{V}\)。
4. 辅助轨迹重锚定:早期去噪阶段防累积漂移校准
虽然通过 \(K\) 次交替投影获得了收敛的初始噪声 \(\boldsymbol{z}_\tau^*\),但由于优化过程采用了大步长大步欧拉线性近似,非线性速度场 \(\boldsymbol{v}_\theta\) 在全步长去噪求解过程中仍可能因积分累积误差而发生微小漂移。鉴于扩散模型在生成前期的低频宏观结构成型期对全局布局起决定性作用,NeoMap 在最终的常规 ODE 求解阶段,仅在前 3 个去噪时间步(\(t = \tau' < \tau\))额外施加一次轻量级 AMP 投影,以中间预测结果重新锚定去噪轨迹,消除累积漂移的同时避免了后期过度约束破坏图像高频细节。
实验关键数据¶
主实验¶
实验基于开源主流视频生成大模型 Wan2.2-I2V-A14B 进行评测,采样步数仅设为 15 步。在静态图像合成任务中评测了 Tanks and Temples(包含大幅度相机运镜)和 LLFF(高频周期图案与快速前向运动);在动态单目视频任务中评测了包含复杂运动的 DAVIS 数据集。
表 1:静态图像新视角合成对比(Tanks-and-Temples 与 LLFF 数据集)
| 数据集 | 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | FID-2048 ↓ | CLIP-S ↑ | ATE ↓ |
|---|---|---|---|---|---|---|---|
| Tanks and Temples | TrajectoryAttention | 13.064 | 0.577 | 0.522 | 151.418 | 0.899 | 0.061 |
| ReCamMaster | 11.549 | 0.533 | 0.594 | 139.487 | 0.903 | 0.099 | |
| ViewCrafter | 13.675 | 0.590 | 0.564 | 133.219 | 0.902 | 0.010 | |
| FlexWorld | 14.655 | 0.601 | 0.531 | 92.686 | 0.918 | 0.005 | |
| NVS-Solver | 12.356 | 0.547 | 0.548 | 131.179 | 0.892 | 0.079 | |
| LanPaint | 13.299 | 0.544 | 0.575 | 196.341 | 0.834 | 0.006 | |
| Reversed Noise | 10.715 | 0.435 | 0.520 | 160.994 | 0.902 | 0.029 | |
| Flow Warped Noise | 11.353 | 0.510 | 0.552 | 130.484 | 0.909 | 0.080 | |
| NeoMap (Ours) | 15.250 | 0.596 | 0.486 | 83.341 | 0.935 | 0.008 | |
| LLFF | TrajectoryAttention | 12.557 | 0.356 | 0.498 | 123.126 | 0.923 | 1.644 |
| ReCamMaster | 10.928 | 0.312 | 0.561 | 173.737 | 0.885 | 1.300 | |
| ViewCrafter | 11.573 | 0.344 | 0.594 | 135.944 | 0.907 | 0.864 | |
| FlexWorld | 13.119 | 0.378 | 0.538 | 97.500 | 0.930 | 0.618 | |
| NVS-Solver | 11.418 | 0.304 | 0.531 | 150.368 | 0.895 | 1.925 | |
| LanPaint | 11.946 | 0.334 | 0.506 | 196.799 | 0.862 | 0.543 | |
| Reversed Noise | 10.866 | 0.287 | 0.505 | 148.187 | 0.923 | 1.142 | |
| Flow Warped Noise | 10.678 | 0.261 | 0.538 | 130.105 | 0.941 | 2.011 | |
| NeoMap (Ours) | 13.385 | 0.360 | 0.432 | 80.888 | 0.953 | 0.551 |
在 DAVIS 动态视频新视角合成中,NeoMap 达到 FVD 234.634、FID-2048 68.864、ATE 0.534,显著超越此前最优对比方法 FlexWorld(FVD 243.930、ATE 0.805)及 NVS-Solver(FVD 341.127、ATE 0.996)。
消融实验¶
在 Tanks-and-Temples 数据集上对交替投影迭代轮数 \(K\)、相似度阈值 \(\lambda\)、核心模块有效性及轨迹重锚定步数进行了消融分析。
表 2:核心模块与超参数消融分析(Tanks-and-Temples 数据集)
| 配置编号 | 迭代轮数 \(K\) | 阈值 \(\lambda\) | AMP 模块 | PCP 模块 | 重锚定步数 | FID-192 ↓ | FID-2048 ↓ | CLIP-S ↑ | ATE ↓ | | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | | 1 | - | - | ✗ | ✗ | - | 17.275 | 160.994 | 0.902 | 0.029 | | 2 | 5 | 0.8 | ✓ | ✓ | 3 | 4.864 | 96.359 | 0.923 | 0.010 | | 3 | 10 | 0.8 | ✓ | ✓ | 3 | 4.774 | 88.310 | 0.930 | 0.008 | | 4 | 15 | 0.7 | ✓ | ✓ | 3 | 5.240 | 92.013 | 0.926 | 0.010 | | 5 | 15 | 0.9 | ✓ | ✓ | 3 | 3.976 | 88.237 | 0.933 | 0.022 | | 6 | 15 | 0.8 | ✗ | ✓ | 3 | 4.943 | 91.215 | 0.929 | 0.012 | | 7 | 15 | 0.8 | ✓ | ✗ | 3 | 5.839 | 115.214 | 0.925 | 0.089 | | 8 | 15 | 0.8 | ✓ | 潜空间融合 | 3 | 5.661 | 93.343 | 0.928 | 0.011 | | 9 | 15 | 0.8 | ✓ | ✓ | 0 | 2.773 | 83.750 | 0.940 | 0.017 | | 10 | 15 | 0.8 | ✓ | ✓ | 5 | 4.674 | 86.026 | 0.932 | 0.008 | | 11 | 15 | 0.8 | ✓ | ✓ | 8 | 6.326 | 96.721 | 0.926 | 0.007 | | 12 (PCP) | 15 | 0.8 | ✓ | ✓ | 3步加PCP | 6.893 | 107.733 | 0.909 | 0.006 | | Full | 15 | 0.8 | ✓ | ✓ | 3 | 3.712 | 83.341 | 0.935 | 0.008 |
关键发现¶
- PCP 模块是几何对齐的决定性支柱:完全移除 PCP(配置 7)导致绝对轨迹误差 ATE 激增至 0.089(退化超过 11 倍),FID-2048 恶化至 115.214;而若将 PCP 移至潜空间插值融合(配置 8),FID 与 ATE 亦显著差于像素级覆盖,实证了潜空间混合带来的空间溢出与几何解耦失效。
- AMP 的相似度阈值体现先验平衡:\(\lambda = 0.7\) 时过于宽松,接纳了低质量几何伪影使 FID 恶化;\(\lambda = 0.9\) 时过滤过严,剔除了可靠先验致使 ATE 误差翻倍至 0.022,选定 \(\lambda = 0.8\) 达到保真度与几何约束的最佳平衡。
- 轨迹重锚定权衡生成自由度与相机精度:完全不加重锚定(配置 9)虽因保留最大模型自由度获得最低 FID-192,但 ATE 出现漂移(0.017);超过 3 步后继续增加重锚定(配置 10、11)会压制真实细节导致 FID 单调恶化。选定 3 步以最小的图像质量代价将相机误差收敛至 0.008。
亮点与洞察¶
- 范式颠覆(流形内寻解而非重构映射):打破了必须微调视频模型或在去噪步步施加引导的思维惯性,利用 ODE 确定性反向映射将生成控制归结为初始噪声优化。
- 交替投影理论保障收敛:巧妙构造流形逼近(AMP)与硬几何约束(PCP)两个投影算子,利用集合交替投影的数学性质保证了高保真语义补全与精确视角的双重达成。
- 任务泛化能力极强:通过将时间外推帧标记为不可见区域、已有历史帧标记为可见区域,该框架无需任何修改即可零样本无缝扩展至视频未来外推(Video Future Extrapolation)任务。
局限与展望¶
- 依赖单目几何先验质量:由于首帧几何投影直接依赖基础深度与位姿模型的精度,若参考视角的估计深度出现整体畸变或尺度漂移,初始先验的系统性偏差将传递至交替投影中。
- 单步欧拉近似的精度折中:为兼顾迭代速度,AMP 使用了一步大步长欧拉近似,这在强非线性区域引入了截断误差,需要依赖去噪前期的辅助重锚定进行补偿。
- 未来方向:探索高阶自适应步长流形映射,并将交替投影机制拓展至文本-几何双重约束的多模态具身环境仿真生成中。
相关工作与启发¶
- vs ViewCrafter / FlexWorld: 后者依赖 3D 点云提升与视频去噪模型的任务特定微调,对未见分布泛化脆弱;本文完全免训练,直接利用基础视频生成模型的通用流形。
- vs NVS-Solver: NVS-Solver 在扩散去噪的每一步修改评分函数以融入扭曲先验,破坏了模型内生去噪轨迹的平滑性;本文通过流形交替投影仅优化初始噪声,去噪阶段保持原汁原味的自然生成。
- vs Go-With-The-Flow / Reversed Noise: 传统噪声扰动与光流扭曲仅对可见区域进行噪声搬移,未见遮挡区域缺乏约束且受深度噪声影响严重;本文利用 AMP 的流形投影实现了遮挡区域的高质量语义补全与自适应可见特征锚定。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 颠覆了 NVS 视频生成的微调与在线引导范式,首创通过流形交替投影优化初始噪声。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖单图与单目视频三套公认 Benchmark,包含丰富基线对比与极其详尽的模块参数消融。
- 写作质量: ⭐⭐⭐⭐⭐ 动机清晰直击痛点,数学投影公式简洁严谨,全篇论述自洽连贯。
- 价值: ⭐⭐⭐⭐⭐ 免训练、免微调即可将通用视频生成大模型转化为强悍的 NVS 引擎,实用性与学术启发极大。