跳转至

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://fix-anything.github.io
领域: 3D 视觉
关键词: 新视角合成、视频扩散模型、3D 重建、生成先验修复

一句话总结

FixAnything 提出了一种统一通用先验的渲染修复范式,将 3DGS、NeRF、网格及稀疏点云在稀疏视角下的渲染退化统一表述为隐空间条件视频去噪,结合掩码锚点控制与基于位姿恢复精度的 Flow-DPO 偏好对齐,仅用轻量 LoRA 即可将异构退化渲染修复为兼具高质感与 3D 多视角一致性的逼真视频。

研究背景与动机

基于辐射场与显式几何的 3D 重建技术近年来取得了跨越式进展,但在输入视点极其稀疏或目标轨迹远离观测机位时,现有的各类 3D 表征无一例外都会产生严重的结构与纹理伪影。3D 高斯泼溅(3DGS)因过拟合与欠约束容易在视场外生成大量浮动伪影(floaters);神经辐射场(NeRF)倾向于在未见视角合成雾状弥散结构;网格(mesh)重构在深度不连续与遮挡边缘容易出现破洞与纹理扭曲;而最原始的稀疏点云则充斥着巨大的空间空洞。传统针对此类退化的修复方案大多走“专病专治”的定制化路线:要么针对 NeRF 设计专用的 3D 扩散正则化损失,要么针对 3DGS 定制带有特定时空解码器的视频扩散网络,或者专门引入基于显式深度的相机控制机制。这种专用化路线工程极度繁重,每当涌现出新的 3D 表征,研究者就必须重新搭建网络架构、重新设计条件机制并清洗海量配对数据。

深入观察可以发现,尽管各类 3D 表征的退化形式在视觉表现上截然不同,但它们本质上都保留了底层相机的连续运动轨迹与场景的大致粗糙几何布局,仅仅是偏离了自然真实视频的分布流形。现存的深层矛盾在于:如果直接将这些退化图像送入图像级生成先验,各视角间缺乏时空连贯约束,必然导致视角切换时的严重闪烁与形变;而现有的视频生成模型若缺乏精确的物理几何约束,又容易在跨帧运动时产生局部几何飘移与结构幻觉,进而破坏下游基于运动恢复结构(SfM)的 3D 重建精度。

本文的切入角度是:不再针对特定 3D 表征设计复杂的几何外挂模块,而是直接复用大规模预训练视频生成模型(Wan2.1)内在的多视角与自然视频先验,将修复任务建模为通用的隐空间条件视频去噪。核心 idea:将异构 3D 渲染序列的退化修复统一为视频去噪流,通过通道级拼接粗糙渲染与置信掩码锚定高质输入视角,并以 SfM 相机位姿恢复精度作为奖励信号进行 Flow-DPO 偏好优化,在零额外推理成本下直接注入 3D 几何一致性。

方法详解

整体框架

FixAnything 的整体处理流程分为表征无关的隐空间条件生成与基于几何一致性的偏好对齐两大部分。给定任意 3D 表征(3DGS、NeRF、网格或 COLMAP 稀疏点云),系统首先沿目标相机轨迹渲染得到退化视频序列 \(x \in \mathbb{R}^{T \times 3 \times H \times W}\),并构建二值掩码向量 \(m \in \{0, 1\}^T\) 指示对应帧是否源自已知无瑕疵的真实训练视点。输入视频与掩码通过预训练且冻结的 Wan2.1 VAE 编码后,在潜在通道维度与整流流(Rectified Flow)加噪潜变量完成拼接,送入仅配置轻量 LoRA 的 Wan2.1 扩散 Transformer(DiT)中预测速度场。在监督微调(SFT)之后,流程进一步引入基于 COLMAP 位姿恢复精度的 Flow-DPO 偏好优化,使模型在无需在推理期运行几何优化的前提下内生具备极强的多视角几何连贯性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:任意 3D 渲染序列 + 训练视角二值掩码"] --> B["通道级隐空间条件注入<br/>VAE 编码拼接潜变量与时序掩码"]
    B --> C["掩码感知锚点机制<br/>锚定已知真实视点并向外推断纹理"]
    C --> D["基于位姿精度的几何偏好优化<br/>SfM 重建位姿 AUC 奖励驱动 Flow-DPO"]
    D --> E["输出:高保真且 3D 几何一致的时空视频"]

关键设计

1. 通道级隐空间条件注入:将异构渲染瑕疵统一为视频修复

传统先验增强方法通常为不同 3D 格式设计复杂的分支网络或跨注意力注入机制,导致模型难以泛化且训练成本极高。FixAnything 认为退化渲染本质上提供了精确的相机轨迹与粗略场景轮廓脚手架,因而无需对基础视频生成网络进行任何破坏性架构改造。具体实现中,模型利用预训练且参数冻结的 VAE 编码器将退化渲染视频 \(x\) 映射为条件潜变量 \(z_{\text{cond}} = \mathcal{E}(x)\),将干净目标视频 \(y\) 映射为目标潜变量 \(z_0 = \mathcal{E}(y)\)。在整流流插值时刻 \(t \in [0, 1]\) 下,加噪潜变量定义为: $\(z_t = (1 - t) z_0 + t \epsilon, \quad \epsilon \sim \mathcal{N}(0, \mathbf{I})\)$ 模型将噪声潜变量 \(z_t\)、条件潜变量 \(z_{\text{cond}}\) 以及沿空间广播展开的时序掩码 \(m\) 直接在通道维度进行级联,组合成增广潜变量 \(\hat{z}_t = [z_t ; z_{\text{cond}} ; m]\)。骨干 DiT 网络仅通过引入秩为 64 的 LoRA 适配层(更新参数量不到全模 1%)来拟合速度场 \(v = \epsilon - z_0\)。该设计彻底摆脱了显式相机坐标系(如 Plücker 射线编码)的强监督绑定,仅靠极少量的视频对(如 20 组)便能使通用大模型理解如何沿着粗糙支架将退化画面“投射”回真实自然视频流形。

2. 掩码感知锚点机制:明确置信基准以抑制过度幻觉

在少样本或大基线新视角渲染中,渲染画面的质量在时序上存在剧烈非均匀性:当相机扫过真实训练视点附近时,画面近乎无瑕疵;而远离训练视角时则出现严重的结构崩溃。若令生成模型无差别地“整体润色”,模型极易在原本清晰准确的已知视点区域过度发挥、生成不切实际的幻觉纹理,进而破坏真实场景的保真度。FixAnything 引入的一维二值时序掩码 \(m\) 完美解决了这一矛盾。当且仅当第 \(i\) 帧位于训练视点位置时,\(m_i = 1\)(信任并锚定),其余未知视点则标记为 \(m_i = 0\)(执行修复)。 这一机制赋予了模型两重不可替代的能力:其一,显式告知模型哪些内容是绝对真实的物理基准,严禁在其上随意改动细节与物体;其二,已知训练视点成为整条视频轨迹的时空“锚点”(anchors),引导模型自注意力机制将已知视点中丰富的高频纹理、光照环境与几何边缘沿着时间轴合理传播至临近的破损帧,避免模型凭借无约束先验凭空捏造。消融实验证明,去掉该掩码会导致 PSNR 直接下滑 1.3 dB。

3. 基于位姿精度的几何偏好优化:无额外推理开销注入 3D 一致性

仅依赖流匹配损失(Flow Matching Loss)训练的监督微调模型虽然在单帧感知质量上表现优异,但在时空演化中往往会生成跨帧漂移的“视觉合理但几何虚假”结构(例如随视角平移而发生形变或滑移的独立物体)。若直接将这些视频用于下游 3D 重建,传统特征匹配与 SfM 将由于极线几何关系被破坏而彻底失效。FixAnything 创新性地将多视角几何一致性重新定义为生成偏好对齐问题。 对于每个训练场景,模型固定输入并利用不同随机种子采样 5 个候选修复视频,随后在这些候选视频上运行搭载 SuperPoint 特征与 LightGlue 匹配器的 COLMAP 重建流程,评估其估计机位与真值机位之间的相对旋转精度(RRA)与相对平移精度(RTA),计算 5 度阈值下的曲线下面积(AUC@5°)。选取 AUC 差距不低于 0.2 的输出构建偏好对 \((y_w, y_l)\),并采用针对整流流优化的 Flow-DPO 目标函数进行微调: $\(\mathcal{L}_{\text{DPO}} = -\mathbb{E} \left[ \log \sigma \left( \frac{\beta}{2} (\Delta_l - \Delta_w) \right) \right]\)$ 其中 \(\Delta_w = \|v_w - v_\theta(\hat{z}_t^w, t)\|^2 - \|v_w - v_{\text{ref}}(\hat{z}_t^w, t)\|^2\),\(\Delta_l\) 为对应非偏好项计算值,\(v_{\text{ref}}\) 为 SFT 阶段冻结的参考模型。通过该偏好优化,多视角几何约束被隐式固化进 LoRA 权重中,使位姿估计 AUC@5° 大幅提升 7.2%,且在推理时不产生任何额外的计算开销。

损失函数 / 训练策略

训练分为两个先后串行阶段: 1. 阶段一(SFT 监督微调):在 DL3DV-10K 采样的 500 个配对视频上训练。先在 \(288 \times 512\) 分辨率下进行基础拟合,随后升级至 \(480 \times 832\) 分辨率(每段 61 帧),使用单张 H100 GPU 迭代训练 3000 步。损失函数采用标准流匹配损失 \(\mathcal{L}_{\text{FM}} = \mathbb{E}_{\hat{z}_t, t} \left[ \|v - v_\theta(\hat{z}_t, t)\|^2 \right]\)。 2. 阶段二(Flow-DPO 几何偏好优化):以 SFT 检查点作为参考模型 \(v_{\text{ref}}\),基于 1000 个场景生成的位姿精度偏好数据对 LoRA 适配层继续优化 2000 步。 推理阶段默认使用 50 步 Euler/ODE 去噪积分;对于长视频采用 61 帧滑窗(含重叠区)处理。

实验关键数据

主实验

在 DL3DV 数据集(测试集 20 个独立场景)下,分别测试 3 视角、6 视角和 9 视角极度稀疏输入下的修复性能。FixAnything 使用同一个通用模型分别对 NeRF、3DGS、网格及 COLMAP 稀疏点云渲染结果进行修复,并与原生少样本 3D 重建算法和专用后处理增强算法进行全面横向对比:

方法类型 具体方法 / 输入表征 3 视角 PSNR↑ 3 视角 SSIM↑ 3 视角 LPIPS↓ 6 视角 PSNR↑ 6 视角 SSIM↑ 6 视角 LPIPS↓ 9 视角 PSNR↑ 9 视角 SSIM↑ 9 视角 LPIPS↓
少样本 3D 重建 3DGS 10.97 0.248 0.567 13.34 0.332 0.498 14.99 0.403 0.446
少样本 3D 重建 RegNeRF 11.46 0.214 0.600 12.69 0.236 0.579 12.33 0.219 0.598
少样本 3D 重建 FreeNeRF 10.91 0.211 0.595 12.13 0.230 0.576 12.85 0.241 0.573
少样本 3D 重建 DNGaussian 11.10 0.273 0.579 12.67 0.329 0.547 13.44 0.365 0.539
少样本 3D 重建 FSGS 12.22 0.296 0.535 13.73 0.429 0.540 15.52 0.468 0.416
专用后处理修复 3DGS-Enhancer 14.33 0.424 0.464 16.94 0.565 0.356 18.50 0.630 0.305
专用后处理修复 Xu et al. 14.62 0.471 0.491 17.35 0.566 0.396 19.19 0.616 0.335
专用后处理修复 Difix3D 12.85 0.392 0.557 14.84 0.445 0.462 16.76 0.520 0.399
专用后处理修复 Difix3D+ 12.37 0.363 0.512 14.41 0.424 0.400 16.39 0.498 0.330
FixAnything (Ours) w/ NeRF 渲染 14.22 0.427 0.451 17.01 0.522 0.329 18.86 0.605 0.297
FixAnything (Ours) w/ 3DGS 渲染 15.18 0.452 0.408 17.65 0.561 0.289 19.76 0.632 0.269
FixAnything (Ours) w/ 网格渲染 15.74 0.482 0.366 17.95 0.583 0.269 19.86 0.646 0.233
FixAnything (Ours) w/ 稀疏 SfM 点云 15.52 0.463 0.381 17.74 0.568 0.271 19.72 0.624 0.241

消融实验

1. Flow-DPO 几何偏好优化与掩码机制的作用

配置变体 评估目标 PSNR↑ SSIM↑ LPIPS↓ AUC@5° (%)↑ 关键机制与影响说明
SFT only 基础监督微调 17.51 0.554 0.296 61.12 缺乏显式几何偏好对齐,单帧清晰但存在跨视角浮动幻觉
SFT + Flow-DPO 几何偏好优化 17.65 0.561 0.289 68.32 抑制漂移幻觉,几何位姿精度显著跃升 +7.2%,推理耗时完全不变
No mask (\(m=0\)) 无掩码控制 16.37 0.525 0.311 - 无法区分真实基准帧,模型盲目幻觉导致真实训练视角细节丢失,掉点 1.28 dB
With mask 掩码感知控制 17.65 0.561 0.289 68.32 严格锚定训练视角并作为上下文指导修复,纹理保真度与连续性最佳

2. 训练样本规模与推理步数开销权衡分析

训练视频对数 PSNR↑ SSIM↑ LPIPS↓ 推理去噪步数 PSNR↑ SSIM↑ LPIPS↓ 单卡 H100 耗时 (秒)
20 16.70 0.531 0.309 5 步 18.02 0.574 0.313 31 (加速 10×)
50 17.20 0.548 0.297 10 步 17.91 0.570 0.296 62
100 17.45 0.556 0.292 25 步 17.75 0.564 0.289 155
500 (默认) 17.65 0.561 0.289 50 步 (默认) 17.65 0.561 0.289 309

关键发现

  • 最简单的稀疏点云修复效果竟与密集 3DGS 相当:仅输入 COLMAP 散乱特征点结合端点真实训练视角,修复出的视频质量(6 视角 PSNR 17.74 dB)甚至略微超越了基于密集 3DGS 的专用输入(17.65 dB)。这证明在强视频先验下,中间复杂的 3D 拟合步骤(如 NeRF/3DGS 密集优化)并非不可或缺,渲染的核心作用是提供相机运动轨迹与空间粗略拓扑骨架。
  • 数据需求量极低:不同于既有增强模型动辄需要 8 万至 15 万张配对图像,FixAnything 仅需 20 组视频即可形成良好的修复模式,超过 100 组后收益逐步收敛。这是因为基础视频大模型内部已经吸收了充分的物理世界先验,LoRA 微调的实质只是训练模型理解“退化条件输入”这一映射接口。
  • 极速低步数推理潜力:采用整流流 ODE 特性,去噪步数从 50 步压缩至 5 步时,PSNR 仍高达 18.02 dB,生成一段 61 帧 \(480 \times 832\) 视频仅需 31 秒,为后续结合分布匹配蒸馏(DMD)实现准实时修复打下了基础。

亮点与洞察

  • 从“专模专修”到“大模型一统”的范式跃迁:以往学术界针对 3DGS、NeRF 或网格分别发明独立的后处理工具链,而本文洞察到所有表征的退化本质上都是向真实自然视频流形的偏离,直接用单一模型覆盖四种截然不同的输入格式,展现了视频基础模型的极强泛化底座价值。
  • 巧用 SfM 位姿误差作为强化学习奖励:将多视角立体视觉中最经典可靠的几何判定工具(COLMAP 位姿解算)无缝融入现代扩散模型的偏好对齐流程(Flow-DPO),不仅避免了传统可微渲染器复杂的梯度回传难题,而且把几何先验全部“蒸馏”进静态权重中,实现了零额外推理延迟的高一致性。
  • 基于多随机种子方差的免训练不确定性度量:利用多次推理输出的标准差精确刻画出模型未观测区域与高幻觉区域(如被遮挡建筑物与未知死角),高置信区域的像素 PSNR 高达 25.7 dB,而低置信区域仅 14.4 dB,为后续生成指导的交互式三维采集规划提供了可信指标。

局限与展望

  • 作者承认的局限:模型处理的单次时空窗口仍受限于底层 Wan2.1 的原生长度(61 帧)。超长轨迹必须依靠分块滑窗拼接,在跨 chunk 拼接处或极长轨迹累积下仍可能出现微妙的光照漂移或语义细微变化。
  • 自身发现的局限:在极端大角度外推(如目标机位完全绕到物体的背光背侧,完全不存在任何训练视线重叠)时,尽管视频渲染流畅逼真,但生成的未见细节完全取决于生成先验的幻觉,无法保证几何保真度与现实世界的真实物体绝对一致。
  • 未来改进思路:可探索将 FixAnything 输出的高质量一致性新视角视频重新回传喂入 3DGS 或 NeRF 重建引擎中充当伪监督(Pseudo-GT),构建从“粗几何 → 视频增强 → 密集伪视角 → 紧致高保真 3D 几何”的闭环自迭代重建管线。

相关工作与启发

  • vs 3DGS-Enhancer / Difix3D+: 既有方法大多针对单帧独立微调扩散模型或依赖定制的 3D 解码器,跨帧一致性差且需在渲染后执行昂贵的三维反向蒸馏;FixAnything 直接利用预训练视频模型的时序注意力,一次性输出整段全局连贯视频,且泛化至任意 3D 表征。
  • vs ViewCrafter / GEN3C: 这类方法需要将复杂的相机外参转换成显式 Plücker 坐标或依赖复杂的相机控制器训练,通常需要庞大的训练资源;FixAnything 直接将粗糙渲染视为天然的轨迹与几何载体,无需复杂的几何编码即可完成精准相机路径跟随。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙将异构 3D 瑕疵抽象为视频流形修复,并以 SfM 精度作为 Flow-DPO 几何奖励,立意高远且实现优雅。
  • 实验充分度: ⭐⭐⭐⭐⭐ 跨越 4 种三维表征、多个视点稀疏度对比,消融实验涵盖掩码、DPO、数据量、步数及不确定性分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,动机阐述切中领域长期痛点,框架设计简洁精妙。
  • 价值: ⭐⭐⭐⭐⭐ 为通用视频生成先验赋能三维视觉与新视角合成树立了标杆范式,工程复用价值极高。