跳转至

FreeGen: Feed-Forward Reconstruction–Generation Co-Training for Free-Viewpoint Driving Scene Synthesis

会议: ECCV 2026
论文: ECCV 原文
领域: 自动驾驶
关键词: 自由视角合成, 自动驾驶场景, 前馈3D高斯, 视频扩散模型, 闭环协同训练

一句话总结

FreeGen 提出了一种统一前馈 3D 高斯重建与视频扩散细化的闭环协同训练框架,无需逐场景优化或昂贵的激光雷达标注,仅凭单轨迹图像输入即可在兼顾轨迹内几何一致性的同时实现高保真的任意偏航视角场景合成。

研究背景与动机

自动驾驶系统的大规模策略预训练和闭环闭环仿真评测,高度依赖逼真且视角自由的虚拟驾驶环境构建。然而,无论是 nuScenes、Waymo 等真实车载采集数据集,还是常规仿真渲染数据,绝大多数都仅沿预设单轨迹记录行车视角。当自车执行变道、超车或避让等偏离采集轨迹的动作时,环境模拟必须具备合成偏航视角(off-trajectory)观察画面的能力。在缺乏跨轨迹配对真实视角监督的极端限制下,如何仅凭单轨迹输入实现高质量的自由视角行车场景渲染,构成了学术界与工业界的关键瓶颈。

现有解决方案主要分化为两大流派,但均面临难以调和的内在局限。以 NeRF 和 3D 高斯泼溅(3DGS)为代表的三维重建方法具备极高的轨迹内插值几何一致性,但高度依赖逐场景优化,外推到未观测区域时由于信息匮乏产生严重空洞与模糊伪影;前馈 3D 重建方法虽将推断加速至单次前传,但在外推视角依然缺乏丰富真实的纹理细节。另一侧,基于大规模视频生成先验的扩散模型具备卓越的纹理外推幻化能力,却缺乏精准的三维几何约束,极易引入电线杆缺失、行人扭曲和时序漂移等几何畸变;部分混合方法试图用图像扭曲(image warping)或激光雷达(LiDAR)投影作为扩散条件,但激光雷达在远景建筑与天空区域极度稀疏,图像扭曲则在视角变大时出现严重结构错位,且硬编码几何无法随模型端到端进化。

本文的切入视角在于重新审视重建与生成的强互补性:重建分支提供稳健的底层几何骨架以锚定插值几何一致性,生成分支注入大规模视觉先验以弥补外推真实感。核心 idea:构建一个端到端前馈的三维高斯重建与视频扩散细化架构,并通过采样非轨迹视角生成伪标签的双向闭环协同训练机制,将扩散生成先验蒸馏进高斯表征、将重建几何结构反哺生成模块,彻底消除测试期优化并打破单轨迹视角偏见。

方法详解

整体框架

FreeGen 的完整流程包含两大模型分支与两阶段协同优化。系统输入为稀疏环视多视角图像与相机位姿,先利用单目几何基础模型预测度量深度,随后由前馈三维高斯重建网络提取像素对齐特征并借助三平面可变形注意力解码出全局三维高斯基元,即时光栅化渲染出目标自由视角下的颜色图像、深度图与不透明度图;紧接着,三维几何三元组作为空间先验注入轻量条件编码器,与加噪潜特征通道拼接送入视频扩散模型完成纹理细化;在协同训练阶段,双分支交替充当伪标签生成器与结构判别器,形成自我增强闭环。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    In["稀疏多视角环视图像 + 位姿输入"] --> GRec["前馈高斯几何条件构建<br/>像素特征提取 + 三平面解码 + 栅格化"]
    GRec --> Triplet["几何条件三元组<br/>颜色图像 I_geo + 深度图 D_geo + 不透明度图 A_geo"]
    Triplet --> GDiff["几何感知视频扩散细化<br/>条件潜特征编码 + 通道拼接去噪"]
    GDiff --> Out["最终自由视角合成视频"]
    GDiff -.->|离线轨迹采样生成伪标签| Loop["闭环双向协同训练机制<br/>Step1生成导向重建 ↔ Step2重建导向生成"]
    Loop -.->|蒸馏外观先验与强化结构几何| GRec

关键设计

1. 前馈高斯几何条件构建:提供完整几何与可靠性先验 针对传统逐场景 3DGS 耗时漫长且缺乏跨场景先验的问题,本文采用前馈式三维高斯重建架构作为几何骨架。对于给定的多视角输入图像序列,模型首先结合 Metric3D v2 单目几何基础模型预测初始深度,再利用多视角 U-Net 提取像素对齐的高分辨率特征图;通过 Triplane Transformer 配合可变形注意力机制,将离散视角特征聚合为全局紧凑的三平面体素表征,最终由高斯解码器直接回归 \(K\) 个三维高斯基元的位置、不透明度、尺度、旋转四元数及球谐颜色参数。在任意目标相机轨迹下,通过分块光栅化(tile-based rasterization)并行渲染出颜色图 \(I_{\mathrm{geo}}\)、深度图 \(D_{\mathrm{geo}}\) 与不透明度图 \(A_{\mathrm{geo}}\),共同构成紧凑的几何条件三元组:

\[C_{\mathrm{geo}} = \bigl(I_{\mathrm{geo}},\, D_{\mathrm{geo}},\, A_{\mathrm{geo}}\bigr)\]

深度图赋予扩散模型准确的度量尺度与遮挡边界,而不透明度图则显式编码了三维高斯累积渲染的置信度——高透光区域代表射线投射至未观测空洞或视角盲区,促使后续扩散生成分支针对性地聚焦于低置信度结构进行修补,避免对已收敛的高确定性区域过度幻化。

2. 几何感知视频扩散细化:轻量条件注入保持泛化与时序连贯 为了在赋予模型强大纹理生成能力的同时严防过度参数化破坏预训练生成底座的通用泛化能力,FreeGen 基于大规模预训练视频扩散模型 Stable Video Diffusion(SVD)搭建外观细化分支,并执行轻量级结构干涉。系统设计了一个轻量级可学习条件编码器 \(\mathcal{E}_c\),将光栅化导出的几何三元组 \(C_{\mathrm{geo}}\) 投影为结构潜特征 \(\mathbf{z}_c\)。在扩散训练期间,冻结的图像 VAE 编码器 \(\mathcal{E}_v\) 提取参考帧潜在特征并注入高斯噪声构造扰动潜变量 \(\mathbf{z}_\tau\)。模型直接在通道维度将条件潜特征与噪声潜变量进行拼接并输入 UNet 去噪网络 \(f_\theta\) 进行噪声预测:

\[\hat{\boldsymbol{\epsilon}} = f_\theta(\mathbf{z}_\tau, \mathbf{z}_c)\]

最小化预测噪声与真实噪声间的均方误差 \(\mathcal{L}_{\mathrm{gen}} = \mathbb{E}\big[\|\boldsymbol{\epsilon} - f_\theta(\mathbf{z}_\tau, \mathbf{z}_c)\|_2^2\big]\)。这一极简的拼接结构免去了复杂的交叉注意力重构,最大程度保留了预训练扩散底座的时空物理连贯性先验,使得生成分支能够严格依循高斯几何边界进行材质渲染,彻底抑制了传统视频扩散模型在自由视角下的剧烈视角抖动与拓扑崩溃。

3. 闭环双向协同训练机制:打破单轨迹偏见与消除推断期优化 单向串联重建与扩散模块的致命缺陷在于:前馈重建网络仅受原车行单轨迹监督,外推到横向偏移轨迹时必然产生系统性几何伪影;而生成分支在单轨迹真值监督下无法识别外推伪影,导致级联误差雪上加霜。受闭环训练启发,FreeGen 提出无需测试期优化的交替双向协同训练范式,包含两个交替冻结互训步骤: - 生成导向重建(Step 1: Generation-guided reconstruction):在真实轨迹横向 \([-3\text{m}, 3\text{m}]\) 偏移区间内随机采样新位姿,由当前高斯模型渲染几何条件,送入冻结的扩散模型生成高保真假想视角作为伪标签;随后利用伪标签与原轨迹真值共同反向传播更新高斯重建网络,将辅助伪标签损失权重设为较小的 \(0.1\),既有效将扩散模型的生成先验蒸馏进高斯辐射场,又严格规避了伪标签噪声对底层三维几何的漂移破坏。 - 重建导向生成(Step 2: Reconstruction-guided generation):高斯模型更新后,将 Step 1 中生成的偏航视角反向投影渲染回原始采集轨迹视角;扩散模型以这些重渲染视角为几何条件进行去噪细化,并严格以原轨迹采集的高清真实视频帧为监督目标计算生成损失。由于最终监督完全由真实无偏的原轨迹数据闭环锚定,重渲染视角的扰动在数学上退化为一种强鲁棒的三维空间数据增强,使扩散网络能够主动适应并校正高斯重建的残差伪影。双向交替迭代使重建几何稳定性与生成纹理真实度实现螺旋上升。

损失函数 / 训练策略

重建分支第一阶段在原始单轨迹序列上预训练 50K 步,构建跨时间步监督;第二阶段进入 20K 步协同训练。总重建损失由光度均方误差、感知损失与深度几何一致性损失构成:

\[\mathcal{L}_{\mathrm{recon}} = \mathcal{L}_{\mathrm{mse}} + \lambda_1 \mathcal{L}_{\mathrm{lpips}} + \lambda_2 \mathcal{L}_{\mathrm{depth}}\]

其中超参数设为 \(\lambda_1 = 0.05\)\(\lambda_2 = 0.01\)。生成细化分支采用恒定学习率 \(1\times 10^{-5}\) 预训练 20K 步后,与重建分支共同进入 20K 步协同优化。整体训练仅需 2 张 NVIDIA A100 GPU,推理阶段为纯单次前馈计算,单个 6 帧多视角序列耗时仅数秒,无需任何在线梯度微调。

实验关键数据

主实验

实验在自动驾驶权威基准 nuScenes 上开展,采用官方划分的 700 场景训练集与 150 场景验证集,关键帧标注由 2 Hz 插值至 12 Hz,评测视频长度设为 6 帧,分辨率统一为 \(768 \times 432\)(保持 \(1600 \times 900\) 原始宽高比)。

自由视角外推实验中,沿原轨迹每隔 2 帧采样一次,施加横向 \(\tau \in \{\pm 1\text{m}, \pm 2\text{m}, \pm 4\text{m}\}\) 视角偏移合成视频,以 FID(单帧真实度)和 FVD(视频时序连贯度)为评测指标:

方法 生成底座 偏移 ±1m FID↓ 偏移 ±1m FVD↓ 偏移 ±2m FID↓ 偏移 ±2m FVD↓ 偏移 ±4m FID↓ 偏移 ±4m FVD↓
PVG (IJCV 2026) - 48.15 246.74 60.44 356.23 84.50 501.16
EmerNeRF (ICLR 2024) - 37.57 171.47 52.03 294.55 76.11 497.85
StreetGaussian (ECCV 2024) - 32.12 153.45 43.24 256.91 67.44 429.98
OmniRe (ICLR 2025) - 31.48 152.01 43.31 254.52 67.36 428.20
Image Warping (ICCV 2025) - 32.27 216.69 60.64 344.68 93.27 398.36
Omni-Scene (CVPR 2025) - 12.92 117.49 20.96 205.99 39.47 370.79
DIFIX3D+ (CVPR 2025) SD-Turbo 17.36 143.04 21.73 154.51 30.43 263.69
FreeVS (ICLR 2025) SVD 51.26 431.99 62.04 497.37 77.14 556.14
DiST-4D (ICCV 2025) SVD 10.12 45.14 12.97 68.80 17.57 105.29
FreeGen (本文) SVD 9.47 34.11 11.25 43.28 14.30 66.19
PhiGensis (2025) OpenSora V2.0 9.80 43.80 11.71 67.54 15.51 103.13
WorldSplat (2025)* OpenSora V1.2 8.25 40.17 11.26 47.41 13.38 64.07

(注:WorldSplat 额外使用了高清地图 HDMaps 与 3D 包围盒标注,FreeGen 仅使用纯图像输入即可取得与之相当乃至更优的 FVD 表现)

原轨迹插值一致性实验中,按时间间隔 1 帧、2 帧、4 帧分别构建 Dense、Medium、Sparse 三档难度:

方法 @1 (Dense) PSNR↑ / SSIM↑ / LPIPS↓ / FID↓ @2 (Medium) PSNR↑ / SSIM↑ / LPIPS↓ / FID↓ @4 (Sparse) PSNR↑ / SSIM↑ / LPIPS↓ / FID↓
PVG 23.33 / 0.73 / 0.41 / 39.47 22.08 / 0.71 / 0.41 / 47.25 20.47 / 0.67 / 0.45 / 70.94
DIFIX3D+ 21.73 / 0.65 / 0.37 / 17.59 20.78 / 0.62 / 0.39 / 19.08 19.68 / 0.59 / 0.41 / 23.42
DiST-4D 19.26 / 0.66 / 0.36 / 13.42 18.47 / 0.62 / 0.39 / 15.68 17.55 / 0.58 / 0.43 / 20.64
FreeGen (本文) 23.34 / 0.72 / 0.30 / 9.61 22.29 / 0.69 / 0.32 / 11.25 20.77 / 0.65 / 0.36 / 14.81

消融实验

在 6 个相机视角全景、向左横向偏移 2m 的严苛条件下验证各关键组件对模型性能的贡献(原论文 Table 3 与 Table 4):

各模块消融(Table 3)

配置说明 重建分支 (Rec.) 生成细化 (Gen.) 不透明度引导 (Opacity) 协同训练 (Co-training) FID (-2m)↓ FVD (-2m)↓
(a) 纯前馈重建基线 - - - 23.25 246.73
(b) 引入颜色+深度扩散细化 - - 15.49 60.53
(c) 引入完整几何三元组 - 13.86 57.21
(d) 完整协同训练模型 12.87 48.39

协同训练动力学消融(Table 4)

训练配置 重建分支协同 (Rec. CT) 生成分支协同 (Gen. CT) 纯重建评估 FID↓ / FVD↓ 最终融合评估 FID↓ / FVD↓
初始预训练状态 (Pre-trained) - - 23.25 / 246.73 13.86 / 57.21
仅微调重建分支 (Rec. Only) - 22.23 / 223.39 14.39 / 54.93
仅微调生成分支 (Gen. Only) - 23.25 / 246.73 13.16 / 51.78
完整双向协同训练 (Full Co-training) 22.23 / 223.39 12.87 / 48.39

关键发现

  • 纯重建与纯生成各有显著缺陷:仅使用前馈重建分支时,尽管结构不发生崩塌,但因外推信息缺失导致 FVD 高达 246.73;而仅依靠扩散模型生成时,由于缺乏稳固的连续几何,时序一致性与空间几何漂移严重(如 DiST-4D 在 ±4m 时 FVD 恶化至 105.29)。
  • 协同训练实现“1+1>2”:表 4 显示,若仅更新重建分支(Rec. Only),因改变了几何条件分布导致未调优的生成分支难以适应,最终融合 FID 反而劣化至 14.39;仅更新生成分支则受制于原始几何渲染误差。唯有交替联合协同训练,才能同步使纯重建质量(FVD 从 246.73 降至 223.39)和最终生成质量(FVD 从 57.21 降至 48.39)获得全面提升。
  • 不透明度图是高效的置信度注意力掩码:在几何条件中引入不透明度图使 FID 从 15.49 进一步压降至 13.86,定性可视化证明其成功引导扩散模型聚焦于未观测盲区进行填充,保护了已有真实结构。

亮点与洞察

  • 闭环伪标签循环消除测试期优化:先前如 DIFIX3D+、StreetCrafter 等前沿方法通常需要在推理阶段进行逐场景反向传播与测试期优化,单场景耗费数小时至数天;FreeGen 将扩散先验的蒸馏前置于端到端离线协同训练闭环中,实现了推断期纯前馈单次前传(数秒级完成),极具工程落地的扩展性。
  • 无须 3D 边界盒与激光雷达等昂贵标注:许多自动驾驶 4D 生成方案严重依赖密集的激光雷达点云投影、高清地图(HDMaps)或三维包围盒监督,成本高昂且受限于传感器分布;FreeGen 仅凭廉价单目视频与通用的深度估计先验即达到了与强标注方法 WorldSplat 相当的生成水准。
  • 几何与生成互补泛化通用性:将 3DGS 渲染的不透明度图作为可靠性先验是极具迁移价值的技巧。该设计同样能够自然拓展至室内机器人导航视点生成、无人机大范围建图等任意受限单轨迹外推场景。

局限与展望

  • 动态物体解耦与独立控制能力有待加强:当前前馈重建架构直接将动态车辆与静态背景融合构建为全局三维高斯,在剧烈交互工况下对于快速变道他车的局部几何重建仍有一定拖影。
  • 极端偏航距离下的视差外推边界:当横向偏移超过 \(\pm 4\text{m}\) 时,单轨迹输入所能捕捉到的视差交叠区极度受限,此时视觉质量高度依赖预训练扩散模型的幻化,物理绝对一致性可能出现轻微滑移。
  • 未来方向:可进一步引入多物体分解的结构化高斯节点,或者结合自动驾驶行为规划器(Planner)进行端到端闭环决策仿真验证。

相关工作与启发

  • vs PVG / StreetGaussian / OmniRe:传统三维高斯方法采用逐场景在线拟合,极度过拟合单轨迹已知视锥,横向外推时即刻出现剧烈模糊;FreeGen 采用前馈先验并在协同训练中融入视频扩散先验,无需在线优化且外推真实度大幅领先。
  • vs DiST-4D / FreeVS:DiST-4D 依赖图像扭曲及激光雷达深度,存在结构断裂与远景缺失;FreeVS 激光雷达投影极度稀疏。FreeGen 的全景前馈 3DGS 提供了稠密完整的几何与不透明度先验,且协同机制消除了单轨迹下几何伪影造成的恶性循环。
  • vs WorldSplat / PhiGensis:WorldSplat 与 PhiGensis 基于 DiT 架构并在训练中重度依赖 HDMaps 和 3D 边界框空间标注;FreeGen 在纯图像弱先验设定下取得了领先的 FVD(时序连贯度)表现,且单向设计被 FreeGen 的闭环互训全面超越。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次实现前馈 3DGS 重建与视频扩散在自由视角自动驾驶场景下的双向闭环协同训练,架构设计简洁深刻]
  • 实验充分度: ⭐⭐⭐⭐⭐ [nuScenes 基准上在不同偏移跨度(1m/2m/4m)及不同时间跨度下进行了详尽的单帧、视频度量对比与动力学消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题动机剖析清晰透彻,互补性设计思路水到渠成,图表与符号表达规范自洽]
  • 价值: ⭐⭐⭐⭐⭐ [摆脱了昂贵的激光雷达标注与低效的测试期优化,为自动驾驶高保真闭环仿真提供了实用高效的前馈生成范式]