跳转至

GeoV2V: Geometry-Grounded Video Diffusion Model for Driving Scene Generation

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://xiyuche.github.io/GeoV2V/
领域: 视频生成
关键词: 新视角合成, 视频扩散模型, 自动驾驶仿真, 几何先验, 跨车道外推

一句话总结

基于 Wan 2.1 主干提出几何引导视频扩散模型 GeoV2V 与多车道同步仿真数据集 Para4D,通过分层解耦注入密集深度与稀疏 LiDAR 先验,在无需 3D 边界框标注的前提下实现了大横向变道轨迹下高保真、几何连贯且保持动态瞬态光影的新视角驾驶视频生成。

研究背景与动机

在自动驾驶仿真和端到端世界模型构建中,合成未见轨迹下的驾驶场景视频是一项关键能力。不同于简单的视点内插,变道或横向平移模拟要求模型从单条录制轨迹向侧向大幅外推数米,同时完整保留场景的三维空间几何布局以及周围移动车辆、行人的时序动态。现有的新视角合成方法主要分为显式三维重建与“重建后修复”生成两类方案。传统的神经辐射场(NeRF)和三维高斯泼溅(3DGS)高度依赖轨迹视角的密集连续覆盖,在视角插值上指标优秀,但在横向外推时极易因视差剧变和视线盲区而产生撕裂、空洞与悬浮伪影;而依托着色点云投影作为条件的单帧扩散修复方法(如 FreeVS、StreetCrafter 等),虽然单帧视觉细节尚可,却往往缺乏长程时空连贯性,容易导致物体形变与时序闪烁。更为棘手的是,真实道路视频包含车灯频闪、路面湿滑反光、雨雾水滴等复杂的动态光影和成像介质效应,这些因素很难依赖显式几何图元进行解析建模。

直接学习鲁棒的跨轨迹驾驶视频生成,面临的一个根本性障碍是真实世界监督数据的缺失。现有的自动驾驶数据集(如 Waymo、nuScenes)均由单车沿单一路线采集,不存在同一动态场景下多条平行车道完全时间同步的成对观测视频。以往研究被迫采用存在视差误差的侧向环视相机或非同步邻近帧构造弱监督,导致模型难以学习纯粹由横向平移引发的严密投影几何变换。

本文的切入点在于:将高质量多轨迹监督与强大的通用视频扩散基础模型深度融合。作者一方面基于 CARLA 构建了具有毫米级位姿精度与完美时空对齐的多车道合成数据集 Para4D,提供高达 4 米横向平移的真值动态视频;另一方面提出以 Wan 2.1 DiT 为主干的视频到视频扩散架构 GeoV2V。核心 idea:将单帧密集深度重投影与稀疏 LiDAR 点云拆解为分层几何先验分别注入 DiT 前后层,结合 RoPE 帧维度拼接源视频隐变量,在端到端视频去噪中免标注解耦几何结构约束与隐式复杂光影演化。

方法详解

整体框架

GeoV2V 旨在接收单视角真实驾驶视频 \(V_{src} = \{I_t\}_{t=1}^T\) 及指定的目标相机外参轨迹,直接合成对应的新轨迹视频 \(V_{tgt}\)。整个生成管线包含两大部分:多模态 3D 几何先验预处理分支与几何引导的视频到视频扩散去噪主干。在几何先验分支中,系统基于单帧深度估计与补全算法构建全局稠密点云,同时保留原始稀疏 LiDAR 点云,分别重投影至目标视角,并通过深度感知形态学滤波修补投影空洞;在扩散主干中,基于 1.3B 参数的 Wan 2.1 DiT 模型,通过帧维度拼接与旋转位置编码(RoPE)引入完整源视频作为外观与动态条件,并采用分层 ControlNet 分别在浅层和深层注入稠密深度与稀疏激光几何先验,实现精准受控的几何外推。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:源视角视频与目标轨迹"] --> B["多模态 3D 先验与形态学修补<br/>单帧深度重投影与稀疏 LiDAR 分离投影"]
    B --> C["时空双重全视频条件注入<br/>源视频隐变量帧维拼接 + 相机姿态编码"]
    C --> D["分层解耦几何注入机制<br/>前15层注入密集深度 + 后15层注入稀疏LiDAR"]
    D --> E["参数高效微调与两阶段训练<br/>冻结 FFN 层 + 独立收敛 LiDAR 控制分支"]
    E --> F["输出:横向变道新视角视频"]

关键设计

1. 多模态 3D 先验与形态学修补:兼顾全局稠密覆盖与局部高精结构

为了向扩散模型提供可靠的三维场景骨架而又不牺牲模型建模复杂动态的灵活性,GeoV2V 坚持在单帧层面上构建三维先验,刻意不引入显式跨帧刚性运动跟踪,从而避免了对繁重 3D 目标检测框的依赖。针对激光雷达点云虽精度高但线束稀疏的缺陷,该模块结合 Video Depth Anything 估计的密集深度与深度补全模型,生成稠密的重投影伪图像,与原始 LiDAR 投影图像分开独立表示。然而,单视角重投影至侧向偏移视角时,由于几何视差与遮挡断裂,投影伪图上不可避免地产生网格状空洞裂隙;若采用简单的双线性插值或无约束最近邻修补,容易错误地将前景物体的色彩蔓延至远景背景中。为此,设计了基于深度一致性约束的形态学修复算法:

首先对有效投影掩码 \(M\) 进行形态学闭运算获取待填充候选区域 \(\Omega = ((M \oplus \mathcal{S}) \ominus \mathcal{S}) \setminus M\);对于空洞像素 \(u \in \Omega\),寻找其在欧氏距离下的最近有效点 \(u_n = \arg\min_{v \in M} \|u - v\|_2\),并定义深度一致邻域 \(\mathcal{N}_d(u) = \{ v \in M \mid \|u - v\|_2 < r, |D(v) - D(u_n)| < \tau \}\);最终填充值通过空域高斯加权平均求得:

\[ \hat{I}(u) = \frac{\sum_{v \in \mathcal{N}_d(u)} w(u, v) I(v)}{\sum_{v \in \mathcal{N}_d(u)} w(u, v)}, \quad w(u, v) = \exp\left(-\frac{\|u - v\|_2^2}{\sigma^2}\right) \]

该设计严格限制色彩仅在深度差小于阈值 \(\tau\) 的同平面几何邻域内蔓延,有效遏制了前景越界污染,为下游扩散生成提供了稳定低噪的粗几何引导。

2. 时空双重全视频条件注入:无显式注意力开销的长程动态传递

在新视角生成过程中,源视角视频蕴含着最为丰富的瞬时动态、材质反射和细节演化,但源视点与目标视点之间并不存在简单的刚性像素对齐。传统方法若引入跨视角的全局交叉注意力,将大幅增加三维时空序列的显存与计算开销。借鉴 ReCamMaster 的思路,模型在时间和空间两个维度分别实施条件注入。在时间维度上,直接利用 Wan 2.1 DiT 自带的旋转位置编码(RoPE),将源视角隐码与目标视角带噪隐码沿着帧维度(时序序列轴)进行直接拼接。这种拼接形式确保了在注意力计算中,同一时刻的源帧与目标帧始终保持恒定的相对位置偏置,使网络能够在常规自注意力计算中直接利用长程时空关联检索外观与运动,无需额外开辟交互分支;在空间维度上,将每帧相机的相对外参位姿编码为相机嵌入向量并加和到对应帧潜变量中,赋予模型显式的视线偏转敏感度。

3. 分层解耦几何注入机制:粗细先验分离避免控制信号干扰

尽管相机姿态嵌入提供了视点方向,但仅靠姿态不足以约束复杂的路面起伏与车辆形变。为此,GeoV2V 将预处理得到的密集深度补全图与稀疏 LiDAR 点云图作为显式几何先验引入去噪流程。不同于简单将两者相加或通道拼接的做法,本文考虑到了深度图(全局覆盖好但边缘有平滑漂移)与激光点云(局部绝对精准但极度离散稀疏)的互补与互斥特性,采用分层分阶段注入策略:在 30 层的 DiT 结构中,前 15 层主要决定宏观视点与大范围场景构型,故在此接入稠密深度重投影先验;后 15 层负责刻画细粒度纹理与几何边界,故接入由专用 ConvNeXt 编码提取的稀疏 LiDAR 几何特征。两个先验控制分支均以参数量仅为 61M 的轻量 ControlNet 实现,既不会让强烈的几何条件抹杀基础视频模型的纹理生成能力,又实现了空间几何对齐与纹理保真度的精细平衡。

4. 参数高效微调与两阶段训练:防止激光分布过拟合并保持泛化性

为防止大模型在大规模驾驶场景微调过程中破坏预训练视频生成模型中蕴含的通用物理先验与复杂纹理生成能力,训练时完全冻结 Wan 2.1 骨干网络中的全部前馈网络(FFN)层,仅对自注意力模块与相机位姿注入层进行参数微调。此外,不同自动驾驶数据集之间的激光雷达线束分布和反射强度差异极大(例如 Waymo 与 nuScenes 存在扫描图案和点云密度上的显著域差),若混合端到端联合优化,容易使网络过拟合到特定的点云图案。GeoV2V 采用两阶段解耦训练范式:第一阶段仅针对密集深度先验与主干进行训练直至收敛,确立稳健的跨视角透视变换能力;第二阶段冻结已训练好的主干,单独训练激光雷达注入的 ConvNeXt 与轻量 ControlNet。该策略确保了模型即使在仅用 CARLA 仿真数据训练的情况下,也能零样本迁移至真实物理世界中具有不同传感器配置的驾驶数据集。

实验关键数据

主实验

评估在 Waymo、nuScenes 真实数据集以及本文构建的 Para4D 仿真基准上展开。在真实数据集的变道(Lane-shifting,偏移 1m、2m、4m)场景下,由于缺乏多车道真值视频,采用 FID 衡量单帧逼真度,采用 FVD 衡量时序连贯性;在 Para4D 数据集上则具备严格对齐的多轨迹真值,评估 PSNR、SSIM、LPIPS 及 FID 指标。

数据集 偏移距离 评估指标 Ours 最佳对比基线 对比基线名称 表现增益
Waymo (真实) 1m FID (↓) 17.53 18.69 StreetCrafter -1.16
Waymo (真实) 1m FVD (↓) 159.00 212.56 StreetGS -53.56
Waymo (真实) 2m FVD (↓) 232.06 272.85 StreetCrafter -40.79
Waymo (真实) 4m FVD (↓) 328.69 369.64 StreetCrafter -40.95
Para4D (仿真) 1m PSNR (↑) 25.18 24.34 StreetGS +0.84 dB
Para4D (仿真) 1m LPIPS (↓) 0.040 0.172 StreetGS -0.132
Para4D (仿真) 2m PSNR (↑) 23.88 23.00 StreetGS +0.88 dB
Para4D (仿真) 2m LPIPS (↓) 0.051 0.181 StreetGS -0.130
Para4D (仿真) 4m PSNR (↑) 21.31 19.85 StreetGS +1.46 dB
Para4D (仿真) 4m LPIPS (↓) 0.080 0.291 StreetGS -0.211

消融实验

在 Para4D 数据集 2m 变道偏移设置下,对各模块的贡献度进行消融验证(测试 PSNR、SSIM 和 LPIPS 指标):

配置方案 PSNR (dB) SSIM LPIPS 配置说明与结论
Full priors (完整模型) 23.88 0.697 0.051 包含稠密深度+稀疏LiDAR+完整源视频+Para4D训练
w/o video (移除源视频输入) 23.28 0.695 0.052 像素级指标变化有限,但物体细节因深度误差产生形变
w/o geometry (dense) 17.18 0.504 0.124 去除密集深度先验,模型无法响应几何位移,指标暴跌
w/o geometry (sparse) 22.86 0.668 0.058 去除稀疏 LiDAR,精细几何边界受损,PSNR 下降 1.02 dB
w/o geometry (both) 16.45 0.490 0.128 完全失去几何先验,生成画面结构彻底崩溃
w/o Para4D (用侧向错位视图训练) 20.92 0.593 0.102 缺乏成对多车道监督导致视差错配,性能显著衰退

关键发现

  • 密集几何先验是跨车道外推的生命线:消融数据显示,移除密集深度先验(w/o geometry (dense))导致 PSNR 从 23.88 骤降至 17.18 dB,LPIPS 恶化一倍以上;定性对比显示缺少该先验时模型甚至无法感知视角的横向平移,证明单凭相机姿态不足以引导 DiT 完成剧烈的大视差几何形变。
  • 成对平行轨迹监督不可或缺:若不采用 Para4D 数据集的多车道同步监督,而是使用传统侧向环视相机生成的弱对齐视图训练(w/o Para4D),PSNR 下降近 3 dB 且 LPIPS 从 0.051 跃升至 0.102。真实多车道同步真值对于解耦自车平移与动态目标位移至关重要。
  • 端到端视频扩散隐式保持非刚体动态光影:定性实验(论文 Fig. 1、Fig. 2 和 Fig. 7)表明,传统显式 3D 重建或逐帧修复方法均无法维持车窗雨滴、地面漫反射以及转向灯闪烁的时序连贯性,而 GeoV2V 无需针对光影设计专门的物理渲染方程,凭借通用视频生成基础模型的时空建模能力即能自然还原动态光效。

亮点与洞察

  • 先验分层注入避让策略:根据 DiT 浅层决定视点构型、深层雕琢细节的特性,将连续稠密先验与离散激光先验划分为前 15 层与后 15 层解耦控制,以轻巧架构避免了异构多模态信号间的相互干扰。
  • 无显式注意力代价的时序条件化:巧妙复用 DiT 既有的 RoPE 位置编码,通过沿时间帧维度拼接源视频隐码与目标去噪隐码,用极低算力开销达成了高一致性的跨视点运动传递。
  • 纯仿真训练具备强大的零样本跨域能力:在仅使用 CARLA 合成数据 Para4D 进行训练的情况下,直接迁移到 Waymo 等真实驾驶场景中仍能取得超越专门针对该数据集拟合的 SOTA 方法的 FVD 表现。

局限与展望

  • 极端大位移与极端遮挡下的幻觉:当车辆横向平移幅度超过 4 米以上,原本被完全遮挡的非视距区域无法获得先验几何支撑,扩散模型仍可能根据常识“脑补”生成合理但与真实世界不完全一致的动态物体。
  • 现有评估指标对动态光影不敏感:作者在论文中指出,当前的像素级指标(PSNR/SSIM)无法客观量化车灯频闪、挡风玻璃雨滴等瞬态光学现象的保真度,亟需针对高阶视觉动态与边缘工况仿真开发专用的量化评测基准。

相关工作与启发

  • vs 显式重建方法(StreetGS / EmerNeRF / OmniRe):显式方法需要针对动态车辆手动标注 3D 边界框并分别建模刚体运动,计算开销巨大且对视角外推适应性差;GeoV2V 无需任何 3D 框标注,利用视频扩散模型直接端到端学会几何与光影变换。
  • vs 重建再修复方法(FreeVS / StreetCrafter):FreeVS 依赖着色点云单帧独立去噪,生成视频闪烁严重且存在运动畸变;GeoV2V 采用全视频时序拼接输入与分层先验注入,在 4m 变道任务中 FVD 显著降低(从 445.36 降至 328.69)。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [提出分层解耦几何注入机制与免 3D 框的跨车道视频外推架构,构建首个多车道同步 4D 仿真数据集]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 Waymo、nuScenes 与 Para4D,包含插值与 1m/2m/4m 变道外推,提供详实的消融与时序光影对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑紧密,架构与几何修补机制数学阐述清晰]
  • 价值: ⭐⭐⭐⭐⭐ [为端到端自动驾驶仿真与高保真闭环世界模型提供了一条兼顾几何精度与复杂光影的可扩展范式]