ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://recamdriving.github.io/
领域: 视频生成
关键词: 视频生成 / 自动驾驶 / 新轨迹合成 / 3D高斯泼溅 / 相机控制
一句话总结¶
针对自动驾驶新轨迹视频生成中现有修复模型易过拟合局部伪影、LiDAR几何线索稀疏失真等问题,ReCamDriving 提出纯视觉的两阶段渐进式扩散生成框架与跨轨迹数据构建策略(ParaDrive),利用稠密 3DGS 渲染作为结构引导,实现了精准的视角控制与高保真 3D 几何一致性。
研究背景与动机¶
高质量的多视角、多轨迹自动驾驶视频对于端到端感知重建与世界模型训练至关重要。然而在物理现实中采集真实的多车并行或多轨迹数据成本极高,需要大量同步传感器车队。因此,利用单程采集的单路行驶视频合成真实可信的新轨迹视频成为了极具吸引力的可扩展替代方案。
针对单程视频的新轨迹合成,现有方法主要分为两类且各有瓶颈:第一类是“先重建后修复”范式(如 Difix3D+、GSFixer),即先用 3DGS 或 NeRF 重建场景并沿偏移动态渲染,再训练扩散模型修补视角外推带来的伪影与黑边。这类方法本质上是在学训练集中的局部退化修复映射,一旦推理时遇到大偏移动态带来的分布外(OOD)伪影,往往引发结构畸变与时空不一致。第二类是“相机控制视频生成”范式(如 FreeVS、StreetCrafter),利用源视频结合目标位姿与稀疏 LiDAR 点云投影作条件引导。然而 LiDAR 点云在远景与遮挡区域天然稀疏缺失,导致天空、远景及反光表面结构坍塌;且由于缺乏实测横向平行轨迹真值,以往模型只能用同车道前后纵向片段做伪配对训练,导致横向变道与大幅平移场景下泛化性能大幅下降。
本文的核心切入点在于:与其将 3DGS 渲染作为待修复的破损画面,不如将其结构完备的三维先验作为扩散模型的稠密几何骨架;同时通过“逆向思维”构建数据监督,将跨轨迹生成的训练与推理几何变换彻底对齐。核心 idea:抛弃昂贵且稀疏的 LiDAR 约束,采用两阶段解耦训练让扩散模型将 3DGS 渲染作为粗对齐后的结构脚手架而非修复模板,并提出基于 3DGS 渲染为源、实拍视频为真值的逆向跨轨迹数据配对策略构建 110K 样本的 ParaDrive 数据集。
方法详解¶
整体框架¶
ReCamDriving 接收源轨迹视频 \(V_s\) 与目标轨迹相对位姿 \(\Delta T\),合成具有横向偏移的新轨迹视频 \(V_t\)。为防止模型在输入 3DGS 渲染时走捷径坍塌为普通的局部图像修复网络,框架采用两阶段渐进式训练方案:第一阶段仅注入相对相机位姿条件,使扩散网络掌握将源视角特征粗对齐到目标视角的核心能力;第二阶段冻结第一阶段的核心自注意力,引入专用渲染自注意力和交叉注意力层,吸纳目标轨迹的 3DGS 粗渲染作为稠密空间几何引导。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:源轨迹视频 + 相对位姿 ΔT"] --> B["阶段一:相对位姿粗控生成<br/>解耦位姿编码与单路粗几何对齐"]
B --> C["阶段二:3DGS 稠密渲染几何精调<br/>冻结主干引入渲染注意力与交叉注意力"]
C --> D["逆向跨轨迹数据构建(ParaDrive)<br/>生成多级退化 3DGS 渲染作为训练源并对齐推理"]
D --> E["输出:高保真 3D 一致新轨迹视频"]
关键设计¶
1. 阶段一:相对位姿粗控生成(解耦位姿与可学习帧嵌入) 针对直接将源隐变量与噪声隐变量简单拼接导致的网络无法区分视角归属问题,本文设计了正规化的解耦位姿注入机制。相机编码器 \(E_{\text{cam}}\) 分别对两轨迹间的相对位姿 \(\Delta T = T_{t \leftarrow s} \in \mathrm{SE}(3)\) 与单位位姿 \(T_I = I_4\) 进行编码,得到相对位姿嵌入 \(c_r\) 与单位位姿嵌入 \(c_I\)。同时引入可学习的帧嵌入 \(E_f\) 辅助时序对齐: $\(x_i = \text{Cat}(x_t + c_r + E_f, \; x_s + c_I + E_f)\)$ 拼接特征输入至 \(N\) 层 Diffusion Transformer (DiT) 块。在此阶段,模型仅微调 Self-Attention 与归一化层,在 Flow Matching 目标下优化速度场预测,迫使主干网络首先学会利用相对几何运动把源视频像素在隐空间完成粗糙视点搬移。
2. 阶段二:3DGS 稠密渲染几何精调(冻结主干与解耦注意力分支) 在粗控主干训练完成后,若将 3DGS 渲染 \(V_{\text{gs}}\) 直接端到端输入,由于渲染视点与目标真值视点重合,模型会倾向于忽视跨视角几何推理而退化成轻量修图模型。为此,作者在第二阶段完全冻结阶段一训练好的 Self-Attention 层,保持粗变换能力,并在每个 DiT 块中追加 Rendering Attention 与 Cross Attention。\(V_{\text{gs}}\) 经过 3D VAE 编码并叠加相对位姿与帧嵌入后得到 \(\bar{x}_{\text{gs}}\),先通过 Rendering Attention 提炼时空几何特征,再作为 Key 和 Value 经由 Cross Attention 调制已完成粗对齐的扩散隐变量 \(\bar{x}_i\)。这种解耦架构让 3DGS 渲染仅仅承担几何骨架(Scaffold)的引导作用,从根本上杜绝了对局部渲染缺陷的过拟合。
3. 逆向跨轨迹数据构建与 ParaDrive 数据集 真实车载采集极少具备平行双车道同时同速实拍数据,以往纵向切割轨迹训练(前后段伪配对)导致模型在横向变道外推时泛化崩塌。本文提出基于 3DGS 的逆向跨轨迹构建方案:先使用 DriveStudio 基于单路视频重建场景 3DGS,并虚拟平移相机渲染横向偏移轨迹;鉴于该渲染带有伪影无法充当 Target 真值,论文巧妙地将其作为训练阶段的 Source 输入,而将真实的实拍视频作为真值 Supervision。在推理时,输入恢复为实拍视频生成渲染轨迹。为了使模型适应推理时 3DGS 渲染的不同伪影程度,作者在 3DGS 训练的第 100、500、1000 步保存未收敛检查点生成带伪影的几何条件,并用 30K 步模型生成 \(\pm1\text{m}, \pm2\text{m}, \pm3\text{m}, \pm4\text{m}\) 的 8 路平移序列,耗费 8240 L20 GPU 时,构建包含 110K 轨迹对的 ParaDrive 数据集。
损失函数 / 训练策略¶
模型基于 Rectified Flow Matching 框架训练。在目标位姿与几何条件 \(c_{\text{cam}}\) 下,前向加噪过程定义为噪声 \(x_0 \sim \mathcal{N}(0, I)\) 与数据 \(x_1\) 间的直线插值 \(x_t = t x_1 + (1-t) x_0\),目标速度场恒为 \(v_t = x_1 - x_0\)。优化目标函数为: $\(\mathcal{L}_{\text{FM}} = \mathbb{E}_{x_0, x_1, c_{\text{cam}}, t} \left\| \epsilon_\theta(x_t; c_{\text{cam}}, t) - (x_1 - x_0) \right\|_2^2\)$ 两个阶段均在 64 张 NVIDIA A100 GPU 上各微调 6,000 步,batch size 为 1,学习率 1e-4,训练分辨率为 \(480 \times 832\),序列长度为 121 帧。基座模型初始化自 Wan2.1 视频生成大模型,相机编码器与自注意力层则初始化自 ReCamMaster 权重。
实验关键数据¶
主实验¶
在 Waymo Open Dataset (WOD) 验证集上,与当前代表性 3D 重建渲染(DriveStudio)、渲染修复(Difix3D+)及相机控制视频生成方法(FreeVS、StreetCrafter)进行不同横向偏移幅度下的定量对比(摘自原文 Table 1 与 Table 2)。
Table 1: WOD 验证集新轨迹生成画质与一致性对比
| 评估指标 / 偏移量 | 方法 | 图像质量 IQ↑ | 时序一致性误差 TCE↓ | 图像保真度 FID↓ | 视频保真度 FVD↓ | 跨视角语义 CLIP-V↑ |
|---|---|---|---|---|---|---|
| Offset ±1m | DriveStudio | 52.13 | 7.93 | 83.32 | 25.37 | 94.78 |
| Difix3D+ | 64.24 | 7.81 | 56.35 | 27.80 | 95.32 | |
| FreeVS | 62.74 | 11.27 | 63.06 | 37.06 | 88.99 | |
| StreetCrafter | 63.57 | 9.72 | 28.18 | 20.51 | 96.01 | |
| Ours | 65.18 | 3.38 | 13.76 | 13.27 | 97.96 | |
| Offset ±4m | DriveStudio | 41.47 | 9.49 | 144.05 | 72.50 | 88.76 |
| Difix3D+ | 58.81 | 10.49 | 78.08 | 65.37 | 90.12 | |
| FreeVS | 56.15 | 14.35 | 107.04 | 58.39 | 85.17 | |
| StreetCrafter | 59.89 | 12.38 | 68.73 | 36.67 | 91.17 | |
| Ours | 61.32 | 4.30 | 32.36 | 26.76 | 94.91 |
Table 2: WOD 验证集相机位姿还原精度对比 (MegaSaM 估计)
| 方法 | Offset ±1m RErr.↓ / TErr.↓ | Offset ±2m RErr.↓ / TErr.↓ | Offset ±3m RErr.↓ / TErr.↓ | Offset ±4m RErr.↓ / TErr.↓ |
|---|---|---|---|---|
| Difix3D+ | 1.36 / 2.42 | 1.64 / 2.66 | 2.01 / 2.97 | 2.68 / 3.12 |
| FreeVS | 1.71 / 2.88 | 2.12 / 2.93 | 3.17 / 3.78 | 3.02 / 3.39 |
| StreetCrafter | 1.52 / 2.53 | 1.79 / 2.77 | 1.91 / 3.13 | 2.87 / 3.03 |
| Ours | 1.32 / 2.37 | 1.45 / 2.43 | 1.63 / 2.65 | 1.57 / 2.73 |
消融实验¶
评估相机几何引导条件(Table 4)与两阶段训练策略(Table 6)的有效性。
Table 4: WOD 验证集相机引导条件消融 (Table 4)
| 相机条件配置 | IQ↑ | FID↓ | FVD↓ | 旋转误差 RErr.↓ | 平移误差 TErr.↓ |
|---|---|---|---|---|---|
| 仅位姿 (Pose only) | 60.13 | 34.86 | 32.31 | 3.01 | 4.23 |
| 位姿 + 稀疏激光 (Pose + LiDAR) | 61.32 | 31.23 | 27.78 | 1.53 | 2.69 |
| 位姿 + 激光 + 3DGS (Pose + LiDAR + GS) | 63.42 | 24.75 | 19.27 | 1.41 | 2.47 |
| 位姿 + 3DGS (Pose + GS, 本文方案) | 63.63 | 24.88 | 19.18 | 1.49 | 2.55 |
Table 6: 两阶段渐进式训练消融 (Table 6)
| 训练策略 | 图像质量 IQ↑ | 图像保真度 FID↓ | 视频保真度 FVD↓ | 跨视角语义 CLIP-V↑ |
|---|---|---|---|---|
| 单阶段联合训练 (One-stage) | 59.97 | 32.64 | 25.16 | 94.78 |
| 两阶段渐进式训练 (Two-stage, 本文方案) | 63.42 | 25.13 | 18.32 | 96.32 |
关键发现¶
- 3DGS 稠密引导彻底胜过稀疏 LiDAR:Table 4 显示单纯加入 LiDAR 相比纯位姿虽有增益,但在引入 3DGS 后,再额外堆叠 LiDAR 对 FID (24.88 vs 24.75) 和 FVD (19.18 vs 19.27) 几乎无额外增益,证明纯视觉稠密先验已完全足以支撑视角控制,彻底摆脱了自动驾驶对高成本激光雷达标定的依赖。
- 两阶段解耦是防御“走捷径修复”的核心支柱:Table 6 表明单阶段训练的 FID 劣化到 32.64,FVD 劣化到 25.16。定性分析(Fig. 8)进一步印证单阶段模型会直接学成局部图像修图器,产生明显的 3D 浮雕与断裂伪影;两阶段训练让隐变量在粗对齐视角下与 3DGS 交互,使得新视角外推稳定可靠。
- 横向位姿泛化必须靠横向数据监督:Table 7 验证表明,若采用传统纵向切割配对(Longitudinal),其旋转误差达 1.97、FID 达 34.17;而本文的横向逆向构建策略(Lateral)将旋转误差压缩至 1.49,FID 降至 24.88。
亮点与洞察¶
- 纯视觉摆脱雷达硬件束缚:巧妙利用 3DGS 渲染作为稠密几何先验替代稀疏 LiDAR,不仅显著提升远景与天空等非反射区域的几何连续性,更为利用海量无激光雷达的网络端行车记录视频训练世界模型开辟了道路。
- 逆向跨轨迹配对构建真值监督:针对自动驾驶平行变道真实视频对无法大规模采集的困境,将“带伪影的渲染新视角作为源输入、无瑕疵的原实拍视频作为目标监督”,优雅打通了横向位姿转换的学习通道。
- 两阶段防坍塌训练范式:通过冻结第一阶段 coarse pose-control 自注意力模块,第二阶段专门用 Cross-Attention 注入 3DGS 结构先验,成功规避了扩散模型在输入渲染图时退化为局部去噪修补网络的陷阱。
局限与展望¶
- 离线 3DGS 重建的时间开销:目前数据预处理依赖 DriveStudio 进行稠密场景 3DGS 优化,虽然是一次性离线开销,但大规模建图仍耗费大量 GPU 算力(110K 样本耗费 8240 L20 GPU 小时)。未来若接入前馈式 4D 动态场景重建模型(如 DGGT),有望将预处理时间从数小时缩减至数秒。
- 高动态移动物体的几何模糊:对于复杂高密度交叉路口中快速穿行的行人或动态车辆,3DGS 静态/弱动态重建可能产生局部残影或涂抹,导致生成的新轨迹视频中动态物体的细粒度轮廓受到一定干扰。
- 极端跨度大偏移动态外推:当平移偏移量超过 \(\pm5\text{m}\)(超出两三个车道跨度)时,渲染视角内不可见未观测区域成倍扩大,对扩散模型强行脑补未知场景的泛化能力提出了极高挑战。
相关工作与启发¶
- vs Difix3D+ / GSFixer (先重建后修复类):Difix3D+ 属于图像级/视频级后处理修复网络,强依赖于训练集渲染伪影的分布,在面对大偏移外推或复杂动态伪影时极易产生视角畸变与时空闪烁;ReCamDriving 本质上是相机控制视频生成,将 3DGS 视为结构指导(Guidance)而非修图输入,通过自注意力与交叉注意力融合源实拍高保真纹理与 3DGS 空间骨架,一致性与视觉质量全面占优。
- vs StreetCrafter / FreeVS (LiDAR 相机控制视频生成类):StreetCrafter 严重依赖投影 LiDAR 点云提供几何约束,但在远景与天空区域几乎无点,易导致背景扭曲;且其训练受限于单轨迹纵向伪配对。ReCamDriving 采用纯视觉方案,不仅几何覆盖致密完整,且通过 ParaDrive 数据集直接学习横向运动转移,在 \(\pm4\text{m}\) 极端横向偏移下 FVD 仍维持在 26.76(相比 StreetCrafter 的 36.67 和 FreeVS 的 58.39 优势巨大)。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出逆向跨轨迹数据配对与 3DGS 稠密几何先验指导方案,摆脱了 LiDAR 依赖。
- 实验充分度: ⭐⭐⭐⭐⭐ 构建 110K 规模的 ParaDrive 数据集,在 WOD 与 NuScenes 双基准上针对画质、一致性、位姿误差及多项消融做了详尽评估。
- 写作质量: ⭐⭐⭐⭐⭐ 论点清晰,图示丰富直观,动机剖析精准且方法论逻辑自洽。
- 价值: ⭐⭐⭐⭐⭐ 为端到端自动驾驶仿真模拟、世界模型数据扩增以及纯视觉大视角轨迹合成提供了全新技术路径。