跳转至

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

会议: ECCV 2026
论文: ECCV 原文
项目页: https://drive-sim.github.io/ReinDriveGen/
领域: 自动驾驶
关键词: 自动驾驶场景生成, 强化学习后训练, 视频扩散模型, 动态点云补全, 分布外编辑

一句话总结

ReinDriveGen 结合动态点云补全与条件视频扩散模型,并提出基于成对偏好模型与成对胜率奖励的强化学习后训练机制,在无需真值监督的前提下显著提升了极限打滑、翻车与剧烈变道等分布外安全关键驾驶场景的视频生成质量。

研究背景与动机

高保真自动驾驶场景模拟器对于自动驾驶算法的研发、边界测试与安全验证至关重要。理想的模拟器不仅需要支持视点变换,更应允许自由编辑场景中交通参与者的运动轨迹,从而合成极端但关键的安全边界案例(如前车急刹碰撞、失控甩尾自旋、车辆侧翻及行人横穿马路等)。然而,无论是基于三维高斯泼溅等三维重建范式,还是基于条件视频扩散模型的生成范式,现有方案均深度依赖于真实采集的驾驶日志数据。当用户在推理时对目标车辆施加任意大幅度位移、剧烈旋转或改变主车视点时,输入条件不可避免地偏离原始训练数据分布。

这种分布外(Out-of-Distribution, OOD)场景所面临的核心矛盾在于:由于极端危险工况在常规采集日志中极其罕见甚至完全缺失,且编辑后的场景根本不存在对应的真实视频作为监督参考,传统的有监督微调(SFT)手段完全无法弥合这一分布落差。在各类场景元素中,车辆作为被编辑的核心主体,承受着最剧烈的视角与运动漂移,因而常常出现严重的几何扭曲、纹理伪影与光影不合理,成为制约可控驾驶模拟真实感的最大瓶颈。

针对这一本质瓶颈,本文从数据驱动与强化学习的结合点切入:既然缺乏真值视频,便通过强化学习后训练(RL Post-Training)直接在分布外条件空间中探索并优化生成质量。核心 idea:将多帧激光雷达动态点云聚合与几何补全渲染出的伪图像作为视频扩散模型的结构引导,并构建专用成对偏好判别器与成对胜率奖励机制,基于前向流匹配强化学习无监督地消除分布外编辑中的车辆畸变与纹理瑕疵。

方法详解

整体框架

ReinDriveGen 的整体流程由两大核心系统协同构成:第一部分是“点云条件视频扩散模拟器”,负责将稀疏的多帧激光雷达扫描构建为连续致密的动态 3D 点云场景,对不完整观测的车辆进行几何补全,并将编辑后的点云投影渲染为 2D 伪图像序列,驱动视频扩散模型生成基础视频;第二部分是“强化学习后训练系统”,通过在预设的分布外条件空间中生成多候选视频,借助专属训练的成对偏好模型完成局域全成对裁决并转化为标量胜率奖励,基于流匹配目标优化视频策略网络。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    A["原始多帧激光雷达点云 + 3D检测框"] --> B["动态点云聚合与车辆几何补全<br/>AdaPoinTr 重构360°完整三维几何"]
    B --> C["场景轨迹编辑与条件伪图像渲染<br/>投射生成几何伪图像序列"]
    C --> D["条件视频扩散基座生成<br/>VACE-1.3B 联合参考帧与伪图像"]
    D --> E["分布外条件候选视频生成<br/>每组条件采样 N=16 候选"]
    E --> F["成对偏好判别模型<br/>DINOv3 CLS 向量反对称双向打分"]
    F --> G["成对胜率奖励聚合与策略优化<br/>面积加权胜率 + DiffusionNFT 对比更新"]

关键设计

1. 动态点云聚合与车辆几何补全:解决轨迹重设导致的视角空洞与几何缺失

纯二维视频扩散模型往往欠缺严密的多视角三维几何一致性,而直接利用单帧激光雷达投影又过于稀疏。ReinDriveGen 针对静态背景累积场景全部 200 帧点云,对行人与骑行者取前后各 2 帧进行局部聚合,对车辆则根据 3D 边界框坐标系将各帧点转换到规范化坐标系下融合同一实例的所有观测点,并将多帧 RGB 反投影着色。然而,真实采集中的车辆受遮挡影响,往往只能观测到底盘或单侧车身。若将其平移至新轨迹或从新视角观察,未观测区域会暴露为明显的几何黑洞。为此,系统引入基于 AdaPoinTr 的点云补全网络,针对车辆类别在投影 ShapeNet 数据上微调,为残缺车辆重构出完整的 360° 三维几何网格。补全部分赋予黑色无纹理标记,将复杂的纹理重建与光照烘焙交给后续的视频扩散模型,从而保证了任意轨迹编辑下三维几何框架的完整连贯。

2. 伪视角遮罩增强的条件视频扩散:以结构伪图像与参考帧引导纹理合成

渲染出的伪图像由于点云离散性和累积误差难免存在伪影,且补全表面缺少色彩。ReinDriveGen 选用 VACE-1.3B 作为视频扩散骨干,通过视频条件单元(VCU)同时接收原始记录的参考图像与编辑后的连续伪图像流。参考帧提供整场环境的全局色调、材质和光照先验,伪图像则提供像素级逐帧三维轮廓约束。针对推理时新轨迹会频繁出现大面积无纹理黑色表面的问题,模型在有监督微调阶段设计了双重遮罩策略:一是借鉴 GA-Drive 沿深度断裂线实施随机边缘腐蚀遮罩,模拟真实视点偏移时的未观测盲区;二是施加随机矩形块遮罩,强制扩散模型依靠参考帧外观先验与上下文语义自行学会补全新暴露表面的逼真纹理、反光与投影。

3. 成对偏好模型构建:解决分布外车辆真实感评价的通用奖励缺失难题

强化学习后训练的核心在于获得高质量的奖励反馈,但通用美学评估或图像画质评分模型对驾驶场景中车辆几何拉伸、轮毂扭曲和反光错位等域内瑕疵极不敏感。ReinDriveGen 发现:降低扩散生成时的伪图像条件供给频率(如由每帧供给降低为隔帧或隔三帧供给),会使得生成的车辆外观呈现出单调、可控的连续退化。利用这一规律,研究团队从 Waymo 数据集上自动化构建了海量同场景、同帧、同实例且仅有质量差异的成对车辆图像三元组 \((i) \succ (ii) \succ (iii)\),并引入非对称运动模糊与弹性畸变增强负样本。在判别器结构上,采用共享权重的 DINOv3 ViT-H+ 提取两张车辆裁剪区域的 CLS 特征,级联输入 MLP 预测双向标量 Logits,以反对称结构计算偏好概率:

\[P(I_1 \succ I_2) = \sigma\left(\frac{s_{12} - s_{21}}{2}\right)\]

该数学形式天生满足互补对偶律 \(P(I_1 \succ I_2) = 1 - P(I_2 \succ I_1)\),有效根除了点式奖励模型因绝对标量打分容易引起的奖励黑客攻击(Reward Hacking)。

4. 成对胜率奖励聚合与策略优化:以局域相对胜率规避绝对评分漂移

在对分布外条件(如原地自旋、车辆翻滚等极端用例)执行强化后训练时,参考策略为每个条件采样 \(N=16\) 条候选视频。系统在第一条候选视频的各帧上运行 YOLO26 检测目标车辆边界框,并将该组空间窗口固定映射至同组其余 \(N-1\) 条视频的同一时空切片上,构建出 \(M\) 个独立的评估单元。在每个评估单元 \(m\) 内,对全部 \(N\) 个车辆切片进行两两打分,以置信阈值 \(\tau = 0.85\) 统计有效胜出频度:

\[R_m^i = \frac{1}{N-1} \sum_{j \neq i} \mathbb{I}\Big[P(a_m^i \succ a_m^j) > \tau\Big]\]

最终的整视频标量奖励 \(\hat{R}(x_i)\) 取各评估单元按边界框像素面积加权的平均值,确保视野中面积大、视觉显著的近景车辆失真获得更高的惩罚权重。在策略更新上,框架将 DiffusionNFT 从静态图像拓展至时空视频流,直接在无分类器引导的扩散正向流匹配路径上计算对比损失:

\[\mathcal{L}(\theta) = \mathbb{E}_{\mathbf{c},\, \mathbf{x}_0 \sim \pi_{\mathrm{old}}(\cdot|\mathbf{c}),\, t} \left[ r \cdot \big\| v_\theta^+(\mathbf{x}_t, \mathbf{c}, t) - \mathbf{v} \big\|^2 + (1 - r) \cdot \big\| v_\theta^-(\mathbf{x}_t, \mathbf{c}, t) - \mathbf{v} \big\|^2 \right]\]

将相对胜率标量奖励作为权重系数,使网络在无需成对真值视频的情况下,持续强化高胜率样本的几何特征并抑制劣质伪影。

损失函数 / 训练策略

模型训练分为两阶段: 1. 有监督微调阶段 (SFT):使用 Waymo 数据集中 1,000 个场景的前视、左前与右前三路相机视频。以 VACE-1.3B 为基座,固定文本提示为 "A realistic autonomous driving scene",在成对渲染伪图像与真实录制视频间联合微调 Context Adapter 与 DiT 模块。视频输入规格为 49 帧、分辨率 \(480 \times 832\)。训练采用 Adam 优化器,恒定学习率 \(1 \times 10^{-5}\),批大小 32,消耗约 500 个 H100 GPU 小时。 2. 强化后训练阶段 (RL Post-Training):精选 20 种典型分布外工况(涵盖原地旋转、左/右急转弯、车辆侧翻及自车横向大幅平移)。为保持训练稳定与参数高效,微调采用 LoRA 形式。每个工况采样 16 个视频候选样本进行组内成对打分与胜率计算,采用 Adam 优化器(学习率 \(1 \times 10^{-5}\))完成 500 次优化步迭代,耗时约 400 个 H100 GPU 小时。

实验关键数据

主实验

在评估自车轨迹偏移(Off-trajectory)的连续变道场景下(每帧横移 0.1m,40 帧累计横移 4m),ReinDriveGen 与多视角重建及生成混合模型在 Waymo 上对比,采用新轨迹目标交并比(NTA-IoU)、新轨迹车道线交并比(NTL-IoU)以及图像真实度 FID 指标。

模型 NTA-IoU ↑ NTL-IoU ↑ FID ↓
PVG (IJCV 2026) 0.256 50.70 105.29
DriveDreamer4D w/ PVG 0.438 53.06 71.52
ReconDreamer w/ PVG 0.464 53.21 74.32
S3Gaussian (CVPR 2024) 0.175 49.05 124.90
DriveDreamer4D w/ S3Gauss. 0.495 53.42 66.93
ReconDreamer w/ S3Gauss. 0.413 51.62 123.61
Deformable-GS (2023) 0.240 51.62 92.24
DriveDreamer4D w/ Deform.-GS 0.335 52.93 77.32
ReconDreamer w/ Deform.-GS 0.443 53.78 76.24
ReinDriveGen (本文) 0.549 56.13 51.99

在目标车辆轨迹编辑任务中(保持自车视点不变,手动将目标车辆横向平移 5m),在 StreetCrafter 发布的 5 个基准场景上评估运动平滑度、背景一致性、图像质量(源自 VBench)及 FID 指标:

模型 运动平滑度 ↑ 背景一致性 ↑ 图像质量 ↑ FID ↓
Street Gaussians (ECCV 2024) 0.9811 0.9310 0.6398 84.7970
StreetCrafter (CVPR 2025) 0.9817 0.9069 0.6509 83.6278
ReinDriveGen (本文) 0.9774 0.9397 0.6928 80.6267

消融实验

论文针对强化学习后训练机制和车辆点云补全模块分别进行了严密消融与步进追踪。由于组内成对打分无法跨阶段横向对比,作者设计了固定随机种子为 0、将各步 RL 策略与 SFT 基线逐帧成对裁剪对比的独立评估公式:

\[E(\mathbf{c}) = \frac{\sum_{m=1}^{M} w_m \cdot P(a_m^{\mathrm{rl}} \succ a_m^{\mathrm{sft}})}{\sum_{m=1}^{M} w_m}\]
训练配置 / 阶段 综合胜率得分 \(E(\mathbf{c})\) 视觉几何表现 纹理与光照表现
初始状态 (Step 0 / 纯 SFT 基线) 0.5000 面对自旋与翻滚时车体剧烈扭曲断裂 出现非真实大面积单色块与不连贯光斑
RL 训练中间态 (Step 60) 0.6120 车辆轮廓拓扑趋于完整,拉伸减少 反光初步对齐环境,但边缘有微小噪点
RL 训练充分收敛 (Step 300) 0.7450+ 360° 旋转与倾斜视角下车身刚性结构完好 轮毂细节清晰,阴影和自然天光高度匹配
消融:移除车辆点云补全模块 - (严重退化) 遮挡面暴露处出现严重几何空洞与塌陷 扩散模型在无参考面处胡乱填色,失真明显

关键发现

  • RL 后训练是分布外泛化的核心动力:在车速倍增、原地打转与侧翻三种极端工况下,评估得分随着 RL 迭代呈现单调稳步上升;对于从未在真实数据中出现的非物理自旋与翻倒动作,SFT 模型往往生成模糊融化的色块,而 RL 训练能够逐步引导网络生成符合刚体动力学与正确透视的车辆结构。
  • 几何补全为扩散模型提供了强先验脚手架:去掉 AdaPoinTr 补全后,激光雷达盲区导致的巨大几何黑洞直接使视频扩散模型退化,生成严重形变与色彩失真的假车;说明扩散模型的图像重绘能力必须建立在致密、正确的空间先验之上。
  • 成对相对奖励从机制上消除了打分漂移:相比传统标量评分网络,通过同一批次内共享检测框的多候选样本全成对裁决,不仅能滤除置信度低于 0.85 的模糊判例,而且使面积更大的近处车辆主导梯度的反向传播,彻底避免了对全图无关背景的奖励作弊。

亮点与洞察

  • 将扩散模型前向强化学习(NFT)成功推广至视频领域:巧妙利用无分类器引导前向流匹配的高效特性,解决了长序列多视角时空张量在强化学习反向传播时显存爆炸和采样速度过慢的工程难题。
  • 以可控条件退化实现零人工标注偏好对构造:通过系统性降采样伪图像供给频率(全帧/隔帧/隔四帧)结合不对称扰动,廉价生成了海量严格变量对齐的高质量偏好三元组,为自动驾驶垂类视频奖励模型提供了优雅的数据生成新范式。
  • 显式点云结合隐式扩散的双轨架构:克服了传统 3DGS 在轨迹编辑时无法重新烘焙阴影光照与填补空洞的短板,同时消除了纯视频扩散模型在多轮修改中无法固定无关背景的随机漂移。

局限与展望

  • 视频序列长度与实时性瓶颈:受限于显存占用,模型当前仅能生成 49 帧时长的短视频片段(约合几秒的行车片段),且单条视频采样耗时约 1 分钟,尚无法满足端到端闭环仿真中的高帧率实时推演需求。
  • 非车辆动体的补全与物理拟真限制:当前点云补全模块主要针对车辆刚体,对行人、骑行者等高自由度形变物体的剧烈交互(如摔倒、抛掷)模拟能力有限,且碰撞时的刚体接触尚未引入物理引擎硬约束。
  • 全景多相机联合生成一致性:实验目前主要集中在前向及左右前向视角的联合建模,未来拓展至整车 360° 环视 6-8 路相机的全域时空联合一致性仍有探索空间。

相关工作与启发

  • vs Street Gaussians / PVG: 纯三维高斯重建方法依赖训练视角的密集射线覆盖,在车辆被平移挪动后,原本遮挡的地面和车身背面暴露出空白黑洞,且无法根据新车位重新计算反光与投影;本文通过点云几何补全搭设脚手架,并利用预训练视频扩散模型重新合成光影,彻底克服了编辑导致的空洞。
  • vs DriveDreamer / UniMLVG: 现有基于 3D 边界框与 HD 地图引导的视频扩散模型缺乏显式空间点云骨架,在多轮连续编辑中难以保持静态环境的绝对一致,且在自旋、侧翻等分布外角标动作下极易生成拓扑崩溃的怪物车;本文引入点云约束配合 RL 后训练,使模型在无真值监督下仍具备强大的外推能力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将强化学习后训练深度引入分布外驾驶视频生成领域,成对偏好设计针对性极强。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖离轨变道与车辆编辑两大场景,主实验、指标追踪与可视化消融完整详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照极佳,问题剖析与解决链路清晰透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为解决自动驾驶世界模型在罕见危险长尾 corner-case 中的数据荒提供了坚实的算法路径。