跳转至

SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 自动驾驶
关键词: 3D扩散模型、语义体素网格、表面Token、大规模场景生成、延迟渲染

一句话总结

提出基于定长表面采样的离散 3D 表达 \(\Sigma\)-Voxfield,通过 3D 局部扩散模型与重叠空间外绘实现以 8GB 显存扩展至十万平米尺度的高保真多视角一致自动驾驶场景生成。

研究背景与动机

大规模 3D 户外自动驾驶场景生成是自动驾驶仿真闭环、Corner Case 数据合成和可控编辑的基础支撑。然而,现有技术路线在多视角几何一致性、大尺度空间扩展与高保真自由视角渲染三者之间存在着严重的割裂。主流的 2D 或视频扩散模型(如 DreamDrive、MagicDrive)虽然能生成极具真实感的相机视图,但生成结果严重绑定在预设的前向行驶轨迹上,缺乏世界坐标系下持久存在的全局 3D 几何,视角平移时极易出现多视角漂移与几何塌陷。另一方面,基于 3D 占有网格(Occupancy)或隐式 NeRF/3DGS 优化的方法(如 Urban Architect、LSD-3D)需要针对每个场景进行耗时的逐场景逆向优化,且 3D 稠密网格的显存消耗随着空间尺度立方级爆炸,无法直接泛化到广袤连续的真实城市道路。

造成这种两难局面的核心矛盾在于:连续 3D 几何与稠密高光度纹理的联合表示极度耗费显存与计算,导致直接在 3D 空间训练生成模型只能局限在物体级或小范围房间级;而若先在 2D/视频空间生成再通过蒸馏或前馈网络回构 3D,又不可避免地损失了几何保真度并受制于训练视角的先验偏差。

本文的切入角度是打破以稠密三维网格或非结构化点云建模全局场景的惯性,构建一种兼具局部紧凑性与精确几何光度描述能力的离散表面单元。核心 idea:设计每个体素内部包含固定基数点集与法向高斯的 \(\Sigma\)-Voxfield 离散表面网格,通过 1D Transformer 扩散模型在局部体素块中联合生成几何与颜色,并借助边界重叠的空间外绘实现恒定显存开销下的无限尺度扩展,最终经由 2D 高斯代理与延迟扩散渲染输出高保真多视角视频。

方法详解

整体框架

SEM-ROVER 的整体流程由三部分有机串联:首先,以粗粒度语义体素网格(体素尺寸 0.6 米)作为拓扑引导,将连续场景离散化为由表面采样点组成的 \(\Sigma\)-Voxfield 单元;随后,在由空间邻近体素组成的局部集合内,利用 1D Diffusion Transformer(DiT)进行受控去噪,并结合 RePaint 机制在重叠区域执行迭代空间外绘(Spatial Outpainting),以恒定算力逐步拼接出数万平米的全局持久 3D 场景;最后,将生成的 \(\Sigma\)-Voxfield 转换为局部切平面切齐的 2D 高斯并微元栅格化为初级 2D 缓冲图像,输入带有可见性掩码引导的延迟扩散渲染引擎(Deferred Renderer),补齐天空、远景与高频反射细节,实现任意轨迹下的高保真图像合成。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入粗粒度语义体素网格<br/>0.6m 分辨率布局先验"] --> B["Σ-Voxfield 离散表面场构建<br/>定长采样点编码几何与颜色"]
    B --> C["语义与 3D 位置引导的局部 Token 扩散<br/>1D DiT 联合去噪几何与光度"]
    C --> D["重叠邻域渐进式空间外绘<br/>边界约束迭代扩展大规模场景"]
    D --> E["2D 高斯代理引导的延迟扩散渲染<br/>可微栅格化与神经细化成像"]
    E --> F["输出逼真多视角驾驶场景序列"]

关键设计

1. Σ-Voxfield 离散表面场构建:将连续几何与外观离散化为定长体素 Token 针对户外自动驾驶场景几何稀疏但表面结构复杂的特性,直接采用稠密三维体素会导致维度灾难,而无序点云又难以与结构化先验对齐。本文提出 \(\Sigma\)-Voxfield 表达,以全局体素网格为空间骨架,仅在非空表面体素内均匀采样固定数量 \(n\) 个附带 RGB 颜色的 3D 表面点。每个点的位置记录为相对于该体素中心的局部坐标 \((x^i, y^i, z^i)\),并与其色彩 \((r^i, g^i, b^i)\) 紧密绑定。为了消除点云排列歧义,将这 \(n\) 个采样点按距体素中心的欧氏距离升序严格排列,展平为一个一维连续向量:

\[\psi(v_\Sigma) = \big[x^1, y^1, z^1, r^1, g^1, b^1, \dots, x^n, y^n, z^n, r^n, g^n, b^n\big] \in \mathbb{R}^{6n}\]

这种设计让每个被占体素能够直接作为单一标准 Token 输入后续的序列化网络,既具备定长张量的易处理性,又将局部微观几何与宏观光度表观紧密纠缠,为在统一空间联合生成二者奠定了基础。

2. 语义与 3D 位置引导的局部 Token 扩散:在受限邻域内联合建模几何与光度分布 全局场景包含成千上万个非空体素,直接对整场进行全自注意力计算不仅显存无法承受,还会破坏局部空间拓扑。本文将全局场景划分为仅包含 \(N_\xi \in [50, 150]\) 个相邻体素的局部子集 \(\mathcal{X}_\xi\)(覆盖约 \(4 \times 4\text{ m}^2\) 范围),采用 1D Diffusion Transformer 架构进行去噪学习。在网络输入端,每个体素的世界坐标中心经过正弦 3D 位置编码与可学习投影层,注入到带噪的表面 Token 中;同时引入对应的语义分类标签(道路、人行道、建筑、植被等)作为交叉注意力条件。此外,网络中部署了空间掩码注意力(Masked Attention),硬性约束每个 Token 仅能与 3 米物理半径以内的邻近体素进行交互。模型通过前向扩散逐步添加高斯噪声,并以均方误差损失预测去噪后的无噪表面 Token \(\widehat{\psi}(\mathcal{X}_{\xi, 0})\),利用语义先验有效抑制了几何结构的幻觉坍塌。

3. 重叠邻域渐进式空间外绘:以恒定显存预算无限拓展场景尺度 受限于局部邻域扩散的感受野,单次去噪只能生成数米见方的局部街区。为了合成宏观无边界的城市道路,本文引入基于 RePaint 调度器的空间外绘机制。对于任意待扩展的局部邻域 \(\mathcal{X}_\xi\),将其体素划分为已知部分 \(\mathcal{X}_\xi^{\text{known}}\) 和新扩展的目标部分 \(\mathcal{X}_\xi^{\text{target}}\)。在反向扩散迭代过程中,每一步均强制将已生成区域覆盖回真实已知状态,仅对目标未生成区域进行去噪更新,从而迫使新生成的边界与已有场景在表面高度、道路边缘和纹理风格上平滑衔接。通过窗口滑动不断向外周扩展,生成过程的时间复杂度与场景面积保持严格线性关系,而单步显存占用锁定在 8GB 以内,成功合成了超过十万平方米的一致性道路场景。

4. 2D 高斯代理引导的延迟扩散渲染:弥合离散表面抽取缺陷并补全背景细节 离散采样点即便具有颜色,直接进行点云投影也会因为密度不足而产生严重的空洞与穿透伪影。本文为每个采样点引入几何法向先验:在体素内部通过主成分分析(PCA)拟合局部切平面法向量,初始化一个紧贴切平面的 2D 高斯椭圆微元,并设定固定半轴半径 \(r = 0.04\text{ m}\),实现无缝连续的 2D 高斯可微栅格化渲染,输出第一阶段的场景缓冲图 \(I_\Sigma\)。然而,\(I_\Sigma\) 仍受限于体素抽取率,缺乏天空、极远处天际线以及微观反光材质。为此,本文设计了基于修改版 Stable Diffusion 的延迟渲染引擎,以 \(I_\Sigma\) 的潜空间特征作为结构条件,并提取投影未命中区域作为可见性遮罩引导天空填充。同时,为了消除多帧或多视角动态漫游时的闪烁,采用自回归条件(ASD,将前一帧预测作为输入)或视频块预测(VSD,单次输出 12 帧),彻底摆脱了昂贵的逐场景 3DGS 优化,实现高帧率、无接缝的逼真图像解码。

损失函数 / 训练策略

  1. 3D 扩散阶段:采用标准 DDPM 目标,在 1000 个去噪步长下优化预测样本 \(\widehat{\psi}(\mathcal{X}_{\xi, 0})\) 与真值表面 Token 之间的 \(\ell_2\) 损失。训练期间以 10% 的概率随机丢弃语义类别标签以支持无分类器引导(CFG),推理时 CFG scale 设为 4.0。使用 Adam 优化器,学习率设为 \(5 \times 10^{-4}\),在两张 24GB GPU 上训练约 4 天。
  2. 延迟渲染阶段:在预先通过 3DGS 静态场重构剥离动态物体后的图像对上微调 Stable Diffusion 1.5。优化噪声预测均方误差损失 \(\mathcal{L}(\phi) = \mathbb{E}_{t, \epsilon}[\|R_\phi(x_t, x_\Sigma) - \epsilon\|_2^2]\),使用 Adam 优化器,学习率 \(5 \times 10^{-5}\),单卡训练 4 天。

实验关键数据

主实验

在 Waymo Open Dataset (WOD) 上对比当前 SOTA 驾驶场景生成方法,分别评估原轨迹视角(Seen)与平移扰动后的新视角(Novel)下的渲染图像质量(FID / KID),以及推理阶段的最低显存占用:

方法 FID (Seen) ↓ FID (Novel) ↓ KID (Seen) ↓ KID (Novel) ↓ 最小显存 (VRAM) 前馈渲染 (Feed-Forward)
InfiniCube 84.14 99.13 0.03 0.06 75 GB 是
GEN3C 113.27 117.63 0.08 0.09 43 GB 是
SEM-ROVER (Ours, ASD) 81.98 89.20 0.05 0.06 8 GB 是

消融实验

针对 3D 扩散模型关键模块、延迟渲染引导信号及体素超参数进行了系统消融。

表 1:3D 扩散特征空间质量消融(基于 PointNet++ 提取特征的 F3D 与 MMD 指标)

配置 F3D ↓ MMD ↓ 说明
完整模型 (Ours) 3.523 0.091 包含语义条件与体素内中心距离排序
w/o 点排序 (w/o ordering) 3.585 0.093 去除升序排序破坏了 Token 的确定性对齐
w/o 语义条件 (w/o sem. cond.) 3.927 0.105 缺失语义引导导致几何拓扑偏离严重

表 2:延迟渲染引擎的引导条件对比

引导条件类型 FVD ↓ 说明
纯语义图 (Semantic / UniScene 风格) 143.62 缺乏几何和颜色绑定,时序上存在剧烈抖动与闪烁
投影激光点云 (FreeVS 风格) 97.51 具备稀疏深度但缺失连续表面与颜色引导
Σ-Voxfield 代理图 (Ours) 53.01 联合编码几何法向与粗糙颜色,时序一致性大幅提升

表 3:表面采样点数 \(n\) 与体素尺寸 \(v_s\) 的权衡分析

参数配置 推理速度 / 指标 F3D / PSNR MMD / SSIM 分析结论
采样点 \(n=5\) 1.95× 速度 F3D: 4.11 MMD: 0.08 表面过于稀疏,几何保真度明显下降
采样点 \(n=20\) (本文基准) 1.00× 速度 F3D: 3.52 MMD: 0.09 最佳计算与表面拟合平衡点
采样点 \(n=70\) 0.51× 速度 F3D: 3.50 MMD: 0.09 收益边际化但计算开销翻倍
体素尺寸 \(v_s=0.3\text{ m}\) - PSNR: 15.20 SSIM: 0.60 细网格约束过紧,抑制了几何生成的多样性
体素尺寸 \(v_s=0.6\text{ m}\) (本文基准) - PSNR: 15.50 SSIM: 0.58 宏观布局可控与局部几何多样的最佳尺寸
体素尺寸 \(v_s=1.2\text{ m}\) - PSNR: 14.83 SSIM: 0.54 体素过大导致道路边缘与物体边界严重模糊

关键发现

  • 新视角泛化鲁棒性突出:在平移扰动的新视角(Novel View)下,InfiniCube 的 FID 从 84.14 大幅退化至 99.13(恶化 14.99),而 SEM-ROVER 仅从 81.98 上升到 89.20(恶化 7.22)。这表明直接在世界坐标系生成 3D 几何相比于主要在 2D/视频视角训练的蒸馏模型具备本质的几何一致性优势。
  • 显存与算力极度友好:将全局稠密扩散解耦为局部 Token 扩散与重叠外绘后,SEM-ROVER 仅需 8GB 显存即可运行,远低于 InfiniCube 的 75GB 与 GEN3C 的 43GB,使消费级单卡运行大规模场景生成成为可能。
  • 几何与颜色解耦生成的必要性:消融表明将语义条件与表面排序结合至关重要,而 \(\Sigma\)-Voxfield 作为延迟渲染先验相比纯语义引导将 FVD 降低了 63.1%(143.62 \(\to\) 53.01),证明几何代理与粗光度是驱动神经渲染器稳定成像的决定性因素。

亮点与洞察

  • 定长紧凑的 \(\Sigma\)-Voxfield 表征:将不规则的三维表面解构为带有法向 2D 高斯代理的体素定长点集,巧妙规避了传统三维 CNN 的三次幂内存爆炸,同时兼容 1D Transformer 的序列建模。
  • RePaint 式 3D 空间外绘解耦尺度依赖:将生成算力与场景物理范围解耦,无论生成百米街区还是十万平米超大场景,单次推理显存始终恒定在 8GB,为大世界生成提供了优雅的扩展范式。
  • 无需逐场景优化的前馈延迟渲染流水线:利用 2D 高斯微元将离散体素直接栅格化为初级特征图,再借助自回归/视频扩散网络补全天空与环境高频光照,彻底抛弃了每场景长达数小时的 3DGS 拟合过程。

局限与展望

  • 外观细节控制维度单一:当前的条件引导仅包含语义类别与粗体素坐标,缺乏对天气、光照角度、特定材质纹理与风格提示词的细粒度文本/参数控制。
  • 仅聚焦于静态背景场景:当前框架假设场景为刚性静态环境,未对移动车辆、动态行人和时变交通流进行联合时空动力学建模。未来需要将动态高斯物体流与时空 4D 扩散机制引入统一框架中。
  • 数据管线依赖离线高质量三维重构:训练数据的 \(\Sigma\)-Voxfield 提取依赖于前置的多视角 3DGS(OmniRe)与 SDF 网格提取,前处理流程较长。

相关工作与启发

  • vs InfiniCube:InfiniCube 采用 HDMap \(\to\) 精细体素生成 \(\to\) 视频扩散 \(\to\) 前馈 3DGS 重建的级联多阶段方案,在侧向与非前视相机视角下易出现严重形变且需要 75GB 显存;本文直接在 3D 空间扩散 \(\Sigma\)-Voxfield 并外绘,侧向多视角稳定性大幅占优且显存压至 8GB。
  • vs GEN3C:GEN3C 依赖庞大的 COSMOS 视频基座并以投影点云为缓存条件,其本质仍为 2D 视频生成,在 Novel 视角下的 FID 高达 117.63;本文通过显式 3D 表面几何扩散保证了强空间物理约束,Novel 视角 FID 达到 89.20。
  • vs LSD-3D / Urban Architect:这类方案虽然引入了点云或隐式 NeRF 几何,但严重依赖 SDS 蒸馏或逐场景高斯几何优化,耗时以小时计;本文完全采用前馈生成与延迟渲染,单场景仅需约 20 分钟即可生成。

评分

  • 新颖性: ⭐⭐⭐⭐ [创新性地设计了兼顾几何与光度的定长体素表面 Token 表达,并以局部扩散结合重叠外绘突破大尺度 3D 场景瓶颈]
  • 实验充分度: ⭐⭐⭐⭐ [在 Waymo 和 PandaSet 上进行了详实的多视角图像指标对比、3D 特征空间消融及体素超参数分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密清晰,动机针对性强,方法公式与流程阐述非常规范透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为端到端自动驾驶模拟仿真提供了一种极低显存、多视角物理自洽的大尺度 3D 场景生成实用路径]