跳转至

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

会议: ECCV 2026
论文: ECCV 原文
项目: https://research.paulengstler.com/syncity-3k
领域: 3D 视觉
关键词: 3D场景生成、扩散模型、卷积式推理、3D高斯泼溅、合成数据自举

一句话总结

SynCity 3000 提出了一种两阶段大尺度 3D 场景生成框架,先以滑动窗口联合去噪生成高分辨率二轴测全景模板,再利用在合成场景数据上微调的“卷积式”两阶段 3D 扩散模型将其无缝解码为任意尺度的 3D 高斯泼溅场景,彻底打破了传统网格化拼接的割裂感与视距限制。

研究背景与动机

电影、游戏与虚拟仿真等工业级应用对高质量大尺度 3D 场景生成提出了迫切需求。然而,当前主流的 3D 生成模型大都受制于物体级(object-centric)表征,主要聚焦于孤立单个物体的单图或文本重建。现存的场景级生成方案主要分为两条技术路线:基于资产布局检索/放置的显式组合方法,以及基于单目深度估计的图像外绘投影拼接方法。前者易产生物体间物理碰撞、视觉不协调且场景风格死板单调;后者则由于视点偏离初始相机视角时遮挡与空洞频发,几何伪影极其严重。

为了突破真实大尺度 3D 场景训练数据极端匮乏的瓶颈,先驱工作 SynCity 尝试通过“拼图网格”(grid of tiles)将整场景离散切分成独立网格单元,复用现成物体级重建模型(如 TRELLIS)逐块生成 3D 单元再加以拼合。然而,这种硬性切块逻辑带来了致命缺陷:各个单元之间缺乏全局上下文感知,跨单元的物体和地势被强行截断,最终场景不仅在接缝处出现明显的几何撕裂,而且通篇呈现出刻板机械的网格化棋盘特征,完全无法刻画自然延展的大尺度建筑群或开放式地貌。

解决该问题的核心瓶颈在于:既要保证超大视野下场景布局与外观的全局一致性,又要赋予物体级 3D 扩散生成器处理连续大空间的能力,同时还不能依赖昂贵稀缺的真实 3D 场景标注。核心 idea:将场景生成显式解耦为“全局连贯的二轴测 2D 模板生成”与“基于卷积式滑动窗口的 3D 高斯扩散解码”,并构建一个轻量级程序化合成场景引擎自举训练数据,以核心-上下文隔离微调让预训练 3D 扩散模型无缝具备全场景连续生成能力。

方法详解

整体框架

SynCity 3000 采用严格解耦的两阶段管线:阶段一利用 2D 潜在扩散模型在共享画布上通过重叠滑动窗口多路平均去噪,生成一张兼具全局透视一致性与细粒度布局控制的超高分辨率二轴测(dimetric)场景模板图;阶段二将该模板输入经过轻量级微调的卷积式 3D 扩散模型中,先通过滑动窗口联合采样全局粗粒度稀疏体素网格(Sparse Structure),再密集预测各体素的高维几何与外观特征(Structured Latents),最后经预训练解码器直接输出全局无缝的 3D 高斯泼溅(3D Gaussian Splats)世界。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["文本提示词与可选布局约束"] --> B["阶段一:二轴测模板重叠窗口去噪<br/>MultiDiffusion机制更新整幅画布"]
    B --> C["阶段二·粗结构:卷积式稀疏体素网格生成<br/>核心+环绕上下文窗口联合去噪"]
    C --> D["阶段二·细结构:卷积式结构化隐变量生成<br/>稀疏体素特征提取与条件去噪"]
    D --> E["3DGS 解码与色彩校正<br/>生成全局一致的大尺度3D高斯场景"]

关键设计

1. 二轴测模板重叠窗口去噪:突破单图分辨率与布局约束的全局画布生成

单图 2D 生成模型的原生输出分辨率有限,强行平铺拼接会导致跨块语义与边缘光照突变。SynCity 3000 选用具备良好几何投影特性的二轴测(dimetric)视角,以预设的水泥基座底图及对应上部遮罩作为生成画幅起点,将整幅潜在画布 \(z \in \mathbb{R}^{C \times (H/\epsilon) \times (W/\epsilon)}\) 划分为若干步长小于窗口尺寸的重叠滑动窗口 \(w \in \mathcal{W}\)(步长 \(s < S\))。在每一步扩散去噪中,各个局部窗口分别根据全局风格提示词 \(P_{\text{style}}\) 以及可能存在的局部布局提示词 \(P_w\) 独立估算噪声 \(\omega_w = \omega_{\text{2D}}(z_w \mid I_{\text{base}}, M_{\text{base}}, P_w, P_{\text{style}})\),随后借鉴 MultiDiffusion 思想在整幅画布上执行跨窗口重叠区域像素/隐变量加权平均。这种平滑过渡机制使局部地物能跨越窗口边界有机延展,完全消除了 SynCity 原有的离散图块边界感。

2. 核心-上下文卷积式 3D 扩散推理:将物体级生成器拓展至连续场景尺度

基线 3D 重建模型(如 TRELLIS)的输入通常假设孤立单物体位于中心,直接将其用于截取的局部场景图像会导致边界处几何塌陷或强行闭合。为消除图块边界割裂,SynCity 3000 将三维体素空间与二维模板空间建立严格对应,并在空间推理时将每个局部窗口划分为“核心区”(Core)与“上下文区”(Context)。在稀疏体素网格去噪时,模型输入不仅包含待更新的核心体素隐变量 \(o_w \in \mathbb{R}^{M \times M \times M \times C}\),还向四周水平扩展 \(V\) 个体素引入环绕上下文 \(o_w^c\),总覆盖范围扩大至 \(M_{\text{context}} = M + 2V\)。条件图像 \(I_w\) 同样居中于核心区域,并以掩码 \(M\) 遮蔽非核心区域。通过扩展正弦位置编码至外部空间域,核心区域保持与原始模型一致的相对坐标,使模型在感知周围 3D 几何拓扑的同时聚焦于核心区生成。在去噪过程中,全场景以步长滑动遍历并在重叠区域对去噪信号求平均,达成连续场景的“卷积式”平滑过渡。

3. 核心隔离监督与双重目标防遗忘微调:兼顾场景连续性与物体先验

现成物体级 DiT 模型若直接在场景图像上推理,会因试图强行推断统一的“物体正向朝向”而出现严重畸变;若激进微调又极易发生灾难性遗忘,破坏其强大的精细几何重建能力。为此,微调采用随机二选一的双重训练目标(执行概率 \(p=0.5\)):一种目标下同时提供核心隐变量与环绕上下文隐变量,迫使网络学习利用周围几何边界;另一种目标下仅提供核心隐变量,完全模拟 TRELLIS 原始的单物体无上下文生成任务。最关键的是,在两种模式下,均方误差(MSE)损失函数被严格限制仅在“核心区”计算:

\[ \mathcal{L}_{\text{MSE}} = \left\| \omega_w(\text{core}) - \hat{\omega}_w(\text{core}) \right\|_2^2 \]

这一设计向模型灌输了极其明确的先验:虽然必须参考上下文环境以维持跨区域连贯性,但自身只需对当前核心区域的几何保真度负责,避免了边界发散问题。

4. 随机地形与资产自举的合成场景数据引擎:破解场景 3D 数据匮乏困境

训练卷积式 3D 扩散模型面临的核心阻碍是缺乏海量、开放、多类别的 3D 场景真值数据。受 LRM-Zero 启发,本文提出了一套基于 Blender 的程序化合成数据引擎。引擎首先程序化生成包含随机高程起伏与硬切色彩过渡的随机地形网格,随后从大规模 Objaverse-XL 资产库中随机抽取若干 3D 物体,进行随机缩放、方位旋转与无重叠表面散布,并施加高角度平行光与投射阴影。之后,利用正交二轴测相机渲染匹配模板风格的顶视图,并裁剪以原点为中心的 \(M_{\text{context}} \times M_{\text{context}} \times M\) 体素块;最后利用额外渲染的 37 个透视视角(32 个随机顶视视角 + 4 个侧视视角 + 1 个底视视角)提取 DINOv2 多视角特征并投影聚合,生成 32 万组高质量配对的二轴测图像、稀疏体素真值和结构化隐变量,低成本自举完成了整个场景扩散模型的微调支撑。

损失函数 / 训练策略

微调过程使用 2 张 NVIDIA RTX A6000 GPU,针对稀疏体素生成器(Sparse Structure)与结构化隐变量生成器(Structured Latents)分别采用学习率 \(5 \times 10^{-6}\) 和 Batch Size = 1 进行全参数微调(不冻结任何层)。稀疏体素模型训练 260k 步,输入分辨率为 \((16 + 2 \times 8)^2 \times 16\);结构化隐变量模型训练 660k 步,分辨率为 \((64 + 2 \times 32)^2 \times 64\)。在场景推理阶段,模板窗口大小设为 \(896 \times 448\) 像素,对应生成步长为 0.5 patch,并在最终 3D 高斯输出上应用色彩校正以消除色偏。

实验关键数据

主实验

为了验证 3D 重建结果对输入模板的保真度,论文在 35 个由 LLM 随机生成的模板上进行了跨视角重建对比,评测指标包括感知相似度 LPIPS、结构相似性 SSIM 和峰值信噪比 PSNR。此外,针对大尺度几何重建质量,论文还在两组不同尺度(\(1344 \times 672\) 与超大尺度 \(2240 \times 1120\))的合成场景代理基准上,与基线 TRELLIS 进行了 Chamfer 距离、F-score、LPIPS 及 PSNR 的全方位对比(原论文 Table 1 与 Table 3)。

方法 模板匹配 LPIPS ↓ 模板匹配 SSIM ↑ 模板匹配 PSNR ↑ 几何 Chamfer (小/大) ↓ 几何 F-score (小/大) ↑
TRELLIS (基线) 0.4094 0.4966 13.5911 0.0137 / 0.0392 0.6685 / 0.6967
TripoSG 0.4182 0.4953 12.2768 - -
Hunyuan3D-2.1 0.4689 0.4490 11.5394 - -
SynCity 3000 (完整模型) 0.3993 0.5247 14.4137 0.0166 / 0.0302 0.7029 / 0.7536

在用户主观偏好盲评(27 位受试者,原论文 Table 2)中,SynCity 3000 在布局控制力上相对 SynCity 取得了 100.0% 的绝对胜率;在对模板的 3D 重建保真度上,对 TRELLIS、TripoSG 和 Hunyuan3D-2.1 的胜率分别高达 71.6%100.0%100.0%;在全场景生成整体质感上,对 SynCity 的胜率为 63.0%,对 NuiScene 为 74.1%,对 3DTown 为 59.3%

消融实验

为验证卷积式微调、上下文感知范围以及滑动步长等核心设计的作用,论文在模板保真度测试集上进行了系统消融(原论文 Table 1 下半部分):

配置 LPIPS ↓ SSIM ↑ PSNR ↑ 说明
完整模型 (Ours) 0.3993 0.5247 14.4137 包含上下文与卷积微调的完整方案
无微调 (no fine-tuning) 0.4726 0.4657 11.7622 性能严重劣质化,无法适应无正向导向的场景切块
无上下文 (no context) 0.4121 0.5142 14.2038 缺乏周围拓扑引导,边界平滑度与结构连贯性受损
小上下文 (smaller context, \(V=4/16\)) 0.4000 0.5047 14.1266 感受野缩小导致长程空间依赖捕获不充分
大步长 (large stride, 1.0 patch) 0.4143 0.5192 14.0624 无重叠去噪平均,局部遮挡导致的前景/背景重复伪影激增

关键发现

  • 微调对卷积推理至关重要:直接使用未微调的现成模型性能急剧恶化(PSNR 从 14.41 骤降至 11.76),因为原始单物体模型默认存在 canonical 前向朝向,而复杂场景中的切片局部不具备各向异性的朝向定义,唯有通过微调才能学会通用的空间卷积响应。
  • 大尺度下几何优势显著放大:当场景模板尺寸由 \(1344 \times 672\) 放大到 \(2240 \times 1120\) 时,原生 TRELLIS 的 Chamfer 距离由 0.0137 暴增至 0.0392,而 SynCity 3000 保持高度稳健(仅为 0.0302),F-score 甚至进一步攀升至 0.7536(领先 TRELLIS 0.057),充分证明了滑动窗口卷积架构在大范围外推上的卓越扩展性。
  • 重叠窗口平滑平均有效抑制幽灵重影:若采用步长为 1.0 patch 的无重叠推理,单一视角下未被遮挡的远景结构常在相邻视块中被重复生成;将步长收紧至 0.5 patch 并联合去噪平均,能有效消除遮挡二义性引起的重影。

亮点与洞察

  • 将物体级 3D 扩散器重塑为空间卷积算子:巧妙利用二轴测视角的几何投影均匀性,将局部 3D 去噪与全局滑动窗口对应,把本来只能处理单个物体的 DiT 架构升维成了可无限滚动的卷积式生成器。
  • “核心-上下文”隔离微调策略:输入包含周围上下文但 loss 仅惩罚核心区域,既解决了窗口边缘几何断裂的难题,又防止了跨块预测发散,保持了原有物体级几何先验。
  • 低成本自举破解场景数据短缺:无需昂贵的人工标注或真实场景扫描,仅用 Blender 在程序化地形上撒布 Objaverse-XL 资产,便生成 32 万场景样本完成有效迁移,为 3D 物理场景生成提供了通用低成本训练范式。

局限与展望

  • 二轴测视角的固有约束:依赖二轴测或正交投影来保持全景尺度与步长的一致性,若要迁移至透视感极强的人视高(eye-level)大透视场景,窗口尺度的尺度缩放与深度形变将难以直接复用统一卷积核。
  • 高度受限与挤压截断:为了防止边界处建筑过高超出局部掩码,目前对掩码进行了 60 像素的垂直挤压外扩,在生成极端摩天大楼或深邃悬崖地貌时,垂直维度的表现力仍受到体素高度 \(M\) 的物理截断。
  • 未来方向:探索透视坐标系下的自适应尺度窗口卷积,以及结合流式渲染或八叉树层级隐空间的真正无限大开放世界端到端交互生成。

相关工作与启发

  • vs SynCity: SynCity 基于网格图块独立串行调用 TRELLIS 生成并刚性拼接,各图块间缺乏全局语义呼应,接缝处割裂严重;SynCity 3000 引入全局重叠去噪画布与卷积式 3D 扩散,实现了无缝且全局有机的场景流动。
  • vs 3DTown: 3DTown 依赖单目深度估计作为几何先验并在 3D 中执行图块锁定外绘,易因深度估计误差产生空洞与几何畸变;本文完全依托 3D 扩散先验从隐空间连续合成,几何闭合性与表面细腻度显著占优。
  • vs NuiScene: NuiScene 仅在包含 43 个场景的小规模 Objaverse 子集上训练 VecSet 外绘模型,纹理需依赖 SceneTex 二次贴图且严重过拟合;本文通过 320k 合成场景数据自举与 3DGS 直接端到端解码,泛化能力与细节丰富度呈压倒性优势。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出核心-上下文卷积式 3D 扩散与二轴测重叠去噪,打破场景切块边界。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖模板保真度对比、两尺度几何真值代理评测、详尽消融及 27 人主观盲评。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表详实,对卷积推理细节与数据自举流程阐述极其透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为解决 3D 场景大尺度扩散生成的数据荒与边界割裂难题提供了教科书级的工程范式。