跳转至

Map2World: Segment Map Conditioned Text to 3D World Generation

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 3D 视觉
关键词: 3D场景生成、结构化隐变量、3D高斯泼溅、MultiDiffusion、TRELLIS

一句话总结

针对世界级 3D 数据匮乏导致的场景生成不完整与领域泛化局限,Map2World 提出以任意形状分割图为界面的 3D 世界生成框架,利用 TRELLIS 结构化隐空间的 3D MultiDiffusion 融合、频域初始噪声优化及条件式细节增强器,实现了任意布局可控、尺度一致且细节丰富的大尺度 3D 场景生成。

研究背景与动机

在大规模 3D 场景生成领域,高质量虚拟环境在沉浸式内容创作、游戏开发、自动驾驶仿真以及具身智能训练中具有重要应用价值。近年来单物体 3D 资产生成模型取得了显著突破,但将生成能力直接扩展到世界尺度仍面临严重瓶颈,核心阻碍在于高保真、大规模 3D 场景级数据的极度匮乏。现有工作主要分为两条技术路线:基于视角的生成通常利用 2D 图像或视频扩散模型生成多视角或漫游视频,再借助单目深度估计将其投影缝合为 3D 场景,这类方法虽然享受了 2D 基础模型的丰富先验,但在几何一致性上存在先天缺陷,遮挡与未观测区域极易产生空洞或形变漂移;而基于世界坐标系的直接 3D 生成方法(如 BlockFusion、CityDreamer、InfiniCube)直接在有限的特定 3D 场景集上训练生成器,导致模型被牢牢局限在单一垂直领域(如仅限自动驾驶道路或特定建筑结构),既缺少跨领域的泛化能力,也常常无法生成高质量的完整材质纹理。

为了打破数据墙,一种新思路是复用在大规模 3D 资产集上预训练的通用 3D 资产生成器(如基于结构化隐变量 SLAT 的 TRELLIS),将其强大的物体级先验迁移到场景级合成中。然而,预训练资产生成器的有效空间分辨率通常被限制在固定尺寸的体素立方体(如 \(64^3\))。早期的网格式拼接方案(如 SynCity)机械地将世界切分为均匀网格并分别生成独立资产后合并,这不仅无法支持非网格的任意多边形语义布局,而且在网格边界处衔接生硬、断裂明显,无法生成跨越多个图块的连贯大尺度地貌和建筑,全局场景的尺度更常发生混乱与失调。

该任务的核心矛盾在于:如何在无需从头采集和训练大规模 3D 场景模型的前提下,将有限空间分辨率的 3D 资产生成先验无缝拓展到任意形状语义布局的大尺度物理世界,同时保证全局尺度的物理一致性与局部纹理几何的高精细度。本文的核心 idea 是:将任意形状的 2D 语义分割图沿高度轴拉伸为 3D 引导掩码,在 TRELLIS 结构化隐空间中通过时变高斯平滑的 MultiDiffusion 融合多区域去噪轨迹,结合频域参数化初始噪声优化施加场景尺度流形约束,并利用轻量级条件细节增强器自回归超分局部隐变量,从而无缝生成布局可控且高精度的 3D 世界。

方法详解

整体框架

Map2World 的输入为包含多个语义区域的 2D 语义分割图,以及为每个区域分配的用户自定义文本提示词(如“长满高大绿树的森林”、“由摩天大楼和道路组成的城市”),输出为全局一致、支持任意漫游视角渲染的高质量 3D Gaussian Splatting (3DGS) 场景。整体流水线分为两个主要阶段:第一阶段是基于结构化隐变量(Structured Latent, SLAT)的任意大尺度空间扩展去噪;第二阶段是基于条件式细节增强器(Detail Enhancer)的局部隐变量超分辨率增强与微调解码。

首先,系统将 2D 分割图均匀沿高度轴投影拉伸为 3D 语义掩码,将三维空间划分为一系列彼此重叠的局部立方体窗口,在结构流 Transformer(\(\mathcal{G}_S\))与隐特征流 Transformer(\(\mathcal{G}_L\))的去噪步骤中,利用高斯加权的 MultiDiffusion 机制并行融合相邻窗口与语义区域的速度场预测;在此之前,先通过频域优化的初始噪声将隐空间对齐到指定场景尺度流形。随后,生成的全局粗粒度结构化隐变量被送入局部细节增强网络,通过复用预训练流 Transformer 并引入自回归条件特征融合,将大立方体隐变量上采样细化为 8 个具有丰富几何与外观细节的子立方体隐变量,最后经过微调的 SLAT 解码器生成最终的 3DGS 场景表示。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:2D 语义分割图<br/>+ 各区域文本提示词"] --> B["频域初始噪声优化<br/>对齐全局尺度流形"]
    B --> C["3D 隐空间 MultiDiffusion 融合<br/>重叠窗口与动态高斯区域融合"]
    C --> D["条件式层次化细节增强器<br/>1到8子立方体自回归隐变量细化"]
    D --> E["局部 SLAT 解码器微调<br/>生成高保真 3DGS 场景"]

关键设计

1. 3D 隐空间 MultiDiffusion 融合:解决任意形状语义区域的无缝空间扩展 预训练 TRELLIS 的生成分辨率被限制在 \(64^3\) 体素网格内,无法直接容纳包含地表、植被与复杂建筑的宏大世界。为了突破固定网格尺寸并摆脱刚性方格拼接导致的边界缝隙,Map2World 将 2D MultiDiffusion 机制扩展至 3D 整流流(Rectified Flow)隐空间。系统在三维连续空间中定义一组空间步长重叠一半的 \(64^3\) 立方体窗口 \(\{\Omega_j\}\),对于任意空间坐标 \(\mathbf{x}\),其局部的去噪速度场由所有覆盖该坐标的激活窗口 \(\mathcal{A}(\mathbf{x}) = \{ j \mid \mathbf{x} \in \Omega_j \}\) 共同投票决定,并通过以窗口中心 \(\mathbf{c}_j\) 为基准的 3D 高斯核 \(W(\cdot)\) 归一化聚合。针对任意形状的语义区域控制,模型将用户给定的 2D 布局沿高度轴拉伸为 \(K\) 个区域的 3D 二值掩码 \(M_k(\mathbf{x})\),并在去噪步 \(t\) 下引入动态平滑的 3D 高斯核 \(G(\sigma_t)\) 对掩码进行空间卷积滤波:

\[ \tilde{v}_t(\mathbf{x}) = \frac{\sum_{k=1}^K \left(M_k(\mathbf{x}) \odot G(\sigma_t)\right) \cdot v_t(\mathbf{x}|y_k)}{\sum_{k=1}^K \left(M_k(\mathbf{x}) \odot G(\sigma_t)\right)} \]

高斯方差 \(\sigma_t\) 随扩散时间步 \(t\) 从初期的大尺度平滑逐渐退火衰减为后期的锐利掩码。这种设计允许不同语义提示词(如道路与草地)在扩散初期在边界处保持语义过渡的柔和连贯,而在后期精确对齐到指定的多边形边界,避免了硬切截断带来的几何撕裂。

2. 频域初始噪声优化:施加全局尺度流形几何约束 TRELLIS 等 3D 资产模型在生成时对初始噪声极其敏感,不同的高斯白噪声采样会导致生成内容在粗粒度结构与绝对物理尺度上产生极大扰动。实验观察发现,在稀疏结构隐空间中,具有相似物理尺度的场景(如单体小建筑 vs 延绵城市街区)聚集在具有共性地面和空旷空间分布的低维流形上。为了避免因随机噪声采样导致世界各局部地平面错位、物体忽大忽小,Map2World 引入了尺度感知的初始噪声优化机制。为了避免对整条整流流去噪轨迹进行代价高昂的全步长反向传播,模型采用一步线性轨迹逼近 \(S(t) \approx S_T + (1 - \frac{t}{T})[\mathcal{G}_S(S_T) - S_T]_{\mathrm{sg}}\) 计算梯度,并利用目标尺度约束 \(y\) 与公共区域掩码 \(\mathcal{M}\) 构建线性引导损失:

\[ \mathcal{L}_{\text{linear}} = \left\| y - \mathcal{M} \left( S(t) \right) \right\|_2 \]

由于在早期结构更新时直接在空间域对噪声张量应用大梯度更新极易引发模式崩溃,算法将稀疏结构特征 \(S\) 转换到频域进行 3D 快速傅里叶变换(3D FFT)参数化。在频域中更新频谱系数极大地平滑了优化曲面,使模型可以在学习率高达 9.0 的情况下仅通过 5 步迭代迅速收敛到目标尺度流形上,确保生成的全局世界在物理尺度与水平地面拓扑上保持高度一致。

3. 条件式层次化细节增强器与局部 SLAT 解码器微调:突破分辨率瓶颈并实现局部几何保真 即使通过 MultiDiffusion 拼合了全局世界隐变量,有限的隐空间通道容量依然无法承载大尺度场景内部微观几何的全部细节。直接在 3D 空间训练超分辨率网络面临极大的配对数据短缺。为此,Map2World 构建了一个隐空间内的层次化细节增强网络(Detail Enhancer)。在训练时,作者从 Objaverse 高质量场景中裁剪出 17,500 个局部大立方体 \(C_\mathcal{O}\),并将每个大立方体等分为 8 个子小立方体 \(C_j\)(\(j=0,\dots,7\)),分别通过 TRELLIS 编码器提取粗细两级 SLAT 隐变量。细节增强网络以目标子区域对应的截断粗隐变量 \(s^{\mathcal{O}|j}\) 以及已生成的相邻子立方体隐变量 \(s^{\text{Adj}(j)}\) 为条件,将其与噪声在通道维度拼接后输入共享权重的浅层 MLP(\(\mathcal{F}_\theta\))进行特征融合,再复用预训练流 Transformer 进行去噪预测:

\[ \mathbf{v}_\theta(\mathbf{s}^j, t) = \mathcal{G}_{S/L}\left( \mathcal{F}_\theta \left( \mathbf{s}_t^j, \mathbf{s}^{\mathcal{O}|j}, \mathbf{s}^{\text{Adj}(j)} \right), t \right) \]

在微调过程中,保持预训练 Transformer 权重冻结,仅微调 MLP 层 \(\mathcal{F}_\theta\),并将其初始权重设为对角阵恒等映射,确保网络平滑过渡。此外,针对原始 TRELLIS 的 3DGS 解码器因仅在完整闭合单物体上训练、解码局部开放场景块时容易出现伪影的问题,Map2World 进一步利用小立方体网格对结构化隐变量解码器(\(D_L\))进行自适应微调,显著提升了解码后 3D 高斯的表面锐度与局部材质精细度。

实验关键数据

主实验

论文在统一文本提示词条件下,将 Map2World 与领域内四种代表性基准进行了系统评测:InfiniCube(面向自动驾驶场景)、CityDreamer(面向城市建筑)、GaussianCube(无布局条件的 3D 生成)以及同样基于 TRELLIS 的最新网格化场景生成基线 SynCity。评测采用多维评估体系:基于 GPT 5.3 评估的大尺度场景质量指标 World Quality(WQ = \(0.15S + 0.45W + 0.25C + 0.15R\),覆盖清晰度 \(S\)、世界完整度 \(W\)、一致性 \(C\) 与真实感 \(R\))、基于 35 个真实场景渲染图计算的分布距离(FID / KID),以及 19 位受试者对 21 对生成样例的双盲人类偏好胜率(以 Map2World 为基准对照)。

方法 S (清晰度) ↑ W (世界完整度) ↑ C (一致性) ↑ R (真实感) ↑ WQ ↑ FID (Incep.v2) ↓ 人类整体质量偏好率 (Map2World胜率) ↑
InfiniCube [ICCV 2025] 6.5 3.8 3.2 4.6 4.05 268.0 98.25%
CityDreamer [CVPR 2024] 7.8 8.5 6.2 5.9 7.36 272.8 91.23%
GaussianCube [NeurIPS 2024] 6.8 4.5 5.0 5.1 5.08 169.1 98.25%
SynCity [arXiv 2025] 8.2 6.8 7.6 7.3 7.25 143.4 89.47%
Map2World (本文) 8.0 7.8 7.9 7.6 7.76 192.4 Reference

消融实验

论文针对细节增强器(Detail Enhancer)的网络架构设计、Classifier-Free Guidance (CFG) 机制的取舍以及 SLAT 解码器(\(D_L\))微调的有效性进行了严格的定量消融。测试集图像渲染自 Objaverse 场景网格真值,评估指标包括峰值信噪比(PSNR)、感知相似度(LPIPS)以及基于 Inception v3、DINOv2 和 CLIP 提取器的多视角 FID。

配置 增强器架构 使用 CFG 解码器微调 PSNR ↑ LPIPS ↓ FID (Incep.v3) ↓ FID (DINOv2) ↓ FID (CLIP) ↓ 说明
(a) 完整方案 (Ours) 通道拼接 MLP 否 是 22.53 0.2137 16.98 32.67 11.79 架构紧凑,边界衔接自然,指标最优
(b) 替换为 IP-Adapter 交叉注意力 Adapter 否 是 20.28 0.2499 29.62 80.81 19.85 难以捕捉精确局部空间几何,边界出现明显断裂
(c) 引入 CFG 引导 通道拼接 MLP 是 是 21.95 0.2174 19.06 38.15 21.32 条件与无条件输出差距过大,造成几何过饱和畸变
(d) 无解码器微调 通道拼接 MLP 否 否 22.08 0.2165 17.89 32.94 13.17 局部微观结构出现模糊,未适配开放场景分布

关键发现

  • 世界完整度与无缝衔接是场景生成的核心胜负手:SynCity 虽借助 TRELLIS 原生权重维持了单体清晰度(\(S=8.2\)),但在拼接复杂布局时因网格割裂导致世界完整度仅为 6.8;Map2World 依靠动态高斯平滑 MultiDiffusion 将全局一致性提升至 7.9,在大场景综合评级(WQ)上达到 7.76,人类评测中以 89.47% 的绝对优势碾压 SynCity。
  • CFG 在强条件隐空间增强中出现负收益:常规扩散模型重度依赖 CFG,但在细节增强阶段,条件信号(粗粒度隐变量)直接决定了基础拓扑,无条件推断与条件推断之间漂移严重。引入 CFG 反而导致差分放大引发色彩过饱和与几何破损,关闭 CFG 才能在保持保真度的同时平稳去噪。
  • 频域参数化显著加速全局尺度收敛:在初始噪声优化中,直接在体素空间以大步长反传梯度会导致严重震荡乃至发散(学习率 9.0 时失稳,学习率 1.0 时需数十步);而采用 3D FFT 频域参数化后,仅需 5 次迭代即可使场景几何 IoU / Dice 稳定收敛到 0.90 以上。

亮点与洞察

  • 将 2D 布局扩散思维无缝平移至 3D 隐空间流模型:将 MultiDiffusion 概念从 2D 像素/潜空间拓宽至 3D Rectified Flow 连续空间,巧妙利用时变平滑高斯核实现了任意复杂非凸形状语义区域的渐进式对齐,克服了以往方法只能生成矩形块拼接的死板限制。
  • 频域噪声优化解耦尺度控制与昂贵采样:没有采取昂贵的重训或多轮完整反传策略,而是洞察到场景尺度在噪声空间中存在流形聚集性,通过单步线性近似与 3D FFT 频域变换,以极小算力实现了确定性的全局场景尺度引导。
  • 小数据驱动的隐空间层次化增强范式:仅利用 35 个高质量场景提取的局部立方体,在冻结大部分主干的前提下只微调轻量 MLP,便完成了 \(1\to 8\) 的 3D 层次化局部细节重构,为缺少大规模配对 3D 场景数据的高分辨率生成提供了通用样板。

局限与展望

  • 作者指出的局限:目前的 3D 语义掩码仍是将 2D 平面分割图沿高度轴进行均匀垂直柱状拉伸获得,对于具有高度维语义变化(如多层建筑立面结构、地下隧道或高架天桥)的立体垂直分层场景缺乏精细的高度轴控制力。
  • 推导与泛化局限:由于基础先验深度依赖 TRELLIS 物体级数据集的分布,生成极端稀有的人造地貌或复杂大规模动态交互实体时可能退化;同时 8 子块自回归生成在极超大规模世界中存在序列推断耗时较长的瓶颈。
  • 未来改进方向:可引入真正的 3D 语义占据体素网格(Semantic Occupancy)作为输入界面以支持全三维立体构型;进一步将局部细节增强器改进为并行非自回归扩散流程,提升极端大尺度场景的渲染吞吐率。

相关工作与启发

  • vs SynCity [arXiv 2025]: SynCity 同样基于 TRELLIS 探索大场景合成,但采用刚性网格切分并对每个网格独立采样,导致边缘断层明显且无法适配任意非规则分割图;Map2World 引入 3D MultiDiffusion 轨迹加权融合与时变动态高斯掩码,支持任意自由形状多边形并实现了无缝的边界过渡。
  • vs CityDreamer [CVPR 2024] / InfiniCube [ICCV 2025]: 传统世界生成模型大多依赖领域内专用 3D 标注集(如自动驾驶驾驶视点、合成城市建筑)从头训练生成器,无法泛化至自然森林、奇幻地貌等开放世界;Map2World 通过复用通用 3D 资产大模型隐空间,在几乎无需海量场景数据微调的情况下兼具强大的跨域生成泛化力。
  • vs 2D MultiDiffusion [ICML 2023]: 2D 领域的 MultiDiffusion 主要面向图像与全景图的重叠窗口拼接;本文将其从平面扩散推广至 3D 结构化流匹配空间,并配套解决了 3D 场景特有的多尺度流形失配与局部微观纹理稀释问题。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (巧妙将 3D MultiDiffusion、频域初始噪声优化与隐空间细节增强器结合,首次实现了任意形状分割图引导的通用 3D 世界生成)
  • 实验充分度: ⭐⭐⭐⭐☆ (包含完备的多视角 GPT 评分、分布距离、消融实验与多维度双盲人类偏好对比,实验结论扎实)
  • 写作质量: ⭐⭐⭐⭐⭐ (逻辑链条清晰,从资产生成器向世界模型跃迁的痛点切入准确,公式与架构图表述严密)
  • 价值: ⭐⭐⭐⭐☆ (为 3D 场景合成提供了无需昂贵场景数据集的全新技术范式,在游戏、虚拟漫游及仿真领域实用前景广阔)