跳转至

OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Onishi-Lab/OneWorld ⚠️ 以原文为准
领域: 3D视觉
关键词: 3D场景生成、统一3D表征、自编码器、跨视角对应、流形漂移强化

一句话总结

OneWorld 摒弃传统的 2D/视频潜在空间生成范式,构建融合外观与语义的 3D 统一表征自编码器并在其几何感知空间中直接扩散生成 3D 高斯泼溅场景,配合跨视角对应约束与流形漂移强化解决多视角一致性与曝光偏差难题。

研究背景与动机

基于扩散模型的 3D 场景生成致力于根据单张参考图像或文本提示合成具备高度真实感与交互性的 3D 数字化世界,在机器人仿真、虚拟现实与游戏资产生成中扮演着核心角色。早期的 3D 生成工作通常依赖分数蒸馏抽样(SDS)在 NeRF 或 3D 高斯泼溅(3DGS)上做逐场景长时间反向优化,不仅计算成本极高,且极易出现多头畸变与跨视角语义割裂。为了提升效率,近期方法转向利用 2D 图像扩散先验,先合成多视角图像或视频再进行几何重建,或者在冻结的 2D 图像/视频 VAE 隐空间中执行扩散并附加 3DGS 解码头(如 FlashWorld、Prometheus 等)。然而,这类 2D 潜在空间本质上缺乏显式的跨视角 3D 几何绑定,生成过程中往往难以维持严格的跨视点外观保真度与几何拓扑一致性。

直接在 3D 几何表征空间做生成建模面临严峻的表征困境。虽然近年来以 π3、Dust3R 为代表的前馈 3D 基础模型在几何重建任务上取得了突破,但其表征高度偏向几何拓扑而严重抽象了纹理外观,无法直接解码出色彩细腻、视觉一致的高分辨率渲染结果;而类似 Gen3R 的同期工作通过将 3D 表征强行压缩以对齐视频 VAE 空间,又导致几何点云与外观视频割裂生成,削弱了 3D 统一建模能力并在大基线视角变换下退化严重。此外,在 3D 潜在空间中进行自回归或多步去噪时,训练时的真实加噪特征与推理时的模型自生中间态之间存在显著的暴露偏差(Exposure Bias),一步微小的几何漂移便会在跨视角几何耦合下被级联放大,导致最终 3D 解码崩塌。

本文的核心切入点是跳出 2D 潜在表征的局限,让扩散模型直接在增强后的 3D 基础模型潜空间内统一协同生成几何与外观。核心 idea:构建融合外观注入与语义蒸馏的 3D 统一表征自编码器(3D-URAE),在此高维几何感知空间中部署条件扩散模型,并引入视角间语义匹配分布约束的跨视角对应损失(CVC)与混合偏移动态潜变量的流形漂移强化策略(MDF),实现高保真度且跨视角严格一致的单视角 3D 场景端到端生成。

方法详解

整体框架

OneWorld 的核心流程分为三个相互支撑的阶段:首先,以预训练前馈 3D 基础模型(π3)为底座构建 3D 统一表征自编码器(3D-URAE),通过外观注入分支补全纹理、语义蒸馏分支对齐基础视觉模型(DINOv2)正则化隐空间流形,输出兼顾几何、外观与语义的统一 3D 标记 \(V\);其次,在统一 3D 隐空间中训练基于 DiT 架构的条件扩散生成模型,并利用跨视角对应损失(CVC)维持目标视角预测与条件输入视角的拓扑匹配分布;最后,针对推理期累积的采样偏移提出流形漂移强化(MDF),利用加噪扩散中间态与真实潜变量的凸组合微调 3DGS 解码头,增强解码器对离流形漂移标记的鲁棒性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    A["单张输入图像 + 相机位姿"] --> B["3D统一表征自编码器<br/>外观注入 + 语义蒸馏正则化"]
    B --> C["跨视角对应扩散去噪<br/>DiT 在统一 3D 隐空间去噪"]
    C --> D["流形漂移强化解码<br/>混合漂移潜变量微调 3DGS 头"]
    D --> E["高保真 3DGS 场景表征与新视角渲染"]

关键设计

1. 3D统一表征自编码器:解耦注入高保真外观与自洽语义约束 前馈 3D 基础模型(如 π3)通常直接使用预训练 DINOv2 作为图像 patchifier 提取语义标记 \(Z \in \mathbb{R}^{N \times h \times w \times C}\),这类特征经过高度语义抽象后丢失了大量高频纹理细节,导致重建出的 3D 高斯泼溅模糊失真。为此,3D-URAE 引入一个轻量卷积外观编码器 \(E_{\text{app}}\),从原始输入图像中提取与语义标记空间分辨率和通道对齐的外观特征 \(Z_{\text{app}}\),将其沿通道拼接得 \([Z \parallel Z_{\text{app}}]\) 并与相机参数 \(T\) 一同送入几何 Transformer 编码器 \(E_V\),生成统一几何-外观标记 \(V \in \mathbb{R}^{N \times h_v \times w_v \times C_v}\)。同时,纯几何渲染监督下的 \(V\) 缺乏紧凑的语义拓扑分布,增加后续扩散难度。为此设置语义蒸馏分支,通过轻量适配器 \(A_{\text{sem}}\) 将 DINOv2 标记投影为 \(Z_{\text{sem}}\),利用边际余弦相似度损失 \(\mathcal{L}_{\text{mcos}}\) 和空间距离矩阵相似度损失 \(\mathcal{L}_{\text{mdms}}\) 对齐两者的局部与全局几何关系,形成正则化的 3D 流形。 $\(\mathcal{L}_{\text{sem}} = \mathcal{L}_{\text{mcos}} + \lambda_{\text{mdms}}\mathcal{L}_{\text{mdms}}\)$ 配合可微 3DGS 渲染损失 \(\mathcal{L}_{\text{render}}\),3D-URAE 使单一标记兼具显式 3D 几何、细粒度外观与紧凑语义。

2. 跨视角对应扩散去噪:以跨视角匹配分布显式保全空间拓扑 在 3D-URAE 生成的统一 3D 标记空间中,扩散模型负责以条件视角为基准去噪目标视角的 3D 标记 \(x_0\)。传统的均方误差损失(如 \(v\)-prediction 损失 \(\mathcal{L}_v = \mathbb{E}[\|\hat{v}_\theta - v\|_2^2]\))仅度量高维特征空间中的逐标记均方误差,无法显式约束跨视角几何对应的连贯性,极易在新视角合成中引发物体漂移或断裂。为此,本文设计了跨视角对应保持损失(CVC)。对于目标视角中的每个标记位置 \(p\),首先在真实标记 \(x_{0,p}\) 与条件视角标记 \(c_{0,q}^{(\text{cond})}\) 之间计算余弦相似度,通过设置置信度阈值 \(\tau = 0.9\) 筛选出匹配质量最高的条件视角最近邻对应点 \(q_p^\star\)。随后,在模型去噪预测出的 \(\hat{x}_{0,p}\) 上,以交叉熵形式强制其在条件视角标记全图上诱导的 softmax 相似度概率分布聚焦于先验对应索引 \(q_p^\star\): $\(\mathcal{L}_{\text{cvc}} = \frac{1}{\sum_p \mathbf{1}_p} \sum_{p=1}^{N_p} \mathbf{1}_p \cdot \left( -\log \frac{\exp(\cos(\hat{x}_{0,p}, c_{0,q_p^\star}^{(\text{cond})}) / \mathcal{T})}{\sum_{q=1}^{N_p} \exp(\cos(\hat{x}_{0,p}, c_{0,q}^{(\text{cond})}) / \mathcal{T})} \right)\)$ 其中 \(\mathcal{T}\) 为温度超参数。总扩散目标定义为 \(\mathcal{L}_{\text{diff}} = \mathcal{L}_v + \lambda_{\text{cvc}} \mathcal{L}_{\text{cvc}}\),保证扩散模型在消除高维噪声的同时严格维持跨视角的几何对应约束。

3. 流形漂移强化解码:混合偏移动态潜变量消除推理期暴露偏差 尽管扩散模型在训练中通过真实加噪潜在变量学习单步去噪,但在多步采样推理时,输入完全依赖前一时刻的预测值。微小的预测误差随时间步累加产生采样漂移,使生成的 3D 标记逐渐偏离 3D-URAE 的原始流形;这一偏离在多视角空间耦合下被急剧放大,导致原本针对无噪流形训练的 3DGS 解码头性能恶化,产生鬼影与几何扭曲。流形漂移强化(MDF)通过主动构造流形外扰动来强化解码头。具体而言,冻结编码器 \(E_V\),利用前一阶段训练好的 DiT 生成处于中间采样时间步 \(t \sim \mathcal{U}([T_1, T_2])\) 的干净潜变量预测 \(\hat{V}_0^{(t)}\),并将其与 3D-URAE 的真实潜变量 \(V\) 进行随机线性插值,合成偏移潜变量: $\(\tilde{V} = \alpha \hat{V}_0^{(t)} + (1 - \alpha) V, \quad t \sim \mathcal{U}([T_1, T_2]), \ \alpha \sim \mathcal{U}([0, 1])\)$ 将混合特征 \(\tilde{V}\) 传入 3DGS 解码头 \(D_V\),计算所有可用视角的渲染误差 \(\tilde{\mathcal{L}}_{\text{render}}\) 并反向传播。通过在连续漂移流形上重构真实场景图像,解码头习得了极强的容错鲁棒性,有效拓宽了 3D 表征在采样漂移下的保真渲染裕度。

损失函数 / 训练策略

OneWorld 采用严谨的分阶段训练管线: 1. 3D-URAE 训练:在 RealEstate10K 与 DL3DV-10K 的 1:1 混合数据上初始化自 \(\pi3\),每场景抽取 8 个视角输入、4 个新视角监督,图像分辨率设为 \(224 \times 448\)。优化目标为 \(\mathcal{L}_{\text{URAE}} = \mathcal{L}_{\text{render}} + \lambda_{\text{sem}} \mathcal{L}_{\text{sem}}\)(其中 \(\lambda_{\text{lpips}} = 0.05, \lambda_{\text{sem}} = 0.1, \lambda_{\text{mdms}} = 1.0\),边界超参 \(m_1 = m_2 = 0.05\)),采用 AdamW 优化器,学习率从 \(2 \times 10^{-4}\) 衰减至 \(2 \times 10^{-5}\),全局 batch size 为 64,在 32 张 NVIDIA A100 GPU 上训练 30K 步。 2. 扩散模型训练:基于 Wan-2.1-T2V-1.3B 初始化条件 DiT,在 3D-URAE 的潜空间中执行 \(v\)-prediction 去噪任务,引入 CVC 损失超参 \(\tau = 0.9, \lambda_{\text{cvc}} = 0.2\)。采用 0.5 概率的分类器无引导(CFG)文本丢弃,全局 batch size 256,学习率从 \(1 \times 10^{-4}\) 线性衰减至 \(1 \times 10^{-5}\),EMA 衰减率为 0.9995,训练 100K 步。 3. MDF 解码头微调:设置漂移步长区间 \(T_1 = 10, T_2 = 20\),冻结 3D-URAE 编码器 \(E_V\) 并仅更新 3DGS 解码头 \(D_V\),使用学习率 \(2 \times 10^{-5}\) 和 batch size 256 训练 10K 步。

实验关键数据

主实验

在标定的单视角新视角合成(1-view NVS)协议下,模型在 RealEstate10K 与 DL3DV-10K 测试集(各 500 个场景)上评估 PSNR、SSIM、LPIPS 及 VBench 系列生成质量指标(主体一致性 I2V Subj.、背景一致性 I2V BG 和成像质量 I.Q.)。

数据集 评价指标 OneWorld (本文) 次优方法 次优基准模型 相对提升
RealEstate10K PSNR ↑ 21.57 20.18 FlashWorld +1.39 dB
RealEstate10K SSIM ↑ 0.735 0.724 FlashWorld +0.011
RealEstate10K LPIPS ↓ 0.231 0.256 FlashWorld -0.025 (感知更优)
RealEstate10K I2V Subj. ↑ 0.993 0.994 Gen3R -0.001 (基本持平)
RealEstate10K I2V BG ↑ 0.995 0.994 FlashWorld / Gen3R +0.001
RealEstate10K I.Q. ↑ 0.604 0.593 Gen3R +0.011
DL3DV-10K PSNR ↑ 17.19 16.02 FlashWorld +1.17 dB
DL3DV-10K SSIM ↑ 0.589 0.566 FlashWorld +0.023
DL3DV-10K LPIPS ↓ 0.418 0.451 FlashWorld -0.033 (感知更优)
DL3DV-10K I2V Subj. ↑ 0.966 0.964 FlashWorld / Gen3R +0.002
DL3DV-10K I2V BG ↑ 0.973 0.970 Gen3R +0.003
DL3DV-10K I.Q. ↑ 0.556 0.543 Gen3R +0.013

在无成对真值的开放场景生成评测中,遵循 WorldScore 评测协议: - WorldScore-Indoor:OneWorld 在 3D 一致性(3D Consist.)上达到 84.98(次优 FlashWorld 83.57),在光度一致性(Photo. Consist.)上达到 81.67(次优 FlashWorld 80.19),风格一致性 76.74,综合多视角保真表现领先。 - DL3DV (室外评测):OneWorld 的 3D 一致性达 78.21(次优 FlashWorld 76.74),光度一致性达 74.09(次优 FlashWorld 72.76),风格一致性 70.62。

消融实验

消融实验细致拆解了 3D-URAE 的构建模块(外观注入与语义蒸馏)以及生成核心组件(CVC 与 MDF)。

模块类别 / 变体 评测场景 / 设定 PSNR ↑ SSIM ↑ LPIPS ↓ 说明
3D-URAE 重建基准 重建基准(含外观注入) 28.19 0.932 0.102 完整 3D-URAE 表征重建
w/o 外观注入分支 仅使用 DINOv2 抽象特征 21.14 0.669 0.293 丢失细粒度纹理,PSNR 暴跌 7.05 dB
OneWorld 生成模型 生成测试(含语义蒸馏) 21.57 0.735 0.231 完整生成模型表现
w/o 语义蒸馏分支 无 DINOv2 语义正则化约束 17.45 0.644 0.352 3D 隐空间缺乏紧凑结构,PSNR 骤降 4.12 dB
OneWorld (Full) RealEstate10K 单视角生成 21.57 0.735 0.231 完整方法(I.Q. 0.604)
w/o 跨视角对应 (CVC) 去除跨视角对应匹配损失 19.10 0.682 0.284 跨视角几何解耦导致严重漂移,PSNR 下降 2.47 dB
w/o 流形漂移强化 (MDF) 解码头仅在 GT 潜变量上训练 20.59 0.714 0.256 推理期曝光偏差导致渲染瑕疵,PSNR 下降 0.98 dB

关键发现

  • 外观注入对纹理保真度至关重要:在 3D 自编码器阶段,缺乏外观注入会导致重建 PSNR 从 28.19 暴跌至 21.14,证明单纯依赖 DINOv2 这类高层抽象特征无法承载精细外观纹理,双路外观注入是高品质 3DGS 渲染的基础。
  • 语义蒸馏极大降低了 3D 扩散生成难度:在去除语义蒸馏分支后,扩散生成 PSNR 发生断崖式下跌(-4.12 dB),表明未经语义结构约束的几何特征流形过于分散混沌,将语义知识蒸馏进 3D 标记能构建紧凑规则的潜空间,大幅提升 DiT 拟合效率。
  • CVC 是多视角结构一致性的关键屏障:消融 CVC 导致生成 PSNR 大幅下跌 2.47 dB 且 LPIPS 显著劣化至 0.284,表明单纯的标记均方误差缺乏拓扑感知,无法抵御复杂视角切换下的错配,唯有显式匹配对齐方能保全跨视点拓扑。
  • MDF 有效抚平了自回归式采样的离流形抖动:去除 MDF 后,渲染质量在 PSNR、SSIM 和 LPIPS 上全面回退,证实了混合偏移动态标记能够显著拓宽解码器的接收域,使解码头在面对扩散去噪残余误差时不产生崩塌。

亮点与洞察

  • 原生 3D 统一隐空间生成范式:跳出以往在 2D 图像/视频 VAE 潜空间做扩散并割裂拼接 3D 头的旧思路,首创直接在 3D 基础模型潜空间内统一建模几何、外观与语义,消除了 2D 潜在表征与真实 3D 物理世界之间的表征壁垒。
  • 置信度引导的 CVC 对应对齐机制:利用先验标记特征的余弦极值与置信度阈值挖掘跨视点硬对应索引,并将其转化为软概率交叉熵约束,巧妙地在无参数开销的前提下将传统几何多视点几何先验内化至 DiT 训练目标中。
  • 低成本的数据流形漂移防御策略(MDF):洞察到扩散模型推理暴露偏差在 3D 耦合环境下的破坏力,仅以几乎零额外架构开销(中间步采样潜变量与真实潜变量线性混合)微调解码头,便显著提升了系统面对采样累积误差的稳健性。

局限与展望

  • 训练开销与底座依赖:3D-URAE 与条件 DiT 依赖前馈 3D 基础模型(π3)和大规模视频 DiT(Wan-2.1)的强大先验,训练全流程耗费数十张 A100 GPU,对计算资源要求较高。
  • 大角度外推与室外广域泛化:虽然在 DL3DV 上取得了显著提升,但室外超大规模复杂拓扑场景(如非受限自然风光与动态光影)的相机轨迹外推仍存在几何边界不闭合与伪影现象。
  • 未来方向:探索与动态 4D 世界模型相结合,以及引入轻量化端侧自适应采样步长,进一步降低长距离漫游生成时的显存与时延开销。

相关工作与启发

  • vs FlashWorld / Prometheus: 后者均在 2D 图像或 Wan 视频 VAE 隐空间中执行扩散生成,再依赖解码器外推 3DGS,导致视角跨度增大时出现明显的几何断裂与身份不匹配;本文直接在 3D 统一表征空间中生成,空间一致性与几何刚性大幅增强。
  • vs Gen3R: Gen3R 试图对齐 3D 基础模型与视频隐空间,但选择将几何(点云)与外观(视频)解耦分步生成,限制了表征容量且对大基线变换极其敏感;本文 3D-URAE 通过外观注入与语义蒸馏实现了几何与外观的联合单步生成。
  • vs LVSM / Aether: 纯前馈大视点合成模型缺乏多步扩散的强大多样性与泛化生成先验,而本文结合了前馈 3D 基础表征与生成式 DiT,既保全了几何约束又赋予了开域补全能力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出在 3D 基础模型统一表征潜空间中直接进行场景扩散生成,摆脱了 2D 隐空间束缚。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 RealEstate10K、DL3DV 标定评测及 WorldScore 开放评测,消融实验设计严谨详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,结构设计自洽,数学表述精炼且图表对应紧密。
  • 价值: ⭐⭐⭐⭐⭐ 为 3D/4D 世界模型从传统的“2D 视频生成+后重建”范式向“原生 3D 统一扩散生成”转型提供了极具前景的工程与理论基准。