跳转至

DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling

会议: ECCV 2026
论文: ECCV 2026
项目主页: https://yanghb22-fdu.github.io/DreamWorld
领域: 视频生成
关键词: 世界模型, 视频扩散模型, 3D几何先验, 几何扩散, 解耦生成

一句话总结

DreamWorld 提出了几何先验锚定的解耦式世界模型架构,通过知识蒸馏将 3D 大模型的高维空间先验注入几何视频扩散模型生成补全的 3D 结构表征,进而指导外观视频扩散模型合成高保真、多视角严格一致的场景探索视频。

研究背景与动机

近年来,相机轨迹可控的视频扩散模型(VDM)迅速成为构建可交互 3D 世界模型的核心范式,用户可通过指定连续相机轨迹探索生成新视角的动态场景,在具身智能、虚拟现实与电影制作中展现出广阔前景。然而,现有的相机可控视频模型大多依赖隐式的时空特征表征或简单的外参编码,缺乏显式的 3D 几何约束。这类几何不可知(geometry-agnostic)的建模方式在面对大视角旋转、遮挡复原以及大尺度视差运动时,极易诱发结构塌陷、几何失真以及多视角间严重的视差漂移与空间不一致性。

直接引入显式几何辅助也面临核心矛盾:基于点云的反投影变形(warping)虽然能够提供准确的相机运动线索,但点云投影本身存在大量孔洞、遮挡伪影与断裂投影。如果直接将这类残缺破损的变形图像输入视频扩散模型进行修补,模型被迫同时承担“填补严重几何空缺”与“纠正视觉伪影并合成细致纹理”的双重重任,导致任务高度纠缠(task entanglement),最终往往输出过度平滑、细节模糊或结构飘移的内容。而 3D 基础模型(如 Depth Anything 3 / VGGT)虽然蕴含强大的全视角多尺度几何与布局先验,却运行在显式空间几何特征空间,与基于 VAE 潜空间的生成式视频扩散模型在特征维度与语义流形上完全脱节,难以直接耦合。

本文的切入角度是打破将几何仅仅视作外观合成附属产物的惯性思路,将显式几何先验提升为贯穿生成流程的“结构支点(structural pivot)”,构建“几何补全先行、外观渲染后置”的两阶段解耦生成机制。核心 idea:通过蒸馏范式将 3D 基础模型的高阶几何先验注入几何视频扩散模型,先以残缺变形引导扩散补全完整且视角一致的三维几何潜表征,再将其作为显式空间骨架条件注入外观视频扩散模型合成最终 RGB 视频,从根本上化解几何与外观的任务冲突。

方法详解

整体框架

DreamWorld 的整体流水线遵循两阶段几何与外观解耦的设计思想:在第一阶段,模型接收初始观察图像 \(I_0\) 与目标相机轨迹 \(\pi\),通过前向点云投影构建残缺变形序列,并由 3D 基础模型提取几何特征,经几何视频扩散模型生成完整、多视角对齐的高维 3D 结构特征序列;在第二阶段,外观视频扩散模型以该完整 3D 结构特征为物理空间引导,联合文本与初始图像条件,基于整流流(Rectified Flow)框架去噪并由 3D VAE 解码器渲染出高保真、物理一致的目标视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单帧初始输入 I0<br/>与目标轨迹 π"] --> B["点云投影与特征提取<br/>局部变形 + 3D基础模型"]
    B --> C["几何视频扩散模型<br/>特征级流匹配补全结构"]
    C --> D["几何投影模块 M<br/>多尺度对齐与高斯KL约束"]
    D --> E["外观视频扩散模型<br/>通道拼接注入几何骨架"]
    E --> F["高保真 3D 一致视频"]

关键设计

1. 几何视频扩散模型:在特征流形中补全空间结构支点 针对点云反投影在未观测区域与遮挡边缘产生大面积残缺和投影视差伪影的问题,本文并不直接在像素空间修补破损图像,而是将几何推理下沉到高阶结构特征空间。模型首先利用单目估计构建局部点云并沿轨迹 \(\pi\) 投影为部分观测帧 \(x_{warp}\),送入冻结的 3D 基础模型(如 DA3)提取多尺度时空几何特征,再经过映射得到残缺几何条件 \(z^{3d}_{warp}\)。几何视频扩散模型 \(F_{geo}\) 采用 Transformer 架构(DiT)并在纯几何潜空间运行整流流(Rectified Flow)训练,以真实目标视频的 3D 几何特征 \(z^{3d}_0\) 为监督目标: $$ \mathcal{L}{geo} = \mathbb{E}}^{3d0, \epsilon, t} \left| v}(\mathbf{z}^{3dt, t, \mathbf{z}^{3d}_0) \right|_2^2 $$ 该设计将几何补全完全隔离在特征空间,规避了高维像素纹理对三维形状推理的干扰,输出连续且空间一致的全局几何骨架。}, I_0, \mathcal{T}) - (\epsilon - \mathbf{z}^{3d

2. 几何投影与正则化模块:打通 3D 几何表征与 VAE 潜空间 3D 基础模型提取的多尺度特征维度巨大且空间分布各异,无法直接与视频 VAE 压缩空间交互。为此,DreamWorld 设计了轻量级 MLP 投影网络 \(M(\cdot)\),将浅层表面法向量、边缘等细节几何与深层全局场景拓扑统一映射为通道适配的扩散特征向量 \(z^{3d}_0\)。为了防止几何表征尺度失真并增强其在扩散去噪过程中的泛化性,在投影空间引入高斯分布 KL 散度正则化约束: $$ \mathcal{L}{\text{KL}} = D)\right) $$ 通过该自适应投影,复杂的 3D 几何先验被归一化为易于扩散主干消化的紧凑连续空间,充当几何与外观之间的稳固翻译桥梁。}}\left(\mathcal{N}(\mu(z^{3d}), \Sigma(z^{3d})) \parallel \mathcal{N}(0, \mathbf{I

3. 外观视频扩散模型:解耦架构下的几何引导高保真渲染 在获取高质量的完整 3D 结构特征 \(\hat{z}^{3d}_{tgt}\) 后,外观视频扩散模型 \(F_{app}\) 不再需要隐式猜测未见区域的遮挡关系或场景深度,而是专注于细粒度纹理的高保真合成与时序平滑。模型将投影后的几何结构骨架特征与加噪的视频 VAE 潜变量 \(z_t\) 在通道维度进行直接拼接(Channel Concatenation),并以初始图像 \(I_0\) 和文本描述 \(\mathcal{T}\) 作为交叉注意力引导。外观流匹配损失与正则项共同优化: $$ \mathcal{L}{app} = \mathbb{E}0, \epsilon, t} \left| v}(\mathbf{zt, t, \mathbf{z}^{3d}_0, I_0, \mathcal{T}) - (\epsilon - \mathbf{z}_0) \right|_2^2 + \lambda \mathcal{L} $$ 为了进一步消除训练与推理间的分布漂移(推理阶段输入为预测几何特征而非真实几何),第一阶段训练时在几何特征上注入适量高斯小扰动,显著提升了外观生成网络对前序几何预测误差的容忍度。}

损失函数 / 训练策略

DreamWorld 采用严格的两阶段分步训练策略。在第一阶段,固定预训练 3D 基础模型权重,联合训练轻量级几何投影模块 \(M\) 与外观视频扩散网络 \(F_{app}\),建立从几何特征流形到 VAE 潜变量的无缝生成映射,训练中加入微小几何噪声扰动以提高鲁棒性。在第二阶段,冻结训练好的投影网络 \(M\),独立训练几何视频扩散网络 \(F_{geo}\),专注于从破损变形特征中蒸馏补全完整的 3D 结构特征。两阶段均基于 Wan 2.1 视频扩散基座进行微调,使用 AdamW 优化器,学习率固定为 \(5 \times 10^{-5}\),全局 batch size 为 32,分别迭代 15,000 次,在分辨率 \(832 \times 480\)、81 帧的超长视频序列上完成高质量训练收敛。

实验关键数据

主实验

在单图像新视角合成基准 RealEstate10K(室内为主)与 Tanks-and-Temples(室外为主)上,对比隐式外参注入(MotionCtrl, CameraCtrl)与显式变形驱动(ViewCrafter, Gen3C)两类主流方案;并在多维度世界模型基准 WorldScore 上进行综合评测。

表 1:单图新视角合成主实验对比(RealEstate10K 与 Tanks-and-Temples 数据集)

数据集 难度划分 方法 PSNR ↑ SSIM ↑ LPIPS ↓ FID ↓ 旋转误差 Rdist ↓ 平移误差 Tdist ↓
RealEstate10K Easy Set MotionCtrl 14.12 0.538 0.413 88.13 4.372 8.778
RealEstate10K Easy Set CameraCtrl 19.09 0.706 0.325 42.18 1.254 2.796
RealEstate10K Easy Set ViewCrafter 19.21 0.719 0.315 39.75 0.713 2.086
RealEstate10K Easy Set Gen3C 20.73 0.726 0.279 33.97 0.556 1.582
RealEstate10K Easy Set DreamWorld (本文) 23.15 0.781 0.249 25.18 0.301 1.112
RealEstate10K Hard Set MotionCtrl 13.05 0.495 0.453 97.66 7.116 9.484
RealEstate10K Hard Set CameraCtrl 17.15 0.554 0.395 75.76 1.875 3.104
RealEstate10K Hard Set ViewCrafter 17.76 0.677 0.376 52.86 1.161 2.682
RealEstate10K Hard Set Gen3C 18.04 0.681 0.334 46.67 0.838 2.347
RealEstate10K Hard Set DreamWorld (本文) 20.94 0.739 0.267 31.16 0.521 1.318
Tanks-and-Temples Easy Set MotionCtrl 14.88 0.554 0.497 80.73 7.447 8.603
Tanks-and-Temples Easy Set CameraCtrl 15.79 0.587 0.396 71.31 1.656 2.913
Tanks-and-Temples Easy Set ViewCrafter 18.11 0.671 0.327 45.67 0.966 2.175
Tanks-and-Temples Easy Set Gen3C 18.95 0.683 0.308 41.95 0.884 1.677
Tanks-and-Temples Easy Set DreamWorld (本文) 21.66 0.721 0.256 29.85 0.377 1.214
Tanks-and-Temples Hard Set MotionCtrl 13.45 0.524 0.514 89.55 8.731 9.402
Tanks-and-Temples Hard Set CameraCtrl 14.01 0.532 0.493 82.01 1.975 3.124
Tanks-and-Temples Hard Set ViewCrafter 17.41 0.645 0.353 57.76 1.437 2.891
Tanks-and-Temples Hard Set Gen3C 17.95 0.659 0.331 48.42 1.266 2.510
Tanks-and-Temples Hard Set DreamWorld (本文) 19.59 0.704 0.283 36.95 0.584 1.337

表 2:WorldScore 世界模型综合基准评测对比

模型 3D 一致性 ↑ 照片级一致性 ↑ 风格一致性 ↑ 相机控制度 ↑ 物体控制度 ↑ 内容对齐度 ↑ 主观质量 ↑ 综合平均分 (Avg.) ↑
WonderWorld 82.85 67.86 55.79 92.32 47.63 79.09 69.03 70.65
AETHER 79.84 58.68 72.09 57.44 52.26 28.06 41.11 55.64
Uni3C 78.59 85.48 88.32 62.94 45.83 47.40 57.00 66.51
Voyager 56.00 80.68 72.89 45.92 57.69 48.36 44.74 58.04
FantasyWorld 83.31 86.11 94.22 57.05 34.46 38.45 57.40 64.43
DreamWorld (本文) 84.96 92.70 92.98 81.97 63.11 50.37 59.17 75.04

消融实验

消融实验基于 RealEstate10K 的 Easy Set 评估条件空间类型与解耦策略对生成质量的贡献。

表 3:DreamWorld 核心设计消融实验(RealEstate10K Easy Set)

配置方案 条件特征空间 (VAE / 3D) 几何与外观建模模式 (联合 / 解耦) PSNR ↑ SSIM ↑ LPIPS ↓ 说明
Baseline VAE 潜空间 几何不可知 / 纯图像条件 19.47 0.721 0.287 仅用变形图经 VAE 编码后作为直接条件
w/o 几何扩散模型 3D 几何空间 缺少补全扩散 / 直接使用残缺特征 20.05 0.724 0.283 直接以残缺 3D 几何特征驱动外观生成
w/o 几何-外观解耦 3D 几何空间 联合端到端多任务优化 21.87 0.752 0.256 单模型联合预测几何特征与外观潜变量
DreamWorld (完整模型) 3D 几何空间 解耦式:先几何补全后外观渲染 23.15 0.781 0.249 先扩散补全几何,再以几何引导外观渲染

关键发现

  • 几何-外观解耦是破解任务冲突的核心:相比于联合多任务训练方案(21.87 PSNR),解耦架构带来了高达 +1.28 dB 的 PSNR 跨越式提升,证实了将结构推理与纹理渲染拆分给专门分支能极大减轻优化负担。
  • 几何特征级扩散至关重要:若移除几何扩散模型、仅靠未补全的残缺 3D 特征,PSNR 从 23.15 骤降至 20.05(-3.10 dB),证明未观测区域的显式几何外推是消除外观合成歧义的绝对先决条件。
  • 大幅降低困难轨迹下的多视角漂移:在 Hard Set 上,DreamWorld 相较于前代最佳方法 Gen3C 分别在 RealEstate10K 和 Tanks-and-Temples 上取得了 +2.90 dB 和 +1.64 dB 的 PSNR 增益,且平移与旋转误差降低 30% 以上,证明其对复杂相机运动具有极佳的鲁棒性。

亮点与洞察

  • 将 3D 基础模型转化为生成的空间支点:不同于以往将 3D 模型仅用于下游几何重构,本文创新性地通过特征蒸馏将 3D 基础模型作为生成扩散的锚点,让通用视频扩散模型获得了严格物理空间布局意识。
  • 以“先结构、后外观”化解任务纠缠:打破了端到端单一视频扩散模型同时兼顾几何与外观的固有范式,先在低歧义的几何空间完成三维补全,再在稳定骨架上长出高保真像素。
  • 训练阶段的几何抗噪注入技巧:在外观模型训练时向几何特征注入适度扰动,巧妙平抑了推理阶段几何补全模型可能引入的预测漂移,是保证两阶段架构端到端泛化稳定的关键工程考量。

局限与展望

  • 假设场景为静态环境:当前框架建立在刚性 3D 点云反投影与静态场景几何假设之上,面对场景中快速运动的动态实体或形变物理交互时,点云投影先验将出现严重动静态混淆。
  • 计算与推理延迟较高:两阶段扩散流水线要求先后运行两个大型扩散模型(几何 DiT + 外观 DiT),生成单段长视频需要更多的反向采样步数,难以直接部署在实时人机交互世界模拟中。
  • 未来方向:探索动态场景下的时空 4D 几何潜空间统一表征,以及通过扩散蒸馏算法加速几何与外观模型的推理帧率。

相关工作与启发

  • vs CameraCtrl / MotionCtrl: 此类方法仅在时序层注入低维相机位姿矩阵或射线编码,属于几何不可知机制;本文引入 3D 基础模型的多尺度显式几何特征作为结构支点,彻底解决了大位移下新视角内容形变与结构塌陷问题。
  • vs ViewCrafter / Gen3C: 此类方案直接将点云变形后的残缺像素图作为扩散输入,让扩散模型直接面对伪影与孔洞;本文将变形下沉到几何特征级,并由专门的几何扩散模型先行修补三维流形,外观生成阶段接收到的是完整无损的结构骨架。
  • vs FantasyWorld: FantasyWorld 采用多任务联合预测方式,几何与纹理在同一网络内优化易引发目标互搏;本文通过两阶段解耦训练,各分支权责分明,在 WorldScore 的一致性与图像质量上均展现出明显优势。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 创新性地把 3D 基础模型的多尺度特征蒸馏进几何视频扩散模型作为中间支点,解耦架构逻辑清晰有力。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖室内外经典 NVS 基准(含易/难子集)以及前沿 WorldScore 世界模型基准,消融实验论证闭环严密。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,图文配合紧密,两阶段流水线设计机理讲解详实透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为解决视频生成向物理一致世界模型演进过程中的 3D 漂移难题提供了行之有效的标杆范式。