Dynamic World Generation Made Efficient¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 3D视觉 / 视频生成
关键词: 动态世界生成, 空间Token记忆, 跨视角一致性, 3D高斯泼溅, 并行视频生成
一句话总结¶
针对自回归序列化生成动态世界耗时长达数小时且易累积跨视角运动不一致的瓶颈,DYNWORLD 提出空间 Token 记忆(Spatial Token Memory),将流匹配视频生成器的中间隐层特征赋予估计的 3D 空间坐标并在跨视角的自注意力层中建立几何投影与交互,实现了多视角动态视频的完全并行生成与解耦 4D 高斯世界重建,将生成时间由数小时缩短至 15-30 分钟(约 10 倍加速)。
研究背景与动机¶
构建大尺度动态 3D 世界是虚拟现实、数字孪生、具身仿真与具身智能的核心基石。用户期望能够自由穿行于场景中,同时观察到空间连续且物理自洽的物体运动(如穿梭的车辆、行走的行人)与纹理演化(如流动的波浪、飘动的云朵)。然而,由于全场景 4D 动态真实数据的极度匮乏,直接端到端训练世界级 4D 生成模型困难重重。因此,当前主流范式普遍转向借助强大的预训练 2D/视频扩散模型,先生成多视角视频,再融合成统一的 3D/4D 场景表征(如 3D Gaussian Splatting 或点云)。
然而,这一范式面临严峻的跨视角运动一致性困境。现有的视频扩散模型本质上是独立生成单个视角的视频片段,缺乏视角间的显式几何约束与运动对应关系;若各自独立采样,相同运动物体在不同相机下必然出现形变、轨迹冲突或外观撕裂。为了缓解该问题,现有方案(如 DynamicVoyager)被迫采用极其低效的“自回归序列化外推”:先生成一个视角的视频,将其更新融入显式 3D 表征,再借助视频补全/外推指导生成下一视角。这种严格的时空依赖链导致严重的计算瓶颈,生成包含少量视角的动态世界动辄需要 3 到 6 小时,且容易在无重叠的远端视角之间丢失全局动态协调。另一类基于去噪分数融合(如 SyncSDE)的方法则仅能处理强重叠区域,且对扩散加噪轨迹的扰动易引发接缝伪影。
本文的切入视角在于:Transformer 架构的视频生成模型其隐层 Token 天然隐式编码了丰富的空间语义与运动演化信息,无需将其退化为低速的显式点云序列化更新,完全可以通过三维几何投影视角直接在 Token 级建立跨视角通信。核心 idea:构建空间 Token 记忆(Spatial Token Memory),在扩散去噪过程中实时估计去噪 Latent 的三维几何坐标并将 KV Token 反投影至世界空间,再通过相机位姿重投影与旋转位置编码(RoPE)注入到其他视角的注意力层,实现多相机视角视频的端到端并行生成与解耦动态高斯世界重建。
方法详解¶
整体框架¶
DYNWORLD 整体包含三个紧密衔接的阶段: 1. 静态世界构建:从单张输入图像出发,结合场景描述文本与预设相机轨迹,先通过深度与法线估计构建局部 3D 高斯核,随后沿相机轨迹执行图像外推与高斯合并优化,构建几何一致的无缝静态 3D 背景世界。 2. 基于空间 Token 记忆的并行视频生成:在静态世界中采样多个固定相机视角,利用基于流匹配(Flow-Matching)的 Transformer 视频生成模型同时生成各视角视频。在去噪过程中维护空间 Token 记忆,通过后验均值与锚点去噪估计瞬时深度,将当前层的 KV Token 投影至 3D 世界并重投影注入其他视角的注意力计算中,确保多视角动态完全同步。 3. 解耦动态高斯世界构建:将生成的各视角视频分割为静态背景与动态前景,背景采用时变颜色与恒定几何的高斯核建模,前景采用逐帧全时变参数高斯核重建,最终联合优化融合成全局统一的 4D 动态世界。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单张图像 + 轨迹描述"] --> B["静态世界构建<br/>深度法线估计 + 图像外推 + 3D高斯合并"]
B --> C["多视角固定相机图像采样"]
C --> D["并行视频生成架构<br/>流匹配 Transformer + 严格固定视角 Prompt"]
D <--> E["空间 Token 记忆更新与共享<br/>瞬时深度估计 + 3D世界反投影 + 跨视角 RoPE 注入"]
D --> F["多视角一致视频输出"]
F --> G["解耦动态高斯世界构建<br/>前景/背景分离 + 静态背景时变色彩 + 全动态前景优化"]
G --> H["统一 4D 动态 3D 世界"]
关键设计¶
1. 空间 Token 记忆与跨视角几何注意力交互:打破序列化依赖的并行生成机制
以往方案依靠逐视角渲染再外推,本质原因在于无法在生成中间态进行跨视角的几何对齐。DYNWORLD 构建了跨去噪时间步 \(\tau\) 的共享记忆库 \(\mathcal{M} = \{(k^{(\cdot,\tau)}, v^{(\cdot,\tau)}, p^{(\cdot,\tau)}_{\mathrm{3D}})\}_{\tau=0}^\Gamma\)。在特定相机视角 \(\Pi^{(i)}\) 计算注意力层时,模型从 \(\mathcal{M}\) 中检索出由其他视角累积的键值对与其对应的 3D 绝对空间坐标 \(p^{(\cdot,\tau)}_{\mathrm{3D}}\)。通过当前相机内外参矩阵投影函数 \(\varphi\) 将其投影到视角 \(\Pi^{(i)}\) 的 2D 坐标系: $\(p^{(i,\tau,*)}_{\mathrm{2D}} = \varphi(p^{(\cdot,\tau)}_{\mathrm{3D}}, \Pi^{(i)})\)$ 为使检索到的 Token 与当前视角的相对空间结构契合,模型对 Key 向量重新施加基于投影坐标的旋转位置编码(RoPE): $\(k^{(i,\tau,*)} = \mathrm{RoPE}(k^{(\cdot,\tau)}, p^{(i,\tau,*)}_{\mathrm{2D}})\)$ 而 Value 向量 \(v^{(\cdot,\tau)}\) 则直接复用。最后,将变换后的几何 Token 与当前视角原有的键值对 \([k^{(i,\tau)}, v^{(i,\tau)}]\) 在序列维度拼接进行多头注意力运算。这种机制使得不同视角的 Transformer 能够在同一个隐空间动态交互,共享正在生成的 3D 物理运动轨迹,同时消除了视角间图像必须直接重叠的限制。
2. 基于后验均值与静态场景对齐的无监督 Token 深度估计:精准赋予 Token 空间几何
为了使当前视角生成的 Key-Value Token 能够反投影到 3D 空间,必须获得其对应的深度标量。然而若等待视频完全去噪完毕再跑深度估计,并行流程将荡然无存。本文利用流匹配模型的线性插值后验均值特性,在去噪步 \(\tau\) 直接从带噪潜变量 \(z^{(i,\tau)}\) 解析估计出干净潜变量 \(\hat{z}^{(i,0)}\): $\(\hat{z}^{(i,0)} = \frac{1}{\dot{\sigma}_\tau \alpha_\tau - \sigma_\tau \dot{\alpha}_\tau} \left( \dot{\alpha}_\tau z^{(i,\tau)} - \alpha_\tau u_\theta(z^{(i,\tau)}, \tau) \right)\)$ 解码出视频帧后,由预训练单目视频深度模型提取稠密深度图 \(\hat{D}^{(i)}\)。针对相邻去噪步潜变量演化平滑的特性,算法仅在去噪轨迹的早期、中期、晚期 3 个锚点时间步计算深度图并缓存复用,大幅减少计算开销。针对单目深度跨视角尺度与平移歧义的问题,算法利用静态 3D 高斯光栅化渲染出的多视角绝对一致深度 \(D^{(i,\mathrm{st})}\) 作为几何基准,通过最小二乘法求解最佳对齐标量 \(\lambda^{(i)}\) 和偏置 \(\mu^{(i)}\): $\(\min_{\lambda^{(i)}, \mu^{(i)}} \sum_{f=0}^{F-1} \|\lambda^{(i)} \cdot \hat{D}^{(i)}_f + \mu^{(i)} \cdot \mathbf{1} - D^{(i,\mathrm{st})}\|_F^2\)$ 校准后的深度图下采样至 Token 分辨率 \(t \times h \times w\),直接通过索引为每一个 KV Token 赋予物理深度,再经相机反投影函数 \(\phi\) 计算出绝对三维坐标 \(p^{(\cdot,\tau)}_{\mathrm{3D}}\)。
3. 时空解耦的高斯泼溅世界重建:分离静态几何与时变动态属性
直接对包含复杂动态的视频序列联合拟合高斯场容易导致几何退化和背景浮动漂移。本文设计了前景与背景解耦的高斯表示重构方案。首先使用视频前景分割和消除模型获取纯净的背景视频与前景视频。对于背景高斯 \(G_{\mathrm{bg}} = \{x_{\mathrm{bg}}, R_{\mathrm{bg}}, s_{\mathrm{bg}}, o_{\mathrm{bg}}, c_{\mathrm{bg}}\}\),其 3D 位置、旋转、缩放和不透明度在时间维度上保持恒定(采用时间维度的平均深度与法线初始化),而颜色属性 \(c_{\mathrm{bg}} \in [0, 255]^{F \times 3}\) 则允许逐帧随时间演化,从而完美契合水面微波、天空飘云或动态光影;对于动态前景高斯 \(G_{\mathrm{fg}} = \{x_{\mathrm{fg}}, R_{\mathrm{fg}}, s_{\mathrm{fg}}, o_{\mathrm{fg}}, c_{\mathrm{fg}}\}\),其所有物理属性均为逐帧时变的 \(F\) 维张量,捕捉刚性与非刚性位移。最后通过端到端联合渲染与 \(L_1\)、SSIM 损失优化,构建出高保真、无伪影的 4D 动态世界。
实验关键数据¶
主实验¶
论文在 WorldScore 世界生成基准与 VideoScore 视频生成一致性基准上进行了全面评测,对比了主流静态/动态世界生成与视频外推模型。实验运行于 8 块 NVIDIA A40 GPU,视频生成基座采用 HunyuanVideo (Hunyuan1.5_480p_i2v_distilled),生成每视角分辨率为 \(512 \times 512\)、帧数 \(F=37\)。
表 1:WorldScore 基准评测结果(节选自原论文 Table 1)
| 方法 (Methods) | 动态评分 (Dynamics Only) | 综合均分 (Overall Average) | 运动准确度 (Motion Acc) | 运动幅度 (Motion Mag) | 运动平滑度 (Motion Smooth) | 相机可控性 (Camera Ctrl) | 3D 一致性 (3D Consist) |
|---|---|---|---|---|---|---|---|
| LucidDreamer | 0.00 | 49.28 | 0.00 | 0.00 | 0.00 | 88.93 | 90.37 |
| WonderJourney | 0.00 | 44.63 | 0.00 | 0.00 | 0.00 | 84.60 | 80.60 |
| WonderWorld | 0.00 | 50.88 | 0.00 | 0.00 | 0.00 | 92.98 | 86.87 |
| Voyager | 0.00 | 54.53 | 0.00 | 0.00 | 0.00 | 85.95 | 81.56 |
| T2V-Turbo | 27.48 | 40.20 | 34.87 | 40.09 | 7.48 | 27.80 | 38.72 |
| 4D-fy | 41.72 | 32.10 | 22.22 | 22.88 | 80.06 | 69.92 | 35.47 |
| DYNWORLD (本文) | 48.90 | 66.11 | 45.41 | 24.65 | 76.64 | 93.27 | 85.36 |
表 2:跨视角视频质量与一致性评测(节选自原论文 Table 2)
| 方法 (Methods) | CLIP (↑) | 视觉质量 VQ (↑) | 时序一致性 TC (↑) | 文本对齐 TA (↑) | 事实一致性 FC (↑) |
|---|---|---|---|---|---|
| MOTIA | 21.84 | 1.922 | 1.553 | 1.956 | 1.929 |
| VACE | 23.80 | 2.287 | 1.852 | 2.654 | 1.858 |
| DynamicVoyager | 23.78 | 2.381 | 1.952 | 2.656 | 2.003 |
| DYNWORLD (本文) | 24.55 | 2.781 | 2.447 | 2.997 | 2.235 |
消融实验¶
论文针对空间 Token 记忆、3D 空间几何、深度对齐、背景补全及前景高斯拆分等核心组件进行了细致消融验证。
表 3:核心模块消融实验(节选自原论文 Table 3)
| 配置 (Methods) | CLIP (↑) | 视觉质量 VQ (↑) | 时序一致性 TC (↑) | 文本对齐 TA (↑) | 事实一致性 FC (↑) |
|---|---|---|---|---|---|
| 移除空间记忆 (w/o memory) | 23.12 | 2.331 | 2.112 | 2.658 | 2.012 |
| 移除 3D 几何投影 (w/o 3D geo) | 19.98 | 2.322 | 1.884 | 2.672 | 1.915 |
| 移除深度全局对齐 (w/o depth align) | 22.04 | 2.128 | 1.667 | 2.542 | 2.145 |
| 移除背景补全 (w/o bg completion) | 22.22 | 2.134 | 1.855 | 2.340 | 2.029 |
| 移除前景高斯分离 (w/o fg GS) | 21.07 | 2.021 | 1.636 | 2.242 | 1.627 |
| DYNWORLD 完整模型 | 24.55 | 2.783 | 2.442 | 2.997 | 2.233 |
关键发现¶
- 生成速度实现数量级飞跃:在 8 视角场景中,序列化自回归方法 DynamicVoyager 耗时达 2 小时 56 分钟,且随视角数线性攀升;DYNWORLD 通过多视角完全并行生成,在 18-22 分钟内即可完成全部视角的渲染与建模,获得约 10 倍速度提升。
- 3D 几何投影是跨视角交互的核心:在消融实验中,若仅仅简单在视角间缓存复制 KV Token 而不做 3D 坐标投影与 RoPE 重校准(w/o 3D geo),CLIP 分数从 24.55 断崖式下跌至 19.98,时序一致性 TC 从 2.442 暴跌至 1.884,物体位置出现严重几何错位与重复生成。
- 层注入策略实现速度与质量极佳权衡:仅在 DiT 主干后部的最后 40-53 层注意力层注入空间 Token 记忆,FID 仅轻微上升(从 173.2 变至 182.2),却能额外节省 10 分钟运行时间(耗时减少 50%)。
亮点与洞察¶
- 将显式几何重投影下沉至隐层注意力空间:传统多视角生成往往受困于像素级融合或显式点云/网格传递,DYNWORLD 巧妙利用 Transformer 的键值对表征空间,将相机外参投影与旋转位置编码(RoPE)结合,在隐层直接完成物理一致性对齐。
- 锚点步后验均值深度估计破解因果死锁:在去噪早期利用流匹配解析后验均值预测干净视频潜变量,并仅在 3 个阶段性锚点步提取深度并复用,巧妙解决了“需要深度就必须先生成完整视频、但并行生成时视频尚未生成”的矛盾。
- 解耦时变高斯参数表征动态世界:精准捕捉了现实世界的物理本质——背景场景结构刚性但光照色彩可变,前景物体几何与外观全动态。这种分离避免了单一动态高斯场的漂移与塌陷。
局限与展望¶
- 依赖外部单目几何深度估计网络:空间 Token 记忆的 3D 绝对坐标依赖于单目视频深度估计模型的输出质量;面对低纹理、强镜面反射或极端遮挡区域,若深度预测产生系统性畸变,会导致跨视角反投影位置偏差。未来可探索生成器内部自监督联合预测深度。
- KV Token 生命周期与内存占用:随着生成的视角数量和视频帧数持续增多,空间记忆库中堆叠的 Token 数量将线性增加。当前尚未引入基于可见性剔除或语义重要度聚类的压缩淘汰策略。
- 超大尺度远距离动态物体的连续追踪:当物体在跨度极大的漫游轨迹中多次进出相机视野时,长程时序上的身份与运动连贯性仍有进一步提升空间。
相关工作与启发¶
- vs DynamicVoyager [50]: DynamicVoyager 依赖序列化生成一个视角后更新 3D 高斯再外推下一个视角,耗时长达 3 小时以上且非重叠视角间容易运动脱节;DYNWORLD 借助空间 Token 记忆实现全视角并行去噪,效率提升 10 倍且保证全局一致运动。
- vs SyncSDE [29] 等去噪融合方法: SyncSDE 采用扩散步在重叠区域混合加噪分数,容易扰动生成流轨迹并在拼接边界留下明显撕裂线缝;DYNWORLD 采用注意力层注入机制,无边界割裂感且支持无物理重叠但空间连通的视角。
- vs WonderWorld / WonderJourney [67, 68]: 前序工作仅支持大尺度静态三维场景漫游,无法赋予场景动态演化;DYNWORLD 拓展至时空 4D 动态世界,支持丰富复杂的物理位移与微观动态纹理。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用 DiT 的 KV 空间与 RoPE 重投影,打破了世界生成领域的序列化瓶颈。
- 实验充分度: ⭐⭐⭐⭐☆ 涵盖 WorldScore、VideoScore 多项权威指标,消融实验设计严谨详尽。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密流畅,三阶段系统流程与数学推导清晰完备。
- 价值: ⭐⭐⭐⭐⭐ 为大尺度交互式动态环境生成与具身仿真场景构建提供了极具工业实用性的高效方案。