跳转至

LivingWorld: Interactive 4D World Generation with Environmental Dynamics

会议: ECCV 2026
论文: ECCV 原文
代码: 项目主页与代码
领域: 3D视觉
关键词: 交互式4D世界生成, 环境动力学, 全局运动场, 3D场景流对齐, 4D高斯泼溅

一句话总结

针对交互式场景外扩生成中自然流体与宏观环境动态缺失的难题,LivingWorld 提出了由几何感知对齐与连续哈希运动场构成的全局欧拉动力学表征,以仅 12 秒单步交互时延实现了大尺度 4D 环境的高一致性生成与无缝循环渲染。

研究背景与动机

近年来基于 3D 高斯泼溅(3DGS)与生成式扩散模型的交互式 3D 场景生成系统(如 WonderWorld、Text2Room、LucidDreamer)取得了显著进展,允许用户通过单张图像或文本提示实时驱动虚拟相机的平移与场景外扩(Outpainting)。然而,这类方法构建的 3D 世界本质上是完全静态的,仅关注几何结构的拓扑延展与外观重建,环境中的河流、海浪、浮云、烟雾和火光等自然现象全部处于冻结状态。在现实世界中,环境动力学并非孤立前景物体的刚体运动,而是与宏观场景几何深度交织的连续物理演化。缺乏这类环境动态的场景,在具身智能交互、机器人感知仿真与沉浸式漫游中往往显得虚假。

将连续的环境动力学引入交互式 4D 场景扩展面临两项严苛挑战:几何尺度一致性与实时交互反馈。现有可控视频生成模型(如 Veo 3.1、CogVideoX、Tora)虽然能合成画质出众的动态片段,但由于欠缺显式、持久的 3D 几何与运动表征,当视点大范围变换或探索新区域时,无法保证跨视角多视几何与动态连续性;另一类基于 4DGS 的场景生成方法(如 4DGS-Cinemagraphy、PerpetualWonder)则严重依赖基于视频重渲染的逆向优化或复杂的物理仿真引擎,单次优化耗时动辄数千秒,彻底丧失了交互式外扩的即时视觉反馈能力。此外,拉格朗日视角下针对每个高斯图元单独优化变形参数的方式,会导致参数规模随场景外扩线性膨胀,且长时间积分极易引发图元漂移与动态区域空洞。

本文的切入角度是打破以视频生成模型为核心的逆向外观蒸馏范式,直接在 3D 显式几何上构建解耦的连续欧拉运动场。核心 idea:将宏观环境动态解耦为连续全局 3D 运动场,利用闭式几何感知 Kabsch 对齐化解跨视角场景流歧义,并通过哈希运动场与双向循环传播实现秒级交互式 4D 世界外扩。

方法详解

整体框架

LivingWorld 从单张输入图像出发,采用两阶段渐进式交互流程:首先构建初始 4D 场景,随后在用户指定的相机位姿与外扩提示词引导下持续扩展 4D 世界。在每个扩展步中,系统通过用户点击或提示生成稀疏运动区域掩码,预测 2D 欧拉光流并结合单目度量深度提升至 3D 空间;接着通过几何感知对齐模块将新视角的稀疏场景流与累积的历史场景流进行刚体旋转与尺度校准;随后利用多分辨率哈希编码神经网络拟合连续 3D 运动场;最后在渲染阶段通过双向正反向平流结合时间不透明度权重,生成无缝且不散崩的 4D 动态高斯序列。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单张输入图像 / 新外扩视角"] --> B["2D 欧拉运动估计<br/>点击掩码 + 瞬时速度流估计"]
    B --> C["几何感知对齐模块<br/>3D 场景流提升 + Kabsch 封闭对齐"]
    C --> D["哈希全局运动场学习<br/>多分辨率哈希表 + MLP 连续速度场拟合"]
    D --> E["双向运动传播与渲染<br/>正反向欧拉平流 + 时间透明度融合"]
    E --> F["交互式 4D 动态场景输出"]

关键设计

1. 几何感知对齐模块:消除跨视角场景流的方向与尺度歧义 当独立的 2D 欧拉光流预测器对不同外扩视角生成流场并借助预测深度反投影至 3D 空间时,由于单目深度尺度漂移与跨视角透视形变,重合区域的 3D 场景流矢量会表现出严重的朝向偏移与幅度不一致。以往方法(如 3D-MOM)通过随机初始化并在图像重投影空间进行缓慢的迭代优化,耗时长达数百秒且在弱重叠区域极易发散。LivingWorld 在重叠几何空间建立显式 3D 对应点集合 \(\mathcal{M}\),将当前视角的提升流样本 \(\mathbf{S}_i\) 与历史累积流样本集合 \(\mathbf{S}_{\text{prev}}\) 之间的对齐直接建模为最优 3D 旋转矩阵 \(\mathbf{R} \in \mathrm{SO}(3)\) 和统一尺度因子 \(s\) 的最小化优化问题:

\[\arg\min_{\mathbf{R}, s} \sum_{k \in \mathcal{M}} \left\| \mathbf{S}_{\text{prev}}^{(k)} - s \mathbf{R} \mathbf{S}_i^{(k)} \right\|_2^2\]

该问题借助 Kabsch 算法通过奇异值分解(SVD)求解出旋转矩阵的最优闭式解,并通过一维最小二乘快速获得最优尺度 \(s\)。由于 Kabsch 算法的计算复杂度仅随对应点数量线性增长(\(\mathcal{O}(N)\)),系统能够在毫秒级内完成粗对齐,随后仅需轻量级的梯度微调进一步消除残差,从而在仅需约 3 秒的时延内为全局运动场提供严格几何自洽的 3D 场景流监督。

2. 基于哈希编码的连续全局运动场:解耦图元数量的高效欧拉动力学表征 传统的动态高斯泼溅多采用拉格朗日体系,即为每个高斯基元分配独立的轨迹嵌入或变形网络,这使得优化开销与高斯图元数量紧密耦合,当场景不断外扩时显存与计算量难以承受。LivingWorld 转向 3D 欧拉空间表征,建立独立于特定图元的连续速度场 \(F_\theta: \mathbb{R}^3 \to \mathbb{R}^3\)。为克服 3D 非结构化点云缺乏规则栅格且场景流监督稀疏的挑战,模型采用多分辨率空间哈希编码结合轻量级 MLP 进行参数化。对于任意空间三维坐标 \(\mathbf{x}\),在各尺度层级通过大质数与异或运算映射至容量为 \(T = 2^{19}\) 的哈希桶中:

\[h_\ell(\mathbf{x}) = \left( \bigoplus_{j=1}^3 x_j^\ell \cdot \pi_j \right) \bmod T\]

各分辨率提取的特征经三线性插值拼接后输入浅层 MLP 回归 3D 瞬时流速 \(F_\theta(\mathbf{x})\)。该架构使得动态高斯能够根据自身空间坐标瞬时查询速度矢量,既避免了针对数百万高斯的繁琐反向传播,又天然具备空间平滑性与向未观测邻近区域的动力学外推能力。

3. 双向运动传播与透明度调度:杜绝高斯发散并维持空间覆盖完整性 在没有额外稠密视频多视角微调的情况下,单纯沿欧拉速度场对高斯位置进行单向离散积分,会不可避免地导致图元朝流动下游汇聚,而在流出源头形成明显的密度空洞与断裂伪影。LivingWorld 提出对称双向欧拉积分策略。设高斯基元 \(g\) 在时间步 \(t-1\) 的中心位置为 \(\mathbf{p}_g\),以轴向步长向量 \(\boldsymbol{\psi}\) 分别执行正向与反向时间平流积分:

\[\mathbf{p}_g^f(t) = \mathbf{p}_g^f(t-1) + \boldsymbol{\psi} \odot F_\theta\big(\mathbf{p}_g^f(t-1)\big)\]
\[\mathbf{p}_g^b(t) = \mathbf{p}_g^b(t-1) - \boldsymbol{\psi} \odot F_\theta\big(\mathbf{p}_g^b(t-1)\big)\]

随后在渲染时将静态高斯、正向轨迹高斯与沿时间反转的逆向轨迹高斯合并。为了在正反向轨迹切换时消除生硬跳跃并形成闭环循环,引入基于线性时间权重 \(w(t) = t/T\) 的双向不透明度调度器:

\[\tilde{\alpha}_g^f(t) = \big(1 - w(t)\big) \alpha_g^f, \quad \tilde{\alpha}_g^b(t) = w(t) \alpha_g^b\]

通过随着时间推移动态调节图元的透明度贡献,使场景在 \(T\) 个时间步内平滑折返并无缝回归初始构型,彻底消除了动态边缘的破损空洞,并在任意长序列渲染下保持严格的体积覆盖与时序稳定性。

损失函数 / 训练策略

全局运动场的训练完全基于对齐后的离散 3D 场景流样本集合 \(\{(\mathbf{x}_i, \mathbf{s}_i)\}_{i=1}^N\)。无需高开销的光度渲染反向传播,直接在流速空间采用 \(L_1\) 回归损失进行监督:

\[\mathcal{L}_{\text{motion}} = \sum_{i=1}^N \|F_\theta(\mathbf{x}_i) - \mathbf{s}_i\|_1\]

在单张 RTX 5090 GPU 上,整个流程中几何外扩(3DGS Outpainting)耗时约 9 秒,流场提取、Kabsch 闭式对齐与哈希运动场拟合总共仅耗时 3 秒,单步总交互延迟被严格压缩在 12 秒左右。

实验关键数据

主实验

评估基准包含从 Pexels 与 Unsplash 收集的 60 个真实自然场景,涵盖浮云、水流、烟雾/浓雾和火焰四大典型环境流体类别(每类 15 个场景)。评测对比了主流可控视频生成模型与显式 4D 场景生成系统,定量指标包括 VBench 视觉质量(成像质量 Imaging、美学质量 Aesthetic)、时序平滑性(运动平滑度 Motion、时序闪烁度 Flicker)、基于 GPT-5.5 的真实物理动态评分(PhysReal)以及单步生成运行耗时。

类别 方法 VBench Imaging (↑) VBench Aesthetic (↑) VBench Motion (↑) VBench Flicker (↑) PhysReal (↑) 运行时间 Runtime (s) (↓)
视频生成 Veo 3.1 0.694 0.625 0.992 0.979 0.622 140
视频生成 CogVideoX 0.677 0.611 0.991 0.983 0.575 1510
视频生成 Tora 0.649 0.609 0.992 0.976 0.571 550
4D 场景 4DGS-Cinemagraphy 0.637 0.604 0.996 0.988 0.605 1980
4D 场景 PerpetualWonder 0.553 0.553 0.979 0.972 0.554 3580
4D 场景 LivingWorld (本文) 0.673 0.639 0.995 0.989 0.655 12

人类主观偏好双盲评估(2AFC Win Rate)中,LivingWorld 相较于各基线展现出压倒性优势:相较于 Veo 3.1 在运动平滑与闪烁控制上胜率分别达 72%(±8.7) 与 75%(±8.4);相较于 4DGS-Cinemagraphy 的全项胜率均超 68%~75%;相较于物理仿真驱动的 PerpetualWonder,在美学与防闪烁指标上的胜率分别高达 87%(±6.6) 与 92%(±5.4)。

消融实验

消融实验重点验证了几何感知对齐模块对局部与全局运动一致性的决定性作用。对比方案包括朴素场景流累积(Naive Scene Flow)、基于图像重投影迭代优化的 3D-MOM,以及本文提出的轻量级对齐模块。指标采用局部一致性度量(MCA 运动相关度、FMV 流动方差)以及大跨度空间对应点间的全局一致性(余弦相似度 Cosine、幅度比率 Magnitude Ratio)。

对齐方案配置 运行耗时 Runtime (s) (↓) 局部一致性 MCA (↑) 局部一致性 FMV (↓) 全局一致性 Cosine (↑) 全局一致性 Mag. Ratio (↑) 说明
WonderWorld + 朴素场景流 (Naive) 9.3 0.0550 1.91 0.54 0.72 无跨视角对齐,流速幅度发散,时序崩溃
WonderWorld + 3D-MOM 优化对齐 600.0 0.0597 1.66 0.66 0.76 图像重投影迭代收敛极慢,新视角外推畸变
LivingWorld 几何感知对齐 (本文) 12.1 0.0742 0.29 0.91 0.84 Kabsch 闭式求解 + 极轻微调,精度与速度兼备

此外针对运动场架构设计的消融表明: 1. 去除哈希运动场(直接对每个高斯固定赋予初始 3D 场景流矢量):高斯在欧拉单步积分中不断叠加相同速度,导致位移幅度过度放大并引发严重的视觉伪影与拉伸。 2. 去除双向运动传播(仅采用正向欧拉积分):流动区域高斯逐渐沿下流漂移脱离起始分布,导致源头出现不可逆的几何破洞与渲染黑斑。

关键发现

  • 几何感知对齐的 Kabsch 算法将对齐耗时从 3D-MOM 的 600 秒压缩至毫秒级闭式计算,同时将全局流场余弦相似度从 0.66 大幅跃升至 0.91,流动方差 FMV 降低 82.5%(从 1.66 骤降至 0.29),彻底消除了跨视角拼接缝隙处的方向扰动。
  • 物理合理性指标 PhysReal 达到 0.655,显著超越顶尖纯视频生成模型 Veo 3.1(0.622)与仿真基线 PerpetualWonder(0.554),证明在显式 3D 空间进行欧拉流动建模相较于纯 2D 像素幻觉能更真实地还原流体动力学规律。

亮点与洞察

  • 将 3D 场景流跨视角对齐化为 Kabsch 刚体配准:敏锐地发现独立单目估计的 3D 流场主要失真源自视点间的坐标系旋转与尺度缩放,采用封闭形式的 SVD 求解取代黑盒高斯反向传播,以极简数学构造破解了 4D 生成的最大计算瓶颈。
  • 对称双向积分破解高斯流体发散难题:巧妙规避了传统欧拉流需要持续补全发射源粒子的复杂流体力学模拟器,利用时间对称性与互补不透明度衰减在静态图元拓扑上构造出自闭合的动力学循环,兼具保形性与轻量性。
  • 天然兼容局部刚体前景动态:环境运动场可无缝叠加用户交互标记的局部前景刚体扰动(如旗帜飘扬、树枝摆动),为大尺度动态世界生成提供了通用的环境底座。

局限与展望

  • 复杂拓扑与高自由度刚体动作支持受限:目前框架主要针对河流、云雾等具备连续欧拉特性的环境动力学,尚未直接支持多关节人体、复杂机械碰撞等高维非刚性铰接运动。
  • 依赖单目深度与 2D 欧拉估计器质量:若初始 2D 光流预测器在低纹理表面或反光水面给出严重错误流向,或单目几何模型在超远景出现尺度畸变,可能给 Kabsch 对齐引入系统误差。
  • 未来方向:探索结合轻量物理约束的不可压缩流体守恒项(如引入动量守恒偏微分方程正则化),并将环境动力学与具身智能智能体交互底座(Embodied Simulator)深度集成。

相关工作与启发

  • vs 3D-MOM / 4DGS-Cinemagraphy: 后者依赖 4D 高斯的逐帧多视角重投影反向传播优化,单场景耗时数千秒,且在新视点扩展区域因缺乏视觉监督而剧烈漂移;LivingWorld 采用显式 3D 空间 Kabsch 对齐与连续哈希欧拉场,耗时降低两个数量级并原生支持动态场景扩展。
  • vs PerpetualWonder / WonderPlay: 后者尝试引入外部专业物理引擎(如 MPM)生成中间物理状态并辅以视频扩散模型蒸馏,计算复杂度极大且对开放式环境流体泛化受限;LivingWorld 直接从 2D 视觉提示提炼连续 3D 速度场,交互响应快、普适性强。
  • vs Veo / CogVideoX / Tora: 纯视频生成模型缺乏持久 3D 几何,无法在漫游路径中维持多视几何一致性;LivingWorld 基于持久 3D 高斯表征,支持自由视点漫游与长序列连续漫游。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将欧拉连续全局运动场与闭式 Kabsch 对齐引入交互式 4D 场景扩展生成任务。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 60 个真实自然流体场景,结合 VBench、GPT-5.5 物理真实性、人类偏好及详尽对齐消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 叙事动机明晰,理论推导紧凑,图表与实验对照结构严谨。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能仿真、游戏与开放式元宇宙提供了低成本秒级响应的 4D 动态世界生成范式。