跳转至

OctWorld: Long-Range World-Consistent Video Generation with Octree-based 3D Mapping

会议: ECCV 2026
论文: ECCV 原文
领域: 视频生成
关键词: 视频生成、3D世界模型、八叉树映射、TSDF融合、长程几何一致性

一句话总结

基于分块自回归视频扩散模型与动态八叉树TSDF空间记忆(OctMap),OctWorld实现了长距离相机轨迹与大视场探索下重访区域严密一致的高保真RGB-D视频生成。

研究背景与动机

世界生成旨在通过数据驱动的生成模型从单张图像和指定相机轨迹合成可探索、高保真且空间连贯的虚拟场景。随着大规模视频扩散基础模型的演进,已有方法尝试通过预测显式3D几何(如深度图或三维点云坐标)来引入空间先验,提升帧间的几何一致性。然而,这些具有几何感知的方案大多局限于短距离或单个生成块(single-chunk)内的局部几何连贯,而在长轨迹、宽视线覆盖的大范围开放场景生成中面临严峻挑战。

在长程探索中,核心矛盾在于生成系统缺乏自洽且可无限扩展的全局空间记忆表示。如果仅依靠分块级自回归,早先生成的场景结构会在长时间推演后遗忘;当相机在经过长距离漫游后重访先前生成的区域(loop closure / revisiting)时,极易产生严重的几何变形、纹理闪烁与结构漂移。现有的点云缓存方案往往无法处理测量噪声与视角遮挡,导致无界累积与几何碎片化;而经典SLAM中的固定体素分辨率TSDF网格则假设场景尺度已知且边界固定,直接应用于无界开放世界时,若采用高分辨率会导致显存爆炸(OOM),若采用粗分辨率又会抹杀近景几何细节。

针对这一矛盾,本文将分块自回归视频扩散与分层自适应体素融合相结合。核心 idea:构建基于稀疏八叉树的动态多分辨率TSDF全局记忆(OctMap),依据观测深度自适应细分体素以平衡细节保真与显存开销,并通过可微网格提取向扩散网络提供严密的跨块几何与外观投影引导。

方法详解

整体框架

OctWorld 以单张初始图像 \(I_0\) 和用户指定的长相机轨迹 \(\mathcal{T}\) 作为输入,将轨迹划分为多个时序块(每个块36帧),采用自回归方式循环执行几何融合与视频扩散生成。系统的核心支柱包括两个部分:用于维护全局几何与外观的动态八叉树空间记忆(OctMap),以及融合了RGB-D预测、历史帧压缩与记忆投影控制的视频扩散骨干网络。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入: 初始图像 I0 与长相机轨迹 T"] --> B["动态八叉树空间记忆构建<br/>自适应节点分配与TSDF融合"]
    B --> C["网格提取与目标视角投影<br/>渲染RGB-D先验与可见性掩码"]
    C --> D["RGB-D分块自回归扩散网络<br/>多模态隐空间降噪与帧打包"]
    D --> E["跨块深度归一化与噪声增强<br/>保证长序列尺度一致与鲁棒推演"]
    E --> F["输出: 长程空间一致视频序列"]

关键设计

1. 动态八叉树空间记忆构建:以深度自适应分辨率打破固定体素的显存瓶颈

针对传统点云缓存易产生离群噪点以及固定分辨率TSDF体素无法兼顾大尺度场景与局部近景细节的问题,本文设计了动态稀疏八叉树结构的OctMap。将根包围盒尺寸设为 \(L\),八叉树深度为 \(d\) 处的体素大小为 \(\ell_d = L / 2^d\),每个叶子节点在八个角点上存储截断符号距离(TSDF)、RGB颜色以及积分权重。对于输入的每一帧RGB-D数据 \((I, D)\),算法根据像素深度计算其反投影对应的物理尺寸: $\(s(u, v, z) = \frac{z}{\sqrt{f_x \cdot f_y}}\)$ 根据该尺度动态确定最细分辨率等级 \(d\),使得 \(\ell_d \le s < \ell_{d-1}\)。近景区域(\(z\) 较小)触发八叉树自适应分裂分配细粒度微小体素,远景区域(\(z\) 较大)则分配较粗体素,从而在开放场景中以极低显存开销保留关键几何结构。随后沿视线在截断区间 \([z-\tau_d, z+\tau_d]\) 内采样体素点并根据观测值更新TSDF与颜色权重。

2. 网格提取与目标视角投影:为后续帧生成提供结构化的显式空间先验

为了给生成模型提供确定性的3D几何支撑,系统在生成当前轨迹块前,通过并行 Marching Cubes 算法从当前 OctMap 的叶子节点中提取等值面三维网格模型(triangle mesh),并在共享角点合并重复顶点以消除缝隙。接着将提取的三维网格渲染到目标视角序列,得到目标视角的未完整预测图像、投影深度图以及表示已观测区域的布尔可见性掩码(visibility mask)。该投影条件通过参考 VideoPainter 架构的轻量 DiT 控制分支注入到扩散模型中,确保未遮挡区域严格复用历史几何与纹理,同时指引网络仅对视场外新探索区域或遮挡死角进行合理补全。

3. RGB-D分块自回归扩散网络:扩展多模态隐空间并结合上下文压缩

视频生成骨干网络基于预训练的 FramePack 架构(继承 HunyuanVideo 扩散骨干)。为了让模型具备三维感知能力,网络扩展了 patch 嵌入层与输出投影层的通道维度,将 RGB 隐特征与深度图隐特征在通道维度拼接。由于未来帧的最大深度在推理时不可知,系统引入了动态深度归一化机制:利用当前历史帧的最大深度对深度图进行缩放与裁剪,映射至 \([0, 1]\) 线性灰度表示后再编码送入 VAE,消除了跨块生成时的绝对几何漂移。此外,网络沿用时间维度渐进压缩机制将历史多帧打包为固定长度上下文,并引入卷积相机适配器将 Plücker 射线编码注入目标潜在序列。

4. 跨块噪声增强:弥合训练真实分布与自回归推理累积误差

在自回归多块生成的长链条中,前续块生成的微小纹理伪影或局部几何形变容易在后续块中逐步放大,最终导致全场景崩溃。为此,训练阶段对历史帧投影特征与时序隐状态注入可控的高斯噪声 \(\epsilon_\alpha\),将采样得到的噪声等级参数 \(\alpha\) 通过专用投影层嵌入到 Transformer 层的时步调节向量中。这种噪声注入策略迫使生成网络学习对不完美历史预测的容错与自我纠偏能力,显著增强了长程闭环和相机大幅摆动时的生成稳定性。

损失函数 / 训练策略

模型在 Flow-Matching 扩散目标下进行端到端优化,总参数量约为 15B。训练分为两阶段:第一阶段采用降低的时间分辨率(\(16 \times 480 \times 832\))在 32 块 NVIDIA H100 GPU 上训练 80K 步;第二阶段切换至完整时序分辨率(\(36 \times 480 \times 832\))精细微调 30K 步。优化器采用 AdamW,学习率为 \(2 \times 10^{-5}\),全量训练 batch size 设为 64。

实验关键数据

主实验

在由 200 个大动态相机场景构成的 WorldScore 标准测试基准上评估综合世界生成能力(每场景连续生成3个时序块,合计108帧):

原论文 Table 1: WorldScore 评测对比

方法 (Method) WorldScore Static↑ 3D一致性 (3D Consist.)↑ 光度一致性 (Photo Consist.)↑ 风格一致性 (Style Consist.)↑ 相机控制 (Camera Ctrl.)↑
AETHER 46.59 65.65 50.29 83.49 37.65
Voyager 49.93 66.35 43.38 67.89 46.60
VMem 42.40 61.83 41.21 77.72 31.56
Gen3C 45.48 70.52 68.46 78.06 12.57
OctWorld (本文) 50.31 71.67 77.01 78.17 39.12

在 RealEstate10K 数据集上的长轨迹反向回退(Reversed Trajectory,共240帧前向加原路回退)空间记忆保持评测:

原论文 Table 2: 空间记忆保持能力评测 (Re10K)

方法 (Method) 感知相似度 LPIPS↓ 倒角距离 CD↓
VMem 0.4010 0.0620
Gen3C 0.1933 0.0457
OctWorld (本文) 0.1633 0.0345

消融实验

分析三维空间记忆表示对重投影保真度的直接影响(在 SpatialVID 100个场景上评估):

原论文 Table 5: 3D记忆表示的重投影渲染质量对比

3D记忆类型 体素尺寸 (Voxel Size) PSNR↑ SSIM↑ LPIPS↓ 峰值显存 (GB)↓ 耗时 (s)↓
PointCloud - 19.89 0.57 0.38 6.11 18.58
TSDF 0.007 20.47 0.61 0.44 1.37 1.42
TSDF 0.004 21.32 0.65 0.39 1.97 3.15
TSDF 0.002 22.08 0.69 0.33 9.66 16.97
TSDF 0.001 - - - OOM -
OctMap (本文) 自适应 (Adaptive) 23.47 0.74 0.27 7.26 17.94

关键发现

  • 相比点云缓存与固定网格 TSDF,动态八叉树设计的 OctMap 在 PSNR 上达到了 23.47 dB,比最高精度的常规 TSDF(22.08 dB)提升了 1.39 dB,且在显存仅需 7.26 GB 的情况下完全规避了细粒度网格在极限尺度下的 OOM 崩溃。
  • 在空间记忆反向回退闭环测试中,OctWorld 的倒角几何误差 CD 下降至 0.0345(较 Gen3C 的 0.0457 降低 24.5%),LPIPS 下降至 0.1633,证实显式融合的三维记忆有效压制了自回归长程推演中的虚假幻觉生成。
  • 噪声增强实验(Table 4b)表明,纯零噪声训练虽然保留了较多的高频空间纹理,但在长程视频自回归时整体生成质量与一致性急剧受挫;注入等级为 3 的噪声可在局部细微细节与长时序几何一致性(3D Consist. 从 67.18 跃升至 71.67)之间取得最优权衡。

亮点与洞察

  • 八叉树自适应尺度分配与显存平衡:利用观测深度动态计算像素投影跨度并按需划分八叉树节点,既保留了近景微小结构的几何锐度,又大幅抑制了大尺度开阔场景下的无效体素消耗。
  • 几何与视觉双流自回归对齐:摒弃单纯靠潜在空间自回归预测或单纯依赖点云投影的极端路径,将 TSDF 网格表面重投影作为硬约束先验,配合扩散模型的生成填补能力,彻底攻克了回溯重访视角的场景结构漂移。
  • 通用的自回归抗漂移训练范式:通过最大深度归一化保证尺度平稳,并借助可调噪声强度强化自回归容错性,为基于视频扩散架构的长程可交互 3D 世界模型构建提供了成熟范例。

局限与展望

  • 动态物体与非静态场景受限:OctMap 底层假设基于经典静态 TSDF 空间融合机制,因此模型训练和推理均针对静态几何世界,难以处理带有复杂运动目标、流体或光照动态变化的开放场景。
  • Marching Cubes 显式网格重构延迟:每个块推演前后均需进行八叉树查询、Marching Cubes 面片抽取和跨视角光栅化渲染,单步耗时近 18 秒,制约了高频实时交互体验。
  • 未来方向:探索类似 3D Gaussian Splatting 的可微连续几何更新方式与八叉树结合,并引入动态解耦分支以支持动静态分离的高保真世界仿真。

相关工作与启发

  • vs Gen3C: Gen3C 依赖稀疏点云累积进行非显式几何条件引导,易受深度估计边缘锯齿和累积误差影响产生几何裂纹与纹理漂移;本文引入 TSDF 八叉树连续曲面融合,能够有效平滑深度误差并在重访时提供闭合稳定的网格先验。
  • vs Voyager: Voyager 侧重于单块内的局部几何一致扩散,未设计多块自回归长时序空间记忆融合机制;本文通过 OctMap 实现了可无限外推且支持回环重访的跨块视频生成。
  • vs VMem: VMem 使用特征/参考帧检索机制来维持时序相关性,但在大范围大幅度运动中容易发生结构不匹配甚至彻底崩溃;本文通过 3D 物理空间中的实体多分辨率融合,保证了真正的空间几何连贯。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将自适应稀疏八叉树TSDF空间记忆系统性融入分块RGB-D自回归视频扩散长程世界生成管线。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 WorldScore 综合基准、Re10K 轨迹闭环重访评测、433 帧长视频盲测以及深入的重投影消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,系统架构与技术细节阐述详实透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为解决长视频生成中严重的几何漂移与重访不一致痛点提供了极具启发意义与实用价值的系统方案。