跳转至

DiTex4D: Direct Text-Driven 4D Generation with Structured Latent Diffusion

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/3dv-casia/DiTex4D
领域: 3D视觉
关键词: 4D生成、3D动画、结构化隐式扩散、混合4D RoPE、相关噪声注入

一句话总结

DiTex4D 基于 3D 基础模型 TRELLIS 构建了直接文本驱动的 4D 结构化隐式扩散框架,通过混合 4D RoPE 与空间键控相关噪声注入消除视频中介和两阶段累积误差,原生支持从头生成 4D 内容与掩码引导的静态网格动画。

研究背景与动机

从文本直接生成动态 4D 资产(3D 高斯泼溅时序)是虚拟现实、游戏制作和具身智能中的核心诉求。然而,文本本身严重缺乏显式的 3D 几何与运动控制先验,且在表达紧凑的文本提示与高自由度的时空 3D 动力学之间存在巨大的表征鸿沟。现存的文本驱动 4D 生成路线主要受限于两类范式:第一类依赖基于分数蒸馏采样(SDS)的逐样本长时间反向优化,极易产生色彩过度饱和、多头面具(Janus 问题)和动力学不稳定的伪影;第二类两阶段路线依赖文本生成视频(Text-to-Video),再通过多视角重建或视频到 4D(Video-to-4D)模型恢复几何,两阶段之间的误差雪崩式级联,且对视频输入提出了极严苛的无遮挡、低速运动等先验约束。

另一条试图绕过视频中介的路线直接利用文本生成轨迹来驱动输入网格(如 AnimateAnyMesh),但由于完全脱离了现有的 3D 大规模基础生成模型,受制于真实 4D 训练数据的极度匮乏,在面对分布外网格或要求大形变复杂动作时泛化能力骤降。与此同时,基于点云无序隐向量(VecSet)的 4D 模型在帧间独立编码时会引入随机采样噪声,诱发潜在空间的严重时间抖动。

本文的切入视角是:3D 基础模型(如 TRELLIS)的结构化隐向量(Structured Latent, SLat)天然具备确定性的体素网格空间映射,且解耦了稀疏几何与纹理生成。核心 idea:直接将文本语义注入预训练 3D 结构化隐式扩散骨干,通过混合 4D RoPE 膨胀时空全注意力,配合空间键控的相关噪声注入与掩码多视角条件分支,在单一框架内无缝统一从零 4D 生成与静态网格 3D 动画两条生成路径。

方法详解

整体框架

DiTex4D 的整体流程分为两阶段扩散与两类生成任务。模型继承 TRELLIS 的分层结构化表示,将 3D/4D 内容拆解为两步:第一步通过稀疏结构流(Sparse Structure Flow, SS Flow)预测激活的 3D 空间稀疏体素索引;第二步通过结构化隐向量流(SLat Flow)预测附着在稀疏体素上的多视角聚合 DINOv2 几何与外观特征。针对“从零 4D 生成”,文本直接作为流匹配(Conditional Flow Matching)的驱动条件;针对“静态网格 3D 动画”,输入网格被复制沿时间轴排列并提取结构化隐向量,结合掩码通道与多视角 CLIP 全局嵌入联合控制扩散反向轨迹;生成的多帧 3DGS 序列最后通过微调的轻量 4D 插值模块提升帧率与运动平滑度。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:文本提示 / 静态3D网格"] --> B["多条件分支与掩码构造<br/>静态网格体素化 + 多视角CLIP编码"]
    B --> C["4D时空注意力膨胀与混合4D RoPE<br/>空间绝对APE + 4D分解相对RoPE"]
    C --> D["空间键控相关噪声注入<br/>SS连续噪声线性叠加 + SLat体素键控共享"]
    D --> E["两阶段流匹配生成<br/>4D SS稀疏体素序列 → 4D SLat隐向量序列"]
    E --> F["3DGS解码与4D时空插值<br/>高斯序列重建 + 跨帧掩码插值"]

关键设计

1. 3D 注意力膨胀与混合 4D RoPE:在无视觉观测下保证大形变时空连贯 预训练 3D 生成模型仅具备单帧静态几何先验,缺乏帧间时空关联。直接输入文本提示去噪不同帧容易产生各帧断裂或完全静止的退化结果。DiTex4D 将预训练空间自注意力层张量重塑展开为时空全注意力(Full Spatiotemporal Self-Attention),使得任意时间帧与空间体素之间均能进行全交互。为了在缺乏视频引导的情况下解决长时序空间漂移与形变失真,方法没有沿用视频到 4D 方法仅使用 1D 时间 RoPE 的策略,而是将 1D RoPE 分别独立应用于空间与时间坐标 \((x, y, z, t)\) 并在通道维度拼接构成 4D RoPE;同时完整保留预训练模型既有的 3D 绝对位置编码(APE)。这种混合 4D RoPE 策略既利用 3D APE 牢固锁定了预训练的空间拓扑结构先验,又利用相对 4D RoPE 灵活捕捉动态位移并提供时序外推能力。

2. 空间键控相关噪声注入:消除独立高斯采样引起的跨帧剧烈闪烁 在扩散采样过程中,若各帧使用独立采样的纯随机高斯噪声,由于文本先验相较于单目视频先验极为抽象,扩散模型难以将各帧隐向量约束在平滑的时空流形上,极易产生高频几何抖动与纹理闪烁。DiTex4D 引入全局共享噪声 \(\epsilon_{\text{shared}}\) 与帧独立噪声 \(\epsilon_{\text{ind}}^i\) 的相关噪声注入机制(平衡权重设定为 \(\alpha=1\))。对于连续向量空间的 SS 结构,直接采用线性混合;而针对 SLat 阶段各帧激活体素数量与 3D 空间坐标动态变化的问题,提出了空间键控(Spatial Key)对齐机制:

\[ \epsilon_{\text{SLat}}^i = \epsilon_{\text{shared}}^{k_i} + \epsilon_{\text{ind}}^i, \quad \text{其中 } k_i = (x_i, y_i, z_i) \]

只要两帧在相同三维体素坐标 \((x, y, z)\) 处被激活,它们将严格共享同一份基底噪声 \(\epsilon_{\text{shared}}^{k_i}\),而独立噪声 \(\epsilon_{\text{ind}}^i\) 则赋予动力学生成自由度,彻底消除了由于空间体素错位带来的噪声不连续性。

3. 掩码扩散机制与多视角 CLIP 全局条件:精确锚定静态网格首帧外观 针对从静态网格生成 3D 动画的任务,核心挑战在于如何在保持初始网格几何拓扑与材质严苛一致的前提下施加文本驱动动作。DiTex4D 将单帧输入网格在时间轴复制 \(T\) 次得到引导序列,由结构化 VAE 提取为条件隐向量 \(z_c\),并构造二进制时空掩码 \(M \in \{0, 1\}^{B \times T \times L \times 1}\)(首帧保留置 1,待生成帧置 0)。将噪声隐向量 \(z_t\)、条件隐向量 \(z_c\) 与掩码 \(M\) 在通道轴直接拼接,送入配备零初始化投影层的扩散骨干。为了弥补单一网格输入对动态多视角语义把握的不足,模型同时将网格渲染为 4 个正交方位角(\(0^\circ, 90^\circ, 180^\circ, 270^\circ\))图像,经由 CLIP 图像编码器提取并由三层 MLP 映射为全局上下文嵌入,通过解耦交叉注意力(Decoupled Cross-Attention)注入网络,实现“多视角图像定外观、自然语言指令定动作”的精准分工。

损失函数 / 训练策略

模型采用条件流匹配(Conditional Flow Matching, CFM)优化目标,训练矢量场回归网络 \(v_\theta(x, t)\)

\[ \mathcal{L}_{\text{CFM}}(\theta) = \mathbb{E}_{t, x_0, \epsilon} \| v_\theta(x_t, t) - (\epsilon - x_0) \|^2 \]

采用渐进式训练策略,先在 8 帧长度下收敛时空关联,随后扩展至 16 帧微调;使用 AdamW 优化器,学习率设为 \(1 \times 10^{-4}\),在 8 张 GPU 上使用 FP16 混合精度和总 batch size 32 进行分布式训练。对于 4D 插值模块,采用跨帧掩码机制(给定第 \(I\) 帧与第 \(I+2\) 帧预测中间第 \(I+1\) 帧),仅需极少量迭代步数即可完成微调,实现 \(T \to 2T - 1\) 的平滑倍频。

实验关键数据

主实验

实验在从 Objaverse 和 ObjaverseXL 中筛选的 20,000 个带明显运动幅度的 4D 动画资产上训练,并在包含 32 个涵盖人、动物、刚体等多类别的独立测试集上进行跨视角评测。针对 4 个渲染视角(\(0^\circ, 90^\circ, 180^\circ, 270^\circ\))计算 VBench 感知指标,包括运动平滑度(Motion Smoothness, M.Sm)、美学质量(Aesthetic Quality, Aest.Q)、动态幅度(Dynamic Degree, Dy.Deg)以及图像到视频保真度(I2V);从零 4D 生成任务中以 CLIP Score 衡量文本语义对齐。

原论文 Table 1 主对比实验数据如下:

方法分类 方法名称 4D从零生成: CLIP↑ 4D从零生成: M.Sm↑ 4D从零生成: Aest.Q↑ 3D网格动画: I2V↑ 3D网格动画: M.Sm↑ 3D网格动画: Aest.Q↑
SDS 优化类 Dream-in-4D [75] 24.17 0.973 0.416
SDS 优化类 Animate3D [24] 23.96 0.986 0.509 0.877 0.987 0.514
两阶段视频前传 L4GM [45] 24.97 0.991 0.482 0.848 0.992 0.498
视频到4D扩散 GVFDiffusion [69] 25.03 0.989 0.539 0.902 0.989 0.535
轨迹扩散类 AnimateAnyMesh [58] 25.42 0.994 0.527 0.948 0.997 0.546
直接4D扩散 DiTex4D (本文) 25.51 0.995 0.559 0.946 0.997 0.562

消融实验

消融实验在 8 帧设置下进行,系统评估混合 4D RoPE、空间相关噪声注入、4D 插值模块及多视角 CLIP 条件对生成稳定性的贡献(原论文 Table 2):

消融配置 评测任务 核心指标 (CLIP / I2V)↑ 运动平滑度 (M.Sm)↑ 美学质量 (Aest.Q)↑ 动态幅度 (Dy.Deg)↑ 机制说明
完整模型 (Ours) 4D基础生成 25.54 0.996 0.559 0.281 结合混合4D RoPE与体素键控相关噪声
w/o mixed-4D RoPE (1D RoPE + 3D APE) 4D基础生成 25.48 0.994 0.553 0.312 退化为传统空间APE+1D时间RoPE,大位移易发生漂移
w/o mixed-4D RoPE (仅 4D RoPE) 4D基础生成 23.64 0.964 0.469 0.531 丧失预训练3D绝对坐标先验,同等步数下几何崩溃
w/o Correlated Noise Injection 4D基础生成 25.17 0.977 0.544 0.406 各帧独立采样导致时空流形跳跃,帧间剧烈闪烁
w/o 4D interpolation 4D基础生成 25.52 0.986 0.556 0.281 缺少跨帧掩码插值,未提升连续采样帧率
完整模型 (Ours) 3D网格动画 0.948 0.997 0.563 0.250 包含掩码扩散与多视角解耦交叉注意力
w/o Multi-View Condition 3D网格动画 0.918 0.991 0.557 0.377 仅靠文本指令,初始网格的多视角几何一致性显著下降

关键发现

  • 混合 4D RoPE 的不可替代性:完全移除 3D 绝对位置编码而仅保留 4D 相对 RoPE 时,模型 CLIP 指标从 25.54 暴跌至 23.64,美学分数下降近 0.09。这表明 3D 基础模型中固化的绝对坐标语义无法在小规模 4D 微调中仅通过相对旋转编码从头恢复。
  • 空间键控噪声抑制闪烁:空间相关噪声注入将基础模型的运动平滑度从 0.977 显著提升至 0.996,消除了独立噪声导致的随机体素激活跳变。
  • 外观与运动解耦:在 3D 动画任务中,多视角 CLIP 条件使 I2V 保持率由 0.918 跃升至 0.948,证明将“多视角图像负责身份与外观”与“文本负责驱动动作轨迹”分工是解决单网格跨帧漂移的有效解法。

亮点与洞察

  • 跳过视频中间态,根治累积误差:以往方案受限于 2D 视频生成器的视角不连续性与遮挡缺陷,DiTex4D 原生在 3D 结构化隐式空间中进行文本引导的动力学生成,从根本上杜绝了多阶段级联带来的失真。
  • 空间体素键控噪声(Spatial-Keyed Noise)巧妙实用:在稀疏体素网格数量和位置随动作逐帧变动的非结构化场景下,提出以三维空间坐标 \(k_i=(x,y,z)\) 作为哈希键绑定共享基底噪声,轻巧解决了稀疏点集/体素集无法跨帧向量广播求和的工程与理论难点。
  • 统一双路径的通用掩码设计:借助通道拼接与二进制掩码机制,将静态资产重驱动与从头生成统一在同一套扩散架构内,展现了结构化隐向量在 3D/4D 内容编辑与动画中的高可塑性。

局限与展望

  • 作者承认的局限:模型在大形变物理交互、多刚体碰撞以及具有极端精细几何(如极细毛发、复杂镂空)的动态场景下,结构化体素的分辨率和表达精度仍有提升空间。
  • 外部观察的局限:依赖预训练 3D 基础模型 TRELLIS 的词元表征,一旦静态 3D 编码在某些稀有非刚性物体上出现伪影,生成的 4D 运动会继承并放大此类瑕疵;且当前仅支持单物体级别,尚难扩展至完整 4D 复杂动态场景。
  • 未来方向:探索与物理引擎强化学习引导结合的自监督机制,并将空间体素分辨率做自适应八叉树级扩展以支持更高精度的形变细节。

相关工作与启发

  • vs Dream-in-4D / Animate3D: 后者采用多视角视频扩散进行逐样本 SDS 优化,每例需要耗费数十分钟甚至数小时且多视角一致性脆弱;DiTex4D 采用前传式流匹配隐式扩散,秒级推断并原生保持三维几何一致性。
  • vs L4GM / GVFDiffusion: 属于两阶段视频到 4D 范式,极易受视频生成质量与单视角遮挡制约;DiTex4D 跳过视频生成环节,语义交互直接发生在 4D 空间。
  • vs AnimateAnyMesh: 后者从头训练轨迹扩散模型,未继承大规模 3D 静态大模型先验,在分布外测试样本上运动微弱;DiTex4D 基于 TRELLIS 的 3D 先验,具有显著更强的大运动生成能力与开集泛化度。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (首次在 3D 结构化隐向量上直接实现文本驱动 4D 扩散,混合 4D RoPE 与键控噪声设计精巧)
  • 实验充分度: ⭐⭐⭐⭐⭐ (评测覆盖从头生成、静态动画两类任务,主对比、细粒度消融与用户研究完整严谨)
  • 写作质量: ⭐⭐⭐⭐⭐ (问题定义清晰,架构与模块设计逻辑严密,图表信息表达准确)
  • 价值: ⭐⭐⭐⭐☆ (为 3D 资产快速文本驱动重驱动与动态生成提供了高效前传基准,开源代码具有良好社区价值)