跳转至

UniDynamics: Event-RGB Fusion for Unified Future 4D Dynamic Scene Generation

会议: ECCV 2026
论文: ECCV 官方页面
领域: 视频理解
关键词: 事件相机与RGB融合、未来4D场景生成、扩散模型、动态感知空间、光流与深度协同

一句话总结

针对自动驾驶在单帧输入下缺乏动态先验且易受运动模糊干扰的难题,UniDynamics 提出首个基于单对事件-RGB输入的扩散生成框架,通过事件潜变量增强与感知动态空间(PDS)解耦交互,统一生成未来的外观视频、三维深度与光流场。

研究背景与动机

在自动驾驶与具身智能系统中,根据当前视觉观测精准推断环境未来的时空演化,是下游轨迹规划、动态避障和风险预判的核心基石。现有的驾驶世界模型大多依赖历史连续视频序列,并高度绑定速度、加速度、车辆轨迹或文本导航等结构化控制先验以保证生成的可控性。然而在开放道路的实际部署中,可靠且长时间的时序历史与精确先验往往难以稳定获取;在极简的单帧预测设定下,仅凭单张静态 RGB 图像根本无法直接观测到物体的瞬时运动状态,加之高速运动引发的严重运动模糊,会导致传统视频预测模型在推断未来场景时产生灾难性的结构漂移与错误外推。此外,现有预测范式通常割裂了静态几何表征(如单模态深度预测)与动态运动场(如光流),缺乏显式的动态物理约束来保障长时序生成的时空一致性。

事件相机凭借微秒级的高时间分辨率与高动态范围,能够在极低延迟下持续捕捉场景中因相对运动产生的亮度变化,天然蕴含了精细的物体轮廓边界与瞬时运动方向。即便在强光眩光或剧烈运动模糊导致 RGB 图像退化的严苛工况下,事件流依然能提供稳定可靠的初始动量与结构线索,成为单帧未来预测中最理想且鲁棒的动态先验补充。同时,生成未来场景不仅需要外观画面的逼真渲染,更要求内在三维几何与跨帧运动场相互自洽。

本文的切入角度是:将事件流作为单帧 RGB 观测的互补动态先验,并在统一的潜变量空间中协同建模未来外观(RGB)、静态几何(深度)与动态物理场(光流)。核心 idea:通过事件潜变量增强模块(ELE)将事件流转化为扩散兼容的柔性初始动量先验,并在多尺度 U-Net 中嵌入感知动态空间(PDS),解耦并双向交互几何与运动潜变量,同时将其零卷积反馈至扩散解码器,实现单对事件-RGB驱动的高保真统一未来 4D 动态场景生成。

方法详解

整体框架

UniDynamics 建立在 Stable Video Diffusion(SVD)的潜扩散架构之上。在输入端,给定当前时刻 \(T\) 的单张 RGB 图像与 \(T-1 \to T\) 时间窗口内的异步事件流,系统目标是自回归联合预测未来 \(N\) 帧的外观 RGB 视频序列、度量深度图以及前向光流场。为了避免为不同模态训练臃肿独立的编码器并促进跨模态对齐,模型采用统一权重共享的图像 VAE 潜空间作为联合表征域,外观扩散去噪在图像潜变量上进行,深度和光流潜变量则以图像潜变量为基准在 U-Net 内部经由专门空间联合建模并解码。

整个处理管线由两大核心创新驱动:首先,事件流经时间体素化后通过事件潜变量增强模块(ELE)与 RGB 潜变量双向对齐,转化为柔性注入的伪历史状态潜变量,为去噪扩散提供初始动量;其次,在扩散主干多尺度 U-Net 的跳跃连接处嵌入感知动态空间(PDS),将潜特征解耦为空间几何(深度)与时空运动(光流)两个子空间进行门控双向交互,随后分别向 U-Net 解码器的空间层和时空层注入反馈,最终通过预训练 VAE 解码器联合输出未来的 RGB、深度与光流场。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    InRGB["输入单帧 RGB 观测<br/>时刻 T 图像"]
    InEvt["输入事件流<br/>时窗 T-1 到 T 事件"]
    InRGB --> ELE["事件潜变量增强(ELE)<br/>双向交叉注意力与融合"]
    InEvt --> ELE
    ELE --> DiffIn["扩散输入潜序列构建<br/>软性动量先验注入"]
    InRGB --> DiffIn
    DiffIn --> UNet["SVD 时空扩散 U-Net<br/>多尺度特征抽取与去噪"]
    UNet <--> PDS["感知动态空间(PDS)<br/>解耦适配与门控双向交互"]
    PDS --> Feedbk["动态反馈注入<br/>深度注空间层 / 光流注时序层"]
    Feedbk --> UNet
    UNet --> Out4D["统一共享 VAE 解码<br/>未来 4D 场景预测(RGB + 深度 + 光流)"]

关键设计

1. 事件潜变量增强:从异步脉冲中提取扩散兼容的柔性动量先验

事件相机记录的原始数据是稀疏且非均匀的异步脉冲流,直接输入连续扩散模型会产生严重表征失配。模型首先在 \(100\,\text{ms}\) 窗口内将事件累加并线性插值投影为包含 \(B=15\) 个时间切片的体素网格,并通过轻量级 2D 残差卷积编码为事件特征。然而单纯依赖事件特征容易在静态或纹理缺失区域退化,为此设计的 ELE 模块引入双向交叉注意力机制(BiCA),分别交替将投影后的 RGB 潜变量与事件特征互作 Query、Key 和 Value 完成跨模态结构对齐;随后通过卷积融合层与以原始 RGB 潜变量为引导的交叉注意力进行补充润色,得到强化的事件潜变量 \(Z(E)\)。特别地,针对直接把事件作为强条件拼接在未来多步潜变量上容易引发瞬态偏差、导致长程外推时空飘移的问题,UniDynamics 采用了一种巧妙的柔性注入策略:将 \(Z(E)\) 视作时刻 \(T-1\) 的伪历史状态潜变量,在训练与去噪时与未来待预测序列一同加噪并扩散,既保留了微秒级运动引发的瞬时动量,又不会破坏 SVD 预训练时序注意力对全局场景演化的建模稳定性。

2. 任务解耦与门控双向交互:感知动态空间中的几何与运动解缠

深度代表了场景静态的三维刚性结构与遮挡边缘,而光流刻画的是动态时空位移与跨帧像素对应关系。如果将两者混合在单一隐空间中联合优化,多任务之间梯度的“拔河效应”(tug-of-war)会相互干扰,导致流场预测扰动静态结构的边缘稳定性。PDS 在多尺度 U-Net 的第 1、1/2、1/4 分辨率阶段分别嵌入轻量适配层,使用 2D 卷积深度适配器提取几何特征 \(F_d\),同时使用 3D 卷积光流适配器捕捉时空动态演化 \(F_f\)。考虑到物理世界中运动边界与物体几何边缘天然对齐、且物体运动受制于深度几何结构,PDS 设计了门控双向交互机制:将两者拼接特征送入卷积分支,生成经由 Sigmoid 激活的归一化空间门控权重,并分别与对偶模态残差相乘相加更新潜变量:

\[\bar{Z}(D) = \text{Sigmoid}(\text{Conv}_f(F_{fu})) \odot F_f + F_d, \quad \bar{Z}(F) = \text{Sigmoid}(\text{Conv}_d(F_{fu})) \odot F_d + F_f\]

该设计使得光流分支能够依据深度边缘自适应校准运动轮廓,深度分支亦能借助瞬时位移强化动态前景判别,实现了物理一致性的软解耦。

3. 物理引导的动态反馈注入:基于零卷积的分级渐进约束

为了让在 PDS 中学习到的几何结构与运动规律反向约束生成外观的物理真实感,UniDynamics 建立了从 PDS 向 U-Net 解码器的跨层特征回注路径。深度表征富含静态几何边界与表面法向约束,被精准映射并回注至 U-Net 的空间注意力层(Spatial Transformer),直接规范空间像素的外观完整性;光流表征富含跨帧时序动态轨迹,被注入至 U-Net 的时序注意力层(Temporal Transformer),直接正则化帧间演化的连续性。为了防止训练初期未经充分收敛的几何/运动噪声破坏 SVD 预训练权重所蕴含的生成先验,回注分支全部采用零初始化卷积(ZeroConv):

\[Y_d = \text{ZeroConv}(X_d), \quad Y_f = \text{ZeroConv}(X_f)\]

在训练伊始,零卷积输出严格为零,模型等价于原始无注入状态;随着训练收敛,网络自适应地由弱到强释放物理约束信号,引导外观生成在时空维度上紧密贴合物理运动与三维结构规律。

损失函数 / 训练策略

整个网络端到端联合优化,包括外观生成、深度估计、光流预测以及事件表征对齐四部分。对于 RGB,在潜空间计算多步去噪预测误差 \(L(I)\);对于深度,结合潜空间损失 \(L(D)\) 与像素级尺度位移不变损失 \(L_{\text{SSI}}\);对于光流,计算潜空间 MSE 损失 \(L(F)\) 与像素级 \(L_1\) 偏差。同时,为强监督约束 ELE 模块的表征保真度,额外引入 \(Z(E)\) 与真实时刻 \(T-1\) 图像潜变量的均方误差损失 \(L(E)\)。整体目标函数定义为:

\[L = L(I) + L(D) + L(F) + L(E) + \lambda_1 L_{\text{SSI}} + \lambda_2 L_1\]

实验中平衡超参数固定为 \(\lambda_1 = 2.0\)、\(\lambda_2 = 1.0\)。训练过程采用 AdamW 优化器,学习率设为 \(5 \times 10^{-5}\),并在训练中以 \(15\%\) 的概率随机丢弃条件分支以启用分类器自由引导(Classifier-Free Guidance),同时采用 EMA 平滑模型权重与 DeepSpeed ZeRO-2 优化显存。

实验关键数据

主实验

在自动驾驶合成基准 E-VKitti2 上,评估了未来 \(N=9\) 帧的生成与感知质量。涵盖指标包括外观视频保真度(FID、FVD)、深度预测精度(AbsRel、准确率 \(\delta_n\)、RMSE)及光流精度(EPE、AE、异常像素占比 nPE)。如表 1 所示,UniDynamics 在兼顾三项全能输出的同时全面超越了专精单项的基线方法。

方法分类 模型 FID ↓ FVD ↓ 深度 AbsRel ↓ 深度 \(\delta_1\) ↑ 光流 EPE ↓ 光流 AE ↓ 光流 1PE ↓
仅未来生成 SimVP 137.8 1301.7 不支持 不支持 不支持 不支持 不支持
仅未来生成 SVD 114.5 1244.4 不支持 不支持 不支持 不支持 不支持
仅未来生成 Vista 101.8 1364.6 不支持 不支持 不支持 不支持 不支持
仅未来感知 FLODCAST 不支持 不支持 0.57 21.4% 11.7 55.7 76.4%
仅未来感知 SVD-Depth 不支持 不支持 0.39 52.8% 不支持 不支持 不支持
仅未来感知 SVD-Flow 不支持 不支持 不支持 不支持 8.5 40.3 88.8%
生成+单感知 UniFuture-Depth 44.0 584.1 0.38 56.8% 不支持 不支持 不支持
生成+单感知 UniFuture-Flow 46.9 615.3 不支持 不支持 5.9 33.8 78.8%
生成感知统一 UniDynamics (无事件) 46.8 577.1 0.36 56.0% 5.3 34.1 79.2%
生成感知统一 UniDynamics (完整模型) 39.1 223.6 0.27 67.1% 3.0 21.0 58.1%

消融实验

在 E-VKitti2 上针对事件输入机制、多模态任务分支以及 PDS 模块结构展开了详尽的消融验证。

配置变体 FID ↓ FVD ↓ 深度 AbsRel ↓ 深度 \(\delta_1\) ↑ 光流 EPE ↓ 光流 AE ↓ 说明
UniDynamics (无事件输入) 46.8 577.1 0.36 56.0% 5.32 34.1 失去瞬时动量与高频线索,FVD 剧增 +353.5
UniDynamics (强拼接 hard in) 43.3 417.6 0.33 60.2% 4.63 28.2 直接硬拼接导致长时序条件偏置,性能显著劣于 ELE
UniDynamics-Depth (无光流) 42.0 264.2 0.27 68.6% 不支持 不支持 缺少显式运动场约束,外观 FVD 恶化至 264.2
UniDynamics-Flow (无深度) 44.1 268.3 不支持 不支持 3.64 24.8 缺失几何刚性骨架,光流 EPE 增至 3.64
UniDynamics (无 PDS 适配器) 50.8 384.9 0.30 62.6% 4.60 30.3 联合卷积极易引起梯度冲突并扰乱静态外观
完整模型 (UniDynamics) 39.1 223.6 0.27 67.1% 3.00 21.0 各组件协同达到全局最优时空与物理一致性

高速运动模糊对比与真实世界 Zero-shot 表现

  1. 运动模糊鲁棒性:在人为添加流动运动模糊的 E-VKitti2 极端工况下,基于单帧 RGB 的基线 UniFuture-Depth 崩溃(FID 56.1, FVD 668.7, \(\delta_1\) 57.9%),而 UniDynamics 借助高时间分辨率事件的轮廓补全与动量锚定,取得压倒性性能(FID 53.6, FVD 272.8, \(\delta_1\) 68.1%, 光流 EPE 2.86 vs UniFuture-Flow 的 5.67),验证了事件相机的抗模糊护城河效应。
  2. 跨域 Zero-shot 迁移:在真实车载数据集 DSEC 上,模型未经微调即取得 \(FVD = 224.0\)(对比 UniFuture-Depth 的 285.7)与光流 \(EPE = 6.8\)(相比 UniFuture-Flow 的 12.4 降低近一倍);在更具挑战性的复杂动态户外场景 M3ED 上,FID/FVD 分别达到 68.5 与 508.3(领先基线 88.6 与 705.4),证明了潜空间统一对齐具备极强的域泛化能力。

关键发现

  • 事件流是单帧外推的解题关键:去除事件流后,FVD 呈现数倍级恶化(223.6 升至 577.1),这表明没有历史视频时,模型无法凭空获知场景速度矢量,而事件流正是填补这部分信息残缺的最佳物理测量源。
  • 几何与运动互为表里:去除深度分支不仅损失了三维感知,更导致光流预测 EPE 激增(3.00 变 3.64),证明精准的动态光流高度依赖稳定的静态空间几何结构作为位移边界约束。
  • 解耦交互优于混合卷演:在 PDS 中若不解耦深度与光流直接采用 3D 卷积学习,多任务梯度干扰会导致 FID/FVD 严重退化,验证了解耦适配与门控过滤对于多物理量生成必不可少。

亮点与洞察

  • 将事件潜变量当作柔性伪历史帧注入:将事件特征视为 \(T-1\) 时刻的潜在外观参与全局加噪扩散,既巧妙地向 SVD 输入注入了运动矢量,又彻底规避了显式条件拼接带来的长程外推伪影,兼具数学优雅性与工程实用性。
  • 感知动态空间(PDS)解耦物理双流:通过 2D 卷积专注空间几何与 3D 卷积专注时空运动,并利用物理可解释的门控交互将三维结构与运动矢量分别注入 U-Net 空间与时序层,实现了扩散先验与物理规律的有机共融。
  • 统一轻量化的单潜空间生成表征:摒弃多编码器并联思路,完全复用预训练图像 VAE 潜空间完成 RGB、深度与光流的端到端对齐与映射,不仅降低训练显存,还从底层保证了跨模态生成的对齐精度。

局限与展望

  • 复杂工况下的事件传感器噪声敏度:在高速震动或复杂多变雨雾天气下,真实世界物理事件相机易产生高频背景噪声或漏触发(如低对比度纹理区域),该工作尚未引入面向事件坏点/噪声的显式鲁棒性滤波机制。
  • 端到端 4D 重建仍需后处理:当前模型通过预测的外观、深度与光流间接升维还原未来 3D 点云与场景流(Scene Flow),尚未将原生 4D 高斯泼溅(4D-GS)或隐式神经场作为显式端到端生成表征直接迭代。
  • 未来方向:可进一步将 UniDynamics 的 4D 动态场与车载端到端端大模型(如规划轨迹规划器)做闭环反馈联合训练,形成基于预测物理场赋能的具身动态规控新范式。

相关工作与启发

  • vs UniFuture:UniFuture 探索了单帧驱动下的未来生成,但必须强依赖人为赋予的速度/轨迹等控制先验,且在高速运动模糊下由于 RGB 严重失真彻底失效;UniDynamics 引入无源事件相机彻底摆脱了控制先验依赖,在单对观测下实现了抗模糊的更高保真预测。
  • vs Vista / SVD 衍生世界模型:传统世界模型多集中在 RGB 单一外观维度,生成的连续视频在三维物理世界中往往缺乏真实几何与刚体约束;UniDynamics 首次建立起融合深度几何与光流时空场的统一 4D 生成范式。
  • vs 传统事件-RGB 融合方法(如 DCEIFlow, SRFNet):传统融合方法仅针对当前时刻的深度估计或光流感知,属于被动感知;UniDynamics 突破性地将其升维至未来时空的生成式预测任务中。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出基于单对事件-RGB的多模态未来4D场景统一扩散生成框架,事件柔性动量注入与PDS设计极具开创性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 合成与多个真实数据集(VKitti2, DSEC, MVSEC, M3ED)多维度评测,运动模糊与全面消融实验论证扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑脉络清晰严密,物理设计动机与实验现象相互印证,图表表述规范详实。
  • 价值: ⭐⭐⭐⭐⭐ 对自动驾驶极端工况预测、驾驶世界模型抗运动模糊及具身智能未来环境演化具有极高参考价值。