跳转至

EvDiff: High Quality Video with an Event Camera

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/weilunli/EvDiff
领域: 图像生成
关键词: 事件相机、单步扩散模型、视频重建、替代训练、高效时序融合

一句话总结

EvDiff 针对事件相机视频重建面临的计算开销大与配对数据稀缺难题,结合 Stable Diffusion 3 设计单步扩散模型与高效时序融合 EvEncoder,并构建三阶段替代训练管线将大规模自然图像先验蒸馏至事件域,实现了仅凭单色事件流即可生成高保真、高动态范围的高清彩色视频。

研究背景与动机

事件相机(如动态视觉传感器 DVS)模仿人类视网膜感知机制,异步记录像素级光强变化,具备微秒级时间分辨率、超高动态范围(达 140 dB)及低功耗等物理优势。然而,事件相机仅输出离散、稀疏且缺乏绝对亮度基准的非网格事件流,无法被现代以帧为中心的视觉网络直接处理。将事件流转换为连续视频帧不仅是直观呈现高动态场景的途径,更是连接神经形态感知与下游主流计算机视觉算法的关键桥梁。

自里程碑工作 E2VID 以来,主流事件视频重建方法普遍遵循端到端回归范式,利用 U-Net 等卷积网络直接拟合“事件体素网格到灰度帧”的确定性映射。然而,这类经典范式在扩展模型容量与数据规模时遭遇了严峻瓶颈:一方面,事件相机固有时间分辨率极高,传统视频扩散模型若直接引入时空自注意力或多步反向去噪,其二次方甚至更高阶的计算复杂度对于超高帧率视频合成而言完全不可承受;另一方面,真实世界中严格配对的“事件-高帧率RGB视频”数据集极度匮乏,基于物理模拟器的合成数据又受限于高帧率视频源的紧缺,导致回归模型普遍陷入低质量灰度重建,伴随模糊、重影及块状失真等伪影。

深究这一退化机制可以发现,回归型事件重建网络的伪影具有高度稳定的特征分布(如边界断裂、边缘模糊与非规则块状失真),其根源在于绝对强度初始条件的缺失与有限空间带宽。作者敏锐地意识到:如果能建立一个人工退化空间在海量自然图像上合成逼真的 E2VID 式失真,就能解耦事件建模与高容量图像生成,借助自然图像预训练的大规模扩散模型充当强大的先验修复器。核心 idea:将事件视频重建分解为“单步扩散生成 + 替代训练蒸馏”两步流,以 E2VID 风格退化模型撬动千万级自然图像数据训练 DiT,再通过蒸馏与联合微调将时序 EvEncoder 对齐至潜空间,实现单步高效的端到端彩色视频重建。

方法详解

整体框架

EvDiff 在推理阶段采用单阶段端到端架构,主要由两部分构成:负责时序特征提取与潜变量映射的时序一致性事件编码器(EvEncoder),以及基于 Stable Diffusion 3(SD3)的大容量单步扩散主干网络(OSDiff)与 VAE 解码器。输入时,连续时间窗口 \(\Delta t\) 内的异步事件流 \(\{e_{\Delta t}\}\) 首先被体素化为同步网格 \(V \in \mathbb{R}^{H \times W \times T}\);随后 EvEncoder 结合历史隐藏状态提取时序特征并生成潜变量序列 \(\{z_i\}_{i=1}^N\);单步扩散模型以 \(z_i\) 为起点执行一次前向去噪预测 clean 潜变量,最终由预训练 VAE 解码器还原出高质量连续彩色帧。

为解决事件流缺乏大规模真实标注对的训练难题,EvDiff 提出了三阶段替代训练管线(Surrogate Training Pipeline): 1. 阶段 1(DiT 训练):在无事件参与的大规模自然图像集(Places365)上,利用所设计的 E2VID 风格退化模型人工合成低质-高质配对,微调 DiT 与 Surrogate VAE 编码器; 2. 阶段 2(替代蒸馏):引入传统 E2VID 模型作为“替代桥梁”,将事件流经 E2VID 生成低质帧后过 Surrogate VAE 编码器得到的潜变量作为教师信号,蒸馏监督直接从事件体素输入的 EvEncoder; 3. 阶段 3(联合微调):在小规模真实配对数据上端到端联合微调全模型,注入真实传感器噪声与时序光流一致性约束。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    E["输入事件流 {e_Δt}"] --> V["体素化同步网格 V"]
    subgraph S1["三阶段替代训练蒸馏与时序对齐"]
        direction TB
        DEG["退化建模与大规模图像 DiT 预训练<br/>Places365合成E2VID退化,训练一阶DiT"]
        ETF_NODE["高效时序融合 EvEncoder<br/>三卷积分支自适应门控循环传递"]
        DIST["替代蒸馏与小规模真实流联合微调<br/>E2VID潜变量引导蒸馏,光流一致性微调"]
        DEG --> ETF_NODE
        ETF_NODE --> DIST
    end
    V --> ETF_NODE
    DIST --> OSD["单步扩散模型 OSDiff<br/>基于 SD3 先验执行一次去噪变换"]
    OSD --> DEC["VAE 解码器"]
    DEC --> OUT["输出高质量彩色视频流"]

关键设计

1. 退化建模与大规模图像 DiT 预训练:以人工伪影跨越配对数据鸿沟

针对事件-视频配对数据极其匮乏且模型容量难以放大的矛盾,作者没有直接在稀缺事件数据上死磕,而是系统剖析了传统 E2VID 回归结果的固定退化模式,提炼出三大致因并构建了 E2VID 风格退化模型:一是事件生成机制(EGM),由于事件仅反映光强相对变化,平滑区域因缺乏触发事件而丢失绝对基准,模型通过在图像低方差平滑区域内随机叠加多尺度多边形与不规则暗斑进行模拟;二是传感器固有缺陷(SII),模拟像素电路有限带宽导致的拖尾事件及光子到达噪声,施加边缘局部柔化、边界随机不连续性与高斯噪声;三是算法级退化(AD),模拟过长积分时间或快速运动引起的体素化运动模糊,并通过降采样再升采样的尺寸缩放操作模拟网络空间带宽截断与细节平滑。在 180 万张 Places365 高清图上,以此模型合成退化低质图,驱动单步 DiT 和可训练的 Surrogate VAE 编码器联合训练,损失函数结合潜变量均方误差与感知一致性:

\[\mathcal{L}_{\text{DiT}} = \lambda \|\boldsymbol{z}_{\text{pred}} - \boldsymbol{z}_{\text{gt}}\|_2^2 + \text{LPIPS}(\hat{\mathbf{I}}, \mathbf{I}_{\text{gt}})\]

这一设计彻底解除了对真实事件配对数据的依赖,成功为模型注入了数十亿参数规模的高保真图像生成先验。

2. 高效时序融合 EvEncoder:轻量自适应门控平衡长程时序与计算开销

直接在扩散模型中应用类似 SVD 或 ControlNet 的全时空自注意力机制,会导致计算复杂度随时间帧数呈 \(O((THW)^2 \cdot C)\) 爆炸,与事件相机追求高帧率重建的初衷背道而驰。EvEncoder 采用局部循环结构引入 Efficient Temporal Fusion(ETF)模块,将计算开销骤降为 \(O((HW)^2 \cdot T \cdot C)\)。每个 ETF 模块包含三个轻量卷积块,分别对当前帧事件特征 \(x_i\) 与上一时刻隐藏状态 \(h_{i-1}\) 进行提取,并生成自适应平衡门控权重 \(g_i\)

\[\mathbf{y}_i = \mathbf{g}_i \odot \mathbf{x}_i + (1 - \mathbf{g}_i) \odot \mathbf{h}_{i-1}\]

自适应门控能够动态权衡当前剧烈运动带来的瞬态事件信息与静态背景所依赖的历史记忆,既消除了全连接时空注意力的巨额显存占用,又显著优于传统的固定权重融合。

3. 替代蒸馏与真实配对联合微调:教师潜空间对齐与时序连贯收敛

阶段 1 训练出的 DiT 能够以低质图像潜变量为条件生成高清图像,但无法直接接受非图像模态的事件网格输入。替代蒸馏阶段将现成 E2VID 作为“显式解码中介”,先将事件转化为粗糙图像再通过 Surrogate VAE 编码器获得潜表示 \(z_{\text{vae}}\),随后以学生-教师架构最小化 EvEncoder 输出潜表示 \(z\)\(z_{\text{vae}}\) 的 KL 散度与特征距离:

\[\mathcal{L}_{\text{distill}} = \text{KL}(q_\phi(\boldsymbol{z}|E)) + \|\boldsymbol{z} - \boldsymbol{z}_{\text{vae}}\|_2^2\]

在完成模态对齐后,阶段 3 使用小规模合成及真实事件视频序列(REDS 数据集配合 v2e 模拟器)进行端到端联合微调。为解决物理事件相机的非理想响应与视频闪烁,训练过程中对事件流动态注入丢弃、合并及极性去除扰动,并通过光流形变损失 \(\mathcal{L}_{\text{flow}}\) 显式约束帧间时序一致性,使 DiT 自适应修正 EvEncoder 的潜空间分布残差,确保全流水线在单步推理下稳定收敛。

损失函数 / 训练策略

全流程分为三个独立的优化阶段,全部基于单张 NVIDIA H200 GPU 采用 AdamW 优化器(\(\beta_1=0.9, \beta_2=0.999\),初始学习率 \(5 \times 10^{-6}\))训练,模型主干通过 rank=64 的 LoRA 进行参数高效微调: - 阶段 1(DiT 训练):在 Places365 图像集上以 batch size 10 训练 180k 步,输入分辨率剪裁至 \(512 \times 512\),采用 \(\mathcal{L}_{\text{DiT}}\) 联合优化潜空间与像素级感知误差。 - 阶段 2(替代蒸馏):固定 DiT,在长度为 40 的事件体素序列上(batch size 1)执行 12k 步蒸馏,最小化 \(\mathcal{L}_{\text{distill}}\)。 - 阶段 3(联合微调):在序列长度为 30 的片段上(batch size 1)执行 12k 步端到端优化,总损失为 \(\mathcal{L}_{\text{joint}} = \lambda \mathcal{L}_{\text{DiT}} + \mathcal{L}_{\text{flow}} + \|\boldsymbol{z}_{\text{pred}} - \boldsymbol{z}_{\text{gt}}\|_2^2\)

实验关键数据

主实验

评估在两个公开的真实世界基准上展开:BS-ERGB(高速且含剧烈运动的真实场景)和 DSEC(立体事件相机的自动驾驶场景)。评测统一使用官方公开权重;为公平对比仅能输出灰度图像的传统方法,EvDiff 的预测结果在计算 MSE、SSIM 和 LPIPS 时均转换为灰度图。

数据集 方法 MSE ↓ SSIM ↑ LPIPS ↓ FID ↓ FVD ↓
BS-ERGB E2VID (CVPR 2019) 0.1175 0.3313 0.5518 276 1688
FireNet (WACV 2020) 0.0857 0.3302 0.5328 271 1909
E2VID+ (ECCV 2020) 0.0717 0.3710 0.4397 238 1652
ET-Net (ICCV 2021) 0.0683 0.3557 0.4566 270 1569
HyperE2VID (TIP 2024) 0.0756 0.3489 0.4598 275 1673
EvDiff (本文) 0.0463 0.3394 0.4023 148 984
DSEC E2VID (CVPR 2019) 0.1042 0.3393 0.5427 239 1541
FireNet (WACV 2020) 0.0927 0.3478 0.5670 262 1492
SPADE-E2VID (TIP 2021) 0.0601 0.4578 0.4911 234 1277
ET-Net (ICCV 2021) 0.0737 0.2953 0.5232 259 1496
HyperE2VID (TIP 2024) 0.0691 0.2977 0.5297 272 1445
EvDiff (本文) 0.0476 0.3677 0.4226 129 1491

此外,在计算复杂度对比中(原论文 Table 2),EvDiff 展现了显著的效率优势:EvDiff 参数量仅为 2.19G,在 \(512 \times 512\) 分辨率下的计算量为 2.18 TFLOPs;相比之下,基于 SD3 的多步 ControlNet 对照组参数量达 8.23G,在 10 步、20 步和 40 步去噪下的计算量分别高达 26.62 TFLOPs、49.93 TFLOPs 和 96.56 TFLOPs。

消融实验

论文在 BS-ERGB 和 DSEC 数据集上系统消融了训练管线各个阶段、退化分支及网络架构组件(原论文 Table 3):

实验变体配置 BS-ERGB: MSE ↓ BS-ERGB: LPIPS ↓ BS-ERGB: FID ↓ DSEC: MSE ↓ DSEC: LPIPS ↓ DSEC: FID ↓ 说明与机理解析
完整模型 (Final Model) 0.0463 0.4023 148 0.0476 0.4226 129 默认三阶段全流程模型
w./o. 阶段 1 DiT 训练 0.0726 0.4906 374 0.0630 0.4817 256 仅用原始预训练权重直接微调,性能剧烈衰退 56.8%
w./o. E2VID 风格退化模型 0.0850 0.5267 396 0.0918 0.5286 450 无法模拟真实伪影,FID 严重劣化 83.6%
w./o. EGM 退化分支 0.0738 0.5000 276 0.0702 0.4937 260 去除平滑区域暗斑模拟,绝对亮度估计失真
w./o. SII 退化分支 0.0667 0.4743 277 0.0734 0.4897 238 去除传感器噪声与边界拖尾模糊模拟
w./o. AD 退化分支 0.0747 0.5059 333 0.0861 0.5150 333 去除体素运动模糊及降采样空间滤波模拟
w./o. 阶段 2 替代蒸馏 0.0660 0.4373 162 0.0778 0.4750 164 失去显式中间域潜表示引导,跨模态对齐受阻
w./o. 阶段 3 联合微调 0.0763 0.5740 224 0.0968 0.6546 189 未对齐真实传感器分布,LPIPS 出现大幅恶化
w./o. ETF 时序模块 0.0586 0.4234 159 0.0605 0.4482 152 失去帧间自适应融合,MSE 恶化 20.9%
替换 ETF 为 ConvGRU 0.0500 0.4147 165 0.0561 0.4337 127 参数量相当但时序平衡能力稍逊
替换 ETF 为 ConvLSTM 0.0496 0.4156 160 0.0620 0.4403 127 计算冗余且收敛稳定性弱于轻量 ETF
替换 EvEncoder 为 E2VID + VAE 0.0729 0.4827 231 0.0580 0.4691 184 推理延迟由 63ms 恶化至 84ms 且感知质量下降

关键发现

  1. 替代退化模型是迁移生成先验的决定性桥梁:完全去除 E2VID 风格退化模型导致 BS-ERGB 上 FID 从 148 暴跌至 396,FVD 从 984 恶化至 3683。单一退化组件中,算法退化(AD)和事件机制(EGM)影响最为显著,证明平滑区斑状噪声与空间滤波是传统事件回归的核心痛点。
  2. 感知与真实度实现质的突破:在 BS-ERGB 上,EvDiff 相较于此前最佳方法(ET-Net / E2VID+)将 MSE 降低 32.2%,LPIPS 降低 8.5%,FID 降低 37.8%(由 238 降至 148),FVD 降低 37.3%(由 1569 降至 984);在 DSEC 上 FID 相比此前最优降低 44.9%(由 234 降至 129)。
  3. 单色输入下的高动态范围彩色合成:EvDiff 是首个能稳定从单色事件流合成高质量真实彩色的方法。在真实过曝场景下(如天空云层),由于事件相机保留了高动态范围相对信息,生成的画面完好保留了云彩轮廓与渐变细节,其表现力甚至优于出现局部过曝饱和的 Ground Truth RGB 传感器图像。

亮点与洞察

  • 以“退化替代”解耦模态稀缺性:巧妙绕过“事件-视频对极难采集”的硬约束,反向将传统回归算法的系统性缺陷归纳为三类数学退化算子,使海量静态图像数据集(Places365)能够无缝转化为事件生成的监督温床,展现了极具启发性的跨模态数据扩展思路。
  • 单步扩散打通高帧率落地闭环:摆脱了将视频生成粗暴视作全时空自注意力或数十步采样扩散的低效陷阱,通过单步前向推理将计算开销压制在 2.18 TFLOPs,较 ControlNet 方案计算量降低一个数量级以上,为神经形态相机实时处理奠定了基础。
  • 摆脱文本提示先验依赖:传统 ControlNet 视频方案高度依赖外部 VLM 或 Ground Truth 抽取的文本 Prompt(如 RAM 标签)提供语义支撑,而在盲恢复场景下此类先验完全不可用;EvDiff 在无提示词条件下依然能凭借自身强大的生成先验重建出高保真画面。

局限与展望

  • 残余时序闪烁(Temporal Flicker):模型骨干本质上仍为逐帧单步前向扩散,时序连贯性主要依赖 EvEncoder 的时序循环传递与微调阶段的光流损失进行约束。在极快剧烈运动或大幅光照骤变场景中,画面背景仍可能观察到轻微的亮度或色相闪烁。
  • DiT 架构固有的周期性网格伪影:由于选用 SD3 作为基座模型,其基于 Patch 切分的 Transformer 特性偶尔会在均匀平坦区域引入微弱的周期性网格条纹,这属于 SD3 底层骨干的通病。
  • 色彩还原的不适定性:单色事件流完全丢失绝对光谱波长分布,彩色视频的恢复完全依赖生成先验的语义猜测与统计记忆;在颜色先验模糊的人工合成物体或多义语义区域,可能出现色彩偏离真实物体原始光谱的情况。

相关工作与启发

  • vs E2VID / E2VID+ / HyperE2VID: 传统方案均基于 U-Net 架构在小规模事件对上做像素级端到端回归,由于缺少生成先验,重构结果仅为灰度且充斥严重模糊和斑块伪影;EvDiff 引入十亿级单步扩散模型,在保持高保真 MSE/SSIM 的同时大幅超越传统方法的感知和生成指标(FID/FVD),并实现彩色输出。
  • vs E2VIDiff: E2VIDiff 首次尝试将多步 Stable Diffusion 条件化用于事件重建,但去噪步数多、效率极低,且生成结果缺乏对物理事件信号的严格保真,常产生严重脱离真实场景的幻觉;EvDiff 采用单步扩散与替代蒸馏架构,在保持极高推理效率的同时实现了像素级保真度与生成真实感的最佳平衡。
  • vs ControlNet (SD3 版): 采用多步 ControlNet 会使时空复杂度激增且必须依赖密集的场景提示词;EvDiff 在单帧 FLOPs 上降至其几十分之一,且在无需外挂文本 Prompt 的盲反演条件下依然稳定高保真重建。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出面向事件相机的单步扩散与三阶段替代训练范式,构思极其精巧。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 BS-ERGB 与 DSEC 双基准,对比 8 项经典与最新 SOTA,并包含详尽的多分支与多架构消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题剖析透彻,退化分解逻辑清晰,图表绘制精美直观。
  • 价值: ⭐⭐⭐⭐⭐ 为解决极度缺乏配对数据的神经形态与底层视觉逆问题开辟了全新的大模型先验迁移范式。