跳转至

From Noise to Events: Conditional Diffusion for Event Data Augmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/rfww/n2e
领域: 视频理解
关键词: 事件相机数据增强, 条件扩散模型, 时空连续性, 噪声优化, 仿射解耦表征

一句话总结

针对传统事件数据裁剪或混合操作破坏时空连续性与混淆标签的瓶颈,N2E 提出一种维度解耦表征与条件 DDIM 扩散模型,通过可控调控去噪步数、隐空间随机噪声与条件向量实现保真且多样化的从噪声到事件数据增强。

研究背景与动机

事件相机作为一种仿生神经形态视觉传感器,凭借微秒级超高时间分辨率、极高动态范围、低功耗与极低延迟,在高速运动捕捉与极端光照场景中展现出传统帧率相机不可比拟的优势。然而,由于事件传感器硬件造价昂贵且标注困难,高质量的标注事件流数据集规模极为有限。当下主流事件视觉模型在应对复杂下游任务时极易发生过拟合,亟需有效的数据增强策略来扩充训练数据分布多样性。

然而,现存的事件数据增强方案大多生搬硬套图像领域的启发式几何变换或遮挡混合策略,暴露出不可调和的结构性缺陷。事件流本质上是由坐标、时间戳与极性构成的四元组点云流,不同维度紧密关联。诸如 EventDrop 的随机丢弃方法在剪裁局部时空区域时会硬生生切断事件的时间连续性;而 EventMix 等基于三维掩码的混合方案不仅产生违背物理成像规律的视觉伪影,还会因低速运动下事件频次极少导致软标签分配严重失衡;ShapeAug 等合成图元注入又难以拟合真实场景统计分布。

本文的核心切入点是跳出固定规则变换与插值混合的范式,直接对原始事件的联合统计分布建模。既然事件固有的稀疏性与微观抖动天然契合概率生成过程,就可以将数据增强重构为一个可控的“从噪声反向扩散到事件”的生成问题。核心 idea:将四元组连续事件流解耦为保全时空拓扑的四通道张量表征,通过条件 DDIM 逆扩散反推特定样本的高斯噪声,在可控扰动逆过程步数、随机隐噪声及语义条件特征下,生成既物理保真又兼具可控多样性的分布内增强事件流。

方法详解

整体框架

N2E 的全流程包含训练阶段的条件扩散学习与推理阶段的数据增强生成两大步骤。在训练阶段,连续的四元组事件流经过基于事件切片与维度解耦的无损张量化处理,送入条件提取器提取结构引导向量,同时监督基于 DDIM 的事件解码器学习从加噪状态预测高斯噪声并逆向恢复清晰事件流;在推理/增强阶段,系统利用确定性 DDIM 逆过程将原样本编码为样本特异性的随机隐噪声,进而结合语义条件向量执行多样化扰动采样,生成具有逼真运动模糊与合理背景扰动的新事件样本。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始连续事件流<br/>(x, y, t, p) 四元组"] --> B["维度解耦表征<br/>切片/重排为4通道3D张量"]
    B --> C["条件提取器与DDIM逆向映射<br/>提取语义条件并反推潜空间噪声"]
    C --> D["三维可控扰动生成<br/>步数/潜噪声/条件扰动"]
    D --> E["保真且多样的增强事件流<br/>输入下游骨干网络"]

关键设计

1. 维度解耦表征:破解帧化表征的信息损失与时空割裂 传统事件表征(如 Event Frame、Time Surface、Event Spike Tensor)为了适配 2D CNN,往往将时间戳维度拍平或执行局部累积投影,使得同一空间坐标上的高频事件被强行合并或覆盖,破坏了原生的微秒级时空连续性。N2E 提出一种维度解耦转换策略:首先按照固定事件长度 \(\Delta n\)(实验取 4096)对连续事件流截取子事件流切片,将总事件数 \(N\) 划分为 \(n = \lfloor N / \Delta n \rfloor\) 个子切片;然后将切片内的四个物理属性(\(x\) 坐标、\(y\) 坐标、相对时间戳 \(t\)、极性 \(p\))分别分离并重排展开为紧凑的二维网格,进而组装为形状为 \(n \times 4 \times h \times w\) 的规则张量 \(\mathcal{E} = \mathcal{R}(\mathbf{E}, \Delta n)\)。该设计仅涉及张量重构与通道归一化,既保证了极低的转换开销,又完整封存了所有事件的精确时空拓扑,为后续扩散网络建立高保真生成基底。

2. 条件 DDIM 事件解码与隐空间噪声反推:约束保真度与消除生成幻觉 由于事件脉冲存在极强的局部随机性与物理稀疏性,如果直接从纯随机高斯噪声进行无条件先验扩散生成,模型极难还原出具有现实语义边界的连贯目标轮廓。N2E 构建了一个由残差卷积块与注意力机制组成的条件提取器 \(f_c(\cdot)\) 提取全局语义上下文向量 \(c = f_c(\mathcal{E})\)。事件解码器由条件 UNet 构成,其在逆向去噪步 \(\tau\) 预测噪声 \(\epsilon_\theta(\mathcal{E}_\tau, c, \tau)\)。更关键的是,在进行样本增强时,N2E 巧妙地复用确定性 DDIM 逆扩散前向变换,从原始事件样本中确定性地反向推演其对应的特异性潜空间噪声 \(\mathcal{E}_T\): $\(\mathcal{E}_{\tau+1} = \sqrt{\alpha_{\tau+1}} f_\theta(\mathcal{E}_\tau, c, \tau) + \sqrt{1 - \alpha_{\tau+1}} \epsilon_\theta(\mathcal{E}_\tau, c, \tau)\)$ 其中 \(f_\theta(\mathcal{E}_\tau, c, \tau) = \frac{1}{\sqrt{\alpha_\tau}}(\mathcal{E}_\tau - \sqrt{1 - \alpha_\tau}\epsilon_\theta(\mathcal{E}_\tau, c, \tau))\)。这种以原始样本隐变量作为采样起点的机制,从根本上锁定了生成结果处于原数据分布流形附近,杜绝了无约束生成引入错误类别语义的风险。

3. 三维可控扰动增强策略:灵活调控事件模糊与背景噪声 为了获得丰富且物理合理的样本变体,N2E 在生成采样过程中解耦出三种独立的连续扰动操作,统一表达为: $\(\hat{\mathcal{E}} = \begin{cases} \text{Generate}(\mathcal{E}_T + \epsilon_s, c, T \to 0) & \text{# 随机隐噪声扰动} \\ \text{Generate}(\mathcal{E}_{\hat{T}}, c, \hat{T} \to 0) & \text{# 去噪步数调节} \\ \text{Generate}(\mathcal{E}_T, c + \epsilon_c, T \to 0) & \text{# 条件向量扰动} \end{cases}\)$ 具体机制包括: - 步数调节(\(\text{N2E}_{\text{step}}\):将逆扩散去噪步数设定在 \(T \in [50, 200]\) 之间动态截断。步数越少,恢复出的事件流带有更丰富的仿生背景环境噪声与非刚性残余;步数越多,轮廓越锐利清晰; - 隐噪声加扰(\(\text{N2E}_{\text{s.noise}}\):对逆推得到的潜空间高斯噪声注入微小的高斯扰动 \(\epsilon_s\)(缩放因子设为 0.1),生成边缘带有逼真运动模糊与微颤的新事件; - 条件扰动(\(\text{N2E}_{\text{c.noise}}\):在提取的引导特征 \(c\) 上增加扰动 \(\epsilon_c\),驱使解码器在不改变主体大轮廓的前提下对细微运动细节进行纹理重采样。

损失函数 / 训练策略

N2E 扩散模型的训练采用双重约束的目标函数。在每个训练时间步 \(\tau \in [1, T]\),利用正向扩散将原表征 \(\mathcal{E}_0\) 与纯高斯噪声 \(\epsilon_\tau \sim \mathcal{N}(0, \mathbf{I})\) 插值合成含噪状态 \(\mathcal{E}_\tau = \sqrt{\bar{\alpha}_\tau} \mathcal{E}_0 + \sqrt{1 - \bar{\alpha}_\tau} \epsilon_\tau\)。网络联合优化去噪残差的 \(\ell_2\) 范数与 \(\ell_1\) 范数: $\(\mathcal{L} = \sum_{\tau=1}^T \mathbb{E}_{\mathcal{E}_0, \epsilon_\tau} \left[ \lambda_1 \|\epsilon_\theta(\mathcal{E}_\tau, c, \tau) - \epsilon_\tau\|_2 + \lambda_2 \|\epsilon_\theta(\mathcal{E}_\tau, c, \tau) - \epsilon_\tau\|_1 \right]\)$ 其中训练总扩散步数 \(T = 1000\),采用 Adam 优化器,学习率设为 \(1\times 10^{-4}\),批大小为 64,共训练 1000 个 epoch。在执行下游数据增强时,随机抽取 30% 的训练样本通过 N2E 生成对应增强版本混合训练,下游网络批大小设为 16,训练 30 个 epoch。

实验关键数据

主实验

在目标识别基准 N-Caltech101(包含 101 类、8,246 个样本)与动作识别基准 DVS-Gesture(包含 11 类手势、1,342 个样本)上,论文系统评测了 5 种主流骨干架构(ResNet18, ResNet50, VGG16, ViT, Swin)跨越 4 种典型事件表征(Event Frame, Time Surface, Voxel Grid, Event Spike Tensor)的分类精度。

以下为主实验对比数据(节选代表性表征下的 Top-1 准确率,单位 %):

表 1: N-Caltech101 分类基准准确率对比 (原论文 Table 1 节选)

方法 Voxel Grid + RN50 Voxel Grid + Swin Time Surface + RN18 Time Surface + Swin Event Frame + RN50
Original 85.8 91.3 75.4 88.7 79.1
DataAug [9] 88.4 91.4 84.3 89.5 83.6
EventDrop [12] 87.2 91.9 82.6 89.7 81.6
EventMix [38] 85.5 92.0 80.2 91.3 76.7
ShapeAug [4] 87.0 88.7 80.5 85.3 80.6
N2E (本文) 90.5 94.9 88.0 94.3 90.6

表 2: DVS-Gesture 动作识别准确率对比 (原论文 Table 2 节选)

方法 Voxel Grid + RN18 Voxel Grid + Swin Voxel Grid + ViT EST + RN50 Time Surface + RN18
Original 87.5 74.3 63.9 88.5 74.3
DataAug [9] 93.8 87.5 82.3 90.3 80.6
EventDrop [12] 92.0 16.7 80.2 69.1 NaN (崩塌)
EventMix [38] 87.9 79.2 81.6 87.5 71.2
ShapeAug [4] 89.9 71.9 59.4 88.9 72.2
N2E (本文) 97.6 93.4 83.7 91.0 82.6

消融实验与保真度分析

论文在 MVSEC 数据集上评估了不同增强方法在事件物理一致性与图像质量指标上的保真度表现。通过计算事件级峰值信噪比(ePSNR)、均方根误差(RMSE)以及基于事件帧计算的感知相似度(LPIPS),全面量化增强数据与原分布流形的贴合度。

表 3: MVSEC 数据集上事件数据生成保真度客观评测 (原论文 Table 3)

方法 ePSNR (dB) \(\uparrow\) RMSE \(\downarrow\) LPIPS \(\downarrow\) 特征描述
DataAug [9] 2.1627 0.3694 0.6342 仅做空间仿射变换,时间/极性未对齐
EventDrop [12] 2.1587 0.3700 0.6156 随机抛弃事件破坏光流一致性
EventMix [38] 1.2190 0.5704 0.6839 空间重叠产生非物理伪影与错误光流
ShapeAug [4] 2.1356 0.3740 0.6355 虚拟图元引入错误时空速度场
N2E (T=200, 本文) 11.9747 0.0040 0.1910 高保真拟合原分布,保留精准物理光流

关键发现

  • 泛化性能与架构自适应性极佳:N2E 在所有 5 种网络结构与 4 种事件表征组合下几乎全面超越现有基线。在 N-Caltech101 上,Swin + Voxel Grid 达到了 94.9% 的顶尖性能;在 DVS-Gesture 上,ResNet18 + Voxel Grid 达到了 97.6% 的高准确率(相比原始提升超过 10.1%)。
  • 杜绝训练崩溃与负迁移:EventDrop 在 Time Surface 表征上出现 NaN 损失崩塌,且在 Swin 上准确率暴跌至 16.7%;EventMix 经常由于模糊混杂造成模型欠拟合(如在 ResNet18 + Event Frame 上从 73.7% 跌至 53.0%)。而 N2E 保持了极高的物理合理性,在所有组合下均表现出稳定正收益。
  • 物理光流与运动一致性显著最优:在 MVSEC 物理光流对齐评测中,N2E 的 ePSNR 达到 11.9747 dB(基线最高仅 2.1627 dB),RMSE 低至 0.0040(降低近两个数量级),LPIPS 从 0.6 以上压缩至 0.1910,证明了逆扩散过程在保持微观运动拓扑与光度变化梯度上的绝对优势。

亮点与洞察

  • 解耦四元组张量化表达:突破了传统事件帧化处理合并同坐标事件的固有信息损失瓶颈,用维度切片重排为 4 通道张量,兼备张量计算兼容性与时空无损性。
  • 基于 DDIM 反向映射的保真度锚定:不从各向同性白噪声虚空生成,而是反推输入事件的隐空间潜变量作为生成基底,巧妙保证了增强样本处于“近原数据分布”流形内,完全避免了生成对抗或扩散模型常有的类别漂移假阳性。
  • 可复用的微观扰动调控范式:将逆扩散步数(控制宏观背景噪声)、隐噪声扰动(控制高频边缘运动模糊)和条件嵌入扰动(控制微观细节分布)解耦,为点云、神经脉冲等非网格化高维时序数据的生成增强提供了标准范式。

局限与展望

  • 推理与增强时间开销偏高:作者明确指出,由于依赖多步扩散去噪迭代,并且需要先执行 DDIM 逆过程推断潜空间噪声,N2E 的数据扩增耗时显著高于传统的随机裁剪或仿射变换操作。
  • 超参数敏感度需离线调优:步数截断区间 \(T \in [50, 200]\) 及扰动强度 0.1 属于先验经验设定,对于不同事件频率(如高动态与极低动态场景)的最佳扰动范围存在差异。
  • 未来方向:探索单步扩散蒸馏加速策略(如 Flow Matching 或 Consistency Model),设计更轻量化的前向潜噪声映射机制,将 N2E 推广至实时流式事件增强中。

相关工作与启发

  • vs EventDrop / NDA: 传统丢弃类方法通过硬性遮盖模拟丢包,但会彻底抹杀时间戳之间的单调连续关联;N2E 通过自适应扩散去噪模拟渐变环境噪声与边缘微抖,保留了严谨的时间演化连续性。
  • vs EventMix: EventMix 强行利用 3D 掩码将两个事件流拼接,造成多物体混杂并依赖不可靠的事件计数线性插值标签;N2E 坚持单样本自监督潜变量加噪扰动,标签完全无损保持,避免语义模糊。
  • vs ShapeAug: ShapeAug 人工注入几何多边形虚假事件,光流场与物理场景割裂;N2E 依靠深度数据驱动学习生成在真实物理分布流形内的样本,生成的事件流具备真实传感器级别的光流和运动补偿特性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [首次将条件扩散模型用于异步事件相机的全维度无损连续数据增强]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨越 5 个主流骨干网络、4 种核心事件表征、2 大下游任务并包含物理光流保真度客观评测]
  • 写作质量: ⭐⭐⭐⭐⭐ [结构严密,问题定义精准,数学推导与流程架构图清晰连贯]
  • 价值: ⭐⭐⭐⭐☆ [为事件视觉小样本过拟合瓶颈提供了全新的生成式解决路线,开源代码可复用性强]