跳转至

Learn to See the Unseen in Low-light Spike Streams

会议: ECCV 2026
论文: ECCV 原文
领域: 图像恢复
关键词: 脉冲相机, 扩散模型, 低光照成像, 神经形态视觉, 图像重建

一句话总结

针对低光照高速场景下脉冲相机光子通量匮乏、数据极端稀疏且高噪导致传统回归重建严重失真的难题,提出结合生成先验与物理结构约束的扩散重建框架 Diff-SPK,通过脉冲间隔增强表征 ETFI、轻量残差条件编码器与跨步特征融合模块,显著提升了重建图像的感知质量与结构保真度。

研究背景与动机

脉冲相机(Spike Camera)作为一种极具潜力的神经形态视觉传感器,各像素以微秒级超高采样率连续积分光电流并在达到阈值时发放异步脉冲,凭借超高时序分辨率在无人机、自动驾驶和机器人等高速视觉任务中展现出克服运动模糊的显著优势。然而,在弱光乃至极低光照的高速动态场景中,入射光子通量极度匮乏,各像素点两次脉冲发放之间的间隔大幅延长,传感器读出噪声与热像素噪声的相对比重激增,导致采集到的脉冲流在时空维度上呈现极端稀疏与超低信噪比的退化特性。

现有基于统计先验(如 TFI、TFSTP)或深度回归网络(如 CNN、RNN、Transformer 架构的 S2I、WGSE、BSF 等)的重建方法,高度依赖充分的光子积分信息进行确定性像素回归。当面对极暗环境带来的信息缺失时,确定性像素反演问题在数学上呈现出严重的病态不适定性(ill-posed),回归模型往往陷入两难困境:要么过度平滑导致关键几何边缘与纹理彻底湮灭,要么过度拟合噪声生成剧烈斑点伪影。近期虽有探索利用扩散模型(如 Liu 等人)进行脉冲恢复的工作,但由于其依赖较大时序窗口内的平均脉冲发放统计量,在高速运动下引入了不可忽视的严重运动模糊,难以泛化至极端动态暗光环境。

面对这种细粒度外观无法由稀疏输入唯一确定的根本局限,核心思路应当是从“追求不可测的确定性像素精度”转向“在稀疏物理结构约束下利用生成先验推断视觉合理性”。核心 idea:构建两阶段扩散重建框架 Diff-SPK,首先从稀疏脉冲间隔中提取结构稳定且无曝光盲区的增强纹理(ETFI),并设计专用轻量残差编码与全时步注意力融合机制,将脉冲流的物理结构先验强力注入预训练扩散模型的去噪轨迹中,实现极限暗光高速下的逼真感知重建。

方法详解

整体框架

Diff-SPK 采用基于 ControlNet 的潜空间扩散模型(LDMC)作为基础生成主干,整体流程包含脉冲间隔纹理增强(ETFI)、条件特征编码以及全时步特征融合三个核心阶段。针对输入时序窗口 \(2\delta t\) 内的稀疏二值脉冲流 \(\mathbf{S}_{k,\delta t}\),系统首先通过 ETFI 模块挖掘全局脉冲发放间隔(ISI)并利用最大间隔归一化防止暗区信号丢失,再经自监督时序卷积块聚合成单通道初级亮度结构图 \(\tilde{EI}_k\);随后,该结构图跳过易造成高频空间失真的预训练 VAE,进入专用的轻量残差编码模块提取多尺度条件特征;最后,在扩散模型的反向去噪循环中,特征融合模块将条件特征与去噪潜在变量进行跨步动态交叉注意力融合,确保生成过程始终受控于脉冲物理结构。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["低光照脉冲流<br/>S_{k,delta t}"] --> B["脉冲间隔纹理增强<br/>全局ISI增强与时序卷积聚合"]
    B --> C["单通道初级结构图<br/>tilde{EI}_k"]
    C --> D["结构保持条件编码<br/>轻量残差块提取多尺度特征"]
    D --> E["ControlNet 主干条件流<br/>多尺度下采样与跳跃连接"]
    C --> F["全时步特征融合模块<br/>ETFI引导的交叉注意力与Transformer"]
    F --> G["扩散反向去噪过程<br/>注入潜变量 z_t 约束去噪轨迹"]
    E --> G
    G --> H["VAE 解码输出<br/>高质量感知重建图像"]

关键设计

1. 脉冲间隔纹理增强表征(ETFI):消除曝光盲区与时序聚合 在极低光照下,若直接使用已有的脉冲重建网络输出作为扩散模型的条件输入,其在不同光照档位下极其不规律的非线性退化会破坏生成先验的稳定性。为此,本文设计了一种退化规律可预测且结构一致的初级物理表征 ETFI。算法首先利用全局脉冲发放间隔(Inter-Spike Interval, ISI)计算光强,为防止长脉冲间隔区域在 8-bit 可视化空间中完全黑化(低于可分辨阈值),引入最大脉冲间隔进行自适应反比例增强: $$ \hat{EI}k = \frac{\max(ISI_k)}{ISI_k} $$ 该操作从物理机制上保障了场景中最微弱的光子信号不会在量化阶段被截断。随后,将时序窗口 \(T = 2\delta t + 1\) 内的增强矩阵堆叠为 \(\hat{\mathbf{EI}}_{k,\delta t} \in \mathbb{R}^{T \times H \times W}\),并通过轻量卷积块压缩为单通道聚合表征 \(\tilde{EI}_k \in \mathbb{R}^{1 \times H \times W}\)。该卷积模块通过自监督广播重构目标进行优化: $$ \mathcal{L}}} = \mathbb{E{\hat{\mathbf{EI}}_k)|_2^2 \right] $$ 其中 }} \left[ |\hat{\mathbf{EI}}_{k,\delta t} - \mathcal{B}(\tilde{EI\(\mathcal{B}(\cdot)\) 表示沿时间维度的通道广播操作,有效平滑了离散采样量化噪声并紧凑压缩了时序动态。

2. 结构保持条件编码器:规避 VAE 潜在空间失真 在自然图像超分辨率或图像修复扩散模型中,通常直接采用预训练 VAE 编码器将条件图映射到潜空间。然而实测表明,ETFI 表征具有强烈的脉冲量化伪影和非自然图像统计分布,直接通过标准 VAE 编解码后其空间结构相似度大幅退化(局部 SSIM 仅有约 0.32)。为了避免几何骨架与高频轮廓在编码阶段发生不可逆畸变,Diff-SPK 摒弃了 VAE 条件编码通路,专门设计了一个轻量级残差卷积编码网络: $$ \mathcal{F}{enc} = \text{Conv}}(\hat{\mathcal{F}{enc}) + \tilde{EI}_k, \quad \text{其中 } \hat{\mathcal{F}}_k)) $$ 其中 } = \text{Res}(\text{Conv}(\tilde{EI\(\text{Conv}_{init}\) 采用零卷积初始化以保证训练初期的平稳过渡,\(\hat{\mathcal{F}}_{enc}\) 提供给后续融合模块。该模块在严格保留输入脉冲边缘与拓扑结构的同时,将单通道特征投影至与 ControlNet 兼容的高维嵌入空间。

3. 全时步特征融合模块:强化去噪全程的结构引导 传统 ControlNet 仅在去噪 U-Net 的解码器侧通过残差连接注入条件特征。在极端弱光条件下,输入脉冲高度稀疏,这种较晚的浅层注入不足以在扩散初期的重噪声阶段提供充分的几何约束,易导致去噪轨迹漂移至扩散模型预训练先验中的常见自然纹理,生成看似合理却违背物理真值的幻觉结构。本文提出特征融合模块,在每个去噪时间步 \(t\) 直接将 ETFI 条件注入噪声潜在变量 \(z_t\): $$ \mathcal{F}{ECA} = \text{Linear}(\text{ECA}(t}, \hat{\mathcal{F}{enc}, z_t)) + z_t $$ 其中 ECA 为 ETFI 引导的交叉注意力机制(以时间步嵌入 \(t_{emb}\) 和潜在变量 \(z_t\) 构造 Query,以 ETFI 条件特征 \(\hat{\mathcal{F}}_{enc}\) 提供 Key 和 Value)。随后经 Transformer 块进一步挖掘时空交互信息,并通过零卷积层输出最终融合潜特征: $$ \mathcal{F}} = \text{Conv{init}(\text{Trans}(\mathcal{F})) + z_t $$ 融合后的特征 \(\mathcal{F}_{fuse}\) 取代原 \(z_t\) 送入 U-Net,使得脉冲流所蕴含的轮廓与运动骨干在全扩散轨迹中持续施加刚性引导。

损失函数 / 训练策略

训练过程采用两阶段分步优化策略。第一阶段先独立预训练 ETFI 卷积聚合模块 6,000 次迭代,使其具备稳定的时序压缩与去噪能力;第二阶段冻结 ETFI 模块,利用合成低光脉冲数据集对 ControlNet、条件编码器与特征融合模块进行端到端微调 30,000 次迭代。模型以 Stable Diffusion 1.5 权重初始化,ControlNet 基于 control_v11f1e_sd15_tile.ckpt 初始化。扩散噪声预测损失函数定义为: $$ \mathcal{L} = \mathbb{E}{z_t, t, \mathcal{F}}, c_{text}, \epsilon} \left[ |\epsilon_\theta(\mathcal{F{fuse}, t, \mathcal{F}) - \epsilon|_2^2 \right] $$ 优化器采用 AdamW,学习率设为 }, c_{text\(10^{-5}\),批大小为 96,在 4 张 NVIDIA A800-80GB GPU 上分布式训练。推理阶段采用 DDPM 调度器采样 50 步,无分类器引导缩放因子(CFG scale)设为 2,以在生成细节与输入保真度之间取得均衡。

实验关键数据

主实验

为了建立极弱光高速脉冲成像的评估基准,作者构建了合成数据集 SATSPK 以及规模约为现有真实数据集 30 倍的真实动态基准(包含室内可控光照的 IndoorSPK 与车载高速街景 OutdoorSPK)。主实验全面对比了传统方法(TFI、TFP、TFSTP)与前沿深度回归及扩散方法(SSML、S2I、WGSE、BSF、Hu et al.、Liu et al.),有参考评估采用 PSNR/SSIM/LPIPS,无参考感知质量采用 MUSIQA/MANIQA/CLIP-IQA+。

数据集 指标 TFSTP (传统) Hu et al. (回归SOTA) Liu et al. (扩散基线) 本文 (Diff-SPK) 优势/提升幅度
SATSPK (极暗动态合成) PSNR (↑)
SSIM (↑)
LPIPS (↓)
MUSIQA (↑)
15.315
0.342
0.688
36.175
16.876
0.542
0.439
36.551
20.346
0.460
0.527
28.394
23.499
0.683
0.223
56.565
+6.623 dB vs Hu
+0.141 vs Hu
-0.216 vs Hu
+20.014 vs Hu
IndoorSPK (真实极暗室内) MUSIQA (↑)
MANIQA (↑)
CLIP-IQA+ (↑)
39.310
0.297
0.484
46.559
0.328
0.395
42.737
0.306
0.345
48.046
0.436
0.499
+1.487 vs Hu
+0.108 vs Hu
+0.104 vs Hu
OutdoorSPK (真实黄昏车载) MUSIQA (↑)
MANIQA (↑)
CLIP-IQA+ (↑)
48.690
0.374
0.469
47.777
0.342
0.422
34.146
0.305
0.295
49.494
0.408
0.480
+1.717 vs Hu
+0.066 vs Hu
+0.058 vs Hu
Dong et al. (跨相机真实基准) MUSIQA (↑)
MANIQA (↑)
CLIP-IQA+ (↑)
36.286
0.256
0.368
46.456
0.342
0.317
33.917
0.206
0.210
55.268
0.474
0.450
+8.812 vs Hu
+0.132 vs Hu
+0.133 vs Hu

消融实验

论文在表 4 中系统检验了 ETFI 模块、条件编码器与全时步融合模块对框架性能的影响,并在表 3 中测试了不同光照档位下的鲁棒性。

配置变体 IndoorSPK MUS. (↑) IndoorSPK MAN. (↑) SATSPK PSNR (↑) SATSPK SSIM (↑) SATSPK LPIPS (↓) 说明与核心现象
完整模型 (Ours) 48.046 0.436 23.499 0.683 0.223 性能全面最优,感知与结构高度平衡
Baseline 1 (去掉 ETFI,改用 Hu et al. 重建图) 46.268 0.375 15.605 0.429 0.474 PSNR 暴跌 7.894 dB,说明回归输出的不规则退化破坏了扩散条件
Baseline 2 (去掉专用编码器,改用微调 VAE) 39.917 0.372 21.891 0.583 0.353 VAE 潜空间失真导致结构严重受损,无参考与有参考指标双降
Baseline 3 (去掉特征融合模块) 47.867 0.408 23.365 0.679 0.233 仅靠 ControlNet 浅层注入导致去噪轨迹约束减弱,生成伪影增加

在不同光照强度测试中(IndoorSPK 在 40 Lux、60 Lux 与 80 Lux 下),Diff-SPK 在所有光照级别下均稳居第一(如在 40 Lux 下 MUSIQA 达 48.223,远高于各对比方案),验证了其对多样化弱光环境的普适性。

关键发现

  • ETFI 表征的基石作用:Baseline 1 的性能崩溃表明,扩散生成模型对输入条件质量并非要求“完美图像”,而是要求“退化模式规律且几何骨架稳定”。回归网络在极低光下的输出具有不可预测的残差伪影,反而严重误导了扩散生成。
  • VAE 潜空间的模态失配:将非自然图像分布的脉冲间隔图强行压入自然图像预训练的 VAE 潜空间,会抹除细微的高频拓扑,使得重建边缘发生模糊漂移。
  • 早期全步特征注入的必要性:对比 Baseline 3 发现,特征融合模块将条件特征直接注入潜变量 \(z_t\),在去噪起始阶段即可纠正生成流向,有效消除了真实键盘、标牌等微小字符重构中的幻觉乱码。

亮点与洞察

  • 从纯像素回归到受约束生成先验的范式转换:在极暗高动态物理极限下,观测信息已不足以唯一解出真实场景。该研究明确放弃了对不可靠像素残差的强行拟合,转而利用 Stable Diffusion 蕴含的自然图像先验“脑补”合理纹理,同时用脉冲物理约束锚定结构,实现了感知质量与物理真实性的绝佳平衡。
  • ETFI 自适应区间归一化的简洁与有效:通过最大脉冲间隔归一化,既保持了脉冲相机高动态范围的相对关系,又自适应地将极暗区域信号拉伸至敏感动态区间,无需依赖脆弱的深度色彩映射模型。
  • 可复用的神经形态跨模态引导机制:设计的专用轻量残差编码与全步 cross-attention 融合范式,解决了生成模型潜空间对事件相机(Event Camera)、脉冲相机等神经形态信号的模态不兼容问题,对其他神经形态视觉生成任务具备直接借鉴价值。

局限与展望

  • 高计算开销与推理延迟:作为基于迭代去噪的扩散模型(50 步 DDPM),单帧推理耗时达秒级,与脉冲相机原本追求的微秒级实时高速感知存在较大鸿沟,亟需探索单步蒸馏(如 Consistency Models 或 SD-Turbo)以压缩推理延迟。
  • 高动态场景下的时序一致性保证:当前方法主要基于局部时间窗单帧重建,缺乏显式的视频/时序帧间长程注意力约束,在连续序列视频生成中可能出现微细纹理的时序闪烁现象。
  • 极小特征的幻觉风险:在信噪比逼近理论极限的黑夜环境中,扩散模型生成的高频纹理可能存在一定概率的合理化“幻觉”,在自动驾驶安防等对可信度要求极高的任务中需配合不确定度估计机制。

相关工作与启发

  • vs Hu et al. (ECCV 2024):Hu 等人采用纯 RNN/回归架构力求在暗光下保持鲁棒性,在稍亮场景下像素对齐指标优异,但在极暗动态场景(如 SATSPK)下无法脑补湮灭的结构,PSNR 仅 16.876 且感知分数低;Diff-SPK 引入生成扩散先验,在极暗场景大幅反超 6.6 dB,视觉清晰度碾压。
  • vs Liu et al. (ICCV 2025):Liu 等人虽尝试引入扩散模型,但直接采用大时序窗口的平均脉冲计数作为输入,导致严重丢失高速运动的高频时序优势,在动态场景下产生弥散性运动模糊;Diff-SPK 坚持从高时间分辨率的脉冲间隔(ETFI)切入,完好保留了边缘动态。
  • vs DiffBIR / SUPIR:图像恢复领域的经典扩散工作高度依赖 VAE 编码器压缩输入图;本文实证指出了神经形态离散表征与自然图像 VAE 潜空间的本质冲突,给出了定制轻量残差编码器加跨步交叉注意力注入的解决方案。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次将条件扩散模型生成先验成功适配于极低光照高速脉冲流重建,提出了专用的 ETFI 表征与模态匹配融合模块]
  • 实验充分度: ⭐⭐⭐⭐⭐ [建立了规模达现有数据集 30 倍的真实与合成基准,涵盖多档位定量可控室内光照与真实车载黄昏场景,对比与消融详尽]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,针对性指出了回归模型与 VAE 编码在暗光脉冲领域的失效根因,方案针对性极强]
  • 价值: ⭐⭐⭐⭐⭐ [为脉冲相机突破光子通量极限、开拓极限夜视与高速安防应用提供了全新范式,极具启发意义]