Event-driven Motion Deblurring via Trajectory-based Kernel Reconstruction¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像恢复
关键词: 图像去模糊, 事件相机, 轨迹核重建, 深度展开网络, 物理退化建模
一句话总结¶
针对真实场景非均匀运动模糊反演极度病态的问题,本文通过可微对齐目标直接从事件流中估计密集像素运动轨迹,构建空间变化的物理点扩散函数(PSF)退化算子,并设计了交替执行数据一致性与可学习先验的 ADMM 深度展开网络,在更低延迟下实现了顶尖去模糊质量。
研究背景与动机¶
动态场景下的单幅图像运动模糊是由曝光期间相机震动与场景物体相对运动引起的图像退化。在传统图像去模糊研究中,经典优化算法通常依赖空间不变性假设(即全图共享单一模糊核),然而在真实复杂场景中,相机的六自由度旋转平移、多物体非刚性运动以及场景深度阶跃使得像面上每个像素的模糊核各不相同。这种空间变化(spatially varying)的退化特性使盲去模糊变成了一个极度病态的逆问题。近年来,基于卷积神经网络、Transformer 以及扩散模型的深度学习方法大幅推动了去模糊性能,但大多仅以单张模糊 RGB 图像作为输入。由于同一张模糊图像在理论上可由无数对不同的清晰图像与局部模糊核卷积生成,缺乏曝光期间的实时运动观测使得纯数据驱动方法极易产生过平滑、伪影以及与物理运动不符的几何畸变。
事件相机(Event Camera / DVS)作为一种新型神经形态视觉传感器,为破解去模糊的病态性带来了全新物理视角。与传统帧相机在曝光时间内固定累积光子强度不同,事件相机的每个像素能够以微秒级时间分辨率、超高动态范围异步记录对数光强的瞬时变化。由于事件流本质上连续编码了场景纹理沿运动轨迹的高频变化且完全没有运动模糊,它理论上天然蕴含了曝光窗口内的真实运动矢量。
然而,现有融合事件相机的去模糊方法存在明显的两极分化缺陷:一类方法采取完全数据驱动的黑盒策略,将事件流体素化后仅作为通用辅助特征送入神经网络与图像特征粗暴拼接或注意力交叉融合,完全忽略了事件生成机制与图像退化成像之间的物理几何联系,导致泛化能力与运动利用率受限;另一类方法虽尝试引入物理约束,但通常依赖全局均匀模糊核或曝光内恒定线性运动等过度简化的先验假设,一旦遇到大范围非刚性运动或复杂深度跳变便迅速失效。核心 idea:利用可微事件对齐显式估计像素级密集运动轨迹,据此构建物理上有据可依的空间变化点扩散函数(PSF)退化算子,并通过融合模糊一致性、事件各向异性结构一致性与可学习图像先验的 ADMM 深度展开网络,实现可解释且高效的非均匀盲去模糊。
方法详解¶
整体框架¶
本文提出的非均匀运动模糊恢复框架由两大核心系统协同构成:一是基于物理机制的事件驱动模糊核估计系统,二是结合物理算子与数据驱动先验的ADMM 深度展开优化网络。整体恢复流程始于输入的模糊图像 \(B\) 与曝光时间 \(T\) 内对应的连续事件流 \(E\)。首先,系统通过构建基于运动补偿的可微事件对齐目标函数,从微秒级事件流中求解出曝光时间内的密集像素级连续运动场,并离散采样追踪得到各像素的运动轨迹;接着,利用双线性散布将像素轨迹投影为逐像素的局部点扩散函数(PSF),形成显式的空间变化退化算子 \(\mathcal{K}(K)\);最后,将去模糊任务建模为一个包含物理模糊一致性、事件高频结构一致性与图像正则化项的联合泛函极小化问题,并通过 ADMM(交替方向乘子法)将其拆解为多个具有闭式或梯度特性的子问题,在多阶段展开网络中循环交替更新,逐步逼近真实清晰图像 \(S\)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:模糊图像 B 与事件流 E"] --> B["基于可微对齐的运动轨迹估计<br/>运动补偿与锐度最大化求解运动场"]
B --> C["空间变化点扩散函数核重建<br/>离散时间轨迹双线性散布生成 PSF"]
C --> D["各向异性结构一致性建模<br/>局部邻域差分聚合边缘响应"]
D --> E["ADMM 深度展开迭代去模糊<br/>USM 数据保真 + UZM 学习先验 + UUM 对偶更新"]
E --> F["输出:多阶段自适应加权清晰图像"]
关键设计¶
1. 基于可微对齐的运动轨迹估计:从微秒级事件流推导物理精确的运动场
传统基于帧间光流的运动估计在严重模糊区域往往彻底崩溃,而事件相机异步触发的高频信号则保留了未退化的运动轨迹。事件产生的物理机制遵循对数强度变化:当某一位置累积变化达到对比度阈值 \(C\) 时触发极性为 \(p_k \in \{-1, +1\}\) 的事件 \(e_k = (\mathbf{x}_k, t_k, p_k)\)。假设曝光时间内像面存在连续运动场 \(v(\mathbf{x}, t)\),将任意事件沿速度场补偿映射至参考基准时刻 \(t_0\): $$ \tilde{\mathbf{x}}k = \mathbf{x}_k + \int}^{t_0} v(\mathbf{xk, \tau) \, d\tau $$ 在物理真实运动场的作用下,源自同一场景边缘的事件点经过位移补偿后应当在空间上完美重合,表现为补偿后事件累积图的梯度急剧增加、边缘对比度最大化。因此,本文构建了负梯度平方和形式的事件锐度对齐损失,并引入一阶空间平滑正则化 \(\mathcal{R}_v(v) = \|\nabla v\|_1\) 以抑制事件稀疏无纹理区域的噪声: $$ \hat{v} = \arg\min_v \left( -\sum_k) \right|^2 + \lambda_v |\nabla v|_1 \right) $$ 通过可微梯度更新求解该优化问题,模型获得了微秒级密集运动矢量,彻底摆脱了传统线性匀速假设,为后续构建弯曲、非刚性的任意真实轨迹提供了精确支撑。}} \left| \nabla \sum_k p_k \delta(\mathbf{x} - \tilde{\mathbf{x}
2. 空间变化点扩散函数核重建:将离散时间轨迹映射为像素级退化算子
在物理成像过程中,曝光时间 \(T\) 内传感器像元接收到的模糊强度实质是潜在清晰图 \(S\) 沿时空运动轨迹 \(\Phi_t(\mathbf{x})\) 的连续时间积分。为了将连续物理退化转化为可计算的算子,本文将曝光区间均匀离散化为 \(M\) 个时间切片 \(\{t_m\}_{m=1}^M\)。结合前一步估计出的运动场,计算每个像素点在各时刻的坐标位移,从而将连续时空轨迹离散采样为离散轨迹点集。每个像素 \(\mathbf{x}\) 处的局部点扩散函数(PSF) \(k_{\mathbf{x}}(\mathbf{d})\) 定义为轨迹点在空间偏移量 \(\mathbf{d}\) 处的累积: $$ k_{\mathbf{x}}(\mathbf{d}) = \frac{1}{M} \sum_{m=1}^M \delta\left(\mathbf{d} - (\Phi_{t_m}(\mathbf{x}) - \mathbf{x})\right) $$ 在具体实现中,各采样时刻的亚像素位移采用双线性散布(bilinear splatting)累加至预设大小的局部卷积网格(默认 \(5 \times 5\)),并进行归一化保证能量守恒 \(\sum_{\mathbf{d}} k_{\mathbf{x}}(\mathbf{d}) = 1\)。由此得到的像素级核场 \(K = \{k_{\mathbf{x}}\}\) 显式表达了空间变化模糊算子 \(\mathcal{K}(K)\),将模糊成像过程建模为 \(B(\mathbf{x}) = \sum_{\mathbf{d}} k_{\mathbf{x}}(\mathbf{d}) S(\mathbf{x} + \mathbf{d}) + n(\mathbf{x})\),为反向去模糊提供了完全符合光学成像规律的精确正向通道。
3. 各向异性结构一致性建模:跨模态高频边缘特征对齐
仅依靠模糊保真度 \(\|B - \mathcal{K}(K)S\|_F^2\) 进行反演时,由于逆问题的不适定性以及核估计可能存在的微小残差,解空间容易产生高频振铃与边缘阶梯假象。事件流本身不仅蕴含运动,还携带着极高信噪比的场景几何边界信息。为了将事件中的未退化高频轮廓有效注入去模糊过程,本文提出了各向异性结构响应算子 \(\mathcal{A}(\cdot)\)。对于任意图像或事件特征图 \(X\),其在像素 \(i\) 处的响应定义为局部领域差分的聚合: $$ \mathcal{A}(X)i = \frac{1}{|\mathcal{N}(i)|} \sum (X_j - X_i) $$ 该算子沿局部领域差异化汇总方向性梯度,能够强烈激活与场景边缘对齐的连续结构,同时滤除孤立的传感器暗电流噪点。通过在目标函数中强制约束清晰图结构响应与事件特征响应的对齐误差 }(i)\(\|\mathcal{A}(S) - \mathcal{A}(E)\|_F^2\),模型能够在恢复模糊纹理的同时,利用事件的高动态边界作为空间锚点,精准校正图像结构。
4. ADMM 深度展开迭代去模糊:物理退化模型与学习先验交替交织
传统优化去模糊方法依赖人工先验(如全变分 TV 或稀疏先验),恢复细节能力有限;端到端网络又缺乏物理约束。本文引入辅助变量 \(Z\) 与缩放对偶变量 \(U\),构建增广拉格朗日函数: $$ \mathcal{L}_\rho(S, Z, U) = |B - \mathcal{K}(K)S|_F^2 + \mu |\mathcal{A}(S) - \mathcal{A}(E)|_F^2 + \lambda \mathcal{R}_S(Z) + \frac{\rho}{2} |S - Z + U|_F^2 $$ 将整个优化过程展开为 \(N=6\) 个交替执行的阶段,每个阶段内包含三个模块: - USM(Update S Module):固定 \(Z\) 与 \(U\),在物理模糊一致性、事件一致性及二次惩罚项下对 \(S\) 进行一步可微梯度下降:\(S^{k+1} = S^k - \eta^k \nabla_S \mathcal{L}_\rho\),其中步长 \(\eta^k\) 设为可学习参数,且前向核算子 \(\mathcal{K}\) 与转置核算子 \(\mathcal{K}^\top\) 均严格按照前述物理 PSF 执行计算; - UZM(Update Z Module):对应正则项近端算子 \(Z^{k+1} = \mathrm{prox}_{\frac{\lambda}{\rho} \mathcal{R}_S}(S^{k+1} + U^k)\)。本文摒弃了手工设计的 TV 等先验,采用轻量级编解码(Encoder-Decoder)网络参数化该近端映射,直接从海量数据中自适应提取丰富自然图像先验; - UUM(Update U Module):执行对偶变量线性累加更新 \(U^{k+1} = U^k + S^{k+1} - Z^{k+1}\)。
最终去模糊图像通过对所有中间展开阶段输出进行可学习权重加权融合:\(\hat{S} = \sum_{i=0}^N w_i S_i\),使物理一致性约束与深度先验在多轮迭代中层层递进。
损失函数 / 训练策略¶
整个展开网络采用端到端方式训练,使用 Charbonnier 损失函数监督最终聚合输出 \(\hat{S}\) 与真实清晰图像 \(S^*\) 之间的重构误差: $$ \mathcal{L}_{rec} = \sqrt{|\hat{S} - S^*|^2 + \epsilon^2} $$ 其中超参数 \(\epsilon = 10^{-3}\)。实验在 4 块 NVIDIA RTX 5090 GPU 上进行,采用 AdamW 优化器(\(\beta_1 = 0.9, \beta_2 = 0.99\)),初始学习率设为 \(2 \times 10^{-4}\),并采用余弦退火策略进行衰减。训练阶段从模糊输入与事件中随机裁剪 \(256 \times 256\) 补丁,Batch Size 设为 8。默认超参数配置为:时间离散切片数 \(M=8\),局部核尺寸 \(K=5 \times 5\),ADMM 展开阶段数 \(N=6\)。
实验关键数据¶
主实验¶
评估在合成事件基准 GoPro、半真实事件基准 HS-ERGB 以及真实世界事件基准 REBlur 上全面展开。所有对比方法在 HS-ERGB 和 REBlur 上均从零重新训练以保证绝对公平。
| 数据集 | 指标 | 本文 | 之前最佳(SOTA) | 提升 |
|---|---|---|---|---|
| GoPro [30] | PSNR (dB) SSIM |
37.15 0.978 |
36.78 (CMTA-7) / 36.70 (Zhu et al.) 0.978 (MAT) / 0.977 (CMTA-7) |
+0.37 dB 持平/微优 |
| HS-ERGB [44] | PSNR (dB) SSIM |
29.43 0.818 |
28.97 (MAT) / 28.11 (FFTFormer) 0.816 (MAT) / 0.813 (FFTFormer) |
+0.46 dB +0.002 |
| REBlur [40] | PSNR (dB) SSIM |
37.24 0.971 |
36.97 (MAT) / 36.78 (MAENet) 0.969 (MAT) / 0.967 (MAENet) |
+0.27 dB +0.002 |
注:在传统仅基于单帧 RGB 输入的顶尖模型中,Restormer 在 GoPro 上为 32.92 dB,Concertormer (ICCV 2025) 为 34.42 dB;本文利用事件物理驱动模型相比纯图像恢复模型领先超过 2.7 dB 以上。
消融实验¶
在 GoPro 数据集上对退化算子建模方式与事件一致性约束进行消融验证:
| 配置 | 空间变化核算子 | 事件一致性约束 | PSNR (dB) | SSIM | 说明 |
|---|---|---|---|---|---|
| Model 1(卷积替代) | \(\times\) | \(\checkmark\) | 36.25 | 0.976 | 用标准可学习卷积替代物理核算子,性能暴跌 0.90 dB |
| Model 2(无事件一致性) | \(\checkmark\) | \(\times\) | 36.60 | 0.977 | 移除 \(\mathcal{L}_{cons}\)(\(\mu=0\)),性能下降 0.55 dB |
| Full Model(本文完整) | \(\checkmark\) | \(\checkmark\) | 37.15 | 0.978 | 结合物理核退化算子与事件高频结构约束 |
此外,针对超参数的敏感性分析表明: - 时间切片数量 \(M\):当 \(M\) 从 2 增加至 8 时,PSNR 从约 34.5 dB 迅速提升至 37.15 dB,表明密集离散化对精确积分至关重要;当 \(M > 8\) 后性能提升饱和但显存和耗时增加,因此 \(M=8\) 为最佳平衡点。 - 局部核尺寸 \(K \times K\):\(1 \times 1\) 与 \(3 \times 3\) 无法覆盖大位移模糊,导致严重欠拟合;增大到 \(5 \times 5\) 取得最佳性价比,更大尺寸(如 \(7 \times 7\) 及以上)收益边际递减。 - 展开阶段数 \(N\):随着阶段数从 2 增至 6,去模糊质量呈现稳步台阶式提升;\(N \ge 6\) 后视觉细节恢复基本成熟,参数量随阶段数呈线性平稳增长。
关键发现¶
- 物理退化算子比黑盒卷积更具决定性:Model 1 的对照实验表明,即便在深度展开架构下,单纯依靠可学习的传统卷积算子也无法拟合真实复杂的空间变化模糊,物理构建的逐像素 PSF 是性能突破 37 dB 的核心支柱。
- 计算效率与恢复精度的双重优势:在单卡 RTX 5090(输入分辨率 \(480 \times 480\))评测下,本文模型推理耗时仅约为 50 ms,参数量保持在 10M 以下,在速度与轻量化指标上显著优于 MAT (AAAI 2025) 与 Concertormer (ICCV 2025)。
- 真实场景泛化鲁棒:在真实传感器采集的 HS-ERGB 与 REBlur 复杂非刚性运动场景中,物理 PSF 能够自适应调整局部角度与支撑集尺度,完全没有传统模型在剧烈突发运动下的波纹伪影。
亮点与洞察¶
- 将事件流提升为物理核重构的几何发生器:区别于把事件流当成普通特征通道的传统做法,本文利用微秒级事件补偿对齐的锐度损失推导密集位移场,从数学上还原了光学成像积分的底层物理过程。
- 即插即用的轻量近端映射网络:在 ADMM 深度展开中,利用紧凑的编码器-解码器替代繁重的大模型主干去承担近端算子,将绝大部分结构约束交由物理数据一致性项保证,大幅降低了网络的参数冗余。
- 跨模态结构响应算子解耦噪声与边缘:所设计的各向异性结构响应不仅能有效转移事件中的无模糊边缘先验,更规避了事件传感器热噪声对去模糊像元直接传导的负面影响。
局限与展望¶
- 极端光照与严重遮挡下的运动场失效:若场景处于极低照度无纹理区域,事件触发过于稀疏,对齐损失所依赖的梯度能量不足可能导致运动场平滑先验占主导,进而使局部核退化为各向同性。
- 事件时间同步与色差标定假设:物理积分模型隐含假设了事件相机与帧相机在曝光周期内的精确时间戳对齐;若工业落地中存在时间漂移或几何畸变未对齐,核重建将产生系统性偏差。
- 未来方向:作者指出可将该物理展开范式进一步扩展至动态遮挡、剧烈光照跃迁等复杂极端环境,并探索超轻量化移动端部署方案。
相关工作与启发¶
- vs 端到端事件融合方法(如 EFNet, MAENet, MAT):这类方法大多采用 UNet 或 Transformer 结构直接学习特征层级的跨模态融合,缺乏成像退化反问题的物理模型先验。本文通过显式重构空间变化 PSF 并构建展开优化回路,不仅可解释性极强,还在参数量和推理速度占优的情况下取得了显著更高的 PSNR。
- vs 传统物理引导方法(如 Nakabayashi et al.):传统方法往往受限于全局均匀模糊核或简单的恒定匀速位移模型,无法处理场景景深变化与非刚性旋转。本文通过可微事件对齐估计密集像素级运动,使得每个像素拥有独立的自由轨迹与 PSF,突破了空间不变性的桎梏。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 成功将微秒级事件流直接对齐到光学积分成像物理模型,提出空间变化 PSF 显式构建与 ADMM 深度展开方案。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 GoPro、HS-ERGB 与 REBlur 三大典型数据集,实验包含完备的基线对比、消融验证与超参数分析。
- 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰规范,物理退化与 ADMM 子问题分解逻辑严密,图表详实。
- 价值: ⭐⭐⭐⭐⭐ 为计算摄影、神经形态视觉与底层图像逆问题提供了物理驱动与深度学习结合的高效范例。