High-speed Imaging through Turbulence with Event-based Light Fields¶
会议: ECCV 2026
论文: ECCV 2026 Poster
项目主页: Project Page
领域: 计算成像 / 物理光学 (physics)
关键词: 事件相机、大气湍流、光场成像、高速视频重建、万花筒光学
一句话总结¶
针对高速动态场景穿透大气湍流成像中运动模糊与几何抖动交织的顽疾,本文构建了首个纯事件光场成像系统,利用万花筒光学获取 9 个子孔径视角,基于“跨视角强相关的场景运动 vs 跨视角弱相关的湍流扰动”统计解耦原理,结合循环神经重建网络,在强湍流下实现了高达 12,000 fps 的清晰无畸变视频重建。
研究背景与动机¶
远距离穿透大气成像(如地面天文观测、长程侦察与空地安防)长期受困于大气湍流造成的相位畸变,引发严重的几何形变(tilt/wander)与时空变化模糊(anisoplanatic blur)。传统应对湍流的软硬件方案(如自适应光学 AO、幸运成像 lucky imaging 及深度展开去湍流算法)无一例外受制于常规面阵感光元件的固定曝光时间窗口。在曝光时间内,传感器不可逆地积分光强,不仅抹平了微秒级的大气湍流动态,而且在观测高速运动物体时引入难以剔除的严重运动模糊。
事件相机具备微秒级的极高时间分辨率和无运动模糊的异步光流感应特性,天然适合捕捉极高帧率动态。然而,将单目事件相机直接应用于湍流下的动态场景成像却遭遇了根本性的物理退化:事件相机仅在对数光强变化超过阈值时触发脉冲,而在动态场景中,高速物体的真实运动与湍流引发的折射率起伏均会在像面上产生几乎不可区分的光强震颤。单视角事件流中,场景运动与湍流扰动在数学上形成了非凸的双线性乘性耦合,缺乏解耦所需的几何与先验约束。以往结合事件与传统帧的工作要么强依赖刚体运动假设,要么帧率仍被传统相机的低曝光率锁死,无法发挥事件相机的核心优势。
本文的切入视角是引入光场(Light Field)计算光学架构:当目标处于远距离时,子孔径间的视差极其微弱,场景辐射度在各视角保持高度一致;但入射到不同子孔径的光线穿透的是空间上各异的大气湍流柱,各自承受独立的瞬时相位畸变与点扩散函数扰动。核心 idea:利用基于万花筒单传感器的事件光场相机捕获多子孔径视角,将跨视角强相关的真实场景运动与跨视角弱相关的随机湍流涨落显式分离,并在通道堆叠的循环编码器-解码器网络中隐式学习湍流统计特性,实现万帧级无畸变视频重建。
方法详解¶
整体框架¶
本文构建的端到端事件光场去湍流成像系统分为两个核心环节:物理光路采集与神经网络反演。在光路前端,来自远距离物体的光线穿透非等晕大气湍流介质后,经由长焦主镜头聚焦到中间像面,并通过瞳孔匹配中继镜导入 4 镜面万花筒管腔中。万花筒内的光程折叠在单片神经形态事件传感器(Prophesee EVK4)上无重叠地阵列排列出 \(3 \times 3\) 个共计 9 个虚拟子孔径视角的事件流。在数字处理端,各子孔径的事件流经过时空体素化(voxelization)后沿通道维度进行多视角拼接,送入端到端多视角循环神经网络(扩展版 E2VID),逐步递归提取多视差共识特征并输出清晰的高帧率去湍流强度视频。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["远距离高速动态目标 S(u, t)"] --> B["非等晕大气湍流介质<br/>空间独立相位误差 h^(i)"]
B --> C["长焦主镜 + 瞳孔匹配中继镜"]
C --> D["万花筒光学分光<br/>折叠光程生成 3x3 子孔径"]
D --> E["单芯片事件相机捕捉 9 路事件流 E^(i)"]
E --> F["时空体素化与通道多视角堆叠<br/>5 频段体素聚合成 45 维张量"]
F --> G["多视角循环卷积编码-解码网络<br/>ConvLSTM 积累时空共识并去抖"]
G --> H["高帧率清晰去湍流视频 (最高 12,000 fps)"]
关键设计¶
1. 湍流光场双线性成像解耦模型:利用空间多视角相关性分离运动与扰动
在非等晕湍流模型下,传感器像面 \(i\) 号子孔径的瞬时非相干成像光强满足积分方程: $\(I^{(i)}(\mathbf{x}, t) = \int_{\Omega} |h^{(i)}_\mathbf{u}(\mathbf{x}, t)|^2 S(\mathbf{u}, t) \, d\mathbf{u}, \quad i = 1, \dots, N\)$ 其中 \(S(\mathbf{u}, t)\) 为目标表面辐射度分布,\(h^{(i)}_\mathbf{u}(\mathbf{x}, t)\) 为穿过不同湍流柱路径后的相干复点扩散函数(PSF)。单视角下,\(S\) 与 \(|h|^2\) 发生双线性乘性混叠,从单一退化强度反求二者为极度欠定的盲反问题。当利用光场相机拓展到 \(N\) 个同时刻子孔径时,由于远距离成像视差趋近于零,各子孔径共享相同的场景物理信号 \(S(\mathbf{u}, t)\);然而,各孔径接收的光线穿越了彼此横向错位的大气湍流柱,导致各自独立的瞬时波前相位扰动与点扩散函数 \(\{h^{(i)}\}\)。因此,由场景高速运动激发的事件在 \(N\) 个通道间展现出极强的时空一致性与互相关联,而由空气微团温度折射率随机抖动引起的局部伪事件在各通道间互不相关。这种跨视角的冗余共识为算法分离真实场景动态与虚假湍流扰动提供了坚实的物理基础。
2. 单传感器万花筒无同步光场光机架构:紧凑消除阵列硬件同步误差
多相机阵列若采用多个分立事件传感器,不仅体积庞大、成本高昂,且微秒级硬件时间戳与空间外参标定极其脆弱。本文采用基于万花筒镜面反射的紧凑型单传感器光场结构:主镜选用 Canon RF 800 mm f/11 长焦镜头,其后接入 100 mm 瞳孔匹配透镜,将主镜出瞳与后续拾取系统的入瞳精确匹配;核心分光单元为长 305 mm、孔径 12.6 mm 的矩形空心四面反射万花筒。万花筒内部通过镜面多次折叠光程,将主镜头光瞳分割并在单片 Prophesee EVK4(高动态范围事件传感器)感光面上一次性形成 \(3 \times 3\) 的子孔径阵列投影。光路后端同时引入分光棱镜,将另一半光路导向 Blackfly S CMOS 传统相机用于同步采集地面真值/对比基准。由于所有 9 个视角成像在同一块感光硅片上,天然消除了多传感器间的硬件时钟漂移和触发同步延时。
3. 多视角通道堆叠循环神经重建架构:隐式学习湍流统计与跨视角共识
为了将光场几何红利直接转化为清晰视频,本文对经典事件视频重建网络 E2VID 进行了多视角最小侵入式扩展。对于每个子孔径事件流 \(\mathcal{E}^{(i)}\),在时间窗 \(\Delta T_k\) 内将其量化为具有 \(B=5\) 个时间切片(temporal bins)的时空体素网格 \(E_k^{(i)} \in \mathbb{R}^{B \times H \times W}\);接着,将 \(N=9\) 个视角的体素网格沿通道维度直接拼接,构建统一的多视角联合输入张量 \(\tilde{E}_k \in \mathbb{R}^{(N \cdot B) \times H \times W}\)(即 \(45 \times H \times W\))。网络骨架采用基于 ConvLSTM 循环单元的 U-Net 编码器-解码器。网络利用浅层跨通道卷积隐式对比 9 个视角的体素一致性,快速滤除随机湍流脉冲并强化相干运动响应;ConvLSTM 则沿时间轴长程递归累积隐状态特征,抑制逐帧几何抖动。为保证循环单元长时间推理的数值稳定性,所有 ConvLSTM 层均施加谱归一化(Spectral Normalization),防止隐藏状态在时序递归中发散或产生高频伪影。
损失函数 / 训练策略¶
网络在合成数据集上进行端到端监督训练,优化目标采用图像感知损失 LPIPS: $\(\mathcal{L} = \frac{1}{K} \sum_{k=1}^K \operatorname{LPIPS}(\hat{V}_k, V_k)\)$ 选用 LPIPS 而非传统的均方误差(MSE),旨在规避 MSE 对微小几何形变过度惩罚所导致的生成图像模糊。训练策略细节如下: - 优化参数:从零开始训练 200 个 epoch,批次大小 batch size = 8,采用 Adam 优化器,学习率固定为 \(10^{-4}\),在单块 NVIDIA RTX A6000 GPU 上完成。 - 数据增强体系:包含随机几何裁剪(\(112 \times 112\))与翻转(概率 0.5);输入体素加入高斯噪声 \(\mathcal{N}(0, 0.4)\) 及概率 0.01% 的热像素(hot-pixel)噪声 \(\mathcal{N}(0, 0.1)\);设计暂停增强(pause augmentation),以 0.05 概率置零输入事件流并保持 0.9 的静止概率,强制循环网络在无新事件输入时依靠隐状态维持上一帧清晰输出而不退化。
实验关键数据¶
主实验¶
论文在基于 REDS 数据集合成的大气湍流事件仿真序列(Table 1)与真实室内光学实验台采集的湍流数据(Table 2)上进行了定量评估。基线包括同等网络配置下的单视角(中心子孔径 \(256 \times 256\))及总像素数严格对齐的高分辨率单视角(\(768 \times 768\))。评价指标包括峰值信噪比(PSNR)、结构相似性(SSIM)、感知误差(LPIPS)、帧间变换保真度(ITF,评估时序稳定性)以及扭曲误差(\(E_{\text{warp}}\))。
表 1:仿真数据集定量对比结果(REDS + P2S 湍流模拟器)(对应原论文 Table 1)
| 方法 | 输入分辨率 / 视角 | PSNR (dB) ↑ | SSIM ↑ | LPIPS ↓ | ITF (dB) ↑ | \(E_{\text{warp}}\) ↓ | 说明 |
|---|---|---|---|---|---|---|---|
| Single-view | \(768 \times 768\) (等总像素) | 14.84 | 0.501 | 0.5185 | 22.71 | 0.0050 | 边缘受湍流扭曲,时序严重抖动 |
| Single-view | \(256 \times 256\) (单视角基准) | 14.84 | 0.461 | 0.4607 | 22.72 | 0.0047 | 缺乏多视角约束 |
| Light field (本文) | \(3 \times 3 \times 256 \times 256\) | 15.40 | 0.505 | 0.4332 | 25.16 | 0.0022 | 时序抖动大幅削减,ITF 提升 2.45 dB |
表 2:真实室内光学实验台定量对比结果(显示器重放 REDS 穿过真实蜡烛热浪)(对应原论文 Table 2)
| 方法 | PSNR (dB) ↑ | SSIM ↑ | LPIPS ↓ | ITF (dB) ↑ | \(E_{\text{warp}}\) ↓ | 说明 |
|---|---|---|---|---|---|---|
| Single-view | 12.37 | 0.351 | 0.543 | 20.87 | 0.0085 | 真实热浪下结构弯曲发暗 |
| Light field (本文) | 12.99 | 0.367 | 0.531 | 23.30 | 0.0051 | 真实湍流下保持直线轨迹,\(E_{\text{warp}}\) 降低 40% |
消融实验与高帧率极致验证¶
为探究多视角光场几何相对于增加单一视角空间分辨率的本质优势,论文设计了以下消融对比与物理实验:
| 评估维度 / 场景 | 对比配置 | 关键观测指标与现象 | 核心结论与物理机制分析 |
|---|---|---|---|
| 光场 vs 高分辨率单视角 | \(3 \times 3 \times 256^2\) vs \(1 \times 768^2\) | LPIPS: 0.4332 vs 0.5185; \(E_{\text{warp}}\): 0.0022 vs 0.0050 | 即使单视角像素总量完全等同于光场 9 视角之和,其去湍流能力依然严重落后。证明湍流抑制增益来源于角向视差分集(angular diversity)带来的独立波前采样,而非单纯的空间像素堆叠。 |
| 对抗运动模糊 (vs SOTA 算法) | 本文 vs MambaTM (ECCV 2024 SOTA) | 快速运动物体合成(4 帧累加模拟传统曝光) | 传统帧级 SOTA 模型 MambaTM 在曝光累积模糊面前彻底失效,重建严重模糊;本文直接摄取无曝光积分窗口的事件流,完美重构清晰锐利边缘。 |
| 旋转反光条轨迹测试 (600 fps) | Single-view vs Light field | \(\theta-t\) 时空切片轨迹线平直度 | 单视角在 \(\theta-t\) 图上表现为明显的波浪形锯齿(残留湍流摆动);光场模型呈现严格直线斜率,彻底剔除时序 wander。 |
| 超高速 Nerf 玩具子弹 (12,000 fps) | 本文 vs 10万美元级高速相机 (Photron UX100) | 飞行速度 16,000 px/s;重建帧率 12,000 fps | 传统专业高速相机(4,000 fps)面临极短曝光时间下的严重欠曝与严重运动拉丝(需补光 2~45 倍);本文系统在低照度下于 12,000 fps 重构出笔直清晰的子弹飞行轮廓。 |
关键发现¶
- 多孔径视角冗余彻底击败单视角分辨率优势:消融数据表明,单视角相机即使将分辨率提升 9 倍(\(768 \times 768\)),其时序抖动(\(E_{\text{warp}} = 0.0050\))与感知退化(LPIPS = 0.5185)依然极为严重,而 \(3 \times 3\) 光场在总像素完全相同的情况下将 \(E_{\text{warp}}\) 压缩至 0.0022,验证了多光束穿过独立湍流柱所捕获的波前统计分集是解耦双线性逆问题的关键。
- 纯事件架构突破传统高速相机物理瓶颈:在拍摄高达 16,000 像素/秒的 Nerf 子弹实验中,传统专业高速相机不仅售价昂贵(约 10 万美元 vs 本文系统约 5,000 美元)、机身笨重(1.5 kg vs 40 g),而且受光通量限制需要极强的补光灯;本文系统完全摆脱了曝光时间积分的物理束缚,依靠低功耗事件流实现了 12,000 fps 的高质量视频重现。
亮点与洞察¶
- 物理先验与事件统计的巧妙耦合:敏锐捕捉到“远距离场景视差极小使得信号强相关,而大气微团离散使得相位畸变弱相关”的物理本质,无需构建复杂的显式波前恢复网络,直接利用多视角通道堆叠便让轻量级卷积网络自发收敛出共识过滤机制。
- 万花筒光学的极简工程实现:避免了微透镜阵列制造公差大、空间分辨率严重碎裂以及多相机阵列时钟微秒级对齐困难的痛点,采用单个万花筒与单片事件芯片即可稳定获取完美同步的 9 子孔径,工程鲁棒性极高。
- 对高速成像与穿透介质领域的范式启发:该工作开辟了“纯事件流 + 多维光场计算”克服动态介质散射与像差的新方向,不仅可推广到车载激光雷达/夜视在恶劣天气(雨雪烟尘)下的成像,也为生物组织深层动态显微提供了低成本无标记的全新思路。
局限与展望¶
- 作者指出的局限:系统受制于单片事件传感器有限的空间分辨率(约 100 万像素),经万花筒 \(3 \times 3\) 分割后各子孔径分辨率进一步降至 \(256 \times 256\) 甚至更低;其次,假定目标接近光学无穷远(无显著深度视差),该假设在微距或近景显微成像中不再成立;此外,在 176×176 分辨率下的算法推理延时约为 3.4 ms,若要部署至全画幅实时系统,网络计算开销仍需深度轻量化优化。
- 潜在盲区与改进思考:当前网络完全在合成数据(REDS + P2S)上训练,仿真对事件噪声模型(如极端低照度下的背景热事件、非线性对数响应失配)的刻画仍有限;在真实桌面实验中,多孔径需要依靠预先摆放的标定靶做单应矩阵对齐(homography alignment),一旦长焦光机结构由于现场温漂或震动发生微小几何偏移,视角错位将严重损害多视角一致性假设。未来可引入隐式可形变对齐层或自监督动态配准模块增强实用鲁棒性。
相关工作与启发¶
- vs EvTurb (CVPR 2024) / EGTM (CVPR 2024):EvTurb 与 EGTM 依赖“传统强度帧 + 事件流”双模态输入,输出帧率被传统相机的固定曝光时间死死限制;本文采用纯事件架构(event-only),彻底摆脱传统曝光窗口,将成像帧率提升了数十至上百倍(达 12,000 fps)。
- vs MambaTM (ECCV 2024):MambaTM 基于状态空间模型处理传统视频序列去湍流,在目标高速运动时因传统传感器固有的运动模糊导致特征崩溃;本文直接从无模糊事件微秒脉冲重构,高速场景下轮廓锐利度显著胜出。
- vs 传统硬件自适应光学 (AO):大多数 AO 系统必须依赖引导星(Guidestar)或昂贵笨重的波前传感器与变形镜;本文是目前已知首个在千赫兹(kHz)乃至万赫兹级别运作且无需任何引导星的被动式低成本去湍流方案。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(首次将事件相机与光场光学融合用于大气湍流动态成像,物理建模与光机设计切中痛点)
- 实验充分度: ⭐⭐⭐⭐⭐(涵盖理论仿真、蜡烛阵列/加热器真实湍流台、水球破裂、万帧 Nerf 子弹及与 10 万美元级专业高速相机的详尽对比)
- 写作质量: ⭐⭐⭐⭐⭐(物理图像清晰直观,公式精炼克制,时空切片图与实验对比表述严谨)
- 价值: ⭐⭐⭐⭐⭐(为远程监视、高速飞行动体探测、天基地基对抗性成像提供了突破曝光瓶颈的全新计算光学范式)