跳转至

TurboMPLE: Joint Infrared Turbulence Mitigation and Physical Fields Estimation via Mutual Progressive Layered Extraction

会议: ECCV 2026
论文: ECCV 2026 Official
代码: https://github.com/Ayt777/TurboMPLE
领域: 优化/理论
关键词: 大气湍流消除, 物理场估计, 红外成像, 多任务学习, 渐进分层抽取

一句话总结

针对红外成像中大气湍流引起的光学畸变、模糊与灰度漂移,TurboMPLE 首创端到端多任务架构,通过双向特征互引导与大气物理定律约束,同步实现高质量视频湍流去除与四个动态二维物理场的高精度反演。

研究背景与动机

在大气长波红外(8–13 \(\mu\text{m}\))成像系统中,地面高温引起的大气温度梯度剧烈波动,进而引发折射率在时空维度的随机扰动。这种扰动会在传感器成像面造成严重的时空模糊、几何弯曲畸变,以及由于热消散与吸收散射引起的灰度漂移。传统大气湍流去除算法多依赖帧间对齐与时域“幸运区域”融合,在动态场景或长距离强湍流下极易失真。近年来基于深度学习的去湍流网络虽取得显著恢复进展,但绝大多数工作仅将该问题视为纯粹的数据驱动型图像去退化任务,完全割裂了退化现象与底层大气物理状态的耦合关系,导致模型在未见真实场景中的泛化能力极其脆弱。

此前虽有工作尝试引入物理信息,例如基于变分自编码器学习隐式相位畸变表示,但所得隐变量依然缺乏真实的物理量纲与可解释性;另有开创性工作 PBCL(Nature Computational Science 2023)提出了物理增强协同学习框架,但其采用“先估计静态湍流强度场、再据此复原图像、最后后验微调物理场”的三阶段串行策略。这种多阶段流水线不仅存在明显的误差累积效应、无法进行真正的端到端联合反向传播,而且将二维湍流物理场强行假定为静态不变量,无法捕捉湍流在视频时序中的真实动态演变。

本文的核心切入角度在于:湍流退化过程本质上是复杂大气物理场与成像光路相互作用的产物,图像退化表象包含了物理场的投影信息,而精确的物理先验反过来又能为消除退化提供强有力的结构约束。核心 idea:将红外大气湍流消除与底层物理场反演统一在多任务端到端框架下,构建相互渐进分层抽取结构与物理约束损失,利用双向注意力机制实现退化先验与视觉表征的深层互惠协同。

方法详解

整体框架

TurboMPLE 输入包含连续 \(T\) 帧红外退化图像的序列 \(I \in \mathbb{R}^{T \times 1 \times H \times W}\),输出为复原后的清晰红外视频序列 \(I_{\text{out}} \in \mathbb{R}^{T \times 1 \times H \times W}\) 以及对应的四个动态二维大气物理场预测图 \(P_{\text{out}} \in \mathbb{R}^{T \times 4 \times \frac{H}{16} \times \frac{W}{16}}\)。这四个物理场分别由大气折射率结构常数 \(C_n^2\)、温度结构常数 \(C_T^2\)、湍流动能耗散率 \(\varepsilon\) 以及表征速度脉动的雷诺应力 \(\text{RS}\) 构成。

网络整体由三个核心阶段构成:首先,输入图像序列经过嵌入布格–朗伯–比尔定律(Bouguer–Lambert–Beer Law, BLB)的物理编码器,抑制热辐射灰度漂移并结合时域注意力单元提取浅层时空特征;接着,时空特征送入堆叠的 \(N\) 个相互渐进分层抽取块(MutualPLE Block),在任务专有专家与共享专家协同表征的基础上,通过跨任务交互块实现渐进式的双向交叉引导;最后,解耦出的两套任务特异性表征分别经由复原头与物理估计头,并在湍流物理定律约束损失的监督下完成端到端推理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入序列<br/>T×1×H×W"] --> Enc["BLB物理嵌入编码器<br/>物理辐射补偿 + 时空特征提取"]
    Enc --> PLE["MutualPLE特征抽取块<br/>共享双分支 + 任务专有专家"]
    PLE --> CTMB["跨任务交互引导<br/>双向注意力 + 渐进动态门控"]
    CTMB --> Heads["双任务解码预测头<br/>复原头 + 物理场估计头"]
    Heads --> OutMit["清晰图像序列<br/>T×1×H×W"]
    Heads --> OutPhys["物理场预测<br/>Cn2, CT2, ε, RS"]

关键设计

1. BLB物理嵌入编码器:消除红外灰度漂移并捕捉时空特征

针对红外成像中热辐射在大气传输时的吸收与散射导致图像灰度整体飘移与对比度退化的问题,编码器首层显式嵌入布格–朗伯–比尔定律。该物理机制通过下式对输入图像 \(I\) 进行辐射衰减前置补偿: $\(I_1 = I \times \exp\left((\mu_a + \mu_s) \times d\right)\)$ 其中 \(\mu_a\) 和 \(\mu_s\) 分别表示大气吸收与散射衰减系数,\(d\) 表示等效传输距离。三者均作为网络可学习参数,通过 Sigmoid 函数分别映射至 \([0, 1]\) 和 \([0, 10]\) 物理合理区间内。随后,经补偿的图像 \(I_1\) 送入多层卷积与时域注意力单元(Temporal Attention Unit, TAU),在下采样四倍的同时捕捉时序帧间强相关性,输出丰富的浅层时空表征 \(F_{\text{st}} \in \mathbb{R}^{T \times C \times \frac{H}{4} \times \frac{W}{4}}\)。

2. 共享与专有专家解耦:结合状态空间时序建模与湍流敏感调制

针对传统多任务硬共享机制容易出现梯度冲突与负迁移的缺陷,MutualPLE 在每一层将特征抽取解耦为任务专有专家与共享专家。为了应对大气湍流兼具局部空间剧烈扭曲与长程时间波动的物理本质,共享专家采用了创新的双分支解耦设计:卷积分支中,由轻量化评估器预测空间湍流图,生成空间自适应权重矩阵 \(W\),以此对特征进行逐元素调制 \(F_{\text{conv}} = F_{\text{st}} \odot W\),从而显著增强湍流敏感区域并抑制冗余响应;时序分支则采用基于二维选择性扫描机制(SS2D)的视觉状态空间模型(Mamba),在线性复杂度下精准捕获长序列跨帧运动连续性。两路特征拼接并经 Channel Shuffle 重组为共享表征 \(F_s^i\);而针对去退化与物理估计各自任务的专有专家,则采用高效的全局-局部多尺度卷积结构分别抽取 \(F_m^i\) 与 \(F_e^i\)。

3. 跨任务交互引导:自适应双向注意力与渐进门控融合

为了彻底打破单向或串行多阶段信息孤岛,跨任务交互块(CTMB)建立了去湍流任务与物理场估计任务之间的双向信息交互路径。在第 \(i\) 层中,两个反向的跨注意力机制相互作用:去湍流专家以物理估计特征为键值获得大气退化分布的物理先验指导,而物理估计专家则以高分辨率视觉特征为引导捕捉微观细节强度变化: $\(\tilde{F}_m^i = \text{CrossAttn}_{m \leftarrow e}(F_m^i, F_e^i), \quad \tilde{F}_e^i = \text{CrossAttn}_{e \leftarrow m}(F_e^i, F_m^i)\)$ 为了防止浅层阶段过早引入不稳定的跨任务噪声,网络引入了随网络深度递增的渐进互学习权重 \(\omega_i = 0.2 + i \times 0.4\),自适应调节交互特征与原始特征的加权融合: $\(F_m^{i\prime} = F_m^i \odot (1 - W_m^i) + \tilde{F}_m^i \odot W_m^i, \quad W_m^i = \omega_i \cdot \Phi_m([F_m^i, \tilde{F}_m^i])\)$ 最终,结合全局池化与 Softmax 门控网络 \(\mathcal{G}\),将更新后的任务特异特征与共享专家特征 \(F_s^i\) 自适应聚合,不仅保留了深层表征的协同互惠,同时有效避免了多任务干扰。

损失函数 / 训练策略

TurboMPLE 采用多目标联合优化框架,兼顾视觉复原保真度与物理场内在物理一致性。

图像去湍流损失函数定义为: $\(\mathcal{L}_m = \mathcal{L}_{\text{mit}} + \beta_1 \mathcal{L}_{\text{re-deg}}\)$ 其中 \(\mathcal{L}_{\text{mit}} = \|I_{\text{out}} - I_{\text{GT}}\|_1\),而 \(\mathcal{L}_{\text{re-deg}}\) 是通过可微的前向重退化模拟流水线(依次施加灰度漂移、高斯模糊及网格扭曲几何倾斜)将生成图 \(I_{\text{out}}\) 重退化后与真实退化输入 \(I\) 计算的 \(L_1\) 一致性损失。超参数 \(\beta_1\) 在训练初期设为 0,在后半段开启并设为 1。

物理场估计损失函数定义为: $\(\mathcal{L}_e = \mathcal{L}_{\text{est}} + \beta_2 \mathcal{L}_{\text{phys}}\)$ 其中 \(\mathcal{L}_{\text{est}} = \|P_{\text{out}} - P_{\text{GT}}\|_1\),权重 \(\beta_2 = 0.5\)。为了确保预测物理量符合流体物理规律,\(\mathcal{L}_{\text{phys}}\) 显式嵌入了大气温度脉动、折射率扰动、动能耗散率以及雷诺应力之间的理论关系式: $\(\mathcal{L}_{\text{phys}} = \mathbb{E}\left[ \left\| \hat{C}_n^2 - \left(79 \times \frac{P}{\hat{T}^2}\right)^2 \hat{C}_T^2 \right\|_1 + \left\| \hat{\varepsilon} - \gamma (\hat{C}_n^2)^{3/2} \left(\frac{T}{P}\right) \right\|_1 + \left\| \widehat{\text{RS}} - \frac{(\hat{\varepsilon} L)^{2/3}}{L} \right\|_1 \right]\)$ 该物理一致性正则项强制约束各预测通道之间的偏微分与比例关联,极大地提升了模型在真实无标签红外场景中的物理可信度。

实验关键数据

主实验

实验基于作者构建的大规模红外湍流合成基准(3,357 个序列、共 100,710 帧图像与对应的 16×16 分辨率 4 通道物理场标注),在统一设定(输入 30 帧、256×256 分辨率)下与前沿的单帧去退化、视频超分、以及先进湍流算法进行综合基准对比。

表1:红外图像去湍流性能量化对比(PSNR (dB) / SSIM)

方法类型 方法 弱湍流 (Weak) 中等湍流 (Medium) 强湍流 (Strong) 综合全集 (Overall) 计算量 (GMACs)
视频基准 BasicVSR (CVPR'21) 29.2718 / 0.8695 25.8040 / 0.7474 24.1317 / 0.6714 26.4142 / 0.7632 8355.0
视频去模糊 ESTRNN (IJCV'23) 25.1907 / 0.7898 24.1390 / 0.7178 23.1995 / 0.6609 24.1810 / 0.7231 1450.2
单帧恢复 ConvIR (TPAMI'24) 26.9256 / 0.8007 23.9879 / 0.6641 22.8554 / 0.6016 24.5989 / 0.6893 120.4
单帧恢复 MaIR (CVPR'25) 29.3921 / 0.8705 25.5369 / 0.7443 24.0329 / 0.6675 26.3329 / 0.7612 134.8
湍流专用 TMT (TCI'24) 29.3165 / 0.8697 26.0301 / 0.7498 24.7026 / 0.6825 26.6936 / 0.7678 496.0
湍流专用 DATUM (CVPR'24) 29.1793 / 0.8683 26.2379 / 0.7613 24.9530 / 0.6964 26.7997 / 0.7757 1582.0
物理协同 PBCL (Nat. Comput. Sci.'23) 28.3768 / 0.8502 26.2520 / 0.7693 25.0672 / 0.7265 26.5729 / 0.7823 642.0
状态空间 MambaTM (CVPR'25) 26.8179 / 0.7848 24.9059 / 0.6923 23.9590 / 0.6445 25.2341 / 0.7075 312.0
多任务联合 TurboMPLE (本文) 29.8887 / 0.8790 27.1542 / 0.7918 25.6436 / 0.7274 27.5718 / 0.7998 145.1

表2:物理场估计性能对比(空间与时序评估)

方法 空间 \(C_n^2\) (MAE / \(R^2\)) 空间 \(C_T^2\) (MAE / \(R^2\)) 空间 \(\varepsilon\) (MAE / \(R^2\)) 空间 \(\text{RS}\) (MAE / \(R^2\)) 时序 \(C_n^2\) (\(R^2\)) 时序 \(C_T^2\) (\(R^2\)) 时序 \(\varepsilon\) (\(R^2\)) 时序 \(\text{RS}\) (\(R^2\))
UNet 0.076 / 0.604 0.071 / 0.564 0.053 / 0.523 0.074 / 0.586 0.893 0.890 0.870 0.891
GRCNN 0.060 / 0.771 0.054 / 0.763 0.039 / 0.712 0.057 / 0.767 0.888 0.883 0.853 0.886
UwU-Net 0.118 / 0.124 0.105 / 0.109 0.072 / <0.1 0.112 / 0.117 0.386 0.387 0.368 0.387
FoVFormer 0.036 / 0.891 0.034 / 0.882 0.024 / 0.860 0.035 / 0.888 0.948 0.944 0.929 0.947
PBCL 0.048 / 0.754 0.044 / 0.734 0.037 / 0.621 0.046 / 0.745 0.932 0.927 0.909 0.930
TurboMPLE 0.024 / 0.943 0.023 / 0.935 0.017 / 0.919 0.023 / 0.940 0.973 / 0.997 0.972 / 0.997 0.963 / 0.995 0.973 / 0.997

消融实验

表3:核心模块累加消融实验结果

配置 包含组件 PSNR (dB) SSIM 物理场空间 \(R^2_s\) 物理场时序 \(R^2_t\)
(1) 基线 Residual Dense Blocks 代替双分支专家,无互学习/物理嵌入/物理损失 26.470 0.781 0.890 0.967
(2) 分支增强 (1) + 双分支专家(SS2D时序 + 湍流敏感调制卷积) 26.726 0.786 0.900 0.974
(3) 交互增强 (2) + 跨任务交互引导块(CTMB 双向交叉注意力) 27.113 0.787 0.909 0.983
(4) 物理嵌入 (3) + 编码器布格–朗伯–比尔定律嵌入(BLB) 27.452 0.797 0.916 0.972
(5) 完整模型 (4) + 湍流物理约束损失 \(\mathcal{L}_{\text{phys}}\) 27.572 0.800 0.934 0.985

表4:MutualPLE Block 数量 \(N\) 的影响消融

块数量 \(N\) PSNR (dB) SSIM 物理场空间 \(R^2_s\) 物理场时序 \(R^2_t\) 计算量 (GMACs) 参数量 (M)
\(N = 1\) 26.482 0.783 0.896 0.966 96.3 0.645
\(N = 2\) (默认) 27.572 0.800 0.934 0.985 145.1 0.942
\(N = 3\) 27.477 0.795 0.936 0.981 193.8 1.239

关键发现

  • 双向互惠促进双任务指标跃升:消融实验表明,仅加入 CTMB 跨任务交互模块,去湍流 PSNR 便从 26.726 dB 跃升至 27.113 dB,物理场空间拟合优度 \(R^2_s\) 提升近 0.01。这证明了物理场先验能直接指导视觉特征解除扭曲,同时清晰视觉线索也能显著提升物理场反演精度。
  • 物理先验驱动可解释泛化:引入 BLB 辐射补偿与 \(\mathcal{L}_{\text{phys}}\) 物理约束后,PSNR 再次提升 0.459 dB,且在真实红外采集场景中与四探针热电偶温度计(TFM)实测参数取得了高达 \(r = 0.944\)(\(C_n^2\))和 \(r = 0.968\)(\(C_T^2\))的皮尔逊相关系数,证明模型并非过拟合伪影,而是真正学习到了真实物理流体规律。
  • 极致的轻量化与运行效率:TurboMPLE 仅需 0.942M 参数和 145.1 GMACs(30帧 256×256 图像输入),其运算开销比 BasicVSR 降低了 50 倍以上,比单任务主流去湍流 Transformer(如 DATUM 1582 GMACs)高效 10 倍以上,完美适配实际边缘红外设备的实时去湍流应用。

亮点与洞察

  • 多任务特征级相互渐进抽取:打破了过去将图像去湍流与物理场估计视为孤立单任务或非端到端串行级联的范式,通过动态渐进权重 \(\omega_i\) 调控双向交叉注意力,实现了表征层面的有机互补。
  • 物理定律硬嵌入与软正则结合:在输入前置端嵌入布格–朗伯–比尔定律自适应补偿热辐射漂移,在损失端嵌入柯尔莫哥洛夫内区湍流微积分关联方程,兼顾了深度学习的拟合能力与经典光学物理的严谨性。
  • 大规模红外湍流基准构建:不仅采集了北京、湖北、重庆三地涵盖 80,580 帧真实红外视频,还合成了包含全套时空物理场标注的 100,710 帧多级湍流数据,为该交叉领域提供了极具价值的标准测试基准。

局限与展望

  • 物理场空间分辨率受限:受制于计算开销与流体仿真网格限制,反演预测的物理场空间分辨率目前仅为图像尺寸的 \(\frac{1}{16} \times \frac{1}{16}\)(即 16×16 网格),尚未达到全分辨率像素级密集场估计。
  • 极端突发非均匀湍流适应性:当前网络假设同一局部视野内的大气压强 \(P\) 与环境温度 \(T\) 处于缓变状态,面对火箭尾焰、强对流燃烧等剧烈突发气流扰动,理论物态方程参数(如局域特征尺度 \(L\))可能需要动态自适应建模。
  • 未来方向:未来可将此框架迁移至可见光与短波红外多光谱联合湍流探测中,并探索基于扩散模型的像素级超分辨率物理场联合推演。

相关工作与启发

  • vs PBCL (Nature Computational Science 2023):PBCL 采用分阶段多模型独立估计策略,假设湍流场为静态且缺乏端到端梯度回传;TurboMPLE 采用单模型全端到端 Multi-Task PLE 结构,显式建模时序动态,去湍流指标大幅领先且参数量大幅削减。
  • vs MambaTM (CVPR 2025):MambaTM 通过隐式 VAE 学习潜在相位畸变编码,缺乏可解释物理意义;TurboMPLE 则显式反演可测量、符合流体力学规律的四个实际物理场,并在计算复杂度与复原保真度上全面占优。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首创红外大气去湍流与物理场估计的端到端相互渐进多任务统一框架,物理嵌入设计新颖。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 18 万帧大规模真实与合成双模态数据集、真实热电偶物理实测对比、多维度消融及 SOTA 横向对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 物理机理推导严谨,多任务网络架构图示与公式表述清晰自洽。
  • 价值: ⭐⭐⭐⭐⭐ 彻底打通了光学图像底层物理反演与高层去退化恢复,对军工侦察、远距离遥感与自由空间光通信极具落地价值。