跳转至

Degradation-Robust and Temporally Consistent Infrared–Visible Video Fusion via One-step Diffusion Framework

会议: ECCV 2026
论文: ECCV 2026
领域: 图像恢复
关键词: 红外与可见光视频融合, 单步扩散模型, 整流流, 时序一致性, 局部运动补偿

一句话总结

针对现有视频融合方法因单模态退化导致时序运动估计不可靠的问题,本文提出“先融合后时序(fusion-first)”的单步整流流扩散视频融合框架 DRT-VF,通过模态协同注意力构建鲁棒的帧内联合表征,并结合全局闪烁抑制与局部运动补偿实现高保真度且时序稳定的视频融合。

研究背景与动机

红外与可见光传感器在全天候场景感知中具有天然的互补优势:可见光图像具有丰富的高频纹理与色彩细节,但在低照度、夜间或烟雾等恶劣条件下感知性能急剧下降;红外传感器虽能凸显热辐射目标并免疫光照变化,却缺乏细粒度背景纹理且常伴随传感器固有噪声。虽然近年来基于深度学习的图像级融合方法在静态场景取得了显著进展,但在自动驾驶、全天候安防监控等实际连续视频流应用中,简单按帧逐一运行图像融合模型往往会引发严重的时序闪烁、运动伪影与跳帧失真。

为了缓解时序不一致性,现有视频融合方案通常引入循环特征聚合或基于光流的空间对齐机制。然而,绝大多数方法沿用了“时序优先(temporal-first)”处理范式,即先在各个单模态内部进行时序建模与帧间对齐,随后再执行跨模态特征融合。这种设计的致命缺陷在于其隐式依赖单模态输入的运动估计可靠性:在实际动态退化场景中,可见光视频常面临严重弱光、阴影或遮挡,红外视频则常伴随低信噪比与脉冲闪烁,导致基于单一模态计算的光流或时序运动严重漂移与畸变,这些错误会不可逆地传导并放大到跨模态融合阶段,导致融合视频产生显著的局部伪影与时序崩塌。

本文的切入视角是彻底颠覆传统管线的时间-跨模态编排次序,倡导“先融合后时序(fusion-first)”的新范式:在跨帧时序建模之前,先利用跨模态互补性完成深层信息融合,建立退化鲁棒的联合语义锚点,从而为后续时序稳定性约束提供高可靠度的特征基底。核心 idea:构建基于单步整流流扩散的 progressive 视频融合架构,第一阶段利用模态协同注意力在隐空间融合出高保真无退化帧内表征,第二阶段以该联合表征为基座,解耦构建全局通道统计稳态与高分辨率局部运动梯度补偿,实现兼顾高频结构保真与帧间平滑的端到端视频融合。

方法详解

整体框架

DRT-VF 整体采用两阶段递进式架构(Stage I 空间跨模态联合表征学习与单步扩散超精细重构,Stage II 分层时序一致性正则化与动态补偿),端到端运行流程如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入:连续可见光与红外视频帧<br/>{I_t^v, I_t^i}"] --> MCA["模态协同注意力 (MCA)<br/>跨模态交互生成联合语义锚点"]
    MCA --> DiT["单步整流流 DiT 主干<br/>生成先验隐空间单步去噪微调"]
    DiT --> GTC["全局时序一致性 (GTC)<br/>通道全局统计差分抑制大尺度闪烁"]
    GTC --> LMC["局部运动补偿 (LMC)<br/>DCN对齐 + 上下文聚合与边界梯度修正"]
    LMC --> Out["输出:高保真且时序连贯融合视频帧"]

在第一阶段(Stage I),输入当前帧的可见光图像通过预训练变分自编码器(VAE)提取结构隐变量,红外图像通过可学习的轻量红外适配器(Infrared Adapter)捕获热辐射特征。二者进入模态协同注意力(MCA)模块,动态结合红外显著热特征与可见光细粒度纹理;紧接着将该联合表征送入基于整流流(Rectified Flow, RF)公式的单步 Diffusion Transformer (DiT) 生成主干,在潜空间利用强扩散先验将退化特征一步映射至干净流形,最后由 VAE 解码器重建高质量帧内融合结果。

在第二阶段(Stage II),网络冻结或递进微调 Stage I 空间参数,引入双层时序一致性建模。首先在低分辨率潜空间通过全局时序一致性(GTC)模块正则化通道全局激活统计量,在无需显式空间配准的前提下消除大面积光度闪烁;随后在解码器最终高分辨率层前嵌入局部运动补偿(LMC)模块,通过可形变卷积(DCN)配准与解耦的双分支(上下文聚合分支与边界高频梯度修正分支),精确校正动态目标几何错位并抑制重影失真。

关键设计

1. 模态协同注意力 (MCA):以共享语义锚点实现自适应特征互补 针对弱光或传感器噪声下硬拼接/简单加权容易引入单模态退化噪声的问题,MCA 摒弃了过早特征对齐或刚性融合。模块先将可见光潜特征 \(F^v\) 与红外特征 \(F^i\) 沿通道拼接并经由卷积层投影,生成统一表征作为共享查询向量(Query)\(Q\)。随后,分别利用可学习线性投影矩阵生成模态特定的键值对 \((K^v, V^v)\) 与 \((K^i, V^i)\)。通过以共享语义锚点 \(Q\) 分别对两路模态计算自适应交叉注意力,实现模态特定信息的自适应挖掘与动态互补:

\[A^v = \text{Softmax}\left(\frac{Q (K^v)^\top}{\sqrt{d}}\right)V^v, \quad A^i = \text{Softmax}\left(\frac{Q (K^i)^\top}{\sqrt{d}}\right)V^i\]

最后经由前馈网络(FFN)聚合得到统一帧内融合特征 \(F^{\text{fuse}} = \text{FFN}(A^v) + \text{FFN}(A^i)\),使融合结果在深层表征空间自然抑制单模态退化并保留高显著性目标。

2. 单步整流流 DiT 主干:兼顾扩散生成先验与单步高效推理 传统多步扩散模型虽然能够凭借强大的分布建模能力重建微观结构,但数十甚至数百步反向迭代计算无法满足视频级融合的效率需求。本文采用整流流(Rectified Flow)框架建立从高斯噪声到干净融合潜变量的直线常微分方程(ODE)轨迹,在训练时预测恒定目标速度场 \((z_1 - z_0)\):

\[\mathcal{L}_{RF} = \mathbb{E}_{z_0, z_1, t}\left[ \| v_\theta(z_t, t, c) - (z_1 - z_0) \|^2 \right]\]

其中 \(c\) 为 MCA 模块提供的跨模态联合引导条件。由于学习到了直线轨迹,在推理阶段模型无需任何随机多步采样,只需利用欧拉法单步求导直接获取去噪潜特征 \(\hat{z}_0 = z_1 - v_\theta(z_1, t=1, c)\),既完整保留了扩散生成模型对退化区域的纹理补全先验,又实现了毫秒级的高效单步前向推理。

3. 全局时序一致性 (GTC):通道全局响应统计正则化抑制大尺度闪烁 视频融合中常见的画面明暗闪烁(photometric flicker),其本质源于相邻帧之间全局特征激活均值的非稳态跳变。传统方法依赖全局光流对齐极易在弱光或烟雾下失效,而 GTC 则选择在潜空间直接对通道级全局统计量进行平滑约束。针对连续三帧融合特征 \(\{F_{t-1}, F_t, F_{t+1}\}\),先通过全局平均池化(GAP)提取全局响应向量 \(u_i = \text{GAP}(F_i)\),并显式构建中心帧相对前后帧均值的残差偏差项 \(\delta_t = u_t - \frac{u_{t-1} + u_{t+1}}{2}\)。该偏差项直接作为时序不平稳指示器,通过轻量级 MLP 与 Sigmoid 生成通道调制权重 \(w_t\),以残差乘法方式重新校准中心帧特征 \(F_t^{\text{out}} = F_t + F_t \odot w_t\)。该机制完全避开了复杂的空间像素级对齐,低计算开销地熨平了帧间全局亮度震荡。

4. 局部运动补偿 (LMC):可形变配准与梯度域边界双分支解耦修复 潜空间全局统计稳态难以处理运动物体边缘由于几何位移导致的局部模糊与伪影,LMC 模块被置于解码器全分辨率特征层之前。首先利用带偏移量的可形变卷积(DCN)将相邻帧特征粗对齐到中心参考帧 \(\hat{D}_k = \text{DCN}(D_k, \Delta p_k)\)。针对直接聚合带来的插值模糊与鬼影问题,LMC 提出了双分支解耦结构:上下文聚合分支(CAB) 以中心帧特征为 Query,配准相邻帧为 Key/Value 计算相互自注意力(Mutual Self-Attention, MutualSA),自适应滤除错误对齐像素并聚合时序互补纹理;边界细化分支(BRB) 则在梯度域提取时序梯度残差 \(\mathcal{G}_t = | \nabla \hat{D}_{t-1} - \nabla D_t | + | \nabla \hat{D}_{t+1} - \nabla D_t |\),将动态目标的高频边缘与静态背景解耦,通过残差块生成边缘校准项。最终两分支输出直接残差相加,精准还原锐利运动边界。

损失函数 / 训练策略

模型采用两阶段渐进式训练方案,全流程在单张 NVIDIA GeForce RTX 5090 GPU 上完成: - Stage I 空间融合训练:训练 100 个 epoch,batch size 为 8,采用 AdamW 优化器,学习率为 \(1 \times 10^{-4}\)。损失函数由多模态融合通用目标驱动,包含强度保真损失、梯度保真损失、色彩保留损失以及整流流扩散速度匹配损失 \(\mathcal{L}_{RF}\),促使模型生成兼具高对比度红外目标与清晰可见光细节的单帧特征。 - Stage II 时序一致性训练:训练 100 个 epoch,batch size 为 1(由连续帧序列构成时序输入窗口)。在保持 Stage I 融合重构损失的同时,引入时序一致性正则化损失 \(\mathcal{L}_{\text{temporal}}\),惩罚前后帧经过运动补偿后的特征残差,联合优化 GTC 与 LMC 模块参数。

实验关键数据

主实验

评估在 HDO(强红外闪烁)、M3SVD(多动态目标)、NOT-156(弱光夜视)和 VTMOT(剧烈快速运动模糊)四个典型红外-可见光视频融合基准数据集上展开。对比 12 种主流方法(涵盖最新图像融合与视频融合 SOTA),采用互信息(MI↑)、视觉信息保真度(VIF↑)、结构相似性(SSIM↑)评估单帧融合质量,采用双向短期加权误差(BiSWE↓)和倒易流均方和(MS2R↓)评估时序稳定性。

数据集 评估指标 DRT-VF (本文) UniVF (前次优/SOTA) TemCOCO (视频基线) DCEVO (图像SOTA)
HDO MI ↑ / VIF ↑ / SSIM ↑ 3.521 / 0.792 / 0.680 3.483 / 0.806 / 0.671 3.250 / 0.647 / 0.568 3.409 / 0.781 / 0.671
BiSWE ↓ / MS2R ↓ 6.232 / 0.210 6.378 / 0.227 6.414 / 0.213 6.335 / 0.223
M3SVD MI ↑ / VIF ↑ / SSIM ↑ 3.373 / 0.934 / 0.712 3.366 / 0.931 / 0.688 2.218 / 0.466 / 0.441 3.421 / 0.931 / 0.691
BiSWE ↓ / MS2R ↓ 6.479 / 0.222 7.316 / 0.222 6.488 / 0.258 7.395 / 0.227
NOT-156 MI ↑ / VIF ↑ / SSIM ↑ 4.449 / 0.934 / 0.642 4.410 / 0.926 / 0.628 3.713 / 0.703 / 0.605 4.219 / 0.884 / 0.641
BiSWE ↓ / MS2R ↓ 7.542 / 0.574 8.551 / 0.591 8.122 / 0.826 8.579 / 0.577
VTMOT MI ↑ / VIF ↑ / SSIM ↑ 4.232 / 0.981 / 0.662 4.212 / 0.977 / 0.656 2.814 / 0.712 / 0.615 3.822 / 0.953 / 0.654
BiSWE ↓ / MS2R ↓ 4.822 / 0.332 4.690 / 0.338 4.593 / 0.382 4.848 / 0.345

在四大基准测试中,DRT-VF 在绝大多数指标上均位列第一或第二。特别是在夜间弱光场景 NOT-156 上,本文时序指标 BiSWE 相比 UniVF 从 8.551 骤降至 7.542,MS2R 从 0.591 降至 0.574,显著克服了暗光下单模态运动估计失真导致的闪烁伪影;同时在下游目标跟踪评测中(基于 YOLOv11n + ByteTrack 零样本设置),DRT-VF 达到 0.244 AUC 和 0.236 DP@20,全面领先所有对比模型。

消融实验

消融实验在具有代表性动态特征的 M3SVD 与夜视退化的 NOT-156 数据集上完成,系统探究范式颠覆(先融合 vs 先时序)、各阶段模块及局部补偿双分支的具体贡献:

变体配置 M3SVD: MI ↑ M3SVD: SSIM ↑ M3SVD: BiSWE ↓ NOT-156: MI ↑ NOT-156: SSIM ↑ NOT-156: BiSWE ↓ 说明
完整模型 (Ours) 3.373 0.712 6.479 4.449 0.642 7.542 完整两阶段 Fusion-First 框架
Temporal-First 3.152 0.651 7.854 4.125 0.594 8.956 移至模态内时序优先后性能全面崩塌
w/o Stage II 3.392 0.724 8.542 4.466 0.653 9.684 失去时序约束,空间微增但时序闪烁极严重
w/o MCA 3.214 0.686 6.551 4.253 0.616 7.625 退化为通道级简单拼接,跨模态互补受损
w/o DiT 3.187 0.672 6.613 4.204 0.608 7.702 移除单步扩散生成先验,高频结构保真度骤降
w/o GTC 3.361 0.706 8.216 4.432 0.636 9.458 移除全局时序一致性,BiSWE 大幅恶化(大尺度频闪)
w/o LMC 3.315 0.682 6.582 4.385 0.612 7.683 移除局部运动补偿,MS2R 从 0.574 恶化至 0.694(运动边缘模糊)
w/o DCN (LMC内) 3.332 0.693 6.514 4.406 0.622 7.605 缺失形变配准直接聚合导致严重重影伪影
w/o CA (CAB分支) 3.295 0.688 6.492 4.367 0.627 7.564 缺失相互自注意力上下文聚合,纹理丰富度降低
w/o BR (BRB分支) 3.344 0.698 6.486 4.415 0.631 7.552 缺失梯度残差边缘校准,运动轮廓边缘发虚

关键发现

  • 范式对比印证假说:将时序处理放于单模态前处理的 Temporal-First 变体,由于红外闪烁或可见光弱光导致光流估计严重漂移,各指标均呈现断崖式下跌(NOT-156 上 BiSWE 恶化至 8.956,MS2R 恶化至 0.652),决定性地证实了“先跨模态深度融合再建模时序(Fusion-First)”在抗退化上的优越性。
  • 分层时序设计的明确解耦:GTC 模块主导全局视场的亮度平滑,移除 GTC 会引起 BiSWE 恶化近 2 点(NOT-156 从 7.542 恶化至 9.458);而 LMC 模块主导运动物体的像素级精细对齐,移除 LMC 会引起 MS2R 指标从 0.574 骤升至 0.694,二者分工明确且互相补充。
  • 单步扩散先验的高保真价值:去除 DiT 模块不仅使 MI 和 SSIM 出现全面回落,也削弱了潜空间流形的规整度,证明了整流流单步建模在平衡极端退化修复先验与视频高吞吐推理上的核心价值。

亮点与洞察

  • “先融合后时序(Fusion-First)”架构范式革新:精准指出现有视频融合在单模态退化下面临时序估计不可靠的核心症结,通过颠倒融合与时序次序,让时序网络在干净丰富的跨模态联合表征上工作,从根本上阻断了单模态退化误差的时序传播链条。
  • 单步整流流(Rectified Flow)引入低照度视频融合:首次在跨模态视频融合中成功落地单步 DiT 架构,既借助连续扩散模型的强生成先验克服了极端光照缺失和传感器重度噪声,又规避了传统扩散数十步采样的致命计算开销。
  • 解耦的宏观-微观时序一致性架构:将时序一致性显式拆分为低分辨率潜空间的通道统计偏差抑制(GTC,宏观去闪烁)与全分辨率梯度残差双分支校准(LMC,微观保边缘),设计极具优雅性与可迁移性。

局限与展望

  • 时序窗口受限于三帧上下文:当前 GTC 与 LMC 模块基于局部三帧对称滑动窗口设计,在应对大范围长程遮挡或持续慢速大位移场景时,缺少长期记忆机制来维持跨数十帧的长程语义持久性。
  • 极端几何视差的配准挑战:尽管 LMC 引入了可形变卷积(DCN)提供非刚性几何补偿,但若红外与可见光物理双目相机在硬件层存在显著视差(Unregistered Parallax)或动态畸变,融合结果仍可能存在局部边缘残影。
  • 未来改进方向:可进一步探索结合轻量状态空间模型(Mamba)或自回归记忆队列实现双向长程时序感知,并将鲁棒的立体自适应视差配准模块融入 Stage I 的跨模态特征提取流程中。

相关工作与启发

  • vs UniVF [CVPR 2024]: UniVF 采用时序上下文先增强单模态表征再融合的思路,在单模态严重退化(如极暗可见光)时容易放大噪声;本文采用 Fusion-First 范式并引入单步扩散先验,在退化鲁棒性和去伪影能力上优势明显。
  • vs TemCOCO [ICCV 2023]: TemCOCO 借助多模态高层语义先验与时序循环约束,但对大面积全局曝光波动引起的频闪缺乏显式无对齐通道统计平滑机制;本文 GTC 与 LMC 分层设计在低算力下实现了更出色的全局去闪烁与高频动态边缘重建。
  • vs DDFM [ICCV 2023] / Mask-Dif [TPAMI 2024]: 传统基于扩散模型的图像融合依靠多步随机逆向采样,单帧推理耗时往往数秒甚至更长,且帧间独立去噪存在剧烈跳闪;DRT-VF 采用直线整流流实现确定性单步生成,并深度协同两阶段时序约束,真正打通了扩散生成模型在高质量连续视频融合中的实用路径。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 颠覆性倡导 Fusion-First 视频融合范式,单步整流流扩散与分层时序一致性设计契合度高且机制完备。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖四大退化视频基准的全面对比、定量时序与空间指标、严密的各组件/范式消融以及下游零样本目标跟踪落地。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻犀利,问题剖析逻辑连贯,公式推导严谨精炼且图表表意清晰。
  • 价值: ⭐⭐⭐⭐☆ 为全天候多模态自动驾驶、夜间自主机器人导航及低照度监控提供了极具实用价值的高保真视频增强方案。