跳转至

P²Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/YiShi99/P2Fusion
领域: 3D视觉
关键词: 红外与可见光图像融合、提示学习、知识蒸馏、多模态感知、专家混合系统

一句话总结

针对红外-可见光图像融合中先验硬约束冲突与粒度失配问题,P²Fusion 提出以“Teach-to-Fuse”范式将热显著性与空间质量双重内在物理先验蒸馏为动态可学习提示,并结合门控动态专家重校准模块实现自校正特征提炼与高保真感知重建。

研究背景与动机

红外与可见光图像融合(IVIF)旨在综合可见光传感器捕获的丰富背景纹理与红外传感器捕获的高温热辐射目标,为自动驾驶、目标重识别和复杂恶劣天气监测提供全天候多模态视觉表征。然而,由于自然场景下缺乏成对的“理想真实融合图像(Ground Truth)”,IVIF 在本质上是一个无监督图像生成问题,传统深度网络高度依赖手工设计的启发式损失函数与网络架构,难以在保留微弱纹理细节与突显显著目标结构之间达成自适应平衡。为此,引入领域先验知识辅助特征融合逐渐成为主流趋势。

然而,现有的先验引导范式普遍受制于三种核心技术路线的根本缺陷。首先,基于显式模态硬约束的方法(如 STDFusionNet、PIAFusion)通常将静态显著图或分割掩膜作为惩罚性正则项,这迫使网络优先去拟合刚性的先验分布,反而在模态冲突区域牺牲了精细的高频纹理边界。其次,联合下游任务联合优化的路线(如 TarDal、SuperFusion)将目标检测或语义分割网络嵌入训练循环,但这往往引入严重的多目标梯度冲突,使得模型过度迎合目标检测框的高对比度要求,劣化了背景区域的视觉感知质量。最后,近年兴起的外在语义先验引导路线尝试引入 CLIP、DINO 等视觉大模型作为软引导,但大模型的高层抽象语义表征与以像素级纹理重构为核心的低层图像融合之间存在严重的“粒度失配(Granularity Mismatch)”,无法为局部光影与边缘重建提供直接有效的像素指导。

本文的切入角度是回归多模态成像数据的本质内生属性,抛弃寻找“完美静态先验”或盲目引入外部大模型抽象表征的旧路,建立轻量自适应的动态提示引导机制。核心 idea:提出“教导-融合(Teach-to-Fuse)”范式,将红外热显著性与可见光空间退化质量两种内生物理先验蒸馏为动态可学习提示,并设计门控动态专家重校准机制对异质特征进行解耦提炼与自校正,消除优化冲突并实现端到端高保真融合。

方法详解

整体框架

P²Fusion 整体架构包含双师内在先验动态提示蒸馏、双向交叉注意力交互以及门控动态专家重校准(GDER)三大核心阶段。首先,输入图像对分别经过轻量级特征编码器提取浅层特征,同时从红外图像和可见光图像中分别提取内生的目标热显著性先验和空间图像退化质量先验,并将其蒸馏为可学习的动态提示向量(Prompts)。随后,动态提示作为调节因子注入模态特征,并通过双向交叉注意力实现粗粒度跨模态信息交互。最后,交互后的异质特征进入由模态专精专家与全局注意力专家构成的 GDER 模块,通过动态门控网络实现解耦校正与多轮渐进提炼,最终由重构解码器输出高质量融合图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入<br/>红外图像 I_ir 与可见光图像 I_vis"] --> B["先验提取教师网络<br/>红外显著性 IST 与可见光质量 VQT"]
    B --> C["双师内在先验动态提示蒸馏<br/>内生先验蒸馏为软性可学习提示"]
    C --> D["双向交叉注意力机制<br/>模态特征注入提示并交互 F'"]
    D --> E["门控动态专家重校准 (GDER)<br/>解耦模态专家与注意力专家的动态仲裁"]
    E --> F["渐进解码重构<br/>高质量融合图像 I_fused 与下游任务感知"]

关键设计

1. 双师内在先验动态提示蒸馏:以软性提示解耦硬约束与粒度失配

传统先验引导方法往往直接将二值化掩膜或分类边界作为损失函数硬惩罚,导致网络丧失探索像素间互补细节的灵活性;而直接引用大模型先验又面临语义与像素的粒度脱节。针对这一问题,本设计提出双师教导机制(Teach-to-Fuse),在模态内部自适应提炼内生属性,并将其转化为动态嵌入提示(Dynamic Prompts)来软性调节特征空间。 在红外分支中,构建红外显著性教师(Infrared-Saliency Teacher, IST),采用在 MSRS 与 FMB 场景标注上预训练的 SegFormer-B2 提取行人、车辆等高热辐射目标的先验分布 \(T_{ir} \in \mathbb{R}^{H \times W}\);在可见光分支中,构建无参考可见光质量教师(Visible-Quality Teacher, VQT),基于无参考质量评价器 BRISQUE 计算可见光图像的空间退化分数 \(s \in [0, 100]\),并归一化为空间质量先验标量 \(T_{vis} = (100 - s) / 100\)。网络学习的提示特征 \(P_{ir}\) 与 \(P_{vis}\) 分别通过 BCE 与 MSE 蒸馏损失与双师输出对齐,随后通过嵌入层与浅层模态特征相加得到增强特征: $\(F_m = f_m + \text{Embed}(P_m), \quad m \in \{vis, ir\}\)$ 这种设计让先验知识以连续特征向量的形式平滑调节模态编码,彻底消除了刚性损失导致的梯度冲突。

2. 门控动态专家重校准(GDER):专用解耦专家的自校正互补仲裁

红外与可见光图像特征天然具有异质性:红外侧对温差结构敏感,可见光侧包含密集纹理细节,经双向交叉注意力交互后容易出现模态混淆与特征相互干扰。区别于传统为了扩展模型参数容量的混合专家(MoE)结构,本文提出的 GDER 模块专注于“特征解耦与偏置校正”,由先验响应模态专家 \(E_{mod}\) 与先验无关注意力专家 \(E_{att}\) 协同组成。 先验响应模态专家 \(E_{mod}\) 显式接入动态提示,强制聚焦于由先验标识的关键区域(如热辐射前景目标与高反差边缘),确保先验知识精准注入;而先验无关注意力专家 \(E_{att}\) 完全独立于提示信号,采用包含通道与空间维度的卷积注意力机制(CBAM)挖掘全局长程上下文与局部微弱结构,主动补偿提示所遗漏的背景纹理。门控网络 \(G(\cdot)\) 动态评估局部特征与全局提示的一致性,输出自适应权重 \(w = \text{softmax}(G(F', P))\),完成特征的自校正加权更新: $\(F'' = F' + w_1 \cdot E_{mod}(F') + w_2 \cdot E_{att}(F')\)$ 实验表明两者特征表征的皮尔逊相关系数仅为 \(r = 0.46\),证明了两类专家在功能上高度解耦。当先验信号受到极端曝光或浓烟干扰时,门控网络自发降低模态专家权重、提升全局注意力专家权重,形成极强的抗退化自愈能力。

损失函数 / 训练策略

P²Fusion 的优化目标由感知重构约束与提示蒸馏损失共同构成,总损失函数定义为: $\(\mathcal{L}_{total} = \lambda_1 \mathcal{L}_{int} + \lambda_2 \mathcal{L}_{ssim} + \lambda_3 \mathcal{L}_{grad} + \lambda_4 \mathcal{L}_{ir}^{distill} + \lambda_5 \mathcal{L}_{vis}^{distill}\)$ 其中感知损失包含: 1. 强度损失 \(\mathcal{L}_{int} = \|I_{fused} - \max(I_{ir}, I_{vis})\|_1\),平衡热辐射能量与可见光亮度; 2. 梯度损失 \(\mathcal{L}_{grad} = \|\nabla I_{fused} - \max(|\nabla I_{ir}|, |\nabla I_{vis}|)\|_1\),迫使融合图像保留双模态中更丰富的高频边缘; 3. 结构相似性损失 \(\mathcal{L}_{ssim} = 1 - (\omega_{ir} \text{SSIM}(I_{ir}, I_{fused}) + \omega_{vis} \text{SSIM}(I_{vis}, I_{fused}))\),其中权重根据模态的平均梯度幅值自适应分配。 提示蒸馏损失则包括针对可见光质量的 MSE 损失 \(\mathcal{L}_{vis}^{distill} = \|P'_{vis} - T_{vis}\|_2^2\),以及针对红外显著图的交叉熵损失 \(\mathcal{L}_{ir}^{distill} = - (T_{ir} \odot \log P_{ir}^{map} + (1 - T_{ir}) \odot \log(1 - P_{ir}^{map}))\)。超参数设置为 \(\lambda_1=8, \lambda_2=25, \lambda_3=20, \lambda_4=0.5, \lambda_5=5\)。在 4 张 NVIDIA RTX 3090 GPU 上使用 Adam 优化器训练 100 个 epoch,初始学习率为 \(1 \times 10^{-4}\)。

实验关键数据

主实验

在 MSRS、M3FD、FMB 和 RoadScene 四大公开数据集上与 11 种前沿 SOTA 方法进行定量对比,评估指标包括融合质量评估指数(FQIE)、视觉保真度(VIF)、基于梯度的特征传递指标(\(Q^{AB/F}\))和互信息(MI)。如表 1 所示,P²Fusion 在多项指标上大幅刷新 SOTA 表现。

表 1: MSRS、M3FD、FMB、RoadScene 四大基准上的图像融合质量量化对比

数据集 方法 FQIE ↑ VIF ↑ Qabf ↑ MI ↑
MSRS DiTFuse (TPAMI'25) 0.642 0.281 0.363 2.146
FreqGAN (TCSVT'25) 0.679 0.285 0.492 2.871
Freefusion (TPAMI'25) 0.590 0.281 0.430 1.984
LutFuse (ICCV'25) 0.783 0.424 0.610 3.625
SAGE (CVPR'25) 0.763 0.335 0.535 3.217
本文方法 (Ours) 0.850 0.445 0.682 3.905
M3FD DiTFuse (TPAMI'25) 0.389 0.188 0.274 2.514
Freefusion (TPAMI'25) 0.621 0.473 0.539 2.712
LutFuse (ICCV'25) 0.466 0.319 0.480 3.987
SAGE (CVPR'25) 0.659 0.363 0.575 3.115
本文方法 (Ours) 0.743 0.429 0.635 3.819
FMB DiTFuse (TPAMI'25) 0.536 0.215 0.363 2.620
Freefusion (TPAMI'25) 0.696 0.501 0.587 3.004
LutFuse (ICCV'25) 0.575 0.319 0.527 3.897
SAGE (CVPR'25) 0.763 0.384 0.634 3.429
本文方法 (Ours) 0.826 0.448 0.677 4.030
RoadScene DiTFuse (TPAMI'25) 0.445 0.320 0.426 2.938
DDFM (ICCV'23) 0.485 0.372 0.471 2.940
LutFuse (ICCV'25) 0.328 0.265 0.381 3.644
SAGE (CVPR'25) 0.379 0.237 0.334 2.919
本文方法 (Ours) 0.617 0.388 0.557 3.021

同时,为验证融合对高级下游视觉任务的增益,基于 YOLOv7s 进行目标检测测试,基于 SegFormer-B5 进行语义分割评估,具体数据见表 2。

表 2: 下游任务定量评估:M3FD 目标检测与 FMB 语义分割结果

任务 / 基准 方法 关键类别指标 (Person / Car / Truck) 核心总结指标
M3FD 目标检测 DiTFuse (TPAMI'25) Person: 0.514, Car: 0.684, Truck: 0.663 mAP: 60.46%
(YOLOv7s) FreqGAN (TCSVT'25) Person: 0.544, Car: 0.700, Truck: 0.673 mAP: 61.85%
Freefusion (TPAMI'25) Person: 0.527, Car: 0.702, Truck: 0.674 mAP: 61.87%
SAGE (CVPR'25) Person: 0.531, Car: 0.707, Truck: 0.658 mAP: 60.86%
本文方法 (Ours) Person: 0.534, Car: 0.704, Truck: 0.690 mAP: 62.37% (+0.5%)
FMB 语义分割 DiTFuse (TPAMI'25) T.Sign: 73.15, Car: 81.76, Pole: 43.21 mPA: 63.340%, mIoU: 56.808%
(SegFormer-B5) FreqGAN (TCSVT'25) T.Sign: 73.56, Car: 82.23, Pole: 44.73 mPA: 64.471%, mIoU: 57.284%
Freefusion (TPAMI'25) T.Sign: 71.75, Car: 80.16, Pole: 41.97 mPA: 63.469%, mIoU: 56.421%
SAGE (CVPR'25) T.Sign: 72.39, Car: 81.39, Pole: 41.86 mPA: 63.798%, mIoU: 56.479%
本文方法 (Ours) T.Sign: 74.15, Car: 82.27, Pole: 43.91 mPA: 64.672%, mIoU: 57.456%

消融实验与分布外(OOD)验证

为进一步确认各个模块的有效性与极端场景鲁棒性,论文在 DroneVehicle 航拍视角数据集上执行严格的零样本 OOD 测试(未经 DroneVehicle 训练微调),对比数据如下表所示。

表 3: DroneVehicle 数据集上的分布外(OOD)泛化与消融检验

配置 / 方法 图像融合指标 (FQIE / VIF / Qabf) 目标检测 mAP50→95 (Car / Truck / Bus / All) 表现分析与消融结论
完整模型 (Ours) FQIE: 0.6282, VIF: 0.2655, Qabf: 0.5269 Car: 0.632, Truck: 0.576, All: 0.604 完整模型表现最优,跨视角鲁棒性极强
去除可见光提示 (w/o Pvis) FQIE 明显下降,VIF 损失最大 门控机制退化为近均匀分布,丢失高频细节 证明空间质量先验是维持纹理保真度的核心
去除红外提示 (w/o Pir) Qabf 显著衰减,热目标对比度降低 红外激活过度平滑,目标检测漏检率升高 证明热显著性先验提供了关键目标定位支撑
去除双师蒸馏 (w/o both) 全指标下降最严重,多项下降超过 15% 缺乏物理先验锚点,跨模态交互发生混淆 验证了双师内在先验引导的不可替代性
TIM (TPAMI'24) 对比基线 FQIE: 0.2728, VIF: 0.2211, Qabf: 0.3182 Car: 0.622, Truck: 0.567, All: 0.595 传统特征解耦在俯视大视角衰减显著
FreqGAN (TCSVT'25) 对比 FQIE: 0.5340, VIF: 0.2775, Qabf: 0.4643 Car: 0.601, Truck: 0.490, All: 0.540 频域对抗在复杂光照下出现伪影

关键发现

  • 双先验的互补协同:消融结果显示,去掉可见光提示 \(P_{vis}\) 会使门控分布坍塌为空间无差别的均匀响应,导致 VIF 急剧下降;而去掉红外提示 \(P_{ir}\) 则会导致热目标边界模糊,使下游检测的查全率显著降低。两者协同方能实现“前景清晰突显、背景细节完备”。
  • 专家的功能正交性:模态专家与注意力专家的相关系数仅为 0.46,在过曝光场景下,注意力专家精准捕获路牌文字与路灯杆骨架,而模态专家则精准隔离行人热轮廓,验证了动态仲裁而非暴力拼接的有效性。
  • 跨域 OOD 适应能力:在完全未见过的航拍 DroneVehicle 数据集上,即便面临严重的小目标与大视角畸变,下游检测全类别的 mAP50-95 仍高出次优 SOTA 模型 0.9%,展示出其优异的无监督泛化潜力。

亮点与洞察

  • 由“硬惩罚”转向“软提示”的范式重塑:传统方法直接将先验作为损失惩罚项,极易导致梯度震荡与细节抹杀;P²Fusion 将物理先验编码为轻量可学习 prompt 嵌入特征流,既保留了先验引导的场景自适应性,又赋予了网络充分的像素级重建自由度。
  • 基于自校正 MoE 的模态解耦仲裁:摒弃传统 MoE 仅用于扩大模型容量的做法,设计模态专精专家与全局注意力专家,通过门控动态权重在先验失效或传感器退化时实时补偿,极大增强了模型在烟雾遮挡与过曝光工况下的稳健性。
  • 通用可扩展的先验接入框架:P²Fusion 具备先验不可知(prior-agnostic)特性,其提示蒸馏接口不仅限于热辐射与 BRISQUE 质量分数,未来可低成本拓展接入深度(Depth)、表面法向量或时序光流先验,极具工程迁移价值。

局限与展望

  • 作者承认的局限:当前的红外显著性教师(IST)依赖预训练分割模型进行前后景二值化切分,若预训练模型在非典型极端工况下出现大面积漏检,可能向动态提示注入初始噪声。
  • 实验与机制局限:可见光空间质量教师基于无参考评价算法 BRISQUE,虽然能衡量整体噪声和曝光失衡,但对于局部高频纹理退化(如局部严重模糊、微小运动伪影)的度量粒度依然偏全局化,未来可探索局部密集质量图先验。
  • 未来改进思路:可引入多尺度多退化类型的自监督质量评估器,并构建双向反馈闭环,使融合网络在训练中能够逆向微调教师先验提取头,实现师生联合自适应进化。

相关工作与启发

  • vs STDFusionNet / PIAFusion: 后者依赖硬编码的显著目标检测掩膜或光照分类损失强制约束网络,缺乏动态调节机制;本文将先验转化为动态可学习提示并在特征层做交互,消除了静态约束对背景高频细节的抑制。
  • vs SAGE (CVPR 2025) / CMFS (IJCAI 2025): 后两者依赖 SAM 或 CLIP 等外部大型基座模型提取高阶语义,存在严重的低层像素重构粒度失配;本文立足成像设备内在属性,提取轻量物理内生先验,兼顾了低推理开销与高保真像素重建。
  • vs TarDal (CVPR 2022) / SuperFusion (IJAS 2022): 后者通过联合下游检测任务做多任务交替优化,不可避免地产生多目标梯度冲突并牺牲背景视觉观感;本文保持图像融合为纯净的自监督优化主线,依靠高质量互补特征自发促进下游任务,两全其美。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出将内生多模态物理先验蒸馏为动态可学习提示,并结合解耦专家自校正,构思精巧。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 个权威基准、12 个 SOTA 基线、两项核心下游任务及严格的航拍 OOD 测试,证据扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,动机阐述直击领域痛点,实验设计完整且说服力强。
  • 价值: ⭐⭐⭐⭐⭐ 为多模态图像融合与多源感知领域提供了摆脱外在庞大模型与刚性硬惩罚的极佳技术范式。