跳转至

Video Can Teach PAN-Sharpening: PSF-Aware Cross-Domain Supervision

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/brachiohyup/ViPS
领域: 遥感
关键词: 全色锐化, 跨域监督, 点扩散函数, 视频先验, 遥感图像融合

一句话总结

提出解耦监督框架 ViPS,利用高帧率自然视频构建伪配对提供高频空间结构与推扫式微位移监督,并结合传感器特定的点扩散函数(PSF)库实现光学退化对齐,在无需高分辨率多光谱真值的前提下显著超越现有 SOTA 全色锐化方法。

研究背景与动机

全色锐化(PAN-Sharpening)是卫星遥感对地观测中的核心基础任务,旨在将高空间分辨率的全色图像(HRPAN)与低空间分辨率的多光谱图像(LRMS)进行几何融合,重建出兼具高空间分辨率和高光谱保真度的高分辨率多光谱图像(HRMS)。然而,受制于星载成像传感器的物理硬件约束,单一探测器无法在宽光谱和高空间分辨率之间同时取得高信噪比。当前绝大多数深度学习全色锐化网络都遵循 Wald 降采样协议,在合成退化的全色与多光谱图像对上进行端到端全监督训练。这种经典范式严重脱离了真实的在轨成像物理过程:真实卫星数据普遍存在跨传感器安装夹角、卫星平台抖动以及推扫式(pushbroom)时延引起的跨模态亚像素微失配,同时伴随着强烈的传感器光学系统退化(如各向异性点扩散函数与调制传递函数衰减)。在真实全分辨率测试时,合成训练的模型极易产生模糊的双边缘伪影、纹理走样以及显著的光谱畸变。

现有主流改进方案大多停留在网络架构层面的局部修补,例如引入边缘与梯度显式正则、设计跨模态对齐注意力机制或动态形变卷积以在特征层自适应对齐。然而,这些架构级策略依然受限在遥感数据内部监督的封闭假设中:全色波段的高频梯度与多光谱波段的真实辐亮度边缘并不完全共线,强行施加严格的空间对齐往往会引发光谱失真;更为关键的是,由于真实 HRMS 物理真值在客观上不可获取,单纯依赖遥感域内部的降采样监督无法获得高质量、大规模且兼具真实空间几何微位移的充足梯度信号。

本文另辟蹊径,跳出纯遥感数据驱动的框架,敏锐地指出高帧率自然视频序列在物理特性上是天然绝佳的「空间结构教师」——连续视频帧之间微小且平滑的平移相机运动,不仅保留了极致丰富的自然高频几何边缘与纹理,而且帧间微位移在统计学上能够精准模拟卫星推扫式成像过程中的行间时滞与微失配。核心 idea:提出 ViPS 跨域监督框架,将监督源显式解耦为来自自然视频的伪空间监督与来自真实卫星观测的光谱一致性监督,并借助传感器特定的点扩散函数(PSF)退化库实现跨域光学退化对齐,彻底摆脱对高分辨率多光谱真实标注的依赖。

方法详解

整体框架

ViPS 的整体架构围绕「视频传授空间结构、遥感观测约束光谱」的双分支解耦监督机制展开。给定一对卫星真实观测(HRPAN 图像 \(I_{pan}^h\) 与 LRMS 图像 \(I_{ms}^l\))以及自然视频中的连续帧序列 \((I_t, I_{t+a})\),模型同时在视频空间分支与遥感光谱分支中迭代训练。为了弥合自然相机与卫星传感器之间的光学系统物理差异,ViPS 引入了离线预构建的多传感器点扩散函数库(PSF Bank)。在每个训练迭代中,系统针对目标卫星传感器抽取特定的 PSF 退化核,并将该核同时作用于视频帧和真实卫星图像的退化采样过程,使得两个跨域分支在空间频率衰减特性上保持物理一致。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    subgraph S1["解耦跨域输入与空间微位移模拟"]
        direction TB
        A["自然视频帧对 (It, It+a)<br/>4K 1000 FPS 连续平移采样"]
        B["真实卫星观测 (HRPAN, LRMS)<br/>目标传感器 s"]
    end
    subgraph S2["PSF Bank 光学退化对齐"]
        direction TB
        C["传感器专用 PSF Bank<br/>均匀采样光学核 Ks ~ Bs"]
    end
    subgraph S3["伪配对构建与网络前向推理"]
        direction TB
        D["视频分支:伪全色与伪多光谱生成<br/>It灰度化 + 谱段投影与Ks退化"]
        E["遥感分支:LRMS自监督尺度退化<br/>Ks退化获得低分辨率配对"]
        F["轻量混合卷积-Transformer主干网络<br/>S2D变换 + Swin-T交互 + D2S重建"]
    end
    subgraph S4["解耦损失监督"]
        direction TB
        G["亮度梯度空间结构损失 Lspa<br/>约束伪高分辨率多光谱的几何边缘"]
        H["LRMS域光谱保真度损失 Lspe<br/>L1自监督约束遥感分支光谱一致性"]
    end

    A --> D
    B --> E
    C -->|一致光学模糊| D
    C -->|一致光学模糊| E
    D --> F
    E --> F
    F --> G
    F --> H

关键设计

1. 解耦跨域监督:视频空间先验与遥感光谱保真度解耦

传统全色锐化依赖 Wald 降采样构建监督,导致模型在面对真实未对齐的在轨全色与多光谱数据时无法处理微失配。ViPS 抛弃了使用单一数据源同时拟合空间和光谱的惯性思维,将监督信号解耦到两个互补域:空间信息由自然视频提供,光谱信息由真实遥感图像自身约束。视频分支选取 4K、1000 FPS 的高帧率相机拍摄的平移运动视频序列,设定时间间隔偏移量 \(a=10\) 抽取帧对 \((I_t, I_{t+a})\)。将 \(I_t\) 转化为灰度图像作为伪高分辨率全色输入 \(\bar{I}_{pan}^{h,p} = \text{Gray}(I_t)\),将带有平移位移的 \(I_{t+a}\) 经由传感器通道映射和退化算子生成伪低分辨率多光谱观测 \(I_{ms}^{l,p}\)。这种设计不仅提供了无尽的高频空间纹理,更自然复现了推扫式卫星传感器在不同探测谱段上的亚像素扫描微位移。与此同时,遥感分支直接输入真实的星载观测 \((I_{pan}^h, I_{ms}^l)\),在降低一个尺度的空间域上通过重建目标 \(I_{ms}^l\) 提供纯正的地面地物辐射光谱特征。两路分支在同一个全色锐化网络中交替优化,既教会了网络如何在微位移下锐化边缘,又避免了将自然视频中不相关的色彩统计特性引入遥感数据。

2. 物理驱动的 PSF Bank 光学退化对齐与随机核采样

直接将自然图像与遥感图像混合训练往往会因为光学成像机制的巨大域鸿沟而导致网络坍塌。真实卫星的光学镜头具有特定的调制传递函数(MTF)和各向异性点扩散函数(PSF),简单的双三次或高斯各向同性下采样完全无法表达实际成像中的频谱衰减。ViPS 为 WorldView-3、QuickBird 和 GaoFen-2 等主流商业卫星分别离线建立了包含 \(M_s = 10,000\) 个 \(16\times 16\) 尺寸核的物理 PSF 库 \(\mathcal{B}_s\)。在训练过程中,每次从目标传感器的 PSF 库中随机均匀采样一个核:

\[\mathcal{K}_s \sim \text{Unif}(\mathcal{B}_s)\]

该退化算子统一建模卷积与 \(r=4\) 倍下采样过程:

\[\mathcal{D}(\mathbf{I}; \mathcal{K}_s, r) = (\mathcal{K}_s * \mathbf{I}) \downarrow_r\]

在视频分支中,用该核对投影后的视频帧做退化生成伪多光谱图 \(I_{ms}^{l,p} = \mathcal{D}(\mathcal{P}_{C_s}(I_{t+a}); \mathcal{K}_s, r)\);在遥感分支中,同样用该核对真实全色和多光谱图像进行尺度退化:\(I_{pan}^l = \mathcal{D}(I_{pan}^h; \mathcal{K}_s, r)\) 与 \(I_{ms}^{vl} = \mathcal{D}(I_{ms}^l; \mathcal{K}_s, r)\)。这种跨域一致的光学核共享机制,使得自然视频分支学习到的空间去卷积与超分辨率先验,能够无缝迁移到卫星传感器特定的光学频率响应中,且随机核采样有效防止了网络对特定人工设定的退化核发生过拟合。

3. 弱化像元严格对齐的亮度梯度空间结构损失

视频帧对 \((I_t, I_{t+a})\) 之间存在客观的几何位移,且自然视频的通道投影并不具备真实卫星多光谱的物理辐射定标意义。如果直接计算伪高分辨率预测与原始视频帧之间的像素级 \(\mathcal{L}_1\) 重建损失,不仅会强行抹平位移模拟带来的鲁棒性,还会导致色彩畸变。为了精准提取纯粹的几何空间边缘结构并容忍微失配,ViPS 提出了亮度梯度一致性损失。网络对伪多光谱预测 \(\hat{I}_{ms}^{h,p}\) 先取通道平均映射到亮度空间 \(\bar{I}_{ms}^{h,p} = \text{Gray}(\hat{I}_{ms}^{h,p})\),随后仅对梯度算子 \(\nabla\) 提取的边缘模长施加 \(\mathcal{L}_1\) 约束:

\[\mathcal{L}_{spa} = \Big\| \, |\nabla \bar{\mathbf{I}}_{ms}^{h,p}| - |\nabla \bar{\mathbf{I}}_{pan}^{h,p}| \, \Big\|_1\]

该损失放弃了像元绝对强度的约束,转而强制预测的多光谱亮度边缘在几何走向、陡峭程度和结构分布上严格对齐全色图的梯度幅值。由于梯度模长具有局部的平移不变性,该损失赋予了网络在存在亚像素空间微错位时依然能够恢复锐利边界的容错能力。

4. 轻量混合卷积-Transformer 骨干网络与多尺度特征注入

为兼顾工业级大场景遥感影像的高吞吐推理要求与复杂的长程空间依赖建模,ViPS 设计了一个计算效率极高的混合架构。针对空间尺度相差 4 倍的全色图与低分辨率多光谱图,网络首先对全色图像 \(I_{pan}^h\) 应用无损的 Space-to-Depth(S2D)空间深度重排变换,将其空间分辨率下采样 4 倍并使通道数扩展 16 倍,直接与低分辨率多光谱图像 \(I_{ms}^l\) 在通道维度完成物理对齐拼接。拼接特征首先经过一个大感受野的 \(9\times 9\) 卷积捕获局域空间上下文,紧接着送入堆叠的 Swin Transformer Block(STB)计算局部移窗自注意力,高效融合跨谱段信息。特征在经历第二次 \(9\times 9\) 卷积与第二阶段 STB 的层级精炼后,经过 \(1\times 1\) 卷积降维,再通过 Depth-to-Space(D2S)像素重排算子还原至全色原始分辨率。最后,网络将原始全色图像与上采样特征直接进行残差拼接,通过三层连续的 \(1\times 1\) 卷积输出最终的 HRMS 结果。全过程大部分核心计算均在低分辨率尺度完成,整网在 \(256\times 256\) 输出尺寸下的计算量仅为 19.5 GFLOPs,单帧推理时间低至 0.003 秒。

损失函数 / 训练策略

ViPS 的总优化目标由视频分支的空间结构损失与遥感分支的光谱保真度损失加权组成:

\[\mathcal{L}_{total} = \lambda_{spa} \mathcal{L}_{spa} + \lambda_{spe} \mathcal{L}_{spe}\]

其中遥感分支的光谱损失定义在以真实观察 \(I_{ms}^l\) 为真值的降采样尺度上:

\[\mathcal{L}_{spe} = \Big\| f_\theta(\mathbf{I}_{pan}^l, \mathbf{I}_{ms}^{vl}) - \mathbf{I}_{ms}^l \Big\|_1\]

超参数固定设置为 \(\lambda_{spa} = 10\),\(\lambda_{spe} = 1\)。训练采用 AdamW 优化器,学习率为 \(1\times 10^{-4}\),权重衰减为 0.01。训练过程中严格以 1:1 的交替比例轮流送入遥感 mini-batch 和视频 mini-batch,并在单个 NVIDIA RTX 4090 GPU 上迭代训练 \(10^5\) 步。

实验关键数据

主实验

论文在 PAN-Collection 标准基准上,对 WorldView-3(8 波段)、GaoFen-2(4 波段)和 QuickBird(4 波段)三个不同卫星传感器开展了全分辨率(Full-Resolution, FR)与降分辨率(Reduced-Resolution, RR)两套严谨评测。下表展示了 WorldView-3 上的量化对比(FR 评测指标为高质量无参考指标 HQNR 以及空间畸变 \(D_s\)、光谱畸变 \(D_\lambda\);RR 评测采用 ERGAS、SCC、SAM、Q 指数、PSNR 和 SSIM,并统计了在 \(256\times 256\) 尺寸下的推理时间与 FLOPs)。

方法 出处 FR: HQNR↑ FR: \(D_s\)↓ FR: \(D_\lambda\)↓ RR: ERGAS↓ RR: SAM↓ RR: PSNR↑ RR: SSIM↑ 推理时间(s)↓ FLOPs(G)↓
PanNet ICCV 2017 0.918 0.049 0.035 2.538 3.402 36.148 0.966 0.001 5.17
MSDCNN JSTARS 2018 0.924 0.050 0.028 2.489 3.300 36.329 0.967 0.002 14.96
FusionNet ICCV 2021 0.920 0.053 0.029 2.428 3.188 36.569 0.968 0.002 5.13
LAGConv AAAI 2022 0.915 0.055 0.033 2.380 3.153 36.732 0.970 0.004 8.43
S2DBPN TGRS 2023 0.946 0.030 0.025 2.245 3.019 37.216 0.972 0.005 158.94
PanDiff TGRS 2023 0.952 0.034 0.014 2.276 3.058 37.029 0.971 2.955 62.07
DCPNet TGRS 2024 0.923 0.036 0.043 2.301 3.083 37.009 0.972 0.109 105.40
TMDiff TGRS 2024 0.924 0.059 0.018 2.151 2.885 37.477 0.973 9.997 1284.42
CANConv CVPR 2024 0.951 0.030 0.020 2.163 2.927 37.441 0.973 0.451 52.21
U-Know CVPR 2025 0.955 0.029 0.016 2.046 2.797 37.934 0.976 - -
PAN-Crafter ICCV 2025 0.958 0.027 0.016 2.040 2.787 37.956 0.976 0.009 79.03
ViPS (Ours) ECCV 2026 0.959 0.026 0.016 2.021 2.770 38.021 0.978 0.003 19.50

在 GaoFen-2 和 QuickBird 数据集上,ViPS 同样取得了最优表现:在 GaoFen-2 上,ViPS 的 FR-HQNR 达到 0.976(次优 PAN-Crafter 为 0.964),RR-PSNR 达到 45.122 dB;在 QuickBird 上,ViPS 的 FR-HQNR 达到 0.932(次优 U-Know 为 0.931),RR-PSNR 达到 38.451 dB。

消融实验

为验证核心组件的有效性与架构通用性,作者在 WorldView-3 上进行了组件剥离实验以及在经典基线 PanNet 上的迁移验证:

变体配置 视频空间监督 \(\mathcal{L}_{spa}\) PSF-Bank 退化一致性 随机核采样 FR: HQNR↑ FR: \(D_s\)↓ FR: \(D_\lambda\)↓ RR: ERGAS↓ RR: SAM↓ RR: PSNR↑
(A) 仅遥感分支 (RS-only) ✗ ✓ ✓ 0.949 0.036 0.015 2.420 2.992 37.118
(B) 移除 PSF-Bank 退化 ✓ ✗ ✗ 0.956 0.028 0.016 2.235 2.892 37.277
(C) 固定核 (无随机采样) ✓ ✓ ✗ 0.948 0.029 0.023 2.213 3.190 37.613
(D) ViPS 完整模型 ✓ ✓ ✓ 0.959 0.026 0.016 2.020 2.770 38.021
PanNet 基准模型 - - - 0.918 0.049 0.035 2.538 3.402 36.148
PanNet + ViPS 监督范式 ✓ ✓ ✓ 0.954 0.028 0.018 2.217 2.814 37.229

此外,针对视频帧对构建中的时间间隔 \(a\) 的灵敏度分析表明:当 \(a=1\) 时(位移过小)PSNR 为 37.359 dB;\(a=5\) 时为 37.808 dB;\(a=10\) 时取得最佳性能 38.021 dB;而当 \(a=20\) 时由于帧间位移过大导致几何对齐假定破损,PSNR 骤降至 37.013 dB。因此最终选定 \(a=10\) 作为黄金超参。

关键发现

  • 跨域解耦训练带来显著空间重构增益:对比变体 (A) 与完整模型 (D),引入视频空间监督后,FR 评测的空间畸变指标 \(D_s\) 从 0.036 锐降至 0.026,RR-PSNR 提升了近 0.9 dB。这证实了自然视频中高频纹理与微平移位移能极为有效地弥补卫星端缺少 HR 标注的缺陷。
  • 物理退化对齐是跨域迁移的核心防线:若抛弃 PSF-Bank(变体 B)或使用固定核(变体 C),模型的光谱畸变 \(D_\lambda\) 和 SAM 明显劣化(固定核时 SAM 从 2.770 劣化至 3.190)。说明只有通过物理一致的 PSF 退化,视频域的超分辨率恢复经验才能稳健地泛化到星载多光谱成像。
  • 即插即用的监督范式普适性:当把 ViPS 监督框架直接应用在极其经典的 2017 年 CNN 基准 PanNet 上时,PanNet 的 HQNR 从 0.918 暴增到 0.954,PSNR 从 36.148 dB 提升至 37.229 dB,不仅全方位超越了后续诸多复杂的架构设计,甚至逼近了近年 SOTA 表现。这充分论证了「全色锐化的瓶颈更在于监督范式而非堆叠网络深度」。

亮点与洞察

  • 范式颠覆:用地面视频解决卫星遥感痛点:通常遥感研究聚焦于内部自洽或利用航拍图像,而本文巧妙指出高帧率相机平移扫描时的物理投影与卫星推扫式相机在时间延迟和微位移机制上的深层同构性,为遥感高质量超分提供了近乎无限且高分辨率的数据源泉。
  • 物理先验弥合域鸿沟的优雅范式:跨域训练最忌讳域偏移导致伪影。ViPS 没有盲目使用复杂的对抗损失或域自适应模块,而是直接切中要害——使用传感器专属的 16×16 点扩散函数核同时约束双域下采样,以极简的物理约束打通了数据迁移的通道。
  • 极佳的精度-速度性价比:与当前动辄依赖多步扩散迭代(如 TMDiff 推理耗时 10 秒、1284 GFLOPs)的模型相比,ViPS 凭借高效的 S2D/D2S 混合架构与 Swin-T,将推理耗时压缩在 3 毫秒以内(19.5 GFLOPs),完全满足星上实时处理或大规模地面站批量锐化的工业部署需求。

局限与展望

  • 推扫式成像假设的理想化局限:自然视频采集时限定为平移运动且场景相对静态,而真实遥感场景中可能包含高速移动的目标(如行驶的车辆、海浪)、强烈的高程差引起的局部视差扭曲以及卫星姿态滚转(roll/pitch/yaw),现有视频配对无法完全模拟非刚性大视差情况。
  • 光谱维度的通道映射较为朴素:视频分支中通过固定通道映射矩阵 \(\mathcal{P}_{C_s}(\cdot)\) 匹配卫星 4 波段或 8 波段,该操作未考虑植被红边、近红外等特定遥感谱段的地物反射光谱响应曲线(SRF),光谱维度的交叉监督仍完全寄托在遥感降采样分支上。
  • 未来方向:探索引入非刚性光流变换与合成视差建模更复杂的地形起伏微错位,结合高光谱视频或物理辐射定标模型使视频伪观测更贴近真实物理光谱特性。

相关工作与启发

  • vs Wald 降采样经典协议 (Wald et al., 2000): 传统方法在合成降采样对上训练,测试时面临跨传感器微位移和真实退化失配引起的严重双边缘走样;ViPS 打破了 Wald 闭环,通过高帧率视频微位移与真实遥感观测解耦监督,真正解决全分辨率下的在轨退化问题。
  • vs PAN-Crafter (ICCV 2025) & U-Know (CVPR 2025): PAN-Crafter 和 U-Know 致力于通过注意力机制对齐或不确定性蒸馏扩散模型进行补偿,推理代价昂贵且依旧受限于遥感自身数据分布;ViPS 表明改换监督范式可以让轻量网络取得优于重型架构的性能。
  • vs Spatial Data Augmentation (Chen et al., TGRS 2023): Chen 等人首次系统化构建了 PSF 退化数据增强,但局限在遥感数据内部的退化鲁棒性提升;ViPS 将 PSF-Bank 升华为跨域桥梁,成功驾驭了跨自然视频与卫星图像的端到端学习。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次提出利用高帧率自然视频作为全色锐化的空间微位移教师,构想极具创新性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在三个主流卫星传感器、全分辨率与降分辨率双协议下全面评测,消融与跨骨干验证极其扎实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,物理图景与退化建模清晰透彻]
  • 价值: ⭐⭐⭐⭐⭐ [彻底打破遥感高分辨率标注匮乏的桎梏,推理速度极快,工业应用潜力巨大]