Freqformer: Image-Demoiréing Transformer via Effective Frequency Decomposition¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/xyLiu339/Freqformer
领域: 图像恢复
关键词: 图像去摩尔纹、频域分解、Transformer、空间感知通道注意力、色彩校正
一句话总结¶
Freqformer 提出平滑抗混叠的频域分解机制,将图像解耦为局部高频纹理与尺度鲁棒的低频色彩畸变,结合非对称裁剪/缩放双分支与可学习频域合成变换(FCT),以仅 6.065M 参数在多项高清去摩尔纹基准上刷新 SOTA。
研究背景与动机¶
使用数码相机拍摄电子屏幕时,屏幕显示像素阵列与相机色彩滤波阵列(CFA)之间的空间混叠极易引发严重的摩尔纹伪影。这类伪影通常表现为高频波浪纹理与大范围不规则色斑的复杂交织,严重损害图像的视觉质感与后续视觉任务的可靠性。早期深度学习方法普遍将去摩尔纹视为端到端的全局图像映射任务,但由于摩尔纹纹理常与真实图像的高频边缘混淆,且色斑与自然场景颜色高度纠缠,直接的端到端网络往往顾此失彼,要么过度平滑丢失真实细节,要么残留顽固色偏。
为了实现纹理与色彩的有效解耦,近期研究尝试引入 Haar 小波变换或分块离散余弦变换(DCT)等频域工具。然而,传统离散正交变换应用于非平稳的自然图像时暴露出多重固有缺陷:其一,多级小波下采样具有时移变性,激进的空间降维极易引发二次混叠,且不同子带特征在空间上高度离散、缺乏平滑性;其二,分块 DCT 强行假定局部信号平稳,面对跨越全局的弯曲摩尔纹纹理容易产生分块边界伪影;其三,小波将特征分散至多个独立方向子带,DCT 甚至产生多达 64 个通道,导致网络通道冗余与计算开销急剧膨胀;其四,传统方法普遍依赖固定且不可微的数学逆变换,两频段各自产生的微小恢复误差在逆合成阶段被无差别叠加放大,诱发严重的像素级结构畸变。
深入剖析摩尔纹的物理分布可以发现,图像退化呈现出清晰的频域分工:摩尔纹纹理主要富集于高频段,展现出极强的空间局部性而几乎不包含宏观色彩信息;低频段则几乎不包含细碎条纹,主要承载大范围的色彩畸变,且展现出极高的尺度鲁棒性(将低频图像下采样至 0.1 倍再插值恢复仍能保留近 50 dB 的保真度,而高频图像仅有约 25 dB)。核心 idea:通过抗混叠平滑卷积递归解耦高频局部纹理与低频鲁棒色彩,采用高频裁剪与低频大幅缩放的非对称双分支架构配合空间感知通道注意力(SA-CA),并以特征级可学习频域合成变换(FCT)取代固定逆变换,实现紧凑高效的超高清图像去摩尔纹。
方法详解¶
整体框架¶
Freqformer 采用两阶段解耦与合成架构。输入含有摩尔纹的图像 \(I_m\),首先通过多级抗混叠卷积分解模块,在完全保留原始空间分辨率的前提下分离出高频纹理分量 \(I_h\) 与低频色彩分量 \(I_l\)。高频分支专注于去除局部复杂纹理,在训练时采用随机高分辨率裁剪策略;低频分支专注于校正宏观色偏,在训练与推理全程均采用大比例缩放策略以聚合全局色彩信息。双分支均采用以空间感知通道注意力(SA-CA)为核心单元的编码器-解码器架构,高频解码器辅以多尺度分层特征融合。最后,将低频特征双线性上采样至与高频对齐后送入可学习频域合成变换(FCT)模块,通过自适应特征交互完成全分辨率图像的高保真重建。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入摩尔纹图像 $I_m$"] --> B["多级平滑频域分解<br/>递归空洞卷积抗混叠解耦"]
B -->|高频分量 $I_h$(局部纹理)| C["非对称双分支学习策略<br/>高频分支:全尺寸/裁剪训练"]
B -->|低频分量 $I_l$(全局色彩)| D["非对称双分支学习策略<br/>低频分支:紧凑缩放训练"]
C & D --> E["空间感知通道注意力与分层融合<br/>RDDB大感受野 + SCP通道注意力 + 门控FFN"]
E --> F["可学习频域合成变换(FCT)<br/>双分支特征自适应交互 + PostFusion"]
F --> G["重建高保真清晰图像 $\hat{I}$"]
关键设计¶
1. 多级平滑频域分解:递归抗混叠卷积解耦纹理与色彩 传统小波下采样与分块 DCT 的离散表征严重缺乏空间连续性,且易因降采样引入不可逆的相位敏感混叠与块效应。本文摒弃正交基投影,构建了一种保留空间平滑性与移不变性的多级平滑分解机制。给定输入图像 \(I_m\),利用空洞卷积核进行 \(L\) 级递归低通滤波,第 \(i\) 级的分解定义为: $\(I^i_l = \text{Conv}(I^{i-1}_l, k), \quad I^i_h = I^{i-1}_h + I^{i-1}_l - I^i_l = I^0_l - I^i_l\)$ 其中初始输入 \(I^0_l = I_m\),\(I^0_h = 0\),卷积操作采用膨胀率为 \(2^i\) 的扩张卷积以逐级指数级扩大平滑感受野。经过 \(L\) 级分解后,输出满足 \(I_m = I_l + I_h\)(其中 \(I_l = I^L_l\),\(I_h = I^L_h\))。该过程完全避免了降采样操作,保证高频 \(I_h\) 与低频 \(I_l\) 在空间分辨率上与原始图像严格一致。高频分量纯净提炼出高动态变化的局部摩尔干涉条纹,而低频分量滤除高频振荡,平滑捕获整体色彩走势与光照色偏,为后续针对性恢复奠定严密物理基础。
2. 非对称双分支学习策略:高频裁剪与低频缩放定制处理 超高清(4K)图像直接输入 Transformer 网络面临显存与算力瓶颈,而全局下采样又会直接破坏细密的高频摩尔纹与文字边缘。通过量化实验验证,高频分量 \(I_h\) 经下采样后重建的 PSNR 仅为约 25 dB,表明其包含极其敏感的局部相位与结构信息;相对地,低频分量 \(I_l\) 经下采样至 0.1 倍分辨率再插值恢复,PSNR 仍高达约 50 dB,展现出极其优异的尺度鲁棒性。基于此物理差异,模型制定了非对称训练与推理策略: - 高频分支:仅承载纹理结构而几乎不含绝对色彩,依赖局部上下文即可准确识别并消除条纹。因此训练阶段采用局部随机裁剪策略(如 \(512\times 512\) 或 \(768\times 768\)),测试阶段直接滑窗或全分辨率前向处理。 - 低频分支:退化主要表现为大范围色彩漂移(源自摄影环境光照差异及摩尔纹调制的色偏差)。将低频图像大幅缩放到极小尺寸(例如 \(256\times 256\) 或 \(512\times 512\)),使原本分散在全图的漫反射式色偏差高度集中在小块无纹理区域,极大简化了色彩校正难度。更重要的是,低频分支在训练与测试时始终维持完全相同的紧凑尺寸,彻底规避了变分辨率输入导致的尺度泛化失真。
3. 空间感知通道注意力与分层融合:大感受野与跨通道互补建模 摩尔纹在不同色彩通道上的破坏程度存在显著差异(例如绿色通道对摩尔纹干扰具备较强鲁棒性),促使网络通过通道注意力挖掘互补通道先验。然而纯通道自注意力无法感知邻域波纹相位,必须融合局部空间上下文才能准确识别周期性波动。为此,每个编码器与解码器块均引入空间感知通道注意力(SA-CA)模块,包含三项核心机制: - 残差空洞密集块(RDDB):特征输入注意力之前先经过 RDDB,以密集跨层连接和空洞卷积建立宽广的空间感受野,快速捕获大尺度波纹的空间延展结构。 - 空间-通道投影(SCP)与通道自注意力:在生成注意力查询 \(Q\)、键 \(K\)、值 \(V\) 时,先通过 \(1\times 1\) 卷积执行通道模式投影,再接 \(3\times 3\) 深度可分离卷积聚合邻近像素的空间依赖,随后重排为 \(Q' \in \mathbb{R}^{c \times hw}, K' \in \mathbb{R}^{hw \times c}, V' \in \mathbb{R}^{c \times hw}\),在通道维度执行多头自注意力计算。 - 门控前馈网络(GFFN):传统 FFN 难以处理空间-通道交织的非平稳噪声,GFFN 同样借助 SCP 提取双路特征,并通过非线性门控打分进行逐元素乘法过滤,动态抑制不合理的频域假频响应。 - 高频解码器分层融合:高频解码器中,底层解码块输出的浅层净化特征 \(\hat{F}_3\) 与中间层特征 \(\hat{F}_2\) 逐级通过跳跃连接拼接到更高层解码块的中间层(\(N/2\) 层)之后,为高层重构提供细粒度纹理指引,显著增强了多样化波纹形态的恢复鲁棒性。
4. 可学习频域合成变换(FCT):自适应特征融合消除累积伪影 传统小波或 DCT 方法均使用固定的数学反变换公式将分离子带逆变换相加。然而,双分支分别独立修复过程中,由于网络在边缘处可能产生的空间相位误差或亮度微小偏移,直接像素级相加(\(\hat{I} = \hat{I}_l + \hat{I}_h\))会导致误差在重叠区域形成强化干涉,产生可见的光晕与结构模糊。为此,Freqformer 在特征维度设计了可学习的 FCT 模块。记高频分支最终输出前的特征为 \(\hat{F}_h\),将缩放后的低频特征 \(\hat{F}_l\) 双线性插值上采样至与高频裁剪区域严格对齐后的特征记为 \(\hat{F}'_l\)。FCT 模块首先执行自适应通道投影相加: $\(F = \text{Conv}(\hat{F}'_l) + \text{Conv}(\hat{F}_h)\)$ 该相加操作在数学上等价于通道拼接后接卷积,但参数量更加轻量。随后,融合特征 \(F\) 送入由 \(N_f\) 层 Transformer 组成的 PostFusion 模块,在深层隐空间对色彩与纹理边界进行自适应平滑微调与跨频段交互,最后经 \(3\times 3\) 卷积与 PixelShuffle 上采样直接重建出无伪影的高保真清晰图像 \(\hat{I}\)。
损失函数 / 训练策略¶
训练过程分为解耦预训练与联合微调两个阶段: - 第一阶段(分支独立预训练):高频分支与低频分支分别在裁剪与缩放策略下独立优化。为了加速收敛并强化中间层特征表达,采用深度监督策略,对解码器各阶段输出与对应真值高/低频分量计算 \(L_1\) 损失与基于预训练 VGG16 网络的感知损失 \(L_p\): $\(L_{\text{stage}_1} = \sum_{i=1}^3 \left( L_1(\hat{I}_i, I^{GT}_i) + L_p(\hat{I}_i, I^{GT}_i) \right)\)$ - 第二阶段(端到端联合微调):冻结初始权重后,联合优化双分支与可学习 FCT 模块。损失函数对最终全分辨率重建图像 \(\hat{I}\) 与真实清晰图像 \(I^{GT}\) 施加监督: $\(L_{\text{stage}_2} = L_1(\hat{I}, I^{GT}) + \lambda_2 L_p(\hat{I}, I^{GT})\)$ 其中感知损失权重设为 \(\lambda_2 = 0.1\)。训练采用 Adam 优化器与周期性余弦退火学习率调度,两阶段各训练 150 个 epoch。
实验关键数据¶
主实验¶
在主流去摩尔纹公开基准 TIP2018、LCDMoire、FHDMi(1080P)以及超高清 UHDM(4K)上,Freqformer 与一众专用去摩尔纹 SOTA 模型及通用图像恢复大模型进行了全面对比。
| 数据集 | 评估指标 | 输入未处理 | MBCNN [53] | FHDe2Net [10] | ESDNet [45] | ESDNet-L [45] | Freqformer (本文) |
|---|---|---|---|---|---|---|---|
| TIP2018 [31] | PSNR ↑ SSIM ↑ |
20.30 0.7380 |
30.03 0.8960 |
27.78 0.8950 |
29.81 0.9160 |
30.11 0.9200 |
30.63 (+0.52) 0.9269 (+0.0069) |
| LCDMoire [53] | PSNR ↑ SSIM ↑ |
10.44 0.5717 |
44.04 0.9948 |
41.40 N/A |
44.83 0.9963 |
45.34 0.9966 |
45.62 (+0.28) 0.9967 (+0.0001) |
| FHDMi [10] | PSNR ↑ SSIM ↑ LPIPS ↓ |
17.97 0.7033 0.2837 |
22.31 0.8095 0.1980 |
22.93 0.7885 0.1688 |
24.50 0.8351 0.1354 |
24.88 0.8440 0.1301 |
25.26 (+0.38) 0.8518 (+0.0078) 0.1253 (-0.0048) |
| UHDM (4K) [45] | PSNR ↑ SSIM ↑ LPIPS ↓ |
17.12 0.5089 0.5314 |
21.41 0.7932 0.3318 |
20.34 0.7496 0.3519 |
22.12 0.7956 0.2551 |
22.42 0.7985 0.2454 |
22.24 (-0.18) 0.8021 (+0.0036) 0.2424 (-0.0030) |
| 模型参数量 (M) | - | - | 14.192M | 13.571M | 5.934M | 10.623M | 6.065M |
在通用恢复模型对比中,Freqformer 同样显著超越了具有 28.785M 参数的 AdaIR(FHDMi 上 21.87 dB)和 11.478M 参数的 MoCE-IR(21.80 dB),展现出专用频域解耦架构对于复杂非平稳条纹干扰的碾压性优势。
消融实验¶
1. 频域分解方法对比(FHDMi 数据集) 验证平滑抗混叠递归分解相较于经典 Haar 离散小波(DWT)及分块 DCT 的有效性。
| 分解方案 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 参数量 (M) | 核心现象 |
|---|---|---|---|---|---|
| Freqformer (平滑递归分解) | 25.26 | 0.8518 | 0.1253 | 6.065M | 纹理边缘锐利,无块伪影与残余条纹 |
| Freqformer w/ 2级 Haar DWT [18,24] | 23.01 | 0.8036 | 0.1810 | 10.921M | 文字边缘产生剧烈锯齿与模糊,条纹残留 |
| Freqformer w/ Block DCT [10,53] | 23.22 | 0.8073 | 0.1569 | 12.715M | 引入分块边界伪影,大范围弯曲纹理难以消除 |
2. 低频分支训练策略对比(低频单分支性能)
| 低频分支配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 参数量 (M) | 说明 |
|---|---|---|---|---|---|
| Freqformer (低频) w/ 局部裁剪 (crop) | 23.13 | 0.9220 | 0.0695 | 2.695M | 缺乏全图色彩参照,色偏矫正严重受限 |
| Freqformer (低频) w/ 裁剪分块平铺 (crop & tile) | 25.90 | 0.9363 | 0.0486 | 2.695M | 拼接交界处色彩过渡不连贯 |
| Freqformer (低频) w/ 缩放 (resize) | 29.90 | 0.9568 | 0.0291 | 2.695M | 全局色彩信息紧凑汇聚,性能暴涨 6.77 dB |
3. 频域分解与可学习 FCT 消融对比
| 模型架构配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 参数量 (M) |
|---|---|---|---|---|
| Freqformer-L (无频域分解,端到端单分支) | 23.92 | 0.8409 | 0.1284 | 5.851M |
| Freqformer w/ 固定数学逆合成 (Fixed FCT) | 25.13 | 0.8478 | 0.1298 | 5.876M |
| Freqformer w/ 可学习特征合成 (Learnable FCT) | 25.26 | 0.8518 | 0.1253 | 6.065M |
| ESDNet-L 基线 (无频域分解) | 24.88 | 0.8440 | 0.1301 | 10.623M |
| ESDNet w/ 可学习 FCT (增加频域双分支) | 25.20 | 0.8511 | 0.1244 | 12.567M |
关键发现¶
- 平滑递归分解是性能基石:相较于 Haar 小波与分块 DCT,所提平滑分解在抑制二次混叠与块效应的同时,为模型节省了约 50% 的多子带冗余参数,并在 PSNR 上领先 2.0 dB 以上。
- 低频分支缩放策略带来巨大收益:低频分量经下采样后能保留约 50 dB 的无损级色彩保真度,缩放处理使网络能以全局视野纠正大范围色偏,直接带来单分支近 6.8 dB 的性能提升。
- 可学习 FCT 消除误差干涉:将传统的直接相加升级为特征空间的自适应变换(仅增加 0.189M 参数),不仅缓解了两分支各自的相位重构误差,还消除了接缝光晕伪影。
亮点与洞察¶
- 物理先验驱动的非对称计算分配:敏锐抓住“高频重局部纹理、低频重全局色彩”的本质差异,让高频专注局部小 patch 训练、低频专注微缩全图训练,在以 6.065M 小模型超越数倍大模型的同时,天然适配超高清 4K 分辨率处理。
- 频域可学习逆变换的泛化设计:打破传统频域网络把逆变换视作固化数学算子的思维定势,在特征空间进行平滑可学习重构,该思路可直接推广至去雾、图像去雨、去噪等具有频率解耦特性的底层视觉任务。
- 空间-通道双重约束的轻量注意力:利用绿色通道抗摩尔先验设计通道注意力,再以 RDDB 结合深度可分离卷积补全波动相位所需的邻域空间感知,在计算效率与特征表达力之间取得了极佳平衡。
局限与展望¶
- 注意力算子硬件执行延迟较高:处理 4K 分辨率图像时,尽管 Freqformer 理论计算量仅为 2.46 TFLOPS(显著低于 ESDNet-L 的 3.68T),但实测推理速度为 0.58 秒/张,慢于全卷积网络 ESDNet-L(0.25 秒/张)。这主要由于标准注意力机制在底层算子融合与 GPU 调度上未针对边缘端专用硬件深度优化,未来可通过 FlashAttention 或重参数化卷积加速。
- 动态视频去摩尔纹的时序一致性未覆盖:模型目前聚焦于单张图像去摩尔纹,而连续视频拍摄中相机位移会导致摩尔纹高频相位剧烈波动,直接逐帧应用可能引入时序闪烁。
- 极端几何变形下的泛化性:针对极端曲面屏或近距离大倾角拍摄引起的强非线性曲率条纹,固定的空洞卷积膨胀率可能难以完全匹配局部剧烈变化的频率周期。
相关工作与启发¶
- vs WDNet [18] & MBWDN [42]: 早期小波去摩尔纹网络直接串联方向子带或堆叠多级复杂分支,存在子带通道冗余、下采样混叠与巨大参数开销。本文通过平滑无下采样分解避免混叠,并采用针对性非对称双分支,参数量减半且指标显著领先。
- vs MBCNN [53] & FHDe2Net [10]: 传统 DCT 方法受限于局部滑窗感受野,容易打碎连续弯曲波纹并产生块效应。Freqformer 通过 RDDB 与空间感知通道注意力捕获全局周期波纹,并用可学习 FCT 代替固定的 IDCT 反变换,彻底消除块边界痕迹。
- vs ESDNet [45]: ESDNet 作为轻量超高清去摩尔纹经典方案,在单分支端到端架构下仍难以彻底根除大面积色斑与顽固细纹。Freqformer 通过将频域先验与轻量 Transformer 相结合,在参数量减小约 40% 的情况下实现了更高的去纹纯净度与色彩真实感。
评分¶
- 新颖性: ⭐⭐⭐⭐ [结合摩尔纹退化物理特性的非对称频域分解与可学习 FCT 设计精巧明晰]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖四大经典与超高清基准,详尽消融涵盖算子、策略、分解方式与效率]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑严密,图表清晰,实验论证扎实有力]
- 价值: ⭐⭐⭐⭐ [为超高清图像恢复中的频域解耦与跨尺度计算分配提供了实用范例]