ReAL: Reference-to-Image (R2I) Aware Latent Diffusion for Image Super-Resolution¶
会议: ECCV 2026
论文: ECCV 2026
领域: 图像生成
关键词: 参考图像超分辨率, 检索增强生成, 潜在扩散模型, 神经哈希, 键值缓存融合
一句话总结¶
ReAL 摒弃了超分辨率对文本到图像(T2I)先验与无分类器引导(CFG)的过度依赖,构建纯参考图像引导(R2I)的潜在扩散架构,通过神经哈希检索结合单次编码的自注意力键值缓存融合,在大幅降低推理延迟与显存开销的同时彻底抑制语义漂移与幻觉。
研究背景与动机¶
在真实场景图像超分辨率(Real-ISR)任务中,输入低分辨率(LR)图像往往遭受未知且高度复杂的物理退化,高频纹理严重丢失,反演过程呈现极强的病态性。早期基于生成对抗网络(GAN)的方法虽能生成锐利边缘,但极易引入结构畸变与虚假伪影。近期,基于潜在扩散模型(LDM)的大规模文本到图像(T2I)生成先验被广泛引入超分辨率重建中,依托视觉语言模型(VLM)自动提取文本提示并驱动去噪过程。然而,由于极低分辨率观测下的似然约束极度宽泛,生成先验极易反客为主,导致去噪轨迹严重受制于抽象的文本语义,在细微文本标牌、衣物纹理或叶片等微结构处产生荒谬的语义漂移与内容幻觉(例如将树叶斑块错误还原为人脸)。
参考图像超分辨率(RefSR)尝试借助高分辨率参考图像(Ref)提供高频纹理证据,近期结合检索增强生成(RAG)的扩散模型如 CoSeR 和 iRAG 虽引入了参考图像,但本质上依然冻结并复用通用的 T2I 主干网络,仅通过文本特征映射或高层语义适配层间接注入参考信息。这种间接语义耦合不仅冲淡了真实的视觉纹理指导,还继承了 T2I 模型对无分类器引导(CFG)的双倍前向评估开销,导致推理效率极度低下且无法根除生成幻觉。
本文的切入角度是打破以文本为主导的生成范式,构建一个完全摆脱文本提示、直接由“低质观测 + 视觉参考”双重视觉蓝图驱动的纯参考到图像(R2I)扩散框架。核心 idea:剔除所有文本先验与无分类器引导,将参考图像经由单次前向编码为自注意力键值缓存,在去噪各步直接无缝拼接到以低分辨率为锚点的自注意力层中,以极低计算开销实现像素级高频纹理迁移与无门控的自然语义抗漂移。
方法详解¶
整体框架¶
ReAL 的整体流程旨在从后验分布 \(p_\phi(I_{\text{SR}} \mid I_{\text{LR}}, I_{\text{ref}})\) 中采样,由神经哈希跨模态检索、单次前向特征缓存与自注意力键值融合去噪三大模块协同构成。输入低分辨率图像首先通过紧凑的二值哈希映射在外部参考库中迅速检索出语义最为接近的高分辨率参考图;随后参考图仅前向通过一次 U-Net,将其所有自注意力层的 Key 和 Value 张量压入显存缓存;在多步迭代去噪过程中,低分辨率隐变量作为通道拼接锚点维持全局结构,而 U-Net 的自注意力层直接读取缓存的参考键值完成细粒度纹理迁移。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入低分辨率图像 $I_{LR}$"] --> B["神经哈希跨模态检索<br/>InfoNCE 对比学习生成二进制哈希码"]
B --> C["外部参考数据库检索<br/>最近邻匹配获取最佳高质参考图 $I_{ref}$"]
C --> D["单次前向键值特征缓存<br/>参考图单次前向提取 $K_{ref}, V_{ref}$ 并缓存"]
D --> E["自注意力键值无缝拼接融合<br/>LR 查询锚定与参考键值按 Token 维拼接"]
A -->|VAE 编码 $z_{LR}$ 拼接| E
E --> F["CFG-Free 纯 R2I 扩散去噪<br/>单步前向迭代消除噪声"]
F --> G["高质量超分输出 $I_{SR}$"]
关键设计¶
1. 神经哈希跨模态检索:毫秒级度量空间内的最近邻参考匹配 传统基于高维深度特征(如 VGG 密集特征)的全局匹配算法检索耗时巨大,难以支撑海量参考库的实时扩展。ReAL 采用监督对比学习驱动的二值神经哈希模块,通过固定 VGG 特征提取器结合轻量化可学习哈希头,将图像映射至紧凑的汉明空间。训练阶段为每张图像构建增强视图并采用 InfoNCE 目标函数对齐正样本对:
在推理时,低分辨率查询只需映射为紧凑二值码,通过极其高效的汉明距离即可在外部数据库中快速选出与当前退化区域相关性最高的正向高分辨率样本。相比传统 VGG 全局密集匹配所需的 3830 ms,哈希检索仅需 62 ms,使参考检索开销降至可忽略不计。
2. 单次前向键值特征缓存:解耦去噪循环的轻量化表征提取 在以往扩散参考超分模型中,若每一步扩散反向去噪都重复处理参考图像,将带来数百次昂贵的前向传播开销。ReAL 设计了类似 CacheKV 的特征缓存机制(RFM),在反向去噪迭代启动前,仅将高分辨率参考图 \(I_{\text{ref}}\) 传入 U-Net 骨干网络执行一次前向计算。在这一单次前向过程中,网络将全部自注意力层所计算得到的键(Key)张量 \(K_{\text{ref}}\) 和值(Value)张量 \(V_{\text{ref}}\) 抽取并固化存储于注意力缓存区中。由于参考图不随去噪时间步 \(t\) 添加噪声,其高频结构在所有时步始终保持恒定,从而一次性为后续全部去噪步提供了即插即用的无损高频特征源。
3. 自注意力键值无缝拼接融合:保留低质查询锚点的无门控先验迁移 在反向扩散迭代中,主干网络处理由低分辨率特征 \(z_{\text{LR}} = \mathcal{E}(I_{\text{LR}})\) 与噪声隐变量 \(z_t\) 通道拼接构成的输入。计算自注意力时,网络生成主路径查询 \(Q_{\text{main}}\)、键 \(K_{\text{main}}\) 与值 \(V_{\text{main}}\)。ReAL 将参考缓存张量沿 Token 维度与主路径张量直接拼接:
注意力计算则严格执行 \(\text{Attention}(Q_{\text{main}}, K_{\text{fused}}, V_{\text{fused}})\)。这一机制的关键在于参考特征仅注入到键与值端,而查询矩阵 \(Q_{\text{main}}\) 始终源自低分辨率退化输入。这样既牢牢锁定了超分辨率重构的几何与结构基准,又赋予了每个低质 Token 依据自注意力权重自由“借阅”参考高频细节的自由。更重要的是,当检索到不相关或跨域参考图时,统一的 Softmax 注意力分布会自动将参考 Token 的权重压低至趋近于零,使得模型平滑回退至纯基于自身低质特征的重构,展现出无需额外门控网络的内在鲁棒性。
损失函数 / 训练策略¶
ReAL 采用预训练 Stable Diffusion 2-base 初始化去噪 U-Net,在整个训练阶段保持 VAE 编解码器参数完全冻结。由于高质量参考图已经能够显式注入精确的局部高频细节,模型彻底摒弃了传统超分中训练极不稳定的 GAN 对抗判别损失和感知损失,仅依赖标准潜在空间 \(\ell_2\) 均方误差噪声预测损失:
其中条件 \(c = (t, z_{\text{LR}}, \{K_{\text{ref}}, V_{\text{ref}}\})\) 仅包含时步、低分辨率隐特征及注入的参考键值张量,不含任何文本 Token 嵌入。在推理采样阶段,去噪过程直接采用 50 步 DDIM 采样,且因无需文本条件比对而彻底取消 CFG,单步无需评估两次网络,前向调用次数缩减整整一半。
实验关键数据¶
主实验¶
论文在三个公认的真实世界超分辨率评测基准(DIV2K 验证集、RealSR、DRealSR)上进行了全面评测,涵盖保真度指标(PSNR, SSIM, LPIPS)与感知质量指标(CLIP-IQA+, MUSIQ)。所有对比模型均在 DF2K 与 OST 联合数据集上统一训练。
| 数据集 | 指标 | ESRGAN | BSRGAN | LDM | StableSR | PASD | DifBIR | SeeSR | FaithDiff | CoSeR | iRAG | 本文 (ReAL) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DIV2K Valid | PSNR↑ | 20.067 | 19.858 | 18.727 | 18.956 | 19.453 | 18.747 | 19.157 | 18.375 | 19.579 | 19.280 | 19.650 |
| SSIM↑ | 0.525 | 0.504 | 0.438 | 0.435 | 0.497 | 0.418 | 0.484 | 0.443 | 0.498 | 0.458 | 0.507 | |
| LPIPS↓ | 0.395 | 0.422 | 0.428 | 0.415 | 0.462 | 0.451 | 0.392 | 0.433 | 0.415 | 0.410 | 0.391 | |
| CLIP-IQA+↑ | 0.603 | 0.559 | 0.541 | 0.628 | 0.625 | 0.727 | 0.710 | 0.652 | 0.599 | 0.676 | 0.646 | |
| MUSIQ↑ | 58.397 | 58.199 | 58.743 | 62.083 | 60.877 | 69.379 | 68.594 | 69.316 | 56.543 | 66.480 | 63.325 | |
| RealSR | PSNR↑ | 21.401 | 21.189 | 20.338 | 20.263 | 20.706 | 20.132 | 20.609 | 18.986 | 21.007 | 20.860 | 21.044 |
| SSIM↑ | 0.616 | 0.594 | 0.516 | 0.486 | 0.593 | 0.486 | 0.571 | 0.508 | 0.587 | 0.551 | 0.608 | |
| LPIPS↓ | 0.423 | 0.431 | 0.464 | 0.481 | 0.410 | 0.487 | 0.401 | 0.424 | 0.407 | 0.372 | 0.375 | |
| CLIP-IQA+↑ | 0.601 | 0.565 | 0.513 | 0.624 | 0.628 | 0.728 | 0.711 | 0.653 | 0.596 | 0.666 | 0.667 | |
| MUSIQ↑ | 58.447 | 59.657 | 56.391 | 62.072 | 63.758 | 69.263 | 70.613 | 70.372 | 56.745 | 70.280 | 66.529 | |
| DRealSR | PSNR↑ | 26.010 | 25.352 | 23.518 | 23.397 | 24.898 | 22.507 | 23.999 | 21.988 | 24.734 | 24.080 | 24.836 |
| SSIM↑ | 0.757 | 0.723 | 0.592 | 0.551 | 0.731 | 0.500 | 0.692 | 0.535 | 0.698 | 0.720 | 0.725 | |
| LPIPS↓ | 0.350 | 0.377 | 0.466 | 0.507 | 0.388 | 0.579 | 0.390 | 0.498 | 0.395 | 0.367 | 0.359 | |
| CLIP-IQA+↑ | 0.557 | 0.528 | 0.482 | 0.580 | 0.579 | 0.689 | 0.672 | 0.609 | 0.550 | 0.621 | 0.612 | |
| MUSIQ↑ | 51.285 | 53.040 | 51.938 | 57.299 | 57.112 | 65.606 | 64.829 | 65.900 | 52.345 | 64.630 | 60.368 |
消融实验¶
消融实验深入验证了 ReAL 核心组件的有效性以及不同参考图输入对模型表现的影响:
| 配置 | PSNR↑ | SSIM↑ | LPIPS↓ | CLIP-IQA+↑ | MUSIQ↑ | 说明 |
|---|---|---|---|---|---|---|
| ReAL (full) | 27.352 | 0.803 | 0.246 | 0.625 | 61.565 | 完整模型,结构保真与感知平衡最优 |
| ReAL (-L) | 26.689 | 0.774 | 0.309 | 0.608 | 60.544 | 移除 LR 隐变量通道拼接,结构保真度大幅暴跌 |
| ReAL (-R) | 27.084 | 0.799 | 0.250 | 0.614 | 60.294 | 移除全部参考图条件,高频细节与感知质量下降 |
| ReAL (-F) | 26.837 | 0.782 | 0.248 | 0.633 | 61.802 | 禁用 RFM 键值融合,感知微升但保真严重受损 |
| ReAL (-P) | 27.385 | 0.780 | 0.263 | 0.602 | 60.250 | 替换为随机噪声参考图,结构退化但无崩坏 |
此外,针对推理效率与显存占用的对比显示了 ReAL 无 CFG 和单次缓存的显著优势:
| 方法 | 采样步数 | 使用参考图 | 推理时延 (s)↓ | 显存占用 (GB)↓ |
|---|---|---|---|---|
| DifBIR | 50 | 否 | 5.06 | 9.10 |
| SeeSR | 50 | 否 | 3.23 | 9.24 |
| CoSeR | 50 | 是 | 16.85 | 14.94 |
| iRAG | 200 | 是 | 22.35 | 22.48 |
| ReAL (Ours) | 50 | 是 | 2.65 | 5.83 |
关键发现¶
- 去噪保真度的全面胜出:在扩散类超分模型中,ReAL 在全基准上的 PSNR 和 SSIM 表现最为稳健,如在 DIV2K 上较 iRAG 提升 0.37 dB,在 DRealSR 上 LPIPS 降低 0.036,在完全无需文本先验的情况下,其重建真实度全面超越了依赖 VLM 提示的扩散基线。
- 推理效率出现代际飞跃:得益于 CFG-free 机制以及参考图只需单次前向缓存 KV,ReAL 的推理时延仅为 2.65 秒,显存仅需 5.83 GB。相比同为参考引导扩散的 CoSeR(16.85s / 14.94GB)和 iRAG(22.35s / 22.48GB),时延缩短至六分之一,显存占用压低超 60%。
- 对不相关参考的内生免疫:在注意力热力图与 PCA 主成分分析中,当输入不匹配的随机参考时,LR 查询赋予参考键值的权重自发归零,模型自动回退为基于低分辨率输入的平滑重建,未出现强行拼接导致的非自然伪影。
亮点与洞察¶
- 将 RefSR 范式由 T2I 彻底重构为纯 R2I:深刻指出了低分辨率超分下 T2I 先验“因似然宽泛而反客为主”的数学本质矛盾,用具象的视觉参考替代发散的文本提示,从根源上消除了文本幻觉。
- 单次前向 KV 缓存注入架构:巧妙地将大语言模型中的 KV 缓存思想嫁接到扩散模型自注意力层,解除了多步去噪重复编码高分辨率参考的沉重计算负担。
- 仅注入 Key 与 Value、固定 Query 的锚定设计:保证了去噪主轨迹严格受控于待恢复的低质观测,使模型在充分吸纳外部纹理的同时绝不背离原图几何空间。
局限与展望¶
- 端到端重训练成本较高:与直接在冻结 Stable Diffusion 上训练轻量 Adapter 的方法相比,ReAL 需要联合重训练整个去噪 U-Net,前期预训练开销较大。
- 极端模糊下的退化边界:当输入图像退化极其严重(如严重运动模糊导致边缘完全溃散)时,低分辨率 Query 无法提供足够的结构锚定,此时模型倾向于产生过度平滑的输出,未能充分激发出参考图的高频细节。
- 跨域参考的微弱渗漏风险:虽然 Softmax 分布能在大多数情况下抑制不相关特征,但在大面积平坦区域,偶尔仍有微弱的跨域外来纹理渗入。未来可引入多参考加权融合机制或基于检索置信度的自适应门控。
相关工作与启发¶
- vs CoSeR & iRAG: 后两者虽然引入了参考图像,但仍受制于预训练 T2I 扩散主干网络,依赖文本分支或复杂的高层语义投影,并伴随昂贵的 CFG 计算开销;ReAL 彻底废除文本路径,采用纯 R2I 架构与直接的自注意力 KV 拼接,在时延仅为两者数分之一的前提下实现了更优的保真度与抗幻觉能力。
- vs SeeSR & FaithDiff: 这类通用扩散超分工作依赖大型 VLM(如 RAM、LLaVA)生成文本 prompt 辅助控制扩散过程,但当文本语义与低质退化冲突时常引发严重的语义漂移;ReAL 证明具象的高质量视觉样本是比任何抽象文本更精准、更可控的高频重建指导。
评分¶
- 新颖性: ⭐⭐⭐⭐ [打破常规 T2I 依赖,提出纯 R2I 键值缓存扩散范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [三大基准对比详尽,涵盖消融、检索开销、时延显存及注意力机理解析]
- 写作质量: ⭐⭐⭐⭐⭐ [数理动机清晰深刻,框架阐述严密自洽]
- 价值: ⭐⭐⭐⭐⭐ [为真实世界图像超分辨率与扩散模型精简加速提供了极具落地价值的新路径]