RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution¶
会议: ECCV2026
论文: ECCV 原文
领域: 图像恢复 / 多模态VLM
关键词: 图像超分辨率、奖励模型、偏好对齐、GRPO、多模态大模型
一句话总结¶
把低分辨率图像当作语义锚,用 GRPO 把 Qwen3-VL 8B 微调成 LR 条件化的可解释奖励模型 RefReward-SR(配套首个大规模 LR 条件偏好数据集 RefSR-18K),再把它作为核心奖励信号用 GRPO 微调扩散超分模型 C-FLUX,使生成结果的语义一致性与视觉合理性对齐人类偏好——域内一致率 85.0%,已与人类标注者的 84.7% 持平。
研究背景与动机¶
真实世界超分(Real-ISR)这些年从 bicubic 退化一路走到复杂未知退化:BSRGAN、Real-ESRGAN 把任务写成带对抗损失的分布匹配,StableSR、DiffBIR、SeeSR、OSEDiff 等扩散方法借助生成先验,即使在严重退化下也能合成精细细节。但生成能力越强,评价与优化框架就越跟不上。全参考(FR)指标 PSNR、SSIM、LPIPS 依赖严格的空间对应,这在生成式超分里过于保守——它会把「合理的幻觉」(语义说得通、视觉上也更丰富的细节)当作错误来惩罚;而无参考(NR)指标 MUSIQ、CLIPIQA、TOPIQ-IAA 虽然不需要参考、擅长评价低层锐度与纹理自然度,却因为没有参考而无法约束内容保真,模型可以靠过度锐化、不忠实的伪影甚至改掉主体身份来「刷分」。更要命的是,这两类指标都只是被动地透过低层线索去反映高层语义合理性,忽略了人类感知其实是自上而下的:先确认语义一致性,再细看低层细节。于是它们无法显式惩罚那些违背常识的语义错误和结构扭曲。
第二个问题出在优化端。主流超分方法用监督损失保结构、部分方法再加对抗损失,但严格拟合经验上的 GT 分布并不等于捕获更高层的人类语义偏好;而且真实场景的 GT 本身往往带有退化,过度依赖 GT 的模型会去复现这些瑕疵而不是提升质量。文本到图像领域早已用 RLHF 系统地做偏好对齐,超分里这条路却走得很有限:要么沿用本身就有缺陷的既有指标当奖励,要么直接拿并不擅长低层视觉任务的通用 MLLM 来打分,都没能真正释放强化学习在超分上的潜力。
本文的切入角度是:既然超分是病态逆问题、同一张 LR 可以对应多个「合理」的 HR,那就干脆把 LR 当作唯一的语义锚,把超分评价重写成 LR 条件化的偏好建模问题——不看重建结果和 GT 像不像,而是看它是否忠实于 LR 的结构与语义线索、重建出来的内容是否自然且没有失真异常。核心 idea:先用人类成对偏好数据(RefSR-18K)以 GRPO 把 MLLM 微调成 LR 条件的可解释排序奖励模型,再把这个奖励作为复合奖励的核心信号,用 GRPO 直接优化扩散超分模型的生成分布,从而在保住结构保真度的同时对齐人类语义偏好。
方法详解¶
整体框架¶
方法分两段,中间用同一个奖励模型串起来。第一段是造奖励模型:从 LSDIR 采图、用 SeeSR 的退化管线合成 LR,让 8 个 SOTA 超分模型各生成候选 HR 并混入 GT,由多名标注者按「LR–HR 语义一致性」与「语义合理性」两条准则做组内排序,产出 RefSR-18K;再用格式奖励 + LR 条件排序奖励,以 GRPO 微调 Qwen3-VL 8B,得到一个既能输出 <thinking> 推理链、又能给出标量分、且判断与人类偏好对齐的 RefReward-SR。评测时为了不被整体结构相似掩盖局部差异,再叠一层全局-局部裁剪评分:用 RAM + Grounding DINO 选出代表性区域,把全局分与裁剪分按面积加权融合。第二段是把奖励用起来:把 C-FLUX(来自 DP2O-SR)的微调写成 RL 问题,对每张 LR 采样一组重建,用「RefReward-SR 语义奖励 + LPIPS 感知惩罚 + DEQA 质量奖励」的复合奖励做组内相对优化,最终输出偏好对齐的 HR 图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["LR 输入 + HR 候选"] --> B["LR 条件化的偏好数据 RefSR-18K<br/>一致性 + 合理性成对排序"]
B --> C["LR 条件排序奖励<br/>Thurstone 比较 → 连续保真度"]
C --> D["全局-局部裁剪评分<br/>RAM + Grounding DINO → 面积加权"]
D --> E["复合奖励驱动的超分对齐<br/>Ref + LPIPS + DEQA → GRPO"]
E --> F["偏好对齐的 HR 重建"]
C -.->|对齐阶段只用全局分| E
关键设计¶
1. LR 条件化的偏好数据 RefSR-18K:为语义一致性与合理性提供判别依据
现有 IQA 与美学数据集(KADID、SPAQ、Pick-a-Pic、HPS 等)要么是单图打分、只盯噪声一类的低层失真,要么只看全局艺术性,它们既没有对应的 LR 参考来评价「生成的细节是否忠实于输入的语义」,也不会对生成式超分特有的异常——结构扭曲、不合理纹理、局部内容幻觉——给出显式排序。RefSR-18K 就是为补这个缺口造的:从 LSDIR 精选 5,130 张覆盖多类别的高质量图像,按 SeeSR 的退化管线随机裁剪并施加复杂退化合成 LR;候选 HR 由 8 个当时最强的超分模型生成(DiffBIR、SeeSR、OSEDiff、S3Diff、LucidFlux、DiT4SR、OMGSR-S、HYPIR),这个模型池刻意同时覆盖单步与多步生成范式,以及 Stable Diffusion 与 FLUX 两种不同的生成先验,再混入 GT 一起作为候选。每个标注组由 1 张 LR 参考 + 4 张从 9 个来源中随机抽出的 HR 候选组成,标注者按两条准则联合排序:(1) LR–HR 语义一致性,即生成的细节是否忠实于 LR 中的结构与语义线索;(2) 语义合理性,即重建出的物体是否自然、没有失真引起的异常;质量差别难以分辨时允许并列。组内排序随后被转成成对偏好,同时用于训练 RefReward-SR 和评测偏好对齐度。考虑到图像恢复类标注主观且细粒度,质控做得相当严:标注者必须先通过培训与资格考试、只有与专家判断高度一致的才留下(约 50% 被筛掉),每组至少由 3 名合格标注者独立标注再取平均秩聚合,最后还要做专家复核与后置过滤,剔除候选质量几乎无法区分、图像语义内容不足以判断、标注者分歧过大的组。经过这轮过滤,最终保留 4,699 个高质量标注组、18,796 条带 LR 参考的 HR 重建标注。这套数据是整条链路的地基——没有它,后面无论是奖励模型还是对齐优化都无从谈起。
2. 基于 Thurstone 模型的 LR 条件排序奖励:把「排序判断」变成连续奖励
奖励模型最容易退化成黑箱打分器:只让模型输出一个绝对分数,既没法解释,分数在不同 rollout 之间的抖动也会让排序不稳。RefReward-SR 的做法是让同一个策略在相同的 (LR, 提示词) 条件下对同一张候选采样 K 次、得到 K 个质量分,用这 K 次采样的样本均值与方差去构造 Thurstone 比较模型的比较概率——即模型认为候选 \(x_i\) 优于组内另一张 \(x_j\) 的概率。这里显式引入了方差项,等于把「模型自己有多确定」也编码进比较里:
其中 \(\Phi\) 是标准正态累积分布,\(\mu(\cdot)\)、\(\sigma^2(\cdot)\) 是 K 次预测的样本均值与方差,\(\gamma\) 是一个小的稳定常数。奖励本身不是「排序对不对」的 0/1 判断,而是模型预测概率与人类真实偏好 \(p(x_i,x_j)\in\{1,0.5,0\}\)(胜/平/负)之间的连续保真度,并对组内其余 \(G-1\) 张候选取平均:
据原文描述,\(d\) 由 \(\sqrt{p\,p_k}\) 与 \(\sqrt{(1-p)(1-p_k)}\) 两个根式组成,形似 Bhattacharyya/Hellinger 保真度;⚠️ 缓存文本中该式被 OCR 拆散、两项之间的连接符号丢失,此处不强行还原精确形式,以原文为准。这种连续奖励的好处是能捕捉质量排序中的细微变化,并对「离群预测」施加最重的惩罚——比如把人类公认最差的一张排到最前时,奖励会明显跌落,而单纯的离散排序奖励给不出这种梯度。与排序奖励配套的还有一条格式奖励:输出必须先给出 <thinking>…</thinking> 里的推理链,明确指出 HR 图存在什么问题、位于什么位置,且判断要以 LR 为条件;随后把数值评分放进 <answer>…</answer>。任一格式不满足则格式分为 0。正是这条硬约束让 RefReward-SR 成为「先推理再打分」的可解释评测器,而不是拍脑袋给分的黑箱。
3. 全局-局部裁剪评分:补上「差异只在局部」的判别盲区
实际比对时,不同超分结果的整体结构往往高度相似,质量差异主要体现在局部细节上,只看全局分很容易把这些关键差别漏掉;而人工标注时的真实行为恰恰是先看整图、再逐个比较主要物体。为了模仿这个行为,本文提出两阶段的评分策略。第一阶段做区域提议:先用 RAM 抽取语义标签,再由标签引导 Grounding DINO 生成候选框,然后用一套框过滤流程筛出低重叠、纹理丰富且显著的代表性区域(具体规则在补充材料)。第二阶段做联合评估:让 MLLM 分别评全局图与各个裁剪区域,最后按面积加权平均融合成一个总分:
其中 \(S_g\)、\(A_g\) 是全局图的分数与面积,\(S_i\)、\(A_i\) 是第 \(i\) 个局部裁剪的分数与面积。面积权重让占画面更大的区域对最终分影响更大,从而同时顾及全局信息与局部细节。一个值得注意的工程取舍是:这一策略只在评测阶段启用,在 GRPO 微调超分模型时只用全局分——作者的理由是全局分已经能提供足够强的语义引导,而多裁剪会让奖励计算成倍变慢。
4. 复合奖励驱动的超分对齐:让奖励真正进入生成过程
有了可靠的评测器,本文把 C-FLUX 扩散超分模型的微调写成强化学习问题:给定 LR 输入,条件策略一次采样一组 G 张重建,优化只依赖组内的相对质量比较,正好对应 GRPO 的形式(不训练 critic,靠组内归一化的相对优势更新)。这里奖励设计是成败关键,而单一奖励肯定不够。只给 RefReward-SR 会怎样?它管的是高层语义,既不约束像素级保真,也不专门压制模糊与噪声,模型完全可能为了语义合理而漂移结构。于是奖励由三项互补组成:
RefReward-SR 奖励是核心语义信号,同时判断生成图与 LR 的一致性以及内容本身的合理性;LPIPS 数值越低表示与 GT 的感知相似度越高,因此以负惩罚项的形式进入总奖励,用来防止结构过度偏离、守住感知保真;DEQA 则作为图像质量评估奖励,提升整体锐度并强化对模糊、噪声这类低层退化的惩罚。三项的权重 \(\lambda_1,\lambda_2,\lambda_3\) 分别平衡语义人类偏好对齐、感知保真与伪影抑制(⚠️ 原文 Eq.5 的三项在缓存文本中被 OCR 连写在一起,此处的正负号按正文描述还原:LPIPS 明确为负惩罚项;λ 的具体取值原文未给出)。
损失函数 / 训练策略¶
两段流程都用 GRPO。第一段微调奖励模型:策略是 Qwen3-VL 8B,奖励 = 格式奖励 + LR 条件排序奖励,数据是 RefSR-18K 的组内排序,目标是让模型的判断与人类偏好对齐,同时通过 RL 自然涌现出推理链,而不是靠监督微调硬灌。第二段微调超分模型:策略是 C-FLUX 扩散模型,对每张 LR 采样一组重建,用 Ref + LPIPS + DEQA 的复合奖励做组内相对优化。超分侧的训练数据由 LSDIR 配 Real-ESRGAN 退化合成,分辨率设为 512×512 以与基座模型 C-FLUX 对齐;评测沿用 StableSR 的协议,合成集用 DIV2K-Val 随机裁出 3,000 张 512×512 并用同样的 Real-ESRGAN 退化生成 LR,真实场景用 RealSR 的 100 对 LR–HR(128×128 与 512×512)。⚠️ 原文未给出采样组大小 G、rollout 次数 K 以及 \(\lambda_1/\lambda_2/\lambda_3\) 的具体取值,均在补充材料或未报告,以原文为准。
实验关键数据¶
主实验¶
实验分两块:先验证奖励模型本身与人类偏好有多一致,再验证用它对齐后的超分模型是否真的更好。评测协议沿用 ImageReward 的设定,用一致率(模型偏好与人类标注一致的频率)、Recall@1(人类认为最好的那张是否被模型排到第一)和 Filter@1(人类认为最差的那张是否被模型排到最后)三个指标,并设了域内(候选来自训练见过的 8 个模型 + GT)与域外(2 张候选来自完全没见过的 TSD-SR 与 PiSA-SR)两套各 200 组的测试集。
| 方法 | 域内 一致率(%) | 域内 Recall@1 | 域外 一致率(%) | 域外 Recall@1 |
|---|---|---|---|---|
| 人类标注者 | 84.7 ± 1.4 | - | 81.8 ± 1.3 | - |
| PSNR | 41.8 ± 1.6 | 45.0 | 35.5 ± 2.3 | 25.5 |
| SSIM | 51.8 ± 2.0 | 51.0 | 43.3 ± 1.8 | 26.0 |
| LPIPS | 62.5 ± 0.9 | 49.5 | 58.8 ± 2.0 | 44.5 |
| MUSIQ | 60.9 ± 1.4 | 40.5 | 57.6 ± 2.7 | 38.0 |
| CLIPIQA | 54.0 ± 1.7 | 31.0 | 56.9 ± 2.5 | 32.0 |
| Q-Align | 54.9 ± 1.7 | 35.0 | 54.3 ± 1.0 | 40.5 |
| VQ-R1 | 47.8 ± 1.3 | 49.0 | 44.1 ± 2.8 | 50.5 |
| GPT-5.2 | 52.5 ± 1.0 | 30.7 | 49.7 ± 2.2 | 38.1 |
| Gemini 3 Pro | 58.8 ± 1.5 | 54.0 | 47.9 ± 2.1 | 42.6 |
| Qwen3-VL 8B(零样本) | 31.8 ± 0.4 | 67.5 | 26.1 ± 0.9 | 59.0 |
| RefReward-SR(本文) | 85.0 ± 2.4 | 84.5 | 80.2 ± 2.2 | 77.0 |
(⚠️ 原文列出的 GPT-5.2 与 Gemini 3 Pro,其参考文献分别是 GPT-4 与 Gemini 的技术报告,模型版本标注以原文为准。)Filter@1 上本文同样领先:域内 78.0、域外 73.0,是所有方法中最高的。
对齐后的超分模型则在 RealSR 与 DIV2K-Val 上与一众 SOTA 真实世界超分方法比较,同时把基座 C-FLUX 和同样用 RL(DPO)微调过的 DP2O-FLUX 单独列出来,作为「对齐策略本身带来多少增益」的对照:
| 数据集 | 方法 | PSNR↑ | SSIM↑ | LPIPS↓ | MUSIQ↑ | CLIPIQA↑ | Q-Align↑ | VQ-R1↑ |
|---|---|---|---|---|---|---|---|---|
| RealSR | SeeSR | 25.14 | 0.7211 | 0.3007 | 69.82 | 0.6705 | 3.7190 | 3.9830 |
| RealSR | PiSA-SR | 25.50 | 0.7418 | 0.2672 | 70.15 | 0.6698 | 3.6354 | 4.0180 |
| RealSR | TSD-SR | 23.40 | 0.6938 | 0.2823 | 71.26 | 0.7416 | 3.8444 | 4.0800 |
| RealSR | C-FLUX(基座) | 24.42 | 0.6742 | 0.3376 | 68.70 | 0.6221 | 3.4943 | 3.9650 |
| RealSR | DP2O-FLUX(DPO 基线) | 24.51 | 0.6774 | 0.3259 | 72.42 | 0.7156 | 3.9757 | 4.2170 |
| RealSR | 本文 | 24.68 | 0.7101 | 0.3202 | 71.70 | 0.7007 | 4.1596 | 4.2930 |
| DIV2K-Val | SeeSR | 23.68 | 0.6043 | 0.3194 | 68.68 | 0.6936 | 3.9770 | 4.2013 |
| DIV2K-Val | PiSA-SR | 23.87 | 0.6058 | 0.2823 | 69.68 | 0.6929 | 3.8804 | 4.2054 |
| DIV2K-Val | TSD-SR | 22.41 | 0.5644 | 0.2710 | 71.64 | 0.7559 | 4.0147 | 4.1529 |
| DIV2K-Val | C-FLUX(基座) | 22.71 | 0.5520 | 0.3349 | 69.70 | 0.6781 | 4.0573 | 4.2558 |
| DIV2K-Val | DP2O-FLUX(DPO 基线) | 22.72 | 0.5536 | 0.3216 | 72.98 | 0.7536 | 4.3983 | 4.4343 |
| DIV2K-Val | 本文 | 22.88 | 0.5786 | 0.3260 | 71.95 | 0.7302 | 4.4605 | 4.4396 |
用户研究用来规避「用自家奖励评自家模型」的 reward hacking 风险:从 DIV2K-Val 与 RealSR 各随机抽 10 张图,15 名有图像处理经验的志愿者看图选优。结果是本文胜率 72.7%,高于 DP2O-FLUX 的 67.1% 与 C-FLUX 的 60.2%,且各方法的平均 RefReward-SR 分与胜率强正相关(三者分别 2.09 / 1.80 / 1.77);纳入对比的 PiSA-SR、TSD-SR 分数与胜率都更低(约 1.63 / 1.40,胜率约 31.9% / 18.1%,⚠️ 图 3 中数值与方法的对应关系以原文为准)。
消融实验¶
奖励模型侧(一致率 %):数据规模从 1K 增到 2K、再到全量 4,699 组,域内一致率单调上升;去掉全局-局部裁剪评分后域外掉得比域内更多。
| 配置 | 域内 一致率(%) | 域外 一致率(%) | 说明 |
|---|---|---|---|
| 1K 数据 | 81.2 ± 1.9 | 76.6 ± 3.2 | 只用 1K 组训练,泛化最差 |
| 2K 数据 | 82.7 ± 1.9 | 77.4 ± 1.8 | 数据翻倍带来稳定增益 |
| w/o 全局-局部裁剪 | 83.6 ± 2.6 | 78.1 ± 2.3 | 去掉裁剪评分,域外掉 2.1 |
| 完整模型 | 85.0 ± 2.4 | 80.2 ± 2.2 | 数据规模 + 裁剪评分共同作用 |
超分侧奖励消融(RealSR):逐个移除 Eq.5 中的奖励项,观察重建质量变化。
| 配置 | PSNR↑ | SSIM↑ | LPIPS↓ | MUSIQ↑ | CLIPIQA↑ | Q-Align↑ | 说明 |
|---|---|---|---|---|---|---|---|
| C-FLUX(基座) | 24.42 | 0.6742 | 0.3376 | 68.70 | 0.6221 | 3.4943 | 未对齐的基座 |
| w/o RefReward-SR | 23.89 | 0.6920 | 0.3211 | 73.48 | 0.7239 | 4.1656 | FR 只小降、部分 NR 反升,但语义失真、结构扭曲 |
| w/o LPIPS | 21.98 | 0.5798 | 0.4026 | 74.55 | 0.7434 | 4.3521 | 低层保真度崩塌,NR 却最高(典型刷分) |
| w/o DEQA | 23.87 | 0.7099 | 0.2967 | 69.02 | 0.6153 | 3.5313 | 清晰度下降、细节变糊 |
| 完整模型 | 24.68 | 0.7101 | 0.3202 | 71.70 | 0.7007 | 4.1596 | 各指标最均衡 |
关键发现¶
- 微调是奖励模型有效的前提。零样本 Qwen3-VL 8B 的一致率只有 31.8%,微调后(即 RefReward-SR)达到 85.0%,提升了 53.2 个百分点,直接追平人类标注者的 84.7%。说明「LR 条件的成对偏好 + GRPO 微调」这一套确实补上了通用 MLLM 在细粒度超分评价上的短板。
- 零样本 MLLM 的失效方式很特别:当候选结构相近时它们对细微差异不敏感、倾向于给相同分数,在本文的计算协议下这会把一致率压到 50% 以下,却又反常地抬高 Recall@1 / Filter@1(Qwen3-VL 8B 一致率 31.8% 但 Recall@1 达 67.5%)。所以只看 Recall@1 会被这种「一律给同分」的策略骗过,一致率与 Filter@1 必须一起看。
- 现有低层指标并非全无用处:除 PSNR 外,所有一致率低于 50% 的方法都是 MLLM 类,而 LPIPS 这类 FR 指标反而能在相当程度上间接反映语义偏好(域内 62.5%),但离本文的 85.0% 仍有很大距离。
- 三项奖励各司其职,缺一不可。去掉 LPIPS 的后果最严重——PSNR 从 24.68 掉到 21.98、SSIM 从 0.7101 掉到 0.5798、LPIPS 从 0.3202 恶化到 0.4026,但 MUSIQ/CLIPIQA/NIMA 这些 NR 指标反而冲上最高,是「NR 指标被刷分」的活教材;去掉 RefReward-SR 时 FR 指标只小幅下滑(因为保真主要靠 LPIPS 守着),部分 NR 指标甚至上升,但生成结果出现语义失真与结构扭曲;去掉 DEQA 则相关 NR 指标明显回落(MUSIQ 71.70→69.02、Q-Align 4.1596→3.5313)、细节变模糊。只有三项齐全时各项指标最均衡。
- 全局-局部裁剪评分的价值主要体现在泛化上:去掉它域内掉 1.4、域外掉 2.1,说明它对捕捉细粒度语义不一致、尤其是对没见过的超分模型更关键。
- 一个耐人寻味的矛盾:C-FLUX 在常规 NR/FR 指标上不如 TSD-SR 和 PiSA-SR,人类胜率却更高。这与奖励模型评测的结论互相印证——现有指标确实不足以衡量人类语义偏好。
- 与同样做 RL 微调的 DP2O-FLUX 相比,本文在多数指标领先(PSNR 24.51→24.68、SSIM 0.6774→0.7101、LPIPS 0.3259→0.3202、Q-Align 3.9757→4.1596、VQ-R1 4.2170→4.2930),但在 MUSIQ(72.42 vs 71.70)与 CLIPIQA(0.7156 vs 0.7007)上略低,并非全面碾压。
亮点与洞察¶
- 把 LR 而非 GT 当作条件的锚:这是全文最漂亮的视角转换。超分是病态逆问题,同一张 LR 本来就对应多个合理解;用 LR 做条件既避开了 FR 指标对空间对应的苛刻要求,又避免了 NR 指标的无参考漂移。这个思路可以直接迁移到去模糊、去雨、修复等所有「退化输入 + 生成输出」的恢复任务——只要输入本身携带语义,就能当锚。
- 用 Thurstone 模型 + 多次 rollout 的方差把奖励写成连续保真度:不是判断「排序对不对」的 0/1 奖励,而是衡量预测分布与人类偏好分布的保真度,配合方差项显式建模不确定性,对离群预测的惩罚最重。相比 VQ-R1 那种「用 RL 学排序」的思路,这里多了一层「奖励本身就是连续量」的设计,梯度信号更细腻。
- 格式奖励把推理链变成硬约束:用 RL 而非监督来诱导推理,让「先定位问题再打分」成为模型的默认行为。论文给出的定性例子(对结构扭曲的齿轮给 1.00,对成功重建给 3.80)显示推理确实定位到了具体区域,这种可解释性在低层视觉评测里很少见。
- 全局-局部裁剪 + 面积加权:一个几乎零成本的通用技巧,任何 MLLM 打分器都能直接加上;更有借鉴意义的是作者在 RL 微调阶段主动放弃它换取效率的取舍判断——评测可以慢,训练不能慢。
- 用户研究与平均奖励分之间的强正相关(72.7%/67.1%/60.2% 对应 2.09/1.80/1.77)是一次漂亮的自我验证:既证明了奖励模型没有沦为「刷分指标」,也说明奖励确实在引导生成往人类想要的方向走。
局限与展望¶
- 关键超参缺失影响复现:\(\lambda_1,\lambda_2,\lambda_3\)、采样组大小 G、rollout 次数 K,以及裁剪框的数量与过滤规则都没在正文给出,全部指向补充材料。
- 域外泛化只加了 TSD-SR 与 PiSA-SR 两个未见模型,且域外一致率整体下降(人类也从 81.8 掉到 80.2 附近)——作者自己的解释是未见模型与其他候选质量过于接近、判别本身更难,但这也说明面对全新生成范式(比如更强的扩散 Transformer 或自回归超分)时奖励模型是否仍然可靠,还没有答案。
- 关于 reward hacking:作者用人工用户研究规避了「用自家奖励评自家模型」的自评问题,但训练过程中奖励曲线与人类胜率是否同步上升、有没有出现奖励饱和或 KL 漂移,正文没有报告,这对一个用 RL 做对齐的方法来说是重要缺口。
- 超分侧只验证了 C-FLUX 一个扩散 backbone,奖励模型也固定为 Qwen3-VL 8B;换成单步模型(如 OSEDiff 一类)或别的 MLLM 是否同样有效,未知。
- 「语义合理性」这条准则依赖标注者的主观世界知识,跨文化、跨场景(比如医学图像、遥感图像)的稳定性没有分析,而这些恰恰是超分的重要应用域。
- 一个自然的延伸:RefReward-SR 的
<thinking>链本身就是一份带定位的失败诊断,可以用来给超分模型做失败模式的自动归类,或反过来当作训练数据的质量过滤器——比单纯的标量分更有价值。
相关工作与启发¶
- vs 传统 FR/NR 指标(PSNR/SSIM/LPIPS 与 MUSIQ/CLIPIQA/Q-Align/TOPIQ-IAA):前者苛求空间对应、会惩罚合理幻觉,后者没有参考、无法锚定语义,两类都只能被动地由低层线索反映高层语义。本文把评价改写成 LR 条件化的偏好判断,从「失真度量」转为「偏好判断」,域内一致率从最强基线 LPIPS 的 62.5% 提升到 85.0%。
- vs 通用 MLLM 评测器(GPT-5.2 / Gemini 3 Pro / 零样本 Qwen3-VL):零样本 MLLM 的分数分辨率太低,在结构相近的候选之间给同分,导致细粒度排序失效(一致率跌破 50%)。本文用 RefSR-18K 的成对偏好 + GRPO 把 8B 模型的判断粒度拉到人类水平,参数规模远小于闭源基线。
- vs 通用 IQA / 偏好奖励模型(ImageReward、DEQA、VQ-R1):ImageReward 一类奖励是单图、无参考的美学偏好预测,天然回答不了「生成的细节是否忠实于输入」;VQ-R1 虽然在 IQA 上用 RL 做排序,但仍是无参考设定。本文的奖励显式条件于 LR,评价的是语义一致 + 合理,而 DEQA 在本框架里被降级为补充的质量项,用来压模糊与噪声。
- vs 超分上的 RL 尝试(DSPO、RealSR-R1、IRPO、DP2O-SR):DSPO 一类沿用既有指标做奖励,RealSR-R1、IRPO 直接拿通用 MLLM 打分,都没解决「奖励本身不适配低层视觉」的问题;DP2O-SR 用 DPO 式的直接偏好优化。本文与最接近的 DP2O-SR 相比,区别在于用专门训练的 LR 条件奖励模型 + GRPO 在线采样,而不是依赖固定的偏好对,在多数指标上领先其 DP2O-FLUX 变体,并额外提供了可解释的评测能力。
评分¶
- 新颖性: ⭐⭐⭐⭐ 首个 LR 条件化的超分偏好数据集与奖励模型,「以 LR 为语义锚」的视角转换很扎实;但 GRPO、Thurstone 比较模型、RL 微调扩散模型都是已有构件,属于组合式创新。
- 实验充分度: ⭐⭐⭐⭐ 评测器对齐、域内/域外泛化、超分主结果、用户研究、两组消融都做了,域内域外双测试集的设计尤其规范;扣分在关键超参与裁剪细节缺失、超分侧只验证一个 backbone。
- 写作质量: ⭐⭐⭐⭐ 动机讲得具体、两类痛点的拆解清晰;但公式在缓存文本中 OCR 损失严重,部分符号(\(\gamma\)、奖励式的连接符)在正文里交代不足,读者难以精确复现。
- 价值: ⭐⭐⭐⭐ 提供了一条可复用、可迁移的「LR 条件奖励 + GRPO 对齐」路径,奖励模型本身也能直接当超分评测工具用,对低层视觉的偏好对齐有启发意义。