跳转至

QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration

会议: ECCV2026
论文: ECCV 原文
PDF: 论文全文
代码: https://github.com/fengyang1399-pixel/QualiTeacher.git
领域: 图像恢复
关键词: 质量条件化、伪标签、均值教师、无参考图像质量评价、偏好优化

一句话总结

QualiTeacher 把教师伪标签的质量分数变成学生网络的控制条件,再用质量排序与裁剪一致性约束输出,使不完美监督支持可控的真实图像恢复,在 RTTS 去雾中将 CORUN 配合 Colabator 的 FADE 从 0.824 降至 0.590。

研究背景与动机

真实图像恢复很难得到严格配对的干净目标:同一场景在去掉雪、雾、传感器噪声后,通常无法以完全相同的视角和照明重新拍摄。 因此,合成配对数据可以提供基础恢复能力,却不能覆盖真实退化的复杂组合与空间差异。 均值教师(Mean Teacher)框架让教师为真实退化图像生成伪标签,学生据此训练,教师参数再由学生的指数移动平均更新。 这种闭环能利用无标注图像,但教师输出中残留的雪点、模糊纹理或颜色偏差也会成为学生的监督目标。 Colabator 等方法用标签库和质量选择改善目标可靠性,仍然需要面对一个问题:留下的图像是否真的干净,而不是仅仅获得了较高评价分数。

如果学生无条件拟合所有伪标签,就会把不同质量的恢复结果混在同一个映射中学习;如果只接受少量最高分目标,又会丢失训练内容和质量变化的多样性。 无参考图像质量评价(NR-IQA)并不能彻底解决这个问题,因为评价器可能偏爱过平滑结果,或把锐利但不真实的重复纹理判成高质量。 本文关注的不是训练一个更大的教师,而是改变学生理解监督的方式:同一退化输入的目标可以处在不同质量水平,而这个水平应成为网络可见的条件。 低质量目标因而不必代表“理想恢复结果”,而可以代表“在这个低质量条件下应该产生的结果”。 这也解释了为什么只加一个质量分数还不够:网络可能忽略条件,或者仅把低分输出变差来制造分数差距。

作者把质量条件与显式排序目标结合,希望模型学到沿分数变化的恢复方向,并在推理时选择高质量条件。 这里的“超越教师”是一个学习目标和实验解释,不是任何输入下都成立的数学保证。 特别是质量评价器本身有偏差时,提高预测分数和恢复真实结构并不等价。 核心 idea:把伪标签质量从二元保留标准变成可学习的条件坐标,同时约束高分输出确实变好、局部质量评价保持一致,而不是让学生无条件模仿教师。

方法详解

整体框架

输入包括配对的有标注样本和没有干净参考的真实退化图像,输出是学生网络在指定质量条件下恢复的图像。 无标注分支先通过“质量分级伪标签”构造候选与历史标签库,再通过“质量条件注入与空间加权”把目标质量及区域可靠性用于学生训练。 “质量引导优化”进一步约束不同条件对应的输出质量顺序,并抑制评价器驱动的伪影。 教师采用学生参数的指数移动平均(EMA),负责提供训练目标;推理只需带质量条件的学生,不需要为每张测试图运行整套候选筛选流程。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["真实退化图像"] --> Labels["质量分级伪标签<br/>教师增强、评分与标签库"]
        Labels --> Condition["质量条件注入与空间加权"]
        Input --> Condition
        Paired["配对图像与干净目标"] -->|有监督分支| Condition
        Condition --> Optimize["质量引导优化<br/>偏好排序与裁剪一致性"]
        Optimize -.->|学生参数的 EMA| Labels
        Optimize --> Student["训练后的条件学生"]
        Test["测试图像与条件分数 7"] --> Student
        Student --> Output["恢复图像"]

图中的标签库、质量评价与损失分支属于训练过程,条件学生才是最终部署对象。 质量评分不只是损失权重:全局分数进入网络特征,块级分数则作用于像素监督,两者解决不同问题。 原文图 2 还区分了有标注样本的弱增强与学生无标注输入的强增强;教师侧另使用可逆几何增强来产生多个对齐目标。

关键设计

1. 质量分级伪标签:利用增强产生质量差异,再筛除不一致候选

对一张退化输入,教师分别处理水平翻转、垂直翻转和旋转 90 度后的图像,得到三个恢复结果,再用对应逆变换把输出映射回原坐标。 这样所有伪标签都与同一输入空间对齐,却可能保留不同程度的雪点、纹理或颜色误差。 这些变换理论上不损失内容,但恢复网络并非严格几何等变,因此作者利用其响应差异扩展监督质量的分布,而不只是对三个结果求平均。 评分集成 MUSIQ-KonIQ、BRISQUE 和 CLIP-IQA:前两者关注图像统计或感知失真,后者引入视觉语言先验,减少对单一评价器的依赖。 BRISQUE 原本越低越好,文中先以 \(100-S_{\mathrm{BRISQUE}}\) 反转方向,再进行分数归一化。

Dual-Drop 有两个检查维度:同一伪标签在不同评价器之间是否分歧过大,以及同一评价器对三个几何增强结果的打分是否波动过大。 两者分别通过归一化分数的方差和阈值控制;原文说明任一候选不满足一致性检查时,会丢弃整组增强结果。 通过检查的候选再与该输入的历史标签库合并,按集成质量分数重排,保留历史 Top-3。 因此,这不是“完全取消过滤”或“所有低质量标签永远保留”:实际实现仍有一致性筛除和 Top-3 门控,区别是库中的标签携带显式质量条件参与学习。 缓存的式 (2) 排版损坏,不能据此精确恢复双阈值不等式;正文没有给出这两个阈值的数值,本笔记不猜补。

2. 质量条件注入与空间加权:分别告诉网络目标档位和可靠区域

学生接收退化图像以及所选伪标签的质量分数,训练时要让该条件与对应目标配对,而不是对所有目标都注入最高分。 分数先经正弦位置编码,再经 MLP 映射为与注入位置通道数相同的向量;该向量沿空间维广播后,加到中间特征上。 原文以 U-Net 的编码器与解码器瓶颈为例,因为这里的特征较紧凑,可以用较少的条件注入影响整个恢复过程。 这种做法不要求恢复骨干输出概率,也没有把网络替换成扩散模型,因而可以接入 NAFNet、HistoFormer、CORUN 等现有恢复模型。 从学习目标看,低分伪标签仍被重建,只是它属于低分条件下的映射;不能把它误读成全局分数自动降低了这张图的损失权重。

一张伪标签内部也可能好坏不一,例如天空残雪较少,而建筑细节仍有条纹。 作者把标签划成 \(2\times2\) 不重叠块,分别用集成 IQA 评分,再把块级权重图上采样至原分辨率,乘到像素级重建损失中。 这使质量较好的区域承担更强的监督,减少局部伪影被强制复制的影响,而全局分数继续决定输出档位。 文中式 (4) 的可读文本列出 MUSIQ、反向 BRISQUE 与 CLIP-IQA 的组合系数为 0.4、0.4、1,并描述分数归一化到 \([0,1]\)。 但实现部分又使用最高条件 7,未说明两种尺度的完整转换关系;因此这里不把原始 IQA 分数直接等同于注入分数,也不补造映射公式。

3. 质量引导优化:让高分条件更好,而不只是让低分条件更差

仅靠条件重建,模型可能忽略分数,或者让两个分数对应几乎一样的输出。 作者在同一输入上分别注入高、低质量条件,产生一对学生输出,再由 NR-IQA 评价它们,构造不需要人工偏好标注的质量排序信号。 这受到直接偏好优化(DPO)启发,但不是标准 DPO:确定性图像回归模型没有可供比较的输出对数概率,本文直接在评价分数空间优化。 第一项 \(\mathcal{L}_1\) 要求高分条件输出相对低分条件输出有足够质量间隔,间隔由 \(\delta\) 控制,偏好锐度由温度 \(\beta\) 控制。 第二项 \(\mathcal{L}_2\) 用教师最佳伪标签的质量锚定学生高分输出,避免模型仅靠恶化低分输出满足间隔。 第三项 \(\mathcal{L}_{\mathrm{reg}}\) 把分数注入层权重约束在初始化权重附近,限制偏好优化对原有恢复能力的扰动。

直接最大化 IQA 仍可能诱发“高分但有网格”的输出,因此作者增加裁剪质量一致性。 同一位置的四分之一图像有两条路径:先恢复整图再裁剪评分,以及先裁剪退化输入再恢复评分;两条路径使用同一质量条件。 目标是缩小两条路径的质量分数差,而不是要求对应像素完全相同,因为整图恢复与局部恢复看到的上下文不同。 依据第 3.4 节对式 (9) 的文字定义,该约束可写成:

\[ \mathcal{L}_{\mathrm{cropped}}=\lVert S_1-S_2\rVert_1. \]

这里 \(S_1\)\(S_2\) 分别是上述两条路径的集成质量分数;该式仅表示正文明确说明的差值,不是对损坏的偏好损失式 (8) 的复原。 作者认为,局部统计捷径及评价器的尺度依赖会使两种处理顺序的分数不一致,因此这个约束能减少奖励投机。 它并不能证明所有伪影都被消除,后面的失败案例仍保留了少量网格问题。

一个完整示例

考虑一张带有雪点和建筑纹理的真实图像,以下是按原文流程展开的示意,不是额外实验。 教师在三种几何增强下各恢复一次,将输出逆变换对齐后,对三个候选分别进行多评价器评分和一致性检查。 通过检查的候选与历史标签合并,库中最多保留三个;学生训练时使用所选目标对应的条件,同时根据四个图像块的评分分配像素监督权重。 对同一输入,学生还产生高、低条件输出:高分分支不仅要胜过低分分支,也要受到教师最佳目标质量的向上锚定。 随后检查裁剪前后两条恢复路径的质量是否一致,防止网格纹理在一种尺度下骗过评价器。 最终部署时直接输入测试图像并设条件为 7;不需要知道这张测试图像的干净真值,也不把其恢复结果先送回标签库。

损失函数 / 训练策略

总体训练包含空间加权的像素 \(\ell_1\) 重建、基于 VGG 特征的感知损失、偏好目标以及裁剪质量一致性。 重建损失比较学生输出与库中相应伪标签,感知损失用于保留更高层的结构与外观信息;两者共同约束恢复内容,不能由 IQA 排序单独替代。 教师以 EMA 系数 0.998 更新;原文报告使用两张 NVIDIA A6000、AdamW、动量参数 \((0.9,0.999)\)、学习率 \(5\times10^{-5}\) 和 10K 次迭代。 由于高于 7 的伪标签稀少,作者把这些样本合并到同一个高质量空间,并把推理最高引导分数设为 7。 所以“连续质量条件”不意味着实验验证了任意大分数的可靠外推;实际控制范围受到训练支持度和这项合并策略限制。 缓存的式 (8) 与式 (11) 缺失若干运算符,无法准确复写偏好项的完整形式或各项权重;这些细节应回到可读公式或实现确认。 原文提供了代码地址,但表述为将发布代码,本笔记未据此断言代码已经可用。

实验关键数据

主实验

下表摘取原文表 1(第 11 页)的同骨干比较,均以 Colabator 为参照,不能当作所有方法、所有指标的统一排名。 真实测试集没有干净参考,结果主要衡量无参考感知质量;FADE 越低越好,其余所列指标越高越好。

任务 / 测试集 骨干 指标 Colabator QualiTeacher 差值
去雪 / RealSnow 10K-Test NAFNet HyperIQA 0.470 0.559 +0.089
去雪 / RealSnow 10K-Test NAFNet Q-Align 3.936 4.030 +0.094
去雾 / RTTS CORUN FADE 0.824 0.590 -0.234
去雾 / RTTS CORUN LIQE 2.946 3.317 +0.371
低光增强 / DICM SemiLL MFRQA 58.138 59.372 +1.234
水下增强 / Seathru AIM-Net URANKER 2.374 2.467 +0.093
去雨 / Real 3000 HistoFormer TOPIQ 0.520 0.508 -0.012
去雨 / Real 3000 HistoFormer LIQE 2.680 2.539 -0.141

去雪训练使用 Snow100K 配对数据与 RealSnow 10K-Train 非配对数据;低光实验沿用 SemiLL 设置,以 VE-LOL 训练、DICM 测试。 训练评价器是 MUSIQ、BRISQUE、CLIP-IQA,而主表使用另外一组评价器及任务指标,有助于避免只报告被直接优化的分数。 原文去雨叙述声称每项指标都超过对手,但表 1 中 TOPIQ、LIQE 低于同骨干 Colabator,MANIQA 两者均为 0.308;这里以表格数值为准。

消融实验

原文表 2(第 12 页)采用 NAFNet,在 RealSnow 10K-Test 上评估去雪;每一行按顺序增加组件,所列指标均越高越好。 这些是累加消融,不是每次独立删除一个模块,因此差值不能直接解释为与其他组件无关的净贡献。

配置 分数条件 偏好优化 裁剪一致性 Dual-Drop MANIQA ARNIQA HyperIQA Q-Align
(a) 0.329 0.574 0.452 3.850
(b) 0.341 0.601 0.510 4.001
(c) 0.352 0.613 0.535 4.021
(d) 0.358 0.620 0.543 4.027
(e) 0.362 0.628 0.559 4.030

关键发现

  • 分数条件对应 (a) 到 (b),HyperIQA 从 0.452 到 0.510,增加 0.058,是该表逐步添加中这一指标最大的单步增益。
  • 加入偏好优化后 MANIQA 从 0.341 到 0.352,但作者在图 5 中指出可能伴随网格伪影;再加裁剪一致性后升至 0.358,并报告视觉伪影减少。
  • 表 3(第 12 页)的人评包含 15 位参与者,按 0–5 分盲评;NAFNet 去雪的 Colabator 与 QualiTeacher 分别为 3.23、3.58,但正文未给出置信区间。
  • 表 5(第 14 页)将 ExDark 增强结果送入 YOLOv13,CIDNet 配合 Colabator 与 QualiTeacher 的 Mean AP 分别为 76.7、79.1,支持改善并非只体现在图像质量分数上。

亮点与洞察

  • 质量条件化区分了“这张标签是什么质量”与“我希望最终生成什么质量”。它把不完美监督的属性显式化,而不是默认所有伪标签都是真值。
  • 全局条件和局部权重具有互补性:前者控制目标档位,后者处理同一目标内部的可靠性差异,不能简单合并为一个样本权重。
  • 偏好间隔加向上锚定比单纯拉大高低输出差距更有针对性。后者可能通过破坏低分分支完成目标,前者要求高分分支也承担改善责任。
  • 裁剪一致性提供了跨处理顺序检查评价器捷径的思路。它是面向代理评分漏洞的正则化,而非无参考评分绝对正确的证明。

局限与展望

  • 作者在第 5 节承认仍有少量网格伪影,怀疑 MUSIQ-KonIQ 的摄影纹理偏好;替换成 TOPIQ 后图 8 中伪影消失,但这只是所展示案例的证据。
  • 评价器替换存在指标取舍:表 6 的 TOPIQ 版本 ARNIQA 为 0.614,低于默认版的 0.628,也低于 Colabator 的 0.620,不能概括为替换后所有指标都更优。
  • 从读者角度,NR-IQA、人评和检测收益支持感知有效性,却不能替代真实像素保真度证明;涉及文字、医学细节等内容时还需专门验证。
  • 分数归一化与条件 7 的尺度衔接、双阈值数值及损坏的偏好公式仍待可读原式或实现确认,不能仅靠当前文本无歧义复现。
  • 文中把轻量特征注入称为即插即用,但训练仍包含多个教师前向、多个 IQA 评价和标签库存储;缺少完整训练开销对照,不宜把推理轻量等同于训练便宜。
  • 可进一步独立检验评分范围之外的外推,以及用不参与训练的结构保真测试审计奖励投机;这是读者建议,不是本文已完成的实验。

相关工作与启发

  • 与 Mean Teacher 对比:保留 EMA 教师闭环,改变的是学生条件和监督组织,而非用一个独立巨型教师替代现有网络。
  • 与 Colabator 对比:两者都利用标签选择改善真实恢复;QualiTeacher 在保留标签库的同时引入质量条件和排序约束,因此不能把差异简化成“有无过滤”。
  • 与标准 DPO 对比:这里没有策略对数概率比,使用 IQA 分数差约束确定性输出。准确说法是受 DPO 启发的质量偏好优化,而不是直接套用原始 DPO 推导。
  • 研究启发:可以把可测的监督缺陷作为条件,而不是立即删除样本;迁移到其他任务前,应验证缺陷评分能否与语义正确性分离,避免把错误答案也当成可控风格。

评分

  • 新颖性: 4/5。把伪标签质量条件化,并为确定性恢复构造向上锚定的偏好目标,贡献较清晰。
  • 实验充分度: 4/5。覆盖五类恢复任务、多骨干、累加消融、人评和检测,但并非所有指标一致胜出。
  • 写作质量: 3/5。机制动机较明确,部分“全部领先”的叙述与表格不符,当前文本的公式提取也限制复现阅读。
  • 价值: 4/5。对利用真实无标注数据训练恢复模型有实践启发,但效果仍依赖评价器偏差和校准。