DisRM: Reward Modeling as Discriminative Prediction¶
会议: ECCV 2026
论文: ECCV 2026
领域: 图像生成
关键词: 奖励模型 / 判别式预测 / 偏好对齐 / 扩散模型 / 样本选择
一句话总结¶
DisRM 抛弃昂贵的人工成对偏好标注与繁琐的多维度工程,仅凭 500 张无标注代表性样本训练轻量判别器区分生成分布与目标分布,实现高质量奖励建模与生成器-奖励模型多轮协同演进。
研究背景与动机¶
视觉生成模型在后训练对齐(如 SFT、DPO)和推理期最佳样本选择(Best-of-N)中极度依赖奖励模型提供高质量指导。然而,构建可靠视觉奖励模型的代价极其高昂。主流范式(如 PickScore、ImageReward、HPSv2)依赖成对偏好数据集,动辄需要数十万至上百万人工标注的对比对;这种标注不仅成本巨大,而且难以随应用需求灵活定制。另一条路线试图通过手工设计多个维度的显式评价指标(美学、文本一致性、解剖结构合理性等)并加权融合,但这又引入了严重的“维度工程”负担,不仅权重难以调优,还极易与真实人类偏好发生漂移。
这一困境的核心矛盾在于:现有奖励模型强行要求显式的人工比较判断或预先定义详尽的评价维度,而在许多现实场景中,人类直觉往往能够轻而易举地挑出一小组“这就是我想要的高质量范例”,却难以将这种直觉拆解成精准评分规则或完成百万次细粒度二选一。此外,采用静态偏好数据的传统对齐范式(如标准 DiffusionDPO)仅支持单轮微调;一旦生成器性能提升,旧偏好数据便无法提供更具挑战性的梯度,导致对齐陷入停滞甚至过拟合。
本文的切入角度是重构奖励建模的目标形式:无需人工比较两张生成图谁优谁劣,只需训练一个判别器去区分“预设的目标偏好范例”与“当前生成器的输出”。核心 idea:将奖励建模重构为轻量判别式预测任务,仅依赖数百张无标注的偏好代理数据(PPD),通过区分目标分布与生成分布隐式学习偏好,并利用生成器演进自然构造难负样本以驱动多轮协同后训练。
方法详解¶
整体框架¶
DisRM 的整体管线围绕生成器 \(G_t\) 与判别式奖励模型 \(R_t\) 的闭环迭代展开。系统以极小规模的偏好代理数据集 \(D_p\)(如 500 张来自高质量源的图像,无需任何成对标注)为基准。在每一轮训练中,冻结的视觉基础模型提取图像特征,由轻量奖励投影层(RPL)判别样本属于 \(D_p\) 还是生成器输出,并经由基于排名的自举增强扩充训练样本。训练就绪的 DisRM 既可直接用于推理阶段的 Best-of-N 候选打分筛选,也可为当前批次生成输出标注偏好对,驱动生成器完成 SFT 或 DPO 更新。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["偏好代理数据 (PPD) & 生成器输出"] --> B["偏好代理数据与判别式奖励建模<br/>CLIP 特征 + RPL 判别头区分目标分布与生成输出"]
B --> C["基于排名的自举增强<br/>置信生成样本重打分,自适应伪标签扩充数据"]
C --> D["协同演进的多轮对齐训练<br/>打分筛选最优样本 (Best-of-N) 或构造偏好对更新生成器"]
D -->|更新后的生成器产生更强负样本| B
关键设计¶
1. 偏好代理数据与判别式奖励建模:以单类代表范例替代百万成对比较 针对成对偏好标注成本巨大且主观性强的痛点,DisRM 提出了偏好代理数据(Preference Proxy Data, PPD)概念。在图像质量对齐任务中,PPD 仅包含从高质量合成源(如 JourneyDB)随机抽取的 \(N=500\) 张无标注正例图像 \(D_p = \{x_i^+\}_{i=1}^N\);在安全对齐中则直接使用合成的安全图像。该阶段无需人工打分或成对偏好标签。为了从极少量数据中稳健提取表征,DisRM 复用预训练视觉编码器(如 CLIP-Vision 或视频领域的 ViCLIP)提取深层特征,其后接入一个带有归一化层的多层感知机,即奖励投影层(Reward Projection Layer, RPL)。模型通过二元交叉熵损失最小化判别误差:
其中 PPD 样本的真实标签为 \(y=1\),生成器输出的原始负样本标签为 \(y=0\)。RPL 经 softmax 后的正类置信度即作为样本的偏好奖励得分 \(r(x) = \text{softmax}(\text{RPL}(\text{CLIP-Vision}(x)))_1\)。这种判别式设定成功将复杂的质感、构图、美学特征内化到判别边界中,摆脱了人工拆解维度的繁琐工程。
2. 基于排名的自举增强:最大化有限数据的泛化效用 由于初始 PPD 仅有区区几百张样本,直接训练判别器极易在生成器复杂的输出空间中产生过拟合或欠拟合。DisRM 引入了基于排名的自举增强策略(Rank-based Bootstrapping)。在初始判别器训练完成后,使用更多提示词让当前生成器产出大批候选图像,并用 DisRM 进行打分与排名。从中筛选出得分最高的 \(M\) 个样本作为伪正例集 \(D_f^+\),得分最低的 \(M\) 个样本作为伪负例集 \(D_f^-\)。为了避免对伪正例武断赋予硬标签 1,算法根据样本在得分序列中的排名 \(r\) 计算指数衰减软标签:
超参数 \(\alpha > 0\) 控制置信度随排名的衰减速率。伪负例则保持硬标签 0。将原始数据集 \(D_r\) 与自举增强集 \(D_f^+ \cup D_f^-\) 合并后重新训练 DisRM。此机制利用模型自身的置信度梯度提炼出贴近目标分布的高质量生成结果,显著拓宽了奖励模型在生成分布支撑集上的辨识鲁棒性。
3. 协同演进的多轮对齐训练:难例动态驱动闭环优化 传统直接偏好优化(如 DiffusionDPO)依赖静态偏好数据集,训练一轮后便失去提升动力;而使用固定奖励模型进行多轮微调又极易引发“奖励黑客”(Reward Hacking)现象。DisRM 构建了一个生成器与奖励模型相互促进的协同演进闭环。在第 \(t\) 轮训练中,固定不变的 PPD \(D_p\) 充当恒定的高维灯塔,而生成器 \(G_t\) 生成的一组样本被 DisRM \(R_t\) 评估。对于每个提示词,系统提取最高分样本 \(x_h\) 与最低分样本 \(x_l\):不仅可直接作为最佳候选用于推理(Best-of-N),还可构建偏好微调对 \((x_h, x_l)\) 用于 DPO,或仅保留 \(x_h\) 进行监督微调(SFT)。当生成器演进至 \(G_{t+1}\) 时,其生成质量更加逼近 PPD,输出的样本自然转变为针对判别器更具挑战性的“难负例”,促使下一轮 DisRM \(R_{t+1}\) 进一步微调其决策边界,实现无额外人工介入下的多轮持续提升。
实验关键数据¶
主实验¶
DisRM 在 Stable Diffusion 1.5 和 SDXL 上分别验证了 Best-of-N 样本选择(Ours-RM@10)、SFT 与 DPO 的性能。评估涵盖分布保真度(FID)、人类偏好度(ImageReward、PickScore、HPS)以及图文对齐度(CLIPScore)。
| 模型 | 优化方法 | 偏好数据来源 | 数据规模 | FID↓ | ImageReward↑ | PickScore↑ | HPS↑ | CLIPScore↑ |
|---|---|---|---|---|---|---|---|---|
| SD1.5 | Base-model | - | - | 72.06 | -0.040 | 19.460 | 0.277 | 0.698 |
| SD1.5 | SPO | PickScore | 1M 对 | 70.19 | 0.310 | 20.248 | 0.262 | 0.666 |
| SD1.5 | DiffusionDPO | Pickapic | 1M 对 | 68.15 | 0.180 | 19.869 | 0.281 | 0.709 |
| SD1.5 | DiffusionNPO | PickScore | 1M 对 | 71.60 | -0.017 | 19.520 | 0.272 | 0.684 |
| SD1.5 | Ours-RM@10 | DisRM | 0.5k 无标注 | 68.51 | 0.072 | 19.650 | 0.282 | 0.703 |
| SD1.5 | Ours-SFT | DisRM | 0.5k 无标注 | 64.98 | 0.217 | 19.980 | 0.284 | 0.720 |
| SD1.5 | Ours-DPO | DisRM | 0.5k 无标注 | 63.61 | 0.240 | 20.032 | 0.281 | 0.710 |
| SDXL | Base-model | - | - | 62.83 | 0.790 | 21.235 | 0.293 | 0.744 |
| SDXL | DiffusionDPO | Pickapic | 1M 对 | 63.24 | 1.033 | 21.628 | 0.301 | 0.765 |
| SDXL | Ours-RM@10 | DisRM | 0.5k 无标注 | 62.05 | 0.890 | 21.311 | 0.297 | 0.753 |
| SDXL | Ours-SFT | DisRM | 0.5k 无标注 | 61.74 | 0.915 | 21.275 | 0.297 | 0.756 |
| SDXL | Ours-DPO | DisRM | 0.5k 无标注 | 61.95 | 0.893 | 21.305 | 0.296 | 0.753 |
在跨模型偏好数据标注对比中(同样采用 10,000 对偏好数据微调 SD1.5):ImageReward 标注的微调虽将 IR 刷至 0.186,但 FID 退化为 72.59 且 CLIPScore 降至 0.686;PickScore 标注的微调 PickScore 达 19.849 但 FID 仅为 70.97。DisRM 标注的 DPO 实现了最均衡的增益(FID 最佳 67.42,IR 0.131,PS 19.715,CLIPScore 0.702),有效避免了对单一评价指标的过拟合。
消融实验¶
消融实验深入考察了奖励模型训练策略对样本选择性能的影响,以及多轮迭代 DPO 对生成能力带来的渐进式提升。
| 配置 | 训练策略 / 轮次 | FID↓ | ImageReward↑ | PickScore↑ | HPS↑ | 说明 |
|---|---|---|---|---|---|---|
| 单模型检查点 | Naiive | 14.48 | 0.048 | 19.612 | 0.280 | 固定步数训练后的单一检查点 |
| 检查点平均 | Average | 14.56 | 0.067 | 19.624 | 0.280 | 定期检查点权重平均 |
| 检查点投票 | Voting | 14.61 | 0.063 | 19.618 | 0.281 | 多个检查点打分投票集成 |
| 自举增强 (DisRM) | Bootstrap | 14.18 | 0.071 | 19.651 | 0.282 | 排名自举生成软标签重训,效果最强 |
| 迭代对齐基线 | Base model | 72.06 | -0.037 | 19.467 | 0.277 | 初始未对齐 SD1.5 生成器 |
| 第 1 轮对齐 | Round 1 | 66.20 | 0.099 | 19.631 | 0.279 | 相比基线 FID 降 5.86 点,各指标全面起步 |
| 第 2 轮对齐 | Round 2 | 64.98 | 0.223 | 19.960 | 0.281 | 难负例重塑判别边界,IR 显著翻倍 |
| 第 3 轮对齐 | Round 3 | 63.61 | 0.240 | 20.032 | 0.282 | 持续收敛提升,三轮累计 FID 优化 8.45 点 |
关键发现¶
- 极致的数据效率:DisRM 仅用 500 张无标注 PPD 图像,在 SD1.5 上的 DPO 微调取得了 63.61 的 FID,远优于使用 100 万人工标注成对数据的 DiffusionDPO(68.15)与 DiffusionNPO(71.60);在独立用户盲测中,Ours-DPO 相对 SD1.5 胜率高达 74.4%,与人类偏好的一致率达到 70.5%。
- 奖励多指标平衡性:如对比实验所示,使用针对单一指标训练的成熟奖励模型(如 ImageReward 或 PickScore)容易诱发作弊与退化;DisRM 判别式特征直接源自真实优秀范例,学到的奖励信号更加平滑全面,不会盲目牺牲图文相关性去换取孤立指标的飙升。
- 广泛的应用泛化性:在安全对齐任务上,以合成安全图像为 PPD,SD1.5 和 SDXL 的不当内容生成概率(Inappropriate Probability, IP)分别由 42/51 锐减至 18/17;在视频生成任务(VideoCrafter2)中,仅用 500 段 Artgrid 视频训练的 DisRM-DPO 将 FVD 从 1021.77 压降至 983.28,VBench 达到 81.38,全面超越纯基线。
亮点与洞察¶
- 范式颠覆(成对比较转向单类判别):摆脱了强化学习偏好对齐对大规模对比标注数据的执念,证明了“区分正例与生成样本”的单类判别足以提供高度鲁棒的偏好梯度。
- 软标签自举平滑伪标签噪声:设计排名指数衰减 \(y=e^{-\alpha r}\) 赋予自举样本软置信度,不仅解决了硬伪标签导致的确认偏差,还巧妙构建了模型输出空间的平滑密度比估计。
- 天然契合多轮演进的博弈结构:固定的 PPD 与动态生成的负样本之间形成类似 GAN 的隐式博弈,每次生成器变强都自动给奖励模型喂入难例,无需重新采集数据即可打破单轮对齐的天花板。
局限与展望¶
- PPD 分布覆盖与多样性敏感度:虽然 500 张样本即可工作,但若 PPD 自身存在风格偏置(如偏向特定艺术画风或某种色调),奖励模型可能会引导生成器牺牲内容多样性。
- 强依赖预训练编码器表征:判别器严重依赖 CLIP 或 ViCLIP 的预训练视觉特征空间,若目标偏好维度(如细微物理因果、文字渲染准确性)未被骨干网络充分表征,判别边界可能出现盲区。
- 动态更新的稳定性边界:多轮迭代中奖励模型与生成器的更新步长需要精心匹配,轮次过多时仍需探索更严格的 KL 散度约束机制以防模式崩溃。
相关工作与启发¶
- vs DiffusionDPO [50] / D3PO [58]: 传统扩散模型 DPO 依赖静态的百万级离散偏好数据集,仅支持单轮离线微调且受限于标注质量;DisRM 将 DPO 作为下游消费端,自身负责动态、持续生成成对偏好标签,实现多轮闭环微调。
- vs ImageReward [57] / PickScore [21]: 现有奖励模型需耗费百万人工对比或专家打分,且容易发生指标过拟合(Reward Hacking);DisRM 仅需数百张目标范例,判别式信号更均衡全面,泛化性更强。
- vs VideoDPO [28]: VideoDPO 依赖庞大复杂的专家视觉模型阵列进行繁琐的“维度工程”打分;DisRM 仅用 500 段参考视频便在 ViCLIP 上训练出紧凑奖励头,以极低算力取得了相当的 VBench 对齐增益。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 颠覆成对偏好标注范式,将奖励建模创新地重构为基于极少范例的判别式自举学习。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 SD1.5、SDXL、VideoCrafter2,横跨图像美学、安全对齐与视频生成三大维度,并包含详实的消融与用户盲测。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑层次分明,方法阐述清晰,实验对比扎实自洽。
- 价值: ⭐⭐⭐⭐⭐ 大幅削减视觉模型对齐的人工标注门槛,为生成模型低成本、多轮次后训练提供了通用且高效的新路径。