DRPO: Disentangling Demographic Bias from Rewards for Fair Diffusion Alignment¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 扩散模型, 偏好对齐, 奖励模型偏见, 算法公平性, 特征正交投影
一句话总结¶
针对偏好优化(PO)对齐扩散模型时会放大奖励模型内嵌人口统计学偏见导致生成群体多样性严重坍塌的问题,DRPO 通过线性探测与 SVD 提取奖励特征空间中的人口属性偏见子空间,并在奖励推理前施加正交投影,零侵入地实现了保质量且高公平性的扩散模型对齐。
研究背景与动机¶
近年来,文本到图像扩散模型广泛采用基于人类反馈的偏好优化技术(如 Diffusion-DPO、DanceGRPO 等),利用 HPS、PickScore 或 ImageReward 等预训练偏好奖励模型来微调生成策略,显著提升了画质与图文对齐度。然而,主流奖励模型普遍依赖 CLIP 视觉编码器,而这类视觉主干网络被大量既往工作证实内嵌严重的人口统计学刻板印象(如种族、性别、年龄等偏见)。
当生成策略以最大化这类标量奖励为目标进行迭代时,偏好优化会不可避免地利用并放大这些内嵌偏见:在生成通用人像描述(如“a photo of a person”)时,少数群体的生成占比在 GRPO 对齐后剧烈下降约 40%,种族多样性熵呈单调持续坍塌。更值得警惕的是,现有的多样性保持方案(如引入子集采样或多样性探索奖励的 DRIFT、DiverseGRPO)虽然成功维持了姿态、背景与艺术风格等视觉表象的多样性,却对人口分布的偏见坍塌束手无策——视觉多样性(Visual Diversity)与人口统计学公平性(Demographic Fairness)在特征表征上属于相互独立的两个空间。其深层根源在于奖励特征层面:线性探测实验表明,仅凭奖励特征便能以远超随机猜测的精度预测种族与性别标签,使得 14%~22% 的奖励方差直接归因于人口统计学属性而非实际图像生成品质。
为了阻断这一捷径学习通道,必须从偏好奖励信号的源头切断人口属性与质量评估的纠缠。本文的核心 idea 是:在特征层通过轻量级线性探测与奇异值分解(SVD)精确定位奖励编码器中的低维人口属性子空间,并在送入标量评分头前施加正交补投影将其剔除,以零训练侵入、即插即用的方式为任意偏好优化算法提供无偏奖励信号。
方法详解¶
整体框架¶
DRPO 的设计核心在于将奖励模型中的质量评估表征与人口统计学特征显式解耦。方法分为两个阶段:第一阶段为单次离线准备(Stage 1: Demographic Subspace Identification),利用基础扩散模型在无人口倾向的中性提示词下生成一批样本,借助自动人脸属性分类器(FairFace)打标并训练线性分类探测器,通过 SVD 提取出主导人口属性特征的 \(k\) 维标准正交基子空间 \(\mathbf{V}_k\);第二阶段为在线对齐训练(Stage 2: PO Training with Debiased Rewards),在常规的 DPO 或 GRPO 优化迭代中,每当奖励编码器提取图像特征后,先通过正交投影矩阵 \(\mathbf{P}_\perp\) 消除投影在 \(\mathbf{V}_k\) 上的偏见成分,再将去偏特征送入评分头输出标量奖励,驱动扩散策略更新。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
subgraph S1["离线准备阶段:人口偏见子空间提取"]
direction TB
A["中性提示词采样生成图像"] --> B["FairFace 自动打标 + 奖励特征提取"]
B --> C["人口属性子空间提取<br/>线性探测权重 SVD 分解"]
end
subgraph S2["在线对齐阶段:去偏奖励优化"]
direction TB
D["扩散模型采样图像组"] --> E["CLIP 视觉编码器提取特征"]
C -.->|"提供正交基 Vk"| F
E --> F["特征级正交投影去偏<br/>P⊥ = I - VkVk^T"]
F --> G["MLP 评分头计算去偏标量奖励"]
G --> H["策略梯度更新扩散策略<br/>兼容 GRPO / DPO 目标"]
end
关键设计¶
1. 人口属性子空间提取:探测特征空间中的线性偏见方向
为了从根本上消除奖励对特定群体的偏好,首先必须精确定位偏见在奖励高维表征中的几何分布。实验探测表明,非线性双层 MLP 探测器相较于简单线性分类器在种族与性别预测准确率上仅高出 0.6%~1.8%,这一极小差距证实人口信息在 CLIP 奖励特征空间中呈高度线性编码。基于此性质,DRPO 采样 10,000 张中性提示词图像并用 FairFace 标注类别标签,训练线性权重矩阵 \(\mathbf{W} \in \mathbb{R}^{C \times d}\)(\(C\) 为人口类别数,\(d\) 为特征维度)。随后对权重矩阵进行奇异值分解:
截取前 \(k\) 个最大奇异值对应的右奇异向量构成标准正交基矩阵 \(\mathbf{V}_k = [\mathbf{v}_1, \dots, \mathbf{v}_k] \in \mathbb{R}^{d \times k}\)。这 \(k\) 个正交方向张成了最能区分人口属性的敏感子空间。作者分析显示,该子空间与代表画质的特征方向之间夹角均值高达 \(\theta_{\min} = 72.4^\circ\),说明在几何上人口属性与画质表征几乎正交,为无损分离奠定了理论前提。
2. 特征级正交投影去偏:即插即用的无偏奖励计算
定位偏见基底后,若仅在最终输出标量分数上执行简单的群体均值中心化(Output-level),会因为非线性评分头的纠缠而丢失判别细度。DRPO 选择在特征流进入评分头之前进行截断。定义正交补投影算子 \(\mathbf{P}_\perp = \mathbf{I} - \mathbf{V}_k \mathbf{V}_k^\top\),对输入图像 \(\mathbf{x}\) 提取的原始特征 \(\phi(\mathbf{x})\) 进行线性变换:
变换后的去偏特征 \(\tilde{\phi}(\mathbf{x})\) 被送入预训练好的 MLP 评分头 \(h\),得到修正后的奖励分数 \(\tilde{r}(\mathbf{x}) = h(\tilde{\phi}(\mathbf{x}))\)。由于仅剔除了 \(d=1024\) 维中极小维数(如 \(k=5\)),特征向量范数的扰动通常小于 3%,既抹去了绝大部分主导偏见(使探测器分类精度归零至随机水平,且解释方差 \(R^2\) 骤降至 0.01),又完整保留了评分头对于构图、细节与质感的鉴赏能力。整个去偏过程每步仅增加一次单次矩阵乘法,引入的计算开销小于训练总耗时的 0.1%。
损失函数 / 训练策略¶
计算得到去偏奖励 \(\tilde{r}(\mathbf{x})\) 后,直接替换原本的奖励标量。以 DanceGRPO 为例,对单提示词下采样的 \(K\) 张图像计算组内优势函数:
并代入策略梯度目标中优化扩散策略参数 \(\theta\);若采用 Diffusion-DPO,则基于 \(\tilde{r}\) 对图像进行成对排序后计算隐式偏好损失。整个优化循环无需在微调中引入任何人口统计标注或修改策略网络结构,亦无需引入额外的对抗正则项。
实验关键数据¶
主实验¶
在 SDXL 骨干网络与 500 个中性提示词(涵盖职业、日常场景与肖像,共生成 10,000 张图像)上的评测结果见下表(摘自原文 Table 2)。对比基线包括未经对齐的 Base SDXL、标准对齐方法(Diff-DPO、DanceGRPO)、通用多样性对齐方法(DRIFT、DiverseGRPO)以及推理期公平干预(ITI-GEN+GRPO)。
| 方法 | HPS-v2↑ | PickScore↑ | ImageReward↑ | FID↓ | Vendi↑ | 种族熵 (Race-H)↑ | 性别熵 (Gen-H)↑ | DPD↓ | 最差群体率 (WGR)↑ |
|---|---|---|---|---|---|---|---|---|---|
| Base SDXL | 25.81 | 20.14 | 0.42 | 44.7 | 0.44 | 1.74 | 0.97 | 0.18 | 0.08 |
| Diff-DPO | 27.08 | 21.27 | 0.81 | 40.3 | 0.37 | 1.08 | 0.78 | 0.41 | 0.02 |
| DanceGRPO | 27.42 | 21.63 | 0.93 | 38.9 | 0.34 | 0.89 | 0.69 | 0.49 | 0.01 |
| DRIFT | 27.18 | 21.41 | 0.87 | 33.1 | 0.73 | 0.93 | 0.72 | 0.46 | 0.02 |
| DiverseGRPO | 27.29 | 21.52 | 0.90 | 33.8 | 0.71 | 0.96 | 0.73 | 0.44 | 0.02 |
| ITI-GEN+GRPO | 26.84 | 21.08 | 0.79 | 39.2 | 0.40 | 1.43 | 0.88 | 0.27 | 0.05 |
| DRPO (w/ DPO) | 26.93 | 21.19 | 0.78 | 37.4 | 0.62 | 1.61 | 0.94 | 0.21 | 0.07 |
| DRPO (w/ GRPO) | 27.31 | 21.54 | 0.91 | 35.9 | 0.67 | 1.67 | 0.96 | 0.19 | 0.07 |
消融实验¶
基于 SDXL + GRPO 对投影子空间维度 \(k\)、去偏层级以及打标器鲁棒性进行了全面消融验证(摘自原文 Table 3):
| 消融配置项 | 变体分支 | 质量得分 (HPS-v2)↑ | 种族熵 (Race-H)↑ | 最小主夹角 \(\theta_{\min}\) | 说明 |
|---|---|---|---|---|---|
| 基线(无投影) | DanceGRPO | 27.42 | 0.89 | — | 偏见严重放大,种族熵降至 0.89 |
| 投影维度 \(k\) | \(k=1\) | 27.39 | 1.34 | — | 恢复部分公平性 |
| 投影维度 \(k\) | \(k=3\) | 27.35 | 1.58 | — | 明显平衡 |
| 投影维度 \(k\) | \(k=5\) (默认) | 27.31 | 1.67 | 72.4° | 兼顾极佳画质(-0.11)与最高公平性 |
| 投影维度 \(k\) | \(k=10\) | 27.14 | 1.69 | — | 公平性微弱上升,画质掉点加快 |
| 去偏层级 | 输出级(群体均值差) | 27.38 | 1.23 | — | 标量去偏无法阻断高维捷径 |
| 去偏层级 | 特征级正交投影 (本文) | 27.31 | 1.67 | 72.4° | 几何解耦彻底,公平性指标大幅领先 |
| 分类器鲁棒性 | CLIP zero-shot 代替 FairFace | 27.33 | 1.59 | — | 不依赖单一分类器标注 |
| 分类器鲁棒性 | FairFace + 20% 标签噪声 | 27.32 | 1.56 | — | 容忍弱监督标签噪声 |
关键发现¶
- 对齐加剧偏见的单调性:标准 GRPO 对齐过程中,种族熵从初始 1.74 单调骤降至 0.89,降幅达 49%;最差群体生成率从 8% 跌落至仅 1%,模型在极早训练阶段就抓取了奖励模型中的群体捷径。
- 视觉多样性与人口公平性解耦:DRIFT 与 DiverseGRPO 虽将 Vendi 视觉多样性得分从 0.34 推高至 0.73/0.71,但种族熵仅为 0.93/0.96,几乎与原版 GRPO 一致,证实泛化的多样性正则化无法解决人口偏见。
- 主观质量无损:在 900 组双盲 2AFC 人类评测中,DRPO 相较 DanceGRPO 的偏好率为 47.3%(95% CI [41.6, 53.0]),统计上无显著画质差异;相较 Base SDXL 则达到 72.1% 的偏好胜率,成功保全了偏好对齐带来的画质跃升。
亮点与洞察¶
- 偏见放大机理的准确定位:敏锐地揭示了人类偏好对齐中“模型质量提升伴随人口代表性萎缩”的核心矛盾,指明了 CLIP 奖励模型在特征层内嵌人口偏差是偏好坍塌的本质根因。
- 极简而优雅的投影解耦机制:无需繁重的对抗训练、重采样约束或提示词微调,仅靠一次性离线 SVD 提取 \(k=5\) 个正交方向并在推理流中执行低秩正交补投影,便实现了质量与公平性的解耦。
- 跨优化框架与跨奖励泛化:DRPO 属于完全前置于损失函数计算的通用插件,既能配合 DPO 等离线对齐,也能驱动 GRPO 在线迭代;跨奖励评测(HPS 训练、PickScore/ImageReward 评估)显示画质提升具备普遍性。
局限与展望¶
- 依赖预训练面部属性标注器的分类体系:离线准备阶段使用 FairFace 划分 7 类种族与 2 类性别,受到预定义离散类别的局限,无法充分刻画非二元性别及细粒度族裔交织特征。
- 线性子空间假设的理论上限:正交投影基于偏见呈线性编码的先验,虽然在当前 CLIP 特征中表现极其优异(非线性探测残差极小),但面对更复杂非线性多模态表征时可能需要引入核方法或流形去偏。
- 基模固有偏见的非治愈性:DRPO 旨在防止偏好对齐过程“放大”偏见,使模型恢复至未对齐基模的平衡水平,但并不对基模本身固有的历史分布偏差进行主动纠偏补偿。
相关工作与启发¶
- vs DRIFT / DiverseGRPO: 后两者关注画面的风格、视角与背景多样性,通过采样集覆盖率或潜空间散度进行正则,忽视了奖励信号内部的 demographic shortcut;DRPO 直击偏见源头,两者可无缝叠加形成全方位多样性保护。
- vs ITI-GEN / FairDiffusion: ITI-GEN 在推理期对提示词嵌入进行干涉,容易与文本对齐产生冲突破坏生成保真度(HPS 下降 2.1%);FairDiffusion 在去噪轨迹上加约束,计算复杂且在微调后模型上补偿能力受限。DRPO 在训练阶段重塑奖励地形,赋予模型原生的公平生成能力。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次揭示偏好对齐过程中奖励特征偏见被策略梯度放大的现象,并提出优雅的特征正交投影解耦机制。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 DPO 与 GRPO 双对齐范式、两代 Stable Diffusion 骨干、6 种主流基线、特征探测分析以及严谨的双盲人类实验。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨闭环,从现象揭示、机理探测到方法设计层层递进,动机非常清晰。
- 价值: ⭐⭐⭐⭐⭐ 为生成式大模型在追求高质量对齐的同时保障算法伦理与社会公平性提供了简单高效且低算力开销的范本。