跳转至

Self-Improving Diffusion Classifiers with Minority Preference Optimization

会议: ECCV 2026
论文: ECCV 原文
PDF: Conference PDF
领域: 模型压缩
关键词: 扩散分类器、少数派采样、强化学习、组相对策略优化、参数高效微调

一句话总结

提出自提升少数派偏好优化框架 MiPO,仅利用无标注文本提示与 Tweedie 逆近似少数派奖励,通过 LoRA 和选择性组相对策略优化增强低密度区域表征,在零下游图像和零外部奖励模型下显著提升扩散分类器的零样本感知与鲁棒性。

研究背景与动机

近年来,扩散模型在高质量图像生成领域取得了巨大突破,并进一步扩展到视觉感知与理解任务中。作为代表性范式,扩散分类器(Diffusion Classifier, DC)巧妙利用条件去噪误差评估类条件似然,展现出优异的零样本分类能力、天然的分布外(OOD)鲁棒性以及对虚假快捷特征的免疫性。然而,扩散分类器的感知能力高度受制于预训练数据的生成覆盖范围:标准扩散模型基于噪声匹配损失进行优化,这种均方误差目标天然偏向高密度的主流样本(多数派群体),而在低密度长尾模式(少数派群体)上表征脆弱、去噪不确定性极高,导致扩散分类器在识别低密度小众概念时准确率严重滑坡。

面对扩散模型的少数派采样缺陷,现有研究大多依赖推理期引导,例如训练辅助分类器提供梯度引导,或者针对每个输入文本提示进行耗时的逆向优化(如 MinorityPrompt)。这些方案面临两大致命瓶颈:其一,单张图像生成耗时长达数十秒,计算开销巨大,无法规模化落地;其二,推理期引导完全不更新底层扩散模型的骨干参数,模型的内部表征与隐空间先验保持原样,无法将生成端的多样性提升转化为分类器的感知判别增益。受理查德·费曼名言“我所无法创造的,我就未能理解”所启发,扩散分类器的识别盲区本质源于其生成流形对少数派模式的覆盖匮乏。

为了彻底打破生成偏置与感知受限的恶性循环,本文提出让扩散模型在无需额外真实图像与外部奖励标注的前提下实现自主探索与自我提升。核心 idea:将 Tweedie 逆近似重构误差转化为内在少数派偏好奖励,利用组相对策略优化(GRPO)结合 LoRA 适配器仅微调早期关键扩散步,辅以 KL 散度约束在不破坏主流生成先验的前提下主动拓宽低密度流形覆盖,实现零外部监督的自提升扩散分类。

方法详解

整体框架

MiPO 的核心设计是将少数派偏好优化转化为无需外部评测模型的强化学习对齐任务。输入仅为任意通用的文本提示集(如 HPSv2 提示词),完全不需要下游分类数据集的图像输入。针对每个文本提示,模型使用相同初始随机噪声采样一组平行的随机微分方程(SDE)去噪轨迹。生成样本后,系统利用预训练去噪网络计算中间步的 Tweedie 逆近似重构误差作为内在少数派奖励;接着在提示组内执行相对归一化计算优势函数,并施加 Kullback–Leibler(KL)正则化惩罚以防流形漂移;最后通过 LoRA 仅更新前 40% 时间步的去噪策略。

整个方法的阶段流向与核心模块协同机制如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入文本提示集<br/>无标注通用 Prompts"] --> B["多轨迹 SDE 采样<br/>同初始噪声生成候选样本组"]
    B --> C["DDIM 逆近似少数派偏好奖励<br/>Tweedie 误差度量流形稀疏度"]
    C --> D["组相对策略优化<br/>组内优势归一化与 LoRA 梯度更新"]
    D --> E["保持先验稳定的 KL 正则约束<br/>对齐预训练先验防止奖励黑客"]
    E --> F["早期时间步选择性策略更新<br/>仅更新前 40% 粗粒度语义步骤"]
    F --> G["自提升扩散分类器<br/>少数派表征增强的零样本判别"]

关键设计

1. DDIM 逆近似少数派偏好奖励:无需外部模型的低密度流形度量 针对传统 RLHF 依赖大规模外部多模态奖励模型(如 CLIPScore、ImageReward、PickScore)且无法直接刻画生成流形密度分布的困境,本文基于 Tweedie 公式与 DDIM 单步逆重构构建自监督少数派奖励函数。对于给定提示词 \(c\) 下生成的候选图像 \(\mathbf{x}_0\),模型首先注入高斯噪声 \(\bm{\epsilon} \sim \mathcal{N}(0, \mathbf{I})\) 得到中间扩散步 \(t\)(实验固定取 \(t = 0.9T\),确保充分暴露去噪不确定性同时保留高层拓扑语义)的扰动潜变量 \(\mathbf{x}_t = \sqrt{\bar{\alpha}_t}\mathbf{x}_0 + \sqrt{1 - \bar{\alpha}_t}\bm{\epsilon}\)。随后利用未微调的预训练扩散模型预测噪声并执行单步 DDIM 重建: $\(\hat{\mathbf{x}}_0 = \frac{\mathbf{x}_t - \sqrt{1 - \bar{\alpha}_t}\bm{\epsilon}_{\text{pre}}(\mathbf{x}_t, c, t)}{\sqrt{\bar{\alpha}_t}}\)$ 少数派奖励直接定义为重构图像与生成图像之间的欧氏距离 \(\mathcal{M}(\mathbf{x}_0) = \|\hat{\mathbf{x}}_0 - \mathbf{x}_0\|_2\)。若样本落在高密度主流区域,预训练去噪器能精确预测噪声使得重构误差极小;反之,若样本落在训练集罕见的少数派模式,去噪网络的高不确定性将导致显著的重构残差,从而赋予高奖励。该机制完全内生于扩散网络本身,无需外部监督即可精准探测低密度流形边界。

2. 组相对策略优化:无额外图像的自提升策略梯度 为摆脱对外部价值网络(Critic)的依赖并降低策略梯度的估计方差,本文引入组相对策略优化(GRPO)并将优化范围约束在轻量化 LoRA 适配器参数 \(\theta\) 上。对于同一提示词 \(c\) 衍生出的 \(G\) 条 SDE 轨迹,其终端生成样本获得对应的少数派奖励 \(\{r^{(g)}\}_{g=1}^G\)。模型计算组内均值与标准差,得出每条轨迹的组相对优势标量: $\(A^{(g)} = \frac{r^{(g)} - \text{mean}\big(\{r^{(j)}\}_{j=1}^G\big)}{\text{std}\big(\{r^{(j)}\}_{j=1}^G\big)}\)$ 该设计使优化过程对奖励绝对尺度的波动与异构提示词分布完全不变,天然驱使当前批次中相对更具少数派特征的轨迹获得正向优势加权,而主流样本轨迹被赋予负向抑制。模型在去噪动作空间根据重要性采样比率 \(\rho_{t,i}(\theta) = \frac{\pi_\theta(a_{t,i}|x_{t,i})}{\pi_{\theta_{\text{old}}}(a_{t,i}|x_{t,i})}\) 执行 PPO 风格的裁剪代理目标优化,使得 LoRA 权重能够平滑调整流形边界而不破坏模型原有表征容量。

3. 保持先验稳定的 KL 正则约束:防止奖励黑客与流形漂移 过度追求少数派模式往往伴随着极大的模式漂移风险——策略极易陷入“奖励黑客(Reward Hacking)”,生成充满伪影、高频噪声或视觉畸变的无意义图案以骗取极大的 DDIM 重构误差。为此,整体优化目标在少数派目标 \(\mathcal{J}_{\text{Minority}}(\theta)\) 之外显式引入与预训练基座策略 \(\pi_{\text{pre}}\) 的 Kullback–Leibler 散度约束: $\(\mathcal{J}(\theta) = \alpha \mathcal{J}_{\text{Minority}}(\theta) - \beta D_{\text{KL}}(\pi_\theta \| \pi_{\text{pre}})\)$ 文中将权重设为 \(\alpha = 0.7\) 与 \(\beta = 0.15\)。该正则化项充当锚定基座流形的弹性拉索,严厉惩罚远离原始知识分布的行为,确保模型在向低密度区域延展覆盖的同时,完全保留主流高密度模式的视觉真实度与生成保真度。

4. 早期时间步选择性策略更新:聚焦粗粒度语义结构形成期 在传统扩散强化学习中,对全轨迹 \(T\) 个时间步同时反向传播计算代价极其高昂,且各时间步对高层感知表征的贡献截然不同。近期研究表明扩散过程遵循“先高层语义、后低层细节”的动力学演化规律。本文采取选择性策略优化,仅在前 40% 的去噪步骤(例如总共 50 步调度中仅更新 \(t \in [0, 20]\) 对应的早期阶段)计算策略梯度与更新 LoRA 参数。早期步骤决定了物体的类别属性、大尺度构图与罕见语义概念的生成走向,而后 60% 的步骤则主导高频纹理与局部平滑。将微调限制在早期不仅节省了过半的显存与计算开销,更避免了策略更新对像素级纹理的过拟合,最大化了表征泛化到分类感知任务的收益。

损失函数 / 训练策略

训练过程采用 HPSv2 的 100k 条清洗文本提示词,完全不需要任何真实图像样本。模型骨干使用预训练 Stable Diffusion(SD 1.5 与 SD 2.0),在 UNet 的交叉注意力与自注意力层挂载低秩 LoRA 适配器。优化器选用 AdamW,批次中每个 prompt 采样 \(G = 4\) 条轨迹,去噪求解器采用随机 SDE 模拟连续动作空间,仅在 \(t \in [0, 0.4T]\) 阶段应用带有 \(\epsilon = 0.2\) 裁剪区间的 GRPO 损失和系数为 \(\beta = 0.15\) 的 KL 惩罚。在推理用于扩散分类时,输入测试图像通过预训练加噪调度与 LoRA 赋能的去噪模型进行类别条件噪声匹配预测,选择最小残差类别作为预测结果。

实验关键数据

主实验

在标准扩散分类基准以及对抗与分布漂移测试集上的零样本分类准确率如下表所示。MiPO 在不接触任何下游图像的情况下,在绝大多数基准上均显著超越了原始扩散分类器基线。

模型基座与方法 CIFAR-10 CIFAR-10-C (鲁棒性) ImageNet-Tiny Caltech-101 SUN09
SD 1.5 (Baseline) 85.38% 57.72% 46.50% 97.81% 64.69%
SD 1.5 + MiPO (本文) 87.89% 59.76% 47.30% 99.51% 68.25%
SD 1.5 增益 +2.51% +2.04% +0.80% +1.70% +3.56%
SD 2.0 (Baseline) 88.58% 64.61% 51.45% 99.65% 64.72%
SD 2.0 + MiPO (本文) 86.98% 65.33% 55.25% 99.93% 69.26%
SD 2.0 增益 -1.60% +0.72% +3.80% +0.28% +4.54%

消融实验

为了严格排除奖励函数与评估标准之间的自相关干扰,作者利用非训练期的独立 KNN 密度估计器将 CIFAR-10 划分为少数派群体(Minority Group)与主流多数派群体(Majority Group),检验各组件的真实表征提升与时间步配置影响。

表 1:KL 正则化对分类准确率的消融(基于 SD 1.5)

配置方案 少数派组准确率 (Minority) 多数派组准确率 (Majority) 核心机制说明
SD 1.5 (基线未微调) 73.07% 79.18% 多数派高密度表现尚可,少数派长尾严重劣化
MiPO 无 KL 正则项 (\(\beta = 0\)) 78.58% 82.08% 缺乏先验拉索导致策略过拟合高误差状态
MiPO 完整模型 (含 KL, 本文) 80.58% 82.68% 约束流形漂移,少数派提升 +7.51%,多数派稳中有升

表 2:策略更新时间步选择策略消融(基于 SD 1.5)

时间步策略选择 更新区间 (步数) 少数派组准确率 多数派组准确率 影响机理分析
SD 1.5 (基线) 无微调 73.07% 79.18% 原始基线表征能力对照
全时间步更新 (Full) 0–50 步 (100%) 80.58% 82.68% 表现优秀但显存与计算开销翻倍
后期时间步 (Late) 30–50 步 (后40%) 73.77% 78.18% 仅调整局部像素纹理,无法改变核心语义与拓扑
中期时间步 (Middle) 15–35 步 (中间40%) 79.90% 78.28% 语义结构调整不充分,多数派出现微小回退
早期时间步 (Early, 本文) 0–20 步 (前40%) 81.68% 82.48% 聚焦粗粒度语义与几何结构,少数派达最高准确率

表 3:少数派图像生成性能与推理效率对比(基于 SD 1.5 与 MS-COCO 验证集)

生成方法 少数派生成能力 扩散分类兼容 无需单 Prompt 优化 CLIPScore ↑ HPSv3 ↑ Minority Score ↑ 单图推理耗时 ↓
DDIM 基线 否 是 是 31.7571 5.7581 0.2132 1s
MinorityPrompt 是 否 否 30.4351 1.5324 0.2311 63s
MiPO (本文) 是 是 是 30.8026 4.4090 0.2289 1s

关键发现

  • 生成端少数派覆盖直接映射为感知判别增益:在 CIFAR-10 上对低密度样本群的定向测试显示,MiPO 将少数派分类准确率从基线 73.07% 暴拉至 81.68%(净增 +8.61%),证明扩散模型的生成覆盖度与分类判别能力具备强烈的正相关耦合关系。
  • 早期时间步是语义表征优化的决定性瓶颈:消融实验清晰证明仅更新前 40% 时间步不仅计算开销最小,其少数派分类表现(81.68%)甚至超越了更新全部时间步(80.58%),表明后期高频去噪更新容易对伪影或噪声残差产生有害过拟合。
  • 颠覆推理期优化的效率代差:此前少数派生成 SOTA 方法 MinorityPrompt 需要对每个输入提示执行长达 63 秒的连续梯度反向传播以优化软词向量,不仅无法支持下游分类,其实用性也极其受限;MiPO 通过离线 LoRA 权重固化,以与标准 DDIM 完全相同的 1 秒推理时延达成接近的少数派得分,且人类偏好得分显著更高(ImageReward 0.228 vs -0.026)。

亮点与洞察

  • 闭环自提升哲学(Self-Improving Paradigm):将传统“生成”与“判别”割裂的模式打通,通过扩散模型自身的重构不确定性构建伪标签奖励,无需外接标注或视觉基础模型即可完成自我强化,展现了生成先验内生驱动判别对齐的巨大潜力。
  • 免人工提示优化的即插即用 LoRA:将复杂的流形重加权知识压缩为轻量可插拔适配器,推理期无需任何单 Prompt 调优或测试时反向传播,便于无缝集成至各类不同版本扩散基座及下游感知管线。
  • 可迁移的流形密度重加权范式:利用扩散反向重建残差作为流形稀疏度(rarity proxy)的度量机制,完全可以推广到基于流匹配(Flow Matching)的下一代生成模型对齐、长尾图像合成以及半监督异常检测等任务中。

局限与展望

  • 多物体复杂场景鲁棒性受挫:在非纯净的自然复杂场景数据集(如 VOC2007 和 LabelME)上,MiPO 出现了明显的准确率回退(例如 SD 1.5 在 LabelME 上从 62.90% 降至 55.28%)。论文附录指出这是因为复杂场景存在严重的目标遮挡、多尺度杂乱及多标签歧义,简单的全局少数派奖励容易激发背景小众噪点,干扰了主体目标判别。
  • 少数派独特性与整体审美保真度的权衡边界:当强化学习过于激进地追逐低密度奇异样本时,生成图片容易滑向审美退化边缘。未来需要研究自适应的动态温度系数,在局部罕见概念探索与全局真实度之间实现更优雅的平衡。
  • 未来方向:探索目标区域敏感的局部空间掩码少数派优化,将该机制扩展到扩散视频生成器与 3D 生成模型的感知表征提升。

相关工作与启发

  • vs MinorityPrompt / Don't Play Favorites:后者通过测试时反向传播引导或基于提示词嵌入微调以合成少数派图像,单图计算耗时巨大(~63s),且完全无法将流形扩展转化为固定参数权重以支持下游分类;MiPO 首次通过离线策略对齐更新权重,兼顾毫秒级生成效率与零样本分类提升。
  • vs 传统 Diffusion Classifier:传统方法直接将冻结的预训练扩散模型用于似然推断,受困于噪声匹配损失固有的高密度归纳偏置;MiPO 证明了通过自生成提示强化学习可以定向补足长尾低密度模式,填补了扩散分类器主动自我提升的技术空白。
  • vs DanceGRPO / FlowGRPO:现有扩散 RLHF 工作聚焦于人类主观美学偏好(Aesthetic)或图文对齐(Image-Text Alignment)微调;MiPO 开辟了以流形密度几何特征为奖励驱动的新维度,探索了强化学习反哺生成骨干表征容量的可能性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次揭示少数派生成覆盖与扩散分类器感知能力的内在统一性,提出纯自监督的内生奖励与轻量 RL 对齐框架。
  • 实验充分度: ⭐⭐⭐⭐☆ 涵盖五大常用分类基准、OOD 测试集、详尽的组别消融以及多项图像生成评测指标,但在多目标复杂数据集上的失效分析尚待深化。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑缜密,从费曼名言切入到严谨的数学形式化展开,图表清晰直观,论证层次分明。
  • 价值: ⭐⭐⭐⭐⭐ 为解决长尾视觉表征缺陷与拓展生成式分类器应用边界提供了极具启发性的技术路线。