跳转至

On-Policy Diffusion Reinforcement Learning Meets Off-Policy Quality Anchoring

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/HiDream-ai/DiffusionCompass
领域: 图像生成
关键词: 扩散模型 / 在线强化学习 / 离线锚定 / 奖励过拟合 / 流匹配

一句话总结

本文提出 DiffusionCompass 框架,针对扩散模型在线强化学习易陷入局部奖励饱和与模式坍塌的痛点,创新性地将静态离线优质/劣质样本作为全局质量“指南针”,通过分布感知过滤、感知锚定奖励与奖励重归一化协同约束在线探索,在图像与视频生成对齐中兼得高奖励、强泛化与极高采样多样性。

研究背景与动机

在大规模扩散模型与流匹配(Flow Matching)架构席卷视觉生成领域的背景下,通过强化学习(RL)对齐人类复杂偏好与多维美学指标已成为后训练(Post-training)的核心范式。当前主流对齐方案主要依赖同策略/在线强化学习(On-Policy RL),即利用当前策略网络生成的在线样本并由奖励模型评分,通过排序与对比反馈推动模型自更新。这种闭环机制虽然提供了直接、与模型当前能力强绑定的优化梯度,但在实践中暴露出严重的自指性缺陷。

由于在线探索被严格禁锢在模型自身的狭窄能力分布之内,它缺乏一个客观、稳定的外部质量参照系,极易陷入两大典型困境:一是奖励饱和(Reward Saturation),模型过度拟合生成空间内的局部最优点,甚至利用奖励模型的打分漏洞进行奖励作弊(Reward Hacking),导致真实视觉质感劣化;二是模式坍塌(Mode Collapse),模型在少数高奖励分布上极化,生成样本丧失多样性,甚至在多维复杂目标下整体退化。如果直接将异策略(Off-Policy)静态数据强行混入在线更新,又会因分布偏移(Distribution Mismatch)引发严重的梯度方差和训练震荡。

本文的核心视角在于:在线探索的盲目性可以通过离线静态数据构筑的质量坐标系予以纠偏,离线样本不应作为直接优化的强制拟合目标,而应扮演全局方向校验的“质量锚点(Quality Anchor)”。核心 idea:构建 DiffusionCompass 框架,将在线探索与离线质量锚定解耦并协同优化,利用分布感知过滤离线损失、感知特征相似度辅助奖励以及联合奖励重归一化,为在线策略提供兼顾全局质量基准与探索自由度的稳定对齐方向。

方法详解

整体框架

DiffusionCompass 建立在 Rectified Flow(流匹配)架构之上,整体采用双模型、双数据流协同更新机制。系统维护一个探索策略网络 \(v_\theta\)、一个指数移动平均(EMA)的快照网络 \(v_\theta^{\text{snap}}\),以及一个冻结的初始模型用于正则化。在每次迭代中,在线流利用快照网络生成一批在线样本并由奖励模型打分;离线流则从预先构建的静态样本池中检索对应文本的高质正样本与低质负样本。两路数据在奖励重归一化与特征相似度计算处交叉融合,最终组合在线对比损失、离线锚定损失与 KL 正则项共同更新探索网络。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入文本提示词 c"] --> B["快照网络在线采样<br/>低保真动态快速采样"]
    A --> C["离线样本库检索<br/>正样本集合 / 负样本集合"]
    B --> D["分布感知过滤离线损失<br/>速度场差异度量 d 软加权"]
    C --> D
    B --> E["感知锚定奖励机制<br/>DINOv2 最大特征余弦相似度调制"]
    C --> E
    B --> F["联合奖励重归一化<br/>在线与离线样本统合均值与方差"]
    C --> F
    E --> F
    F --> G["动态采样加速探索<br/>流匹配对比在线损失 LON"]
    D --> H["综合目标联合优化<br/>LON + LOFF + LKL 更新策略网络"]
    G --> H
    H -->|EMA 更新| B

关键设计

1. 分布感知过滤离线损失:正样本拟合与负样本概念擦除的软权重自适应 为了让离线静态数据稳定引导探索网络而不造成严重的分布偏移破坏,作者将离线样本分为前 \(D\%\) 的优质正样本集合 \(\mathcal{X}_{\text{off}}^+\) 和后 \(D\%\) 的劣质负样本集合 \(\mathcal{X}_{\text{off}}^-\)。对于正样本,模型直接拉近预测速度场与目标速度场;而对于负样本,简单反向最大化距离会导致损失无界和梯度发散,因此作者借鉴概念擦除思路,强制探索网络在遇到负样本时预测空提示词 \(\emptyset\) 对应的速度场,借助无分类器引导(CFG)在推理期抑制低质成分生成。此外,离当前策略太远的正样本会带来不稳定梯度,而当前策略本就不可能生成的负样本也没有抑制必要。为此,作者利用截断梯度的速度场欧氏距离衡量样本与当前策略分布的邻近度: $\(d = \text{sg}(\|\mathbf{v} - \mathbf{v}_\theta(\mathbf{x}_t, c)\|_2^2), \quad w = e^{-\alpha d}\)$ 最终离线锚定损失通过指数软过滤权重 \(w\) 进行自适应重加权: $\(\mathcal{L}_{\text{OFF}} = \mathbb{E}_{\mathbf{x}_0\in\mathcal{X}_{\text{off}}^+} w \|\mathbf{v} - \mathbf{v}_\theta(\mathbf{x}_t, c)\| + \mathbb{E}_{\mathbf{x}_0\in\mathcal{X}_{\text{off}}^-} w \|\mathbf{v} - \mathbf{v}_\theta(\mathbf{x}_t, \emptyset)\|\)$

2. 感知锚定奖励机制:引入外部高质量图像特征防御奖励作弊 单一且不可导的标量奖励模型极易存在盲区,使在线策略通过生成不合常理的高频伪影或单调构图来“作弊(Reward Hacking)”。由于离线正样本具备公认的高视觉感知品质,DiffusionCompass 提取在线生成样本与同提示词下离线优质正样本的高阶语义表征(采用 DINOv2 特征提取器,视频数据则对所有帧特征取均值),计算在线样本与所有正样本之间的最大余弦相似度,并以乘性因子的形式注入原始奖励: $\(r_p(\mathbf{x}_0, t) = r(\mathbf{x}_0, t) \cdot \max_{\hat{\mathbf{x}}\in\mathcal{X}_{\text{off}}^+} \text{similarity}(f_{\mathbf{x}_0}, f_{\hat{\mathbf{x}}})\)$ 该设计使在线样本即便在原始奖励模型上获得高分,若严重偏离真实优质视觉特征空间依然会被强行压低实际反馈,从而守住了真实感知质量底线。

3. 联合奖励重归一化:打破同质样本自指,锚定全局绝对标尺 在纯在线强化学习(如 GRPO)中,优势度估计依赖当前 batch 在线样本的均值与方差。当策略遭遇性能瓶颈或退化至低质模式时,所有在线样本得分普遍偏低,但组内归一化依然会给相对较好、实则劣质的样本赋予强正向概率,形成“矮子里面挑高个”的恶性循环。DiffusionCompass 在估计最优化概率 \(p\) 时,将离线参考样本池 \(\mathcal{X}_{\text{off}}\) 的分数直接并入在线集合 \(\mathcal{X}_{\text{on}}\): $\(p \approx \frac{1}{2} \left[ \text{clip}\left( \frac{r(\mathbf{x}_0, c) - \mu_{\mathcal{X}_{\text{on}}\cup\mathcal{X}_{\text{off}}}}{\sigma_{\mathcal{X}_{\text{on}}\cup\mathcal{X}_{\text{off}}}}, -1, 1 \right) + 1 \right]\)$ 通过全局绝对质量参考注入真实的评分基线,确保只有当在线样本的分数在全域视角下真正匹敌或超越离线高质基准时,才能获得显著的正向优化权重。

4. 动态采样加速探索:分治解耦空间美学与时序动力学在线开销 视频生成多步扩散推演极其耗时,在线采样往往构成训练的主要算力瓶颈。由于静态离线库已经牢固锁定了高质量的全局画质先验,在线生成过程无需步步追求满分辨率渲染。针对空间属性奖励(如美学分、保真度),训练期在线流仅执行单帧生成;针对时序属性奖励(如运动平滑性、背景一致性),在线流采用低空间分辨率配高帧率的轻量化“快照”轨迹。这种动态降采样方案将单步探索开销骤降数倍,同时避免了传统低保真训练引发的画质塌缩。

损失函数 / 训练策略

系统在线部分基于 DiffusionNFT 构造对比流场优化项 \(\mathcal{L}_{\text{ON}}\),将正负向扰动速度场分别拉向高/低优势度样本速度。总优化目标由在线对比损失、离线锚定损失与 KL 正则化项加权组合而成: $\(\mathcal{L} = \lambda_1 \mathcal{L}_{\text{ON}} + \lambda_2 \mathcal{L}_{\text{OFF}} + \lambda_3 \mathcal{L}_{\text{KL}}\)$ 在图像任务中采用 SD3.5-Medium 作为基础模型,LoRA(秩 \(r=32, \alpha=64\))微调,使用 AdamW 优化器,学习率设为 \(3 \times 10^{-4}\),损失权重设为 \(\lambda_1=1, \lambda_2=0.1, \lambda_3=10^{-4}\);在线生成仅需 10 步采样,离线高质量生成器使用 Qwen-Image 或 Flux。在视频任务中基础模型采用 Wan2.1-1.3B,离线优质模型采用 Wan2.1-14B,在线轨迹采样 20 步。

实验关键数据

主实验

在文生图组合性评测 GenEval、字符渲染 OCR 精度评测、人类偏好对齐 PickScore,以及包含 16 个维度的文生视频综合基准 VBench 上进行了系统评测。

任务 / 基准 模型 / 方法 核心指标 对比 SOTA / 基线表现 迭代量 / 开销对比
图像组合生成 (GenEval) DiffusionCompass Overall: 0.97 FlowGRPO: 0.95, DiffusionNFT: 0.95 1K iters (仅为 FlowGRPO 5K 的 1/5)
视觉文本渲染 (OCR) DiffusionCompass (w/o CFG) OCR 准确率: 0.975 DiffusionNFT: 0.970, FlowGRPO: 0.915 64 GPU 小时 (FlowGRPO 为 600h)
人类偏好对齐 (PickScore) DiffusionCompass PickScore: 23.8 DiffusionNFT: 23.7, FlowGRPO: 23.4 多样性指标 Vendi: 1.87 vs 1.46
视频综合对齐 (VBench 16维) Wan2.1-1.3B + Ours (RP) 总分: 85.00 Wan2.1-14B: 83.69, CausVid: 83.88 1.3B 参数超越诸多 14B / 5B 模型
大规模视频扩展 (VBench) Wan2.1-14B + Ours (RP) 总分: 87.16 DiffusionNFT (1.3B): 83.52 仅需 160 迭代全面刷新综合指标

消融实验

在视觉文字生成基准(OCR)上针对各模块的贡献进行了完整消融(使用 SD3.5-Medium,Base OCR 为 0.550):

配置 奖励重归一化 锚定辅助奖励 离线锚定损失 分布感知过滤 OCR 准确率 美学评分 CLIPScore 算力开销 (GPUh)
纯在线基准 (NFT) - - - - 0.970 4.45 0.280 64
仅重归一化 ✓ - - - 0.969 4.48 0.282 56
引入感知锚定奖励 ✓ ✓ - - 0.963 5.03 0.309 56
引入离线锚定损失 ✓ - ✓ - 0.974 4.66 0.298 64
未加过滤的全集成 ✓ ✓ ✓ - 0.972 4.88 0.302 64
完整 DiffusionCompass ✓ ✓ ✓ ✓ 0.975 5.00 0.306 64

关键发现

  • 离线质量锚定是打破模式坍塌的核心保障:在域外(Out-of-domain)泛化测试中,纯在线优化的 DiffusionNFT 在 PickScore 达到局部极值后出现严重的模式坍塌,组内 SSIM 高达 0.324,像素 Vendi 分数仅 1.46;而 DiffusionCompass 的 SSIM 降至 0.262,Vendi 跃升至 1.87,彻底消除了不同随机种子下画面结构雷同的问题。
  • 锚定效果源于质量相对对比而非强模型蒸馏:当离线锚点由 Qwen-Image 替换为初始 SD3.5-M 自身生成的静态样本时(自锚定设置),OCR 仍然取得了 0.973 的高分(原 0.975),证明该框架的核心推力是离线高低样本提供的稳定梯度方向对比,而非单向依赖更强模型的知识蒸馏。
  • 通用适配不同在线算法内核:将在线优化底座由 DiffusionNFT 切换为更严苛的非 EMA 在线算法 FlowGRPO 后,引入离线锚定使 OCR 从 0.915 提升至 0.939,美学分由 5.04 升至 5.08,证实机制具有即插即用的通用性。
  • 收敛速度大幅领先:每个提示词仅引入 4 到 6 个离线参考样本,便能在 16~24 步迅速达到纯在线方法 48 步以上的精度,训练收敛速度提升 2 至 3 倍。

亮点与洞察

  • 将离线负样本映射至空条件流场:传统强化学习在惩罚低质样本时极易导致反向梯度爆炸,本文巧妙借用无分类器引导与概念擦除思想,促使网络在空文本条件 \(\emptyset\) 下模拟负样本流场,使推理阶段的 CFG 能够自然避开劣质生成区域。
  • 低保真动态快照化解视频在线采样瓶颈:针对视频生成多步去噪算力沉重的硬伤,将空间美学探索下沉至单帧采样、时序动力学探索下沉至低分辨率高帧率序列,依托静态离线高质锚点兜底画质,实现高性价比的高效后训练。
  • 从自指封闭系统跃迁为具备外部参照的开环系统:为大模型在线强化学习(如 DeepSeek-R1、GRPO 类方法)迁移至连续多步扩散生成提供了重要启示——在线探索负责扩展边界,离线数据负责校准方向。

局限与展望

  • 离线样本库依赖预先生成与标注:训练前需要针对 Prompt 集调用离线模型生成并用奖励模型筛选正负集,若目标任务提示词高度动态或开集扩展,静态样本库的构建流程需持续追加。
  • 特征相似度计算带来的显存与时延开销:在感知锚定奖励中需前向运行 DINOv2 抽取稠密特征,尽管在单卡吞吐上进行了优化,在超大规模分布式训练中仍增加了一定通信负担。
  • 未来方向:探索动态自适应的在线-离线混合比例调节机制,以及将该思想扩展至多模态自回归生成或 3D 具身轨迹规划。

相关工作与启发

  • vs FlowGRPO / DanceGRPO: FlowGRPO 将 GRPO 引入流匹配扩散模型,但严格依赖当前策略的在线采样与 SDE 随机重构,收敛较慢(需 5K 步)且易发生奖励饱和;本文结合 DiffusionNFT 与离线质量锚定,仅用 1K 步即超越其性能,并显著改善多样性。
  • vs DiffusionNFT: DiffusionNFT 利用流匹配速度差分构建无概率模型的在线对比更新,但在纯在线模式下易因奖励作弊出现结构坍塌与单多样性劣化;本文为其补齐了离线分布感知锚定和全局奖励重归一化,构成了更完备的稳定对齐范式。
  • vs 纯有监督微调 (SFT) / 离线 DPO: 静态 SFT 或 DPO 只能机械逼近固定数据集,难以跳出预训练分布去主动探索更优解;本文保留了在线自主试错探索的活力,离线数据仅作为引导方向的“指南针”。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次在流匹配扩散强化学习中系统性融合分布感知离线质量锚定与动态采样,构思清晰自然。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖图像组合生成、高精度 OCR、人类偏好对齐以及 16 维度的视频生成 VBench,消融设计扎实完备。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,理论动机、机制剖析与图表对比展现极高水准。
  • 价值: ⭐⭐⭐⭐⭐ 有效化解扩散模型在线对齐模式坍塌与训练极其昂贵的双重痛点,代码开源且工业落地可行性高。