跳转至

POET: Preference Optimization for Enhanced Text-to-Image Generation

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 提示词重写、直接偏好优化、文生图、多模态大模型裁判、强化学习

一句话总结

POET 提出了首个无需监督微调(SFT)即可直接通过多模态裁判反馈进行迭代 DPO 训练的提示词重写框架,在完全冻结文生图模型的前提下,显著弥补了用户简短提示词与模型偏好之间的分布鸿沟。

研究背景与动机

近年来文本到图像(T2I)生成技术在扩散模型、自回归生成与多尺度预测等范式下取得了突破性进展,能够渲染出细节极其逼真、分辨率极高的合成图像。然而在实际落地与用户交互中,普遍存在一个严重的分布鸿沟(distributional gap):普通用户输入的提示词往往非常简短、模糊或缺乏充分的几何与风格约束(如仅输入“a cat disney cartoon style”),而现代文生图模型原生预训练所依赖的文本表征大多是长篇幅、高密度、富含构图与属性细节的描述性字幕。这一不对齐直接导致模型生成结果频繁出现图文偏离、属性错位、人体解剖学畸变以及构图美学不可控等退化现象。

针对这一问题,现有解决方案主要依赖三类技术路线,但各自面临瓶颈。一是基于大型语言模型(LLM)的上下文学习(In-Context Learning, ICL)或人工交互迭代,这类方法严重受制于上下文窗口长度与提示词敏感性,且依赖大量工程化设计与人工介入;二是通过收集“短提示词-精修长提示词”配对数据进行监督微调(SFT),例如 DALL-E 3 依赖重标注字幕,但高质量提示词配对构建极其昂贵,且不同生成模型(如 FLUX 与 SD)内在偏好的提示词语法各异,SFT 极易让重写器过拟合于特定标注分布,严重削弱跨模型泛化与探索能力;三是基于 PPO 的强化学习策略,但联合微调扩散模型与重写器时训练难度大、方差极高且极度不稳定。

针对上述矛盾,本文主张将文生图主干网络完全视为黑盒环境,仅在输入侧对提示词进行自动化迭代优化。既然不同生成模型具备对提示词结构的隐式偏好,那么重写器便可以直接从生成图像的多模态评测反馈中习得这一偏好,而根本不需要前置的 SFT 过程。核心 idea:摒弃昂贵的人工与模型特定 SFT 数据,提出基于多模态大模型裁判多维偏好反馈的迭代直接偏好优化(Iterative DPO)流水线,通过全对比锦标赛打分构建极具辨别力的偏好对,使语言模型在黑盒环境下自主探索出能够最大化激活文生图模型对齐度与美学潜力的重写策略。

方法详解

整体框架

POET 整体由三个解耦的核心环节构成:提示词候选重写与图像渲染、基于多模态裁判的多维度锦标赛成对打分、以及策略模型的迭代 DPO 偏好更新。整个优化过程完全不改变文生图主干模型(如 FLUX.1、SD-3.5、JanusPro)的任何参数。

输入简短的原始用户提示词 \(x\),当前重写策略模型 \(f_\theta\) 自回归采样生成 \(n\) 个候选重写提示词 \(\{y_1, y_2, \dots, y_n\}\)。随后,冻结的文生图主干模型分别渲染对应的 \(n\) 张合成图像。接着,多模态裁判模型(Qwen2.5-VL-72B-Instruct)根据预设的多维奖励体系,对这 \(n\) 张图像构建的所有有序图像对进行全对比评估(两两胜负判定),累计计算出每个重写提示词的综合评分,从而选出表现最佳的胜者提示词 \(y_w\) 与表现最差的败者提示词 \(y_l\)。最后,三元组 \((x, y_w, y_l)\) 被送入 DPO 损失函数进行策略参数更新,并在每个训练轮次(Round)动态更新参考模型 \(\pi_\text{ref}\),实现渐进式策略演进。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["用户简短输入提示词 x"] --> B["候选重写采样<br/>策略模型采样 n 个变体"]
    B --> C["黑盒图像渲染<br/>冻结的 T2I 主干生成 n 张图像"]
    C --> D["解耦多维偏好奖励系统<br/>图像质量 / 实体对齐 / 物理空间 / 美学"]
    D --> E["全对比锦标赛优胜劣汰<br/>汇总胜负分确定胜者 yw 与败者 yl"]
    E --> F["迭代直接偏好优化更新<br/>最小化 DPO 损失并轮次滚动参考策略"]
    F -->|更新参数| B

关键设计

1. 无需 SFT 的纯 RL 迭代探索机制:打破分布限制并保留策略探索多样性

传统提示词重写往往先在人工撰写或预先收集的精修配对上做监督微调,再做微弱的强化微调。但研究团队发现,SFT 会导致语言模型丧失对提示词语法结构的自由探索能力,陷入标注者固有的表达习惯,从而在下游文生图模型上出现明显的过拟合与迁移性下降。POET 直接跳过 SFT,让基础指令微调 LLM(如 Llama-3-70B-Instruct 或 Qwen-3-32B)直接作为初始策略进入 DPO。在每一轮训练迭代中,参考模型保持上一轮的权重 \(\pi_\text{ref} \leftarrow \pi_\theta\),使模型能够在稳定的 KL 散度约束下稳步推进提示词分布的演进。实验表明,重写器在无需任何配对示范的情况下,自发学会了如何补充物体材质、空间位置、光影环境与构图修饰语,且重写提示词的平均 token 长度随着训练稳定增长。

2. 四维解耦的多模态评测奖励:将复杂图文质量解构为细粒度多模态裁判判决

为准确评估文生图模型生成图像的优劣,POET 采用 Qwen2.5-VL-72B-Instruct 作为多模态评测器(MLLM-as-a-judge),构建了四个彼此正交且细粒度的成对偏好维度: - 图像质量(Image Quality, \(r_\text{Quality}\):检验肢体/手部生理结构、对称物体的几何平滑度、反光与阴影等基础物理法则、场景语意连贯性及高频细节伪影。 - 全局图文对齐(General Alignment, \(r_\text{General-Alignment}\):为克服复杂长句判断难度,先由裁判自动将用户原始提示词拆解为原子式的是非问题集合(例如输入“桌上有四个苹果”,拆解为“是否有四个苹果?”、“是否有桌子?”、“苹果是否位于桌上而非桌底?”),再结合问题与候选图像对进行综合胜负判决。 - 物理空间与属性绑定对齐(Physical Alignment, \(r_\text{Physical-Alignment}\):针对现有文生图模型最易崩溃的实体计数(Numeracy)、空间方位关系(左右、上下、前后)以及颜色/材质属性绑定(Attribute Binding)进行针对性裁决。 - 视觉美学(Aesthetics, \(r_\text{Aesthetics}\):评测构图比例、细节层次、色彩氛围与整体艺术水准。

基于这一体系,作者进一步解耦训练了两个重写器变体:兼顾语义忠实度与基础画质的“通用重写器(General Rewriter)”,其综合奖励为 \(r^\text{General} = r_\text{Quality} + r_\text{General-Alignment} + r_\text{Physical-Alignment}\);以及专门迎合极端视觉吸引力的“美学重写器(Aesthetics Rewriter)”,额外融入了 \(r_\text{Aesthetics}\)。这种解耦避免了美学修饰词过度膨胀而掩盖原始语义目标的固有权衡冲突。

3. 全对比锦标赛成对优选算法:高方差环境下的鲁棒偏好蒸馏

文生图任务中直接使用标量奖励(如 PPO 或 GRPO 中单张图像的连续打分)方差极大,极易受到评测器评分漂移的影响。为此,POET 采用成对比较(Pairwise comparison)并将 \(n\) 个候选生成样本组织成全对比锦标赛。对于单条原始提示词 \(x\),生成 \(n\) 个重写文本及其图像后,遍历全部 \(n(n-1)\) 个有序图像对 \((i, j)\),调用多模态裁判进行两两对比。若图像 \(i\) 胜出则累加 \(+1\)、对手 \(-1\);平局计 \(0\)。在所有奖励维度与所有对手的比拼中累加总积分 \(R_i = \sum_{k=1}^K r_i^k\),最终严格选取积分最高者作为正样本 \(y_w\),积分最低者作为负样本 \(y_l\)。这种全矩阵投票机制极大地消解了单个评分维度的噪声与局部判断偶发误差,为 DPO 提供了高置信度的对比监督对。

损失函数 / 训练策略

对于由算法筛选出的优质/劣质提示词三元组 \((x, y_w, y_l)\),策略网络参数 \(\theta\) 通过标准的 DPO 目标进行优化:

\[\mathcal{L}_\text{DPO}(\pi_\theta; \pi_\text{ref}) = -\mathbb{E}_{(x, y_w, y_l) \sim \mathcal{D}} \left[ \log \sigma \left( \beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_\text{ref}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_\text{ref}(y_l \mid x)} \right) \right]\]

在具体实现中,训练采用 LoRA 参数高效微调,消融研究证明 LoRA 与全参数微调(FFT)在各指标上表现相当,但大幅节约显存与计算开销。多轮训练中每轮重新根据当前策略采样生成图像并裁决更新 \(\pi_\text{ref}\),确保策略优化不会脱靶。

实验关键数据

主实验

论文在 GenEval 基准上对主流先进文生图模型进行了系统评估。表 1 展示了在 FLUX.1-dev 与 Show-o 架构上的主流方法对比,表 2 展示了在多个 T2I 主干和不同尺寸重写器下的泛化表现。

表 1:GenEval 基准对比实验(基于原论文 Table 1,越高越好)

方法 T2I 主干模型 单物体 双物体 计数 颜色 位置方位 颜色属性绑定 综合总分 (Overall)
Baseline Show-o 0.95 0.52 0.49 0.82 0.11 0.28 0.53
PARM++ Show-o 0.99 0.71 0.69 0.95 0.36 0.49 0.70
Baseline FLUX.1-dev 1.00 0.87 0.76 0.84 0.22 0.49 0.70
Zero-Shot FLUX.1-dev 0.98 0.89 0.71 0.82 0.47 0.49 0.73
ICL FLUX.1-dev 1.00 0.89 0.80 0.83 0.54 0.41 0.74
RePrompt FLUX.1-dev 0.98 0.87 0.77 0.85 0.62 0.49 0.76
POET (Ours) FLUX.1-dev 1.00 0.95 0.78 0.88 0.58 0.56 0.79

此外,在综合对齐基准 T2I-CompBench++、问答对齐基准 TIFA 以及 MS-COCO 30K FID 评估中,POET 在全部主流主干上一致取得显著改善。

表 2:跨架构对齐与图像质量评估(基于原论文 Table 3)

模型配置 颜色 (Color)↑ 空间关系 (Spatial)↑ 计数 (Numeracy)↑ TIFA 得分↑ MS-COCO FID↓
FLUX.1-schnell Baseline 0.7492 0.2754 0.6062 0.8803 20.57
+ POET (Ours) 0.7614 0.3216 0.6161 0.8868 17.76
FLUX.1-dev Baseline 0.7647 0.2763 0.6130 0.8572 24.38
+ POET (Ours) 0.7978 0.3206 0.6343 0.8809 19.57
SD-3.5-medium Baseline 0.7988 0.2889 0.6033 0.8782 17.81
+ POET (Ours) 0.8040 0.3322 0.6320 0.8878 17.13
JanusPro Baseline 0.5294 0.1579 0.4380 0.8457 19.28
+ POET (Ours) 0.7861 0.2773 0.5983 0.8845 16.71

消融实验

在 Pick-a-Pic v2 真实用户分布下,采用 GPT-4o 作为独立裁判进行两两对抗评测(对齐 DALL-E 3 生成基线),验证了通用重写器与美学重写器的不同侧重及各维度奖励的有效性。

表 3:Pick-a-Pic v2 胜率评估(基于原论文 Table 4,对抗 DALL-E 3 胜率)

模型与配置 图像质量胜率 图像美学胜率 图文对齐胜率 平均胜率
DALL-E 3 (基准参考) 0.500 0.500 0.500 0.500
FLUX.1-schnell 原始提示词 0.469 0.314 0.419 0.401
+ ICL 基础拓展 0.475 0.307 0.422 0.401
+ POET (通用重写器 General) 0.494 0.476 0.561 0.510
+ POET (美学重写器 Aesthetics) 0.495 0.818 0.424 0.579
FLUX.1-dev 原始提示词 0.513 0.350 0.360 0.408
+ ICL 基础拓展 0.531 0.363 0.457 0.450
+ POET (通用重写器 General) 0.536 0.491 0.575 0.534
+ POET (美学重写器 Aesthetics) 0.576 0.800 0.391 0.589

关键发现

  • 对齐与美学的博弈平衡:消融表明,引入美学奖励后图像美学胜率大幅飙升至 0.818,但图文对齐胜率会从 0.561 下滑至 0.424。定性分析发现,美学奖励极易驱使模型自行脑补华丽背景、光效与装饰物,有时会稀释或干扰原始主体指令的清晰度。这证明了将重写器拆分为“通用对齐型”与“美学优先型”的必要性。
  • 跨主干极佳的零样本迁移性:重写器在某一特定模型(如 FLUX.1-schnell)上通过 DPO 训练后,直接挂载到完全未见过的模型(如 SD-3.5-medium)作为预处理端,性能几乎没有衰减,依然显著超越未修改的提示词与 ICL 基线。这表明高质量提示词所蕴含的“具象化、物理约束明确、构图规整”等内在语法是跨架构通用的。
  • LoRA 高效微调的有效性:全参数微调并未带来相比 LoRA 的稳定优势,LoRA 凭借较少的可训练参数即可充分捕捉多模态裁判所给予的偏好信号,极大降低了训练门槛。

亮点与洞察

  • 完全免 SFT 的闭环强化学习范式:传统观念认为提示词生成依赖大量人类精修范例或模型反推标注。POET 证明了纯粹依靠多模态裁判的成对比较判决,通过迭代 DPO 便能使冻结的基础语言模型从零摸索出极具表达力的精修策略。
  • 问题分解驱动的裁判防幻觉机制:直接将复杂长提示词丢给多模态大模型判定是否图文一致极易受表面相关性误导。POET 先将原始意图拆解为原子式的是非判定问题清单再做判决,极大地压制了裁判自身的虚假偏好与幻觉。
  • 输入端即插即用的低成本泛化:文生图主干模型体积庞大(例如 FLUX 达百亿参数),重新训练成本高昂。POET 将优化完全收束在文本前置输入端,为工业界落地提供了一种即插即用、零推理反向传播的端到端提质手段。

局限与展望

  • 推理延迟增加:每次文生图必须前置经过一次大语言模型的自回归采样推理,虽然相较于多轮扩散采样时间占比尚可,但在极低延迟交互场景下仍带来了额外计算开销。
  • 多模态裁判固有偏见:整个 DPO 的监督信号完全受制于 Qwen2.5-VL-72B 的视觉感知上限。当涉及极端微小的物体定位、晦涩小众的概念或者极高密度的数量计算时,裁判本身若出现误判,会导致偏好对倒错。
  • 长文本注意力衰减与模型上下文限制:重写出的长提示词在输入给文本编码器容量较小的旧版文生图模型(如仅使用 CLIP ViT-L 的模型)时,可能触碰 77-token 上限或引起尾部概念被截断截失。未来工作可探索带长度预算惩罚的多目标偏好优化。

相关工作与启发

  • vs RePrompt / PARM:RePrompt 采用多步推理 CoT 并引入自回归验证,计算流程繁琐且对生成结构干预较深;POET 完全解耦模型推理,保持文生图黑盒特性,以更轻量的端到端 DPO 优化重写文本,在 GenEval 上取得了更高综合分(0.79 vs 0.76)。
  • vs DALL-E 3 Recaptioning:DALL-E 3 依赖耗费巨大的高质量全监督图像描述模型构建 SFT 数据;POET 则证明了通过黑盒渲染结果的成对裁判比拼即可自监督演化,大幅摆脱了数据构建瓶颈。

评分

  • 新颖性: ⭐⭐⭐⭐ [摆脱对 SFT 依赖,确立纯成对多模态裁判驱动的迭代 DPO 文生图提示词优化范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖扩散/自回归多种主干,结合 GenEval、T2I-CompBench++、Pick-a-Pic 人机一致性与跨模型迁移评测]
  • 写作质量: ⭐⭐⭐⭐⭐ [方法逻辑清晰严密,实验消融深入且有针对性地揭示了美学与对齐的内在权衡]
  • 价值: ⭐⭐⭐⭐⭐ [即插即用、无需改动底层权重,为各类文本生图产品提供了极高性价比的输入侧赋能路径]