Correlation-Weighted Multi-Reward Optimization for Compositional Generation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 组合生成 / 多奖励强化学习 / GRPO / 相关性重加权 / 文本到图像
一句话总结¶
针对多概念组合生成中「朴素聚合多个概念奖励会让容易满足的概念主导优化、真正冲突的概念被稀释」这一瓶颈,CMO 在同一 prompt 的样本组内计算概念奖励之间的 Pearson 相关矩阵,用「该概念与其他概念的平均相关」估计它的生成难度,再用 \(\text{softmax}(1-\alpha)\) 给冲突概念加权,接在 MixGRPO + GDPO 的强化学习配方上微调 SD3.5 与 FLUX.1-dev,在 ConceptMix、GenEval 2、T2I-CompBench 三个组合生成基准上取得一致性提升。
研究背景与动机¶
文本到图像扩散与流匹配模型(SD3.5、FLUX.1-dev 一类)在单概念生成上已经相当可靠,但组合生成一直是软肋:一条真实 prompt 往往同时要求若干概念,并且要把每个属性正确绑定到对应物体上、还要满足计数与空间关系。早期工作靠推理期的注意力控制或额外交互条件来缓解 token 纠缠——结构化扩散引导、Attend-and-Excite、token merging 都属于这一类;DiT 与 flow matching 架构把 token 分离做得更好,部分缓解了这个问题,但当一条 prompt 里塞进五六个以上概念时,模型仍然会漏掉其中一部分。近两年更主流的思路是把 GenEval 这类评测指标直接当奖励,用扩散强化学习做后训练(FlowGRPO、MixGRPO、Pref-GRPO、IterComp),在单概念或双概念设定上确实有效。
问题出在多概念设定下奖励的聚合方式上。模型面对复杂 prompt 时最常见的失败不是「全错」而是「部分成功」——同一组采样里,有的图对象对了但计数错,有的图颜色对了却把主体丢了。这时候各概念的奖励互相拉扯,而现有做法只是把每个概念的奖励朴素聚合:GRPO 直接求和,GDPO 虽然用解耦归一化解决了多奖励归一化互相干扰(reward collapse)的问题,归一化之后仍然是等权相加。等权聚合的后果是优化被「在一组图里几乎总被满足」的容易概念主导,而最需要梯度的难概念被平均掉。更棘手的是,某些概念之间是负相关的:把灰色画对,往往以丢掉蜘蛛或锤子为代价——这正是「生成冲突」。论文先做了实证来坐实这一点:在 ConceptMix 上对同一 prompt 的 10 张图计算概念奖励的相关性,把各方法的「负相关概念对比例」和 Full Mark 分数画在一起,SD3.5、SD3.5 + FlowGRPO、SD3.5 + CMO 三点对应的分数约为 0.267 / 0.313 / 0.391(与表 5 的 SD3.5-M 基线和完整模型一致),负相关越多分数越低;而且随着 prompt 里概念数 K 增大,基线模型的负相关概念对比例迅速攀升,说明朴素聚合会放大概念之间的此消彼长。难点还在于「哪些概念难」随 prompt 的组合方式变化——「三把锤子」在某些 prompt 里是难点、在另一些里不是——所以人工调权重不现实。
核心 idea:既然「难」体现为概念奖励在样本组内部的统计相关性,就把手工调权重的问题转成相关矩阵上的自动难度估计——概念与别人越负相关(越冲突)权重越大,用 \(\text{softmax}(1-\text{平均相关})\) 加权到 GDPO 解耦归一化后的优势上,让模型同时满足 prompt 里的全部概念。
方法详解¶
整体框架¶
CMO 是一个面向多概念 prompt 的多奖励强化学习后训练框架,输入是一条多概念 prompt 和策略模型对一个采样组生成的一批图像,输出是更新后的 LoRA 策略。整个流程分四步:先把 prompt 解析成结构化的「多概念配置」,也就是把其中出现的对象、颜色、纹理、形状、风格、尺寸、计数与空间关系拆成 K 个概念组;然后 T2I 模型(SD3.5 或 FLUX.1-dev)对同一 prompt 采样 G 张图,每组图用一组专用奖励函数逐一评价这些概念,得到的奖励堆成一个 \(G \times K\) 的多奖励矩阵;接着在这个矩阵上按概念两两计算 Pearson 相关,得到每个概念的难度分 \(\alpha_k\),再过 softmax 得到权重 \(w_k\);最后把权重乘到 GDPO 解耦归一化后的组内优势上,求和并做批归一化,用最终优势更新策略。优化采用 MixGRPO 式的混合 ODE–SDE 采样,只在最前面几个 timestep 做随机 SDE 探索,其余步走确定性 ODE,以压掉全步 SDE 采样带来的计算开销。
方法的核心计算对象是那个 \(G \times K\) 的多奖励矩阵:所有概念级奖励先被独立算出来、独立归一化,相关性重加权在归一化之后的优势层面发生,因此它是在 GDPO 的基础上替换掉等权求和,而不是另起一套优化目标。
关键设计¶
1. 多概念奖励分解:把一条 prompt 拆成 8 类概念组,各自配一个专用奖励函数
要按概念加权,前提是每个概念有独立的奖励信号,所以 CMO 首先设计的是一套细粒度奖励分解,而不是一个标量打分器。对象存在性用 SAM 3 做文本引导的实例检测,把对象名直接当检测 prompt 送进去,检出的边界框与 mask 同时成为后续所有局部评价的公共定位层——这一步很关键,它把目标实体从背景噪声中抠出来,属性、计数、尺寸、空间四类奖励共享同一套定位,避免了多套检测器各自为政带来的噪声。属性奖励(颜色、纹理、形状、风格)用零样本分类器 OpenCLIP-H 度量:在目标物体边界框裁剪出的区域上取图像特征,与该属性类别的候选词表(如红/绿/蓝)中每个候选词的归一化文本特征算相似度,经 softmax 得到 prompt 指定属性 \(v^*\) 的概率作为奖励
这样奖励是连续的部分分而不是 0/1 判定,训练早期也能给出可分辨的梯度。计数奖励不用存在性那样的二值惩罚,而是基于计数偏差的可微启发式:检出计数 \(c_i\) 与目标计数 \(c_i^*\) 偏差越大奖励越小(⚠️ 该式在缓存文本中字符有损,具体形式以原文为准)。尺寸属性用所有检出物体面积的秩次反平方衰减来评价。空间关系分两路:2D 关系(上/下/左/右)用几何启发式给 1.0 / 0.5 / 0.0 的分档部分分;3D 深度关系(in front of / behind)则用 Depth Anything 3 估计深度图 \(\mathcal{D}(x)\),取目标 mask 内像素的平均深度 \(\bar{d}_i\),前置关系要求 \(\bar{d}_i\) 明显小于 \(\bar{d}_j\),并留一个容差 \(\epsilon\) 吸收深度估计的噪声,后置关系取相反条件。这一整套设计的意义在于:每个概念既可独立评价、又能给出连续部分分,奖励矩阵的每一列才真正对应「这个概念在这张图里满足到什么程度」,后面的相关性分析才有意义。
2. 相关性难度估计与重加权:用组内奖励相关矩阵自动定位相互冲突的概念
这是论文的核心贡献。对同一 prompt 采出的 G 张图,K 个概念的奖励组成矩阵 \(R^{(i)} \in \mathbb{R}^{G \times K}\),先算概念两两之间的 Pearson 相关矩阵 \(C \in \mathbb{R}^{K \times K}\):
然后给每个概念一个难度分 \(\alpha_k\),定义为它与其他所有概念相关系数的平均:\(\alpha_k=\frac{1}{K-1}\sum_{l\neq k}C_{k,l}\)。由于 \(C_{k,l}\in[-1,1]\),与别人负相关的概念 \(\alpha_k\) 低,意味着「把它做对往往伴随另一个概念做错」,也就是最难同时满足的概念;反之高相关的概念是「一荣俱荣」的容易概念。权重由 \(\text{softmax}(1-\alpha_k)\) 给出,用 \(1-\alpha_k\) 把「越难权重越大」翻正过来,最后替换掉 GDPO 的等权求和:
其中 \(A_k\) 是第 k 个奖励的组内相对优势,\(\mu_B,\sigma_B\) 是加权和的批级统计量(⚠️ 式 11 在缓存文本里字符有损,此处按式 2 与图 2 还原为「加权求和后批归一化」,以原文为准)。训练稳定性上有两处旁路:如果某个概念在本组内方差近似为 0(组内全部满足或全部不满足),相关性在数学上无定义,直接把 \(\alpha_k\) 设成默认的最大相关值 1.0,避免除零产生的不稳定梯度;如果采样组里存在未填满的 padding 值,也整组跳过相关性估计。前一处旁路与 GDPO 的组内归一化天然配套——方差为零的概念其组内优势本来就趋近 0,压低它的权重不会损失有效梯度,却能让梯度预算集中到真正冲突的概念上。与「等权多奖励」和「人工调权重」相比,这个机制的差别有三点:难度是组内实例化的,同一概念在不同 prompt 组合里权重不同;难度由相关性而不是奖励绝对值决定——奖励低可能只是策略还没学会,只有负相关才说明概念之间存在真实的优化冲突;权重不引入新参数,也不用额外训练一个难度预测器。
3. 面向困难概念的训练数据构造:单属性与多概念混合,并按概念组偏斜采样
多概念奖励的结构密度需要有对应的训练分布来承载,否则再好的奖励也没东西可监督。CMO 的训练集是 5k 条 prompt,一半是 2.5k 条复杂多概念 prompt(用 ConceptMix 的流水线加 Qwen3-30B 合成,每个实体最多绑 8 个概念,即 \(K+1=8\)),另一半是 2.5k 条单属性 prompt({color} {object} 之类的干净绑定),后者沿用 FlowGRPO、TempFlow-GRPO 的观察——单属性集合能提升整体组合能力。更关键的是概念组的采样比例被刻意偏斜成 Color : Texture : Shape : Size : Spatial : Numeracy = 3 : 3 : 2 : 1 : 10 : 7,让空间关系和计数这两类最难满足的概念在训练中被反复暴露。消融证明了这套数据构造确实是独立的一块贡献:只用基础优化(DRO)几乎无效,换上这套数据后 Avg Full Mark 从 0.2713 升到 0.3305(仅单属性)再到 0.3531(加入多概念),是除相关性重加权之外的最大增益来源。作者也承认这个比例是先验固定的,在讨论中提出未来应改由失败模式驱动自适应调整。
一个完整示例¶
以图 1 的 prompt 为例:「图里有一只灰色的圆形蜘蛛,另外还有恰好三把清晰可见的锤子」。评测拆成 5 个问题:Q1 有锤子吗、Q2 蜘蛛是圆形的吗、Q3 有蜘蛛吗、Q4 蜘蛛是灰色的吗、Q5 图里有三把锤子吗。基座模型在一个采样组上的典型部分成功模式是:Q1 几乎全对(记 1 + 1 = 2 分),Q2 全错(0 + 0 = 0),Q3 只有少数图对(0.2),Q4 部分对(0.5),Q5 多数图对(0.8)。把每个概念奖励在组内归一化后得到约 1.8 / −0.9 / −0.7 / −0.2 / 0.1 的优势;相关性重加权给出的权重是 Q1 0.1、Q2 0.1、Q3 0.8、Q4 0.9、Q5 0.8,最终优势 = 权重 × 归一化奖励 = 0.18 / −0.09 / −0.56 / −0.18 / 0.08(图 1 为示意数值)。要点在于:Q1 这种「白送分」的概念被压到 0.1,而「要把灰色画对就可能丢掉蜘蛛」的 Q4(0.9)和「要凑够三把锤子」的 Q5(0.8)被抬到最高,Q3 那条最大的负梯度因为权重放大而成为这一组的主要优化对象。权重不是按奖励高低给的,而是按概念之间是否冲突给的——这就是相关性重加权在一个具体样本组上做的事。
损失函数 / 训练策略¶
基础优化配方作者称为 DRO(Decoupled Reward Optimization),即 MixGRPO + GDPO 的组合。采样上,为避免全步 SDE 带来的开销,只在滑动窗口 \(S \subseteq [0,T]\) 内做随机探索、窗口外走确定性 ODE:
其中 \(v_t\)、\(s_t\) 分别是速度场与分数函数,梯度因此被集中在窗口 \(S\) 内,显著缩短优化所需的时间步;本文遵循 MixGRPO,把 SDE 更新严格限制在前 3 个 timestep。多奖励侧先用 GDPO 的解耦归一化:对 K 个奖励各自独立算组内相对优势 \(A^{(i,j)}_k=(r^{(i,j)}_k-\mu^{(i)}_k)/\sigma^{(i)}_k\),避免归一化前的聚合把不同奖励组合映射到同一个优势上;CMO 把这一步之后的等权求和换成 \(w_k\) 加权求和,再做批归一化得到 \(\hat{A}_{\text{total}}\)。训练细节:LoRA 微调 SD3.5 与 FLUX.1-dev,学习率 \(3\times10^{-4}\),每次迭代采 8 条 prompt、每条生成 16 张图、4 卡全局 batch size 512,采样步数 SD3.5 用 10 步、FLUX.1-dev 用 6 步,并配合系数保持采样(CPS)平衡探索与效率。
实验关键数据¶
主实验¶
三个组合生成基准:ConceptMix(严格多概念,报告 Full Mark 与 Concept Fraction,k 表示概念数,每条约含 k+1 个概念)、GenEval 2(Soft-TIFA 的原子级 TIFA_AM 与 prompt 级 TIFA_GM)、T2I-CompBench(属性绑定、空间/非空间关系、计数、复杂组合七项及其平均)。所有基准每条 prompt 用不同随机种子生成 10 张图取平均;ConceptMix 的评估器从原始论文用的 GPT-4o 换成 Qwen3-VL-8B,所有基线都用同一套设置重跑,因此绝对数值不能与已发表论文的数字直接比较。
| 模型(指标) | k=1 | k=2 | k=3 | k=4 | k=5 | k=6 | k=7 |
|---|---|---|---|---|---|---|---|
| FLUX.1-dev(Full Mark) | 0.6647 | 0.4127 | 0.2680 | 0.1620 | 0.1173 | 0.0567 | 0.0372 |
| FlowGRPO(Full Mark) | 0.7600 | 0.5457 | 0.3517 | 0.2103 | 0.1727 | 0.0827 | 0.0713 |
| Pref-GRPO(Full Mark) | 0.7037 | 0.4790 | 0.3023 | 0.2120 | 0.1603 | 0.0897 | 0.0647 |
| Qwen-Image(Full Mark) | 0.8183 | 0.6583 | 0.5060 | 0.3803 | 0.3353 | 0.2213 | 0.1747 |
| CMO(FLUX.1-dev,Full Mark) | 0.8410 | 0.7063 | 0.5700 | 0.3947 | 0.3560 | 0.2317 | 0.1883 |
| FLUX.1-dev(Concept Frac.) | 0.8162 | 0.7430 | 0.7093 | 0.6706 | 0.6779 | 0.6467 | 0.6576 |
| FlowGRPO(Concept Frac.) | 0.8747 | 0.8144 | 0.7726 | 0.7235 | 0.7263 | 0.7010 | 0.6953 |
| Qwen-Image(Concept Frac.) | 0.9052 | 0.8600 | 0.8403 | 0.8193 | 0.8171 | 0.7869 | 0.7942 |
| CMO(FLUX.1-dev,Concept Frac.) | 0.9147 | 0.8850 | 0.8635 | 0.8188 | 0.8214 | 0.7917 | 0.7884 |
| 模型 | Color | Shape | Texture | Spatial | Non-Spatial | Numeracy | Complex | Avg |
|---|---|---|---|---|---|---|---|---|
| FLUX.1-dev | 0.7358 | 0.4802 | 0.5989 | 0.2461 | 0.3067 | 0.6107 | 0.4281 | 0.4866 |
| FlowGRPO | 0.8263 | 0.6177 | 0.7241 | 0.5237 | 0.3184 | 0.6987 | 0.3905 | 0.5856 |
| Qwen-Image | 0.8395 | 0.5882 | 0.7407 | 0.4454 | 0.3136 | 0.7553 | 0.4414 | 0.5892 |
| SD3.5 + CMO | 0.8692 | 0.6427 | 0.7959 | 0.5475 | 0.3201 | 0.7200 | 0.4036 | 0.6141 |
| FLUX.1-dev + CMO | 0.8607 | 0.6188 | 0.7206 | 0.4577 | 0.3171 | 0.7066 | 0.4909 | 0.5961 |
| GenEval 2(Soft-TIFA) | TIFA_AM ↑ | TIFA_GM ↑ |
|---|---|---|
| FLUX.1-dev | 64.1 | 17.1 |
| FlowGRPO | 70.9 | 21.8 |
| Pref-GRPO | 70.3 | 23.0 |
| Qwen-Image | 80.0 | 31.4 |
| CMO | 80.0 | 34.0 |
消融实验¶
DRO 指基础的多奖励优化(MixGRPO + GDPO);Single-Attr. / Multi-Concept 指是否纳入对应的训练数据;CR 即相关性重加权。
| 配置 | DRO | Single-Attr. | Multi-Concept | CR | Avg. Full Mark | Avg. Concept Frac. |
|---|---|---|---|---|---|---|
| SD3.5-M(基座) | – | – | – | – | 0.2667 | 0.7203 |
| + DRO | ✓ | × | × | × | 0.2713 | 0.7411 |
| + DRO + 单属性数据 | ✓ | ✓ | × | × | 0.3305 | 0.7752 |
| + DRO + 单属性 + 多概念 | ✓ | ✓ | ✓ | × | 0.3531 | 0.7993 |
| 完整 CMO | ✓ | ✓ | ✓ | ✓ | 0.3913 | 0.8126 |
关键发现¶
- 复杂度越高收益越大。k=7 时 CMO 的 Full Mark 为 0.1883,是基座 FLUX.1-dev(0.0372)的约 5 倍,也超过 Qwen-Image(0.1747);Concept Fraction 从基座 0.6576 提到 0.7884,说明它主要靠「不让对象被整体丢弃」而不是靠某一类属性刷分。
- 相关性重加权是增益最大的一块。在数据与基础优化都到位后(0.3531),单独加上 CR 还能再涨到 0.3913,Concept Fraction 同步从 0.7993 到 0.8126;反过来,只加 DRO 几乎没用(0.2667 → 0.2713),说明「多奖励 + 解耦归一化」本身不足以解决概念冲突。
- 冲突随复杂度上升的定量证据。基线模型的负相关概念对比例随概念数 K 增大而快速上升,CMO 则维持在较低水平;左图把负相关比例与 Full Mark 分数并列后呈现明显的负向关系,这是「优化冲突导致漏概念」这一动机的直接支撑。
- 打平与落后的地方要如实看。GenEval 2 的原子级 TIFA_AM 上 CMO 与 Qwen-Image 打平(80.0 对 80.0),优势只在 prompt 级 TIFA_GM(34.0 对 31.4);T2I-CompBench 的 Numeracy 上 Qwen-Image 的 0.7553 仍高于 CMO 的两条结果(0.7200 / 0.7066);Non-Spatial 用的是 CLIPScore,各方法挤在 0.3067–0.3201 之间,该维度接近饱和,不构成有效证据。
- 两个基座都能受益。SD3.5 + CMO 拿到 T2I-CompBench 最高 Avg(0.6141)并在属性绑定与空间关系上领先,FLUX.1-dev + CMO 则在 Complex(0.4909)上最强,说明该方法不绑定特定骨干。
亮点与洞察¶
- 把「难度」定义在相关结构上而不是奖励值上。奖励低可能只是策略尚未学会,只有负相关才说明两个概念在优化中互相排斥——这一区分让难度信号不再被「概念本来就不容易」的噪声污染,也把「哪些概念冲突」变成了一个不用额外训练就能算出来的量(一个 \(G\times K\) 矩阵上的 Pearson 相关)。这个视角可以直接迁移到任何多目标对齐场景,例如 agent 多目标 RL 或 RLHF 里的多维偏好加权。
- 零方差旁路是一处顺带自洽的细节。组内全都满足或全都不满足的概念,相关性无定义,作者把它设为默认最大相关 1.0 从而压低权重;而这类概念经组内归一化后优势本来就趋近 0,压低它既不损失有效梯度,又避开了除零梯度。
- bbox / mask 复用成公共定位层。SAM 3 检出的框与掩码同时服务属性(裁剪区域做 OpenCLIP 对比)、计数(框数)、尺寸(框面积秩)与空间(2D 几何 + 3D 深度序)四类奖励,一个定位错误不会在四个奖励里以四种不同方式重复出现,这是多奖励设计里容易被忽略的工程细节。
- 3D 关系奖励用深度序比较加容差。用 Depth Anything 3 的深度图比较两个 mask 内的平均深度,并用容差 \(\epsilon\) 吸收单目深度的噪声,得到一个不需要 3D 标注、又比 2D 检测框 IoU 类启发式更贴近「前后」语义的空间关系监督信号。
局限与展望¶
- 训练数据的采样比例(Color : Texture : Shape : Size : Spatial : Numeracy = 3 : 3 : 2 : 1 : 10 : 7)是先验固定的人为设定,作者也把它列为首要未来工作,提出应改由失败模式驱动、把 prompt 分布本身纳入难度感知的优化闭环。
- 相关性只在单条 prompt 的同一个采样组内估计,G 很小的场景下 Pearson 相关系数噪声较大;跨组、跨 prompt 池估计相关性是否会得到更稳的难度信号,论文没有验证。
- 消融只在 SD3.5-M 一条线上做(表 5),没有在 FLUX.1-dev 上重复;主表里 CMO 用的是 FLUX.1-dev,因此消融的结论与主结果的骨干并不完全对齐。
- 训练规模相对克制:LoRA 微调、4 卡、5k prompt,没有验证全参微调或自回归生成模型上的表现;也没有报告训练时间/显存的代价,而每步要跑 SAM 3、OpenCLIP、Depth Anything 3 与一个 VLM 评估器,奖励计算的开销不低。
- 评估侧存在可比性 caveat:ConceptMix 的评测器由 GPT-4o 改为 Qwen3-VL-8B(基线全部重跑因此内部公平),GenEval 2 的 TIFA_AM 上并未拉开差距。
- 缓存全文不含附录,2D 空间关系的具体公式与属性候选词表构造/归一化的细节都在附录里;计数奖励式在缓存文本中字符有损(⚠️ 以原文为准),这些细节的完整核对需要对照原文附录。
相关工作与启发¶
- vs FlowGRPO / MixGRPO:它们把组相对优势用到扩散/流模型的 RL 对齐上,多奖励场景下是等权求和。本文认为等权平均会系统性地低估冲突概念,并把「效率配方」原样保留(MixGRPO 的混合 ODE–SDE)而只替换聚合方式,因此两者的改进是正交可叠加的。
- vs GDPO:GDPO 解决的是多奖励归一化互相干扰导致奖励坍塌,思路是先各自归一化再聚合,但聚合仍是等权。CMO 直接把它当作基座(消融里的 DRO),只把最后的等权求和换成相关性加权,可以理解为「GDPO 的加权聚合版本」。
- vs IterComp / Pref-GRPO:IterComp 从模型库迭代地做组合感知反馈学习,Pref-GRPO 用成对偏好奖励稳定 GRPO;两者都在奖励表面形式上做文章,没有显式建模概念之间的关系,因此在概念数增大时仍受同一个冲突问题制约(ConceptMix 上 k=7 时分别只有 0.0040 与 0.0647)。
- vs 训练无关的注意力控制(Attend-and-Excite、结构化扩散引导、token merging):它们在推理期改注意力或 token 交互,不需要训练、可以直接套在任意模型上,但面对已经被大规模预训练固定下来的绑定能力上限,改善有限,也无法利用「哪些概念冲突」这种全局信息;本文选择后训练,代价是必须拿到模型权重并承担奖励计算开销。
- 可迁移的启发:多奖励加权里,用奖励之间的相关性而不是奖励的均值/方差来定义「难」,是一个几乎零额外成本(一次 \(K\times K\) 相关计算)却能改变梯度分配的操作;同类思路可以试在 RLHF 的多维偏好(有用 vs 无害常冲突)、多任务学习中任务冲突的加权、以及 agent 的多约束奖励设计上。
评分¶
- 新颖性: ⭐⭐⭐⭐ 「用概念奖励的相关结构自动估计难度并重加权」这个视角是新的,但 MixGRPO、GDPO、SAM 3、OpenCLIP 等组件都是现成的,属于组合式创新。
- 实验充分度: ⭐⭐⭐⭐ 三个组合基准 + 消融 + 定性 + 定量冲突分析齐备,但消融只在 SD3.5-M 一条线、无代价分析、附录细节未在主文给出。
- 写作质量: ⭐⭐⭐ 动机与图 1 的说服力强,但多个核心奖励公式被推到附录、符号定义散落,正文表 5 的说明段落重复(同一段话把「表 5」说了两遍),公式在 PDF 里也有明显排版错乱。
- 价值: ⭐⭐⭐⭐ 给多奖励 RL 后训练提供了一个通用、低成本、可插拔的加权模块,对文本到图像组合生成之外的领域也有迁移价值。