跳转至

Correlation-Weighted Multi-Reward Optimization for Compositional Generation

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 组合生成 / 多奖励强化学习 / GRPO / 相关性重加权 / 文本到图像

一句话总结

针对多概念组合生成中「朴素聚合多个概念奖励会让容易满足的概念主导优化、真正冲突的概念被稀释」这一瓶颈,CMO 在同一 prompt 的样本组内计算概念奖励之间的 Pearson 相关矩阵,用「该概念与其他概念的平均相关」估计它的生成难度,再用 \(\text{softmax}(1-\alpha)\) 给冲突概念加权,接在 MixGRPO + GDPO 的强化学习配方上微调 SD3.5 与 FLUX.1-dev,在 ConceptMix、GenEval 2、T2I-CompBench 三个组合生成基准上取得一致性提升。

研究背景与动机

文本到图像扩散与流匹配模型(SD3.5、FLUX.1-dev 一类)在单概念生成上已经相当可靠,但组合生成一直是软肋:一条真实 prompt 往往同时要求若干概念,并且要把每个属性正确绑定到对应物体上、还要满足计数与空间关系。早期工作靠推理期的注意力控制或额外交互条件来缓解 token 纠缠——结构化扩散引导、Attend-and-Excite、token merging 都属于这一类;DiT 与 flow matching 架构把 token 分离做得更好,部分缓解了这个问题,但当一条 prompt 里塞进五六个以上概念时,模型仍然会漏掉其中一部分。近两年更主流的思路是把 GenEval 这类评测指标直接当奖励,用扩散强化学习做后训练(FlowGRPO、MixGRPO、Pref-GRPO、IterComp),在单概念或双概念设定上确实有效。

问题出在多概念设定下奖励的聚合方式上。模型面对复杂 prompt 时最常见的失败不是「全错」而是「部分成功」——同一组采样里,有的图对象对了但计数错,有的图颜色对了却把主体丢了。这时候各概念的奖励互相拉扯,而现有做法只是把每个概念的奖励朴素聚合:GRPO 直接求和,GDPO 虽然用解耦归一化解决了多奖励归一化互相干扰(reward collapse)的问题,归一化之后仍然是等权相加。等权聚合的后果是优化被「在一组图里几乎总被满足」的容易概念主导,而最需要梯度的难概念被平均掉。更棘手的是,某些概念之间是负相关的:把灰色画对,往往以丢掉蜘蛛或锤子为代价——这正是「生成冲突」。论文先做了实证来坐实这一点:在 ConceptMix 上对同一 prompt 的 10 张图计算概念奖励的相关性,把各方法的「负相关概念对比例」和 Full Mark 分数画在一起,SD3.5、SD3.5 + FlowGRPO、SD3.5 + CMO 三点对应的分数约为 0.267 / 0.313 / 0.391(与表 5 的 SD3.5-M 基线和完整模型一致),负相关越多分数越低;而且随着 prompt 里概念数 K 增大,基线模型的负相关概念对比例迅速攀升,说明朴素聚合会放大概念之间的此消彼长。难点还在于「哪些概念难」随 prompt 的组合方式变化——「三把锤子」在某些 prompt 里是难点、在另一些里不是——所以人工调权重不现实。

核心 idea:既然「难」体现为概念奖励在样本组内部的统计相关性,就把手工调权重的问题转成相关矩阵上的自动难度估计——概念与别人越负相关(越冲突)权重越大,用 \(\text{softmax}(1-\text{平均相关})\) 加权到 GDPO 解耦归一化后的优势上,让模型同时满足 prompt 里的全部概念。

方法详解

整体框架

CMO 是一个面向多概念 prompt 的多奖励强化学习后训练框架,输入是一条多概念 prompt 和策略模型对一个采样组生成的一批图像,输出是更新后的 LoRA 策略。整个流程分四步:先把 prompt 解析成结构化的「多概念配置」,也就是把其中出现的对象、颜色、纹理、形状、风格、尺寸、计数与空间关系拆成 K 个概念组;然后 T2I 模型(SD3.5 或 FLUX.1-dev)对同一 prompt 采样 G 张图,每组图用一组专用奖励函数逐一评价这些概念,得到的奖励堆成一个 \(G \times K\)多奖励矩阵;接着在这个矩阵上按概念两两计算 Pearson 相关,得到每个概念的难度分 \(\alpha_k\),再过 softmax 得到权重 \(w_k\);最后把权重乘到 GDPO 解耦归一化后的组内优势上,求和并做批归一化,用最终优势更新策略。优化采用 MixGRPO 式的混合 ODE–SDE 采样,只在最前面几个 timestep 做随机 SDE 探索,其余步走确定性 ODE,以压掉全步 SDE 采样带来的计算开销。

方法的核心计算对象是那个 \(G \times K\) 的多奖励矩阵:所有概念级奖励先被独立算出来、独立归一化,相关性重加权在归一化之后的优势层面发生,因此它是在 GDPO 的基础上替换掉等权求和,而不是另起一套优化目标。

关键设计

1. 多概念奖励分解:把一条 prompt 拆成 8 类概念组,各自配一个专用奖励函数

要按概念加权,前提是每个概念有独立的奖励信号,所以 CMO 首先设计的是一套细粒度奖励分解,而不是一个标量打分器。对象存在性用 SAM 3 做文本引导的实例检测,把对象名直接当检测 prompt 送进去,检出的边界框与 mask 同时成为后续所有局部评价的公共定位层——这一步很关键,它把目标实体从背景噪声中抠出来,属性、计数、尺寸、空间四类奖励共享同一套定位,避免了多套检测器各自为政带来的噪声。属性奖励(颜色、纹理、形状、风格)用零样本分类器 OpenCLIP-H 度量:在目标物体边界框裁剪出的区域上取图像特征,与该属性类别的候选词表(如红/绿/蓝)中每个候选词的归一化文本特征算相似度,经 softmax 得到 prompt 指定属性 \(v^*\) 的概率作为奖励

\[r_i^{\text{attr}}=\frac{\exp(\langle f_{\text{img}}, f_{v^*}\rangle)}{\sum_{v \in \mathcal{V}_k}\exp(\langle f_{\text{img}}, f_v\rangle)}\]

这样奖励是连续的部分分而不是 0/1 判定,训练早期也能给出可分辨的梯度。计数奖励不用存在性那样的二值惩罚,而是基于计数偏差的可微启发式:检出计数 \(c_i\) 与目标计数 \(c_i^*\) 偏差越大奖励越小(⚠️ 该式在缓存文本中字符有损,具体形式以原文为准)。尺寸属性用所有检出物体面积的秩次反平方衰减来评价。空间关系分两路:2D 关系(上/下/左/右)用几何启发式给 1.0 / 0.5 / 0.0 的分档部分分;3D 深度关系(in front of / behind)则用 Depth Anything 3 估计深度图 \(\mathcal{D}(x)\),取目标 mask 内像素的平均深度 \(\bar{d}_i\),前置关系要求 \(\bar{d}_i\) 明显小于 \(\bar{d}_j\),并留一个容差 \(\epsilon\) 吸收深度估计的噪声,后置关系取相反条件。这一整套设计的意义在于:每个概念既可独立评价、又能给出连续部分分,奖励矩阵的每一列才真正对应「这个概念在这张图里满足到什么程度」,后面的相关性分析才有意义。

2. 相关性难度估计与重加权:用组内奖励相关矩阵自动定位相互冲突的概念

这是论文的核心贡献。对同一 prompt 采出的 G 张图,K 个概念的奖励组成矩阵 \(R^{(i)} \in \mathbb{R}^{G \times K}\),先算概念两两之间的 Pearson 相关矩阵 \(C \in \mathbb{R}^{K \times K}\)

\[C_{k,l}=\text{Corr}\big(R^{(i)}_{k}, R^{(i)}_{l}\big)\]

然后给每个概念一个难度分 \(\alpha_k\),定义为它与其他所有概念相关系数的平均:\(\alpha_k=\frac{1}{K-1}\sum_{l\neq k}C_{k,l}\)。由于 \(C_{k,l}\in[-1,1]\),与别人负相关的概念 \(\alpha_k\) 低,意味着「把它做对往往伴随另一个概念做错」,也就是最难同时满足的概念;反之高相关的概念是「一荣俱荣」的容易概念。权重由 \(\text{softmax}(1-\alpha_k)\) 给出,用 \(1-\alpha_k\) 把「越难权重越大」翻正过来,最后替换掉 GDPO 的等权求和:

\[\hat{A}^{(i,j)}_{\text{total}}=\frac{\sum_k w_k A^{(i,j)}_k-\mu_B}{\sigma_B+\epsilon},\qquad A^{(i,j)}_k=\frac{r^{(i,j)}_k-\mu^{(i)}_k}{\sigma^{(i)}_k}\]

其中 \(A_k\) 是第 k 个奖励的组内相对优势,\(\mu_B,\sigma_B\) 是加权和的批级统计量(⚠️ 式 11 在缓存文本里字符有损,此处按式 2 与图 2 还原为「加权求和后批归一化」,以原文为准)。训练稳定性上有两处旁路:如果某个概念在本组内方差近似为 0(组内全部满足或全部不满足),相关性在数学上无定义,直接把 \(\alpha_k\) 设成默认的最大相关值 1.0,避免除零产生的不稳定梯度;如果采样组里存在未填满的 padding 值,也整组跳过相关性估计。前一处旁路与 GDPO 的组内归一化天然配套——方差为零的概念其组内优势本来就趋近 0,压低它的权重不会损失有效梯度,却能让梯度预算集中到真正冲突的概念上。与「等权多奖励」和「人工调权重」相比,这个机制的差别有三点:难度是组内实例化的,同一概念在不同 prompt 组合里权重不同;难度由相关性而不是奖励绝对值决定——奖励低可能只是策略还没学会,只有负相关才说明概念之间存在真实的优化冲突;权重不引入新参数,也不用额外训练一个难度预测器。

3. 面向困难概念的训练数据构造:单属性与多概念混合,并按概念组偏斜采样

多概念奖励的结构密度需要有对应的训练分布来承载,否则再好的奖励也没东西可监督。CMO 的训练集是 5k 条 prompt,一半是 2.5k 条复杂多概念 prompt(用 ConceptMix 的流水线加 Qwen3-30B 合成,每个实体最多绑 8 个概念,即 \(K+1=8\)),另一半是 2.5k 条单属性 prompt({color} {object} 之类的干净绑定),后者沿用 FlowGRPO、TempFlow-GRPO 的观察——单属性集合能提升整体组合能力。更关键的是概念组的采样比例被刻意偏斜成 Color : Texture : Shape : Size : Spatial : Numeracy = 3 : 3 : 2 : 1 : 10 : 7,让空间关系和计数这两类最难满足的概念在训练中被反复暴露。消融证明了这套数据构造确实是独立的一块贡献:只用基础优化(DRO)几乎无效,换上这套数据后 Avg Full Mark 从 0.2713 升到 0.3305(仅单属性)再到 0.3531(加入多概念),是除相关性重加权之外的最大增益来源。作者也承认这个比例是先验固定的,在讨论中提出未来应改由失败模式驱动自适应调整。

一个完整示例

以图 1 的 prompt 为例:「图里有一只灰色的圆形蜘蛛,另外还有恰好三把清晰可见的锤子」。评测拆成 5 个问题:Q1 有锤子吗、Q2 蜘蛛是圆形的吗、Q3 有蜘蛛吗、Q4 蜘蛛是灰色的吗、Q5 图里有三把锤子吗。基座模型在一个采样组上的典型部分成功模式是:Q1 几乎全对(记 1 + 1 = 2 分),Q2 全错(0 + 0 = 0),Q3 只有少数图对(0.2),Q4 部分对(0.5),Q5 多数图对(0.8)。把每个概念奖励在组内归一化后得到约 1.8 / −0.9 / −0.7 / −0.2 / 0.1 的优势;相关性重加权给出的权重是 Q1 0.1、Q2 0.1、Q3 0.8、Q4 0.9、Q5 0.8,最终优势 = 权重 × 归一化奖励 = 0.18 / −0.09 / −0.56 / −0.18 / 0.08(图 1 为示意数值)。要点在于:Q1 这种「白送分」的概念被压到 0.1,而「要把灰色画对就可能丢掉蜘蛛」的 Q4(0.9)和「要凑够三把锤子」的 Q5(0.8)被抬到最高,Q3 那条最大的负梯度因为权重放大而成为这一组的主要优化对象。权重不是按奖励高低给的,而是按概念之间是否冲突给的——这就是相关性重加权在一个具体样本组上做的事。

损失函数 / 训练策略

基础优化配方作者称为 DRO(Decoupled Reward Optimization),即 MixGRPO + GDPO 的组合。采样上,为避免全步 SDE 带来的开销,只在滑动窗口 \(S \subseteq [0,T]\) 内做随机探索、窗口外走确定性 ODE:

\[ dx_t=\begin{cases}\big[v_t-\tfrac{1}{2}g^2(t)s_t\big]dt+g(t)dw, & t\in S\\ v_t\,dt, & t\notin S\end{cases} \]

其中 \(v_t\)\(s_t\) 分别是速度场与分数函数,梯度因此被集中在窗口 \(S\) 内,显著缩短优化所需的时间步;本文遵循 MixGRPO,把 SDE 更新严格限制在前 3 个 timestep。多奖励侧先用 GDPO 的解耦归一化:对 K 个奖励各自独立算组内相对优势 \(A^{(i,j)}_k=(r^{(i,j)}_k-\mu^{(i)}_k)/\sigma^{(i)}_k\),避免归一化前的聚合把不同奖励组合映射到同一个优势上;CMO 把这一步之后的等权求和换成 \(w_k\) 加权求和,再做批归一化得到 \(\hat{A}_{\text{total}}\)。训练细节:LoRA 微调 SD3.5 与 FLUX.1-dev,学习率 \(3\times10^{-4}\),每次迭代采 8 条 prompt、每条生成 16 张图、4 卡全局 batch size 512,采样步数 SD3.5 用 10 步、FLUX.1-dev 用 6 步,并配合系数保持采样(CPS)平衡探索与效率。

实验关键数据

主实验

三个组合生成基准:ConceptMix(严格多概念,报告 Full Mark 与 Concept Fraction,k 表示概念数,每条约含 k+1 个概念)、GenEval 2(Soft-TIFA 的原子级 TIFA_AM 与 prompt 级 TIFA_GM)、T2I-CompBench(属性绑定、空间/非空间关系、计数、复杂组合七项及其平均)。所有基准每条 prompt 用不同随机种子生成 10 张图取平均;ConceptMix 的评估器从原始论文用的 GPT-4o 换成 Qwen3-VL-8B,所有基线都用同一套设置重跑,因此绝对数值不能与已发表论文的数字直接比较。

模型(指标) k=1 k=2 k=3 k=4 k=5 k=6 k=7
FLUX.1-dev(Full Mark) 0.6647 0.4127 0.2680 0.1620 0.1173 0.0567 0.0372
FlowGRPO(Full Mark) 0.7600 0.5457 0.3517 0.2103 0.1727 0.0827 0.0713
Pref-GRPO(Full Mark) 0.7037 0.4790 0.3023 0.2120 0.1603 0.0897 0.0647
Qwen-Image(Full Mark) 0.8183 0.6583 0.5060 0.3803 0.3353 0.2213 0.1747
CMO(FLUX.1-dev,Full Mark) 0.8410 0.7063 0.5700 0.3947 0.3560 0.2317 0.1883
FLUX.1-dev(Concept Frac.) 0.8162 0.7430 0.7093 0.6706 0.6779 0.6467 0.6576
FlowGRPO(Concept Frac.) 0.8747 0.8144 0.7726 0.7235 0.7263 0.7010 0.6953
Qwen-Image(Concept Frac.) 0.9052 0.8600 0.8403 0.8193 0.8171 0.7869 0.7942
CMO(FLUX.1-dev,Concept Frac.) 0.9147 0.8850 0.8635 0.8188 0.8214 0.7917 0.7884
模型 Color Shape Texture Spatial Non-Spatial Numeracy Complex Avg
FLUX.1-dev 0.7358 0.4802 0.5989 0.2461 0.3067 0.6107 0.4281 0.4866
FlowGRPO 0.8263 0.6177 0.7241 0.5237 0.3184 0.6987 0.3905 0.5856
Qwen-Image 0.8395 0.5882 0.7407 0.4454 0.3136 0.7553 0.4414 0.5892
SD3.5 + CMO 0.8692 0.6427 0.7959 0.5475 0.3201 0.7200 0.4036 0.6141
FLUX.1-dev + CMO 0.8607 0.6188 0.7206 0.4577 0.3171 0.7066 0.4909 0.5961
GenEval 2(Soft-TIFA) TIFA_AM ↑ TIFA_GM ↑
FLUX.1-dev 64.1 17.1
FlowGRPO 70.9 21.8
Pref-GRPO 70.3 23.0
Qwen-Image 80.0 31.4
CMO 80.0 34.0

消融实验

DRO 指基础的多奖励优化(MixGRPO + GDPO);Single-Attr. / Multi-Concept 指是否纳入对应的训练数据;CR 即相关性重加权。

配置 DRO Single-Attr. Multi-Concept CR Avg. Full Mark Avg. Concept Frac.
SD3.5-M(基座) 0.2667 0.7203
+ DRO × × × 0.2713 0.7411
+ DRO + 单属性数据 × × 0.3305 0.7752
+ DRO + 单属性 + 多概念 × 0.3531 0.7993
完整 CMO 0.3913 0.8126

关键发现

  • 复杂度越高收益越大。k=7 时 CMO 的 Full Mark 为 0.1883,是基座 FLUX.1-dev(0.0372)的约 5 倍,也超过 Qwen-Image(0.1747);Concept Fraction 从基座 0.6576 提到 0.7884,说明它主要靠「不让对象被整体丢弃」而不是靠某一类属性刷分。
  • 相关性重加权是增益最大的一块。在数据与基础优化都到位后(0.3531),单独加上 CR 还能再涨到 0.3913,Concept Fraction 同步从 0.7993 到 0.8126;反过来,只加 DRO 几乎没用(0.2667 → 0.2713),说明「多奖励 + 解耦归一化」本身不足以解决概念冲突。
  • 冲突随复杂度上升的定量证据。基线模型的负相关概念对比例随概念数 K 增大而快速上升,CMO 则维持在较低水平;左图把负相关比例与 Full Mark 分数并列后呈现明显的负向关系,这是「优化冲突导致漏概念」这一动机的直接支撑。
  • 打平与落后的地方要如实看。GenEval 2 的原子级 TIFA_AM 上 CMO 与 Qwen-Image 打平(80.0 对 80.0),优势只在 prompt 级 TIFA_GM(34.0 对 31.4);T2I-CompBench 的 Numeracy 上 Qwen-Image 的 0.7553 仍高于 CMO 的两条结果(0.7200 / 0.7066);Non-Spatial 用的是 CLIPScore,各方法挤在 0.3067–0.3201 之间,该维度接近饱和,不构成有效证据。
  • 两个基座都能受益。SD3.5 + CMO 拿到 T2I-CompBench 最高 Avg(0.6141)并在属性绑定与空间关系上领先,FLUX.1-dev + CMO 则在 Complex(0.4909)上最强,说明该方法不绑定特定骨干。

亮点与洞察

  • 把「难度」定义在相关结构上而不是奖励值上。奖励低可能只是策略尚未学会,只有负相关才说明两个概念在优化中互相排斥——这一区分让难度信号不再被「概念本来就不容易」的噪声污染,也把「哪些概念冲突」变成了一个不用额外训练就能算出来的量(一个 \(G\times K\) 矩阵上的 Pearson 相关)。这个视角可以直接迁移到任何多目标对齐场景,例如 agent 多目标 RL 或 RLHF 里的多维偏好加权。
  • 零方差旁路是一处顺带自洽的细节。组内全都满足或全都不满足的概念,相关性无定义,作者把它设为默认最大相关 1.0 从而压低权重;而这类概念经组内归一化后优势本来就趋近 0,压低它既不损失有效梯度,又避开了除零梯度。
  • bbox / mask 复用成公共定位层。SAM 3 检出的框与掩码同时服务属性(裁剪区域做 OpenCLIP 对比)、计数(框数)、尺寸(框面积秩)与空间(2D 几何 + 3D 深度序)四类奖励,一个定位错误不会在四个奖励里以四种不同方式重复出现,这是多奖励设计里容易被忽略的工程细节。
  • 3D 关系奖励用深度序比较加容差。用 Depth Anything 3 的深度图比较两个 mask 内的平均深度,并用容差 \(\epsilon\) 吸收单目深度的噪声,得到一个不需要 3D 标注、又比 2D 检测框 IoU 类启发式更贴近「前后」语义的空间关系监督信号。

局限与展望

  • 训练数据的采样比例(Color : Texture : Shape : Size : Spatial : Numeracy = 3 : 3 : 2 : 1 : 10 : 7)是先验固定的人为设定,作者也把它列为首要未来工作,提出应改由失败模式驱动、把 prompt 分布本身纳入难度感知的优化闭环。
  • 相关性只在单条 prompt 的同一个采样组内估计,G 很小的场景下 Pearson 相关系数噪声较大;跨组、跨 prompt 池估计相关性是否会得到更稳的难度信号,论文没有验证。
  • 消融只在 SD3.5-M 一条线上做(表 5),没有在 FLUX.1-dev 上重复;主表里 CMO 用的是 FLUX.1-dev,因此消融的结论与主结果的骨干并不完全对齐。
  • 训练规模相对克制:LoRA 微调、4 卡、5k prompt,没有验证全参微调或自回归生成模型上的表现;也没有报告训练时间/显存的代价,而每步要跑 SAM 3、OpenCLIP、Depth Anything 3 与一个 VLM 评估器,奖励计算的开销不低。
  • 评估侧存在可比性 caveat:ConceptMix 的评测器由 GPT-4o 改为 Qwen3-VL-8B(基线全部重跑因此内部公平),GenEval 2 的 TIFA_AM 上并未拉开差距。
  • 缓存全文不含附录,2D 空间关系的具体公式与属性候选词表构造/归一化的细节都在附录里;计数奖励式在缓存文本中字符有损(⚠️ 以原文为准),这些细节的完整核对需要对照原文附录。

相关工作与启发

  • vs FlowGRPO / MixGRPO:它们把组相对优势用到扩散/流模型的 RL 对齐上,多奖励场景下是等权求和。本文认为等权平均会系统性地低估冲突概念,并把「效率配方」原样保留(MixGRPO 的混合 ODE–SDE)而只替换聚合方式,因此两者的改进是正交可叠加的。
  • vs GDPO:GDPO 解决的是多奖励归一化互相干扰导致奖励坍塌,思路是先各自归一化再聚合,但聚合仍是等权。CMO 直接把它当作基座(消融里的 DRO),只把最后的等权求和换成相关性加权,可以理解为「GDPO 的加权聚合版本」。
  • vs IterComp / Pref-GRPO:IterComp 从模型库迭代地做组合感知反馈学习,Pref-GRPO 用成对偏好奖励稳定 GRPO;两者都在奖励表面形式上做文章,没有显式建模概念之间的关系,因此在概念数增大时仍受同一个冲突问题制约(ConceptMix 上 k=7 时分别只有 0.0040 与 0.0647)。
  • vs 训练无关的注意力控制(Attend-and-Excite、结构化扩散引导、token merging):它们在推理期改注意力或 token 交互,不需要训练、可以直接套在任意模型上,但面对已经被大规模预训练固定下来的绑定能力上限,改善有限,也无法利用「哪些概念冲突」这种全局信息;本文选择后训练,代价是必须拿到模型权重并承担奖励计算开销。
  • 可迁移的启发:多奖励加权里,用奖励之间的相关性而不是奖励的均值/方差来定义「难」,是一个几乎零额外成本(一次 \(K\times K\) 相关计算)却能改变梯度分配的操作;同类思路可以试在 RLHF 的多维偏好(有用 vs 无害常冲突)、多任务学习中任务冲突的加权、以及 agent 的多约束奖励设计上。

评分

  • 新颖性: ⭐⭐⭐⭐ 「用概念奖励的相关结构自动估计难度并重加权」这个视角是新的,但 MixGRPO、GDPO、SAM 3、OpenCLIP 等组件都是现成的,属于组合式创新。
  • 实验充分度: ⭐⭐⭐⭐ 三个组合基准 + 消融 + 定性 + 定量冲突分析齐备,但消融只在 SD3.5-M 一条线、无代价分析、附录细节未在主文给出。
  • 写作质量: ⭐⭐⭐ 动机与图 1 的说服力强,但多个核心奖励公式被推到附录、符号定义散落,正文表 5 的说明段落重复(同一段话把「表 5」说了两遍),公式在 PDF 里也有明显排版错乱。
  • 价值: ⭐⭐⭐⭐ 给多奖励 RL 后训练提供了一个通用、低成本、可插拔的加权模块,对文本到图像组合生成之外的领域也有迁移价值。