跳转至

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Weistrass/DyRef
领域: 图像生成
关键词: 多参考图生成、奖励优化、Flow-GRPO、难例重加权、个性化图像生成

一句话总结

本文先提出覆盖 5 类参考图、单样本 2–7 张参考图的 OmniRef-Bench,暴露出开源模型随混合类型参考图数量增加而急剧掉点这一失效模式,再用「SFT 冷启动 + 在 Flow-GRPO 上叠加 DRS(拉开组内奖励差距)与 DAR(按组均奖励给难样本反比加权)」的两阶段框架 DyRef,把开源骨干在复杂多参考生成上拉到与闭源 Nano Banana Pro 相当的水平。

研究背景与动机

个性化图像生成在扩散模型和 DiT 架构的推动下已经相当成熟,但多参考图生成(Multi-Reference Image Generation, MRIG)仍是个硬骨头:同一个 prompt 里可能同时出现「图 1 里的人」「图 2 的姿势」「图 3 的光线」「图 4 的背景」「图 5 的画面风格」,模型必须把这几类异质参考各自注入到正确的位置。这些类型对生成过程的约束粒度完全不同——主体身份要求局部像素级保真、姿态要求几何结构对齐、光照要求全局色调一致、风格要求统计特性迁移——彼此之间还会互相干扰。这类能力直接对应专业视觉设计与广告投放中「把若干素材元素编排成一张统一画面」的需求,因此并不只是学术上的玩具任务。

真正的瓶颈卡在评测上。已有的多参考基准要么只做单主体/多主体(XVerse、PSRBench),要么虽然引入了主体之外的参考类型但只有简单成对组合、参考图数量很少(MultiBanana 3 种组合、DreamOmni2 2 种),要么只给粗粒度整体打分而不对每种参考类型分别评估,更没有一个基准同时做到「参考类型组合复杂 + 参考图数量大 + 专家标注 + 细粒度多维评测」。评测不到位,方法之间的差距就无法被可靠地度量,也就无从知道模型究竟在哪一类参考、哪一个数量级上崩掉。作者用自建的 OmniRef-Bench 补上这一环后立刻看到了一个清晰的规律:主流开源模型在参考图少的时候画质尚可,一旦参考图数量增加到 4–6 张且类型混杂,画面就出现明显伪影与语义丢失,CLIP-I 随参考数量的增加快速下滑(原文 Fig. 3b),而闭源模型的下滑平缓得多——开源与闭源之间的差距,很大程度上就是这个「随参考复杂度退化」的速度差

由此问题被重新定义成:与其继续堆数据或改架构,不如先解决训练信号本身的失衡。在 RL 阶段,Flow-GRPO 把每个 prompt 采样出的若干样本作为一个组来算组内优势,但对「这组样本有多难」完全不敏感:参考图多、类型杂的样本奖励天然偏低,算出的优势幅度也小,于是梯度被参考图少、画得好、奖励高的简单样本主导,难样本几乎拿不到有效的学习信号;雪上加霜的是,CLIP / SigLIPv2 这类预训练评测器给出的奖励数值分布极其集中,哪怕两张生成图的视觉质量差距很大,奖励也只差千分之几,组内优势因此几乎失去数值区分度。核心 idea:不改模型结构,而是在 SFT 之后从奖励侧做两处互补修正——用 DRS 把过度集中的奖励分布重新拉开以恢复梯度区分度,用 DAR 按每组平均奖励对样本权重做反比缩放,让「参考图多、类型杂」的弱组自动获得更大的优化权重。

方法详解

整体框架

DyRef 是一个两阶段训练框架,训练数据只造一次、两个阶段共用(RL 阶段不引入任何新数据集)。Stage I 用自建的多参考数据构造流水线造出约 14000 条样本,以 LoRA + Flow Matching 损失在 Qwen-Image-Edit-2511 这类双流 MMDiT 骨干上做监督微调,目的是让模型先具备「同时读入多张异质参考图并各归其位」的基本能力;Stage II 在这个冷启动模型上跑在线 RL(Flow-GRPO),每个 prompt 采样一组样本,用 CSD 与 CLIP / SigLIPv2 算出每条样本的标量奖励,先经 DRS 把组内奖励差距放大,再由 DAR 依据该组的平均奖励调整这一组对总损失的贡献,最后用加权后的 GRPO 目标更新策略。整体上 Stage I 负责把模型拉进「能做」的区间,Stage II 负责纠正它在难样本上的欠学习。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
    A["多参考数据构造 + SFT 冷启动<br/>T2I 造靶图 → 反推各类参考图 → LoRA 微调"]
    A --> B
    subgraph S2["Stage II:基于 Flow-GRPO 的奖励优化"]
        direction TB
        B["奖励设计<br/>CSD 风格奖励 + CLIP/SigLIPv2 语义奖励"]
        B --> C["判别性奖励缩放(DRS)<br/>拉开组内奖励数值差距"]
        C --> D["难度感知优势重加权(DAR)<br/>按组均奖励反比调样本权重"]
    end
    D --> E["加权 GRPO 策略更新"]
    E -->|重新采样同一批 prompt| B

关键设计

1. 多参考数据构造 + SFT 冷启动:先把「读多张异质参考图」变成模型见过的事

开源骨干之所以在复杂 MRIG 上崩,第一层原因是训练分布里根本没有这种样本——常规编辑数据大多是一张图一条指令。本文的数据构造采用「先有靶图、再反推参考图」的反向思路:从 Objects365 采样主体概念,用 LLM 依次生成主体实例和 T2I prompt,送进 T2I 模型得到靶图;然后以这张靶图为锚,用 Grounded SAM2 之类的分割模型切出主体、用一系列图像编辑模型(如 Qwen-Image-Edit-2511)分别反推出该主体的背景参考、光照参考、姿态参考,风格参考则取自 OmniConsistency 数据集的外部风格图,并同步生成风格化后的靶图作为这一支的目标。这种做法的好处是每一类参考图与靶图之间存在可验证的对应关系(例如姿态参考的几何结构确实来自靶图),而不需要人工去凑「哪些图属于同一个人/同一种风格」。构造出的约 14000 条样本一并用于 SFT 与后续 RL;参考图数量在样本间自然散布(评测集中是 2–7 张),模型通过把多张参考图与指令一起送进双流 MMDiT 的编辑通路来接受可变数量的参考——参考数量的「scale」不靠改结构,而靠训练数据里把 2 张到 7 张的规格都覆盖到。SFT 用 LoRA 低秩适配加 Flow Matching 损失,改动量小、可插拔,这也是后文能把这套流程同样套到 FLUX.2 [klein] 9B 上的前提。

2. 奖励设计:CSD 管风格、CLIP/SigLIPv2 管语义,两条线各补一个短板

SFT 之后的模型在多数维度已经可用,但风格相关任务明显掉队(Tab. 8 中 SFT 的风格客观指标仅 0.38,MLLM 风格分 7.57,而背景/主体等维度都在 8 分以上)。原因是 Flow Matching 的像素级重建损失对「统计意义上的风格是否一致」几乎不敏感,而风格恰恰是 MRIG 里最抽象的一类参考。受 USO 框架启发,本文把 CSD(style similarity,来自 Somepalli 等人的风格相似度度量) 作为风格对齐的奖励模型加进奖励里,直接引导生成画面向风格参考靠拢;另一条线用 CLIP 或 SigLIPv2 度量生成图与其靶图之间的语义一致性,作为「整体别跑偏」的兜底信号,缩小生成分布与目标数据分布之间的差距。这两项奖励都是冻结的预训练评测器,不参与训练,因此整套 RL 是无模型(model-free)、纯黑盒打分驱动的。消融里去掉 CSD 后风格客观分从 0.46 掉到 0.36、MLLM 风格分从 8.67 掉到 6.33,是全表中单项跌幅最大的一处,说明这条风格奖励确实不可替代。

3. 判别性奖励缩放(DRS):把「挤在一起」的奖励分布重新拉开

CLIP / SigLIPv2 这类相似度奖励有一个麻烦的先天缺陷:数值高度集中。原文 Fig. 5(a) 给了一个很直观的例子——两张生成样本的视觉质量差异相当明显,但原始奖励分别是 0.790 和 0.794,差距只有 0.004;GRPO 的组内优势正是在这种奖励差上建立起来的,奖励挤在一起,优势就几乎退化成噪声,优势为负的样本得不到足够的惩罚、优势为正的样本也得不到足够的激励。DRS 的做法是在 DAR 的每一步优化里,把原始奖励 \(p=\cos(F_{\text{gen}}, F_{\text{target}})\)(生成图与靶图的 CLIP/SigLIPv2 特征余弦相似度)过一个可控的变换函数

\[\hat{p} = F(p,\ t), \qquad 0 < t < 1\]

其中超参 \(t\) 控制变换后奖励的分布形状。经此变换,上面那对样本的奖励被拉成 0.424 与 0.563,差距扩大了一个数量级以上,组内优势重新有了可用的数值对比度。需要注意的是 DRS 并不改变样本之间的相对排序(好的仍然更好),它只是把区分度从「预训练评测器自带的偏置」里释放出来——这也是它主要提升高层语义指标(MLLM 风格 8.67 vs 去掉后 8.12、美学 8.14 vs 8.03)而对低层客观指标几乎无损的原因。⚠️ 变换函数 \(F\) 的具体实现形式原文放在附录 C.4,此处只保留其作用与约束。

4. 难度感知优势重加权(DAR):让参考图多的弱组自动拿到更大的权重

即便奖励被 DRS 拉开,标准 Flow-GRPO 仍有一个结构性盲点:它对每个 prompt 组一视同仁,而组的难度差异极大。作者观察到两件事——一是 MRIG 样本的视觉信息量随混合类型参考图数量增加而增加,这类样本更难、更该被重点学;二是这些样本的实际奖励分数也确实随参考数量增加而系统性下降(详细分析见原文附录 C.3)。两者叠加的结果是:难组算出的优势幅度小,优化被简单组主导,难组「学不到」。DAR 借鉴密集目标检测里 Focal Loss 通过改写每个样本对总损失的贡献来对付样本不均衡的思路,把加权做在这一级:设一个优化步内训练集为 \(\mathcal{S}\)、按 prompt 划分成若干组 \(\mathcal{G}\),组 \(g\) 内样本索引集为 \(I_g\)、样本 \(i\) 的标量奖励为 \(p_i\in[0,1]\),先算组均奖励 \(\bar p_g = \frac{1}{|I_g|}\sum_{i\in I_g} p_i\),再据此构造一个反比的原始权重

\[w_g^{\text{raw}} = (\bar p_g + \epsilon)^{-\gamma}, \qquad w_g = \text{clip}\left(w_g^{\text{raw}},\ w_{\min},\ w_{\max}\right)\]

\(\epsilon\) 是数值稳定项,\(\gamma\) 控制重加权强度。反比形式意味着平均奖励越低的组权重越大,正好把优化压力导向「参考图多、类型杂」的弱组;clip 则防止个别极端组把权重撑爆。为避免整体损失尺度被这些权重整体推高或压低,还要把组权重按当前 batch 的均值 \(\mu\) 归一化回均值约 1,并再次 clip:

\[\tilde w_g = \text{clip}\left(\frac{w_g}{\mu},\ w_{\min},\ w_{\max}\right), \qquad \mu = \frac{1}{|\mathcal{G}|}\sum_{g\in\mathcal{G}} w_g\]

组内每条样本继承自己组的权重 \(w_i = \tilde w_{g(i)}\),最终每个样本以 \(w_i\) 加权进入 GRPO 目标。相比标准 GRPO,DAR 的改动完全发生在优势/损失加权层面,不触碰策略网络的采样过程,因此实现代价极低,却直接改变了「哪些样本在主导梯度」这一根本问题。⚠️ Eq. (3) 在缓存文本中排版损坏,此处按原文给出的「反比幂 + clip + 归一化」三重结构整理,\(\gamma\) 的具体取值原文未在正文给出。

一个完整示例

取原文 Fig. 5 中同一个优化步里的两个组。组 1 是参考图较少的简单样本,这一组采样出的两条生成图奖励分别为 0.790 与 0.794,属于「画质更高但组内几乎无区分度」的高质量组;组 2 是参考图多、类型混杂的难样本,整体奖励明显偏低。

先走 DRS:组 1 那对样本的原始差距 0.004 经变换后被拉成 0.424 vs 0.563,组内优势重新可算。再走 DAR:组 1 的组均奖励高,按 \(w_g^{\text{raw}}=(\bar p_g+\epsilon)^{-\gamma}\) 得到的原始权重小,clip 并归一化后落到 0.80,这一组被维持在略低于平均的贡献上、不再过度占用梯度;组 2 的组均奖励低,归一化后权重升到 1.25,这一组的样本被放大后重点优化。一个 batch 内的权重均值被归一化拉回约 1((0.80+1.25)/2 ≈ 1.03),因此整体损失尺度与不加 DAR 时基本可比——DAR 改变的是不同难度样本之间的相对配比,而不是整体学习率。⚠️ 上述 0.790/0.794/0.424/0.563 与 0.80/1.25 均取自原文 Fig. 5,为示意性数值。

损失函数 / 训练策略

Stage I 沿用标准 Flow Matching 目标:给定时序 \(t\)、从标准高斯采样的 \(z_0\) 与从目标数据分布采样的 \(z_1\),让网络拟合两者差所构成的速度场,

\[\min_{v}\ \mathbb{E}_{t,\,z_0,\,z_1}\left[\left\|(z_1 - z_0) - v_\theta(z_t, t)\right\|^2\right]\]

(⚠️ 原文 Eq. (1) 在缓存文本中排版损坏,此处按 Flow Matching 的标准形式整理。)微调以 LoRA 形式进行。

Stage II 在 Flow-GRPO 的目标上引入样本权重。设 \(r_i(\theta)\) 为当前策略与行为策略在样本 \(i\) 上的概率比、\(\hat A_i\) 为其估计优势、\(\epsilon\) 为 PPO 式的裁剪范围,则加权后的目标为

\[\mathcal{L}(\theta) = -\frac{1}{|\mathcal{S}|}\sum_{i\in\mathcal{S}} w_i \min\left(r_i(\theta)\hat A_i,\ \text{clip}\left(r_i(\theta),\ 1-\epsilon,\ 1+\epsilon\right)\hat A_i\right)\]

其中 \(w_i\) 即 DAR 给出的、经 DRS 变换后奖励所对应的样本权重:DRS 改的是 \(\hat A_i\) 的数值区分度,DAR 改的是 \(w_i\) 的组间配比,两者作用在不同的乘子上,因此可以叠加。关键超参包括重加权强度 \(\gamma\)、权重区间 \([w_{\min}, w_{\max}]\)、DRS 的形状参数 \(t\) 等,敏感性分析放在原文附录 C.2。

实验关键数据

主实验

在自建的 OmniRef-Bench 上,DyRef 分别以 Qwen-Image-Edit-2511(20B)和 FLUX.2 [klein] 9B Base 为骨干实现,与两个闭源模型和三个开源模型对比。客观指标按五种参考类型分别给出,MLLM 评测用 Gemini 3 Flash(去掉 MLLM 判断不准的姿态维度,加入美学与指令遵循)。

方法 Subject Style Bg Light Pose 客观 Avg MLLM Avg
Seedream4.5(闭源) 0.65 0.34 0.89 0.74 0.74 0.67 8.13
Nano Banana Pro(闭源) 0.64 0.46 0.89 0.77 0.72 0.70 8.50
OmniGen2 0.59 0.11 0.85 0.65 0.65 0.57 3.79
DreamOmni2 0.57 0.28 0.85 0.71 0.67 0.62 5.18
BAGEL 0.58 0.15 0.85 0.67 0.69 0.59 4.64
Qwen-2511 0.55 0.15 0.84 0.71 0.71 0.59 4.97
Qwen-2511 + Ours 0.62 0.46 0.87 0.76 0.83 0.71 8.38
FLUX.2 [klein] 0.63 0.21 0.87 0.69 0.74 0.63 6.49
FLUX.2 [klein] + Ours 0.63 0.48 0.90 0.78 0.76 0.71 8.03

同模型在单图编辑与更简单的 MRIG 基准上的表现(用来验证「多参考能力提升不以牺牲基础编辑能力为代价」):

基准 指标 Qwen-2511 + Ours FLUX.2 [klein] + Ours 说明
OmniRef-Bench 客观 Avg 0.59 0.71 0.63 0.71 复杂多参考,相对提升 12%(+0.08 vs FLUX.2)
OmniRef-Bench MLLM Avg 4.97 8.38 6.49 8.03 相对提升 29%(+1.89 vs FLUX.2)
ImgEdit Overall 4.07 4.32 4.07 4.11 超过闭源 GPT Image 1 [High] 4.20 与 Seedream4.0 4.18
DreamBench++ CP×PF 0.53 0.62 0.56 0.61 双骨干上均刷新开源最好成绩
OmniContext Average 8.14 8.24 更简单的 MRIG 基准,+1.2%
MultiBanana Average 3.78 4.34 更简单的 MRIG 基准,+14.8%

消融实验

在 Qwen-Image-Edit-2511 上以 Stage I 的 SFT 结果为基线,逐个去掉三个训练组件(Tab. 8):

配置 客观 Avg MLLM Avg Style(客观 / MLLM) 说明
SFT(Stage I) 0.68 7.90 0.38 / 7.57 只做冷启动,风格是最大短板
Ours(完整) 0.71 8.38 0.46 / 8.67 三项组件齐备
w/o CSD 0.69 8.00 0.36 / 6.33 去掉风格奖励,风格客观分跌 0.10、MLLM 风格分跌 2.34,全表最大跌幅
w/o DAR 0.69 8.03 0.39 / 6.98 退化为标准 GRPO,客观与 MLLM 双降(0.71→0.69、8.38→8.03)
w/o DRS 0.71 8.28 0.45 / 8.12 客观指标几乎不动,但 MLLM 风格 8.67→8.12、美学 8.14→8.03

用户研究方面,30 位专家对随机抽样的 20 个样例按文本保真、参考相似度、构图质量、视觉吸引力和任务完成度排序:DyRef 与 Nano Banana Pro 分列前二(MLLM 给分 8.38 / 8.50,人工 1–4 分制给分 3.42 / 3.09),Seedream4.5 与 Qwen-2511 位列三、四;MLLM 打分与人工偏好的 Pearson 相关 0.902、Spearman 0.800、Kendall 0.667,说明这套「客观指标 + MLLM」的评测协议与人的判断是同向的。

关键发现

  • 三个组件里 CSD 风格奖励的单点贡献最大:去掉后 MLLM 风格分从 8.67 掉到 6.33,跌幅远超其他任何一项。这说明 MRIG 里最「抽象」的参考类型(风格)恰恰是像素级重建损失最管不住的,必须靠专门的风格奖励补上。
  • DAR 与 DRS 的作用面不同,不能互相替代:去掉 DAR 会同时拉低客观与 MLLM 指标(退化回标准 GRPO,难组失去额外权重);去掉 DRS 则客观指标几乎不动、只有高层语义指标下滑,说明 DRS 修复的是「组内优势数值区分度」这一梯度层面的问题,其收益体现在低层相似度指标捕捉不到的高层语义维度上。
  • 性能退化随参考图数量单调加剧,且这正是被修复的对象:原文 Fig. 3(b) 显示开源模型的 CLIP-I 从 3 张参考时的约 0.76 一路降到 6 张时的明显低位,而 DyRef 的曲线在整段参考数量区间都更平——这直接对应「DAR 让难组获得更大权重」的设计意图。
  • 方法在小参数骨干上同样成立:9B 的 FLUX.2 [klein] 加 DyRef 后 MLLM Avg 从 6.49 升到 8.03,已接近 20B 骨干的 8.38,同时它的单图编辑能力还略有提升(ImgEdit 4.07→4.11、DreamBench++ 0.56→0.61),说明这不是靠模型容量堆出来的收益。
  • 泛化到训练分布之外的参考类型:作者在未纳入训练的参考类型上也做了评测(附录 C.6),性能仍有提升,说明 DAR/DRS 学到的是「如何分配优化注意力」而不是对特定类型的过拟合。

亮点与洞察

  • 把「性能随难度退化」当成一个优化问题而不是建模问题来解。多数工作遇到多参考退化会去改注意力或加适配器,本文则指出退化的一大半来自训练信号被简单样本主导,并用 DAR 在损失加权层面直接纠正。这个视角可迁移:任何「样本难度与奖励幅度正相关」的 RL 任务(长链推理、少样本工具调用、长尾检索)都可能存在同样的系统性欠学习。
  • DRS 揭示了一个通用陷阱:预训练评测器作为奖励时,数值集中会让组内优势失效。0.790 与 0.794 对应肉眼可见的画质差异,但 GRPO 只能看到 0.004 的差距。凡是拿 CLIP/相似度类模型当 reward model 的 RLHF/RLVR 流程,都应该先检查奖励的组内方差,而不是默认它可用。
  • 两个修正被刻意设计成作用于不同乘子:DRS 改优势的区分度、DAR 改样本的权重配比,因此天然可叠加、可分别消融,这种「正交拆分」让消融实验的结论非常干净——这也是本文方法叙述清楚的原因之一。
  • 「先有靶图、再反推参考」的数据构造思路可复用。需要构造「多条件控制」的训练数据时,正向地找齐所有条件素材非常昂贵,反向地从一张已经满足全部条件的图出发、用编辑模型逐个剥离出各条件的参考图,是一条便宜且天然对齐的路径。

局限与展望

  • 数据构造依赖一长串外部模型,误差会级联。靶图来自 T2I 模型、主体掩码来自 Grounded SAM2、各类参考图来自图像编辑模型、风格图来自 OmniConsistency 数据集——每一环的失败(分割不干净、编辑模型改了不该改的地方)都会变成训练数据里的噪声标签,而这类噪声在奖励优化阶段会被进一步放大。
  • RL 阶段不引入新数据,也意味着上限被 SFT 数据的覆盖面锁死。作者强调 RL 用的是与 SFT 同源的数据;如果训练分布里某类参考组合覆盖不足,DAR 只能重新分配注意力、无法凭空创造该组合的学习信号。参考数量评测到 7 张,再往上是否仍然有效没有验证。
  • 奖励模型本身是固定偏置的上限。CSD、CLIP、SigLIPv2 都是冻结的评测器,DRS 只能放大它们已经能区分的差异——若评测器对某类失败完全不敏感(例如生成图局部结构崩坏但全局 CLIP 相似度仍高),DRS 无法凭空造出判别力,补救仍要靠换更强的 reward model。
  • DAR 的关键超参 \(\gamma\) 与权重区间 \([w_{\min}, w_{\max}]\) 在正文中未给出取值,只在附录做敏感性分析;这让复现时的调参负担落在读者身上。
  • 可改进方向:把 DRS 的变换函数 \(F\) 从固定形式改成随训练进程自适应的形式(早期温和、后期激进),或让 DAR 的难度度量不只用平均奖励、而是同时纳入参考图数量与类型组合数这类先验难度信号,二者都值得一试。

相关工作与启发

  • vs DreamOmni2 / OmniGen2:它们做的是统一的多模态指令编辑与生成,多参考能力是附带产物,参考类型组合最多 2 种、评测也是粗粒度整体打分;本文的核心差异在于把「参考数量与类型复杂度」当作一等公民,专门造基准、专门设计针对复杂度失衡的训练目标。代价是本文方法不改变基座能力面,收益集中在多参考这一维度上。
  • vs USO(Unified Style and Subject-driven Generation via Disentangled and Reward Learning):USO 同样用奖励学习来做风格 + 主体驱动的解耦生成,本文直接借用了它的 CSD 风格奖励思路,差别在于 USO 面向的是「一种风格 + 一个主体」的场景,而本文要处理的是参考数量可达 7 张、类型可混到 4 类的成组样本,因此必须再解决组间难度不均衡的问题——这正是 DAR/DRS 存在的理由。
  • vs 标准 Flow-GRPO:Flow-GRPO 提供了在 flow matching 模型上做在线 RL 的骨架,但它的组内优势假设「同一批 prompt 的样本难度可比」。本文的 DAR 恰好打破这个假设:把组当作有难度差异的单元来加权,可以看作 Focal Loss 的「样本不均衡」思想在 RL 组级上的对应物。这个类比本身就是一个可迁移的洞见——目标检测里用来对付前景/背景不均衡的工具箱,可能整体都能搬到 RL 的组级加权上来。
  • vs PSRBench / XVerse 这类多主体基准:它们的评测维度集中在主体身份一致性,且不做专家标注的复杂组合;OmniRef-Bench 把参考类型扩到 5 类、组合数扩到 10 种(最多同时 4 类)、参考图 2–7 张,并同时给出客观指标与 MLLM 的多维评分,评测协议本身(客观 + MLLM 且经人工相关性验证)是本文可复用的另一项产出。

评分

  • 新颖性: ⭐⭐⭐⭐ [问题定义(复杂度驱动的性能退化)与解法(组级难度反比加权 + 奖励区分度缩放)都切得准,但单看每个组件(Focal 式加权、奖励变换)都能在别处找到对应物,创新在于组合与问题定位]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建基准 + 两个骨干 + 四个外部基准(含两个更简单的 MRIG 基准与两个单图编辑基准)+ 逐组件消融 + 30 人用户研究与相关性分析,覆盖面相当完整]
  • 写作质量: ⭐⭐⭐⭐ [动机链条从「基准不足 → 观察到退化 → 定位到训练信号失衡 → 两个正交修正」推进得很清楚,配图(Fig. 3、Fig. 5)直接支撑论证;扣分在于关键超参取值与 DRS 变换函数的具体形式被推给附录]
  • 价值: ⭐⭐⭐⭐ [既给出一个可用的评测基准,又给出一个实现代价极低(只改损失加权,不动网络结构)且能跨骨干迁移的训练配方,对做多参考生成与多条件控制的团队都可直接复用]