跳转至

RCEdit-500K: Reference Completion for Image-Conditioned Image Editing

会议: ECCV 2026
论文: ECCV 2026
代码: https://huggingface.co/datasets/carpedkm/RCEdit-500K
领域: 图像生成
关键词: 图像条件图像编辑, 参考图补全, 数据集构建, 弱指令增强, 多模态编辑模型

一句话总结

将图像条件图像编辑(ICIE)数据构建重构为“参考图补全”任务,通过对现有高质量文本编辑三元组定制四类参考图生成管线、弱指令增强与五维度 VLM 严格过滤,构建出首个覆盖 6 大类、包含 47.7 万四元组的统一开源数据集 RCEdit-500K。

研究背景与动机

文本驱动图像编辑(TCIE)在近年来取得了显著突破,但纯自然语言在表达精细视觉属性时存在天然瓶颈。诸如光影分布、摄影色调、特定材质质感以及非文字可描述的复杂风格等全局或细粒度视觉线索,难以仅凭文本提示词精确传达。这催生了图像条件图像编辑(Image-Conditioned Image Editing, ICIE)的需求——模型需要同时以输入锚点图、文本指令以及参考图像作为条件,共同引导目标图像的生成。然而,相比于商业闭源模型,开源社区在统一的多类别 ICIE 领域长期处于空白,现存公开数据要么仅覆盖少数简单实体添加或材质迁移,规模极小(约 1 万至 4 万条),要么侧重于无需保留输入图锚点结构的跨图个性化合成。

造成这一困境的核心壁垒在于 ICIE 配对数据的构建范式。传统前向合成方法试图联合生成输入图像、参考图像、编辑指令与目标图像,往往需要串联调用多次大模型,导致计算开销极其昂贵,并在级联过程中急剧放大模型先验偏差、引入分布伪影与语义失真。与此同时,社区已有的大规模高质量 TCIE 数据集(如 Pico-Banana-400K、GPT-IMAGE-EDIT-1.5M)实际上已经具备了四元组中的三要素:输入图像、编辑文本和编辑后的目标图像,唯一的缺失项正是与之契合的参考图像。

针对这一本质特征,本文跳出了昂贵且易失真的从零前向生成思路,将数据构建任务重新形式化为“参考图补全”(Reference Completion)。核心 idea:将 ICIE 数据构造转化为基于已有高质量 TCIE 三元组的逆向参考图补全问题,通过针对六大编辑类别的差异化合成管线生成对齐的参考图,结合弱化参考描述的指令增强逼迫模型感知视觉条件,并以严格的五维度 VLM 联合过滤保证四元组质量,打造出高质量统一开源基准。

方法详解

整体框架

在 ICIE 任务中,每个训练样本形式化为一个四元组 \(\langle I_{\text{in}}, I_{\text{ref}}, T_{\text{ins}}, I_{\text{tgt}} \rangle\),其中输入图 \(I_{\text{in}}\) 作为结构锚点必须保留非编辑区域的内容与空间布局,参考图 \(I_{\text{ref}}\) 仅作为视觉条件信号,文本指令 \(T_{\text{ins}}\) 描述编辑意图,目标图 \(I_{\text{tgt}}\) 为预期编辑结果。数据管线直接继承现成 TCIE 三元组 \(\langle I_{\text{in}}, T_{\text{orig}}, I_{\text{tgt}} \rangle\),首先利用视觉语言模型(GPT-4o)对编辑类型进行分类(过滤掉不适于单图参考的动作编辑等类型)、生成参考图合成提示并重写指令;随后按四大差异化分支合成参考图像;接着融入弱指令增强;最后通过五维度 VLM 过滤剔除缺陷样本,最终沉淀出 47.7 万条高质量四元组。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["现有高质量 TCIE 三元组<br/>输入图 + 原始文本 + 目标图"] --> B["VLM 任务分类与指令重构<br/>识别6大类 / 生成参考图Prompt / 改写指令"]
    B --> C["四路类型化参考图合成管线<br/>实体分割再生成 / 空间标注 / 前景重绘 / 风格材质迁移"]
    C --> D["弱文本指令增强机制<br/>抽象化消除实体文字线索 / 强迫视觉注入"]
    D --> E["五维度 VLM 严格后置质量过滤<br/>独立评分+任一维度不达标即剔除"]
    E --> F["RCEdit-500K 统一四元组数据集<br/>477K 样本 / 1024分辨率 / 兼具实体与抽象特征"]

关键设计

1. 四路类型化参考图合成管线:依据编辑语义特性解耦参考图来源 传统联合生成容易导致输入与参考图缺乏合理的视觉对应。针对添加(Add)、替换(Replace)、移除(Remove)、背景替换(Background)、风格迁移(Style)与属性改变(Alter)这六大编辑类别,本文设计了四类高保真参考图生成分支。对于 Add 与 Replace,利用 Grounded-SAM-2 从目标图像 \(I_{\text{tgt}}\) 中精确分割出目标实体,随后利用 Flux-Klein-9B 个性化重绘该实体或将其直接合成到新背景上,构造出独立且视觉一致的参考图。针对 Remove 任务,纯文本往往面临指代歧义(例如画面中有多个同类物体时无法确定移除哪一个),因此管线定位待移除实体后,以输入图像中附带紧致边界框(bounding box)或局部裁剪图作为空间参考线索,显式消除指代歧义。针对 Background 替换,采用 TCIE 模型将原前景物体全部重绘补全,提炼出纯净的目标背景环境作为参考。对于 Style 与 Alter 这类高抽象属性,利用文生图模型先生成中介内容图,再经由 GPT-Image-1.5 注入所需的抽象艺术风格或微观材质质感,解决了开源模型难以直接解耦抽象视觉属性的难题。

2. 弱文本指令增强机制:打破文本先验对参考图视觉特征的屏蔽 如果编辑指令在文本层面已经对参考物体的外观细节做出了详尽描述(例如“将图2中那只戴着红色项圈、卷毛的亮黄色小狗添加到图1草地上”),多模态模型往往会直接依赖其自身强大的文生图先验进行“文字编辑”,而惰性忽略参考图像中的真实像素细节。为迫使模型建立从参考图像到目标区域的真正跨图视觉对应,作者引入了弱化文本指令(Weak Instruction)策略。通过让 VLM 将包含细粒度视觉细节的强指令故意泛化抽象(例如简化为“将图2中的动物添加到图1中”),剥离掉可以直接从文本推断出的具体特征。在训练阶段,强指令与弱指令混合输入,有效诱导网络注意并抽取参考图的视觉特征,从机制上避免退化为伪多模态的单文本编辑。

3. 五维度 VLM 严格后置质量过滤:避免单模态单一指标评估失效 由于参考合成涉及分割、定位、图像补全与跨模态生成,流水线各环节容易引入局部瑕疵。以往工作多依靠 CLIP 图文相似度或单一整体评分,这会混淆多种维度的错误模式。本文提出了基于 VLM 的五维度独立打分过滤准则,分别针对:参考图与原 TCIE 配对的兼容性(Reference Compatibility)、参考图自身合理性(Reference Reasonableness)、改写后指令正确性(Adapted Instruction Correctness)、原始输入-目标对编辑准确性(Original Pair Correctness),以及参考图与目标图对应区域的一致性(Ref-Target Similarity)。每个样本在这 5 个维度必须全部达到预设阈值才准予保留,只要任一维度不及格即刻淘汰。人工与多模型交叉验证显示,该保守过滤机制实现了高达 96.7% 的精确率(Precision),共筛除了约 12.5% 的次品,尤其有效清洗了 Style 与 Alter 类别中的语义失真。

损失函数 / 训练策略

RCEdit-500K 支持不同架构模型的适配训练: 1. 扩散模型(Diffusion Models):选用 Flow Matching 架构的 Flux-Kontext 以及 Qwen-Image-Edit-2509,采用参数高效的 LoRA 方式微调,设置 LoRA rank \(r=256\),\(\alpha=256\),仅微调双流注意力模块中的线性映射权重,优化目标延续模型原生的流匹配或扩散去噪损失。 2. 自回归模型(Autoregressive Models):针对完全不具备原生编辑能力的统一样式自回归模型 Janus-Pro,执行全参数微调。在推理生成 ICIE 任务时,将生成编码器(Generation Encoder)与理解编码器(Understanding Encoder)提取的图像 token 进行显式拼接,使自回归解码器能够端到端联合建模输入图的结构锚定与参考图的特征转移。

实验关键数据

主实验

评估基于统一多参考基准 MultiBanana 的 2-reference 子集(排除隐私相关的 makeup 类别),通过 GPT-4o 在 5 个维度上按 1-10 分进行打分:指令对齐度(Instruction Alignment, IA)、参考一致性(Reference Consistency, RC)、背景-主体匹配度(Background-Subject Match, BSM)、物理真实感(Physical Realism, PR)以及视觉质量(Visual Quality, VQ)。

模型类别 模型名称 IA↑ RC↑ BSM↑ PR↑ VQ↑ Avg↑
闭源模型 Nano Banana 4.59 4.00 5.13 5.72 5.44 4.67
闭源模型 GPT-Image-1.5 5.87 4.94 5.40 5.89 5.85 5.51
开源模型基线 Flux-Kontext 2.94 2.80 2.39 2.94 2.81 2.82
开源模型基线 Omnigen2 3.62 3.28 4.50 5.17 5.05 3.93
开源模型基线 Qwen-Image-Edit-2509 3.60 4.06 4.83 5.61 5.39 4.31
开源模型基线 Dreamomni2 4.45 3.61 5.07 5.83 5.80 4.54
开源模型基线 Qwen-Image-Edit-2511 4.15 4.18 4.95 5.68 5.59 4.58
开源模型基线 Flux-Klein-4B 4.69 4.01 5.05 5.62 5.57 4.71
开源模型基线 Flux-Klein-9B 4.78 4.09 5.01 5.61 5.50 4.75
开源模型基线 Janus-Pro(原生未适配) 1.02 1.01 1.02 1.04 1.11 1.03
本文适配微调 Janus-Pro + RCEdit-500K 4.65 3.81 4.52 5.04 4.91 4.43
本文适配微调 Flux-Kontext + RCEdit-500K 3.52 3.42 4.76 5.50 5.27 4.04
本文适配微调 Qwen-Image-Edit-2509 + RCEdit-500K 4.08 4.03 5.11 5.86 5.72 4.56

消融实验

针对数据清洗后过滤机制、弱指令增强机制,以及不同训练数据源质量开展多组消融(以 Flux-Kontext LoRA 为基础模型)。

表 1:核心数据生成组件消融(MultiBanana 2-reference)

配置 IA↑ RC↑ BSM↑ PR↑ VQ↑ Avg↑ 说明
完整方案(Full) 3.52 3.42 4.76 5.50 5.27 4.04 包含五维过滤与弱指令混合
去除五维度过滤 (w/o post-filtering) 3.60 3.30 3.62 4.20 4.04 3.62 BSM/PR/VQ 大幅滑落,噪声破坏物理合理性与图像质量
去除弱指令增强 (w/o weak instruction) 3.67 3.35 3.84 4.50 4.27 3.74 RC 显著下降,模型退化为纯文本先验,生成主体偏离参考图

表 2:不同训练数据集质量与规模对比(MultiBanana 2-reference,基于 Flux-Kontext LoRA)

训练数据集 数据规模 IA↑ RC↑ BSM↑ PR↑ VQ↑ Avg↑
无微调基线 (Baseline) 0 2.94 2.80 2.39 2.94 2.81 2.82
ImgEdit ICIE 子集 60K 3.05 2.83 2.58 3.10 2.92 2.92
AnyEdit (无结构控制) 40K 3.02 2.65 2.10 2.57 2.44 2.68
AnyEdit (全量) 40K 2.17 1.87 4.55 5.15 4.93 2.97
RCEdit-60K (同规模对照) 60K 3.62 3.28 3.78 4.45 4.16 3.68
RCEdit-500K (全量) 477K 3.52 3.42 4.76 5.50 5.27 4.04

关键发现

  • 数据质量是后置过滤的直接体现:去掉五维后置过滤后平均分下降 0.42,其中物理合理性(PR)从 5.50 骤降至 4.20,背景主体协调度(BSM)从 4.76 降至 3.62,证明未经清洗的级联生成样本会严重破坏几何与外观一致性。
  • 弱指令是迫使多模态对齐的必要催化剂:缺少弱指令时,IA 虽有轻微虚高(3.67 vs 3.52),但参考图一致性 RC 明显下滑(3.35 vs 3.42),消融生成的视觉样本中实体外观与参考图严重脱节,证实强指令会导致文本先验屏蔽参考图的视觉调节。
  • 同规模下显著击败旧有基准:在严格对齐数据量的 60K 设置下,RCEdit-60K(3.68)大幅领先 ImgEdit(2.92)与 AnyEdit(2.97),验证了“参考图补全”相比传统前向合成在语义连贯度和自然真实感上的系统性优势。
  • 架构泛化验证瓶颈在于数据:完全没有图像编辑先验的自回归模型 Janus-Pro,经 RCEdit-500K 训练后从几乎不可用的 1.03 飙升至 4.43,甚至超越专有编辑扩散基线 Qwen-Image-Edit-2509,有力佐证了高质量数据是制约多模态编辑能力的最主要瓶颈。

亮点与洞察

  • 逆向重构的四元组补全范式:不同于成本极高且误差累积的前向联合生成,巧妙利用现存海量高质量 TCIE 三元组作为基座,只针对性反向补全参考图,以极低合成代价继承了源数据集的高度真实分布。
  • 弱化文本引导(Weak Instruction)的对抗式设计:故意模糊指令中具体实体描述,打破了多模态模型“偷懒走文本旁路”的捷径,迫使网络深度绑定参考图像像素特征。
  • 五维度各司其职的严格打分准则:摒弃单一 CLIP 分数对复杂交互的笼统模糊判断,以类似“一票否决制”的 VLM 细粒度多轴审计,确保了 47.7 万样本中没有劣质样本稀释训练效率。

局限与展望

  • 动态交互与视频跨度受限:由于单张静态参考图表达能力的天然上限,管线主动舍弃了动作形变(Motion Editing)相关的编辑类别。
  • 抽象属性依赖闭源 API:在 Style 与 Alter 这类需要高度抽象解耦的任务上,开源文生图模型尚无法稳定产出高质量参考图,当前方案仍依赖 GPT-Image-1.5 等闭源系统完成中介过渡。
  • 多物体场景的细粒度空间控制:在复杂拥挤多物体场景下,虽然使用了边界框与裁剪图作为指示,但对重叠遮挡区域的精细边缘处理仍有提升空间。

相关工作与启发

  • vs ImgEdit [36] / AnyEdit [37]:既有工作主要依赖前向合成或特定提取器,涵盖的 ICIE 样本量仅约 1 万至 4 万条,且局限于简单实体增添与替换;本文通过参考图补全方案扩展至 47.7 万条超大规模,且完整覆盖了包含风格、色调、材质改变等 6 大核心语义与抽象类别。
  • vs DreamOmni2 [34] / USO [32]:多图个性化生成类工作聚焦于自由组合多个概念生成新图像,而 ICIE 必须强制要求输入图充当结构锚点,非编辑区域严格保持不动。
  • 迁移启发:针对多模态模型中“强文本先验屏蔽辅助模态特征”的常见通病,弱化指令(Weak Instruction)设计可通用推广至跨模态检索、多视角 3D 生成以及多图像推理微调的数据合成管线中。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [颠覆了传统 ICIE 昂贵的前向合成套路,创造性提出了基于已有 TCIE 数据反向补全参考图的高效统一范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨越 Diffusion 与 Autoregressive 两大代表性模型架构,主实验、多维度消融及同规模横向对比均详实严谨]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,对动机瓶颈剖析清晰,数据统计全面,图表规范精准]
  • 价值: ⭐⭐⭐⭐⭐ [填补了开源社区缺乏大规模统一图像条件编辑数据集的空白,并开源 47.7 万高保真四元组与合成框架]