跳转至

A²-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4028
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/4160.pdf
代码: https://github.com/huayu-zheng/A2Edit
领域: 图像生成 / 参考引导图像编辑
关键词: 参考引导编辑、任意物体插入、混合Transformer、锚点引导路由、掩码退火

一句话总结

A²-Edit在FLUX.1 Fill上用联合注意力与FFN的LoRA专家、由精细分割逐步放宽到包围框的训练课程,以及500,104个跨类别训练样本,让参考物体编辑在粗掩码下仍保持较好的身份和结构一致性,UniEdit粗掩码DINO-I从Insert Anything的56.13提高到62.28。

研究背景与动机

参考引导图像编辑不只是把一个物体贴进另一幅图:模型要继承参考图里的身份、纹理或材质,又要接受目标场景的姿态、尺度和遮挡条件。服装最在意花纹与轮廓,肖像需要保持人物身份同时允许非刚性变化,家具与建筑则更依赖几何结构和透视关系。把这些任务都交给同一条参数路径,容易让一种类别适用的变换损害另一种类别;现有数据又常集中在服装或少数物体,无法充分展示类别之间哪些关系可以共享、哪些需要区别处理。

掩码进一步放大了这个问题。精细分割直接告诉模型物体边界在哪里,粗笔画或包围框却只提供大致位置,模型必须自己决定哪些像素应属于新物体、哪些仍是背景。如果训练始终依赖准确边界,推理时扩大掩码就不只是输入噪声,而是拿走了模型习惯依赖的形状信息。论文因此同时处理类别差异和空间提示不精确,而不是仅增强参考图特征。

核心 idea:让注意力与FFN共享一次类别自适应专家选择,并通过精细掩码、扰动粗掩码、包围框的渐进训练,把编辑依据从外部轮廓提示转移到参考身份与场景语义;多类别配对数据为这种分工提供学习基础。

方法详解

整体框架

核心输入是参考图、目标图和用户掩码,可选附加文本。系统先提取参考前景,利用SigLIP图像编码器、目标图的VAE潜变量和可选T5文本特征形成统一token序列,再送入FLUX.1 Fill的DiT骨干。各层用混合Transformer(MoT)选择轻量LoRA专家,最终由VAE解码得到编辑图像。

完整方案还包含两个训练侧环节:UniEdit-500K提供不同类别的配对样本,掩码退火训练策略(MATS)逐阶段改变这些样本的空间条件。下图将训练和推理合在一起展示;退火节点是训练课程,不是在推理时额外预测一个精细掩码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    DATA["UniEdit-500K<br/>多类别配对"] --> MASK["掩码退火课程<br/>精细到粗糙到框"]
    MASK -->|训练条件| ENC["前景提取与编码<br/>统一token序列"]
    INPUT["参考图与目标图<br/>用户掩码及可选文本"] -->|推理条件| ENC
    ENC --> MOT["联合注意力与FFN<br/>专家建模"]
    MOT --> AGR["锚点引导共享路由<br/>层内选择专家"]
    AGR --> OUT["迭代生成与VAE解码<br/>输出编辑图像"]

关键设计

1. UniEdit-500K多类别配对:让模型看到身份保持与形变之间的真实关系

训练集包含500,104个样本,覆盖服装、肖像、动物、植物、配饰、家具、车辆和建筑8个大类、209个细分类。不同类别采用不同配对来源,而不是对同一幅图裁两块就当参考与目标:服装和配饰使用VITON-HD、DressCode及获许可的商品与穿戴场景;肖像和动物从VidGen-1M视频取帧,经Grounding DINO定位、SAM分割和无参考画质筛选后,依据主体变化程度选择两帧。植物、车辆、建筑、家具主要来自多视角图像,结合自动配对与人工核验。

这种配对使参考和目标能够拥有不同姿态、视角或背景,同时仍指向同一主体。模型才有机会学到“复制什么”和“允许改变什么”,而不只是像素复原。论文还用NanoBanana补充缺失数据和部分领域的不平衡,最后为配对图像生成检测框与分割掩码。其数据许可描述区分公开许可和创作者授权子集;正文没有给出合成数据比例,不能据此认定所有样本都是自然拍摄或统一许可。

2. 掩码退火课程:逐步撤去物体轮廓这条捷径

第一阶段使用与目标物体严格对齐的二值精细掩码,先建立参考主体与目标区域之间的稳定对应。第二阶段并非简单随机丢弃掩码,而是先以圆形结构元素对掩码做各向同性形态学膨胀,再提取外轮廓,用Perlin噪声产生空间相关位移,扰动轮廓后将坐标限制在图像范围内并重建掩码。相关噪声能形成连续、弯曲的手绘误差,而不是每个边缘像素独立抖动的高频噪声。

第三阶段把空间提示进一步放宽为包围框,让模型在没有精细轮廓的情况下推断主体姿态、尺度和局部结构。其关键不是让掩码失去作用,而是保留“在哪里编辑”的位置条件,逐步减少“新物体必须是什么形状”的暗示。正文明确了扰动幅度、噪声尺度和两轴解耦参数的作用,但缓存中的相关公式抽取损坏,且没有给出这些参数的具体数值;这里保留可确认的流程,不重建缺失公式。

3. 联合注意力与FFN专家建模:类别分工也应改变关系计算

编码阶段先清理参考图背景,再将目标潜变量、参考视觉特征和可选文本特征投影到相同隐藏维度,融合成token序列。正文只将该操作抽象为token级Fuse,没有在缓存中展开具体token排布或位置编码,因而不能把它直接等同于某个现成的拼接实现。重要的是,专家看到的条件同时含有参考身份和目标上下文,而不是仅以物体类别名称决定输出。

普通稀疏MoE往往只给FFN配置专家,注意力仍由所有类别共享。A²-Edit认为这不足以处理图像编辑:服装的纹理对齐、面部的非刚性变化、建筑的空间结构,首先就要求不同的token关系建模。因此它在各Transformer层的注意力线性变换(如查询、键、值投影)和FFN线性变换中都加入专家特定的LoRA增量。共享骨干权重承载通用生成知识,被激活专家的低秩增量按路由权重参与对应变换;不是为每个类别复制一套完整DiT。

实现配置为8个专家、LoRA秩32。这里的“8个专家”和“8个大类”数目相同,不代表训练时存在类别与专家的固定一一标签映射,正文描述的是从特征学习分工。缓存中的权重组合公式也有排版损坏,因此不补写未确认的归一化或矩阵乘法顺序。

4. 锚点引导共享路由:保留通用编辑先验,同时按输入调用辅助能力

门控网络是MLP,每层从输入特征产生专家权重。锚点引导路由(AGR)始终保留一个骨干专家,辅助专家按其权重相对骨干权重进行选择,正文还描述了最高权重专家的回退。这样既不把所有类别压在一套适配参数里,也不会因为仅追逐最高分专家而丢掉稳定的通用编辑路径。图中的专家建模与共享路由共同构成层内MoT,并不是两个各自独立生成图像的模型。

每层只路由一次,注意力与FFN复用同一组权重,从而让“如何建立关系”和“如何变换内容”采用一致的专家组合。消融同时比较只在FFN使用MoE、固定专家、Top-2、softmax加权,以及注意力和FFN独立路由。需要注意,方法段允许选择超过骨干分数的辅助专家,而消融段称AGR激活数量与2个专家匹配;缓存没有足够细节解释选择上限与回退边界,因此不能武断写成所有输入永远恰好激活2个专家,也不能推断具体负载均衡损失。

一个完整示例

以论文展示的服装编辑任务作流程说明,而非另报一项实验:用户提供参考服装图、人物目标图,并在上身画一个覆盖衣服及少量背景的粗区域。参考前景编码提供花纹、材质等身份线索,目标编码保留人物姿态和周围环境,文本可以进一步提示需求,但不是必需输入。

统一token进入DiT后,骨干专家提供通用修补能力,辅助专家通过路由参与与该输入相关的纹理和形状建模。由于训练经历了轮廓扰动与包围框阶段,模型有机会把宽松区域理解为可生成的范围,而不是必须填满的衣服外形。VAE最终解码编辑结果;这是一种训练得到的行为,不是显式运行SAM重新定位衣服,也不保证掩码外像素绝对不变。

损失函数 / 训练策略

路由参数和LoRA专家端到端联合优化。正文没有列出完整训练损失、优化器、学习率或辅助正则项,因此不把常见扩散或流匹配损失擅自当作本文给出的公式。

训练使用4张NVIDIA A100,批大小8,图像分辨率\(1024\times1024\)。总计6000步,依次为精细掩码3000步、增强粗掩码1500步、包围框1500步;不能将这些步数直接表述为完整遍历训练集的epoch数。

单张A100 80GB上,50个采样步的平均推理约30秒,基线约32秒,均在100个评估样本上统计。峰值显存分别为42,074 MiB和39,884 MiB;这一结果支持适配开销有限,但没有方差或吞吐量曲线,不能据此保证稳定加速或低显存部署。

实验关键数据

主实验

评估包含VITON-HD、AnyInsertion及自建UniEdit测试集。AnyInsertion共100例,包含40例物体、30例服装和30例肖像;UniEdit测试集共200对,每个大类25对。下表摘取原文表1的粗掩码结果;这里的量化粗掩码是精细掩码膨胀得到的,不能与训练时的Perlin轮廓扰动、定性实验的手绘掩码完全混同。

数据集 / 粗掩码 方法 DINO-I ↑ CLIP-I ↑ LPIPS ↓
VITON-HD FLUX.1-Kontext 56.11 77.91 0.0972
VITON-HD Insert Anything 60.87 78.22 0.0809
VITON-HD A²-Edit 63.79 80.19 0.0685
AnyInsertion FLUX.1-Kontext 54.15 74.05 0.1384
AnyInsertion Insert Anything 60.50 75.98 0.0992
AnyInsertion A²-Edit 61.73 77.27 0.0903

下面摘取原文表2的UniEdit粗掩码结果。DINO-I与CLIP-I衡量特征相似性,LPIPS衡量感知距离,FID衡量生成分布与真实分布的差异;分数沿用原表尺度。VLM评估关注边界质量、真实感和局部一致性,不是用户偏好率。

方法 / UniEdit粗掩码 DINO-I ↑ CLIP-I ↑ LPIPS ↓ FID ↓ VLM ↑
ACE++ 56.68 73.66 0.1219 63.19 74.7
Insert Anything 56.13 73.37 0.1243 61.48 75.0
A²-Edit 62.28 77.45 0.0897 54.62 79.3

将正文对VLM分数的文字定义写成等价的平均式如下,其中\(n\)为样本数,三个子分数依次对应边界、真实感和局部一致性;这只是定义的记号化,并非新增评价协议。具体评审模型、评分范围和提示词在当前正文缓存中未展开。

\[ \mathrm{VLM}=\frac{1}{3n}\sum_{j=1}^{n}\left(s_j^{\mathrm{boundary}}+s_j^{\mathrm{realism}}+s_j^{\mathrm{consistency}}\right). \]

消融实验

原文表3均在UniEdit评估,下表保留粗掩码列。AE为任意编辑框架,UE为UniEdit-500K,FT、RT、BT分别指精细、增强粗糙、包围框训练阶段;完整模型含FT+RT+BT。

配置 DINO-I ↑ CLIP-I ↑ LPIPS ↓ FID ↓ VLM ↑
移除AE框架 56.18 73.21 0.1364 72.63 65.7
仅FFN使用MoE 56.11 73.69 0.1366 73.04 70.3
不使用UE训练 56.27 73.01 0.1347 72.84 66.3
仅FT 55.65 72.92 0.1516 74.77 64.7
FT+RT 59.70 74.86 0.1073 60.33 73.0
Top-2路由 57.42 75.90 0.1101 58.87 72.7
Fixed-2路由 55.21 73.49 0.1406 73.13 66.0
softmax路由 60.95 76.91 0.0983 56.12 74.7
注意力与FFN独立路由 61.16 77.34 0.1003 54.90 77.3
A²-Edit完整模型 62.28 77.45 0.0897 54.62 79.3

关键发现

  • UniEdit粗掩码下,相比Insert Anything,完整模型DINO-I增加6.15,FID降低6.86,LPIPS降低0.0346。多个方向一致的提升比仅看语义相似度更有说服力。
  • 只用精细掩码训练时,粗掩码LPIPS为0.1516;加入RT后为0.1073,再加入BT后为0.0897。注意最后一步也增加了训练阶段与步数,缺少等步数对照,不能把全部收益都归结为包围框本身。
  • 独立路由与共享路由的FID差距仅0.28,但LPIPS从0.1003降到0.0897。关系建模与内容变换协同更像是局部细节收益,而不是单一指标上的巨大跃迁。
  • 完整模型UniEdit精细掩码DINO-I为61.71、粗掩码为62.28,但VLM从82.3降为79.3。粗掩码并非让所有质量维度都提高,也不能声称掩码误差越大越好。
  • 24人用户研究中,A²-Edit相对Insert Anything的偏好比例为69.0%。它补充了自动指标,但正文未充分展开投票次数与置信区间。

亮点与洞察

  • 专家化不仅放在FFN,还进入注意力投影,切中了参考编辑的关系建模问题。相同纹理在不同姿态上如何对应,本来就不是仅靠逐token内容变换能解决的。
  • MATS把“粗掩码鲁棒性”写成可操作的训练课程。值得迁移的不是某一种噪声,而是识别任务依赖的提示捷径,并在基本对应学会后逐渐撤去它。
  • 数据配对、类别分工与空间课程形成互补。单独增加类别并不能证明模型学会类别专长,联合路由消融为这种解释提供了更直接的证据。

局限与展望

  • 正文没有独立的失败案例或局限章节;以下是阅读者依据报告范围提出的限制,不冒充作者已经证明的失败模式。
  • “任意类别”尚未等同于严格的未见类别泛化。UniEdit测试仍来自训练覆盖的8个大类,缺少明确的留出类别协议与完整细分类结果,可补做跨类别和跨来源留出实验。
  • “任意粗掩码”的量化证据主要来自膨胀掩码。偏移、漏覆盖、孔洞、多个不相干区域等输入没有单独的退化曲线,应将这些误差与手绘用户输入分别评估。
  • UE消融描述为不使用该数据、直接使用未训练初始模型,并非等量替代数据对照。因此它支持领域训练有价值,但不能独立证明数据类别多样性优于任何同规模数据集。
  • 自建测试集只有200对,FID未报告不确定性;VLM协议细节、AGR边界规则、完整损失和合成数据占比在当前正文缓存中不足。更完整的复现说明和重复运行统计有助于区分真实收益与评估波动。
  • 42,074 MiB峰值显存和约30秒生成时间仍有部署门槛。可进一步研究在保留粗掩码与身份一致性优势时进行采样加速或专家压缩,而不能直接称其为实时编辑。

相关工作与启发

  • 对比AnyDoor与MimicBrush:都利用参考图进行物体级编辑;A²-Edit把重点进一步放在跨类别参数分工和空间提示退化,其优势在这组实验中得到支持,不应扩大为所有编辑任务上的普遍优越性。
  • 对比ACE++与Insert Anything:都探索统一或上下文式插入,A²-Edit增加联合注意力与FFN专家以及掩码课程。骨干、数据与训练方案同时变化,主结果不是单独证明MoT因果作用的实验,应结合消融阅读。
  • 对比FFN-only MoE:常规专家主要改变内容变换,本文连关系计算一起条件化,并让两个模块共享选择。可迁移到多领域修补或个性化生成,但需要新任务上的同算力验证。
  • 对比文本引导编辑:正文将Qwen-Image-Edit-2509和FLUX.2-klein-4B的跨范式定性比较放在补充材料。当前缓存没有相应数值,不能把它们算作已量化击败的基线。

评分

  • 新颖性: 4/5。联合注意力与FFN的LoRA专家、锚点路由和掩码课程针对任务形成完整设计,但基础组件并非全新。
  • 实验充分度: 4/5。覆盖多个测试集、路由和课程消融及用户研究,仍缺严格未见类别、等训练预算和不确定性分析。
  • 写作质量: 3/5。问题与流程清晰,但路由激活细节、损失和部分评价协议需要补充;缓存公式损坏不应当作论文原版排版错误。
  • 价值: 4/5。对降低参考编辑的掩码交互门槛有实际意义,也提供了多类别配对数据,部署成本与泛化边界仍需验证。