跳转至

Editing Everything Everywhere All at Once

会议: ECCV 2026
arXiv: arXiv:2606.31278
论文: ECCV 原文
代码: https://github.com/Blowing-Up-Groundhogs/mice
领域: 语义分割
关键词: 多实例并发编辑、多模态扩散Transformer、流匹配、注意力偏置、实例感知平滑

一句话总结

针对多指令并发图像编辑中严重的跨实例属性泄漏与拼接缝隙问题,MICE 提出一种免训练且跨架构通用的平滑解耦注意力偏置策略,在单步前向中同时达成精准属性绑定与全局视觉谐调。

研究背景与动机

单张图像中同时修改多个不同目标或局部区域(多实例并发编辑)是文本引导图像操作迈向实用化的高价值方向。直觉上的替代方案是多轮顺序编辑流水线,但逐步编辑不仅耗时成倍增加,且随着编辑轮数叠加(通常超过 6 轮),图像视觉漂移与质量退化迅速累积;更严重的是,当实例间存在空间重叠或遮挡时,顺序执行的最终结果对编辑先后顺序高度敏感。因此,在单次前向推理中完成全部修改的并发编辑具有无可替代的效率和确定性优势。然而,现有并发编辑方法面临的核心瓶颈在于:当多个指令同时指向图像中不同区域时,扩散与流匹配模型的全局交叉注意力会导致文本语义信号相互串扰,造成灾难性的跨实例属性泄漏与特征混叠。

现有的并发编辑解法主要分为三类,但均存在明显的实用局限。第一类是多分支框架(如 MultiDiffusion、LoMOE、LayerEdit),将不同编辑分配到独立并行分支并借助隐空间梯度下降进行后处理优化,这种多分支结构伴随巨大的显存膨胀与 \(O(N)\) 级反向传播开销,在多实例高密度场景下极易爆显存;第二类是全图隐变量优化正则化(如 MDE-Edit),聚合多个损失项导致梯度竞争,大面积物体往往淹没细小目标的编辑信号;第三类是基于注意力的特征隔离方法(如 IDAttn),通过二值硬掩码(0 与 \(-\infty\))阻断注意力,但这不仅引发边界伪影与光照不连贯,还极度依赖人工设定的分层规则(在早期、中期、晚期网络层选用不同硬掩码),缺乏跨骨干架构的通用性。

本文的切入角度是:无需借助多分支复制或层级特异性调参,直接利用联合注意力中的加性偏置矩阵构建连续过渡的负衰减空间。核心 idea:提出免训练的 MICE 框架,通过实例感知的高斯掩码平滑将空间距离连续映射为注意力负偏置,在统一偏置矩阵下单次前向中实现局部实例的严格语义绑定、近邻过渡区域的渐进自然谐调以及无关远距区域的绝对注意力抑制。

方法详解

整体框架

MICE 构建于基于多模态扩散 Transformer(MMDiT)与条件修正流匹配(Flow Matching)的文本引导图像编辑框架之上。给定输入参考图像 \(I_{ref}\)、一组目标分割掩码 \(M = \{m_n\}_{n=1}^N\) 以及对应的局部编辑指令 \(T = \{t_n\}_{n=1}^N\),模型将视觉潜变量(包括带噪潜变量 \(Z_{latent}\) 与参考上下文 \(Z_{context}\))和文本指令提示词 \(Z_{prompt}\) 拼接为全局联合 Token 序列 \(Z = Z_{prompt} \parallel Z_{latent} \parallel Z_{context}\),并在所有 Transformer 模块中执行联合自注意力计算。

传统 MMDiT 的注意力机制将加性偏置矩阵 \(\mathbf{B}\) 默认为 0。MICE 则将整网所有层替换为单一精心构建的平滑解耦偏置矩阵 \(\mathbf{B} \in \mathbb{R}^{|Z| \times |Z| \le 0}\)。通过实例分割掩码推导下采样的潜空间掩码,经实例感知高斯核平滑与负对数概率空间变换,构建出连续平滑衰减的注意力偏置,无需分层适配即可同时兼顾实例解耦与边界光照融合。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入参考图像 + 多实例分割掩码 + 多目标编辑指令"] --> Down["掩码下采样至 VAE 潜空间分辨率"]
    Down --> Smooth["实例感知高斯掩码平滑<br/>独立高斯卷积 + 邻近实例边界硬截断清零"]
    Smooth --> LogB["对数概率空间连续注意力偏置<br/>映射为负对数偏置矩阵以控制空间衰减强度"]
    LogB --> Rules["多模态联合 Token 交互隔离规则<br/>区分实例提示词/背景潜变量/参考上下文交互"]
    Rules --> MMDiT["MMDiT 联合自注意力前向计算<br/>统一偏置应用于所有层无需分层调参"]
    MMDiT --> Out["生成无属性泄漏且平滑谐调的并发编辑图像"]

关键设计

1. 实例感知高斯掩码平滑:消除硬边界同时防止邻近实例语义渗透 直接使用二值分割掩码或外接矩形框会带来严重弊端:二值硬掩码阻断了编辑区域与周边背景的上下文交互,生成的目标往往呈现出明显的“贴图感”与光照切断;而若使用全局或普通高斯滤波进行平滑,当两个被编辑物体空间位置紧密贴合或存在部分接触时,高斯扩散会使两个不同实例的掩码权重相互渗透,引发新的属性交叉污染。针对该痛点,MICE 设计了实例感知的平滑策略。对于第 \(n\) 个实例的二值掩码 \(m_n \in \{0, 1\}^{H \times W}\),首先下采样至与 VAE 潜变量对齐的网格尺度,随后应用核大小为 \(k\) 的 2D 高斯卷积得到初级平滑掩码 \(s_n\)。关键的是,在计算 \(s_n\) 时,算法显式检查该位置在原始潜空间中是否属于任何其他实例 \(n' \neq n\) 的真实掩码范围;一旦触及其他实例的实体边界,该位置的平滑值立即被强制重置为 0。该设计确保了孤立目标向周围无编辑背景拥有完整柔和的扩散半径,而紧邻实例之间始终保持明确的互斥几何阻隔。

2. 对数概率空间连续注意力偏置:统一全层单矩阵控制局部解耦与全局谐调 先前基于注意力阻断的方法(如 IDAttn)必须在骨干网络的不同深度交替切换二值硬阻断与完全开放模式,对网络架构具有强耦合性。MICE 放弃二值掩码,将平滑掩码值 \(s_n \in [0, 1]\) 转换至负对数概率空间,使注意力权重呈现指数级距离衰减。对于落在第 \(n\) 个实例严格外部的视觉 Token \(Z_j\)(包含潜变量或上下文 Token),其与实例 \(n\) 内部 Token \(Z_i\) 之间的联合注意力偏置定义为:

\[\mathcal{B}_n(j) = \frac{1}{\tau} \log\left(s_n[j] + \epsilon\right)\]

其中 \(\tau\) 为温度超参数,负责控制注意力惩罚随几何距离下降的陡峭程度;\(\epsilon = 10^{-30}\) 用于规避对数零点下溢。当 Token \(j\) 处于实例核心区时,\(s_n[j]=1\),偏置严格为 0(无阻碍全交互);当 \(j\) 远离实例时,\(s_n[j] \to 0\),偏置骤降至趋近 \(-\infty\)(彻底阻断 cross-instance 串扰);而在实例边缘缓冲区,\(s_n[j] \in (0, 1)\) 提供温和的负惩罚,允许适度借用周边背景的纹理与光照信息。由于这种平滑过渡在数学上兼具了解耦与谐调,同一个偏置矩阵可毫无修改地应用于 MMDiT 的所有自注意力层。

3. 多模态联合 Token 交互隔离规则:精准绑定实例指令并保留背景上下文一致性 在将全局 Token 序列按模态划分为提示词集合 \(Z_{prompt}\)(含各实例指令 \(Z_{prompt, n}\) 与可选全局风格提示 \(Z_{prompt, g}\))、生成潜变量集合 \(Z_{latent}\)(含未编辑背景 \(Z_{latent, u}\) 与各实例区域 \(Z_{latent, n}\))以及参考图像上下文集合 \(Z_{context}\)(含背景 \(Z_{context, u}\) 与各实例对应源区域 \(Z_{context, n}\))后,MICE 确立了严密的交互矩阵规则: - 指令隔离:不同实例提示词 \(Z_{prompt, n}\) 之间相互施加 \(-\infty\) 偏置,彻底切断文本嵌入空间的特征外溢; - 背景自洽:未编辑的背景潜变量 \(Z_{latent, u}\) 与全局提示词 \(Z_{prompt, g}\)、参考上下文 \(Z_{context}\) 之间保持偏置为 0 的自由交互,锁定非编辑区域的结构底色; - 跨模态定向偏置:生成潜变量与特定实例指令之间依据 \(\mathcal{B}_n(j)\) 施加偏置,引导文本注意力高度聚焦在目标局部及其近邻缓冲带; - 上下文约束:背景参考上下文 \(Z_{context, u}\) 禁止关注任何局部实例指令(偏置置为 \(-\infty\)),防止未编辑背景被特定物体词汇意外篡改。

损失函数 / 训练策略

MICE 是一种完全免训练(training-free)的测试时推断策略。方法无需微调 MMDiT 权重或引入辅助适配网络,也无需在推断时执行计算开销巨大的隐变量梯度下降优化。在执行修正流匹配采样时,仅需根据用户提供的分割掩码生成静态平滑偏置矩阵 \(\mathbf{B}\),将其直接输入 MMDiT 的联合自注意力算子:

\[\text{Attn}(\mathbf{Q}, \mathbf{K}, \mathbf{V}) = \text{Softmax}\left(\frac{\mathbf{Q}\mathbf{K}^T}{\sqrt{d}} + \mathbf{B}\right)\mathbf{V}\]

在 FLUX.2 [klein] 4B/9B 等前沿修正流模型中,默认仅需 4 步采样即可收敛;在 FLUX.1 Kontext-dev 或 FLUX.2-Dev 等大参数量模型中采用标准的 28 步采样。

实验关键数据

主实验

评估涵盖两个基准:低密度并发基准 LoMOE-Bench(64 张图像,平均每图 3 处编辑)以及本文新建的高密度基准 MICE-Bench(260 张图像,平均每图 8.5 处并发编辑,最高可达 40 处)。评估指标包括:全图目标文本匹配度 Target CLIP Score(Tgt C)、局部编辑区域与对应指令匹配度 Localized CLIP Score(Loc C)、背景像素平均绝对误差(MAEB,越低越好)以及有效编辑尝试率(AR%,阈值化像素变化比例)。

下表展示了不同方法在 LoMOE-Bench 和更具挑战性的高密度 MICE-Bench 上的定量对比:

模型 / 方法 骨干网络 LoMOE Tgt C ↑ LoMOE Loc C ↑ LoMOE MAEB ↓ LoMOE AR [%] ↑ MICE-Bench Tgt C ↑ MICE-Bench Loc C ↑ MICE-Bench MAEB ↓ MICE-Bench AR [%] ↑
LoMOE SD 2.0 26.00 29.40 6.66 92.19 24.99 25.46 7.76 99.07
LayerEdit SDXL 25.61 29.07 7.43 97.92 23.77 24.38 9.32 99.51
Qwen-Image-Edit 自研 26.34 28.85 7.13 88.02 25.26 25.33 26.47 98.83
FLUX.2 [klein] 9B (端到端) FLUX.2 9B 26.57 29.45 8.63 99.48 25.66 26.34 27.12 100.00
Gemini 3 Pro Image (闭源商业API) 闭源大模型 26.82 29.67 7.24 97.37 25.64 27.09 13.08 98.97
IDAttn FLUX.2 9B 25.67 29.26 6.41 98.44 24.68 25.54 5.06 73.01
MICE (本文) FLUX.2 9B 26.49 30.30 8.88 98.44 25.24 27.79 13.89 98.97
MICE + SAM3 (无标注真实用例) FLUX.2 9B 26.22 30.41 8.94 96.88 25.26 27.73 13.36 98.54

在多模型骨干适配实验中,将 MICE 插入不同 MMDiT 架构均显著提升了局部编辑准确率:在 FLUX.1 Kontext 上 Loc C 由 28.26/25.43 升至 29.13/25.54;在 FLUX.2 [klein] 4B 上 Loc C 由 28.68/25.97 升至 29.57/26.85;在 FLUX.2-Dev 32B 上 Loc C 由 29.00/26.25 升至 30.28/26.91。

消融实验

基于 FLUX.2 [klein] 4B 骨干网络,对不同编辑区域定义与平滑机制进行了系统消融(Table 1):

配置 LoMOE Tgt C ↑ LoMOE Loc C ↑ LoMOE MAEB ↓ LoMOE AR [%] ↑ MICE-Bench Tgt C ↑ MICE-Bench Loc C ↑ MICE-Bench MAEB ↓ MICE-Bench AR [%] ↑ 说明
Bounding Boxes (外接矩形框) 25.94 29.55 9.38 97.92 25.00 26.57 10.66 98.78 矩形框引入过多背景噪点,背景误差高
原始分割掩码 (Original Seg. M.) 25.78 29.59 7.60 96.35 24.95 26.63 8.15 95.36 刚性边界,缺少边缘谐调缓冲
朴素高斯平滑掩码 (Gaussian Seg. M.) 25.77 29.55 7.08 96.35 25.00 26.19 7.63 87.30 邻近实例间高斯渗漏,多编辑下 Loc C 骤降
实例感知平滑掩码 (Our Seg. M.) 25.77 29.57 7.07 96.35 25.15 26.85 7.84 92.48 边界互斥清零,兼具谐调与强解耦

针对不同并发策略的横向对比显示:在低密度 LoMOE 上,基于多分支与隐变量梯度的 LoMOE 凭借微调优化指标略优;但在高密度 MICE-Bench 上,MICE 的 Loc C 达到 26.85,远胜 MultiDiffusion (26.26)、LoMOE (26.04) 及 IDAttn (25.54)。在 Gemini 3.1 Pro 充当的 LLM-as-judge 双盲评估(Table 5)中,MICE 在 MICE-Bench 上获得 1568.46 的最高 ELO 分数,大幅领先 IDAttn (1412.73) 与原版 FLUX.2 (1172.16)。

关键发现

  • 高密度场景下的解耦优势:在平均 8.5 处并发编辑的 MICE-Bench 上,普通端到端模型(如 FLUX.2 9B、Qwen-Image-Edit)的 MAEB 激增至 26-27,背景遭遇灾难性破坏;而 MICE 通过精确注意力抑制将背景失真压制在极低水平,局部 CLIP 得分超越包括商业模型 Gemini 3 Pro 在内的全部竞品。
  • 计算资源与显存可扩展性:MultiDiffusion 与 LoMOE 等多分支方法在编辑实例数量超过 15 个时,40GB A100 显存直接耗尽(OOM);而 MICE 属于单前向端到端注意力偏置运算,显存消耗与耗时曲线保持极佳平稳性,可轻松支撑多达 40 处并发编辑。
  • 端到端 SAM3 配合可用性:配合 SAM3 分割大模型生成的掩码提示,MICE 的各项量化表现(Loc C 27.73 vs 27.79)几乎与地面真值掩码持平,证明其具备高度实用的现实交互编辑价值。

亮点与洞察

  • 平滑高斯的几何互斥重置:在独立高斯卷积之后显式剔除落在邻近实例内部的扩散权重,巧妙化解了“空间平滑度”与“跨实例语义隔离”这一看似不可调和的矛盾。
  • 全网络层统一偏置的架构无感性:将距离加权映射至连续对数负偏置空间,使得单一偏置矩阵可直接适配于所有网络层与不同参数尺度的 MMDiT,彻底免除了层级超参数调优的繁琐壁垒。
  • 全局与局部编辑的无缝正交兼容:通过为全局提示词和背景潜变量开辟非偏置直通路径,模型在并发处理密集局部重绘的同时,依然能完美执行全图风格转换或环境全局重新打光。

局限与展望

  • 极端重叠实例的分离限制:当多个待编辑目标在空间三维深度上存在高比例重叠甚至包裹遮挡时,2D 视角的重叠边缘重置可能导致被遮挡物体的有效编辑区域过小或边界撕裂。
  • 小尺度微型目标的编辑敏感度:对于尺寸极其细小的实例(例如画面深处的远景纽扣、小配件),VAE 潜空间降采样后对应 Token 极少,高斯核平滑可能导致局部特征过早衰减而出现漏编辑(AR% 略微下滑)。
  • 未来方向:探索与开放词汇 3D 深度感知相结合的三维感知偏置,以及自适应根据实例投影面积动态调节温度超参数 \(\tau\) 与卷积核 \(k\) 的机制。

相关工作与启发

  • vs LoMOE / MultiDiffusion: 后者依赖独立并行去噪分支与隐空间反向传播优化,显存开销随实例数激增且极易在密集编辑下崩溃;MICE 在单一前向通道内通过注意力偏置完成解耦,运算效率呈常数级稳定。
  • vs IDAttn: IDAttn 采用二值硬掩码阻断,不仅容易造成物体边缘突兀和拼接感,且高度依赖不同网络层(浅层、中层、深层)人工设定的混合掩码策略;MICE 采用对数高斯连续衰减,单一矩阵贯穿全层,平滑过渡且具备强大的跨模型迁移能力。
  • vs Qwen-Image-Edit / 纯提示词模型: 纯文本端到端模型缺乏细粒度空间几何定位先验,在密集并发指令下出现严重的语义错位与背景洗白;MICE 以掩码偏置作为注意力约束引导,兼顾了精准局部替换与原图背景忠实度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出基于实例感知高斯平滑的连续对数注意力偏置,解决了多实例编辑中硬解耦与平滑谐调的矛盾。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建 260 例高难度并发基准 MICE-Bench,并在多款主流 MMDiT 架构与自动化评估维度上展开了严密对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学表达严谨,问题动机直击痛点,图表与实验分析结构清晰。
  • 价值: ⭐⭐⭐⭐⭐ 免训练、低算力开销且支持任意数量并发编辑,具备极高的工程落地与工业级图像设计应用价值。