跳转至

RefDiT: Local Attribute Guidance in Reference-Based Image Generation

会议: ECCV 2026
论文: ECCV 2026
领域: 图像生成
关键词: 基于参考图生成、扩散Transformer、局部属性引导、三元组分解、跨模态注意力控制

一句话总结

针对多物体参考图中局部属性无法精细引导生成的问题,RefDiT 提出结构化三元组属性解耦与三元组条件 LoRA 训练策略,在不增加推理架构开销的前提下实现了高保真的局部属性级迁移与生成控制。

研究背景与动机

基于参考图像的受控图像生成近年来发展迅速,个性化合成(如 DreamBooth)与风格迁移(如 StyleDrop、B-LoRA、ZipLoRA)已被广泛用于内容创作。然而,现有主流方案在场景假设上存在明显局限:它们大都假定参考图仅包含单一主体或统一全局风格,通过训练轻量低秩自适应(LoRA)权重或单一边界词标识符(identifier token),将整幅图像的视觉特征压缩为单一的全局表征。当面对包含多个实体、不同实体具备截然不同视觉特性的复杂真实场景时,这种粗粒度的全局条件机制往往会导致严重的属性混淆。例如,当参考图像中同时存在杯子、猫和积木时,模型无法定位与目标 prompt“茶杯与茶碟”最相关的局部物体,甚至将背景墙壁的颜色错误地迁移到生成的伞面上。

现有的 DiT 图像编辑方法(如 Flux.1 Kontext、FlowEdit)虽然具备较强的局部属性操纵能力,但其设计核心是对已有像素进行迭代修改,若强行通过多步编辑链路从参考图演变出全新的实体组合,累积的编辑误差会在数步之内摧毁源图像的上下文先验,导致生成图像严重失真。更关键的矛盾在于:一方面,用户往往期望依据参考图中某一特定局部物体的颜色、材质或风格来驱动全新物体的生成;另一方面,现有生成模型缺乏一种在无需昂贵像素级标注(如手工 bounding box 或 segmentation mask)的前提下,自主建立文本属性标识符与参考图局部区域空间语义对应关系的有效机制。

针对这一困境,本文提出重新审视参考图像引导的信息粒度,将全局引导下放到基于图元关系的局部属性解耦层级。核心 idea:利用多模态大模型抽取无空间标注的结构化物体三元组及其五维细粒度属性,并在扩散 Transformer(DiT)中引入共享权重的辅助三元组注意力流与双分支去噪一致性损失,使模型在训练阶段自适应建立文本属性标识符与参考图局部区域的空间对应关系。

方法详解

整体框架

RefDiT 的整体架构由两大核心系统协同构成:一是结构化条件模块(Structural Conditioning Module, SCM),负责从参考图像中解耦出带有精细属性标签的对象三元组,并构建全局与局部提示条件;二是三元组条件 LoRA 训练模块,负责在 DiT 的双流多模态联合注意力层中,引导属性标识符对准参考图像的特定局部区域。

在推理阶段,给定参考图 \(I\)、生成提示词 \(P\) 以及可选的用户局部控制指令 \(M_c\),SCM 首先解析参考图包含的所有实体及其交互三元组,通过与目标提示词进行语义匹配(或遵循用户明确指定的引导主体),选出最相关的局部三元组并将对应的属性标识符插入到推理提示词中;随后,经过微调的 DiT 模型直接执行标准扩散去噪,无需任何额外的推理结构改动即可精准呈现局部属性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["参考图像 + 目标提示词 + 可选控制"] --> B["结构化三元组属性解耦<br/>MLLM提取属性三元组与标识符构建"]
    B --> C["共享权重的三元组辅助注意力流<br/>图像Patch与三元组文本跨模态联合对齐"]
    C --> D["双分支去噪一致性约束<br/>全局重构损失与局部三元组一致性损失优化"]
    D --> E["生成图像<br/>精准继承局部物体属性并对齐目标提示"]

关键设计

1. 结构化三元组属性解耦:突破单一标识符的全局混叠瓶颈

以往方法通常依赖简短的全局文本描述或单一标识符捕获整图特征,难以刻画复杂多物体场景。为提供无歧义的细粒度指导,SCM 借助多模态大语言模型(如 GPT-4o 或 InternVL-3.5)从参考图像中抽取结构化三元组集合 \(S_T = \{T_c^n\}\),其中第 \(n\) 个三元组表示为 \([O_i, R_{ij}, O_j]\),\(O_i, O_j\) 为物体,\(R_{ij}\) 为其空间或动作交互。针对每个物体 \(O_i\),显式抽取五维关键属性 \(A_{type} = \{\text{color, material, size, shape, global appearance}\}\)。其中全局外观属性(global appearance)专门收录光泽、霓虹、颗粒、哑光等材质感知词,弥补单一物理属性无法涵盖的细微纹理。每个属性均被编码为专用标识符 <attr_{type_j}_{value_{ij}}>。当生成提示词输入时,模块依据语义相似度或用户控制文本 \(M_c\) 进行三元组子集匹配,并将匹配到的局部属性标识符自适应拼接到推理提示中,使条件输入在词元层面具备精准的局部实体指向。

2. 共享权重的三元组辅助注意力流:建立局部区域与标识符的渐进空间对应

即便拥有属性级标识符,若直接使用常规全局重构目标训练 DiT,交叉注意力图分析表明标识符往往会漫散在整幅画面的无关区域,无法聚焦到对应的局部目标。为解决空间脱节问题,RefDiT 充分利用多模态 DiT(MM-DiT)的联合注意力机制:在每一层 \(l\),标准流程联合投影图像 patch 特征 \(x^l\) 与全局文本条件 \(G_c^l\) 为 \(q_{xc}^l, k_{xc}^l, v_{xc}^l\) 并计算 softmax 注意力。RefDiT 在训练阶段为每个匹配的三元组 \(T_{c,i}\) 额外开辟一条辅助三元组注意力流,其视觉候选特征 \(T_{x,i}^l\) 在初始层直接取自参考图像 patch(\(T_{x,i}^0 = x_r^0\))。该辅助流与主干网络完全共享相同的 DiT 与 LoRA 投影矩阵:

\[T_{x,i}^{l+1}, T_{c,i}^{l+1} = \text{softmax}\left(\mathbf{q}_{txc}^l {\mathbf{k}_{txc}^l}^\top\right) \mathbf{v}_{txc}^l\]

其中 \(\mathbf{q}_{txc}^l, \mathbf{k}_{txc}^l, \mathbf{v}_{txc}^l\) 由三元组图像候选与三元组文本提示拼接投影而成。通过多层联合自注意力的交织传播,局部文本三元组的语义拉动图像候选流逐步向对应物体的空间高响应区域收敛,驱使 LoRA 权重学会在隐空间将特定标识符绑定到局部的图像 patch 上,且在推理时无需保留该辅助流。

3. 双分支去噪一致性约束:平衡宏观语义与微观属性迁移

为使更新后的 DiT 既能保留对参考图全局视觉分布与风格的掌控,又能严格强制特定标识符与局部图像区域的一致性,模型采用了由两个均方误差分支组成的联合目标函数。全局重构分支 \(L_r\) 监督全局条件 \(G_c\) 对加噪参考隐变量的去噪拟合能力;三元组局部一致性分支 \(L_{c,i}\) 则监督网络 \(\epsilon_\Theta\) 在输入三元组局部条件 \(T_{c,i}\) 时,对局部候选隐变量的去噪精准度。总训练损失定义为加权和:

\[\mathcal{L}_{\text{training}} = \alpha L_r + (1 - \alpha) \sum_{i=1}^K L_{c,i}\]

其中 \(K\) 为匹配的三元组总数,超参数 \(\alpha \in [0, 1]\) 调节全局风格保持与局部属性对齐的相对权重。实验证明,设定 \(\alpha = 0.5\) 能够达成最优平衡:过大的 \(\alpha\) 导致模型退化为弥散的全局风格模仿,过小的 \(\alpha\) 则削弱整体图像的连贯结构与未被明确指代背景的稳定性。

损失函数 / 训练策略

训练采用流匹配(Rectified Flow)框架下的加权去噪目标,在 Stable Diffusion 3.5 与 Flux 架构上对中间层(第 12–24 层与第 30–37 层)的注意力投影层挂载 LoRA 适配器,冻结基座模型权重与文本编码器。LoRA rank 设为 32,缩放系数 \(\alpha=0.5\),使用 Adam 优化器在单批次(batch size = 1)下训练 750 步,初始学习率为 \(5 \times 10^{-5}\)。

实验关键数据

主实验

实验基准涵盖 60 张复杂多物体参考图构建的 500 幅生成评测集。除传统的 CLIP 图像相似度(CLIP-I)与文本对齐度(CLIP-T)外,论文引入了基于约束词表的大模型评估指标 Attr-Match(通过 LLaMA-3.2-11B 统计五维属性匹配率)与开放式局部属性描述相似度 Attr-SIM。

模型 CLIP-I ↑ CLIP-T ↑ Attr-Match ↑ Attr-SIM ↑
DLoRA (DreamBooth-LoRA) 0.71 0.29 0.48 0.41
B-LoRA 0.70 0.29 0.42 0.44
K-LoRA 0.77 0.27 0.58 0.50
UnZipLoRA 0.73 0.30 0.52 0.46
ProSpect 0.68 0.21 0.28 0.33
SDEdit 0.75 0.22 0.33 0.35
FlowEdit 0.73 0.24 0.38 0.38
FluxKontext 0.79 0.28 0.60 0.52
商业模型对比
Gemini-Banana 0.78 0.29 0.74 0.65
GPT-5 0.82 0.31 0.84 0.70
本文方法
RefDiT (SD 3.5 DiT) 0.80 0.32 0.88 0.70
RefDiT (Flux DiT) 0.83 0.31 0.86 0.74

消融实验

消融实验以 SD 3.5 为基础模型,逐步验证结构化条件模块(SCM)、三元组条件注意力训练机制(Triplet Cond.)、损失权重系数 \(\alpha\) 以及不同 MLLM 抽取器的影响。

实验配置 SCM 模块 三元组条件流 损失权重 \(\alpha\) CLIP-I ↑ CLIP-T ↑ Attr-SIM ↑ Attr-Match ↑
M1 (DreamBooth 基线) \(\times\) \(\times\) - 0.71 0.29 0.43 0.48
M2 (仅全局 SCM 条件) \(\checkmark\) \(\times\) - 0.77 0.27 0.57 0.66
M3 (偏重全局重构) \(\checkmark\) \(\checkmark\) 0.7 0.79 0.32 0.68 0.81
M4 (偏重局部三元组) \(\checkmark\) \(\checkmark\) 0.3 0.80 0.30 0.66 0.82
M5 (开源 MLLM: InternVL-3.5) \(\checkmark\) \(\checkmark\) 0.5 0.73 0.30 0.63 0.80
RefDiT (完整模型, GPT-4o) \(\checkmark\) \(\checkmark\) 0.5 0.80 0.32 0.70 0.88

关键发现

  • 局部注意力对齐收益显著:对比 M1 与 M2,仅引入 SCM 结构化标识符即可使 Attr-SIM 从 0.43 跃升至 0.57;而引入三元组条件辅助流后,Attr-SIM 进一步提升至 0.70。基于 SAM 掩码的交叉注意力图分析显示,三元组条件训练使标识符对应的平均交并比(mIoU)提升了 0.17。
  • 损失平衡至关重要:\(\alpha=0.5\) 时达到最优平衡。当 \(\alpha=0.7\) 时,局部属性迁移受抑;当 \(\alpha=0.3\) 时,过度强化局部三元组导致生成图像的全局场景自然度略微受损(Attr-SIM 降至 0.66)。
  • 抽取模型具备高度通用性:采用开源的 InternVL-3.5(M5)替代闭源商用 GPT-4o 时,Attr-Match 仍达 0.80,Attr-SIM 为 0.63,显著超越所有开源基线,证明 SCM 对底层视觉语言模型具有很强的泛化宽容度。
  • 人工主观评测优势显著:在 45 位受试者共 450 次盲测对比中,受试者在 92% 的投票中偏好 RefDiT 胜过 UnZipLoRA,88% 胜过 DreamBooth,80% 胜过 FluxKontext。在与商业顶级模型 GPT-5 的直接对比中,28% 的投票更偏好 RefDiT,48% 认为质量相当,仅 24% 偏好 GPT-5。

亮点与洞察

  • 训练辅助-推理免除的优雅架构:将三元组注意力流仅作为训练阶段更新 LoRA 的辅助分支,在推理阶段完全回归标准 DiT 前向传播,既解决了空间定位模糊的痛点,又没有为在线推理引入任何显存或延迟负担。
  • 五维结构化属性化解视觉歧义:通过将非定型视觉风格拆解为颜色、材质、尺寸、形状和全局外观五维正交属性,从根源上杜绝了将背景材质误判为主体色彩等常见混叠现象。
  • 可复用的跨模态局部注意力校准范式:通过共享权重网络将局部文本词元与图像 patch 在训练时强行绑定的机制,可直接迁移至多主体故事生成、虚拟试衣及局部纹理控制等更广泛的下游扩散生成任务。

局限与展望

  • 依赖上游 MLLM 抽取质量:若参考图像存在极度密集遮挡或冷门小众物体,MLLM 的三元组解析可能会漏检或错标属性,进而在生成环节产生偏差传导。
  • 单图微调的时间开销:RefDiT 针对每张参考图需优化 750 步 LoRA 权重,虽优于全参微调,但尚无法做到纯前向零样本(Zero-Shot)瞬时推理。未来可探索将三元组对齐机制蒸馏为轻量级通用前馈适配器。
  • 复杂空间关系的动态组合:当前工作主要聚焦于局部属性的保真度迁移,对于包含多物体多重物理接触与高动态几何变形的场景,三元组表征仍显静态。

相关工作与启发

  • vs B-LoRA / K-LoRA / UnZipLoRA: 上述方法致力于将图像拆解为全局的“内容”与“风格”LoRA 块,但对多物体图像会将多个物体的属性合成为不可分割的全局表征;RefDiT 创新性地引入局部三元组和属性级专用标识符,实现了区域级与属性级的选择性引导。
  • vs Flux.1 Kontext / FlowEdit: DiT 编辑方法聚焦于对现有图像的局部像素重采样与修改,在生成全新主体结构时由于缺乏源物体解耦,在多次迭代后容易累积失真;RefDiT 则专注于从参考图中抽取局部属性知识,并将其自由注入到全新提示词驱动的生成过程中。
  • vs ProSpect / MATTE: 早期属性控制方法基于 U-Net 文本反演(Textual Inversion)在时间步层面注入嵌入;RefDiT 适配了更先进的双流 DiT 架构,利用多模态自注意力原生联合投影与局部辅助去噪流,对齐精度更高且空间聚焦能力显著提升。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出利用结构化属性三元组突破参考图局部属性生成的全局混叠难题,设计优雅。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建专门的复杂多物体基准集,提出针对性细粒度评测指标 Attr-Match 与 Attr-SIM,结合大规模主观用户评测与详尽消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照详实,问题切入与解决方案高度自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为 DiT 时代的个性化与细粒度条件生成提供了非常坚实的方法论启发。