跳转至

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/QingtaoPan/ELDiff
领域: 图像生成
关键词: 文本到图像扩散、证据深度学习、Dempster-Shafer 证据理论、多物体组合、跨注意力监督

一句话总结

针对多物体文本到图像扩散模型中伪标签分割偏置与语义重叠冲突两大痛点,ELDiff 结合证据深度学习(EDL)的不确定性建模与 Dempster-Shafer 证据理论(DST)的冲突量化,在零额外推理延时下显著提升了复杂多物体生成的语义一致性与保真度。

研究背景与动机

近年来文本到图像(T2I)扩散模型取得了突破性进展,能够根据文本提示合成高质量且多样的视觉内容。然而,当输入文本涉及多个实体及其复杂空间关系时,标准扩散模型的去噪目标依赖整句全局提示预测噪声,缺乏对各细粒度语言概念与局部视觉区域之间对应关系的显式约束,极易引发实体缺失、属性错位和概念混淆等组合失效问题。

为缓解这一难题,以 TokenCompose 为代表的 token 监督微调范式被提出。该类方法利用预训练检测与分割模型(如 Grounded-SAM)离线提取名词对应的二值分割掩码,并直接以此对交叉注意力图(Cross-Attention Maps)施加逐 token 的空间一致性监督。然而,这种监督机制存在两个根源性缺陷:一方面,自动生成的分割掩码本身存在分割偏置(Segmentation Map Bias)与边缘噪声,强制将注意力匹配到不可靠的伪标签容易导致过拟合;另一方面,独立优化各名词注意力图预设了各概念在空间上完全互斥,而在“猫坐在椅子上”等实体交互或重叠场景中,重叠区域同时受到相互矛盾的梯度拉扯,造成严重的语义重叠冲突(Semantic Overlap Conflict)。

面对伪标签不可靠与实体交互冲突的双重挑战,现存方法要么被动接受噪声监督,要么引入沉重的推理期测试时优化。本文的切入角度是引入不确定性度量与多源证据融合机制,让模型在单次前向中感知伪标签置信度并自适应化解重叠竞争。核心 idea:将交叉注意力图映射为狄利克雷证据分布以估计像素级认知不确定性,并借助 Dempster-Shafer 证据理论量化不同名词间的语义重叠冲突,构建抗偏置且防冲突的端到端扩散微调策略。

方法详解

整体框架

ELDiff 的核心在于构建一套“感知不确定性、惩罚跨概念冲突”的端到端微调目标。在训练阶段,输入提示词经过文本编码器提取各个名词 token,扩散网络主干(如 UNet)在去噪过程中产生各名词 token 对应的交叉注意力图 \(A\)。离线由 SAM 提取的对应二值分割掩码 \(M\) 不再充当确定性硬标签,而是与注意力图共同参与证据学习与冲突消减流程。

整个流程由两个协同组件构成:像素证据损失(Pixel Evidence Loss, \(\mathcal{L}_{\text{PixEvi}}\))将交叉注意力分值映射为狄利克雷分布的证据值,通过主观逻辑量化像素级不确定性,从而在分割伪标签不可靠区域自适应弱化惩罚;token 冲突损失(Token Conflict Loss, \(\mathcal{L}_{\text{TokCon}}\))则利用 Dempster-Shafer 证据理论组合规则,计算多物体空间重叠区域的冲突系数并施加定向抑制,同时聚合目标实体内部激活。在推理阶段,ELDiff 完全复用微调后的扩散骨干,无需任何额外的掩码先验或测试时注意力干预。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入文本提示 + 加噪潜变量"] --> B["扩散主干 U-Net 去噪前向<br/>提取名词 token 交叉注意力图 A"]
    B --> C["1. 像素证据损失:抗分割偏置<br/>MLP 映射证据 + 狄利克雷主观逻辑建模"]
    B --> D["2. Token 冲突损失:消解语义重叠<br/>DST 证据组合量化重叠冲突因子"]
    C --> E["联合优化目标:L_LDM + L_PixEvi + L_TokCon"]
    D --> E
    E --> F["标准去噪生成<br/>推理期 0 额外延时 / 无需掩码"]

关键设计

1. 像素证据损失:基于主观逻辑的像素级不确定性度量 针对 SAM 自动提取分割掩码中不可避免的边缘毛刺与误标注缺陷,硬性交叉熵会导致扩散模型过拟合错误区域。本文没有直接将交叉注意力图视作确定性二值分类预测,而是借助证据深度学习(EDL)将其重构为证据空间。对名词 token 的交叉注意力图 \(A\),通过轻量 MLP 证据网络 \(f_\phi(\cdot)\) 及 Softplus 激活函数映射为非负证据向量 \(e_{i,j}\),进而参数化多项式分布的共轭先验——狄利克雷分布 \(\mathcal{D}(p \mid \alpha)\),其中参数 \(\alpha_{i,j}^c = e_{i,j}^c + 1\)。根据主观逻辑理论,狄利克雷强度 \(S = \sum_{c=1}^C (e_{i,j}^c + 1)\) 直接定义了信念质量 \(b_{i,j}^c = \frac{e_{i,j}^c}{S}\) 与认知不确定性 \(u_{i,j} = \frac{C}{S}\)

为了引导模型聚焦目标同时对可疑标签保持谨慎,损失函数计算狄利克雷分布下的期望交叉熵,并配合 KL 散度约束抑制非目标类的证据过度积累:

\[\mathcal{L}_{\text{ice}} = \sum_{c=1}^C y^c \left( \psi(S) - \psi(\alpha^c) \right)\]

其中 \(\psi(\cdot)\) 为 digamma 函数,\(y^c\) 为掩码真实标签。当面对分割偏置区域时,模型自适应输出平缓松散的分布(高不确定性),\(\mathcal{L}_{\text{ice}}\) 不会对其施加严苛惩罚,从而使模型免受伪标签噪声的破坏。最终的像素证据损失 \(\mathcal{L}_{\text{PixEvi}}\) 综合了标准交叉熵、期望交叉熵与 KL 散度正则。

2. Token 冲突损失:基于 Dempster-Shafer 理论的重叠冲突消除 针对“猫坐在椅子上”等多实体交互中各名词注意力图独立优化导致的语义重叠撕裂,本文引入 Dempster-Shafer 证据理论(DST)对实体间的概念冲突进行显式量化与解耦。首先利用可学习缩放因子 \(\gamma^n \in (0, 1)\) 与掩码 \(M^n\) 将名词交叉注意力图转化为基本信念分配 \(b^n = \gamma^n A^n \cdot M^n\)。对于任意两个名词 \((v, w)\),在空间重叠区域 \(M^v \cap M^w\) 内定义两者的冲突系数:

\[K_{i,j}^{v,w} = b_{i,j}^v \cdot b_{i,j}^w \quad \left(\text{当 } (i, j) \in M^v \cap M^w\right)\]

在此基础上,设计实体间冲突损失 \(\mathcal{L}_{\text{inter}}\) 惩罚重叠区域内的相互抵触,并配合实体内一致性损失 \(\mathcal{L}_{\text{intra}}\) 促使实体自身注意力紧凑汇聚:

\[\mathcal{L}_{\text{inter}} = \sum_{(i,j) \in M^v \cap M^w} \frac{K_{i,j}^{v,w}}{1 - K_{i,j}^{v,w}} \cdot \sigma(K_{i,j}^{v,w} - \tau), \quad \mathcal{L}_{\text{intra}} = \sum_n (1 - b^n)^2\]

式中 \(\sigma\) 为 Sigmoid 函数,\(\tau\) 为冲突容忍阈值。通过 \(\frac{K}{1-K}\) 这一非线性惩罚项,当语义重叠处的二元竞争急剧升高时损失呈爆炸式增长,倒逼优化算法主动将不同实体的注意力峰值分离或协调分配,从根源上消除了互相挤占导致的画质退化。

损失函数 / 训练策略

微调阶段的总优化目标为标准潜在扩散损失与两项证据损失的联合:

\[\mathcal{L}_{\text{ELDiff}} = \mathcal{L}_{\text{LDM}} + \mathcal{L}_{\text{PixEvi}} + \mathcal{L}_{\text{TokCon}}\]

其中 \(\mathcal{L}_{\text{PixEvi}}\) 中的权重超参数设置为 \(\lambda_1 = 5 \times 10^{-5}\)\(\lambda_2 = 5 \times 10^{-7}\)\(\lambda_3 = 5 \times 10^{-7} \cdot \min\{1, n_{\text{epoch}}/100\}\)(采用退火式增益);\(\mathcal{L}_{\text{TokCon}}\) 中实体内与实体间冲突权重均设为 \(\eta_1 = \eta_2 = 1 \times 10^{-4}\)。模型基于单张 NVIDIA RTX 3090 GPU 进行微调,采用 AdamW 优化器,学习率设为 \(5 \times 10^{-6}\),总步数 24,000 步,微调耗时约 22 小时,且二值掩码只需在离线通过 SAM 生成一次。

实验关键数据

主实验

在基于 Stable Diffusion v1.4 的多物体组合、图像保真度与推理延迟测试中,ELDiff 与代表性 SOTA 方法的全面对比如下(摘自原文 Table 1,C 代表 COCO 验证集,F 代表 Flickr30K 验证集):

模型 (SD v1.4) OA↑ MG3↑ MG4↑ MG5↑ FID(C)↓ FID(F)↓ CLIP(C)↑ Latency↓
SD v1.4 基线 0.2986 0.5074 0.1148 0.0088 22.06 57.24 0.3022 7.54s
Attend-and-Excite 0.4513 0.6510 0.2801 0.0601 21.57 57.05 0.3018 25.43s
CoMat 0.4732 0.7044 0.2566 0.0211 22.43 58.49 0.3122 7.54s
IterComp 0.4891 0.6742 0.2487 0.0167 21.68 57.66 0.3047 7.54s
TokenCompose 0.5215 0.7616 0.2881 0.0328 21.12 56.93 0.3112 7.56s
ELDiff (本文) 0.5563 0.8041 0.3305 0.0931 19.25 55.13 0.3276 7.54s

在跨骨干通用性方面,将 ELDiff 微调机制应用于 SD v2.1 与前沿的 SD v3.5 Medium(摘自原文 Table 3):

骨干与微调配置 OA↑ MG3↑ MG4↑ MG5↑ FID(C)↓ CLIP(C)↑
SD v2.1 冻结基线 0.4728 0.7014 0.2557 0.0327 21.79 0.3045
SD v2.1 + TokenCompose 0.6010 0.8048 0.3669 0.0571 20.77 0.3209
SD v2.1 + ELDiff (本文) 0.7116 0.8870 0.5401 0.1392 20.09 0.3241
SD v3.5 冻结基线 0.8084 0.9996 0.9696 0.7328 18.21 0.3185
SD v3.5 + TokenCompose 0.8233 0.9997 0.9839 0.7569 18.05 0.3198
SD v3.5 + ELDiff (本文) 0.8644 0.9997 0.9964 0.8171 17.66 0.3247

消融实验

为验证各核心损失模块对整体框架的贡献,作者在 SD v1.4 上进行了严谨的消融实验(摘自原文 Table 5):

配置与优化目标 OA↑ MG3↑ MG4↑ MG5↑ FID(C)↓ CLIP(C)↑
原始 SD v1.4 0.2986 0.5074 0.1148 0.0088 22.06 0.3022
+ \(\mathcal{L}_{\text{LDM}}\) (仅标准微调) 0.3821 0.6372 0.1956 0.1897 24.57 0.3028
+ \(\mathcal{L}_{\text{LDM}} + \mathcal{L}_{\text{PixEvi}}\) 0.5466 0.7648 0.2934 0.3361 21.17 0.3178
+ \(\mathcal{L}_{\text{LDM}} + \mathcal{L}_{\text{PixEvi}} + \mathcal{L}_{\text{TokCon}}\) (完整模型) 0.5563 0.7660 0.2962 0.3530 20.84 0.3204

关键发现

  • 像素证据损失是组合能力提升的基石:消融表明,引入 \(\mathcal{L}_{\text{PixEvi}}\) 使物体准确率(OA)从基线的 0.3821 跃升至 0.5466,表明不确定性加权使模型能够在保留有效注意力先验的同时容忍 SAM 掩码的噪声边界,避免因伪标签错误而破坏生成结构。
  • Token 冲突损失彻底激活多实体协同:在加入 \(\mathcal{L}_{\text{TokCon}}\) 后,高阶物体组合指标(如 MG5)得到进一步提升,FID 从 21.17 进一步降至 20.84。这证实 DST 理论中的冲突因子有效解决了重叠语义的竞争抑制,消除了实体粘连。
  • 零推理成本的显著优势:不同于 Attend-and-Excite 等推断期优化方案(单图耗时高达 25.43s),ELDiff 将所有约束内化于离线训练权重中,生成单图仅需 7.54s,推理效率与原始 SD 保持一致。

亮点与洞察

  • 将证据深度学习(EDL)跨界引入跨模态注意力对齐:传统 EDL 多用于鲁棒分类或分割,ELDiff 巧妙地将跨注意力图映射为狄利克雷分布,利用其认知不确定性平抑弱监督伪标签噪声,设计非常优雅。
  • 利用 Dempster-Shafer 证据理论化解注意力空间冲突:摒弃生硬的排他正交假设,通过引入 DST 冲突系数 \(\frac{K}{1-K}\) 构建重叠惩罚项,自适应协调了交互物体间的注意力分配。
  • 即插即用且跨架构泛化能力极强:ELDiff 可无缝嵌入 SD v1.4、SD v2.1、SDXL、SD v3.5 以及强大的 Qwen-Image,且在 GenEval 2 与 T2I-CompBench++ 上全面胜过竞争对手。

局限与展望

  • 属性绑定的针对性约束仍有不足:作者在正文中明确指出,尽管多物体组合与计数显著提高,但 ELDiff 在细粒度属性绑定(如复杂的形状与特定纹理归属)上仍有提升空间,缺乏显式的属性级约束。
  • 对初始检测/分割极值误差的鲁棒性上限:虽然不确定性建模能弱化噪声,但若 Grounded-SAM 发生完全漏检或严重概念反转,模型将无法获得有效的初始证据输入。
  • 未来方向:可进一步将证据理论扩展至文本词元属性(颜色、材质)与视觉语义的联合建模,实现更高精度的属性解耦生成。

相关工作与启发

  • vs TokenCompose: TokenCompose 首次采用 Grounded-SAM 对交叉注意力施加逐 token 硬性分割监督;ELDiff 则指出其分割偏置与重叠冲突缺陷,引入 EDL 不确定性与 DST 冲突损失,在不增加推理耗时的前提下全面超越前者。
  • vs Attend-and-Excite / SynGen: 后两者主要依赖推理期的测试时反向传播引导注意力,导致生成延迟成倍增加(如 25 秒/图);ELDiff 采用纯训练期监督,推理期 0 额外开销即可获得更优的生成质量。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将证据深度学习与 DST 证据冲突理论系统性应用于扩散模型的多物体组合生成。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 SD v1.4/v2.1/v3.5/SDXL/Qwen-Image 五大骨干,涵盖 VISOR、T2I-CompBench++、GenEval 2 及用户调研。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰完备,从动机到主观逻辑与证据融合的过渡自然连贯。
  • 价值: ⭐⭐⭐⭐⭐ 为解决弱监督细粒度跨模态对齐中的标签噪声与多概念竞争提供了普适通用的方法论。