跳转至

FairSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

会议: ECCV 2026
论文: CVF Open Access
代码: https://github.com/Atmyre/EquiSteer
领域: 图像生成
关键词: 文本到图像生成, 扩散模型, 公平性去偏, 交叉注意力转向, 免训练推理干预

一句话总结

提出无需微调模型的推理期单样本去偏框架 EquiSteer(文中亦称 FairSteer),通过早步交叉注意力点积门控自适应识别属性中性提示词,结合属性子空间正交化消除预设偏见与自适应强度定向注入,在 SD-1.5、SD-2.1、SDXL 与 SANA 上大幅削减人口统计偏见达 87% 且无损图像生成质量。

研究背景与动机

现代文本到图像(T2I)扩散模型在创意内容生成中已成为核心生产力工具,但由于训练语料库中不可避免地浸染了现实社会的统计偏倚,模型在面对职业与日常场景提示词时,往往会系统性地复现并放大人口统计学偏见。例如,输入中性职业提示词“护士的照片”(a photo of a nurse)时,主流模型几乎无一例外生成女性形象;输入“CEO的照片”(a photo of a CEO)时,则极度偏向男性。这类不平衡并非偶然抖动,而是深嵌在先验分布中的固有偏差,当模型落地于大众应用时,会加剧刻板印象并引发严峻的算法公平性伦理隐患。

为了缓解生成偏差,既有去偏方案在实用性与灵活性上遇到了明显的瓶颈。基于参数微调的方法依赖额外标注的平衡数据并需要重新训练扩散权重,既耗费高昂算力,又无法无缝迁移至闭源或不同架构的模型;基于分类器引导的批级分布平衡方法需要耦合整批样本并依赖外置分类器,在单图生成、细粒度或多属性复合调控时极难落地;基于文本嵌入投影的方法虽然轻量,却对提示词的具体句式表达极度敏感,且在扩散生成过程中缺乏对特定语义区域的空间调控能力。更深层的矛盾在于:合理的去偏干预应当只修正那些缺乏特定人口属性的中性提示词(如“医生”),而对于用户明确指定了人口属性的提示词(如“男医生”),模型必须严格忠实于用户意图,禁止过度干预。

本文的切入视角深入到了扩散模型内部的图文桥梁——交叉注意力(Cross-Attention, CA)层。交叉注意力层决定了文本 token 与图像空间特征的对应绑定,且已被证明编码了丰富的人口属性偏倚。核心 idea:无需更新模型权重,利用早步交叉注意力与离线对比预计算属性转向向量的最大点积响应构建提示词感知门控,对中性提示词先正交投影消除残留属性偏差,再自适应校准并注入目标属性,实现单样本级的选择性、无混叠公平生成。

方法详解

整体框架

EquiSteer 的核心目标是在推理阶段无需更新扩散网络权重,针对包含 \(n\) 个离散属性 \(\{a_i\}_{i=1}^n\) 的概念 \(X\)(例如性别概念包含男性和女性两个属性),将中性提示词生成的属性分布引导至均匀目标分布 \(p(a_i) = 1/n\),同时确保包含特定属性的显式提示词不被扰动。

整体管线分为离线准备与在线推理两大部分:在离线阶段,针对每个属性 \(a_i\),利用对比提示词对在所有交叉注意力层 \(l \in [1, L]\) 和去噪时间步 \(t \in [1, T]\) 上预先提取属性转向向量 \(s_{lt}^{a_i}\),并计算门控判别阈值以及属性特定提示词诱导的平均响应强度;在在线推理阶段,对于任意输入提示词,模型在最初去噪步 \(t=0\) 的指定门控层 \(l_{\text{gate}}\) 处评估最大点积响应,若检测为属性显式提示词则完全跳过干预;若判定为中性提示词,则在去噪采样过程中均匀抽取目标属性,逐层对交叉注意力输出进行子空间正交化清除固有偏差,随后按照自适应强度注入目标属性向量并保持 \(L_2\) 范数一致性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入提示词 Prompt + 初始隐变量"] --> B["门控检测:属性显式提示词识别<br/>t=0, l_gate 评估最大点积响应 dp"]
    B -->|显式指定属性: dp > thr| C["原始生成流程<br/>跳过干预,忠实用户指定属性"]
    B -->|属性中性提示词: dp ≤ thr| D["目标属性均匀采样<br/>a ~ Uniform({a_i})"]
    D --> E["子空间正交化:清除预设偏见<br/>投影移除所有属性方向 span({s})"]
    E --> F["自适应强度属性注入<br/>注入目标属性向量 s_a 并保持范数"]
    F --> G["输出去偏图像<br/>实现边际人口分布公平与高画质"]
    C --> G

关键设计

1. 门控检测:属性显式提示词识别 直接对所有提示词无差别施加属性转向向量会导致严重的语义违背,破坏模型对显式属性指令的执行保真度。作者发现扩散模型早期的交叉注意力激活已天然编码了提示词中是否显式包含特定属性。具体而言,对于第 \(l\) 层交叉注意力在时间步 \(t\) 的输出 \(ca_{lt}^{\text{out}}\)(形状为 batch_size × seq_len × emb_dim),对于每个图像 token 位置 \(k\),其与目标属性离线转向向量 \(s_{lt}^{X}\) 的点积 \(\langle ca_{ltk}^{\text{out}}, s_{lt}^{X} \rangle\) 表征了该空间位置对属性的表达强度。为了捕捉局部最显著的语义证据,定义层级最大点积统计量: $\(dp_{lt} = \max_{0 \le k \le K_l} \langle ca_{ltk}^{\text{out}}, s_{lt}^{X} \rangle\)$ 实证观察表明,在最初时间步 \(t=0\) 的特定中间注意力层 \(l_{\text{gate}}\)(例如 SD-1.5 的第 4 层、SDXL 的第 17 层、SANA 的第 5 层),显式属性提示词产生的 \(dp\) 显著高于中性提示词。基于此,阈值设定为两类样本经验均值的中点: $\(thr^{a} = \frac{dp_{\text{specific}}^{a} + dp_{\text{neutral}}^{a}}{2}\)$ 一旦在 \((l_{\text{gate}}, t=0)\) 检测到存在任意属性 \(a\) 使得 \(dp_{l_{\text{gate}}0}^{a} > thr^{a}\),模型即判定该提示词已自带属性约束,立即放弃干预,退回原始采样。这一判定在整个推理周期内仅触发一次,耗费计算量可忽略不计。

2. 子空间正交化:清除预设偏见 基础转向机制简单地将目标属性向量加到当前的注意力输出上,但中性职业提示词在模型深层表征中已经携带了由于训练数据分布倾斜而产生的微弱或中等强度的既有属性偏见信号。此时若直接叠加目标属性向量,极易在特征空间产生相互冲突的叠加分量,导致生成出具有多重矛盾生理特征或模糊性别特征的异常畸变图像。 为解决混叠问题,EquiSteer 在向中性提示词注入目标属性之前,显式将注意力输出向该概念的所有可能属性方向所张成的子空间进行正交投影消除。对于属性集 \(\{a_i\}_{i=1}^n\) 对应的转向向量集 \(\{s_{lt}^{a_i}\}_{i=1}^n\),使用施密特正交化方法构建一组标准正交基 \(\{u_{lt}^j\}_{j=1}^m\),拼成投影矩阵 \(U_{lt} \in \mathbb{R}^{d \times m}\)。正交化去偏操作定义为投影残差: $\(ca_{lt}^{\text{out\_tmp}} = (I - U_{lt}U_{lt}^\top) ca_{lt}^{\text{out}}\)$ 由于矩阵 \((I - U_{lt}U_{lt}^\top)\) 可在离线完全计算并固化,推理时仅为一次单矩阵乘法,瞬间抹平先验偏倚,为干净注入指定属性奠定正交基础。

3. 自适应强度属性注入:精准标定目标表达 消除固有属性偏差后,必须以合适的幅度注入目标属性 \(a\)。固定的常数转向系数 \(\alpha\) 缺乏弹性,太小则难以在扩散去噪的多步动力学中显现出显著属性特征,太大则会压制原本的职业、姿态与背景细节。 为了使注入的属性表现力精准等价于真实显式提示词所诱发的效果,EquiSteer 采集校准集上显式属性提示词的最大点积期望: $\(\alpha = dp_{\text{mean}}^{a}(l, t) = \mathbb{E}_{\text{attr-spec prompts}}[dp_{lt}^{a}]\)$ 随后将目标属性转向向量按自适应强度注入正交化后的特征中: $\(ca_{lt}^{\text{out\_new}} = ca_{lt}^{\text{out\_tmp}} + \alpha s_{lt}^{a}\)$ 最后,为了保证注意力激活张量的全局数值稳定性与数值分布形态不发生剧烈偏移,利用原始特征的模长对更新后的特征进行等模重归一化: $\(ca_{lt}^{\text{out\_new\_renorm}} = \|ca_{lt}^{\text{out}}\|_2 \cdot \frac{ca_{lt}^{\text{out\_new}}}{\|ca_{lt}^{\text{out\_new}}\|_2}\)$ 由此使得生成图像在视觉上呈现鲜明且自然的目标属性,同时完全保留提示词规定的主体场景与高频细节。

损失函数 / 训练策略

EquiSteer 属于完全免训练(training-free)的后处理引导方案,在整个过程中扩散模型的所有权重保持冻结,不需要任何梯度反向传播或微调损失函数。 离线预计算的超参数与转向向量构建策略如下: - 转向向量计算:遵循 CASteer 的差分构建范式,构建包含与不包含特定属性的成对对比提示词(如“A photo of a male person”与通用中性提示词),在扩散模型前向过程中抽取各层各时间步的交叉注意力输出均值之差,形成 \(s_{lt}^{a}\) 并离线保存。 - 门控层 \(l_{\text{gate}}\) 选定:在独立验证集上扫描各层 \(t=0\) 时的 \(dp\) 分离度(AUROC),选取首次呈现显著区分度的最早中间层。实操中 SD-1.5 与 SD-2.1 设定 \(l_{\text{gate}}=4\),SANA 设定 \(l_{\text{gate}}=5\),SDXL 设定 \(l_{\text{gate}}=17\)

实验关键数据

主实验

评估遵循 TEI 评测协议,选取 8 个具有极高偏倚倾向的代表性职业提示词(CEO、医生、飞行员、技术员、服装设计师、图书管理员、教师、护士)。在属性中性提示词下,理想的属性比例应为 \(1/n\)(性别中为 0.5)。评测指标采用平均绝对奇偶差距 \(\text{Avg. } \Delta = |p - 1/n|\)(越低越好)。

表 1 展示了基于 SD-1.5 的性别概念去偏结果(在 8 大职业、每类生成 1,000 张图像的中性提示词评估中少数群体的生成占比):

少数属性 职业 Vanilla SD FairDiff UCE FTDiff SelfDisc TEI EquiSteer (本文)
女性 (Female) CEO 0.030 0.452 0.027 0.190 0.445 0.389 0.483
女性 (Female) 医生 (Doctor) 0.081 0.502 0.049 0.198 0.502 0.334 0.500
女性 (Female) 飞行员 (Pilot) 0.150 0.739 0.244 0.260 0.568 0.408 0.416
女性 (Female) 技术员 (Technician) 0.007 0.553 0.005 0.168 0.347 0.164 0.375
男性 (Male) 服装设计师 (Fashion designer) 0.078 0.333 0.018 0.167 0.067 0.451 0.504
男性 (Male) 图书管理员 (Librarian) 0.194 0.300 0.297 0.538 0.174 0.421 0.473
男性 (Male) 教师 (Teacher) 0.222 0.205 0.155 0.231 0.081 0.492 0.421
男性 (Male) 护士 (Nurse) 0.007 0.162 0.003 0.208 0.004 0.039 0.432
平均指标 Avg. \(\Delta\) (↓) 0.403 0.167 0.400 0.264 0.244 0.167 0.051

跨模型泛化与图像质量评测方面,表 2 列出了 SDXL 与 SANA 架构上的平均奇偶偏差对比,表 3 列出了在 MS-COCO 30,000 张图像验证集上测得的图文对齐度(CLIP Score)与图像生成保真度(CMMD):

骨干模型 评估配置 / 方法 性别去偏 Avg. \(\Delta\) (↓) CLIP Score (↑) CMMD (↓)
SD 1.5 Vanilla SD 0.403 26.42 0.532
SD 1.5 TEI 基线 0.167 26.56 0.509
SD 1.5 EquiSteer (本文) 0.051 26.63 0.519
SDXL Vanilla SDXL 0.381 26.51 0.794
SDXL TEI 基线 0.242 26.58 0.757
SDXL EquiSteer (本文) 0.075 26.75 0.796
SANA Vanilla SANA 0.473 26.93 0.890
SANA EquiSteer (本文) 0.097 26.77 0.905

多属性扩展上,在包含 5 类的种族(Race)属性测试中,SDXL 上 \(\Delta\) 从 0.172 降至 0.042,SANA 上从 0.178 降至 0.039;在包含 3 类的年龄(Age)属性测试中,SANA 上 \(\Delta\) 从 0.387 降至 0.060(相对减少 85%);在性别+种族+年龄+体型 4 个概念联合去偏(Joint-4)中,一次前向即可同时大幅压低 4 个属性维度的偏差。

消融实验

在 SD-1.5 上对性别属性进行组件消融,考察中性提示词去偏能力(\(\Delta_{\text{neutral}}\),越低越好)与显式指定提示词的属性保真度(Female-spec \(\Delta\) 与 Male-spec \(\Delta\),目标比率为 1.0,越接近 0.5 意味着准确率达到 100%):

模块配置 中性提示词 Avg. \(\Delta\) (↓) 女性显式提示词 \(\Delta\) (↑) 男性显式提示词 \(\Delta\) (↑) 机制作用说明
仅自适应转向注入 (add) 0.165 0.481 0.379 仅做属性注入,残留偏见未清除且误伤显式提示词
注入 + 子空间消除 (add & erase) 0.095 0.394 0.230 正交化清除了固有偏差,但严重破坏显式提示词识别(召回崩溃)
完整模型 (+ 提示词门控, add & erase & gate) 0.051 0.492 0.495 门控精准保护显式提示词,兼顾近乎完美的公平分配与语义保真

关键发现

  • 正交消除与门控机制缺一不可:消融实验直接证明,单纯做属性注入(add)去偏不彻底(\(\Delta\) 仍有 0.165);若只加入正交擦除(erase),虽然能清除偏倚,却会导致显式男性提示词被盲目擦除重建,男性保真度断崖式下跌至 0.230;唯有辅以早步门控(gate),才能彻底解耦中性与显式提示词的处理流程。
  • 极大改善极限偏倚职业:在“护士”(极端偏女性)和“技术员”(极端偏男性)这类 baseline 普遍失效的顽疾案例中,EquiSteer 将护士的男性比例从原始的 0.007 提升至 0.432,技术员的女性比例从 0.007 提升至 0.375,展现出对强先验偏倚的压制能力。
  • 画质与图文对齐完全无损:在 30,000 张 COCO 数据集的严苛测试下,SD-1.5 的 CLIP Score 从 26.42 提升至 26.63,CMMD 从 0.532 优化至 0.519;SDXL 上 CLIP Score 从 26.51 提升至 26.75,完全破除了“公平性必然牺牲生成质量”的固有折中难题。

亮点与洞察

  • 激活层免训练干预的优雅性:利用早期交叉注意力层的特征点积作为现成的显式属性探测器(单次判定、开销微秒级),无需挂载任何笨重的外部多模态或分类大模型,既高效又内生自洽。
  • 从单一概念抑制到生成分布引导的范式跨越:将 CASteer 的负向概念擦除机制升华为“投影置零 + 正交校准重注入”的双向生成调控范式,为免训练的扩散表征编辑开辟了新的技术路径。
  • 天然支持多属性复合去偏:正交子空间投影与向量注入能够以逐概念串行的方式无缝拓展至性别、种族、年龄、体型等多维度属性,单次推理即可实现高维人口属性的全面均衡。

局限与展望

  • 复杂复合构图中的单图门控颗粒度局限:当前的门控机制与转向向量是在整图特征级别进行聚合判断与注入的,当遇到“一个老年男医生和一个年轻女护士并排站立”这类多主体多属性构图提示词时,全图统一的门控和正交注入难以实现实例级的空间解耦控制。
  • 依赖预计算对比提示词的代表性:离线提取的转向向量高度依赖于构建对比提示词集的多样性,如果离线提示词未能完全覆盖某些罕见职业或多文化语境,转向方向可能带有残存偏差。
  • 未来方向:可进一步将空间注意力分割图(Cross-Attention Map)与物体检测定位相结合,实现局部实例级的自适应公平引导;探索将该机制直接扩展至视频扩散模型与自回归扩散 Transformer(如 DiT)架构。

相关工作与启发

  • vs FTDiff / FairDiff (微调类方法):FTDiff 等方案需要修改模型参数并在平衡数据集上反向传播,对高分辨率大模型适配成本极高;EquiSteer 纯推理期即插即用,零额外参数,支持跨架构通用。
  • vs Balancing Act (分布引导类方法):Balancing Act 强依赖整批样本(batch-level)协同与外部属性预测网络;EquiSteer 为严格的单样本级(per-sample)自包含方案,不受 batch size 限制。
  • vs TEI / FairImagen (文本嵌入微调/投影):TEI 与 FairImagen 仅在文本编码阶段做静态投影,缺乏图像生成过程中的空间注意力调控,遇到句式变体鲁棒性较差;EquiSteer 在交叉注意力深处直接调控图文交互动态,去偏幅度显著更强(\(\Delta\) 达 0.051 vs 0.167)。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (巧妙将交叉注意力概念擦除升级为子空间正交化与自适应注入,并构筑了极简高效的早步点积门控机制)
  • 实验充分度: ⭐⭐⭐⭐⭐ (全面覆盖 SD-1.5、SD-2.1、SDXL、SANA 四大基座,并在单概念、多概念联合及多提示词变体下完成严密定量对比与消融)
  • 写作质量: ⭐⭐⭐⭐⭐ (逻辑层层递进,动机清晰直观,公式严谨且紧扣工程实现细节)
  • 价值: ⭐⭐⭐⭐⭐ (为文生图模型的安全、负责任部署提供了开箱即用、零额外训练算力开销的标杆级解决方案)