跳转至

The Path to Reconciling Quality and Safety Alignment in Text-to-Image Generation

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 图像生成
关键词: 文本到图像生成、安全对齐、偏好优化、扩散模型、协同对齐

一句话总结

针对文生图模型安全对齐中过度惩罚导致图像质量与指令遵循能力下降的零和困境,本文提出涵盖双维度标注数据集 LibraAlign-100K、协同偏好优化算法 T2I-SPO 以及兼顾安全与美学的评估指标 UAScore 的统一框架,在消除多类别有害概念的同时保持了卓越的生成质量。

研究背景与动机

随着扩散模型在文本到图像(T2I)生成领域的快速突破,模型已能根据自然语言提示生成高度逼真的图像,但其开放式生成能力也伴随着被滥用生成露骨、暴力或仇恨内容等严重安全风险。现有安全治理手段主要分为三大路径:事后安全过滤规则脆弱且易被越狱攻击攻破;基于参数编辑的概念擦除技术容易发生灾难性概念混淆(例如抹除“裸体”概念时连带损伤了皮肤质感、肌肉线条甚至人体结构的正常表达);而基于强化学习或直接偏好优化的安全微调方法,则普遍采用仅以安全性为单一奖励的狭隘优化目标。

这种单一目标优化引发了学术界长久以来的“零和博弈”困境:安全约束往往以牺牲模型的美学观感与指令遵循忠实度为代价。论文将其生动地概括为“沉睡的维纳斯困境”(Sleeping Venus Dilemma)——当模型接收到描绘古典艺术名作或含丰富艺术构图的提示词时,过于保守的安全模型会将其粗暴拦截或退化为破坏画风、丧失艺术质感且违背原始指令的平庸图像。造成这一权衡困境的根源并非不可调和,而在于现存体系在数据、优化算法与评估协议三方面的系统性缺陷:其一,现有数据集依赖生硬的提示词文本改写,导致正负样本间语义断层且缺乏质量标注;其二,优化目标将安全性与生成质量完全割裂;其三,评测基准长期依赖二元判别的离散分类器,无法刻画连续的安全风险与画质损耗。

为了破除这种人为对立,本文的核心切入点是将文生图安全对齐从“单目标惩戒”转变为“质量与安全双目标协同偏好建模”。核心 idea:构建兼具连续安全成本与美学质量双重监督的基准数据体系,在此基础上推导融合图像质量奖励与安全惩罚的复合偏好优化算法(T2I-SPO),并配合动态聚焦难样本的主动增广,从根本上兼顾有害概念消除与高质量图像表达。

方法详解

整体框架

本文构建的协同安全对齐框架包含三大支柱:数据层(LibraAlign-100K 双维度标注数据集)、算法层(结合复合奖励与动态聚焦机制的 T2I-SPO)以及评测层(量化平衡态的 UAScore)。系统首先基于涵盖 7 大 NSFW 类别、634 个概念的粗粒度排序数据训练连续安全成本模型(SCM);随后利用安全感知修复技术生成构图高度一致的高保真图像偏好对,并标注质量得分与安全成本;最后通过复合偏好损失对扩散模型去噪网络进行直接优化,并在训练过程中动态抓取滞后难样本进行定向梯度扰动增广。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入提示词与扩散潜在状态"] --> B["安全感知局部修复与双维标注<br/>保留构图风格 + 标注质量与安全成本"]
    B --> C["连续安全成本建模<br/>CLIP骨干 + 对比排序与成本锚定"]
    C --> D["复合偏好优化 T2I-SPO<br/>融合质量奖励与安全惩罚项"]
    D --> E["动态聚焦机制 DFM<br/>损失下降率监测与梯度最大化增广"]
    E --> F["对齐扩散模型输出安全且高保真图像"]

关键设计

1. 安全感知局部修复与双维标注:打破安全与质量的虚假耦合 以往构建偏好对时多采用粗暴的文本编辑(如将“nude woman”替换为“woman”),这导致生成的安全图像与原始有害图像在背景、视角、构图和光影上出现剧烈的语义漂移,迫使模型学到“越安全画面越简陋”的错误偏见。本文提出安全感知局部修复管线,首先由 SDXL 根据有害提示词生成原始图像,再由 GPT-4 生成语义紧密对齐的安全改写提示,以此作为引导对原图进行 Image-to-Image 修复,仅替换敏感局部,完整保留背景景深与艺术质感,构建出 8,265 对高保真负正样本;此外,引入来自 Pick-a-Pic 的 2,495 对纯良性图像偏好对以锚定通用审美分布,最终汇聚为 10,760 对 LibraAlign-HF。所有图像均由预训练奖励模型打上美学质量分,并由安全模型打上连续安全成本,提供去偏置的双向监督。

2. 连续安全成本建模:细粒度量化有害严重度与安全基线锚定 传统离散分类器仅提供是非二元标签,无法区分轻微暗示与严重违法违规,更无法为梯度优化提供平滑的方向指引。作者利用基于 4 级严重度评判准则由 GPT-4o 标注的 90K 粗粒度图像对训练安全成本模型 \(C(\cdot)\)。模型以 Open-CLIP ViT-H/14 为骨干网络,挂载轻量适配层,采用对比排序损失拉开有害程度差异并规范符号(有害样本 \(S=+1\) 赋予正成本,安全样本 \(S=-1\) 赋予负成本): $\(\mathcal{L}_{\text{CTRS}} = \mathbb{E}_{(I_w, I_l, S_w, S_l)} \left[ -\log\sigma(C(I_w) - C(I_l)) - \eta \cdot \big(\log\sigma(S_w \cdot C(I_w)) + \log\sigma(S_l \cdot C(I_l))\big) \right]\)$ 针对单纯排序损失会导致良性图像间产生过大方差、进而在对齐时误伤安全样本的问题,特别引入成本锚定损失(Cost Anchoring Loss): $\(\mathcal{L}_{\text{Anchor}} = \mathbb{E}_{(I_w, I_l), S_w=S_l=-1} \left[ (C(I_w) - \mu)^2 + (C(I_l) - \mu)^2 \right]\)$ 将所有良性样本的成本拉近至已验证基准样本的均值 \(\mu\),彻底避免对细微无害特征的过度惩戒。

3. 复合偏好优化 T2I-SPO:将质量奖励与安全约束纳入统一策略更新 为了防止强化学习优化坍缩至保守低质区间,T2I-SPO 定义了线性标定的复合奖励函数 \(R_\lambda(T, I) = R(T, I) - \lambda \cdot C(I)\),其中 \(R(T, I)\) 为来自 PickScore 的文本对齐与视觉质量奖励,\(C(I)\) 为安全成本,\(\lambda > 0\) 调节安全权重。在 Bradley-Terry 偏好模型设定下,每对样本依据复合奖励重新划分为胜者 \(I^+\) 与败者 \(I^-\)。结合 Diffusion-DPO 的解析推导,将策略对齐目标无缝转化为扩散去噪网络的隐式拟合损失: $\(\mathcal{L}_{\text{T2I-SPO}}(\epsilon_\theta, \mathcal{D}_\lambda) = -\mathbb{E}_{(T, I^+, I^-) \sim \mathcal{D}_\lambda} \left[ \log\sigma \left( K \cdot \left[ \|\epsilon_t - \epsilon_\theta(I_t^+, T)\|^2 - \|\epsilon_t - \epsilon_{\text{ref}}(I_t^+, T)\|^2 - \left( \|\epsilon_t - \epsilon_\theta(I_t^-, T)\|^2 - \|\epsilon_t - \epsilon_{\text{ref}}(I_t^-, T)\|^2 \right) \right] \right) \right]\)$ 使得去噪模型在反向传播中自发权衡高画质表征与安全性边界,摆脱传统单边优化的畸变效应。

4. 动态聚焦机制 DFM:基于梯度敏感度的难样本主动强化 不同概念对齐难度差异巨大,部分样本因梯度方向存在潜在冲突而产生损失下降迟滞。DFM 在训练阶段维护每个偏好样本最近 \(m\) 步的滑动损失队列,计算其局部平均下降速率 \(v_i^{(t)}\)。当其连续低于当前批次平均下降率的 \(\eta\) 倍时,该样本被判定为难样本。系统计算其当前原始梯度 \(g_k\),并在包含图像锐化、色彩抖动、隐空间噪声小尺度擦除和频带能量补偿的增广策略池 \(\mathcal{A}\) 中,选取使得梯度方向变动最大的变换 \(a^*\) 进行重注入训练: $\(a^* = \arg\max_{a \in \mathcal{A}} \|g_k - \nabla_\theta \mathcal{L}(\epsilon_\theta, T_k, a(I_k^+), a(I_k^-))\|\)$ 该设计显著强化了对边界模糊和高抗性概念的学习强度,同时不破坏非硬样本的平稳收敛。

实验关键数据

主实验

在涵盖 7 大 NSFW 类别的 I2P 完整数据集、I2P 露骨子集以及 NSFW-56K 露骨基准上,评估各方案的不当内容生成概率(IP)、安全成本(SC)、美学质量(PickScore, PS)以及综合平衡指标(UAScore, UAS)。

基准数据集 评估指标 SD-v1.5 基线 AlignGuard (SOTA) T2I-SPO (本文) 相对基线提升 / 改善
I2P-Sexual IP (↓, %) 31.90 10.53 4.40 -27.50% (降幅 86.2%)
SC (↓) -0.41 -5.08 -8.14 -7.73
PickScore (↑) 19.33 18.82 19.38 +0.05 (超原始模型)
UAScore (↑) 0.302 0.651 0.757 +0.455 (+150.7%)
NSFW-56K-Sexual IP (↓, %) 57.05 19.80 13.65 -43.40% (降幅 76.1%)
SC (↓) 0.50 -7.08 -7.47 -7.97
PickScore (↑) 19.77 18.86 19.14 +0.28 vs AlignGuard
UAScore (↑) 0.328 0.689 0.725 +0.397 (+121.0%)
Full I2P (7 类别) IP (↓, %) 35.49 13.18 17.07 -18.42% (细粒度 SC 表现最优)
SC (↓) -4.21 -6.14 -7.73 -3.52 (全场最优)
PickScore (↑) 19.56 18.94 19.61 +0.05 (全面超越基线)
UAScore (↑) 0.696 0.690 0.784 +0.088 (+12.6%)

在 NudeNet 细粒度敏感身体部位检出分析中,T2I-SPO 在 I2P-Sexual 上的总暴露部位数为 43(胸部 3、生殖器 0、臀部 1),相较于未对齐基线的 485 与 AlignGuard 的 137 呈现断层式下降,且生殖器检出彻底清零。

消融实验

消融实验重点验证了复合奖励平衡系数 \(\lambda\)、动态聚焦机制参数 \(\eta\) 以及增广组件丰富度对最终收敛损失与通用多模态能力的影响。

实验模块 / 超参配置 关键考查指标 评测表现与趋势 机制说明
\(\lambda = 0.01\) I2P IP / COCO CLIPScore IP: 26.3% / CLIPScore: 26.54 安全惩罚比重过轻,防御机制不充分
\(\lambda = 0.15\) (默认) I2P IP / COCO CLIPScore IP: 21.8% / CLIPScore: 26.46 达到安全防御与文本保真度最佳帕累托平衡点
\(\lambda = 0.50\) I2P IP / COCO CLIPScore IP: 20.7% / CLIPScore: 25.64 安全过度主导,退化为传统单目标 DPO,画质显著下挫
DFM: 无机制 (\(\eta = 0\)) 收敛 Loss@Step 20K 最终收敛损失停留在 ~0.375 难学习样本收敛停滞,阻碍模型达到最优极小点
DFM: \(\eta = 0.2\) (默认) 收敛 Loss@Step 20K 最终收敛损失显著降至 0.359 动态辨识滞后样本并重注入最大梯度扰动,收敛大幅加速
增广组件: 1 种 收敛损失 Loss 0.3737 单一变换无法充分覆盖多模态分布边界
增广组件: 4 种全部启用 收敛损失 Loss 0.3593 锐化、抖动、隐空间扰动与频带补偿协同,收敛最平稳且充分

关键发现

  • 打破安全衰减定律:在 Pick-a-Pic、HPD 与 DrawBench 三大纯安全提示词基准测试中,T2I-SPO 的 PickScore(20.4、20.7、21.0)与 ImageReward(0.282、0.233、0.032)不仅全线超越现有对齐方法,甚至优于未经对齐的原生 SD-v1.5(ImageReward 为 0.161、0.130、-0.014),证实双维偏好优化能有效吸纳高审美先验。
  • 对抗越狱鲁棒性显著增强:面对 SneakyPrompt 和 MMA 等先进对抗性越狱反推攻击,T2I-SPO 的不当内容生成率分别低至 5.5% 和 30.2%,远低于 ESD-u(9.0% / 33.8%)和 UCE(12.0% / 36.8%),证明其对隐式或对抗性变异概念具备出色的泛化防御力。

亮点与洞察

  • 安全感知局部修复的高保真解耦:采用预训练大模型指导的 Image-to-Image 修复构建对齐样本,保持非敏感上下文的绝对一致。这种将“语义擦除”约束在敏感情感局部的设计,避免了传统整图重绘带来的全局分布漂移。
  • 复合奖励下 DPO 的扩散闭式映射:将连续安全代价巧妙纳入 Bradley-Terry 比较体系并直接映射至扩散网络去噪差分项,省去了训练在线判别器带来的对抗训练不稳定性与计算冗余。
  • 动态聚焦与梯度敏感度最大化增广:不盲目对全量数据增加数据增强,而是实时监控样本级损失斜率,并依据梯度的正交变化动态选取增强算子,为生成模型处理长尾难样本提供了通用训练策略范例。

局限与展望

  • 作者承认的局限:全量训练阶段仍依赖大规模 GPU 集群进行扩散网络全参数更新,在计算资源敏感型场景中部署成本相对较高;同时对于多义词暗喻或深层文化语境引发的高阶有害概念,安全成本模型仍偶有判断偏差。
  • 实验与范式局限:复合奖励中的平衡权重 \(\lambda\) 当前为全局固定常数,尚未实现依据提示词自身的敏感等级进行自适应动态退火或弹性调度。
  • 改进方向:可进一步探索将 T2I-SPO 拓展至参数高效微调(如 LoRA、ControlNet 模块对齐),并将视频生成扩散模型(T2V)中的时空连续性安全与视觉平滑度纳入同一协同偏好框架。

相关工作与启发

  • vs AlignGuard / SafetyDPO: 后者是近期基于偏好优化的前沿代表,但其构建偏好对时正负样本语义跨度过大,且奖励函数只衡量安全性,导致生成图在艺术细节与指令遵循上严重退化;T2I-SPO 通过图像局部修复保持构图一致,并引入复合双维奖励,从底层消除了对艺术和质量的副作用。
  • vs ESD / UCE / RECE 等概念擦除技术: 概念擦除依赖显式修改交叉注意力权重闭式解,属于刚性截断,极易引起灾难性遗忘与语义缠绕(如抹除人体导致皮肤纹理无法正常绘制);T2I-SPO 借助数据分布引导扩散分布软对齐,对安全边界与表现力边界的处理更加平滑细腻。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性揭示并解决文生图安全对齐中的质量牺牲困境,提出双维标注、协同优化与综合评估的完整闭环。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 7 大 NSFW 类别、两类典型基准(SD-v1.5 与 SDXL)、多种对抗越狱攻击以及细粒度 NudeNet 解剖学分解,消融详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构层次分明,对“沉睡的维纳斯困境”等核心论点的剖析生动透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为解决多模态生成模型在商业化落地与学术前沿中的安全-美学双难困境确立了极具参考意义的新范式。