跳转至

LACON: Training Text-to-Image Model from Uncurated Data

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://zhiyangliang.github.io/LACON
领域: 图像生成
关键词: 文本到图像生成、未清洗数据、显式质量条件、扩散模型、属性可控生成

一句话总结

LACON 摒弃了先过滤丢弃低质数据的传统范式,将美学、水印、清晰度等 5 维数据质量信号重构为显式连续条件向量,利用高斯加权聚类中心嵌入和全数据训练,让模型显式习得高低质量边界并实现无伪影的高保真可控生成。

研究背景与动机

现代大规模文本到图像(T2I)生成模型的跨越式突破,在很大程度上依赖于百亿级网络抓取的多模态图文对。然而在业界主流实践中,原始网络数据常伴随模糊、低美学、水印、过曝或弱图文关联等缺陷,促使现有 SOTA 模型普遍采纳“先过滤后训练(filter-first)”的严格清洗范式。例如,Stable Diffusion 仅基于高美学子集 LAION-Aesthetics 训练,Qwen-Image 引入了多达 7 阶段的严苛级联过滤管线,而 Hunyuan-Image 亦通过三阶段清洗丢弃了超过 55% 的海量初始数据。

这种过滤至上的机制潜藏着两大根本性缺陷。首先是严重的统计低效与数据浪费:被直接剪除的数据占据初始规模的半数以上,但这些样本绝非纯粹的有害噪声,其内部蕴含着长尾罕见概念、多样的真实物理世界几何与广泛的常识实体分布,丢弃它们会造成严重的泛化知识断层。其次,更关键的矛盾在于模型内在质量认知的片面性:当模型仅暴露在人工筛选的高质量切片中时,它只建立了对于“优质”的片面先验,从未真正理解何为“劣质”,因而无法划定高低质量之间的显式决策分界线。在推理阶段,工程师不得不依赖负向提示词(negative prompts)和无分类器引导(CFG)进行启发式盲猜,强行将生成轨迹推离模型从未见过的失效区域。

本文的切入视角在于:与其将质量信号作为二元排他的“过滤器”,不如将其转化为可学习、可控制的“显式条件”。核心 idea:将美学评分、水印概率、清晰度、信息熵与亮度等多维质量信号转化为连续标量标签,通过高斯加权聚类中心(GCC)映射为平滑条件嵌入并与噪声潜变量上下文拼接,在 100% 原始未清洗数据上训练全质量谱系感知模型,并在推理阶段通过解耦多条件引导实现精细化质量与属性的主动调控。

方法详解

整体框架

LACON(Labeling-and-Conditioning)旨在直接利用全量未清洗数据训练文本到图像模型,从根本上弥合过滤带来的知识盲区。模型不再拟合条件分布 \(p(x|y)\),而是对联合条件概率 \(p(x|y, s)\) 进行建模,其中 \(x\) 为图像目标,\(y\) 为文本描述,\(s\) 为样本的多维连续质量属性向量。

整体流水线主要包括三个阶段:首先在离线阶段对全量 110M 原始图文数据进行多维质量属性自动标注,生成五维标量评分向量;随后在训练阶段,利用高斯加权聚类中心(Gaussian-weighted Cluster Centroids, GCC)将连续标量转化为与潜在特征同维度的软条件嵌入,并与加噪潜变量直接拼接送入 DiT 主干;最后在推理阶段,通过固定目标高质条件(LACON-S)或多条件解耦引导缩放(LACON-A),主动消除白边与水印等低质伪影并实现细粒度视觉质量调节。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始未清洗图文数据<br/>100% 样本保留(含长尾概念与低质样本)"] --> B["多维质量属性自动标注<br/>提取美学、水印、清晰度、信息熵、亮度"]
    B --> C["高斯加权聚类中心嵌入<br/>RBF 锚点软加权映射为连续条件向量"]
    C --> D["上下文拼接与全谱系条件训练<br/>潜变量与质量嵌入拼接 + Flow Matching 训练"]
    D --> E["多条件解耦引导推理<br/>LACON-S 固定高质量 / LACON-A 细粒度独立缩放"]
    E --> F["高保真可控生成图像<br/>消除低熵白边与水印,保留长尾世界知识"]

关键设计

1. 多维质量属性自动标注:将过滤信号转化为多维连续标签向量 为了兼顾高层语义美学与底层物理图像特征,LACON 选取了传统清洗管线中最常用于硬性阈值剪枝的 5 种核心质量信号,构建 5 维连续属性向量 \(s = [s_{\text{aes}}, s_{\text{wat}}, s_{\text{cla}}, s_{\text{ent}}, s_{\text{luma}}]\)。其中美学评分 \(s_{\text{aes}} \in [0, 10]\) 评估整体视觉艺术质量;水印概率 \(s_{\text{wat}} \in [0, 1]\) 量化画面存在人工水印或 Logo 的置信度;清晰度评分 \(s_{\text{cla}}\) 基于拉普拉斯方差(Laplacian variance)度量感知锐度,取值范围在 3000 处截断以平抑极端离群值;信息熵 \(s_{\text{ent}} \in [0, 8]\) 计算香农信息熵以捕捉纹理细节丰富度与信息密度;亮度评分 \(s_{\text{luma}} \in [0, 1]\) 则反映 HSV 空间下的平均视觉明度。通过离线自动标注,全量数据集中的每个样本均被赋予清晰的质量坐标,避免了离散剔除导致的信息丢失。

2. 高斯加权聚类中心嵌入(GCC):连续标量评分的平滑软编码 如何将连续标量评分稳定地转化为生成模型可消化的条件向量是方法成功的核心。直接线性插值表达容量有限(仅有两个端点),硬离散分桶(discrete binning)会在分桶边界产生不连贯阶跃,而傅里叶特征嵌入(Fourier-feature embedding)则对高频扰动和超参过于敏感。为此,LACON 提出了高斯加权聚类中心嵌入机制。对于第 \(k\) 个属性,在预期的取值区间内均匀设置 \(N\) 个固定非学习标量锚点 \(p^{(k)} = \{p_1^{(k)}, \dots, p_N^{(k)}\}\),并为每个锚点绑定一个可学习的中心嵌入向量 \(c_i^{(k)} \in \mathbb{R}^d\),其中 \(d\) 与噪声潜变量的通道维度对齐。针对给定的标量值 \(s_k\),通过高斯径向基函数(RBF)计算其与各锚点的亲和度分数: $\(u_i^{(k)} = \exp\left(-\frac{(s_k - p_i^{(k)})^2}{2\sigma_k^2}\right)\)$ 式中带宽 \(\sigma_k\) 精确设为相邻中心锚点间距的一半,从而为该属性提供自适应的平滑过渡范围。亲和度归一化后得到混合权重 \(w_i^{(k)} = u_i^{(k)} / \sum_{j=1}^N u_j^{(k)}\),最终的属性嵌入向量即为各中心向量的凸组合: $\(e_k = \sum_{i=1}^N w_i^{(k)} c_i^{(k)}\)$ 该设计既保持了与分桶一致的参数量,又借助重叠的高斯核平滑捕捉了评分空间的局部几何结构,使梯度反传与状态过渡极其平稳。

3. 上下文拼接与全谱系条件训练:全层感知质量边界 在模型骨干的条件注入方式上,若采用额外的交叉注意力层注入质量标签,不仅会引入多余计算负担,而且在网络深层容易被强文本语义稀释。LACON 采用了更加纯粹且全层可见的上下文拼接(Context Conditioning)策略:将 5 个属性的嵌入拼接为嵌入序列 \(e = [e_1, \dots, e_5]\),并在 token 序列维度直接与图像加噪潜变量 \(x_t\) 拼接,作为 DiT 的首层输入序列。文本提示词 \(y\) 则依然通过交叉注意力输入,保持语义控制的解耦。这种早期序列级融合使生成骨干从最浅层即可感知图像的质量基准,显式学习真实高低质量数据之间的分布流形分界线,既吸纳了低质样本中的实体分布,又不会在高质量生成模式下产生退化伪影。

4. 灵活推理引导策略:LACON-S 与 LACON-A 的定量质量调控 在推理采样阶段,显式条件属性向量赋予了模型双重可控性:既可定点采样高质量图像,亦可动态调节单项属性强度。本文设计了两种递进的推理策略: - LACON-S(标准引导):以极高计算效率为导向,将质量属性向量 \(s\) 恒定固定在设定的理想高质量取值(如最高美学、零水印、高清晰度、高信息熵、适中亮度),仅在文本条件 \(y\) 上施加标准无分类器引导(CFG),完全不需要额外的降噪网络前向评估; - LACON-A(激进多条件解耦引导):面向对属性控制有极端苛求的场景,在每步去噪步 \(t\) 对文本条件和每个质量属性分别解耦施加独立引导,并行计算 \(K+2\) 个速度场预测并加权合成: $\(v_t^a = v_{\text{base}} + \omega_c (v_{\text{text}} - v_{\text{base}}) + \sum_{k=1}^K \omega_k (v_{s_k} - v_{\text{text}})\)$ 其中 \(v_{\text{base}} = v_\theta(x_t, t, \emptyset, s_{\text{base}})\)\(v_{\text{text}} = v_\theta(x_t, t, y, s_{\text{base}})\),而 \(v_{s_k}\) 表示仅将第 \(k\) 个属性设为目标高质量而其余属性保持基线配置的前向预测。用户可在推理时随心调大 \(\omega_{\text{aes}}\)\(\omega_{\text{cla}}\) 以增强画面的艺术美感与细节锐度,或精确压制低熵导致的空白边界与水印痕迹。

损失函数 / 训练策略

模型采用连续流匹配(Flow Matching)目标进行端到端优化,采用线性插值路径 \(x_t = (1-t)x + t\epsilon\),其中 \(x \sim p(x)\) 为潜空间图像,\(\epsilon \sim \mathcal{N}(0, I)\)。训练网络预测向量场速度 \(v_\theta(x_t, t, s, y) = \epsilon - x\): $\(\mathcal{L}_{\text{FM}} = \mathbb{E}_{t, x, \epsilon, s, y} \left[ \| v_\theta(x_t, t, s, y) - (\epsilon - x) \|_2^2 \right]\)$ 实验主体以高效 DiT 架构 Sana 为骨干(覆盖 Sana-0.6B 与 Sana-1.6B),训练集包含从 LAION-2B-EN 抽取的 100M 图像与 10M 内部图像,为消除原始网页 caption 噪声,全部文本均由离线 GPT-4o 重新生成。Sana-1.6B 在 32 块 NVIDIA A100 GPU 上以 2048 全局批大小预训练 150K 步(512×512 分辨率),并在 1024×1024 分辨率下追加微调 20K 步。

实验关键数据

主实验

在 512×512 与 1024×1024 分辨率下,本文将 LACON 与采用不同过滤阈值的基线模型进行了系统评测,评价指标包括 GenEval(文本对齐与组合生成能力)、DPG(详细提示词生成评估)与 FID(MJHQ-30K 上的真实度与分布拟合度)。对比基线包括:Baseline-A(严苛过滤,仅保留约 5% 数据)、Baseline-B(最佳过滤子集,保留约 65% 数据)、Baseline-C(100% 全量未过滤原始数据,无质量条件输入)与 Baseline-D(与 Baseline-C 数据相同,推理时挂载负向提示词)。

分辨率与模型配置 方法 训练数据利用率 GenEval ↑ DPG ↑ FID (MJHQ-30K) ↓
512×512 (Sana-0.6B) Baseline-A (过度过滤) ≈5% 55.0 68.1 14.9
Baseline-B (最佳过滤) ≈65% 62.8 70.4 13.4
Baseline-C (全量无条件) 100% 60.8 69.7 15.4
Baseline-D (+ 负向提示词) 100% 61.0 69.2 15.3
LACON-S (本文标准版) 100% 64.4 71.9 11.9
LACON-A (本文激进版) 100% 65.6 71.8 11.8
512×512 (Sana-1.6B) Baseline-A (过度过滤) ≈5% 58.3 73.4 14.0
Baseline-B (最佳过滤) ≈65% 68.0 76.1 13.1
Baseline-C (全量无条件) 100% 67.0 75.4 13.5
Baseline-D (+ 负向提示词) 100% 67.1 75.5 13.5
LACON-S (本文标准版) 100% 70.9 77.3 12.0
LACON-A (本文激进版) 100% 71.6 78.1 11.2
1024×1024 (Sana-1.6B) Baseline-B (最佳过滤) ≈65% 68.3 76.3 12.9
LACON-S (本文标准版) 100% 70.9 77.6 11.4
LACON-A (本文激进版) 100% 71.5 78.8 11.3

此外,在自回归生成架构(Qwen3-0.6B 与 Qwen3-1.7B 结合 LlamaGen VQ-VAE)下,LACON-A 同样分别取得了 61.3 / 75.4 / 11.2 与 70.3 / 80.1 / 10.9 的优异成绩,显著优于仅在 65% 清洗数据上训练的 Baseline-B(58.9 / 73.1 / 12.4 与 66.4 / 78.2 / 12.1),验证了框架跨架构的普适性。

消融实验

1. 连续属性 Token 注入策略对比(基于 Sana-1.6B 512×512) 对比了线性插值(Linear Interpolation)、硬离散分桶(Discrete Binning)、傅里叶特征嵌入(Fourier Feature)与本文的高斯加权聚类中心(GCC)。

编码策略 机制说明 GenEval ↑ DPG ↑ FID ↓
线性插值 (Linear Interpolation) 极值两端设可学习 token,根据标量线性混合 69.5 76.1 12.7
离散分桶 (Discrete Binning) 均匀区间硬量化,各桶独立 token 69.8 77.2 12.4
傅里叶特征 (Fourier Feature) 周期性正弦高频编码 + MLP 投影映射 70.4 77.0 12.5
GCC (本文提出) 固定物理锚点 + 高斯核平滑自适应软加权 71.6 78.1 11.2

2. 推理阶段各质量属性独立移除消融(LACON-S 设置下逐一剔除对应高质量条件)

引导配置 移除的质量属性 GenEval ↑ DPG ↑ FID ↓ 性能跌幅与敏感性
LACON-S (完整) 无(保留全部 5 维信号) 70.9 77.3 12.0 基准表现
w/o \(s_{\text{aes}}\) 移除美学属性条件 69.4 76.6 12.6 GenEval 骤降 1.5,FID 恶化 0.6,敏感度最高
w/o \(s_{\text{cla}}\) 移除清晰度属性条件 69.7 76.8 12.5 锐度下降,FID 恶化 0.5
w/o \(s_{\text{ent}}\) 移除信息熵属性条件 69.8 77.0 12.2 复杂纹理场景边缘生成易现空白缺陷
w/o \(s_{\text{wat}}\) 移除水印属性条件 70.2 77.2 12.1 部分采样结果开始浮现残余水印暗纹
w/o \(s_{\text{luma}}\) 移除亮度属性条件 70.4 77.3 12.1 对比度与曝光稳定性微降

关键发现

  • 打破质量与数量的零和博弈:在传统过滤管线中,保留数据从 5% 增至 65% 性能先升后降(过少则欠拟合,过多则受低质污染)。而 LACON 彻底解除这一制约,直接在 100% 数据上训练却大幅超越 65% 黄金过滤子集(Sana-1.6B FID 由 13.1 降至 11.2),证明未清洗数据中的低质样本拥有极高的负例边界指导价值。
  • 弥补长尾世界知识断层(Knowledge Gap):可视化评测表明,Baseline-B 因清洗过滤丢失了如大蓝闪蝶(Morpho butterfly)、矿物阶梯台地(Mineral terraces)、粉彩老年肖像等长尾概念,生成出现严重畸变;而 LACON 凭借 100% 原始数据的全量摄入,完美重现了罕见实体的细致物理特征。
  • 美学与清晰度是影响最大的主导维度:消融数据显示,\(s_{\text{aes}}\)\(s_{\text{cla}}\) 对生成指标的拉动最为显著;而信息熵 \(s_{\text{ent}}\) 的显式建模则巧妙解决了在未清洗全量数据上训练时普遍出现的图像白边与边界空白塌陷。

亮点与洞察

  • 将破坏性清洗重构为建设性监督:传统研究将质量评估模型(如美学打分器、水印检测器)单纯作为“门禁过滤器”,LACON 颠覆性地将其再利用为多维正向条件标签,既保护了数据多样性,又使数据治理算力在训练阶段获得二次价值回收。
  • 高斯加权聚类中心(GCC)的几何优雅性:通过固定的物理空间锚点和基于半间距方差的高斯核函数,GCC 在保持离散 token 紧凑参数量的同时实现了连续、平滑且梯度稳定的分布建模,比强震荡的傅里叶特征和阶跃式分桶更契合物理属性演化。
  • 从推理端“盲猜负提示词”转向训练端“明示质量锚点”:彻底告别了依靠在负向 prompt 中堆砌“ugly, watermark, low quality”的脆弱试错模式,在训练阶段让网络端到端学会如何从低质模式平滑导航至高质流形。

局限与展望

  • 依赖预定义质量维度的完备性:目前仅覆盖了美学、水印、清晰度、信息熵、亮度 5 维信号,尚未显式建模诸如肢体解剖结构异常(畸变手指/面部坍塌)或多物体几何透视失真等高阶结构缺陷。
  • 多条件引导推理的算力开销:LACON-A 在去噪时需要计算 \(K+2\) 个前向速度分量,单步推理成本约为标准生成的 7 倍。未来需探索针对多属性引导的联合蒸馏或轻量化快速采样算法。
  • 拓展至视频与 3D 等多模态领域:视频生成中的时序闪烁、相机抖动,以及 3D 生成中的多视角不一致性同样饱受过滤丢弃之苦,将时空连续质量评分条件化是极具潜力的演进路径。

相关工作与启发

  • vs Qwen-Image / Hunyuan-Image 等工业级清洗流水线:现有工业模型投入巨大算力构建多阶段瀑布式过滤管线,丢弃 50% 以上原始数据;LACON 证明了“全量数据 + 显式质量打标”不仅节省了清洗门禁设计的试错成本,还能以同等计算预算取得更高生成上限。
  • vs Coherence-Aware Diffusion / MIRO:此类工作开始尝试将文本图像对齐分数或强化学习奖励作为条件信号,但聚焦于图文语义契合度;LACON 首次系统性地将美学、物理清晰度、水印概率等底层到高层的全谱系多维清洗指标进行向量化建模并实现解耦可控。
  • vs Negative Prompting 启发式负向引导:传统负向提示词仅在推理阶段凭借无监督文本隐空间进行隐式远离,缺乏显式退化表征;LACON 提供了严格对应的训练期对偶表述,引导效果更为确定且不存在语义冲突。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 颠覆了文生图领域的“先过滤后训练”范式,将清洗指标优雅地重构为连续条件嵌入,视角极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 0.6B 与 1.6B 规模、Flow Matching 与自回归双架构、从 5% 到 100% 的完备数据比例对比、各质量维度消融及长尾知识断层定性验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻犀利,问题剖析一针见血,架构图与可视化对比清晰直观。
  • 价值: ⭐⭐⭐⭐⭐ 为大模型时代低成本、高效率利用无清洗海量真实数据提供了极具工业落地潜力的通用方法论。