跳转至

On the Diffusibility of High-Dimensional Latents

会议: ECCV 2026
论文: ECCV 原文
项目: https://cfeng16.github.io/on_the_diffusibility/
领域: 图像生成
关键词: 文本到图像生成, 表示自编码器, 高维隐空间, 流匹配, x0预测

一句话总结

针对基于预训练视觉表征的高维表示自编码器在微调重构后有效维度坍缩导致标准速度预测难以收敛的问题,本文揭示了高维噪声正交分量对扩散优化的干扰机理,提出直接采用 clean data (\(x_0\)) 预测目标,无需维度压缩即可高效扩散高维隐变量并显著提升生成保真度。

研究背景与动机

扩散模型与流匹配(Flow Matching)已成为高保真视觉生成的核心范式,其计算效率通常依赖于将扩散过程置于隐空间进行。早期方法采用变分自编码器(VAE)提取的低维隐空间,但极易丢失细粒度感知细节;近期兴起的表示自编码器(RAE)则直接利用预训练语义视觉编码器(如 DINOv2、SigLIP2)的特征空间来加速扩散训练。然而,开箱即用的语义编码器并非专为图像重构优化,往往会过滤掉文字、微小物体与高频纹理等低层视觉信号。为了弥补重构保真度的缺陷,学界自然倾向于引入重构损失对语义编码器进行微调或利用 MAE 等重构表征。

然而,这种为提升重构性能而改造的高维表征空间,在扩散生成训练中却遭遇了严峻的优化瓶颈。实验表明,在经过重构微调的高维特征空间中,标准流匹配的速度预测(\(v\)-prediction)目标收敛异常迟缓,甚至在单图过拟合测试中都难以拟合。现有方案为了绕过这一困境,普遍通过瓶颈适配器(Adapter)将高维特征强行压缩至低维空间,但这又不可避免地损害了高维表征蕴含的丰富语义与细粒度信息,使得高维重构表征在扩散生成中的真实潜力未被充分释放。

这种优化困难的核心矛盾在于表征有效维度的剧烈坍缩与高维正交各向同性噪声之间的几何不匹配。重构任务迫使高维特征高度贴近自然图像所在的低维流形,导致有效维度骤降;此时标准速度预测目标会将模型容量大量消耗在拟合与低维信号流形正交的高维各向同性噪声分量上。核心 idea:显式揭示重构微调诱发的高维隐表征有效维度坍缩机理,采用干净样本预测(\(x_0\)-prediction)直接隔绝与流形正交的无关噪声分量,在不压缩维度的情况下实现高维重构表征的高效扩散生成。

方法详解

整体框架

本文针对基于强重构高维表征的文本到图像扩散模型构建生成流程。系统主要由两大部分构成:第一部分为高维强重构分词器(Tokenizer),通过重构微调或采用重构预训练编码器以保留高频视觉细节;第二部分为扩散生成网络,基于文本条件利用扩散 Transformer(DiT)直接在高维特征空间中去噪生成。

在文本到图像生成管线中,输入图像 \(I\) 经由高维表征编码器提取高维特征 \(h_0 \in \mathbb{R}^h\) 作为扩散隐变量。文本提示经过冻结的自回归多模态视觉语言模型(如 Qwen3-VL-2B)并由可学习的 Query Token 提取文本条件嵌入 \(y\)。扩散网络(1B 规模的 Lumina-Next DiT)接收加噪隐特征 \(h_t = (1-t)h_0 + t\epsilon\) 与文本条件 \(y\),直接回归预测干净表征 \(x_0\)。最后,去噪生成的完整高维特征送入图像解码器还原为高分辨率图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与文本提示"] --> B["强重构高维表征提取<br/>保留高频细节与语义特征"]
    B --> C["有效维度坍缩几何表征<br/>信号聚集于低维子空间"]
    C --> D["流形解耦 clean data x0 预测<br/>消除正交噪声分量干扰优化"]
    D --> E["高保真像素解码输出<br/>无需低维瓶颈压缩"]

关键设计

1. 有效维度坍缩分析:揭示重构微调导致的隐空间几何变化

标准语义表征(如冻结的 DINOv2、SigLIP2)在全特征维度下拥有极高的有效维度,因而对流匹配速度预测具有良好的扩散性。但当引入重构目标微调编码器或采用 MAE 这类以重构为导向的预训练表征时,特征空间的奇异值谱出现断崖式衰减。为了定量描述这一现象,论文在 ImageNet 采样的 20 万个 patch 特征上执行奇异值分解(SVD),得到按降序排列的奇异值 \(\sigma_1, \dots, \sigma_D\),定义前 \(k\) 个主成分的累积能量占比为:

\[C(k) = \frac{\sum_{i=1}^k \sigma_i^2}{\sum_{i=1}^D \sigma_i^2}\]

\(R_\tau = \min \{ k \mid C(k) \ge \tau\% \}\) 表示解释至少 \(\tau\%\) 方差所需的最少主成分数。数据表明,DINOv2-L 在 1024 维下的 \(R_{90}\) 高达 672,而经重构微调后其 \(R_{90}\) 骤降至 129;768 维的 MAE-B 其 \(R_{90}\) 仅为 103。其内在机制在于,自然图像天然分布于低维流形,当编码器被强制捕获像素级重构细节时,高维隐特征被约束在极低维度的信号流形子空间中,造成有效维度严重坍缩。

2. 正交噪声干扰与速度预测缺陷:数学解析高维扩散优化瓶颈

当观测到的高维特征 \(x_0 \in \mathbb{R}^h\) 严格集中于低维流形子空间时,可将其表示为真实隐变量 \(c_0 \in \mathbb{R}^l\) 通过正交基矩阵 \(Q \in \mathbb{R}^{h \times l}\)(满足 \(Q^\top Q = I_l\))的线性映射:\(x_0 = Q c_0\)(其中 \(h \gg l\))。在标准流匹配插值 \(z_t^h = (1-t)x_0 + t\epsilon^h\) 下,各向同性高维高斯噪声 \(\epsilon^h\) 可正交解耦为子空间内噪声 \(Q\epsilon^l\) 与正交补空间噪声 \(\epsilon_\perp = (I - QQ^\top)\epsilon^h\)。此时,流匹配的标准速度预测目标 \(v_\theta^h(z_t^h, t) = \mathbb{E}[\epsilon^h - x_0 \mid z_t^h]\) 被迫分解为两项:

\[v_\theta^h(z_t^h, t) = Q v_\theta^l(z_t^l, t) + \frac{1}{t}(I - QQ^\top)z_t^h\]

\(h \gg l\) 的极端几何条件下,第二项正交噪声分量 \(\epsilon_\perp\) 在高维空间中占据了绝大部分能量,且其与真实信号 \(c_0\) 完全无关。标准速度预测网络被迫分配巨大的模型容量与梯度更新去逼近发散的正交噪声项 \(\frac{1}{t}\epsilon_\perp\),导致在有限迭代步内对核心信号流形的学习极度低效,从而引发生成图像几何结构溃散。

3. 流形解耦 clean data (\(x_0\)) 预测:绕过高维正交噪声直接学习低维信号

为从根本上规避正交噪声对网络容量的无效消耗,本文放弃速度预测目标,转而直接训练模型预测干净隐表征 \(x_0\)。其条件期望目标形式为:

\[x_\theta^h(z_t^h, t) = \mathbb{E}[x_0 \mid z_t^h] = \mathbb{E}[Q c_0 \mid Q z_t^l + t\epsilon_\perp]\]

由于真实信号分量 \(Q c_0\) 与正交补空间噪声 \(\epsilon_\perp\) 在统计上完全独立,正交噪声项在条件期望计算中被自然剔除,目标精确简化为:

\[x_\theta^h(z_t^h, t) = Q \mathbb{E}[c_0 \mid z_t^l] = Q x_\theta^l(z_t^l, t)\]

该数学特性表明,\(x_0\) 预测在目标函数层面自动过滤掉了高维空间中的正交噪声干扰,使得高维扩散 Transformer 的参数学习完全聚焦在低维有效信号流形上。即使在高维表征空间下直接建模,\(x_0\) 预测依然能够保持与低维扩散等价的优化效率,彻底消除了对降维 Adapter 的依赖。

损失函数 / 训练策略

在文本到图像生成训练中,给定图文对 \((I_i, T_i)\),首先提取高维强重构特征 \(h_{i,0} \in \mathbb{R}^h\) 与文本条件嵌入 \(y_i\)。流匹配时间步 \(t \in [0, 1]\) 采用时间偏移调度:令基础时间为 \(t_n\),偏移后时间为 \(t_m = \frac{\alpha t_n}{1 + (\alpha - 1)t_n}\),其中比例系数 \(\alpha = \sqrt{m/n}\)\(m\) 为图像 token 数与通道维度的乘积,设置基准尺度 \(n = 4096\)

扩散 Transformer \(x_\theta\) 以前向加噪特征 \(h_{i,t} = (1-t)h_{i,0} + t\epsilon\) 为输入,采用均方误差损失监督直接预测干净特征 \(h_{i,0}\)

\[\mathcal{L}_{\text{Diff}} = \mathbb{E}_{t, \epsilon, h_{i,0}, y_i} \left[ \| x_\theta(h_{i,t}, t, y_i) - h_{i,0} \|^2 \right]\]

为避免在极小时间步 \(t \to 0\) 出现数值不稳定,训练中遵循截断设置,将采样时间步截断在 \(t \ge 0.05\)。对于重构微调编码器 \(g'\),结合了语义保持损失 \(\mathcal{L}_{\text{sem}} = \| g(I) - g'(I) \|^2\)\(g\) 为冻结原编码器)与包含 \(L_1\)、感知及对抗损失的像素级重构损失 \(\mathcal{L}_{\text{recon}}\),防止表征语义坍塌。

实验关键数据

主实验

在 256×256 分辨率及相同训练数据(BLIP-3o 的 34M 子集,90k 步)下,论文在 GenEval、DPG-Bench 及 COCO-30k 零样本 FID 上对比了不同分词器与预测目标的性能。

Tokenizer 隐变量维度 预测目标类型 GenEval ↑ DPG-Bench ↑ COCO-30k FID ↓ 说明
DINOv2-L (冻结基线) 1024 \(v\)-pred 37.63 70.21 18.34 语义强但重构弱
FT-DINOv2-L (微调重构) 1024 \(v\)-pred 30.96 67.47 29.97 维度坍缩致扩散失败
FT-DINOv2-L-low-dim 32 (压缩) \(v\)-pred 40.99 73.04 17.64 降维损失高频细节
FT-DINOv2-L (本文方案) 1024 \(x_0\)-pred 39.48 71.83 16.80 保留完整高维细节,生成质量最佳
MAE-B-RAE 768 \(v\)-pred 36.17 67.54 22.20 重构预训练表征下 \(v\) 预测落后
MAE-B-RAE (本文方案) 768 \(x_0\)-pred 40.89 73.90 17.24 各指标全面大幅提升

消融实验

针对表征编码器的有效维度 \(R_\tau\) 与重建质量(ImageNet 验证集 PSNR),论文分析了重构导向训练对特征空间几何性质的直接影响。

Tokenizer / 编码器 训练数据集 全维度 \(R_{90}\) \(R_{95}\) \(R_{99}\) 重构 PSNR (dB)
DINOv1-B ImageNet-1k 768 502 595 701
DINOv2-B-RAE LVD-142M 768 507 611 726 18.85
SigLIP2-B-RAE WebLI 768 460 578 715 19.10
MAE-B-RAE ImageNet-1k 768 103 252 578 28.13
MAE-B-IG-3B Instagram-3B 768 197 348 595 27.67
DINOv2-L (原版冻结) LVD-142M 1024 672 811 965 17.34
FT-DINOv2-L (微调重构) ImageNet-1k 1024 129 302 726 29.12

在规模扩展实验中,本文方法扩展至 90M 预训练并结合 60k SFT,在 256 分辨率下 GenEval 达 78.62、DPG-Bench 达 80.13;在 512 分辨率下进一步提升至 79.69 和 81.15,优于参数量更大的 Scale-RAE(2.4B 参数,GenEval 77.43,DPG-Bench 78.47)。

关键发现

  • 强重构表征导致有效维度急剧缩减:纯语义预训练模型(DINOv2-L)的 \(R_{90}\) 占总维度的 65.6%,而重构微调后该比例剧降至 12.6%,表明重构压力强制高维特征贴近极低维流形。
  • 预测目标的选择决定高维扩散成败:在微调 DINOv2-L 上,\(v\) 预测导致 FID 恶化至 29.97,而 \(x_0\) 预测将 FID 显著优化至 16.80,GenEval 从 30.96 跃升至 39.48。在 MAE-RAE 上,\(x_0\) 预测同样使 FID 从 22.20 改善至 17.24。
  • 高维保留对图像保真度至关重要:虽然 32 维低维瓶颈(FT-DINOv2-L-low-dim)因流形紧凑具有略高的文本对齐分,但强行压缩破坏了细粒度纹理导致 FID 落后于本文无压缩方案(17.64 vs 16.80)。

亮点与洞察

  • 洞察表征微调的几何副作用:首次系统揭示并量化了“重构优化导致有效维度坍缩”这一关键几何现象,指出了表征学习与生成扩散在特征空间有效维度上的深层冲突。
  • 严谨的数学解耦消除噪声干扰:通过子空间投影证明了高维 \(v\) 预测中正交噪声项的破坏作用,确立了 \(x_0\) 预测在统计独立性下自动消解正交噪声分量的理论合理性。
  • 打破高维表征必须低维压缩的思维定式:无需设计繁琐的低维瓶颈适配器,仅通过简单的参数化目标切换,便实现了高维强重构隐特征的端到端高效生成。

局限与展望

  • 实验规模与分辨率限制:主干实验主要基于 1B 规模 DiT 与 256×256 分辨率,虽然初探了 512 分辨率与 90M 数据,但超大规模基础模型(如 >10B 参数、4K 分辨率)下的表征可扩散性仍待进一步检验。
  • 编码器双向任务联合优化:目前先通过微调获得强重构编码器,再独立训练扩散生成网络;未来可探索理解表征与生成表征的联合自适应优化机制。

相关工作与启发

  • vs RAE / Scale-RAE: RAE 直接采用冻结的纯语义编码器(如 DINOv2、SigLIP2),在特征维度未坍缩的前提下适用 \(v\) 预测,但重构 PSNR 仅约 17-19 dB,易丢失文字与精细细节;本文引入重构优化并将重构 PSNR 提升至 29 dB,同时借助 \(x_0\) 预测解决了伴生的高维扩散优化难题。
  • vs AlignTok: AlignTok 同样对预训练编码器做重构微调,但因受困于高维空间扩散难的瓶颈,只能引入降维适配器将特征压缩至低维;本文证明直接在高维空间利用 \(x_0\) 预测无需降维即可扩散,且在图像保真度(FID)上更优。
  • vs JiT: JiT 在像素空间探讨了流形几何下 \(x_0\) 预测的优势;本文将这一洞察拓展并深化至高维连续表征自编码器空间,定量建立了重构微调、有效维度坍缩与流匹配优化效率之间的完整理论映射。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 理论清晰透彻,首次建立重构微调、有效维度坍缩与高维扩散参数化的映射。
  • 实验充分度: ⭐⭐⭐⭐☆ 涵盖谱分析、单图过拟合、多数据集生成评测及分辨率扩展消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑推导严密流畅,图表直观且问题阐述切中痛点。
  • 价值: ⭐⭐⭐⭐⭐ 为表示自编码器(RAE)摆脱降维瓶颈、直接利用高维强重构特征提供了简洁高效的标准化方案。