跳转至

Co-evolving Representations in Joint Image-Feature Diffusion

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/zelaki/CoReDi
领域: 图像生成
关键词: 联合图像特征扩散, 协同进化表征, 流匹配, 特征塌陷正则化, 像素空间扩散

一句话总结

针对联合图像-特征扩散模型中预训练视觉表征空间静态固定的瓶颈,本文提出协同进化表征扩散(CoReDi),通过轻量可学习线性映射联合优化扩散模型与语义空间,并借助停止梯度、批归一化与特征方差正则化彻底阻断表征塌陷,在潜空间与像素空间扩散中均实现显著加速收敛与样本质量跃升。

研究背景与动机

扩散模型与流匹配方法已成为高保真图像生成的核心范式,其通常运行在低维 VAE 潜空间或直接在像素空间对图像底层统计分布建模。然而,标准扩散主干自身缺乏显式的深层语义先验,容易在全局结构与复杂语义关联上出现失真。近期兴起的联合图像-特征扩散方法(如 ReDi、REG)尝试打破这一限制,通过同时建模低级 VAE 潜变量与自监督视觉编码器(如 DINOv2)提取的高级语义特征,让模型兼具局部微观纹理与宏观语义掌控力。

然而,现存联合扩散框架普遍存在一个根本性断层:作为扩散引导目标的语义表征空间完全脱离生成目标独立构建,且在训练全过程中保持静态冻结。在实践中,高维语义特征仅通过离线预计算的固定 PCA 或浅层自编码器降维到若干通道,扩散模型被动地去拟合这一预设分布。表征编码器与投影头从未针对图像合成任务的目标函数接收过任何反馈与自适应优化。这种“静态表征空间引导动态生成模型”的不对称设计,限制了高级语义特征与低级图像潜变量之间的互补增益。

本文的切入角度是:引导扩散过程的语义空间应当根据生成任务的实际需求动态进化。核心 idea:提出协同进化表征扩散(CoReDi),将预训练视觉特征的降维映射替换为与扩散模型端到端联合优化的可学习线性层,并引入停止梯度目标、批归一化约束与显式特征方差正则化,使语义空间在免于模式塌陷的前提下与生成主干协同特化。

方法详解

整体框架

CoReDi 的核心在于将语义降维映射纳入生成训练回路,构建一个两路并行的联合流匹配系统。输入图像经过冻结的预训练视觉编码器(如 DINOv2-ViT)提取高维稠密特征后,通过一个可学习的线性投影矩阵映射至低维空间,随后立即施加无仿射参数的批归一化(Batch Normalization)以锁定数值尺度。加噪后的图像潜变量(或降采样像素)与加噪后的协同进化表征通过通道合并或线性投影融合成统一的令牌流,送入扩散 Transformer(DiT)主干同时预测双模态的速度场。为了防止端到端优化引发的平凡退化与通道塌陷,系统在表征流匹配目标处施加停止梯度,并在表征内部引入显式多样性正则化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 x0 与预训练特征 z0"] --> B["自适应可学习线性投影<br/>g_phi(z0) = z0 W_phi 替代固定 PCA"]
    B --> C["无仿射参数批归一化<br/>锁定特征尺度防止噪声调度失真"]
    C --> D["停止梯度流匹配速度目标<br/>切断目标端直接反传防止平凡解"]
    D --> E["特征方差与正交去相关正则化<br/>约束空间分量多样性阻断通道塌陷"]
    E --> F["双模态速度场预测与采样输出"]

关键设计

1. 自适应可学习线性投影:让语义空间适配生成任务需求

现有联合扩散方法(如 ReDi)必须使用预先离线计算的固定 PCA 矩阵将高维视觉特征(如 DINOv2 的 1024 维)投影到 8 维或 16 维紧凑空间,但 PCA 仅保留数据全局无监督方差最大的方向,这些方向往往包含对几何与生成无益的背景噪声或冗余全局模式。CoReDi 彻底舍弃静态投影,将映射层参数化为可学习矩阵 \(W_\phi \in \mathbb{R}^{D \times d}\): $\(\tilde{\mathbf{z}}_0 = g_\phi(\mathbf{z}_0) = \mathbf{z}_0 W_\phi\)$ 其中 \(D\) 为视觉编码器输出维度(例如 1024),\(d\) 为目标低维通道数(潜空间下设为 8,像素空间设为 16)。随着扩散主干反向传播损失,投影权重 \(W_\phi\) 动态旋转调整其投影子空间,使得保留下来的特征分量精准捕捉图像生成过程最匮乏的局部空间构型与高层拓扑信息。

2. 停止梯度目标与无仿射批归一化:双重锚定阻断平凡解与数值漂移

如果直接采用标准的流匹配损失端到端更新投影参数 \(\phi\),系统会遭遇严重的数值退化陷阱:因为加噪流匹配损失的目标项包含真实表征 \(\tilde{\mathbf{z}}_0\),网络会通过简单地将 \(\phi\) 压缩为全零矩阵或常数向量来平凡地最小化速度预测误差,从而彻底丧失表征能力。CoReDi 在表征速度损失项中对目标真实值施加停止梯度操作(Stop-Gradient): $\(\mathcal{L}_{\text{rep}} = \left\| \mathbf{v}_\theta^z(\mathbf{x}_t, \tilde{\mathbf{z}}_t, t) - (\boldsymbol{\epsilon}_z - \text{sg}(\tilde{\mathbf{z}}_0)) \right\|^2\)$ 此外,扩散模型对于输入特征的尺度变化高度敏感,动态更新的映射头极易引发特征方差随训练步数发散或萎缩,进而彻底破坏预设的连续时间噪声调度。为此,模型在投影矩阵之后紧跟一个无仿射参数(无乘性缩放 \(\gamma\) 与加性平移 \(\beta\))的 Batch Normalization 层,纯粹利用指数移动平均(EMA)估计批次方差与均值,将每个通道规范化为零均值单位方差,从而保证输入扩散主干的特征尺度严丝合缝地吻合布朗运动扩散分布。

3. 特征方差与去相关正则化:结构化抑制通道冗余与特征塌陷

虽然停止梯度阻断了标量尺度的平凡全零解,批归一化也防止了不同样本塌陷至单一点,但映射后的表征仍然极易遭遇“特征塌陷”(Feature Collapse):所有学习到的投影通道高度同质化、携带几乎相同的语义模式,或者部分通道方差趋于死寂。为迫使 \(d\) 个通道捕获互补正交的生成线索,CoReDi 提出特征方差正则化(Feature Variance Regularization),对空间中每个 token 位置 \(i\) 沿通道维度的标准差施加 hinge 惩罚: $\(\mathcal{L}_{\text{var}}(\tilde{\mathbf{z}}_0) = \frac{1}{L} \sum_{i=1}^L \max\left(0, \gamma - \sqrt{\text{Var}(\tilde{\mathbf{z}}_0^i) + \epsilon}\right)\)$ 其中 \(L\) 为空间 token 总数,\(\gamma=1\) 为最低标准差阈值。这一设计促使每个空间 token 的各特征通道保持活跃且互不相同。论文同时探索了权重正交正则化 \(\mathcal{L}_{\text{orth}} = \|W_\phi^\top W_\phi - \mathbf{I}\|_F^2\) 与通道协方差非对角线惩罚 \(\mathcal{L}_{\text{cov}}\),实验证明三者均能有效防止通道简并,其中特征方差约束在生成保真度上表现最佳。

4. 像素空间扩散架构解耦扩展:突破 VAE 重构瓶颈

CoReDi 不仅适用于潜空间扩散,还能直接推广到像素空间扩散,摆脱 VAE 带来的重构误差上限与信息丢失。借鉴 DeCo 架构,CoReDi 将加噪的低分辨率图像 \(\hat{\mathbf{x}}_t\) 与加噪协同表征 \(\tilde{\mathbf{z}}_t\) 一并送入 DiT 编码器提取联合条件特征 \(\mathbf{c}_{\text{joint}}\): $\(\mathbf{c}_{\text{joint}} = \text{Enc}_\theta(\hat{\mathbf{x}}_t, \tilde{\mathbf{z}}_t, t)\)$ 全分辨率图像的速度场由轻量级像素解码器预测 \(\mathbf{v}_{\text{pred}}^x = \text{Dec}_\theta(\mathbf{x}_t, \mathbf{c}_{\text{joint}}, t)\),表征速度场则由线性解码头输出 \(\mathbf{v}_{\text{pred}}^z = \mathbf{W}_{\text{dec}} \mathbf{c}_{\text{joint}}\)。由于像素尺度与高级语义特征在分辨率与维度上差异巨大,论文发现直接照搬潜空间超参数会导致不平衡,将表征权重平衡系数下调至 \(\lambda_z=0.1\) 并在通道数设为 16 时取得最优像素生成表现。

损失函数 / 训练策略

CoReDi 采用端到端多任务联合目标函数训练参数 \(\theta\)(扩散主干及预测头)与 \(\phi\)(可学习投影矩阵): $\(\mathcal{L}(\theta, \phi) = \mathcal{L}_{\text{image}}(\theta, \phi) + \lambda_z \mathcal{L}_{\text{rep}}(\theta, \phi) + \lambda_{\text{reg}} \mathcal{L}_{\text{reg}}(\phi)\)$ 其中潜空间实验中设定 \(\lambda_z = 1.0\),像素空间设为 \(\lambda_z = 0.1\);正则化权重默认设为 \(\lambda_{\text{reg}} = 1.0\)。投影层权重 \(W_\phi\) 初始化为随机正交矩阵。对于参数量更大的 XL 级别模型,采用余弦退火衰减学习率调度器单独微调投影层参数,以确保长程训练下的平稳收敛。

实验关键数据

主实验

在 ImageNet \(256 \times 256\) 条件图像生成基准上,CoReDi 在潜空间(Latent Diffusion)与像素空间(Pixel Diffusion)均显著超越现有基线。在无分类器引导(w/o CFG)设置下,CoReDi 仅用一半甚至几分之一的训练预算即可达到或超越基线性能。

模型 参数量 训练步数/轮数 FID ↓ sFID ↓ IS ↑ Precision ↑ Recall ↑
SiT-B/2 130M 400K iter 33.0 - - - -
ReDi-B/2 130M 400K iter 21.4 - - - -
CoReDi-B/2 130M 200K iter 24.7 6.7 57.4 0.60 0.61
CoReDi-B/2 130M 400K iter 16.4 - - - -
SiT-XL/2 675M 7M iter 8.3 - - - -
REPA-XL/2 675M 4M iter 5.9 - - - -
ReDi-XL/2 675M 4M iter 3.3 - - - -
CoReDi-XL/2 675M 2M iter 3.4 - - - -
DiT-XL/2 (CFG) 675M 1400 epochs 2.27 4.60 278.2 0.83 0.57
SiT-XL/2 (CFG) 675M 1400 epochs 2.06 4.50 270.3 0.82 0.59
REPA-XL/2 (CFG) 675M 800 epochs 1.80 4.50 284.0 0.81 0.61
ReDi-XL/2 (CFG) 675M 800 epochs 1.72 4.68 278.7 0.77 0.63
CoReDi-XL/2 (CFG) 675M 400 epochs 1.58 4.33 297.2 0.63 0.78

在像素空间评估中(DeCo 架构),CoReDi 同样表现出优异的加速与生成提升:

像素扩散模型 训练步数 参数量 FID ↓ 相对基线收敛速度
DeCo-L/16 (复现) 100K iter 426M 46.0 1.0×
DeCo-L/16 200K iter 426M 31.3 1.0×
CoReDi-L/16 100K iter 426M 31.5 2.0× (100K 追平 200K)
CoReDi-L/16 200K iter 426M 21.5 提升 9.8 FID

消融实验

消融实验基于 CoReDi-B/2 架构在 200K 训练步数下系统检验稳定化机制(停止梯度 SG、批归一化 BN)、正则化流派及权重系数。

配置 / 消融项 FID ↓ sFID ↓ IS ↑ Precision ↑ Recall ↑ 说明
CoReDi (完整模型, VF) 24.7 6.7 57.4 0.60 0.61 包含 SG + BN + 特征方差正则化 (\(\lambda_{\text{reg}}=1.0\))
w/o Stop-Gradient (SG) 50.8 8.1 29.5 0.49 0.53 目标退化,投影层平凡最小化损失,FID 剧降 26.1
w/o Batch Normalization (BN) 223.9 150.6 3.6 0.06 0.01 尺度无界导致噪声调度崩溃,模型彻底发散
无任何正则化 (w/o Reg) 37.2 7.2 39.8 - - 发生特征塌陷,性能差于固定 PCA 基线 (30.9)
正交正则化 (Ortho) 25.6 6.8 57.0 - - 约束矩阵权重正交,有效阻断通道同质化
协方差正则化 (Cov) 25.9 7.0 54.8 - - 惩罚特征协方差非对角线项,实现解耦
特征方差正则 (\(\lambda_{\text{reg}}=0.5\)) 25.9 6.6 55.2 0.59 0.60 约束强度稍弱,性能依然稳健
特征方差正则 (\(\lambda_{\text{reg}}=1.5\)) 24.3 6.6 58.9 0.61 0.61 增强通道差异性后生成质量进一步微幅提升

此外,针对不同骨干视觉编码器(Visual Encoders)在 200K 步数下的泛化性测试显示,CoReDi 相比固定 PCA 的 ReDi 获得一致的大幅提升:DINOv2(30.9 → 24.7 FID)、MOCOv3(38.2 → 33.5 FID)、SigLIPv2(36.2 → 29.1 FID)、MAE(40.3 → 37.1 FID)。

关键发现

  • 双重稳定化是协同进化的生命线:移除停止梯度会导致 FID 骤降至 50.8,说明未经保护的目标端会迅速诱导平凡常数投影;而缺少批归一化则导致模型完全崩溃(FID 223.9,Recall 接近 0),印证了表征尺度与扩散加噪调度的严密匹配是生成模型收敛的前提。
  • 显式正则化不可或缺:无正则化下的端到端训练甚至不如静态 PCA(37.2 vs 30.9),证明简单投影会导致各通道塌陷至低秩子空间。特征方差正则(VF)表现最优(24.7 FID),因为它直接作用于空间局部 token 的通道分散度。
  • 自适应空间结构涌现:通过局部色彩相关图差异度(LDS)、相关衰减斜率(CDS)与均方根空间对比度(RMSC)三项空间结构度量分析,CoReDi 在训练过程中自发演化出远强于固定 PCA 的局部空间几何与语义轮廓结构,这正是其大幅提升扩散合成质量的深层物理原因。

亮点与洞察

  • 从“静态拟合”跃迁至“动态特化”:打破了表征辅助扩散领域长期以来将外部表征视为只读先验的思维惯性,证明了仅凭一个极其轻量的线性投影矩阵在生成梯度反传下的协同演化,便能彻底激活视觉大模型的空间结构潜力。
  • 极简设计与收敛加速度:无需引入复杂的非线性神经网络适配器,仅仅依靠一个可学习投影头配合停止梯度、BN 和 Hinge 方差惩罚,就在 XL 规模上将收敛步数压缩了 2 到 13 倍(相比 REPA 提速约 13 倍,相比 ReDi 训练成本减半)。
  • 跨越潜空间与像素空间的普适范式:不仅在标准 VAE 潜空间生效,还能无缝迁移至端到端像素扩散模型(如 DeCo),证明语义表征引导与低级信号生成的解耦融合机制具有高度通用性。

局限与展望

  • 映射容量受限于单层线性变换:为兼顾稳定性和控制参数复杂度,本文仅探索了单层线性映射 \(W_\phi\);未来可探索浅层 MLP 或交叉注意力适配器,但非线性深层映射在停止梯度下如何防范更高维度的模式退化仍是挑战。
  • 表征骨干依然保持冻结:底层大型视觉编码器(如 ViT-L/14)的参数在训练中始终处于冻结状态;如何以极低显存代价(如 LoRA)对特征抽取器进行端到端极轻量微调,值得进一步探索。
  • 高分辨率与文本引导未全面覆盖:实验主要集中在 ImageNet \(256 \times 256\) 类别条件合成上,其协同进化机制在超高分辨率(如 \(1024 \times 1024\))或开放域复杂文本到图像(Text-to-Image)任务上的表现有待验证。

相关工作与启发

  • vs ReDi (Kouzelis et al., 2025):ReDi 同样探索了图像潜变量与 DINOv2 特征的联合流匹配,但采用预先计算的静态 PCA 降维,表征空间在训练期间死板固定;CoReDi 将静态 PCA 升级为可学习的动态协同投影头,结合方差正则化彻底激发了表征与图像生成的互补性。
  • vs REPA / iREPA (Yu et al., 2025; Singh et al., 2025):REPA 在扩散隐藏层施加表征对齐特征损失,iREPA 指出表征的空间结构对于生成至关重要;CoReDi 则在统一流匹配框架下直接联合生成图像与表征,并证明了协同进化映射会自动诱导出更显著的空间结构度量指标。
  • vs DeCo (Ma et al., 2025):DeCo 聚焦于像素空间的频域解耦以规避 VAE 瓶颈;CoReDi 将语义表征引导成功扩展到 DeCo 框架中,仅通过简单条件拼接便在像素扩散上实现了 2 倍收敛提速。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出在联合图像-特征扩散中让表征空间与生成模型协同进化,成功破解端到端优化退化难题。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖潜空间与像素空间扩散、多种模型尺度、4 种视觉编码器泛化实验、完备的收敛曲线及细致的空间自相似度分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑极为清晰,问题提炼精准,三个稳定化要素与实验剖析层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 为多模态联合扩散模型与自监督视觉表征的深度融合开辟了全新方向,代码开源且具备极高通用性。