跳转至

V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/HL-hanlin/V-Co
领域: 图像生成
关键词: 扩散模型, 像素空间扩散, 协同去噪, 表征对齐, DINOv2

一句话总结

V-Co 在统一的 JiT 像素级测试基准下系统解构了视觉协同去噪机制,提出由全双流架构、结构化掩码无条件分支、感知-漂移混合损失与基于 RMS 的信噪比校准构成的完整配方,在 ImageNet-256 上显著提升了像素扩散模型的生成质量与训练效率。

研究背景与动机

像素空间扩散模型(如 JiT)摆脱了传统隐空间扩散(LDMs)对预训练变分自编码器(VAE)的依赖,通过在原生像素空间直接训练高可扩展性的 Transformer 去噪器,避免了自编码器诱导的重构瓶颈与特征偏差。然而,像素级速度预测或去噪目标主要关注底层信号的局部一致性,缺乏显式的高层语义监督。这使得像素空间扩散模型在学习高层概念表征与复杂构图时样本利用率偏低,往往需要数倍于隐空间模型的参数量与训练步数才能达到可比的生成质量。

为了向扩散模型注入外部视觉先验,已有研究探索了表征对齐(如 REPA 强制对齐中间隐层)以及表征隐空间扩散(如 RAE),而视觉协同去噪(Visual Co-Denoising,如 Latent Forcing、ReDi)则通过让图像生成过程与自监督特征流(如 DINOv2)共同演化,使两路信号在整个去噪轨迹中持续交换信息。然而,现有的协同去噪系统通常将网络架构、引导策略、辅助监督损失与特征尺度校准等多重设计杂糅在端到端系统中,关键有效成分相互遮蔽,学界始终缺乏对协同去噪内部机理的严谨受控研究。

本文基于统一的 JiT 像素去噪框架,系统解耦并回答了协同去噪中的四个核心问题:什么架构能兼顾分支特异性与跨流交互、CFG 引导下的无条件分支应当如何定义、哪类表征空间辅助损失最为互补,以及如何物理校准跨模态特征去噪难度。核心 idea:采用解耦的全双流架构并在 CFG 中通过语义到像素的结构化注意力阻断消除泄漏,结合实例级感知对齐与分布级漂移排斥的混合损失以及基于 RMS 的信噪比对齐重缩放,形成简练且高效的像素-语义协同去噪配方。

方法详解

整体框架

V-Co 建立在连续时间流匹配(Flow Matching)与速度损失(v-loss)的形式化框架上,输入为干净图像 \(x\) 及其由冻结 DINOv2 提取的 Patch 级语义特征 \(d\)。在扩散时间步 \(t \in [0, 1]\) 下,系统向两路流独立注入标准高斯噪声 \(\epsilon_x, \epsilon_d \sim \mathcal{N}(0, I)\) 得到加噪输入: $\(z_t^x = t x + (1-t)\epsilon_x, \quad z_t^d = t d + (1-t)\epsilon_d\)$ 去噪网络以 \((z_t^x, z_t^d, t, c)\) 为输入联合预测干净图像与语义特征 \((\hat{x}, \hat{d})\),并将其转化为速度预测 \(\hat{v}_x = (\hat{x} - z_t^x)/(1-t)\)\(\hat{v}_d = (\hat{d} - z_t^d)/(1-t)\)。基础协同去噪损失监督两个分支的速度预测误差。

整个 V-Co 流程包含四项核心协同设计:通过双流 Transformer 独立处理并执行联合交互、在 CFG 生成时应用结构化注意力掩码阻断语义泄漏、在训练中引入自适应门控的感知-漂移混合损失,以及在输入端利用特征 RMS 匹配信噪比。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:像素流加噪图像与 DINOv2 语义特征"] --> B["RMS 特征重缩放<br/>按像素/语义模长比动态对齐 SNR"]
    B --> C["全双流 JiT 架构<br/>独立 Norm/MLP/QKV 配合联合自注意力"]
    C --> D["结构化语义到像素掩码<br/>CFG 无条件推理切断语义向像素注意力"]
    D --> E["感知-漂移混合损失<br/>实例级成对吸引与同类样本分布排斥"]
    E --> F["输出:预测的速度场与高保真去噪图像"]

关键设计

1. 全双流 JiT 架构:保持分支特异性表征与灵活跨流联合交互

在协同去噪中,像素信号与抽象语义特征具有完全不同的流形几何。若采用传统单流共享骨干网络(如直接元素相加或通道拼接后送入共享 Transformer 块),过早的参数共享与特征混合会强行压制语义流的独立演化空间,破坏表征结构。消融实验显示,直接相加和通道拼接在 CFG=1.0 时的 FID 仅为 15.15 和 14.33。即使改用 Token 序列拼接,若前置较多共享块,性能依然受限。

V-Co 最终确定了完全解耦的双流 JiT(Fully Dual-Stream JiT Blocks)方案:像素流与语义流在所有层均保持各自专用的 LayerNorm、前馈网络(MLP)以及自注意力投影矩阵(Query, Key, Value),仅在计算注意力权重时将两个序列拼接执行联合自注意力(Joint Self-Attention)。这种设计赋予两路流完全独立的非线性变换能力,同时使网络能够逐层自适应决定跨流信息融合的粒度与权重,在同等可训练参数量下将无引导 FID 大幅优化至 8.86。

2. 结构化语义到像素掩码:消除 CFG 无条件预测中的语义泄漏失真

分类器无关引导(CFG)依赖条件预测与无条件预测的外推差值 \(\Delta_x = \hat{v}_x^{\text{cond}} - \hat{v}_x^{\text{uncond}}\)。在双流协同去噪场景中,网络同时受类别标签 \(c\) 和语义特征 \(d\) 约束。基线方法通常沿用输入级丢弃策略,即在训练与生成无条件分支时随机将语义输入替换为全零嵌入(Zero Embedding)或可学习空标记([null] Token)。然而,这种输入级扰动会造成严重的分布偏离,且在联合丢弃标签与语义时,外推速度方向出现严重失准,导致 CFG 放大后的引导 FID 迅速劣化至 24.75。

V-Co 利用双流架构的注意力图连接特性,提出了结构化语义到像素掩码(Structural Semantic-to-Pixel Masking)。在构建无条件分支时,无需在输入端注入畸变的零向量,而是在注意力计算中显式屏蔽语义 Key/Value 向像素 Query 的单向注意力流动,从结构物理通路彻底阻断语义先验向像素生成流的渗透;同时保留像素流向语义流的信息传递,确保语义分支内部演化的完整性。配合训练阶段对类别与语义条件的联合丢弃,该结构掩码将引导 FID 从输入丢弃的 6.69 显著压低至 3.18。

3. RMS 特征重缩放:基于等价时间调度的信噪比对齐

预训练 DINOv2 特征与标准归一化像素张量在特征模长和数值范围上存在显著差异。当两个分支共享连续时间步 \(t \in [0, 1]\) 时,在流匹配参数化下,去噪难度直接受局部信噪比决定: $\(\text{SNR}(t) \propto \frac{t^2 \mathbb{E}[\|s\|^2]}{(1-t)^2 \mathbb{E}[\|\epsilon\|^2]}\)$ 由于双流被注入相同单位方差的噪声 \(\epsilon\),若语义特征的信号模长与像素信号失配,会导致两流在同一时间步下的去噪难度发生严重割裂,其中一侧过早进入低噪声阶段,导致联合梯度互相拉扯(缺失特征缩放时引导 FID 恶化为 5.28)。

V-Co 提出利用均方根(RMS)动态对齐语义流特征幅度: $\(d' = \alpha \cdot d, \quad \alpha = \frac{\text{RMS}(x)}{\text{RMS}(d)}\)$ 论文在理论上严谨证明,对语义特征缩放 \(\alpha\) 倍在信噪比维度完全等价于保持特征不缩放、而将语义流的扩散时间步映射至偏移调度 \(t' = \frac{\alpha t}{1 + (\alpha - 1)t}\)。相比手动调整复杂双重时间步调度的基线方法(FID 2.93),简易的 RMS 缩放直接统一了双流在整个扩散过程中的去噪难度,将引导 FID 稳定优化至 2.52。

4. 感知-漂移混合损失:统一实例级成对吸引与同类别分布排斥

基础协同去噪的速度损失仅对每个样本施加像素级的均方误差回归,缺乏对高层表征拓扑的几何约束。传统 REPA 在中间隐藏层强行施加均方误差约束,往往在训练后期过度束缚扩散模型的特征自由度(CFG 引导 FID 仅从 2.96 微降至 2.91);而常规感知损失仅提供点对点的实例吸引,易导致生成流向局部稠密模式塌缩;单步生成中使用的漂移损失(Drifting Loss)则缺乏多步去噪所需的精确成对监督。

针对此矛盾,V-Co 提出了感知-漂移混合损失(Perceptual-Drifting Hybrid Loss)。该损失将成对感知约束作为正向吸引场,拉动生成图像表征 \(u_i = \phi(\hat{x}_i)\) 靠近真实目标 \(\phi(x_i)\): $\(V_{\text{pos}}(u_i) = \phi(x_i) - \phi(\hat{x}_i)\)$ 同时在同一类别样本集合中,计算与其他生成样本 \(j\) 之间的核归一化权重 \(\alpha_{ij} \propto \exp(-\|\phi(\hat{x}_i) - \phi(\hat{x}_j)\|^2 / \tau_{\text{rep}})\),构建促使样本分散的负向排斥场: $\(V_{\text{neg}}(u_i) = \sum_{j \neq i} \alpha_{ij} (\phi(\hat{x}_j) - \phi(\hat{x}_i))\)$ 引入动态相似度门控因子 \(s_i = \exp(-\|\phi(\hat{x}_i) - \phi(x_i)\|^2 / \tau_{\text{gate}})\) 进行自适应加权: $\(V_{\text{hyb}}(u_i) = s_i V_{\text{pos}}(u_i) + (1 - s_i) V_{\text{neg}}(u_i)\)$ 并施加漂移损失 \(\mathcal{L}_{\text{drift}} = \|u_i - \text{sg}(u_i + V_{\text{hyb}}(u_i))\|_2^2\)。在生成偏离目标较远时排斥场占主导以防止聚集,接近目标时吸引场主导确保精确收敛,在 300 轮训练下将引导 FID 进一步推进至 2.44。

损失函数 / 训练策略

模型的总体优化目标由基础协同去噪速度损失和辅助感知-漂移混合损失加权组成: $\(\mathcal{L} = \mathcal{L}_{\text{v-co}} + \lambda_{\text{hyb}} \mathcal{L}_{\text{drift}}\)$ 其中基础协同速度损失为: $\(\mathcal{L}_{\text{v-co}} = \mathbb{E}\Big[\|\hat{v}_x - v_x\|_2^2 + \lambda_d \|\hat{v}_d - v_d\|_2^2\Big]\)$ 经参数敏感性研究发现,语义分支权重取 \(\lambda_d \in \{0.01, 0.1\}\) 时性能最佳。在此配置下,像素主分支的反向梯度模长约为语义分支的 2 至 4 倍,保证了模型以像素生成质量为主导目标、以语义重构为辅助约束。全模型在 ImageNet-256 数据集上完全遵循 JiT 标准的优化器与学习率配置,无需针对特定模块繁复调参。

实验关键数据

主实验

在标准的 ImageNet 256×256 类条件图像生成基准上,评估 50K 生成样本的 FID 和 Inception Score(IS)。V-Co 在参数量显著减少、训练轮数大幅降低的情况下,超越了底层纯像素扩散基线 JiT,并优于先前典型的隐空间及像素空间扩散方法。

模型 空间/类型 参数量 训练轮数 FID↓ IS↑
JiT-B/16 像素空间扩散 131M 600 3.66 275.1
JiT-L/16 像素空间扩散 459M 600 2.36 298.5
JiT-H/16 像素空间扩散 953M 600 1.86 303.4
JiT-G/16 像素空间扩散 2.0B 600 1.82 292.6
Latent Forcing (JiT-B/16) 像素空间协同去噪 465M 200 2.48 -
PixelGen-XL/16 像素空间扩散 676M 160 1.83 293.6
ReDi (SiT-XL/2) 像素空间协同生成 675M 350 1.72 278.7
DiT-XL/2 隐空间扩散 (VAE) 724M 1400 2.27 278.2
SiT-XL/2 隐空间流匹配 (VAE) 724M 1400 2.06 277.5
V-Co-B/16 (200 ep) 像素空间协同去噪 260M 200 2.52 242.6
V-Co-B/16 (600 ep) 像素空间协同去噪 260M 600 2.35 261.1
V-Co-L/16 (200 ep) 像素空间协同去噪 918M 200 2.10 243.0
V-Co-L/16 (500 ep) 像素空间协同去噪 918M 500 1.72 245.3
V-Co-H/16 (300 ep) 像素空间协同去噪 1.9B 300 1.71 263.3

消融实验

在受控的 JiT-B/16 基线协议下,逐步验证架构解耦、CFG 无条件通路设计、特征尺度校准与辅助监督损失的增益贡献。

模块设计 / 阶段 配置变体 CFG=1.0 FID↓ Guided FID↓ 说明
网络架构 单流直接相加 (Direct Addition) 15.15 - 参数量 156M,早期融合严重限制表征表达
单流通道拼接 (Channel Concat) 14.33 - 参数量 157M,两流未隔离前向处理
单流序列拼接 (Token Concat, 6专/6共) 12.35 - 参数量 198M,增加分支专用层持续改善指标
全双流架构 (Dual-Stream, 0共/12双流) 8.86 - 参数量 260M,独立 Norm/MLP 配合全层联合注意力
CFG 无条件策略 输入零向量丢弃 (Zero Embedding) 9.17 6.69 传统输入替换法,破坏特征统计分布
可学习空标记丢弃 ([null] Token) 9.37 6.64 输入空 token 无法阻止隐式语义泄漏
双向掩码 (Bidirectional Mask) 11.08 7.17 阻断像素向语义注意力反而削弱了语义流演化
语义到像素掩码 (Semantic-to-Pixel) 5.62 3.18 结构阻断语义向像素流动,联合丢弃下性能最优
特征校准策略 无特征缩放 (w/o RMS scaling) 9.12 5.28 双流 SNR 严重失调,去噪步调脱节
噪声调度偏移 (Noise Schedule Shift) 4.81 2.93 理论 SNR 对齐但需要独立时间调度与超参
RMS 特征重缩放 (RMS-based Scaling) 5.38 2.52 动态幅度缩放简便直接,引导生成质量更优
辅助表征损失 纯速度预测基线 (v-loss only) 5.38 2.96 300 轮训练下缺少高层几何约束
附加 REPA 损失 (Hidden Alignment) 5.63 2.91 中间层强行对其约束过死,提升微弱
附加常规感知损失 (Perceptual Loss) 4.28 2.73 实例级成对吸引,提供显式语义对齐
附加漂移损失 (Drifting Loss) 4.86 2.85 分布级排斥,增强全局覆盖度
感知-漂移混合损失 (Hybrid Loss) 4.44 2.44 门控自适应平衡吸引与排斥,多步扩散下最优

关键发现

  • 双流解耦比单纯堆叠参数更有效:V-Co-B/16(260M 参数)在 200 轮训练下即取得 2.52 的 FID,600 轮达到 2.35,以近一半的参数量逼平甚至超越了 459M 参数的 JiT-L/16(2.36);V-Co-H/16(1.9B 参数,300 轮)取得 1.71 FID,超越了训练 600 轮、参数量达 2.0B 的 JiT-G/16(1.82)。
  • 结构化掩码是 CFG 稳定的核心:在双流生成中,传统的输入级置零会导致引导外推方向偏离,放大后产生严重噪点;而通过注意力掩码阻断语义输入,使得无条件分支只依赖图像流自身演化,从机制上消除了条件伪影。
  • 推理端无外部编码器开销:在测试采样时,由于模型已经学会自回归/自去噪式生成语义流或利用内化特征,无需在前向中反复调用大体积的 DINOv2 教师模型。在同等甚至更优的画质下,V-Co-B 的推理吞吐量达到 0.484 images/s,显著高于 JiT-L 的 0.329 images/s。

亮点与洞察

  • 解耦结构与注意力掩码的设计闭环:通过全双流结构与单向结构掩码,将传统的"数据级输入篡改"转化为"网络拓扑级信息阻断",优雅地解决了多条件扩散中无条件外推失真的通用难题。
  • 特征重缩放与时间步偏移的数学等价性:揭示了连续时间流匹配中特征幅度与扩散调度之间的内在信噪比(SNR)映射关系,用简单的 RMS 归一化取代了繁重的多时间步超参搜索。
  • 自适应门控的生成排斥场迁移:首次将面向单步生成的漂移损失与成对感知损失有机融合,通过目标距离门控动态权衡吸引与排斥,为多步生成模型的分布正则化提供了新思路。

局限与展望

  • 训练端外部特征提取开销:尽管推理阶段无需外部编码器,但训练阶段仍需针对每个 Batch 实时提取或预缓存高分辨率图像的 DINOv2 特征,增加了一定的端到端训练 GFLOPs(训练时每样本增加约 35 GFLOPs)。
  • 语义分支模态与教师选择较为单一:当前研究主要以 DINOv2 作为视觉语义表征教师,未进一步验证 CLIP(多模态对齐表征)或文本生成任务下的协同去噪效果。
  • 离散分类与更高分辨率扩展:当前实验集中在 ImageNet-256 类条件生成基准,尚未在更高分辨率(如 512×512 或 1024×1024)以及开放词表文生图(Text-to-Image)场景下进行大尺度验证。

相关工作与启发

  • vs JiT: JiT 坚持纯像素去噪但语义表征监督较弱;V-Co 在 JiT 骨干基础上引入 DINOv2 协同去噪流,不仅补齐了语义结构感知,还证明了全双流架构在同等计算量下较单流放大更有利于生成表征对齐。
  • vs Latent Forcing: Latent Forcing 采用单独的噪声时间表分别调度像素与特征流,流程繁琐且超参敏感;V-Co 理论证明了 RMS 特征重缩放与时间偏移等价,以更简洁统一的单一时间步机制实现了更优的生成质量(FID 2.35 vs 2.48)。
  • vs REPA / PixelGen: REPA 采用强硬的特征回归损失容易在后期束缚模型自由度;PixelGen 仅引入成对感知损失;V-Co 提出感知-漂移混合损失,在实例对齐的基础上补充同类排斥正则,有效规避了模式崩塌与过平滑。

评分

  • 新颖性: ⭐⭐⭐⭐ [系统解构协同去噪机制,提出结构化掩码 CFG、RMS 尺度对齐理论与感知-漂移混合损失]
  • 实验充分度: ⭐⭐⭐⭐⭐ [完备的消融链条覆盖架构、CFG、校准与损失四个维度,并在 ImageNet-256 上提供坚实的主实验与效率数据]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,数学推导清晰自洽,实验分析层层递进]
  • 价值: ⭐⭐⭐⭐⭐ [为去除 VAE 依赖的高性能像素空间扩散模型提供了极具实用价值的表征对齐新范式]