DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models¶
会议: ECCV 2026
论文: ECCV 官方页面
代码: https://diverse-var.github.io/
领域: 图像生成
关键词: 视觉自回归模型, 生成多样性, 潜在尺度回退, 条件退火, 图像生成
一句话总结¶
针对文本引导视觉自回归模型(VAR)在单提示词下生成多样性严重不足的问题,DiverseVAR 通过在推断期对文本嵌入实施条件退火噪声注入,并结合多尺度自动编码器的 Scale-Travel 尺度回退与精炼机制,无需训练即可实现多样性大幅提升与视觉质量的平衡。
研究背景与动机¶
近年来,以下一尺度(Next-Scale)预测为核心范式的视觉自回归(VAR)模型迅速崛起。与传统将图像展平成一维光栅序列的自回归模型相比,VAR 巧妙地将特征图分解为金字塔残差 token 序列,在每个尺度内并行生成并在尺度间自回归推进,既严格遵循因果依赖又保留了二维局部空间先验,在生成速度与视觉保真度上已比肩甚至超越主流扩散模型和流匹配模型。随着此类模型被广泛拓展到大尺度的文本到图像(如 Infinity、Switti)及文本到视频(如 InfinityStar)生成,学术界主要精力一直集中在追求更极致的清晰度与文本对齐度。
然而,强条件信号的过度主导引发了一个隐蔽却严重的缺陷——单提示词生成缺乏多样性(Per-Prompt Diversity Collapse)。对于同一个输入提示词,无论变换何种随机采样种子,现存模型往往生成构图、姿态与语义几近一致的样本。传统在语言模型或光栅生成中常用的手段(例如调节核采样阈值 \(p\)、提高采样温度 \(\tau\) 或简单的无分类器引导 CFG 衰减),在 VAR 的尺度金字塔框架下效果十分有限;盲目增大温度或扰动 token 会迅速引发结构畸变。借鉴扩散模型中扰动条件嵌入的退火思路(CADS),虽然向文本嵌入注入高斯噪声可以有效打破条件束缚并释放多样性,但这会破坏特征图流形分布,导致生成图像充斥严重的伪影、结构残缺与画质坍塌。
面对这一两难困境,核心症结在于:如何在使用噪声打破早期尺度强语义绑定的同时,在后续生成中修复失真伪影。本文切入点正是 VAR 独特的尺度层级特性——浅层尺度粗粒度网格决定全局布局与语义,深层尺度精细网格决定高频细节。核心 idea:构建“先退火扰动、再尺度回退精炼”的两阶段推断框架 DiverseVAR,先通过对文本嵌入注入退火噪声激发宏观多样性,再借助 VAR 原生多尺度编码器将特征图逆向回退至粗粒度尺度(Scale-Travel)并重新解码无噪高分辨率细节,在零额外训练下登顶多样性-质量帕累托前沿。
方法详解¶
整体框架¶
DiverseVAR 是一个完全免训练(Training-free)的推断期算法,专为以多尺度残差预测为核心的 VAR 架构设计。输入为文本提示词对应的条件嵌入 \(c\) 与初始阶段生成的潜变量序列。其核心执行过程由两个串联阶段构成:第一阶段在粗尺度生成过程中对文本嵌入引入基于调度的退火高斯噪声(Condition-Annealing),抑制提示词对早期语义的绝对统治,让模型在宏观构图和物体分布上产生充分的分歧;第二阶段在生成推进至中间尺度 \(l\) 时,利用原生多尺度编码器将当前累积的特征图回退至更早的粗糙尺度 \(m\)(\(m < l\)),丢弃受噪声污染的高频 token,随后在无噪声条件下由粗到细重新自回归生成后续高分辨率尺度,彻底洗净视觉伪影。
整个数据流向如下所示,紧密对齐条件退火、多尺度累积、Scale-Travel 尺度回退与最终无噪精炼阶段:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入文本提示词与随机种子"] --> B["条件退火噪声注入<br/>对文本嵌入加噪衰减"]
B --> C["带噪前向自回归生成<br/>生成至中间尺度 l 形成特征图 Z_l"]
C --> D["Scale-Travel 尺度回退<br/>多尺度编码回退至粗尺度 m"]
D --> E["无噪高分辨率自回归精炼<br/>自尺度 m+1 生成至最终尺度 K"]
E --> F["输出高保真且具高多样性的图像/视频"]
关键设计¶
1. 条件退火噪声注入:打破先验垄断以释放宏观多样性
在标准 VAR 中,文本条件通过交叉注意力(Cross-Attention)矩阵或起始符(<SOS>)嵌入贯穿自回归预测始终。若在所有尺度始终施加精准条件,模型在最初几个残差尺度(如 \(1\times 1\) 或 \(2\times 2\))便会迅速锁定场景主体及朝向。针对该问题,作者系统评估了 CFG 调度、<SOS> 扰动与文本嵌入扰动三种路径,发现针对文本嵌入注入噪声能够最彻底地打破这种模式坍塌。具体机制是在计算前 \(k_{\max}\) 个尺度的自回归交叉注意力时,将条件向量 \(c\) 替换为扰动向量 \(\hat{c}_k\):
$\(\hat{c}_k = \sqrt{1 - \alpha(k)}\, c + \sqrt{\alpha(k)}\, \epsilon, \quad \epsilon \sim \mathcal{N}(0, \mathbf{I})\)$
其中 \(\alpha(k)\) 遵循余弦衰减退火调度,在最粗尺度 \(k=1\) 赋予最高噪声方差,随着尺度 \(k\) 递增逐步衰减至 0。这种扰动让模型在前序生成阶段产生多样的语义原型与多体分布,但由于特征流形发生偏移,若直接任由该过程生成至全分辨率尺度 \(K\),图像会出现局部色块紊乱与结构破碎。
2. Scale-Travel 潜在尺度回退:借助原生多尺度编码修复流形偏移
针对退火噪声导致的严重画质恶化,本文没有引入外部去噪网络或迭代重采样,而是挖掘了 VAR 固有的多尺度自编码逆向机制。在尺度 \(l\)(通常设为 \(l=8\),此时图像的整体粗粒度布局与语义已经固化),模型通过双线性上采样对前 \(l\) 级残差累积求和得到当前合成特征图 \(\mathbf{Z}_l = \sum_{i=1}^l \text{up}(\mathbf{r}_i, \mathbf{s}_K)\)。Scale-Travel 机制直接以 \(\mathbf{Z}_l\) 替代预训练时的真实图像特征,通过 VAR 自带的多尺度编码器重新离散化并向下投影,且仅截取回退目标尺度 \(m\)(\(m < l\))以内的粗粒度 token 序列: $\(\tilde{\mathbf{r}}_k = \mathcal{Q}\left(\text{down}(\mathbf{Z}_l - \mathbf{Z}_{k-1}, \mathbf{s}_k)\right), \quad k = 1, \dots, m\)$ 其中 \(\mathcal{Q}\) 为量化算子,\(\text{down}(\cdot, \mathbf{s}_k)\) 为向目标网格分辨率的双线性下采样。通过丢弃 \(m+1\) 到 \(l\) 级受噪声污染的残差 token 并保留重编码的粗尺度骨架 \(\tilde{\mathbf{r}}_{1:m}\),算法有效实现了特征图在尺度轴上的“时间旅行”,即回退至干净的粗尺度潜在表征。
3. 无噪自回归尺度精炼:无缝衔接高保真细节重建
完成尺度回退后,模型将 \(\tilde{\mathbf{r}}_{1:m}\) 作为已确立的先验因果上下文,在完全关闭条件噪声(即使用原始无扰动文本嵌入 \(c\))的纯净环境下,重新自回归预测 \(k = m+1, \dots, K\) 的高分辨率残差 token 序列: $\(\tilde{\mathbf{r}}_{m+1:K} \sim \prod_{k=m+1}^K p(\mathbf{r}_k \mid \tilde{\mathbf{r}}_1, \dots, \tilde{\mathbf{r}}_m, \mathbf{r}_{m+1}, \dots, \mathbf{r}_{k-1})\)$ 该阶段利用自回归 Transformer 强大的尺度间补全能力,在保留第一阶段所确立的多样化宏观布局(主体姿态、物体相对坐标、构图视角)的基础上,自适应地填补逼真、连贯的高频纹理与边缘细节,从而在单次推断流中巧妙抵消了噪声注入带来的质量惩罚。
损失函数 / 训练策略¶
DiverseVAR 完全工作于推理阶段(Zero-Shot / Training-Free),无需对 VAR 基座模型或多尺度 VQ-VAE 进行任何微调或权重更新。在超参数配置上,通常选取条件退火范围阈值 \(k_{\max} \in \{2, 3, 4, 5, 6\}\),最大噪声幅度 \(\alpha(1) \in \{0.5, 1.0\}\);Scale-Travel 的切入尺度选定为全局语义稳定的 \(l = 8\),回退目标尺度 \(m\) 通常取 4 到 6。
实验关键数据¶
主实验¶
评估在基于两款代表性图像 VAR 模型(Infinity 与 Switti)以及视频 VAR 模型(InfinityStar)上展开。图像评测采用 MJHQ-30K 和 MS-COCO 验证集,评测指标包含多样性指标 LPIPS-MPD(\(MPDL \uparrow\))与 Vendi Score(\(Vendi \uparrow\))、质量与对齐指标 ImageReward(\(IR \uparrow\)),以及综合评价指标 FID(\(FID \downarrow\))。
| 模型配置 | 数据集 | FID \(\downarrow\) | ImageReward (IR) \(\uparrow\) | LPIPS-MPD \(\uparrow\) | Vendi \(\uparrow\) | 备注 |
|---|---|---|---|---|---|---|
| Infinity (Base) | MJHQ-30K | 19.16 | 1.22 | 0.33 | 4.10 | 原始基线,严重缺乏多样性 |
| Infinity + Cond. Anneal. | MJHQ-30K | 15.53 | 0.49 | 0.56 | 7.68 | 仅文本加噪,多样性激增但画质大幅坍塌 |
| Infinity + Scale-Travel (DiverseVAR) | MJHQ-30K | 15.28 | 1.08 | 0.48 | 6.07 | 画质显著回升且多样性较基线提升 45.5% |
| Infinity (Base) | MS-COCO | 37.37 | 1.16 | 0.37 | 4.41 | 原始基线 |
| Infinity + Cond. Anneal. | MS-COCO | 22.51 | 0.39 | 0.58 | 8.13 | 仅加噪,IR 暴跌至 0.39 |
| Infinity + Scale-Travel (DiverseVAR) | MS-COCO | 28.97 | 1.04 | 0.52 | 6.68 | 多样性与图像质量兼得 |
| Switti (Base) | MJHQ-30K | 16.18 | 1.11 | 0.44 | 4.79 | 原始基线 |
| Switti + Cond. Anneal. | MJHQ-30K | 21.34 | 0.63 | 0.58 | 7.34 | 仅加噪,FID 恶化至 21.34 |
| Switti + Scale-Travel (DiverseVAR) | MJHQ-30K | 17.30 | 0.93 | 0.56 | 6.68 | 显著优于纯加噪的质量与多样性权衡 |
数据依据:原论文 Table 1。
在文本生成视频任务中,基于 InfinityStar-8B 在 VBench 上的测试结果如下表所示:
| 模型方案 | VBench Diversity \(\uparrow\) | VBench Quality Score \(\uparrow\) | 说明 |
|---|---|---|---|
| InfinityStar (Base) | 0.270 | 0.806 | 视频帧间与不同种子间重复度高 |
| InfinityStar + Cond. Anneal. | 0.627 | 0.794 | 多样性提升但质量指标受损 |
| InfinityStar + DiverseVAR | 0.487 | 0.804 | 多样性相对基准激增 +80.4%,质量分仅下降 0.002 |
数据依据:原论文 Table 2。
消融实验:不同推断期多样性控制机制对比¶
论文对比了传统的调节温度 \(\tau\)、调节核采样阈值 \(p\) 以及不同 CFG 引导权重 \(\omega\) 下的生成表现:
| 控制策略 | 采样配置参数 | LPIPS-MPD \(\uparrow\) | Vendi \(\uparrow\) | ImageReward (IR) \(\uparrow\) | 核心表现与分析 |
|---|---|---|---|---|---|
| Infinity(调整温度 \(\tau\)) | \(\tau = 0.5\) | 0.284 | 3.500 | 1.305 | 极度保守,多样性最低 |
| Infinity(默认温度) | \(\tau = 1.0\) | 0.334 | 4.031 | 1.323 | 默认基线 |
| Infinity(提高温度) | \(\tau = 5.0\) | 0.414 | 4.813 | 1.108 | 多样性适度提高,画质微降 |
| Infinity(极限高温) | \(\tau = 10.0\) | 0.459 | 4.954 | -0.430 | 采样崩塌,画质全面溃败为负分 |
| DiverseVAR (Ours) | 推荐配置 | 0.470 | 5.833 | 1.216 | 多样性超越极限高温,画质稳健居于 1.2+ 高位 |
| Infinity(核采样 \(p\)) | \(p = 0.90 \to 1.0\) | 0.323 \(\to\) 0.335 | 3.934 \(\to\) 4.071 | 1.320 \(\to\) 1.330 | 改变 \(p\) 对 VAR 多样性几乎无实质影响 |
数据依据:原论文 Table 4 与 Table 5。
关键发现¶
- 退火噪声与尺度回退的共生关系:单独进行条件退火虽能极大地释放潜在多样性(MJHQ 上 MPD 提升近 70%),但导致 ImageReward 由 1.22 暴跌至 0.49;而引入 Scale-Travel 精炼后,ImageReward 回升至 1.08(相比纯加噪提升 +120.4%),同时保留了绝大部分多样性增益。
- 帕累托前沿的全局主导:在跨越不同 CFG 权重(\(\omega \in [2.0, 9.0]\))、不同引导调度策略下,DiverseVAR 均在帕累托曲线上全面包裹传统 CFG 调整与单纯噪声注入方案。
- 常规采样控制失效:核采样对 VAR 多样性改变极其钝感(Vendi 分数仅在 3.9 至 4.0 徘徊),而提高温度一旦超过 2.0,画质便断崖式暴跌(\(\tau=10\) 时 IR 跌至 -0.430),证明了传统自回归采样手段无法解决 VAR 模型的特定瓶颈。
亮点与洞察¶
- 将“时间回溯”巧妙转化为“尺度旅行”:扩散模型在像素去噪路径上回溯步数较为直观,而自回归因果序列通常不可逆。DiverseVAR 洞悉了 VAR 多尺度特征图的连续渐进特性,借助预训练 VQ-VAE 固有的多尺度离散编码过程实现非破坏性的逆向尺度投影,设计极度轻巧而优雅。
- 免训练与即插即用特性:整个流程完全不触碰 Transformer 模型权重,不依赖外部精炼器(Refiner),只需在推理循环中插入少许张量操作与截断解码,极易无缝集成至任意开源 VAR 流水线。
- 与 Prompt Rewriting 具有互补性:LLM 提示词重写虽然能丰富表述,但在提示词本身已极度详尽时改变空间有限;实验证明 DiverseVAR 能与提示词重写叠加使用,提供更宽广的语义创意空间。
局限与展望¶
- 推断计算延迟轻微增加:由于在尺度 \(l\) 处需要调用一次多尺度编码器投影,并重新执行 \(m+1\) 到 \(K\) 尺度的自回归生成步,推断延时较标准 VAR 有所上升。
- 极端扰动下的残存伪影:在追求极致多样性的参数设置下,仍有约 6% 的样本存在局部边缘不协调或瑕疵,未来或可探索自适应尺度回退判定机制(例如由轻量 critic 动态决定回退层数 \(m\))。
相关工作与启发¶
- vs. CADS (Sadat et al., ICLR 2024):CADS 首次在扩散模型中提出条件退火噪声注入;本文将其引入 VAR 架构,并发现 VAR 在遭受噪声冲击时表现出比扩散模型更敏感的伪影坍塌,进而针对性提出了依托 VAR 架构特性的 Scale-Travel 结构化精炼方案。
- vs. 传统 CFG 调度与核采样:传统扩散与 AR 调整策略主要在 logits 或得分空间进行线性插值,对 VAR 的尺度金字塔缺乏针对性;DiverseVAR 作用于跨尺度因果特征图空间,取得了实质性的多样性突破。
评分¶
- 新颖性: ⭐⭐⭐⭐ [首次系统揭示并解决文本引导 VAR 模型的生成多样性坍塌问题,提出了独特的 Scale-Travel 尺度回退机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖图像(Infinity、Switti)与视频(InfinityStar)多个模型及主流榜单,帕累托分析与基线对比完备]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,机制图与算法伪代码清晰易懂,实验论证严谨]
- 价值: ⭐⭐⭐⭐ [无需微调即可显著改善生成式 VAR 模型的实用体验与下游检索采样表现]