跳转至

Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://compvis.github.io/logit-refiner/
领域: 图像生成
关键词: 视觉自回归模型, 尺度内依赖建模, 均值场近似, 图像生成, Logit Refiner

一句话总结

针对视觉自回归模型(VAR)在同尺度内并行独立解码导致的局部空间结构不一致问题,本文提出无需重新训练主干的轻量级 Logit Refiner,仅需在冻结主干特征上串联极浅因果自回归模块即可建模尺度内空间依赖,以不足 5% 的计算开销实现显著生成质量飞跃。

研究背景与动机

近年来以 VAR(Visual Autoregressive Modeling)为代表的下一尺度预测范式在视觉生成领域取得了瞩目成就。通过构建离散 Token 图的多分辨率金字塔,VAR 从粗到细逐尺度生成图像,并在每个尺度内并行解码所有 Token。相比逐像素或逐 Token 的自回归扫描,尺度级自回归将推理步数从数千步压缩至数十步,在兼顾可扩展性的同时极大释放了自回归模型的并行吞吐优势,并被广泛推广至大规模文本到图像生成及多模态统一建模中。

然而,尽管 VAR 的单 Token 边际概率预测十分准确,生成样本中却普遍存在局部的空间不协调与伪影。典型的失效模式包括高频重复却无序的“纹理杂乱”(texture soup)、多个同类实例粘连融合成怪异畸形,以及边缘轮廓的明显断裂。直觉上模型增大可以解决这些缺陷,但实验表明即便将主干参数扩展至 20 亿(2B),上述空间不一致现象依然顽固存在。这一矛盾背后的根源并非主干网络的表征容量不足,而是源自 VAR 固有的采样解码规则:模型在尺度间满足严格自回归条件概率,但在尺度内却将联合概率强制分解为逐 Token 独立分布的乘积——这在数学上构成了一种典型的“均值场”(mean-field-style)近似,完全切断了同一分辨率下相邻 Token 之间的空间关联。

以一个极简的 \(2 \times 2\) 黑白棋盘网格生成任务为例:真实分布仅包含 2 种有效的交替图案,模型在尺度 2 预测每个像素取黑或白的边际概率均为 50%;但由于独立采样无法建模空间依赖,独立采样会生成 \(2^4 = 16\) 种组合,其中 14 种均为非法棋盘。这表明准确的逐点边际概率在独立解码下无法保证联合分布的合理性。核心 idea:保留昂贵主干网络的并行特征计算,通过外挂轻量级因果自回归 Logit Refiner 仅在尺度内做局部序列化采样,以极小参数代价显式补全残差空间依赖,从解码根源打破均值场独立性假设。

方法详解

整体框架

Logit Refiner 针对 VAR 类模型提出了一种分层解耦的生成范式:保持预训练好的 VAR 主干网络完全冻结,主干网络依然以双向注意力单次并行前向输出当前尺度全部 Token 位置的富上下文隐状态向量;随后引入一个仅有 2 层 Transformer Block 的极轻量因果自回归模型,以光栅扫描顺序逐个预测同尺度内的 Token,并将前序已采样的 Token 嵌入作为增量因果上下文。

该设计的精髓在于将沉重的跨尺度全局表征建模与轻量的尺度内局部依赖解耦。主干网络已通过双向注意力充分吸收了前序所有低分辨率尺度的宏观语义与全局布局,因而外挂的 Refiner 无需从头构建全图上下文,仅需捕获均值场独立采样所遗漏的残差空间依赖,从而以极低的额外计算负担消除了独立解码带来的结构畸变。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多尺度离散 Token 输入<br/>已生成尺度序列 r_&lt;k"] --> B["VAR 冻结主干网络<br/>单次前向并行提取当前尺度特征 h^(k)"]
    B --> C["尺度内自回归因子分解<br/>建立同尺度空间上下文依赖链"]
    C --> D["残差依赖建模架构<br/>输入特征拼接与轻量因果 Transformer"]
    D --> E["恒等映射初始化<br/>W_proj 与投影层零初始化保底平滑"]
    E --> F["分层自适应推理策略<br/>早期尺度细化 + KV 缓存加速循环"]
    F --> G["高质量空间一致图像<br/>消除纹理杂乱与结构畸变"]

关键设计

1. 尺度内自回归因子分解:打破均值场独立采样假设

原生 VAR 在尺度 \(k\) 生成 Token 序列 \(\mathbf{r}_k = (r_1^{(k)}, \dots, r_{L_k}^{(k)})\) 时,直接采用完全分解的均值场近似: $\(p_\theta(\mathbf{r}_k \mid \mathbf{r}_{<k}) \approx \prod_{i=1}^{L_k} p_\theta(r_i^{(k)} \mid \mathbf{h}^{(k)})\)$ 这一独立采样策略使得相邻位置即使在拥有完全相容的边际概率时,也会因随机采样的无序组合而拼凑出破损的边缘。针对该痛点,本文在保留跨尺度自回归骨架 \(p(\mathbf{r}_{1:K}) = \prod_{k=1}^K q_\phi(\mathbf{r}_k \mid \mathbf{r}_{<k})\) 的基础上,将尺度内的解码规则替换为严格的自回归联合分布因子分解: $\(q_\phi(\mathbf{r}_k \mid \mathbf{r}_{<k}) = \prod_{i=1}^{L_k} q_\phi\left(r_i^{(k)} \mid r_{<i}^{(k)}, \, \mathbf{h}_{\le i}^{(k)}, \, \mathbf{r}_{<k}\right)\)$ 在空间顺序上采用标准的光栅扫描(左到右、上到下)。该公式在数学上严格泛化了原生 VAR:若 Refiner 忽略尺度内因果历史 \(r_{<i}^{(k)}\),即可精确退化为均值场解码。自回归解码强迫后续 Token 观测到先行生成的邻近 Token,从而在空间邻域内建立强互信息约束,杜绝了独立采样引发的拼贴错位。

2. 残差依赖建模架构:冻结主干特征与因果 Transformer 级联

为避免重新训练主干网络或引入过高的推理延时,Refiner 被设计为仅消费特征的即插即用轻量级模块。对于尺度 \(k\) 的第 \(i\) 个位置,输入向量 \(\mathbf{z}_i^{(k)}\) 由两部分拼接后线性投影构建: $\(\mathbf{z}_i^{(k)} = \mathbf{W}_\text{proj} \left[ \, \mathbf{h}_i^{(k)} \, \parallel \, \mathbf{c}_i^{(k)} \, \right]\)$ 其中 \(\mathbf{h}_i^{(k)} \in \mathbb{R}^w\) 是主干网络并行前向输出的第 \(i\) 位隐藏状态,\(\mathbf{c}_i^{(k)} = \text{emb}_\phi(r_{i-1}^{(k)})\) 是尺度内前一个已采样 Token 的因果上下文嵌入(起始位采用可学习的 \(\mathbf{z}_\text{sos}\))。融合特征经过深度仅为 \(d_r = 2\) 层的轻量因果 Transformer 块处理: $\(\tilde{\mathbf{h}}_i^{(k)} = \text{TransformerBlocks}_\phi\left(\mathbf{z}_{1:i}^{(k)}\right)\)$ 最后通过分类头输出修正后的 logits 并执行分类分布采样:\(\tilde{\boldsymbol{\ell}}_i^{(k)} = \text{head}_\phi(\tilde{\mathbf{h}}_i^{(k)})\)\(r_i^{(k)} \sim \text{Cat}(\text{softmax}(\tilde{\boldsymbol{\ell}}_i^{(k)}))\)。由于主干网络的双向注意力已经提供了高度全局化的语义场,Refiner 仅需用 2 层网络学习细粒度的局部残差依赖,相比主干 \(16 \sim 30\) 层的深度,参数增量仅约 10%。

3. 恒等映射初始化:零扰动热启与残差聚焦优化

直接对附加模块进行随机初始化会导致训练初期 logits 发生剧烈偏移,不仅破坏预训练 VAR 的高质量先验,还会拉长收敛周期。本文设计了精巧的恒等初始化(Identity Initialization)方案:直接复用预训练 VAR 主干的 Token 嵌入层和预测头权重;将输入投影矩阵初始化为 \(\mathbf{W}_\text{proj} \leftarrow [\,\mathbf{I} \parallel \mathbf{0}\,]\),使得前序因果 Token 嵌入在初始步处于屏蔽状态;同时将每个因果 Transformer 块内自注意力与 FFN 的输出投影矩阵全置为零。

在初始状态下,Refiner 输出的 logits 在数值上与未修改的原生 VAR 完全等价,训练 loss 从原生模型的稳态基线平滑起步。优化器无需花费精力重新拟合庞大的 Token 词表空间分布,所有梯度信号全部精准聚焦在自回归残差修正因子的学习上,使模型在短短数小时内即可完成高质量收敛。

4. 分层自适应推理策略:早期尺度聚焦与 KV 缓存加速

尺度内自回归采样固然改善了质量,但逐 Token 循环在最高分辨率下(如 \(16 \times 16 = 256\) 个 Token)可能会引入一定的时延。消融实验揭示了一个极为关键的宏观规律:空间结构的一致性主要取决于低分辨率早期尺度(如 \(1\times 1\)\(8\times 8\)),因为全局物体结构和语义实体是在粗粒度尺度下奠定骨架的;到了高分辨率微细尺度,各区域主要填充高频纹理细节,均值场独立采样的破坏力显著弱化。

基于这一发现,本文提出了分层自适应推理策略:在推理阶段,仅在低分辨率的前几个尺度(如 \(\le 8\times 8\)\(\le 10\times 10\))开启 Refiner 自回归细化,在更高尺度直接沿用 VAR 的并行前向解码,同时结合轻量 KV 缓存技术,成功在保留 88%~99% 的 FID 质量收益的同时削减了 71%~84% 的 Refiner 额外时延开销,构建出极致的质量-吞吐 Pareto 前沿。

损失函数 / 训练策略

在训练阶段,VAR 主干模型参数 \(\theta\) 保持绝对冻结,仅更新 Refiner 模块参数 \(\phi\)。训练采用经典的 Teacher Forcing 机制,在构建因果上下文输入时直接使用 Ground-Truth 真实 Token。得益于标准因果注意力掩码,所有尺度的所有位置可以在一次前向计算中完全并行化,无需进行耗时的序列采样。优化目标为全尺度所有 Token 上的标准交叉熵损失: $\(\mathcal{L}(\phi) = - \sum_{k=1}^K \sum_{i=1}^{L_k} \log q_\phi\left(r_i^{(k)} \mid r_{<i}^{(k)}, \, \mathbf{h}_{\le i}^{(k)}, \, \mathbf{r}_{<k}\right)\)$ 相比基线模型数百个 epoch 的漫长预训练,Refiner 仅需训练 30 个 epoch,基础学习率设为 \(2.5 \times 10^{-5}\)(约为基线 VAR 的四分之一),在单机环境下仅需数十个 GPU 算力时(约 66 H200-h)即可训练完毕。

实验关键数据

主实验

在 Class-Conditional ImageNet \(256 \times 256\) 基准测试上(采用 50k 样本评估 FID、Inception Score、Precision 与 Recall),Logit Refiner 与各尺度 VAR 及其前沿变体进行了系统性对标:

模型架构 参数量 FID↓ IS↑ Precision↑ Recall↑ 相对 VAR 的 FID 变化
VAR-d16 (基线) 310M 3.30 274.4 0.84 0.51 -
MVAR-d16 310M 3.09 285.5 0.85 0.51 -
M-VAR-d16 464M 3.07 294.6 0.84 0.53 -
HMAR-d16 465M 3.01 288.6 0.84 0.55 -
VAR-d16 + Refiner (本文) 356M 2.81 267.2 0.81 0.56 ▼ 0.49
VAR-d20 (基线) 600M 2.57 302.6 0.83 0.56 -
HART-d20 649M 2.39 316.4 - - -
VAR-d20 + Refiner (本文) 671M 2.17 274.7 0.80 0.60 ▼ 0.40
VAR-d24 (基线) 1.0B 2.09 312.9 0.83 0.57 -
HART-d24 1.0B 2.00 331.5 - - -
VAR-d24 + Refiner (本文) 1.1B 1.83 288.2 0.79 0.63 ▼ 0.26
VAR-d30 (基线) 2.0B 1.92 323.1 0.82 0.58 -
HART-d30 2.0B 1.77 330.3 - - -
VAR-d30 + Refiner (本文) 2.2B 1.76 319.4 0.80 0.62 ▼ 0.16
ImageNet 验证集真实样本 - 1.78 - - - -

在更高维度的文本生成图像任务(T2I)中,将 Refiner 应用于 Infinity-2B(\(1024 \times 1024\) 分辨率)模型,在 FLUX-6M 上轻量训练后,HPSv3 人类偏好评分由基线的 9.79 显著提升至 9.91,进一步验证了该机制的通用跨任务迁移能力。

消融实验

为严格解耦“自回归联合建模”与“纯参数容量增加/额外训练轮次”的贡献,作者在 VAR-d16 上设计了对照消融实验:

配置说明 是否联合建模 额外参数量 训练轮次 FID↓ 核心结论
VAR-d16 基线 0 0 3.30 原生均值场采样性能上限
+ 额外纯延长训练 0 30 ep 3.12 纯增加训练量提升极其微弱
+ 并行双向 Refiner (相同结构) +46M 30 ep 3.15 仅堆叠参数且保持独立采样收效甚微
+ 因果 AR Refiner (本文完整方法) +46M 30 ep 2.81 因果自回归联合依赖建模带来绝对增益

下表展示了 Refiner 网络深度 \(d_r\) 与各组件训练策略对质量的影响:

消融维度 具体设置 额外参数 / 训练参数 FID↓ 说明
Refiner 深度 \(d_r\) \(d_r = 0\)(仅前向投影+分类头) +8M 3.02 纯单步线性自回归已见显著效果
\(d_r = 1\) +27M 2.85 浅层因果注意力大幅拉升性能
\(d_r = 2\) (默认设置) +46M 2.81 性能达到饱和与效率最佳平衡点
\(d_r = 4\) +84M 2.82 更深层数未见进一步质量增益
训练组件选择 仅微调头与嵌入(主干与上下文投影冻结) 46M (可训) 2.86 仅学分类头仍有良好泛化表现
冻结主干,全训 Refiner (默认) 46M (可训) 2.81 算力与质量回报率最高(66 H200-h)
主干与 Refiner 全量端到端微调 356M (全训) 2.72 质量微幅提升但算力消耗翻倍(127 H200-h)

关键发现

  • 增益来源于依赖建模而非模型容量:采用同等参数量(46M)但保留双向注意力和独立采样的 Parallel Refiner,FID 仅能达到 3.15,远落后于因果自回归版本(2.81),确凿证明了打破均值场假设、实现尺度内联合采样的必要性。
  • 以小博大超越两倍规模主干:搭载 Refiner 的 VAR-d24(总参数 1.1B)取得 1.83 的 FID,性能直接压倒了参数量为其两倍的原生 VAR-d30(2.0B,FID 1.92),展现出极高的参数使用效率。
  • 多样性与召回率全面拉升:不同于常规技巧以牺牲样本多样性换取保真度,Refiner 在全尺度下将 Recall 指标稳定提升了 0.04~0.06,说明消除空间逻辑硬伤后,模型能够探索更广泛且真实的视觉模式。
  • 早期尺度的决定性支配作用:逐尺度消融表明,移除 \(2 \times 2\) 尺度的 Refiner 导致 FID 恶化最为剧烈(从 2.81 跌至 2.98);而在 \(16 \times 16\) 尺度移除仅微跌至 2.83。这为选择性在前几个尺度运行 Refiner 提供了理论支撑。

亮点与洞察

  • 问题本质的数学洞察精准:敏锐地指出视觉自回归模型的空间伪影不是网络“学不会”,而是被解码阶段强加的独立因果假设“封印”了,将其定性为均值场近似误差,立论极具穿透力。
  • 即插即用的非侵入式残差架构:不需要推倒重训耗资巨大的基础 VAR 或 Infinity 模型,仅用 2 层轻量网络在冻结特征上做微步修正,训练成本仅占基线的 3%~5%,对工业界和开源社区落地极度友好。
  • 恒等映射初始化的工程巧思:通过将投影层设为 \([I \parallel 0]\) 及注意力投影零初始化,使模型从第 0 步就完美平滑继承基线表现,避免了外挂模块冷启动时的特征扰动震荡。

局限与展望

  • 推理延时存在一定程度回升:尽管采用了极浅层数和 KV 缓存,但在最高分辨率尺度进行序列自回归依旧不可避免地增加了推理时间,对于超高并发延迟敏感场景存在一定开销。
  • 自回归扫描顺序仍依赖手工设定:目前仍沿用传统的光栅扫描顺序(Raster-scan),虽然自然但并不一定符合所有图像内部的语义因果依赖,未来可探索内容感知的动态扫描或局部块并行策略。
  • 与非自回归局部修正结合的前景:自回归是消除均值场近似的最直接方式,但未来可以探索扩散去噪(Diffusion Denoising)或掩码迭代生成等非自回归方式来并行修补尺度内局部依赖。

相关工作与启发

  • vs 原生 VAR (Tian et al., 2024):VAR 开创了逐尺度预测范式,但在同尺度内采用独立并行采样;本文为其补上了缺失的尺度内依赖链条,构成了从跨尺度粗粒度自回归到尺度内细粒度自回归的完整联合概率建模。
  • vs M-VAR / MVAR (Ren et al., 2024; Zhang et al., 2026):后者通过解耦空间注意力或引入马尔可夫空间条件来修改主干网络结构;Logit Refiner 则完全无需改动主干,作为外挂组件能够与这类新型主干无缝正交叠加。
  • vs HART / FlowAR (Tang et al., 2024; Ren et al., 2024):这些工作尝试将离散 Token 替换为混合表征或流匹配连续表征;Logit Refiner 证明即使在纯离散尺度自回归框架下,仅修正解码采样逻辑即可触及甚至超越连续生成模型的质量上限。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [准确揭示了 VAR 均值场近似的理论缺陷,提出了极其轻巧优雅的尺度内自回归修正方案]
  • 实验充分度: ⭐⭐⭐⭐⭐ [完备的消融实验、跨越 310M 到 2B 参数量的主干验证、ImageNet 到 T2I 泛化及 Pareto 效率分析,证据确凿]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严丝合缝,从极简棋盘反例到数学公式推导层层递进,动机非常清晰纯粹]
  • 价值: ⭐⭐⭐⭐⭐ [以几乎可以忽略的微小训练代价大幅拔高了视觉自回归模型的质量天花板,具备极高的实用工程价值]