跳转至

Generative Refinement Network for Visual Synthesis

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/bytedance/GRN
领域: 图像生成
关键词: 视觉生成, 离散分词器, 自回归模型, 全局精炼, 层次化二进制量化

一句话总结

GRN 提出了理论上近乎无损的层次化二进制量化(HBQ)分词器以解决离散 token 重建质量差的瓶颈,并构建了类似人类绘画过程的全局精炼机制与熵引导自适应采样策略,在彻底消除自回归误差累积的同时实现高效自适应步数生成。

研究背景与动机

视觉生成领域近年来主要由缩放扩散 Transformer(Diffusion Transformers / Flow-based models)主导。这类连续流模型通过沿着学习到的速度场在固定噪声先验与真实数据分布之间积分,展现出卓越的高保真视觉合成能力。然而,扩散模型以均方误差(MSE)为目标进行优化,缺乏显式的似然估计能力,只能在推理时采用预设的固定步数采样轨迹。这种“一刀切”的计算分配机制无论输入样本的内容复杂与否均消耗完全一致的算力,无法根据生成难度进行动态自适应计算,造成了严重的推理算力浪费。

与此同时,受大语言模型基于 token 级似然建模成功的启发,自回归(Autoregressive, AR)模型在视觉生成中也获得了广泛探索。自回归框架天然具备由多项式似然度量的不确定性感知能力,但一直受到两大核心痛点的钳制:其一,传统离散视觉分词器(如 VQ-VAE、FSQ 等)受制于码本容量与量化误差,在相同隐空间维度下的图像重建质量显著落后于连续 VAE;其二,无论是从左到右逐 token 预测,还是从粗到细逐尺度预测(如 VAR),因果生成机制一旦前步出现采样偏差,后续步骤便在此基础上继续级联放大,导致严重的误差累积。即便像 MaskGIT 这样的非自回归掩码生成模型,一旦将高置信度 token 确定后便永久锁定、无法回溯修改,依然缺乏全局纠错与反思机制。

针对扩散模型计算步数僵化与自回归模型离散损失严重、误差只增不减的根本矛盾,本文提出了一种模拟人类绘画渐进修改过程的新范式。人类作画并非一蹴而就或机械地从上到下填充,而是先勾勒草稿,再全局审视、逐步补充细节并擦除修正早期笔误。核心 idea:通过基于哈尔小波级数原理的层次化二进制量化(HBQ)实现与连续表示等价的近无损离散压缩,并在此离散空间上建立允许反复擦除修正的全局精炼机制与熵引导自适应步数采样,使自回归模型兼具完全纠错能力与复杂度感知的动态算力分配。

方法详解

整体框架

GRN 包含两个核心构成阶段:首先是通过层次化二进制量化(HBQ)构建的因果 3D 离散视觉分词器,用于将图像或视频高维信号无损映射到紧凑的二进制隐空间;其次是在该离散空间上运行的生成式精炼网络(GRN)。

在生成阶段,模型打破了传统自回归模型高置信度 token 一旦生成即永久固定的陈规。生成过程从完全随机采样的初始噪声 token 图开始,每一步精炼状态由当前绘制结果与未填充的随机噪声依据动态选择掩码混合而成。网络通过 Transformer 进行全图预测后,根据当前预测的不确定性(平均熵)动态调整步数与保留比例,允许新填入 token、保留原有预测,并主动擦除早期被证明不合理的预测 token。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["输入图像 / 视频 X"] --> HBQ["层次化二进制量化分词器<br/>tanh激活 + 逐轮二分量化"]
    HBQ --> Init["初始化状态 F_0<br/>100% 随机噪声 token 图"]
    Init --> Transformer["全局精炼网络 Transformer<br/>预测全图下一状态 p(Y_{t+1})"]
    Transformer --> Entropy["熵引导自适应采样<br/>计算全局平均熵并调度保留率 l_t"]
    Entropy --> Update["状态演进更新<br/>填入新 token / 保留稳定 token / 擦除早期错误"]
    Update -->|未达到终止步数| Transformer
    Update -->|达到自适应终止条件| Final["高质量合成离散 token 图"]
    Final --> Decoder["HBQ 3D 解码器重建视觉内容"]

关键设计

1. 层次化二进制量化(HBQ):实现离散分词器指数衰减的近无损压缩

现有离散分词器难以媲美连续 VAE 的根源在于标量码本容量受限,而直接扩展通道维度又会导致生成模型参数暴增与收敛困难。HBQ 受到信号处理中哈尔小波(Haar Wavelet)级数展开的启发,将连续特征量化建模为区间二分查找逼近问题。在 3D 因果 VAE 编码器后接入 \(\tanh(\cdot)\) 激活函数,将连续特征约束在闭区间 \([-1, +1]\)。对于每个通道的连续特征,通过构建中心点序列 \(c_i\) 进行 \(M\) 轮分层二值化划分,获得二进制标签序列 \(\{q_1, q_2, \dots, q_M\} \in \{0, 1\}\)

\[c_i = \sum_{j=1}^{i-1} \frac{\delta[q_j]}{2^j}, \quad q_i = \begin{cases} 0, & \text{if } F \le c_i \\ 1, & \text{if } F > c_i \end{cases}\]

其中 \(\delta[q_j] = 1\)(若 \(q_j = 1\))或 \(-1\)(若 \(q_j = 0\))。在每一轮 \(j\) 中,量化误差界满足 \(e_j < \frac{1}{2^j}\),误差上限随轮数呈指数级衰减。量化后的特征可精确还原为 \(\hat{F} = \sum_{j=1}^M \delta[q_j] \cdot 2^{-j}\) 并送入解码器。这一设计使得离散分词器无需增大隐空间通道数即可实现高达 4 轮至 8 轮的高精度多尺度离散化,在相同通道下彻底抹平了离散分词器相较连续分词器的重建质量差距。

2. 全局精炼机制:支持回溯擦除与全局迭代纠错

传统自回归模型与掩码自回归(MaskGIT)的致命缺陷在于单向累加——已生成的 token 永久不可更改,前期的轻微误判必然在多步生成中演化为灾难性伪影。GRN 将每一步的状态 \(F_t\) 定义为当前绘制图 \(Y_t\)、随机噪声图 \(Y_{\text{rand}}\) 以及二值选择掩码 \(S_t\) 的组合:

\[F_t = S_t \cdot Y_t \oplus \overline{S_t} \cdot Y_{\text{rand}}\]

其中 \(S_t\) 中为 1 的比例 \(l_t\)(累积统计量)在精炼阶段整体单调递增至 100%。在每一步中,\(S_t\) 的生成并非依据单 token 的确定性置信度硬截断,而是通过均匀随机选取;在每一步更新时,先前已经填入的 token 位置完全有可能在下一步重新由 \(Y_{\text{rand}}\) 接管(即主动擦除,Erased token),或者被 Transformer 重新预测更新。该机制赋予了模型如画家改画般的全图纠错能力,随着上下文信息的日益丰富,模型能主动审视并更正早先在信息匮乏时做出的错误推断。

3. 熵引导自适应采样:复杂度感知的动态算力调度

固定采样步数对于结构简单的样本而言造成算力冗余,对高复杂度样本则精炼不充分。GRN 利用离散分类输出天然提供的概率分布特性,以预测分布的信息熵度量当前生成画面的内在复杂度。设第 \(t\) 步时全图预测的平均归一化信息熵为 \(H(Y_t)\)

\[H(Y_t) = -\frac{1}{N \log_2 K} \sum_{i=1}^N \sum_{j=1}^K p(y_{(i,j)} \mid F_{t-1}, \text{cond}) \cdot \log p(y_{(i,j)} \mid F_{t-1}, \text{cond})\]

由于在生成前几步由于高度随机性熵值较不稳定,算法设置了前 \(t_0=5\) 步的平滑热身期。此后,模型根据 \(t_0+1\) 步计算得到的平均熵动态确定精炼累积比例 \(l_t\) 的增长斜率与总步数:当平均熵较低时表明模型对画面结构极度确信,采用更陡峭的增长率并在最少 20 步(或文本生图 10 步)提前收敛退出;当平均熵高时则自适应延长精炼步数至上限 50 步并放缓增长,从而在不损害画质的前提下使全数据集平均推理速度提升 1.25 倍(最高加速达 2.5 倍)。

损失函数 / 训练策略

分词器训练目标综合了 L1 重建损失、LPIPS 感知损失与 PatchGAN 判别器对抗损失:

\[\mathcal{L}_{\text{tokenizer}} = \lambda_{\text{recons}} \mathcal{L}_{\text{recons}} + \lambda_{\text{LPIPS}} \mathcal{L}_{\text{LPIPS}} + \lambda_{\text{GAN}} \mathcal{L}_{\text{GAN}}\]

其中图像分词器权重分别设为 1.0、1.0、0.3,图视联合分词器权重设为 1.0、0.2、0.005,并通过直通估计器(Straight-Through Estimator, STE)反向传播梯度。

生成网络 GRN 的训练则极其简洁:在每次训练迭代中,从均匀分布中随机采样生成比例 \(l_t \in [0, 1]\),将地写真实 token \(Y_{\text{gt}}\)\(N \cdot l_t\) 个位置与随机 token \(Y_{\text{rand}}\)\(N \cdot (1 - l_t)\) 个位置混合构成输入 \(F_t\),目标是预测全部地写 token,采用标准多分类交叉熵损失:

\[\mathcal{L}_{\text{CE}} = - \mathbb{E} \left[ \frac{1}{N} \sum_{i=1}^N \log p(y_i \mid F_t, \text{cond}) \right]\]

支持离散索引预测(\(\text{GRN}_{\text{ind}}\),类别数 \(K=2^M\))和按位二进制预测(\(\text{GRN}_{\text{bit}}\),类别数 \(K=2\))两种目标形式。

实验关键数据

主实验

在 ImageNet \(256 \times 256\) 类别条件图像生成基准评测中,GRN-G 模型以 2B 参数量取得了 1.81 gFID 的顶级生成表现,全面超越同量级的扩散模型 DiT-XL/2(2.27)、流匹配模型 SiT-XL/2(2.06)以及知名自回归模型 VAR-d30(1.92)与 LlamaGen-XXL(2.34)。在分词器重构性能上,HBQ 仅用 4 轮量化(M=4)便实现了 0.56 rFID,大幅击败连续基线 SD-VAE 与其他离散分词器。

任务 / 基准 模型 分词器类型 参数量 核心指标 (FID / rFID / GenEval) 质量指标 (IS / PSNR / LPIPS)
ImageNet 分词器重构 SD-VAE 连续 (C) - rFID: 0.87 PSNR: 24.08 / SSIM: 0.68
ImageNet 分词器重构 VAR 离散 (D) - rFID: 0.85 PSNR: 22.47 / LPIPS: 0.15
ImageNet 分词器重构 LlamaGen 离散 (D) - rFID: 2.19 PSNR: 20.79 / SSIM: 0.68
ImageNet 分词器重构 HBQ (M=4, 本文) 离散 (D) - rFID: 0.56 PSNR: 23.01 / LPIPS: 0.13
ImageNet 256×256 生成 DiT-XL/2 连续 (C) 675M gFID: 2.27 IS: 278.2
ImageNet 256×256 生成 SiT-XL/2 连续 (C) 675M gFID: 2.06 IS: 277.5
ImageNet 256×256 生成 LlamaGen-XXL 离散 (D) 1.4B gFID: 2.34 IS: 253.9
ImageNet 256×256 生成 VAR-d30 离散 (D) 2B gFID: 1.92 IS: 323.1
ImageNet 256×256 生成 GRN-G (本文) 离散 (D) 2B gFID: 1.81 IS: 299.0
GenEval 文本生图 (T2I) SD3 Medium 连续 (C) 2B Overall: 0.62 Two Obj: 0.74 / Color: 0.67
GenEval 文本生图 (T2I) Infinity 离散 (D) 2B Overall: 0.71 Two Obj: 0.85 / Pos: 0.49
GenEval 文本生图 (T2I) GRN (本文) 离散 (D) 2B Overall: 0.76 Two Obj: 0.90 / Pos: 0.52
VBench 文本生视频 (T2V) CogVideoX-5B 连续 (C) 5B Overall: 81.61 Quality: 82.75 / Semantic: 77.04
VBench 文本生视频 (T2V) Lumos-1 离散 (D) 3.6B Overall: 78.30 Quality: 79.50 / Semantic: 73.50
VBench 文本生视频 (T2V) GRN (本文) 离散 (D) 2B Overall: 82.99 Quality: 84.41 / Semantic: 77.35

消融实验

论文系统探究了全局精炼机制(Refine vs. 传统 Mask 固定策略)、预测目标形式(索引 vs. 按位预测)以及熵引导自适应采样对生成性能的影响。

配置 / 消融项 机制说明 CFG / 温度 \(\tau\) FID ↓ IS ↑ / 说明
GRN 全局精炼 (Refine) 允许回溯擦除与持续修改 2.4 / \(\tau=1.23\) 3.63 285.5 (稳定高保真收敛)
传统掩码策略 (Mask) 已生成 token 锁定不可更改 2.4 / \(\tau=1.23\) 185.62 4.3 (相同超参下生成崩溃)
传统掩码策略 (Mask, 最佳搜索) 强行提高 CFG 并大幅降温 8.0 / \(\tau=0.50\) 18.13 220.2 (严重落后于精炼范式)
\(\text{GRN}_{\text{ind}}\)-B (130M) 预测标量分类索引 (\(K=2^M\)) 2.4 / \(\tau=1.33\) 3.56 280.3 (小模型索引预测略占优)
\(\text{GRN}_{\text{bit}}\)-B (130M) 展开通道预测二进制位 (\(K=2\)) 2.4 / \(\tau=1.23\) 3.63 285.5
\(\text{GRN}_{\text{ind}}\)-L (458M) 预测标量分类索引 (\(K=2^M\)) 2.0 / \(\tau=1.30\) 2.64 314.8
\(\text{GRN}_{\text{bit}}\)-L (458M) 展开通道预测二进制位 (\(K=2\)) 1.9 / \(\tau=1.20\) 2.47 287.0 (大模型二进制位预测更强)
固定 50 步采样 (基线) 所有样本分配固定 50 步 - 3.56 相对耗时 1.0×
熵引导自适应采样 依据熵动态调度 20~50 步 - 3.47 平均加速 1.25× (最高 2.5×)

关键发现

  • 全局精炼是避免自回归生成崩溃的决定性基石:消融实验直接证明,若采用 MaskGIT 式的前序 token 刚性锁定策略,在相同解码超参下 FID 发生断崖式崩塌(从 3.63 恶化至 185.62);即便经过网格搜索强行调参,传统掩码固化的 FID(18.13)仍落后全局精炼整整一个数量级。这确凿证实了“允许反悔与纠错”是自回归模型突破误差累积瓶颈的关键。
  • 二进制预测在规模扩展与复杂模态中表现更佳:在小尺度模型(130M)上索引预测略微占优,但当模型扩展到 458M 及以上乃至文本生视频任务时,二进制位预测(Bit Prediction)能提供更细致显式的梯度监督信号,且全局精炼机制有效化解了传统位预测假设各 bit 独立的缺陷,彻底消除了视频中的 token 混叠伪影。
  • 熵引导自适应采样达成质量与效率双赢:在 63,000 张图像采样统计中,超过 97.9% 的图像无需耗尽 50 步即可完成,更有 6.3% 的简单样本在 20 步以极高置信度提前生成。在显著降低平均计算量的同时,动态调度避免了对简单样本的过度精炼噪声干扰,FID 反而由 3.56 进一步提升至 3.47。

亮点与洞察

  • 基于哈尔小波级数思想的 HBQ 量化设计:巧妙将复杂的隐空间特征离散化转化为二分逼近求和序列,使得量化误差随分解轮数严格按指数级 \(1/2^j\) 衰减,在完全不扩展隐空间通道数的前提下抹平了离散分词器与连续分词器多年的质量鸿沟。
  • 推翻“生成即定局”的拟真画家作画范式:不同于前序自回归方法单向不可逆的时空遍历,GRN 将早期预测视作“草图”,允许随时利用后续涌现的丰富上下文擦除重画,以极简统一的训练策略赋予模型强大的全局反思纠错能力。
  • 天然兼容统一多模态大模型的纯离散范式:GRN 证明了离散分词器与离散自回归范式完全有能力在图像与视频生成上比肩乃至超越前沿连续扩散模型,为彻底摆脱 Transfusion 等连续/离散割裂的双流架构、构建端到端全离散自回归多模态基础模型铺平了道路。

局限与展望

  • 计算资源与极端规模验证尚待深入:受算力限制,当前开源模型最大只验证至 2B 参数量,尚未探索类似 FLUX、HunyuanVideo 或 Wan 2.1 这类 10B+ 参数量规模下的涌现能力。
  • 视频生成的细节多样性与特定失真:作者承认当前 T2V 模型在涉及人类动态行为时表现优异,但在复杂自然物理场景与微小高频细节上仍偶有失真,纹理丰富度仍有精进空间。
  • 步数蒸馏与自适应推理的深度融合:未来的重要探索方向是将渐进式蒸馏(Step Distillation)引入精炼机制中,进一步压缩自适应步数区间(如压缩至 4~8 步),以实现兼具毫秒级生成速度与复杂度感知的极端高效合成。

相关工作与启发

  • vs MaskGIT / BERT: MaskGIT 在每一步依据置信度固化选中 token,后续步骤只能填充剩余掩码,前期微小错误被强制继承放大;GRN 的选择掩码采用全局随机更新,每一步允许撤销并重写已生成 token,实现真正的闭环迭代精炼。
  • vs VAR (Visual Autoregressive): VAR 采用尺度自回归(从粗分辨率到细分辨率),虽然具备多尺度渐进结构,但同一尺度内部以及高层尺度一旦决定同样不可修改;GRN 直接在单一分辨率隐空间进行全图并行精炼,消除了多尺度级联带来的层级误差固化问题。
  • vs Continuous Diffusion / Flow Transformers (DiT / SiT / Wan 2.1): 扩散模型依赖连续特征与固定求解器步数,缺乏实例复杂度的感知弹性;GRN 完全基于离散表征与分类交叉熵建模,天然提供信息熵置信度度量,实现了原生、无需外挂强化学习策略网络的自适应步数生成。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出 HBQ 指数衰减离散化与全局擦除重写的生成式精炼范式,从根本上重构了视觉自回归生成逻辑。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖图像重建、类别条件生成、高分辨率文生图与文生视频全链路,消融实验设计严密对比直击核心痛点。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑链路清晰,数学推导与动机阐述严谨自然,图表翔实规范。
  • 价值: ⭐⭐⭐⭐⭐ 为纯离散 token 统一多模态大模型的视觉生成提供了兼顾超高保真度与动态自适应算力的高价值范式。