FluxLite: Inference-Time Proposal Control for Discrete Diffusion Models¶
会议: NeurIPS2026
arXiv: 2609.35947
领域: 离散扩散模型 / 优化与采样理论
关键词: 提议分布控制、图通量、Feynman–Kac、序贯蒙特卡洛、方差控制
一句话总结¶
FluxLite 在不重训离散扩散模型的前提下,联合调整稀疏跳转速率与补偿权重,以图散度保持目标边缘分布路径不变,并用局部规则 HEU 或小规模非负二次规划 D-VCG 缓解粒子权重退化。
研究背景与动机¶
奖励对齐、温度调整和后验采样都要求把预训练生成分布改成一个倾斜分布,而不是简单增加独立采样次数。 Feynman–Kac 序贯蒙特卡洛(SMC)把这一过程拆成粒子传播与重要性加权:粒子沿提议动力学运动,权重补偿传播没有实现的概率变化。 D-FKC 已经给离散扩散提供了这种校正,但当传播方向与目标倾斜不匹配时,少数粒子吸收大部分权重,增加粒子数也未必增加有效探索。
因此,问题不只是如何更频繁地重采样,而是能否先让粒子移动得更符合目标,再减少必须由权重承担的变化。 连续扩散中的 DriftLite 利用漂移与加权散度之间的等价关系实现这一点;离散扩散却只能沿预训练反向过程允许的有向边跳转,还必须保证每条边的速率非负。 如果把连续向量场控制直接搬过来,容易得到不可执行的新边或负速率。
FluxLite 把控制对象改成图上的概率通量,并区分“保持目标的代数恒等式”和“如何挑选低方差代表的近似优化”。 核心 idea:把目标概率变化在稀疏跳转与残余权重之间重新分配,用精确图散度补偿保证总体目标不变,再用训练免费的局部方差控制改善有限粒子的采样表现。
方法详解¶
整体框架¶
输入是预训练反向跳转速率、奖励或引导势、时间网格以及当前加权粒子;输出是近似终点倾斜分布的加权样本。 反向时间从噪声端走向数据端,通常令奖励逐渐开启;温度指数与奖励共同定义目标路径:
这里 \(Z_t\) 是归一化常数,正文的标准倾斜构造假设 \(\gamma>0\),奖励可采用噪声端为零、数据端达到目标强度的线性 ramp。 算法需要从 \(q_0\) 初始化,不能任意把基模型先验当作倾斜先验;若噪声端分布均匀且奖励尚未开启,两者才一致。 文中的“保持路径”指保持整条时间边缘分布路径,而不是保证受控 CTMC 的随机轨迹联合分布也不变。
每一步先用通量等价补偿构造控制问题,再在 HEU 与 D-VCG 两种替代控制器中选择一种,形成有效速率和残余势。 Algorithm 1 的顺序是构造控制、加权、按 ESS 重采样、传播;没有新的神经网络训练或训练监督分支。 下图表示这一推理数据流,两种控制器并行列出,不能理解为先 HEU 再 D-VCG。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["反向速率、奖励<br/>当前加权粒子"] --> B["通量等价补偿"]
B -->|选择 HEU| C["HEU 局部重分配"]
B -->|选择 D-VCG| D["D-VCG 非负基控制"]
C --> E["有效速率与残余势"]
D --> E
subgraph S["受控 SMC 递推"]
direction TB
F["残余势加权"] --> G["ESS 触发重采样"] --> H["有效速率传播"]
end
E --> F
H -->|下一时间步| A
H --> I["终点加权样本"]
关键设计¶
1. 通量等价补偿:改变粒子移动方式,不改变目标边缘分布
论文采用列源约定:\(Q_t(y,x)\) 表示从源状态 \(x\) 跳到目标状态 \(y\) 的速率。 一条边增加外流,会减少源状态的概率;因此补偿势必须使用“净外流除以当前质量”的图散度,而不是把符号反过来。 对于合法扰动,核心关系是:
新增传播通量与新增势产生的质量变化逐项抵消,故连续时间总体方程仍描述同一个 \(q_t\);散度在 \(q_t\) 下的均值也为零。 恒等式要求在考虑的支持上 \(q_t(x)>0\),并且 \(Q'_t(y,x)\ge0\);实际控制还把边限制在预训练反向图的稀疏支持内。 这里保证的是使用精确目标量时的总体等价,不是“估计密度、离散积分、有限粒子全部无误差”。
为了让不同控制器具有统一起点,作者先把传播全部关闭,得到纯重加权势 \(g_t^0=g_t-\operatorname{div}_{q_t}Q_t\)。 任意候选有效速率的残余势就等于纯重加权势加上该速率的图散度,控制目标是降低其在目标分布下的方差。 在通量变量中,这等价于用 \(1/q_t(x)\) 加权的残余质量平方和,受非负与稀疏约束,属于凸加权最小二乘问题,而非任意修改去噪 logits。
若允许完整有向图,DEN 可以显式把残余势消成零;但这需要全状态密度与稠密跳转,不是大规模离散扩散可直接使用的算法。 PR 则走向另一极端:完全不传播,所有变化都依赖权重,不能创造初始粒子未覆盖的新状态。 这两个极端解释了为何“方差越低”与“有限预算下终点误差越低”并不是同一个优化问题。
2. HEU 局部重分配:只在一跳邻域内搬运源项差异
HEU 从稠密零残余构造提取出一个简单规则:定义源项 \(\mu_t(x)=q_t(x)g_t^0(x)\),只沿合法外向边把通量从较小源项搬向较大源项。 正部截断保证速率非负,局部邻域大小替代全状态数作为归一化,阻尼因子限制搬运强度。 在邻域互为邻居且双向归一化匹配时,这近似把源项替换成阻尼后的邻域平均,压低局部起伏,但不会自动消除邻域之间的差异。
因此 HEU 是一跳启发式,不是稀疏最小二乘的精确解,也没有任意有向图上的全局方差单调下降保证。 mask 扩散可以按外向邻居数,或按外向与入向邻居总数,选择不同强度的归一化。 正文附录给出邻居源项的解析展开,旨在复用已经计算的边速率与密度而不新增 score 网络前向;这依赖所需局部量确实可用。 Ising 实验没有采用 HEU,因为直接用粒子直方图会把绝大多数未访问单翻转邻居的质量误记为零,作者把采用解析展开留作后续实现。
3. D-VCG 非负基控制:把全图优化缩成粒子云上的小二次规划
D-VCG 不逐条优化指数规模的边,而是准备少量非负速率基:保留原始反向速率,并增加通过密度比和奖励差重加权的目标对齐基。 每个基沿用合法图结构,非负系数的组合因而仍是有效速率;控制参数不是模型参数,而是当前时间步的少量系数。 其总体优化写成:
实现时在当前加权粒子上计算各基的散度,中心化后用加权协方差组装二次项,用纯重加权势与散度的协方差组装线性项。 这使系数自动反映“哪一种传播方向最能抵消当前权重变化”,而不是手动固定一个全程引导强度。 无约束问题的最优解满足正规方程 \(A_t\theta=-c_t\);只有协方差矩阵非奇异时才有唯一无约束解,非负约束问题不能简写成直接求逆。
附录实现用活跃集候选枚举、很小的对角 ridge 和候选评分选系数;候选生成与评分的正则项不同,所以是近似求解。 Ising 的联合退火加奖励实验另加随奖励 ramp 增强的目标基锚定惩罚,纯退火与纯奖励实验没有这个惩罚。 其扩展基还包括中间温度基和依赖能量差的通量基;后者改用前向速率前因子,并非严格沿用正文的学习反向速率乘子形式。 图中的“2-basis”“4-basis”是最小版与扩展版的标签,联合引导或退化温度下实际基数会变化,不能把标签当作所有配置的固定基数。
4. 受控 SMC 递推:控制传播与校正权重必须成对使用
得到有效速率后,算法用对应残余势做指数增量加权、归一化,再检查有效样本量(ESS);归一化权重下,ESS 为 \(1/\sum_n w_n^2\)。 若 ESS 与粒子数之比低于阈值,就重采样并重置等权,随后按有效速率传播到下一时间步。 只修改速率而漏掉补偿势,会离开目标等价类;只重采样而不改善传播,也不会解决目标区域探索不足的问题。
理论分析的固定网格递推采用先权重、每步多项分布重采样、再传播的 bootstrap 版本。 实际 CTMC 实验则用中点速率和势,以及半步加权—传播—半步加权的分裂,并按 ESS 自适应做系统重采样;默认阈值为 0.5。 这一区别必须保留:Algorithm 1 是一阶骨架,实验分裂不是逐行照搬骨架,粒子定理也不是对实验自适应闭环的完整担保。
一个完整示例¶
在词表大小为 5、长度为 3 的 mask CTMC 中,状态空间有 216 个状态,终点未遮盖目标只有 125 个状态。 从全 mask 附近初始化后,PR 无论怎样加权都不能凭空得到原粒子云中没有的完整序列,因此这一设置不报告 PR。 D-VCG 则在当前状态的合法揭示边上混合原始反向基与目标对齐基,先根据残余势调整粒子权重,再重采样并让粒子沿受控边揭示 token。 下一步重新估计系数,已经探索到的状态为后续权重校正提供支持;收益来自移动方向和残余权重一起改变,而非增加非法跨状态跳转。 这是论文 benchmark 的机制示例,没有额外假设未报告的单粒子数值。
损失函数 / 训练策略¶
FluxLite 本身不重训模型;Ising 的基模型是用 200,000 个 Swendsen–Wang 样本与去噪 score-entropy 损失预训练的 U-Net。 Theorem 4.1 分析已知前向核、学习局部密度比的总体偏差:训练误差使用 \(\ell(u)=-\log u-1+u\),其中 \(u\) 是估计比值除以真实比值。 它还要求引导势有界、相关比值处于正的有界窗口,并要求倾斜路径在训练边测度下具有有限覆盖因子。 覆盖因子按边的两个端点上的倾斜分布与基分布之比加权后沿时间聚合,不是简单的 score 精度条件;即使训练平均误差小,强倾斜仍可能放大偏差。
Theorem 4.2 只给确定性控制、固定网格、每步 bootstrap 重采样下,相对于同一固定网格总体递推的粒子误差,其粒子数依赖为 \(N^{-1/2}\),常数依赖残余势振幅。 附录的单步权重方差引理说明:在势的大小也受控时,减小残余势方差有助于减小指数权重的方差。 这些结果支持局部控制目标,但不证明最小瞬时方差就是任意有限粒子数下的最优终点质量,也未覆盖同一粒子云估计控制的反馈误差。
实验关键数据¶
主实验¶
小状态 CTMC 使用 4,000 粒子、80 步、10 个种子;统一状态空间为 125,mask 状态空间为 216。 相对 D-FKC,D-VCG 的终点 KL 改善最高为 114.8 倍,指跨种子 KL 比值的几何均值,而不是所有条件都改善 114.8 倍。 KL 用精确目标对加权直方图计算,概率先按 \(10^{-15}\) 截断再归一化;图中误差带基于 log KL 的标准差。
音乐补全用 Lakh 单声部序列,长度 256、词表 129、SEDD 预训练模型。 所有方法匹配 1,024 次函数评估;SGDD 为 32 外循环乘 32 内步,两个 SMC 方法为 128 步乘 8 粒子,因此这里只是 NFE 匹配,不是运行时间匹配。
| 方法 | ρ=40%:Hellinger ↓ | ρ=40%:Meas. Error ↓ | ρ=60%:Hellinger ↓ | ρ=60%:Meas. Error ↓ |
|---|---|---|---|---|
| SGDD | 0.076 | 4.93 | 0.151 | 6.11 |
| D-FKC | 0.033 | 0.29 | 0.081 | 0.88 |
| D-VCG | 0.035 | 0.00 | 0.079 | 0.05 |
表格保留原文 Table 2 的数字与列序。 观察模型把 \(\rho\) 定义为已揭示位置的比例,后文却称其为“masking ratio”;此处按观察模型解释,不能倒置成未揭示比例。 measurement error 定义为已揭示位置上的不匹配比例,但原表没有标明是否以百分数展示,且出现 4.93、6.11,故这里保留原表量级、不擅自加百分号或换算。 D-VCG 的观测一致性最好,但在 \(\rho=40\%\) 的 Hellinger 上,0.035 比 D-FKC 的 0.033 略差,不是所有指标全面领先。
Meissonic 文本到图像实验使用 100 个提示词、4 类风格各 25 个,64 去噪步、8 粒子,CFG 强度为 9。
| 方法 | MPS ↑ | HPSv2 ↑ |
|---|---|---|
| D-FKC | 15.282 ± 0.032 | 0.2980 ± 0.0003 |
| D-VCG | 15.422 ± 0.032 | 0.3033 ± 0.0003 |
这里的 ± 是跨 100 个提示词的标准误,不是标准差;两项是偏好/对齐评价,不是直接计算真实图像分布的距离。 附录的 CFG 参数识别给出 \(\gamma=1-s=-8\),使正文 Proposition 2.1 的带 \(\gamma\) 前因子速率不再合法。 作者另用非负 CFG 速率基构造有效传播;该扩展不能直接援引正文要求正指数的总体稳定性定理。
消融实验¶
下表选取 Ising 的配置分析,而不从图线猜测未经文本报告的绝对误差。 所有改善倍数都是 D-FKC 的行相关 MSE 除以扩展版 D-VCG 的对应 MSE;几何均值与峰值在各行注明的扫描范围内聚合。
| 配置 | 几何均值改善 | 峰值改善 | 扫描与边界 |
|---|---|---|---|
| 纯退火,βtrain=0.4 | 5.33× | 24.5× | βtarget=0.20–0.55;无锚定惩罚 |
| 联合退火与奖励,βtrain=0.4 | 6.77× | 55.4× | βtarget=0.45;βr=0.02–0.40;有锚定惩罚 |
| 纯退火,βtrain=0.3 | 1.69× | 4.84× | βtarget=0.20–0.60;ESS 阈值 0.25 |
| 纯奖励,βtrain=βtarget=0.4 | 5.21× | 17.2× | γ=1;βr=0.02–0.40;无锚定惩罚 |
| 粒子数扫描,βr=0.20 | 15.21× | 34.7× | N=100–5000;峰值在 N=1000 |
Ising 使用 \(16\times16\) 周期格点,目标参考每个配置由 2,000 个 Swendsen–Wang 样本估计,非零外场使用 ghost spin。 行相关 MSE 指生成样本与参考样本的未中心化行相关均值,在间隔 1–13 上的平方误差平均;相关估计排除一格边界,也不减去磁化均值。 Ising 曲线跨 3 个种子取均值,误差带为种子标准差除以 \(\sqrt{3}\);退火用 5,000 步,奖励或联合设置用 2,000 步。
关键发现¶
- 纯奖励去掉联合退火与锚定惩罚后仍改善,说明收益不完全来自额外正则;但联合配置不能被解释成无正则方差目标的单独消融。
- 在测试范围内,增加 D-FKC 粒子数没有消除差距;附录报告 D-FKC 的 5,000 粒子仍比 D-VCG 的 500 粒子差 5.4 倍行相关 MSE。
- 稀疏 D-VCG 有时优于零残余 DEN,说明传播随机性、阻尼和固定离散化也影响终点误差,不否定 DEN 的总体零残余恒等式。
- 单 A100、Ising 的 500 粒子扩展基设置中,D-VCG 每步耗时与 D-FKC 相差约 5% 以内;这不是所有任务或端到端总耗时的普遍保证。
亮点与洞察¶
- 把“改提议分布会不会改变目标”与“该选哪个提议分布”拆开处理:前者靠代数补偿,后者靠近似优化,使算法近似发生在哪里更清楚。
- 非负速率基让合法性成为参数化的结构性质,而非事后截断负速率;少量加权协方差便可把粒子当前需求反馈到传播方向。
- PR 与 DEN 不是简单的弱、强基线排序,而是权重变化与传播变化的两个极端;有限粒子优化需要同时考虑探索覆盖和传播噪声。
局限与展望¶
- 精确恒等式需要正支持与目标局部密度信息;有限粒子直方图不能替代高维邻域密度,HEU 在 Ising 中被省略就是直接例子。
- 控制目标是当前时刻的残余势方差,不直接优化终点 KL、偏好分数或所有观测函数;强引导、稀疏图瓶颈及不充分基库仍可能限制效果。
- Theorem 4.1 不覆盖前向核设定错误、独立学习的任意速率或数值生成器误差;Theorem 4.2 不覆盖 score 误差、时间离散化、自适应 ESS、数值传播及粒子依赖控制。
- joint 模式的锚定惩罚、toy 的阻尼和近似活跃集评分说明实际效果不只来自裸二次目标;后续应分析这些稳定化选择与传播方差的联合影响。
- 真实规模验证目前集中在音乐补全与 100 提示词的图像 CFG,没有直接给出大规模文本推理 benchmark;DLM 推理扩展是方向,不能写成已验证结论。
- 可进一步研究自适应控制的端到端误差、混合离散—连续控制,以及把受控采样器蒸馏成更低延迟的生成过程;这些不属于本文已完成的压缩或蒸馏方法。
相关工作与启发¶
- vs D-FKC:同样采用 Feynman–Kac 校正,FluxLite 进一步在等价类内改变传播速率,并对残余势做同步补偿,针对的是校正后仍存在的权重退化。
- vs DriftLite:共享“控制加散度补偿”的思路,但控制对象从连续漂移变成离散图通量,合法性增加稀疏支持与非负速率约束。
- vs twisted / controlled SMC:同样希望更好的提议降低退化;本文用预训练速率基与在线小优化代替额外训练提议网络,但不保证取得全局最优 twisted proposal。
- vs SGDD:音乐实验中 SGDD 是 split-Gibbs 后验采样基线,D-VCG 改善观测一致性;结果限于相同 NFE 的给定离散逆问题,而非一般 Gibbs 与 SMC 的优劣定理。
- 研究启发:可把新增基的边际收益与协方差条件数结合,动态选择控制基,再单独量化额外探索产生的传播噪声;这是基于本文机制的后续设想,不是作者已验证结果。
评分¶
- 新颖性: 4/5 — 将连续提议控制系统化为带稀疏与非负约束的离散通量等价类。
- 实验充分度: 4/5 — 覆盖精确 CTMC、学习 Ising 与两个真实规模应用,但文本推理与广泛运行时间评估仍缺。
- 写作质量: 4/5 — 证明边界和实现细节充分,基数标签、音乐比例称谓及表格单位需要仔细区分。
- 价值: 4/5 — 提供可复用的训练免费采样控制原则,而非模型参数压缩方法。