跳转至

QuanVI: Score-based Variational Inference via Quantum Maximally Mixed States

会议: NeurIPS2026
arXiv: 2609.39164
领域: 优化/理论
关键词: 得分匹配、变分推断、最大混合态、量子张量网络、局部马尔可夫依赖

一句话总结

QuanVI 将 EigenVI 的单特征向量解改成低能子空间上的最大混合态,再用局部量子张量网络压缩密度算子,在链式结构的合成分布上扩展到 100 维,但局部窗口的表达能力和计算代价仍是主要限制。

研究背景与动机

变分推断需要用可计算的分布近似复杂后验。传统方法多最小化 KL 散度或最大化 ELBO;得分型变分推断则比较对数密度的梯度,因此目标的归一化常数不会进入得分。GSM 和 BaM 使用高斯变分族,面对多峰、环形或漏斗几何时表达能力有限。EigenVI 用正交函数展开的振幅平方表示密度,把得分目标化为最小特征值问题,能够超越单高斯,但每维使用 K 个基函数后,展开系数有 K 的 D 次方个,全局算子更有 K 的 2D 次方个元素。

除了存储问题,单特征向量也不是稳定的表示单位:最小特征值若有简并,求解器可以返回该子空间中的不同方向,振幅平方得到的密度也可能随方向改变。近简并时,采样噪声或数值扰动会改变所选方向。仅把系数张量压缩,不能自动解决这种表示不唯一;仅引入混合态,又会留下指数大的密度矩阵。

QuanVI 因而同时改变“解是什么”和“解怎样存储”。它用子空间上的均匀密度算子替代一个方向,并利用链式马尔可夫得分的局部性,使训练不必构造全局矩阵。核心 idea:学习一个低能子空间上的最大混合态,用保持正交约束的局部张量核压缩该子空间,再通过张量收缩实现训练和概率查询,而不是显式求解高维全局特征向量。

方法详解

整体框架

输入是目标分布的得分函数以及各维的正交基函数;论文实验使用 Hermite 基。输出不是图像或扩散模型,而是一个可查询的变分概率密度。每维的基函数向量组成张量积特征,学习的密度算子作用在这个特征空间上。

方法包含四个互相依赖的设计:最大混合态决定变分族,局部得分算子决定训练目标如何分解,量子张量网络决定算子如何紧凑存储,测量收缩决定训练后如何计算密度、边缘分布和条件分布。这里的“量子”指经典计算上的复数张量及正交约束,不要求量子硬件;附录明确所有实验均在 CPU 上运行。

这些设计的核心是算子代数及张量收缩,而不是串行神经网络模块,因此不把矩阵机制硬画成流水线图。训练收缩插入的是目标得分构成的局部损失算子;概率查询收缩插入的是基函数的测量矩阵,两者不能混为同一个输入。

关键设计

1. 最大混合态:用子空间替代不唯一的单个方向

EigenVI 的纯态可写成一个单位向量的外积,其密度是对应振幅的平方。QuanVI 改为学习列正交的复数矩阵 U,每列表示子空间的一条正交方向。对子空间内所有方向赋予相同权重,得到秩为 r、迹为 1 的正半定算子;密度由这个算子与张量积特征夹乘得到。

\[ \rho=\frac{1}{r}UU^{\dagger},\qquad U^{\dagger}U=I_r,\qquad q_{\rho}(x)=\Phi(x)^{\dagger}\rho\Phi(x). \]

这里 U 有 \(K^D\) 行、r 列,\(\Phi(x)\) 是各维正交基向量的张量积。正半定性保证密度非负;基函数正交归一和算子迹为 1 保证密度积分为 1。所谓“最大混合”是所选子空间内的均匀混合,并不是在整个特征空间上默认使用单位矩阵,也不是学习任意一组混合权重。

若将 U 换成同一子空间的另一组正交基,外积和不变,因此不会再依赖某个简并特征向量的选取。这个结论有边界:固定秩 r 的线性迹目标在不受张量网络约束时选择的是最低 r 个特征方向的平均,而不是保证每个方向都对应全局最小特征值。只有 r 与目标简并子空间相匹配、并与更高能级分开时,才能把它理解为稳定地表示整个最低能子空间;近简并及秩选错仍会影响结果。QTN 的受限表达和非凸优化又进一步限制了能否达到该理想解。

另一个需要保留的理论边界是:附录 A.1 推导了实数纯态的 Fisher 目标如何变成二次型,正文随后将这个二次型扩展为混合态的线性迹目标。论文没有在所给全文中证明它等于最终混合密度自身的 Fisher 散度,因此不把二者无条件画等号。

2. 局部得分算子:避免构造指数大的全局矩阵

论文采用沿变量顺序的路径图作为局部性的代表:目标密度由相邻变量的二元因子相乘组成。内部变量的得分只需要左邻、自己和右邻;端点只需要相邻两个变量。把得分残差写入正交基后,每个坐标贡献的算子只作用于相应的局部特征空间,其他位置通过正交积分变成单位算子。

训练时因此逐项收缩局部算子,而不存储完整的 \(K^D\times K^D\) 矩阵。局部项嵌入全空间后相加,仍是正文的全局迹目标;正文第 5 节省略了这种嵌入的记号,不能将局部小矩阵直接当作与全局密度算子同维的矩阵。

这一机制依赖真实的局部得分结构,而不只是“张量网络压缩能力强”。一般稠密依赖图没有自动获得相同的局部算子分解,变量顺序也会影响可压缩性。尤其要区分两种窗口:路径图的内部得分涉及三个变量,而实验默认 L=2 指每个可学习 QTN 核作用于两条线,不意味着目标得分只依赖两个变量。

3. 量子张量网络:把指数依赖留在局部窗口中

QuanVI 用 MPO 风格的链式、滑动窗口张量网络表示 U 及其共轭转置。D 条系统线对应数据维度,E 条辅助线提供混合态的环境自由度;每条线的局部维度是 K。局部张量核具有正交或酉约束,边界使用固定、不可训练的向量闭合收缩,因此训练更新需要保持这些约束,而不能任意修改整个矩阵。

E=0 是纯态版本;正文给出混合态有效秩 \(r=K^E\)。这个等式应结合列正交条件理解:r 不能超过系统特征空间维数 \(K^D\),辅助线不是无限增加有效秩的免费资源。增加 E 同时改变混合自由度和网络核数量,因而 E 的性能变化不能完全归因于“消除简并”。

L 是每个局部核作用的线数,核数量为 \(D+E-L+1\),单核元素数量随 \(K^{2L}\) 增长。论文给出的有效键维数随 \(K^{L-1}\) 增长。这样,固定 K、L 时参数量随 D、E 增长是多项式的;若为了稠密或长程依赖不断增加 L,指数代价依然会回来。

复数张量扩展了局部参数化,不等于使用更高浮点精度。附录的 float 与 cfloat 对比主要改变实数/复数表示;后验实验采用复数双精度,是另一项实验设置,不应将两者混称为精度提升。

4. 测量收缩:同一个密度算子支持不同概率查询

训练后,查询某个坐标值时插入该维基函数向量的外积,查询完整密度时对所有系统线插入这些测量矩阵。若某个变量需要积分消去,就将其测量矩阵换成单位矩阵:这不是近似边缘化,而是利用正交基的积分恒等式,在已学习的变分分布内实现边缘化。

条件分布由联合密度收缩除以观测变量的边缘密度收缩得到,要求分母非零。这里的可查询性不意味着变分近似已经等于真实目标;它只表示对所学 q 的积分和条件化有统一的计算接口。

采样使用链式法则逐维进行:固定已经采出的坐标,将未来坐标换成单位矩阵,得到当前坐标的一维条件密度,再用数值逆 CDF 采样。网络收缩与数值求逆都需要计算,因此可查询并不等于可以常数时间生成一个高维样本。

一个完整示例

采用正文的 D=4、E=1、L=2 设置,并假设每维基函数数为 K,辅助线对应的有效秩是 K。若要计算 \(q(x_2,x_4)\),在第 2、4 条系统线放入对应坐标的测量矩阵,在第 1、3 条线放入单位矩阵,再收缩辅助线及网络核。

若进一步求第 1、3 个变量在 \(x_2=z_2,x_4=z_4\) 下的条件密度,分子固定全部四个坐标,分母只固定第 2、4 个坐标并积分掉第 1、3 个坐标。两次收缩的比值就是条件密度;没有额外训练一个条件模型。

这也解释了为何正交基约束是概率语义的一部分,而不只是优化技巧:没有积分等于单位矩阵的性质,上述“换成单位矩阵”就不再自动等于边缘化。

损失函数 / 训练策略

训练最小化各坐标局部得分项的迹之和。下面用带波浪号的局部项显式表示其嵌入全空间,避免正文省略嵌入后产生维数歧义。

\[ \mathcal{L}(\Theta)=\sum_{d=1}^{D}\operatorname{tr}\!\left(\rho_{\Theta}\widetilde M^{(d)}\right),\qquad \rho_{\Theta}=\frac{1}{r}U_{\Theta}U_{\Theta}^{\dagger}. \]

局部项通过小批量样本估计,再通过 U、局部算子和共轭 U 的收缩评价损失。附录提到 Stiefel 投影和回缩来维持正交约束,但全文没有提供完整优化器伪代码或全部默认超参数,因此不补造具体更新公式。

合成主实验用 K=5、E 取 0 或 2、默认 L=2,训练 2000 步,训练样本量 B=500D。后验实验用 K=5、E 取 0 或 2、B=5000,训练 1000 步,学习率 0.1、动量 0.9、复数双精度。后验还先进行 Stan 无约束变换及含 Jacobian 的密度计算,再用 GSM 或 BaM 拟合的完整协方差作预条件化;参考后验样本不参与预条件器构造。

复杂度应以附录 B.1.1 的详细口径理解。正文简写每步为 \(O(DBK^{2L})\),但附录计入逐个局部项穿过整个网络的直接收缩,得到总训练代价 \(O(TD(B+D+E)K^{O(L)})\)。单点密度查询为 \(O((D+E)K^{O(L)})\),N 个完整顺序样本为 \(O(ND(D+E)K^{O(L)})\);这些表达式仍隐藏收缩顺序和局部布局常数,也未单列逆 CDF 网格精度的代价。

实验关键数据

主实验

合成实验报告五次运行的前向 KL,即 \(\mathrm{KL}(p\|q)\),用目标分布的 \(10^4\) 个样本估计,越低越好。非高斯目标从二维几何开始,再附加非线性马尔可夫链;100 维不等于测试了任意稠密的 100 维后验。下表节选原文表 1,保留可扩展性与失败场景。

维度 / 目标 ADVI EigenVI MoG QuanVI E0 QuanVI E2
5 / X-shape 1.6816 ± 0.0716 0.4007 ± 0.0743 1.3039 ± 0.0269 0.2613 ± 0.0035 0.2661 ± 0.0054
5 / Funnel 2.8012 ± 0.0653 1.3435 ± 0.1065 0.8183 ± 0.0742 4.3944 ± 1.8299 2.6412 ± 0.4579
20 / Ring 8.9786 ± 0.1421 OOM 10.6938 ± 0.3243 9.1621 ± 1.5400 9.0459 ± 1.0407
100 / Gaussian 0.1308 ± 0.0020 OOM 2.2290 ± 0.0119 ≤ 0.01 ≤ 0.01
100 / X-shape 47.2649 ± 0.2927 OOM 72.7630 ± 6.0097 42.2971 ± 1.2528 40.5473 ± 4.0462
100 / GMM3 47.1609 ± 0.2688 OOM 68.3951 ± 7.4535 43.0097 ± 2.3348 43.0798 ± 2.9883
100 / Funnel 48.8944 ± 0.2271 OOM 57.0316 ± 0.4351 46.4010 ± 3.1020 47.0005 ± 3.8384

表 1 将高维 EigenVI 标为 OOM,但附录 C.2.2 说 D>5 的配置被跳过并标为不可行,不能据此断言每个 OOM 单元都实际运行至内存耗尽。低维比较也不是相同基大小:合成 EigenVI 用 K=4,QuanVI 用 K=5。

后验实验的指标是用参考样本估计的前向 Fisher 散度,即在 p 下比较目标与变分分布的得分平方误差,越低越好;它与训练时扩展的迹目标及上表前向 KL 都不是同一个数值尺度。原文表 2 报告四次运行,以下保留相同均值和标准差,所有指标在共同的无约束坐标中计算。

后验 / 维度 ADVI EigenVI QuanVI E0 QuanVI E2
gpregr / 3 1.1509 ± 0.0177 0.0828 ± 0.0681 0.2180 ± 0.0463 0.2330 ± 0.0369
hmm / 4 168.9795 ± 32.6976 4.0295 ± 1.5069 5.0783 ± 0.6214 4.8047 ± 0.4491
hmm_bball_0 / 6 746.7151 ± 2.0978 18.5057 ± 3.0322 13.7126 ± 0.5198 13.4460 ± 0.3597

消融实验

原文表 5 对局部窗口进行五次运行,指标同为前向 KL。以下列出完整窗口序列中的三个代表行;这些消融运行与主表不同,不将 L=2 的数值替换成主表数值。

维度 / 目标 L=1 L=2 L=3 L=4 L=5
5 / X-shape 6.7725 ± 0.0399 0.2645 ± 0.0065 0.2478 ± 0.0050 0.2552 ± 0.0083 0.2460 ± 0.0120
10 / Funnel 18.9833 ± 3.1152 7.9293 ± 1.1948 6.3671 ± 0.4352 4.3833 ± 0.5269 2.8119 ± 0.0503
20 / Funnel 38.5510 ± 5.3004 13.7661 ± 0.5832 11.7725 ± 0.1846 7.0066 ± 0.2342 —

表 6 给出的 Funnel 训练时间说明窗口代价很陡:D=10 时,L=2 约 15 分钟,L=3 超过 12 小时;D=100、L=2 约 5 小时。窗口表中的破折号只表示没有最终 KL,不能自行解读为零、OOM 或数值发散。

图 3 的辅助线消融在 D=10 的 X-shape 上使用更噪的设置:500 步、每步重新采样 B=100、每个 E 五个种子。正文称 E=3 的平均结果最好,但缓存没有图中的完整数值,不补造 E 扫描表。实数/复数消融在 D=5、E=0 的 Funnel 上得到平均 KL 约 5.08 / 3.58,耗时约 1 分 10 秒 / 1 分 30 秒,不能当作所有目标的普遍改进幅度。

关键发现

  • 主要收益是避免全局特征问题的存储瓶颈,不是高维误差接近零:100 维非高斯目标的 KL 仍约为 40–47。
  • 混合态不总优于纯态;100 维 GMM3 和 Funnel 都是 E0 的均值更低。现有实验支持适度辅助自由度有时改善拟合,但没有直接测量简并度或隔离简并稳定性收益。
  • Funnel 更依赖扩大窗口,然而计算代价可从分钟跳到十几小时;“对 D 多项式”不意味着所有容量设置都廉价。
  • NF 不能只按失败案例排除:附录表 3 的 5 维 X-shape 中位 KL 为 0.0319,优于主表 QuanVI 均值,但统计口径不同;它在其他设置存在大量发散运行,因此不做无条件 SOTA 声明。

亮点与洞察

  • 将“选择一个向量”改为“表示一个子空间”,把简并时的基变换不变性直接编码进解的定义。这比事后固定特征向量符号更彻底,但需要明确秩和谱间隙条件。
  • 目标局部性与表示局部性同时使用:前者减少损失算子支持范围,后者减少可学习参数。两者互补,不能用其中一个代替另一个的假设。
  • 基函数正交性连接了归一化与边缘化:同一个单位矩阵替换规则就能实现多种概率查询。可迁移的思想是先设计满足积分恒等式的表示,再构建可计算的推断接口。

局限与展望

  • 作者明确承认局部结构依赖及更大窗口的收缩代价,计划扩展到更丰富的依赖图和自适应张量网络。
  • 高维实验证据主要来自按链构造的合成分布;真实后验仅 3、4、6 维,尚未证明对高维稠密贝叶斯后验同样有效。
  • 辅助线消融同时增加秩和核数量,不能单独识别最大混合态处理简并的因果贡献。更有针对性的实验应控制参数量、已知谱简并及扰动强度。
  • 固定子空间内均匀权重限制了混合谱;自适应秩或非均匀权重值得研究,但会改变当前的最大混合态语义和优化问题。
  • 原文训练复杂度简写与附录详细收缩成本不同,NF 使用中位数而主表使用均值,且方法样本预算不同。应补充统一壁钟/得分调用预算及稳定性统计再比较效率。

相关工作与启发

  • vs EigenVI:两者共享正交函数展开与得分诱导算子;EigenVI 显式求一个最低特征向量,QuanVI 学习受局部 QTN 约束的混合子空间。可扩展性来自避免全局矩阵,代价是非凸训练和窗口容量限制。
  • vs GSM / BaM:高斯族易优化,但难表达非高斯几何;QuanVI 用更丰富的基函数和张量关联表示密度。后验实验又用高斯拟合预条件化,说明两类方法可以互补,而不是完全替代。
  • vs Born 型张量网络:纯态 Born 表示把一个振幅平方变成概率,QuanVI 对多个正交振幅均匀混合。借鉴点是对表示对象的对称性进行建模,而不只是压缩参数。

评分

  • 新颖性: 4/5 — 混合子空间与局部 QTN 的结合有明确动机,但混合密度与 Fisher 目标的等价性仍需澄清。
  • 实验充分度: 3/5 — 合成目标、后验和多项消融较全面,但真实高维后验与直接简并鲁棒性测试不足。
  • 写作质量: 3/5 — 主要机制清楚,复杂度口径、局部算子嵌入和基线不可行标记仍有解释空间。
  • 价值: 4/5 — 对结构化得分型推断及可查询概率表示有参考价值,应用需先检查局部依赖和窗口预算。