跳转至

Modeling Quantum Neural Network Gradient With Reinforcement Learning

会议: NeurIPS2026(主会 poster;依据所提供元数据,未联网核验)
arXiv: 2609.31066v1
OpenReview: https://openreview.net/forum?id=lfrvu8xfsh
代码: https://doi.org/10.5281/zenodo.22956233
领域: 强化学习(PPO 学习量子神经网络优化器)
关键词: 学习型优化器、量子神经网络、贫瘠高原、PPO、谱归一化

一句话总结

RLQ-Grad 用带谱归一化的经典 PPO 策略,根据量子神经网络的训练状态产生替代更新信号,在给定分类模拟实验中提高验证准确率并降低额外求导开销,但不证明真实梯度恢复或普遍绕过贫瘠高原。

研究背景与动机

量子神经网络(QNN)通常将经典特征编码为量子旋转角,经过可训练电路,再把测量结果交给经典分类头。训练时,反向传播需要保留或重建量子态,参数移位需要反复执行电路;在状态向量模拟中,这些操作随量子比特数增加迅速变贵。另一重困难是贫瘠高原:某些电路与可观测量组合下,损失或其导数在随机参数集合中高度集中,有限测量预算难以分辨有用的优化方向。计算一个导数很贵,与导数本身缺少可辨识信号,是相关但不同的问题。

已有量子强化学习工作会搜索电路结构,或为 QAOA、VQE 等问题学习参数控制器。本文不更改主要实验中的硬件高效 ansatz(HEA),而把监督分类训练过程变成强化学习环境:策略提出量子参数的更新信号,环境执行更新,再用训练损失和准确率反馈。其吸引力是不用在每次量子参数更新时显式求电路导数;代价则是引入一个需要同时训练、依赖奖励信息的经典优化器。因此必须把策略前向、策略训练和仍然存在的 QNN 前向计算分开核算。

核心 idea:把量子参数的解析求导替换为状态条件化的学习型更新规则,用训练效果而非真实梯度标签训练策略,并通过 PPO 与谱归一化稳定这个反馈回路。

方法详解

整体框架

RLQ-Grad 的输入不是单个分类样本,而是当前优化过程的摘要:量子参数、当前训练批次的损失与准确率、上一步策略产生的更新信号。经典 actor 输出与量子参数等长的连续动作,把它填入这些参数的梯度槽,再由 Adam 执行更新;其余经典层仍按原文算法通过反向传播训练。更新后的 QNN 在训练批次上产生统计量,供奖励计算和下一状态构造使用,critic 则学习评估状态以辅助 PPO。

这个循环包含两种不同的使用方式。联合训练时,要收集状态—动作—奖励轨迹并更新 actor/critic;使用已经学到的优化器继续优化 QNN 时,仍需 QNN 前向统计来构造状态,但不必把每次动作生成都理解成一次 PPO 训练。最终分类推理只使用训练好的 QNN,不需要 PPO 奖励,也不需要优化器 actor。

图中的实线是 QNN 优化时的数据流,虚线是联合训练期间的奖励与策略训练反馈;分类部署与这条优化回路分开。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["Training batch + current QNN"] --> A["State-conditioned proposal"]
    A --> Q["QNN update + forward statistics"]
    Q --> B["Reward feedback"]
    B -. "training trajectories" .-> C["PPO + spectral normalization"]
    C -. "train actor and critic" .-> A
    Q --> O["Trained QNN: classification inference"]
    Q -->|"next optimization state"| A

关键设计

1. State-conditioned proposal(状态条件提议):学习更新规则,而不是监督拟合真实导数

策略需要知道“目前在哪里”以及“刚才如何移动”,否则只能产生与训练进展无关的随机方向。原文式 (6) 把量子参数、训练批次平均损失、平均准确率和上一步更新信号拼接为状态。下面用批次统计的缩写表示同一结构,其中前一步信号来自 actor,不是要求额外计算一次真实电路梯度。

\[ s_t=[\theta_t,\ell_t,\mathrm{acc}_t,g_{t-1}]. \]

actor 为经典 MLP,其动作维度等于可训练量子参数数目。当前参数提供位置,损失与准确率提供任务表现,上一动作提供短期优化历史。策略因而可以根据已有交互形成方向选择的经验,而不是像参数移位那样为每个参数反复查询电路。原文把动作称为 surrogate gradient,但没有用真实导数作为拟合目标,也没有证明它是无偏梯度估计器。

原文式 (12) 用如下简化更新解释与解析求导的区别。

\[ \theta_{t+1}=\theta_t-\eta\,g_t,\qquad g_t\sim\pi_\phi(\cdot\mid s_t). \]

实际算法不是只执行这个固定步长公式:它将动作写入量子参数的梯度槽,再交给 Adam 和余弦退火调度器。Adam 的动量及二阶矩会进一步改变实际参数位移。因此“策略输出”“真实导数”和“最终参数变化”是三个不同对象,不能因为动作使用了梯度接口就把它当作损失的导数。

QNN 本体先用 PCA 降维,再通过经典输入全连接层映射到角度,以 Rx 旋转编码;HEA 的每层含单量子比特旋转与纠缠操作,最后测量 Pauli Z,并用输出全连接层映射到类别。量子参数数目为 \(P_{\mathrm{QNN}}=3nL\)。策略主要接管这些量子参数,不能据此声称经典输入层也不再需要通过量子模块传播梯度。原文算法明确保留其他计算图分量的反向传播,这条路径的输入梯度仍可能衰减。

2. Reward feedback(奖励反馈):通过分类效果判断动作,而不是用导数标签监督

一个非零动作不一定是好动作;策略必须从执行后的训练表现知道哪些方向更有用。原文式 (7) 将训练批次的准确率与损失倒数相加,较高准确率和较低损失都能提高奖励。为忠实保留原文定义,下面保留其批次期望形式,不把“损失倒数的均值”擅自改成“平均损失的倒数”。

\[ r_t=\mathbb{E}_{(x,y)\sim\mathcal{B}_t}\left[acc(f(x,\theta_t,\mathbf{W}_t,\mathbf{b}_t),y)+\frac{1}{\mathcal{L}(f(x,\theta_t,\mathbf{W}_t,\mathbf{b}_t),y)+\epsilon}\right]. \]

小常数避免除零,但没有消除小损失附近倒数的敏感性;准确率本身又是离散统计量。两项如何缩放、有限 shots 或噪声会如何影响奖励,都需要另做实验。这里使用的是训练批次奖励,不是把验证集标签作为奖励输入;后文报告的分类指标则是验证准确率。

原文 Algorithm 1 先评估更新后统计量,再用当前时刻参数下标写奖励公式,存在时序下标不够清楚的问题。笔记按“动作执行—评估表现—存储转移”的反馈逻辑解释,但不声称已经从源码核实具体的更新前后奖励实现。初始化也有文字差异:算法写量子参数与上一信号从零开始,其他部分讨论随机初始化,不应自行把这些描述合并为一个已确认设置。

附录 C.1 的合理结构性结论是:真实电路导数的方差界不直接约束一个外部经典策略的输出。其更强的“没有对电路求导,因此统计独立”推断并不成立,因为状态中的参数、损失和准确率均来自电路,策略训练又依赖电路产生的奖励。动作可以与真实导数相关,也可以有很大方差却完全没有下降作用。附录 F.2 和正文局限进一步承认,若损失与奖励差异本身集中,PPO 仍会缺少学习信号;这比“普遍避免贫瘠高原”更准确。

3. PPO + spectral normalization(PPO 与谱归一化):稳定会被自身动作改变的环境

每次参数更新都会改变下一步的 QNN 和奖励分布,长时间保存的旧轨迹可能与当前环境不匹配。作者选择 on-policy PPO 来收集当前策略的轨迹,并以剪切目标限制策略更新幅度;critic 提供价值估计,辅助形成优势信号。本文不是专门提出新的 PPO 损失,相关剪切范围、GAE、熵系数和更新轮数除注明项外沿用 SB3 默认值。

作者并未证明 PPO 在这里比所有其他 agent 准确率更高。附录 D.1 的初步比较中,TD3 和 SAC 比未使用谱归一化的 PPO 更准确;选择 PPO 的理由侧重较小的模型和 rollout 而非大 replay buffer 的资源权衡。PPO 的 on-policy 性也不能自动保证无偏更新方向、全局最优或多项式样本复杂度。

谱归一化作用于选定的策略/价值网络层,用估计的最大奇异值缩放权重,使映射对输入扰动不至于变化过快。原文式 (16) 的写法为:

\[ \hat{W}_i=\frac{W_i}{\rho_i},\qquad\rho_i=\max\bigl(\rho(W_i),k\bigr). \]

分母使用 stop-gradient,每次训练更新用一次幂迭代估计谱范数。Algorithm 2 则使用以 1 为下界的归一化版本。附录 D.2 比较 actor 与 critic 的末层同时归一化、只归一化 critic 末层以及不归一化;其解释是 critic 的约束减少 TD 误差放大,actor 的约束进一步稳定更新尺度。这里的稳定作用是机制解释与经验支持,不是收敛定理;谱范数也不必在任意训练轨迹中单调增长。

损失函数 / 训练策略

量子分类器以监督损失为目标,PPO 优化累计奖励并训练价值函数,二者不是同一个损失,也没有显式的真实梯度回归项。原文主算法的 Adam 学习率为 1e-3、权重衰减为 1e-4、动量为 (0.9, 0.999),配余弦退火。附录 D.1 另写策略/价值网络采用 SGD、学习率 5e-4;资源分析却计入 actor/critic 的 Adam 状态。两处优化器口径不一致,不能在笔记中悄悄统一。

主分类比较训练 200 epochs,BC 批大小为 128,其他数据集为 256。PCA 以约 95% 累计解释方差选择特征数;BC 使用固定种子划分。每个数据集和电路配置分别训练一个 agent,没有展示跨任务或跨量子比特规模复用的元训练结果。

附录 D.1 只使用一个环境,rollout 长度覆盖整个监督训练步数,给出 BC 为 400、MNIST/F-MNIST 为 46800、CIFAR10 为 39000;策略更新的 minibatch 为 200。这些设置有助于理解“联合训练”的具体工作量,也说明仅写 actor 参数内存并不足以解释 rollout 储存总量。附录 E.3 的 full-pipeline 时间量级按每样本 PPO 更新分析,完整运行还取决于轨迹长度、更新轮数和环境评估次数。

实验关键数据

主实验

表一取自原文 Table 2,指标为 BC 的 top-1 验证准确率(%),均值 ± 标准差,4 次运行;配置标签同时给出量子参数数目。

方法 2q1d (6) 4q2d (24) 6q3d (54) 8q4d (96) 10q5d (150) 12q6d (216)
Backpropagation 80.62 ± 10.64 90.86 ± 1.998 91.88 ± 2.057 91.88 ± 1.126 91.96 ± 2.402 93.15 ± 2.942
Parameter-shift 85.71 ± 7.082 89.77 ± 1.316 89.60 ± 5.526 89.77 ± 2.010 91.99 ± 5.385 92.11 ± 5.526
Adjoint differentiation 83.01 ± 11.64 84.93 ± 14.82 85.04 ± 3.689 87.32 ± 8.476 92.75 ± 10.28 93.02 ± 8.926
RLQ-Grad 95.52 ± 0.080 95.20 ± 2.379 95.79 ± 3.418 95.96 ± 0.380 96.18 ± 4.178 96.58 ± 5.612

同一 Table 2 的 12q6d 配置中,MNIST 为 RLQ-Grad 95.27 ± 0.297、Backpropagation 92.48 ± 0.225;F-MNIST 为 87.62 ± 0.181、85.72 ± 0.198;CIFAR10 为 RLQ-Grad 41.15 ± 0.352、最强解析基线 Parameter-shift 40.08 ± 0.321。它们都是验证集结果,不能写成独立留出测试集性能。

表二取自原文 Table 3:更大 CIFAR-10 电路上的 top-1 验证准确率(%),3 次运行的均值 ± 标准差。

方法 14q7d (294) 16q8d (384) 18q9d (486) 20q10d (600)
Backpropagation 38.72 ± 3.21 40.45 ± 2.67 39.86 ± 3.48 40.13 ± 2.91
CMA-ES 10.10 ± 0.14 10.12 ± 0.21 10.11 ± 0.20 10.13 ± 0.15
sep-CMA-ES 10.09 ± 0.23 10.14 ± 0.17 10.11 ± 0.26 10.15 ± 0.19
SPSA 10.08 ± 0.27 10.15 ± 0.18 10.11 ± 0.32 10.14 ± 0.24
Layerwise 44.73 ± 3.21 48.58 ± 2.74 50.92 ± 3.47 53.16 ± 3.65
Gaussian Init 43.92 ± 3.15 46.87 ± 2.38 49.76 ± 3.02 52.41 ± 2.71
RLQ-Grad 45.86 ± 3.84 48.64 ± 2.46 51.29 ± 3.16 53.02 ± 2.83

RLQ-Grad 与专门的高原缓解方案相近,而不是全面超过它们;20q10d 的最高均值属于 Layerwise。误差区间重叠也不支持把很小的均值差异写成显著优势。CMA-ES、sep-CMA-ES、SPSA 在所报告设置下接近随机水平,不能推广为这些方法在所有预算、初始化或电路上必然失败。

消融实验

谱归一化的数值比较来自附录 Table 6:未归一化 PPO 与 PPO (SN) 的 BC 为 90.05 ± 4.760、95.52 ± 0.080;MNIST 为 59.52 ± 0.212、61.36 ± 2.216;F-MNIST 为 68.52 ± 0.534、73.64 ± 0.415;CIFAR10 为 25.12 ± 0.961、27.17 ± 0.782。该表同时把参数数目从 5575 改为 11847,MACs 从 5440 改为 10432,因此不是架构完全匹配的纯 SN 消融。Figure 4 的归一化位置比较只作定性证据,不从图像缺失的文本缓存中臆造数值。

表三是附录 Tables 7–8 的资源分析摘录。时间单位为秒/次;RLQ-Grad 包含作者所称的 PPO rollout、actor/critic 更新、梯度缓冲和优化器状态,不能拿 actor-only 时间替代。CPU 为 AMD Ryzen 5 5600G,4 次预热后平均 12 次测量。

配置 Backpropagation 时间 Parameter-shift 时间 Adjoint 时间 RLQ-Grad full 时间 RLQ-Grad full 内存
2q1d 0.0042 0.0067 0.0027 0.0455 161.22 KB
6q3d 0.0260 0.1333 0.0109 0.0641 306.35 KB
12q6d 0.1662 2.3931 0.0569 0.0858 796.14 KB
14q7d 0.2719 5.2019 0.0836 0.0842 1.02 MB
20q10d 219.41 693.96 59.3241 0.0881 1.95 MB

关键发现

  • 小电路存在明确非胜出:2q1d 上 full PPO 比三种解析方法都慢,12q6d 仍慢于 adjoint;14q7d 的 0.0842 与 0.0836 只是近似持平。最大 CPU 比值来自额外优化/求导成本,不表示整个 QNN 训练也有相同比例的加速。
  • GPU 比较只有 NVIDIA RTX 3090 上的 Backpropagation 与 RLQ-Grad,平均 15 次;20q10d 为 1457.06 与 1190.83 ms,整个范围加速约 1.03–1.22 倍,不能套用 CPU 上的数千倍比值。
  • 原文 Table 1 明确省略共同的 QNN 前向成本,附录 E.1 仍给出状态向量前向的指数依赖。因此经典 actor 的多项式成本不是端到端状态向量模拟的多项式保证。
  • 20q10d 的原文内存为 Backpropagation 6174 MB、Parameter-shift 22.55 MB、RLQ-Grad full 1.95 MB;adjoint 的报告值均低于 0.1 MB 测量分辨率。但 adjoint 保持常数个额外缓冲,不等于总状态向量内存为常数。参数移位的较高内存也依赖批处理实现,串行查询并不必然储存每个参数一份状态。

亮点与洞察

  • 贡献在于换掉“更新信号如何产生”,而不是声称恢复了不可测的真实导数。策略能够编码特定训练过程的经验,这为学习型优化器与量子电路接口提供了一个具体实现。
  • 将求导的计算瓶颈与奖励的可辨识性拆开,是理解本文最重要的视角。降低计算成本可以成立,但奖励没有信息时,一个便宜且方差不小的动作仍然未必有用。
  • PPO 与 SN 针对的是策略自身训练的稳定性,与改变 QNN 损失景观的层级训练、结构化初始化可以互补。最值得后续检验的是两类方案结合后的准确率、交互预算及总运行成本,而不是只看动作方差。

局限与展望

  • 理论强度有限:附录 C.1 未求导不推出统计独立,C.2 的经典反向传播不保证策略梯度良态;附录 F.1 用奖励有信息、好局部极小值和通用逼近来声称高效训练的充分性,却未给出 PPO 的样本复杂度或收敛保证。不能据此声称普遍有效更新或多项式训练。
  • 奖励集中与坏局部极小值仍在:正文明确承认真正平坦损失下奖励差异消失,以及欠参数化时的局部极小值障碍。F.2 末尾把“条件 2 失败”解释为损失平坦,与此前条件 1/条件 2 的定义不一致;G.1 的过参数化比率带平方根,与前述阈值写法也不一致,笔记不猜改作者条件。
  • 输入梯度与证明边界:经典输入层仍可能受量子输入 Jacobian 衰减影响。附录 G.2 的精确 2-design 假设不能由“用了 HEA”自动推出;证明中较紧的二阶矩界没有由所列 trace 界直接得到,交叉矩公式亦需复核,因此不把它当作已核实的任意监督损失定理。
  • 资源文字自相矛盾:原文把 12q6d 的 796.14 KB 与 actor-only 102.28 KB 称为约 4 倍,实际比值约 7.8;其 26% + 26% + 52% 合计 104%,不构成自洽内存分解。参数/梯度/优化器状态推导也未充分说明大 rollout buffer 的完整计量边界。
  • 实验范围有限:全部是无 shot 噪声的状态向量模拟;四数据集仅扩展到 12 qubits,更大规模仅 CIFAR-10 与资源评估到 20 qubits。没有真实量子硬件、现实噪声信道、跨配置 agent 迁移或独立测试集上的新证据。
  • 更严格的后续验收:应提供匹配网络规模的 SN 消融,报告动作与真实梯度的方向一致性及实际下降率,拆分共同前向、rollout、策略更新和峰值内存,并在有限测量预算下检验奖励可辨识性。这些是建议,不是本文已完成的实验。

相关工作与启发

  • 与解析求导比较:Backpropagation、Parameter-shift、Adjoint differentiation 计算电路导数;RLQ-Grad 学习可被 Adam 消费的替代信号。后者可能便宜,但前者具有导数语义,二者不能只用方差曲线判断谁更正确。
  • 与量子结构搜索比较:既有 RL-QAS 工作选择门序列或电路结构,本文保持 HEA 并学习参数更新。其核心方法是 PPO 学习优化器,量子计算是该优化器的应用环境。
  • 与学习型优化器比较:Verdon 等的经典网络量子控制器以及 Andrychowicz 等的 learning-to-learn 提供思想背景。本文还不是可跨任务复用的元优化器,其每配置训练成本必须单独交代。
  • 与景观缓解方法比较:Layerwise 与 Gaussian Init 改善可训练性,本文减少显式求导依赖。大规模实验支持相近准确率,尚不足以证明三者必然通过完全相同的机制获益。

评分

  • 新颖性: 4/5;把监督 QNN 的量子更新接口接入 PPO,机制清楚,但沿用了学习型优化器思想。
  • 实验充分度: 3/5;覆盖多配置和较强基线,仍受验证集口径、模拟条件与消融混杂限制。
  • 写作质量: 2/5;局限讨论有价值,但独立性论证、优化器口径和资源数字存在明显不一致。
  • 价值: 3/5;对昂贵电路求导的替代路线有启发,尚不能视为通用贫瘠高原解决方案。