Modeling Quantum Neural Network Gradient With Reinforcement Learning¶
会议: NeurIPS2026(主会 poster;依据所提供元数据,未联网核验)
arXiv: 2609.31066v1
OpenReview: https://openreview.net/forum?id=lfrvu8xfsh
代码: https://doi.org/10.5281/zenodo.22956233
领域: 强化学习(PPO 学习量子神经网络优化器)
关键词: 学习型优化器、量子神经网络、贫瘠高原、PPO、谱归一化
一句话总结¶
RLQ-Grad 用带谱归一化的经典 PPO 策略,根据量子神经网络的训练状态产生替代更新信号,在给定分类模拟实验中提高验证准确率并降低额外求导开销,但不证明真实梯度恢复或普遍绕过贫瘠高原。
研究背景与动机¶
量子神经网络(QNN)通常将经典特征编码为量子旋转角,经过可训练电路,再把测量结果交给经典分类头。训练时,反向传播需要保留或重建量子态,参数移位需要反复执行电路;在状态向量模拟中,这些操作随量子比特数增加迅速变贵。另一重困难是贫瘠高原:某些电路与可观测量组合下,损失或其导数在随机参数集合中高度集中,有限测量预算难以分辨有用的优化方向。计算一个导数很贵,与导数本身缺少可辨识信号,是相关但不同的问题。
已有量子强化学习工作会搜索电路结构,或为 QAOA、VQE 等问题学习参数控制器。本文不更改主要实验中的硬件高效 ansatz(HEA),而把监督分类训练过程变成强化学习环境:策略提出量子参数的更新信号,环境执行更新,再用训练损失和准确率反馈。其吸引力是不用在每次量子参数更新时显式求电路导数;代价则是引入一个需要同时训练、依赖奖励信息的经典优化器。因此必须把策略前向、策略训练和仍然存在的 QNN 前向计算分开核算。
核心 idea:把量子参数的解析求导替换为状态条件化的学习型更新规则,用训练效果而非真实梯度标签训练策略,并通过 PPO 与谱归一化稳定这个反馈回路。
方法详解¶
整体框架¶
RLQ-Grad 的输入不是单个分类样本,而是当前优化过程的摘要:量子参数、当前训练批次的损失与准确率、上一步策略产生的更新信号。经典 actor 输出与量子参数等长的连续动作,把它填入这些参数的梯度槽,再由 Adam 执行更新;其余经典层仍按原文算法通过反向传播训练。更新后的 QNN 在训练批次上产生统计量,供奖励计算和下一状态构造使用,critic 则学习评估状态以辅助 PPO。
这个循环包含两种不同的使用方式。联合训练时,要收集状态—动作—奖励轨迹并更新 actor/critic;使用已经学到的优化器继续优化 QNN 时,仍需 QNN 前向统计来构造状态,但不必把每次动作生成都理解成一次 PPO 训练。最终分类推理只使用训练好的 QNN,不需要 PPO 奖励,也不需要优化器 actor。
图中的实线是 QNN 优化时的数据流,虚线是联合训练期间的奖励与策略训练反馈;分类部署与这条优化回路分开。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
I["Training batch + current QNN"] --> A["State-conditioned proposal"]
A --> Q["QNN update + forward statistics"]
Q --> B["Reward feedback"]
B -. "training trajectories" .-> C["PPO + spectral normalization"]
C -. "train actor and critic" .-> A
Q --> O["Trained QNN: classification inference"]
Q -->|"next optimization state"| A
关键设计¶
1. State-conditioned proposal(状态条件提议):学习更新规则,而不是监督拟合真实导数
策略需要知道“目前在哪里”以及“刚才如何移动”,否则只能产生与训练进展无关的随机方向。原文式 (6) 把量子参数、训练批次平均损失、平均准确率和上一步更新信号拼接为状态。下面用批次统计的缩写表示同一结构,其中前一步信号来自 actor,不是要求额外计算一次真实电路梯度。
actor 为经典 MLP,其动作维度等于可训练量子参数数目。当前参数提供位置,损失与准确率提供任务表现,上一动作提供短期优化历史。策略因而可以根据已有交互形成方向选择的经验,而不是像参数移位那样为每个参数反复查询电路。原文把动作称为 surrogate gradient,但没有用真实导数作为拟合目标,也没有证明它是无偏梯度估计器。
原文式 (12) 用如下简化更新解释与解析求导的区别。
实际算法不是只执行这个固定步长公式:它将动作写入量子参数的梯度槽,再交给 Adam 和余弦退火调度器。Adam 的动量及二阶矩会进一步改变实际参数位移。因此“策略输出”“真实导数”和“最终参数变化”是三个不同对象,不能因为动作使用了梯度接口就把它当作损失的导数。
QNN 本体先用 PCA 降维,再通过经典输入全连接层映射到角度,以 Rx 旋转编码;HEA 的每层含单量子比特旋转与纠缠操作,最后测量 Pauli Z,并用输出全连接层映射到类别。量子参数数目为 \(P_{\mathrm{QNN}}=3nL\)。策略主要接管这些量子参数,不能据此声称经典输入层也不再需要通过量子模块传播梯度。原文算法明确保留其他计算图分量的反向传播,这条路径的输入梯度仍可能衰减。
2. Reward feedback(奖励反馈):通过分类效果判断动作,而不是用导数标签监督
一个非零动作不一定是好动作;策略必须从执行后的训练表现知道哪些方向更有用。原文式 (7) 将训练批次的准确率与损失倒数相加,较高准确率和较低损失都能提高奖励。为忠实保留原文定义,下面保留其批次期望形式,不把“损失倒数的均值”擅自改成“平均损失的倒数”。
小常数避免除零,但没有消除小损失附近倒数的敏感性;准确率本身又是离散统计量。两项如何缩放、有限 shots 或噪声会如何影响奖励,都需要另做实验。这里使用的是训练批次奖励,不是把验证集标签作为奖励输入;后文报告的分类指标则是验证准确率。
原文 Algorithm 1 先评估更新后统计量,再用当前时刻参数下标写奖励公式,存在时序下标不够清楚的问题。笔记按“动作执行—评估表现—存储转移”的反馈逻辑解释,但不声称已经从源码核实具体的更新前后奖励实现。初始化也有文字差异:算法写量子参数与上一信号从零开始,其他部分讨论随机初始化,不应自行把这些描述合并为一个已确认设置。
附录 C.1 的合理结构性结论是:真实电路导数的方差界不直接约束一个外部经典策略的输出。其更强的“没有对电路求导,因此统计独立”推断并不成立,因为状态中的参数、损失和准确率均来自电路,策略训练又依赖电路产生的奖励。动作可以与真实导数相关,也可以有很大方差却完全没有下降作用。附录 F.2 和正文局限进一步承认,若损失与奖励差异本身集中,PPO 仍会缺少学习信号;这比“普遍避免贫瘠高原”更准确。
3. PPO + spectral normalization(PPO 与谱归一化):稳定会被自身动作改变的环境
每次参数更新都会改变下一步的 QNN 和奖励分布,长时间保存的旧轨迹可能与当前环境不匹配。作者选择 on-policy PPO 来收集当前策略的轨迹,并以剪切目标限制策略更新幅度;critic 提供价值估计,辅助形成优势信号。本文不是专门提出新的 PPO 损失,相关剪切范围、GAE、熵系数和更新轮数除注明项外沿用 SB3 默认值。
作者并未证明 PPO 在这里比所有其他 agent 准确率更高。附录 D.1 的初步比较中,TD3 和 SAC 比未使用谱归一化的 PPO 更准确;选择 PPO 的理由侧重较小的模型和 rollout 而非大 replay buffer 的资源权衡。PPO 的 on-policy 性也不能自动保证无偏更新方向、全局最优或多项式样本复杂度。
谱归一化作用于选定的策略/价值网络层,用估计的最大奇异值缩放权重,使映射对输入扰动不至于变化过快。原文式 (16) 的写法为:
分母使用 stop-gradient,每次训练更新用一次幂迭代估计谱范数。Algorithm 2 则使用以 1 为下界的归一化版本。附录 D.2 比较 actor 与 critic 的末层同时归一化、只归一化 critic 末层以及不归一化;其解释是 critic 的约束减少 TD 误差放大,actor 的约束进一步稳定更新尺度。这里的稳定作用是机制解释与经验支持,不是收敛定理;谱范数也不必在任意训练轨迹中单调增长。
损失函数 / 训练策略¶
量子分类器以监督损失为目标,PPO 优化累计奖励并训练价值函数,二者不是同一个损失,也没有显式的真实梯度回归项。原文主算法的 Adam 学习率为 1e-3、权重衰减为 1e-4、动量为 (0.9, 0.999),配余弦退火。附录 D.1 另写策略/价值网络采用 SGD、学习率 5e-4;资源分析却计入 actor/critic 的 Adam 状态。两处优化器口径不一致,不能在笔记中悄悄统一。
主分类比较训练 200 epochs,BC 批大小为 128,其他数据集为 256。PCA 以约 95% 累计解释方差选择特征数;BC 使用固定种子划分。每个数据集和电路配置分别训练一个 agent,没有展示跨任务或跨量子比特规模复用的元训练结果。
附录 D.1 只使用一个环境,rollout 长度覆盖整个监督训练步数,给出 BC 为 400、MNIST/F-MNIST 为 46800、CIFAR10 为 39000;策略更新的 minibatch 为 200。这些设置有助于理解“联合训练”的具体工作量,也说明仅写 actor 参数内存并不足以解释 rollout 储存总量。附录 E.3 的 full-pipeline 时间量级按每样本 PPO 更新分析,完整运行还取决于轨迹长度、更新轮数和环境评估次数。
实验关键数据¶
主实验¶
表一取自原文 Table 2,指标为 BC 的 top-1 验证准确率(%),均值 ± 标准差,4 次运行;配置标签同时给出量子参数数目。
| 方法 | 2q1d (6) | 4q2d (24) | 6q3d (54) | 8q4d (96) | 10q5d (150) | 12q6d (216) |
|---|---|---|---|---|---|---|
| Backpropagation | 80.62 ± 10.64 | 90.86 ± 1.998 | 91.88 ± 2.057 | 91.88 ± 1.126 | 91.96 ± 2.402 | 93.15 ± 2.942 |
| Parameter-shift | 85.71 ± 7.082 | 89.77 ± 1.316 | 89.60 ± 5.526 | 89.77 ± 2.010 | 91.99 ± 5.385 | 92.11 ± 5.526 |
| Adjoint differentiation | 83.01 ± 11.64 | 84.93 ± 14.82 | 85.04 ± 3.689 | 87.32 ± 8.476 | 92.75 ± 10.28 | 93.02 ± 8.926 |
| RLQ-Grad | 95.52 ± 0.080 | 95.20 ± 2.379 | 95.79 ± 3.418 | 95.96 ± 0.380 | 96.18 ± 4.178 | 96.58 ± 5.612 |
同一 Table 2 的 12q6d 配置中,MNIST 为 RLQ-Grad 95.27 ± 0.297、Backpropagation 92.48 ± 0.225;F-MNIST 为 87.62 ± 0.181、85.72 ± 0.198;CIFAR10 为 RLQ-Grad 41.15 ± 0.352、最强解析基线 Parameter-shift 40.08 ± 0.321。它们都是验证集结果,不能写成独立留出测试集性能。
表二取自原文 Table 3:更大 CIFAR-10 电路上的 top-1 验证准确率(%),3 次运行的均值 ± 标准差。
| 方法 | 14q7d (294) | 16q8d (384) | 18q9d (486) | 20q10d (600) |
|---|---|---|---|---|
| Backpropagation | 38.72 ± 3.21 | 40.45 ± 2.67 | 39.86 ± 3.48 | 40.13 ± 2.91 |
| CMA-ES | 10.10 ± 0.14 | 10.12 ± 0.21 | 10.11 ± 0.20 | 10.13 ± 0.15 |
| sep-CMA-ES | 10.09 ± 0.23 | 10.14 ± 0.17 | 10.11 ± 0.26 | 10.15 ± 0.19 |
| SPSA | 10.08 ± 0.27 | 10.15 ± 0.18 | 10.11 ± 0.32 | 10.14 ± 0.24 |
| Layerwise | 44.73 ± 3.21 | 48.58 ± 2.74 | 50.92 ± 3.47 | 53.16 ± 3.65 |
| Gaussian Init | 43.92 ± 3.15 | 46.87 ± 2.38 | 49.76 ± 3.02 | 52.41 ± 2.71 |
| RLQ-Grad | 45.86 ± 3.84 | 48.64 ± 2.46 | 51.29 ± 3.16 | 53.02 ± 2.83 |
RLQ-Grad 与专门的高原缓解方案相近,而不是全面超过它们;20q10d 的最高均值属于 Layerwise。误差区间重叠也不支持把很小的均值差异写成显著优势。CMA-ES、sep-CMA-ES、SPSA 在所报告设置下接近随机水平,不能推广为这些方法在所有预算、初始化或电路上必然失败。
消融实验¶
谱归一化的数值比较来自附录 Table 6:未归一化 PPO 与 PPO (SN) 的 BC 为 90.05 ± 4.760、95.52 ± 0.080;MNIST 为 59.52 ± 0.212、61.36 ± 2.216;F-MNIST 为 68.52 ± 0.534、73.64 ± 0.415;CIFAR10 为 25.12 ± 0.961、27.17 ± 0.782。该表同时把参数数目从 5575 改为 11847,MACs 从 5440 改为 10432,因此不是架构完全匹配的纯 SN 消融。Figure 4 的归一化位置比较只作定性证据,不从图像缺失的文本缓存中臆造数值。
表三是附录 Tables 7–8 的资源分析摘录。时间单位为秒/次;RLQ-Grad 包含作者所称的 PPO rollout、actor/critic 更新、梯度缓冲和优化器状态,不能拿 actor-only 时间替代。CPU 为 AMD Ryzen 5 5600G,4 次预热后平均 12 次测量。
| 配置 | Backpropagation 时间 | Parameter-shift 时间 | Adjoint 时间 | RLQ-Grad full 时间 | RLQ-Grad full 内存 |
|---|---|---|---|---|---|
| 2q1d | 0.0042 | 0.0067 | 0.0027 | 0.0455 | 161.22 KB |
| 6q3d | 0.0260 | 0.1333 | 0.0109 | 0.0641 | 306.35 KB |
| 12q6d | 0.1662 | 2.3931 | 0.0569 | 0.0858 | 796.14 KB |
| 14q7d | 0.2719 | 5.2019 | 0.0836 | 0.0842 | 1.02 MB |
| 20q10d | 219.41 | 693.96 | 59.3241 | 0.0881 | 1.95 MB |
关键发现¶
- 小电路存在明确非胜出:2q1d 上 full PPO 比三种解析方法都慢,12q6d 仍慢于 adjoint;14q7d 的 0.0842 与 0.0836 只是近似持平。最大 CPU 比值来自额外优化/求导成本,不表示整个 QNN 训练也有相同比例的加速。
- GPU 比较只有 NVIDIA RTX 3090 上的 Backpropagation 与 RLQ-Grad,平均 15 次;20q10d 为 1457.06 与 1190.83 ms,整个范围加速约 1.03–1.22 倍,不能套用 CPU 上的数千倍比值。
- 原文 Table 1 明确省略共同的 QNN 前向成本,附录 E.1 仍给出状态向量前向的指数依赖。因此经典 actor 的多项式成本不是端到端状态向量模拟的多项式保证。
- 20q10d 的原文内存为 Backpropagation 6174 MB、Parameter-shift 22.55 MB、RLQ-Grad full 1.95 MB;adjoint 的报告值均低于 0.1 MB 测量分辨率。但 adjoint 保持常数个额外缓冲,不等于总状态向量内存为常数。参数移位的较高内存也依赖批处理实现,串行查询并不必然储存每个参数一份状态。
亮点与洞察¶
- 贡献在于换掉“更新信号如何产生”,而不是声称恢复了不可测的真实导数。策略能够编码特定训练过程的经验,这为学习型优化器与量子电路接口提供了一个具体实现。
- 将求导的计算瓶颈与奖励的可辨识性拆开,是理解本文最重要的视角。降低计算成本可以成立,但奖励没有信息时,一个便宜且方差不小的动作仍然未必有用。
- PPO 与 SN 针对的是策略自身训练的稳定性,与改变 QNN 损失景观的层级训练、结构化初始化可以互补。最值得后续检验的是两类方案结合后的准确率、交互预算及总运行成本,而不是只看动作方差。
局限与展望¶
- 理论强度有限:附录 C.1 未求导不推出统计独立,C.2 的经典反向传播不保证策略梯度良态;附录 F.1 用奖励有信息、好局部极小值和通用逼近来声称高效训练的充分性,却未给出 PPO 的样本复杂度或收敛保证。不能据此声称普遍有效更新或多项式训练。
- 奖励集中与坏局部极小值仍在:正文明确承认真正平坦损失下奖励差异消失,以及欠参数化时的局部极小值障碍。F.2 末尾把“条件 2 失败”解释为损失平坦,与此前条件 1/条件 2 的定义不一致;G.1 的过参数化比率带平方根,与前述阈值写法也不一致,笔记不猜改作者条件。
- 输入梯度与证明边界:经典输入层仍可能受量子输入 Jacobian 衰减影响。附录 G.2 的精确 2-design 假设不能由“用了 HEA”自动推出;证明中较紧的二阶矩界没有由所列 trace 界直接得到,交叉矩公式亦需复核,因此不把它当作已核实的任意监督损失定理。
- 资源文字自相矛盾:原文把 12q6d 的 796.14 KB 与 actor-only 102.28 KB 称为约 4 倍,实际比值约 7.8;其 26% + 26% + 52% 合计 104%,不构成自洽内存分解。参数/梯度/优化器状态推导也未充分说明大 rollout buffer 的完整计量边界。
- 实验范围有限:全部是无 shot 噪声的状态向量模拟;四数据集仅扩展到 12 qubits,更大规模仅 CIFAR-10 与资源评估到 20 qubits。没有真实量子硬件、现实噪声信道、跨配置 agent 迁移或独立测试集上的新证据。
- 更严格的后续验收:应提供匹配网络规模的 SN 消融,报告动作与真实梯度的方向一致性及实际下降率,拆分共同前向、rollout、策略更新和峰值内存,并在有限测量预算下检验奖励可辨识性。这些是建议,不是本文已完成的实验。
相关工作与启发¶
- 与解析求导比较:Backpropagation、Parameter-shift、Adjoint differentiation 计算电路导数;RLQ-Grad 学习可被 Adam 消费的替代信号。后者可能便宜,但前者具有导数语义,二者不能只用方差曲线判断谁更正确。
- 与量子结构搜索比较:既有 RL-QAS 工作选择门序列或电路结构,本文保持 HEA 并学习参数更新。其核心方法是 PPO 学习优化器,量子计算是该优化器的应用环境。
- 与学习型优化器比较:Verdon 等的经典网络量子控制器以及 Andrychowicz 等的 learning-to-learn 提供思想背景。本文还不是可跨任务复用的元优化器,其每配置训练成本必须单独交代。
- 与景观缓解方法比较:Layerwise 与 Gaussian Init 改善可训练性,本文减少显式求导依赖。大规模实验支持相近准确率,尚不足以证明三者必然通过完全相同的机制获益。
评分¶
- 新颖性: 4/5;把监督 QNN 的量子更新接口接入 PPO,机制清楚,但沿用了学习型优化器思想。
- 实验充分度: 3/5;覆盖多配置和较强基线,仍受验证集口径、模拟条件与消融混杂限制。
- 写作质量: 2/5;局限讨论有价值,但独立性论证、优化器口径和资源数字存在明显不一致。
- 价值: 3/5;对昂贵电路求导的替代路线有启发,尚不能视为通用贫瘠高原解决方案。