跳转至

Replay-buffer engineering for noise-aware quantum circuit optimization

会议: NeurIPS2026(任务清单归属;全文为 arXiv v2)
arXiv: 2604.21863
领域: 强化学习
关键词: 经验回放、可靠性感知采样、量子架构搜索、摊销评估、无噪声到有噪声迁移

一句话总结

本文把量子电路优化的瓶颈从“换一个智能体”转向“更有效地复用经验”:以退火可靠性回放提高样本效率、以分块评估减少量子—经典调用、以仅迁移回放缓存加速噪声适应,但不同任务的精度、门数和收敛速度优势并不统一。

研究背景与动机

量子编译需要把目标酉变换近似成有限门集组成的电路,量子架构搜索则需要找到能制备低能量态的参数化电路。强化学习可以把门放置视为连续决策,但一次动作的成本远高于普通离散环境:架构搜索通常还要运行 COBYLA 优化连续角度,再通过量子模拟计算哈密顿量期望值。电路越大,每一步完整评估越昂贵;在噪声下,还必须限制特别容易积累误差的双量子比特门。

已有经验回放也有两种相反的偏差。优先经验回放(PER)强调大时序差分(TD)误差,却不能区分“有学习价值的纠错”与“下游目标不可靠导致的误差”;可靠性调整回放(ReaPER)用同一轨迹后续的 TD 误差折减优先级,却在价值网络尚未成熟时可能过早相信不稳定的可靠性估计。另外,无噪声模拟中已经探索出的电路在转向噪声环境时往往被丢弃,导致昂贵搜索从头开始。

本文沿用 DQN/DDQN 和已有电路表示,改的是经验如何采样、一次反馈覆盖多少次架构编辑,以及经验如何跨噪声条件复用。这三个问题彼此相关,但实验分别检验,尤其迁移实验使用均匀回放,不能把它的收益全部归给退火采样。核心 idea:让回放从早期强调 TD 误差逐渐转向可信目标,同时降低反馈评估频率,并把无噪声轨迹作为噪声学习的缓存初始化,而不是直接继承源策略权重。

方法详解

整体框架

输入是目标酉变换或分子/自旋系统的哈密顿量,输出是达到目标保真度或能量误差要求的电路。智能体观察当前电路状态,选择门动作,环境返回评估结果并把转移存入缓存;训练从缓存采样,而部署电路本身不需要回放缓存。

三个贡献不是所有实验都必须串联的单一模型。“退火可靠性回放”改训练采样;“摊销架构评估”只针对昂贵的架构搜索环境;“仅缓存迁移”在源任务训练后开启对应噪声任务。下面按先获得源经验、再迁移到目标任务的顺序画出它们的关系,虚线表示训练监督或缓存复用,不表示电路推理数据流。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["目标与当前电路"] --> B["智能体门动作"]
    B --> C["摊销架构评估"]
    C --> D["转移缓存"]
    D --> E["退火可靠性回放"]
    E -. "TD训练监督" .-> B
    D -. "源任务结束后复制" .-> F["仅缓存迁移"]
    F -. "初始化目标缓存" .-> G["噪声目标训练"]
    G --> H["优化后的电路"]

编译任务的观察来自当前酉矩阵与目标之间的残差酉矩阵实部、虚部。单量子比特小旋转动作使用绕 X/Y/Z 轴的正负 \(\pi/128\) 旋转,另有 HRC 离散门集实验;双量子比特实验包含局部 Z 旋转及 XX/YY 旋转。QAS 则用张量记录门的层位与连线,并携带成本摘要;常用门集是 RX、RY、RZ 和 CNOT,非法动作被屏蔽。

附录 Q 进一步说明,实际编码动作可以同时包含一个双量子比特门与一个单量子比特旋转,所以“环境步数”不应直接等同于“总门数”。Heisenberg 实验改用 RXX/RYY/RZZ 等门,并用整数标签合并多种连线类型;这属于任务表示差异,不是退火采样本身的创新。

关键设计

1. 摊销架构评估:让一次昂贵反馈覆盖多次电路编辑

标准 CRLQAS 每放一次门就优化角度并计算能量。OptCRLQAS 连续积累 \(m\) 次架构编辑后才做完整评估,若回合提前结束则强制补做末次评估,因此长度为 \(T\) 的回合约从 \(T\) 次昂贵调用降到 \(\lceil T/m\rceil\) 次。节省的是环境评估,不是把网络更新也无条件降低到原来的十分之一。

两次评估之间,电路结构继续更新,状态中的成本摘要保持上次评估值。作者的文字说明是中间积累步给予零改善奖励,评估步才给予非平凡反馈;终止时必须用真实最终能量结算,避免智能体利用过期缓存逃避失败惩罚。这也改变信用分配:连续几个门共同改变了结构,奖励不再追逐容易被角度优化抵消的单门差异。

不过附录 J.1 的式 (53) 使用相邻两次评估的成本差,其分子并不因“两个成本在块内固定”就必然为零,与随后“中间奖励为零”的解释冲突。本文笔记按作者明确的文字意图描述流程,不把该式当作已无歧义的可复现实现。主文默认 \(m=10\),但附录 P 和表 19 的 12-qubit 配置为 \(m=15\),具体实验间隔须分别核对。

2. 退火可靠性回放:先利用大误差,再逐步信任下游目标

TD 误差衡量当前 Q 估计与自举目标之间的差距,但大误差不一定意味着目标正确。ReaPER 对一条回合中的转移定义可靠性:后续转移占据的绝对 TD 误差越大,当前目标就越值得怀疑。若回合共有 \(n\) 个转移,其理想化定义与本文采样机制是:

\[ \mathcal{R}_t=1-\frac{\sum_{i=t+1}^{n}|\delta_i|}{\sum_{i=1}^{n}|\delta_i|},\qquad \Psi_t^{(+,\tau)}=\mathcal{R}_t^{\omega_\tau}|\delta_t|^\alpha,\qquad \mu_t^{(+,\tau)}=\frac{\Psi_t^{(+,\tau)}}{\sum_j\Psi_j^{(+,\tau)}}. \]

这里 \(\alpha\) 控制 TD 优先化强度,\(\omega_\tau\) 控制可靠性的影响。\(\omega=0\) 回到 PER;\(\omega=1\) 是完全可靠性调整,固定 ReaPER 也可以使用中间指数,并非只能取 1。本文让指数线性上升,主文配置从 0.1 升到 0.7,达到退火时间后保持不变,而不是最终完全转为 \(\omega=1\)。

\[ \omega_\tau=\omega_{\min}+(\omega_{\max}-\omega_{\min})\min\!\left(\frac{\tau}{T_{\mathrm{ann}}},1\right). \]

早期 Q 网络接近随机,可靠性只是噪声代理,因此保留 PER 式纠错;后期价值估计更成熟,再压低大误差但下游不可信的样本。主文与表 20 给编译 \(T_{\mathrm{ann}}=5\times10^5\) 步,LunarLander 为 \(5\times10^4\) 步,并提出取总训练预算一半的规则;这些单位是步,不是编译的训练回合数。附录 N.2 却把 0.2、0.7、20000 列为扫参最佳组合,随后又称 0.1、0.7 为所选配置,不能把这些版本悄悄合成一套参数。

实现也不是每次更新都精确重算全回合后缀。附录 D.2 的 SumTree 先按最大树优先级插入新样本,用 \(\max(|r_t|,0.1)\) 初始化误差代理;回合结束时计算可靠性,后续更新则用“回合误差总和减去本样本误差”近似后缀和。该近似丢失了严格的时序后缀含义,应与上面的理想定义区分。总误差极小时有回退分支,优先级还加 \(10^{-6}\) 的数值稳定项。

理论边界同样重要。定理 D.1 研究固定数据集上的表格型 Q-learning,依赖有界量、正可靠性下界、可靠性—方差对齐与单调似然比(MLR)条件;作者未在实际缓存中验证后两项。理论使用完全重要性修正,而实现用逐渐升至 1 的 \(\beta\)。因此论文给出的是条件性的噪声底降低论证,不是深度网络、任意环境或任意退火计划的无条件收敛保证。

3. 仅缓存迁移:保留源经验,但重新学习噪声任务价值

先在无噪声环境训练,再把整个源缓存复制为对应噪声任务的初始缓存。复制的是状态、动作、源奖励、下一状态和终止标记,不过滤、不重新标注奖励,也不转移 Q 网络权重。源与目标的状态和动作接口相同,是数据可被读入的前提;这并不意味着源奖励就是目标奖励,旧转移仍带着源环境偏差。

新目标网络通过这些经验获得较好的早期覆盖,随后加入噪声环境真实转移,逐步替代旧经验。论文称之为在线自校正,不能理解为自动把每条旧源奖励重算成噪声奖励。附录 E 的论证还要求任务偏移有界、高价值源轨迹在目标中仍有用;大幅改变拓扑、门集或噪声机制时,仅有相同数据形状不足以保证迁移有效。

迁移主实验使用 OptCRLQAS 加均匀回放,源缓存来自固定 12 GPU-hour 的训练。为了利用缓存,目标初始探索率从 1.0 降为 0.55,并收紧课程。因此“无权重迁移”并不等于“只改一个缓存变量而所有超参不变”,也不等于免除源训练成本。附录 M 单独研究缓存与探索率交互,结果并不支持所有噪声下都减少探索。

一个完整示例

以一个 QAS 回合的机制示意为例,取主文默认 \(m=10\):智能体连续编辑十次电路,结构观察每步变化,但只有第十步才重新优化角度、评估能量。如果第七步因步数上限结束,则第七步也必须评估。这里的次数用于说明规则,不是新增实验结果。

这些转移进入源缓存后,退火采样先主要强调 TD 误差,后期增加对可靠性的折减。源训练结束后,可以复制该缓存到同一分子的噪声环境,却重新初始化网络;之后采到源转移时读到的仍是源奖励,只有新收集的目标转移包含噪声评估反馈。这样能复用“哪些结构值得试”,又不直接把无噪声 Q 估计当成噪声任务答案。

损失函数 / 训练策略

附录 D.2 用在线网络选下一动作,再由目标网络估值,这是 DDQN 型目标;重要性权重按采样概率计算,并在批次内以最大权重归一化。值得注意的是,其 SmoothL1 不是标准的“逐样本损失乘权重”,而是先把预测和目标同时乘权重:

\[ Y_i=r_i+\gamma_{\mathrm{layer}}(1-d_i)Q_{\bar\theta}\!\left(s'_i,\arg\max_a Q_\theta(s'_i,a)\right),\qquad \mathcal{L}=\operatorname{SmoothL1}\!\left(W\odot Q_\theta(s)[a],W\odot Y\right). \]

这会改变 Huber/SmoothL1 的有效加权方式,因此复现不能直接用常见 PER 损失替代。QAS 奖励沿用 CRLQAS:成功给予 5,达到上限且失败给予 -5,其余按相邻成本相对目标最优值的改善比例计算,并以下界 -1 截断;OptCRLQAS 又把评估反馈延迟到块边界。

表 20 的编译网络有两层、每层 128 单元,学习率 \(3\times10^{-4}\)、batch 200、缓存 \(5\times10^5\)。QAS 则使用每层 1000 单元的三/四层网络、batch 1000、缓存 20000,以及 5/6-step returns;两类任务不能混用同一超参表。LunarLander 单独训练 5000 回合、6 个种子,并非量子任务的额外重复种子。

实验关键数据

主实验

下表来自主文表 1,是双量子比特 \(ZZ(\pi)\) 近似任务,阈值 0.9914。比较的是各方法在所列预算得到的最好结果,并非相同训练回合下的最终精度;4 倍和 32 倍指回合预算之比,不是已测墙钟加速比。

方法 训练回合数 最少门数 最佳保真度
ReaPER+(退火方法) \(2.5\times10^4\) 123 0.9920
固定 ReaPER \(10^5\) 126 0.9931
PER \(10^5\) 127 0.9918
HER \(10^5\) NA \(<0.9914\)
PPO(Moro et al.) \(8\times10^5\) 122 0.9914

退火方法用更少回合达到相近精度,但固定 ReaPER 的最佳保真度更高,PPO 的最少门数也略低。因此表题的“全面优于基线”不能按每列均领先解读。

12-qubit H2O 的主文图 4 内嵌数据为多种子均值 ± 标准差,全文此处没有明确给出确切种子数。这不是化学精度结果:各能量误差都高于 \(1.6\times10^{-3}\) Ha。

回放方法 能量误差(Ha) 总门数 CNOT 步数
固定 ReaPER \((2.00\pm0.26)\times10^{-2}\) \(221\pm57\) \(125\pm29\) \((2.5\pm2.3)\times10^4\)
ReaPER++(退火方法) \((2.13\pm0.21)\times10^{-2}\) \(128\pm29\) \(75\pm35\) \((3.7\pm2.0)\times10^4\)
PER \((2.43\pm0.12)\times10^{-2}\) \(165\pm45\) \(95\pm28\) \((5.7\pm3.2)\times10^4\)
均匀回放 \((2.45\pm0.20)\times10^{-2}\) \(151\pm35\) \(91\pm41\) \((3.2\pm5.2)\times10^4\)

这里固定 ReaPER 的平均误差最低、步数最少;退火方法突出的是电路紧凑性。主文报告 OptCRLQAS 相对 CRLQAS 的平均每回合墙钟时间减少 67.5%,不能把 \(m=10\) 的理论评估次数节省直接称为十倍端到端加速。

消融实验

表 3 的 6-qubit BEH2 振幅阻尼实验(\(p=0.001\))同时保留探索率相同的迁移对照与降低探索率的迁移版本,便于看出缓存本身与超参改动的区别。原表未给出种子均值或误差条,不能赋予与多种子结果相同的统计强度。

缓存初始化 初始探索率 \(\epsilon\) 能量误差(Ha) CNOT ROT
无迁移 1.00 \(8.45\times10^{-5}\) 29 16
迁移 1.00 \(5.81\times10^{-5}\) 26 15
迁移 0.55 \(5.77\times10^{-5}\) 27 10

降低探索率得到略低误差和更少 ROT,但 CNOT 比同探索率迁移版本多一个。原文称后者 CNOT 减少 11.3%,与表中 29→27 不符;按表计算约为 6.9%,笔记不替作者改表。

附录 J.3 的固定 1000 回合扫参也说明摊销不总提高精度:10-qubit 的 CRLQAS 最小误差 \(9.0\times10^{-4}\) Ha,\(m=7\) 为 \(9.2\times10^{-4}\),\(m=10\) 为 \(1.0\times10^{-3}\);相应经典优化时间约 490、110、75 秒。时间下降稳定,精度与门数则需要单独权衡。

关键发现

  • 单量子比特小旋转任务在三个容差下的退火成功率为 89.30%、85.30%、81.40%,主文称 40 个种子;附录 G 的门数置信区间明确使用 5 个训练种子,且区间大幅重叠。两种统计口径不能合并为“所有指标均由 40 种子显著证实”。
  • 表 2 的非 RL 对比中,本文采用 5 个种子,但多数基线没有重跑。8-qubit H2O 的本文误差 \((2.2\pm1.4)\times10^{-4}\) Ha 高于 quantumDARTS 的 \(1.7\times10^{-4}\) Ha,优势主要在总门数 89.8 对 219,而非能量全面最优。
  • 迁移在 6/8-qubit 有速度与能量收益;12-qubit 报告步数减少 88.2%、CNOT 减少 57.6%,但没有最终能量改善,应称“更快达到无迁移精度”,不能泛称“更快达到化学精度”。
  • 迁移综合分数定义为 \(S=0.4\Delta_{\mathrm{steps}}+0.1\Delta_{\mathrm{ROT}}+0.2\Delta_{\mathrm{CNOT}}+0.3\Delta_{\mathrm{err}}\),各项是相对无迁移基线的改善。分数不是物理精度,也受指标权重影响。
  • 15–20-qubit 结果依赖固定 MPS 初始电路,20、30、40 只是新增 RL 门;能量误差 \(1.5\times10^{-2}\) 至 \(2.1\times10^{-2}\) Ha,且仅单种子。它验证兼容性与结构扩展,不证明大系统化学精度。

亮点与洞察

  • 回放可靠性不是额外的噪声预测网络,而是轨迹内部误差信息。退火的价值在于承认这一代理量的可信度会随训练成熟而改变,不把训练开始与收敛阶段强行套进同一采样偏好。
  • 摊销评估既节约计算,也改变反馈粒度。可迁移的启发是:在昂贵优化器会掩盖单步结构改动时,可以评价组合编辑,但必须明确缓存状态、延迟奖励与终止补评估的语义。
  • 迁移的是探索成果而非源策略参数。它适合状态/动作接口稳定、目标反馈变贵的任务,但源标签残留意味着应持续监测目标表现,而不是认为“无权重迁移”自然消除了所有分布偏差。

局限与展望

  • 全部量子结果来自经典模拟器,尚未覆盖真实设备的连通性约束、校准漂移与更复杂噪声;LunarLander 也只是一个补充离散动作验证。
  • 所谓固定骨干不意味着所有回放超参相同:编译 PER 的 \(\alpha=0.6\),ReaPER/退火方法为 0.4。效果属于各报告配置的比较,不能单独归因于仅改变 \(\omega\)。
  • 理论条件未被实证验证,且理想后缀可靠性、在线近似与重要性损失不同。后续应记录真实缓存分桶统计,并做精确/近似可靠性及标准/现有损失的独立消融。
  • 附录 M 的“无迁移”行标为无噪声,而迁移行对应噪声条件,不能直接用这些行证明匹配噪声下的纯迁移因果收益;其中强噪声下两探索率的误差比约为 7,原文“一个数量级”只能视为粗略描述。
  • 全文有 ReaPER+ 与 ReaPER++ 混称,没有充分依据把它们当作两个独立新算法。这里统一解释为退火方法,并保留表格的源标签。
  • HRC 主文称 tuned HER 停在 95%,附录 H 表 7 为 100%;“比固定 ReaPER 快约 24%”也与 1.56/1.60 百万步不符。附录 N 的扫参配置、主文默认配置,以及中间奖励公式仍需代码核对。
  • 12-qubit 迁移综合分数主文给 51.0%,附录 L 原权重行给 12.3%,没有足够条件信息可调和;不应拿综合分数替代逐项指标。

相关工作与启发

  • vs PER / 固定 ReaPER:前者用误差强调信息量,后者再考虑下游可靠性;本文主要增加随训练推进的可靠性指数,创新是调度而非重新发明可靠性定义。
  • vs HER:HER 重新标注目标及相应奖励,本文缓存迁移完整保留源转移。二者复用经验的对象不同,均匀采样的 HER 也不等同于普通均匀回放。
  • vs CRLQAS / TensorRL-QAS:CRLQAS 提供课程与电路搜索,本文降低评估频率;TensorRL-QAS 提供 MPS 初始化,本文在其固定基础电路之上继续改进,新增门不能冒充完整电路资源。
  • vs offline-to-online RL:本文延续用离线经验播种在线缓存的思路,将其放到无噪声—噪声量子优化中。值得进一步研究按少量目标评估选择源经验,但这是展望,不是本文已经实现的奖励重标注。

评分

  • 新颖性: 4/5 — 将调度、评估粒度与实例迁移围绕回放组织起来,但可靠性定义和缓存播种本身有前作。
  • 实验充分度: 3/5 — 任务与消融覆盖较广,种子口径、未重跑基线和高量子比特单次运行限制了结论强度。
  • 写作质量: 2/5 — 方法主线清楚,但命名、预算、奖励解释及若干表文数值冲突影响复现。
  • 价值: 4/5 — 对反馈昂贵的离策略学习有实用启发,收益应按速度、精度和电路成本分别判断。