跳转至

Bidirectional Information Flow (BIF) - A Sample Efficient Hierarchical Gaussian Process for Bayesian Optimization

会议: NeurIPS2026
arXiv: 2505.11294
代码: https://anonymous.4open.science/r/Bidirectional_Information_Flow
领域: 优化/理论
关键词: 贝叶斯优化、层次高斯过程、信用分配、结构先验、子任务迁移

一句话总结

BIF 用子高斯过程的采集图构造父模型软先验,再把父级真实响应按不确定性感知权重分给子模型持续学习,改善低预算组合任务的重建质量与学习轨迹,但这种反馈是有偏伪响应而非真实子任务分解。

研究背景与动机

昂贵黑盒优化通常只返回整体结果,却具有可利用的子任务结构。例如,多通道神经刺激的肌肉激活由多个电极通道共同影响;GAN 的表现同时依赖生成器和判别器参数。普通高斯过程贝叶斯优化(GPBO)在完整参数空间里学习总响应,能估计不确定性,却不显式保存各子任务的知识;层次高斯过程则让子模型负责各自子空间,再由父模型处理整体目标。问题是,子模型如果只在初始化时获得少量真实数据,之后一直只向父模型提供信息,父模型花费昂贵查询得到的新反馈便无法用于改进这些子模型。

这一缺口不能简单通过“把父级观测复制给所有子模型”解决。整体响应混合了多个子任务及其交互,既不等于任何一个子任务的真实值,也未必服从严格加法关系。直接复制会让子模型被同一个总信号污染;硬性要求父模型等于子输出的固定组合,又会限制父模型纠正错误先验的能力。BIF 因此同时追求两个目标:从已有子知识获得早期搜索引导,以及让每次父级真实查询成为整个层次的学习机会,而不是仅更新父模型。

作者的切入点是把向上信息当作可被数据修正的结构先验,把向下信息当作带偏差、需独立校准的近似训练信号。核心 idea:子采集图向上形成父模型软均值先验,父级总响应向下形成守恒信用分配,再分别归一化真实子响应与推断子响应,闭环更新整套层次模型。

方法详解

整体框架

输入是一组已知子任务及其参数子空间、每个子任务少量真实初始化样本,以及可查询整体目标的环境;输出包括父目标的优化建议、父级代理模型和可复用子模型。BIF 不是从无结构黑盒中自动发现任务划分,而是先指定父子结构,再反复执行“子采集图上行—父级选点及真实查询—响应信用下行—双流校准更新”。父模型仍以真实整体响应训练,子模型则把自己的真实数据与父级分配出的伪响应作为两个来源。

在每轮开始时,子模型先生成整个子空间的采集图。父模型将这些图提升到完整组合空间并取平均,用来指导自己的均值先验;自身后验和采集函数仍决定实际选点。查询返回的是一个真实整体响应,而不是每个子任务的真实标签。下行通道利用查询前的子预测和不确定性分配该响应,各子模型再在自己的参数投影上得到一个近似标签,更新后重新生成下一轮的采集图。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["子任务划分与<br/>真实初始化数据"] --> U["采集图软先验"]
    U --> P["父级后验选点<br/>真实环境查询"]
    P -->|真实总响应| D["守恒响应信用"]
    U -->|子采集效用| D
    D -->|推断子响应| R["双流独立校准"]
    I -->|真实子响应| R
    R -->|更新子模型| U
    P -->|真实总响应更新父模型| U

图中真实环境查询与模型训练必须分开理解:下行产生多个子训练点,并不意味着多做了多次物理实验,也不意味着观察到了多个真实子响应。均值先验会随子模型变化,父模型则通过真实历史数据修正它,因而循环既改变子模型,也改变父模型后续的搜索偏好。

关键设计

1. 采集图软先验:传递子任务的搜索偏好,而非锁死父级组合

每个子 GP 使用 Matérn 核,在自己的参数子空间中预测均值和标准差,再计算采集效用。这里的“采集图”是候选位置对应的探索/利用分数,不是子函数真实值的表,也不只是后验均值。父级候选点对应各个子空间的坐标,因此可以读取每张子图的相应位置并平均。一个尚不确定、但有潜力的子区域也能提高组合候选点的先验吸引力,这解释了为何该通道主要帮助早期搜索,而不等同于确定性地预测整体奖励。

作者用一个截距和一个平均采集图作为父均值的显式基函数,并为这两个系数保留高斯先验。父核另按子核相加,刻画子结构带来的协方差关系;均值引导与核结构是两件不同的事,不能只介绍其中之一。

\[ A(x)=\frac{1}{|S|}\sum_{s\in S}\alpha_s(x_s),\qquad m_p(x)=\theta_{\mathrm{bias}}+\theta_{\mathrm{scale}}A(x),\qquad \boldsymbol{\theta}_p\sim\mathcal{N}([0,1]^\top,I),\qquad k_p(x,x')=\sum_{s\in S}k_s(x_s,x_s'). \]

这里 \(S\) 是子模型集合,\(x_s\) 是父级候选点在子空间的投影。系数先验的中心让初始父均值倾向平均子图,但非零协方差保留了调整空间:真实父数据若不支持子图,父模型不必继续服从其固定尺度和偏置。这是软结构引导,不是把父目标硬约束为子任务的已知解析组合。

平均而非求和还带来尺度区别。附录 L.1 的命题是在真实目标严格等于各子函数之和、子预测误差与探索残差都趋零时,证明平均图趋于真实目标除以子数;不是平均图无条件趋于真实目标本身。父均值中的尺度系数因此并非多余参数,正文关于“先验收敛到目标”的概括应结合这一比例关系理解。

2. 守恒响应信用:用可控近似标签利用每次父级查询

父级总响应如何帮助子模型,是本文最重要也最容易误解的一步。对于刚被父模型查询的组合点,作者读取各子模型在相应坐标的效用,再除以该子模型自己采集图的最大效用,以降低不同子任务尺度的直接影响;随后用 softmax 得到正权重,按权重乘上真实父响应。采用 UCB 时,效用同时包含当前预测和由查询计数折减的不确定性,所以较缺数据的子模型也可能获得较大信用,而非完全按预测均值分配。

\[ \alpha_s(x_s)=\mu_s(x_s)+\gamma\frac{\sigma_s(x_s)}{\sqrt{n_s(x_s)}},\qquad c_s(x_s)=\frac{\alpha_s(x_s)}{\max_{z_s}\alpha_s(z_s)},\qquad w_s(x)=\frac{\exp(c_s(x_s))}{\sum_{j\in S}\exp(c_j(x_j))},\qquad \tilde y_s(x_s)=w_s(x)y_p(x). \]

这些是原文机制关系;此处用 \(\tilde y_s\) 明确标记推断标签,避免与真实子环境响应混淆。权重和为一,所以归一化前的推断子响应之和等于父响应,包括按比例分配其中的噪声。但各子响应来自同一个带噪观测,不能被当作彼此独立的新测量;守恒只说明没有把完整总信号复制多份,不证明标签无偏,更不证明找到了真实且唯一的潜在分解。

原文声称除以最大效用可把信用分数限制在 \([0,1]\)。这需要采集效用非负、最大值严格为正且有限;仅做最大值除法不能处理负效用,也不能处理零分母。正文与附录 L.3 没有给出通用的平移、截断或零分母保护,因此这里保留条件,而不把它改写成作者未提出的 min-max 信用分数。主文 UCB 的计数分母也未直接写防零项,附录 L.1 才明确使用 \(\sqrt{n_s(x_s)\vee1}\);复现时应核实这一边界约定。

即使子 GP 完全学会各自真实函数,最大值归一化后再 softmax 通常也不等于真实贡献占总响应的比例。附录 L.2 的零偏差结论要求正值加法子任务,在考察点的真实贡献相等,且两个子函数的最大值也相等;一般不平衡情况只有偏差刻画。这是“有效的在线信用启发式”,不是从单一总响应中恢复所有真实子标签的识别定理。

3. 双流独立校准:不要把不同来源的响应直接混为同一尺度

每个子模型先有来自真实子环境的初始化数据,之后又获得父级分配出的伪响应。父级任务的组合变换、子数和信用权重会改变伪响应的尺度;若直接把它与真实子响应拼接,同一子空间位置就可能出现不兼容的数值。作者对两种来源分别做 min-max 归一化,再把归一化后的样本用于同一个子 GP 的训练,使各来源内部的相对高低成为主要学习信号。

\[ T(y)=\frac{y-\min(Y)}{\max(Y)-\min(Y)}. \]

真实流与推断流分别使用各自的 \(Y\),不是先合并再共同计算最小最大值。这只能协调数值尺度,无法消除错误信用造成的结构偏差,也不保证归一化后的伪标签与真实标签代表完全相同的函数。尤其初始化只有一个样本或响应全相同时,分母为零;原文未明确给出常数流的处理规则,不应宣称该变换对所有初始状态都自动有效。

这一步与实验中对真实环境响应所做的在线 z-score 或“除以迄今最大观测值”不同,后者是数据集层面的响应预处理选项。前者专门协调子模型收到的两个来源。独立归一化后,子标签之和一般不再等于原始父响应;因此信号守恒属于信用分配步骤,不能扩展为整个训练流水线始终保持物理量守恒。

一个完整示例

设一个父级候选配置由两个子空间坐标组成,父级真实查询返回 10,两个子模型在该点的归一化效用分别为 0.8 和 0.2。这是说明机制的例子,不是论文实测数据。softmax 后权重约为 0.646 和 0.354,因此子模型收到约 6.46 和 3.54 的伪响应,父模型仍收到真实总响应 10。

两个伪响应相加为 10,但真实子响应可能根本不是这两个数;即使父目标是加法,也可以有其他贡献组合产生相同总值。接下来,每个子模型分别用自己的真实流和推断流范围做归一化,把相应投影坐标加入训练集并更新后验。新的均值和不确定性改变下一轮子采集图,也改变父级软先验,父模型因此可能选择另一组组合坐标。

这条回路让一次昂贵整体查询更新多个代理模型,而不是节省到“零查询”,也不是额外获得两个独立真实子环境样本。若组合任务改为强非线性变换,子信用仍按同一规则分配;父模型可以修正错误引导,但子标签更可能持续带有变换造成的偏差。

损失函数 / 训练策略

算法 1 先为每个子任务收集 \(r\) 个真实样本,再执行预算为 \(Q\) 的父级查询循环。每一轮重建子采集图与父级先验,最大化父采集函数选点,取得一个真实父响应,分配信用、追加相应数据、增加相关查询计数,并为所有模型进行 \(t\) 步训练。实验用 Adam,学习率 0.01;子核为 Matérn,平滑度参数 0.5。GP 更新对应核及相关参数的学习,论文没有提出神经网络式的独立监督损失。

当前缓存的算法每轮都由父模型查询环境,没有写出“父与各子模型 round-robin 轮流做真实查询”的额外日程。子模型的连续更新主要来自父查询分配的伪响应,不能把训练计数增加解释为同次数的子环境采样。论文明确给出真实子初始化需求,因此应用时仍需能取得这些初始化响应,或使用其模块迁移方案;“只需整体反馈”描述的是初始化之后的主要闭环。

神经刺激主文给出的参数顺序为 \(\{\kappa,\gamma,r,t\}=\{8,4,1,15\}\)。附录 E 表 3 对不同归一化列出不同参数,而 E 的末段又写一组整体选择 4.0、3、6、10;这些设置不能合成唯一通用配置。附录 G 的模块迁移则清空旧查询数据,只保留预训练子模型的超参数后放入新父任务,而非携带全部历史观测。它在早期提升父表现,但从头训练的子模型最终可能重建得更好,体现旧任务偏差的迁移代价。

理论部分分析的是采用学习核的 GP-UCB:紧致动作空间、真实核对应的有界 RKHS 范数、真实及学习核的有界对角方差、独立高斯噪声和合适的置信参数是关键条件。核错配先转换为后验均值与方差误差,再进入累计遗憾上界;均值误差以线性项进入,方差误差还经过平方根。加法结构下,总核错配可由各子核错配之和控制,但这不等于遗憾数值直接等于子误差之和。

这些界说明减少子核错配为何值得追求,并未证明信用伪标签必然使错配趋零。附录使用的标准 GP-UCB 选择规则也不同于实现描述中带位置查询计数的 UCB,且先验收敛命题要求严格加法,而不是任意复杂组合变换。应将理论视为有条件的误差传播分析,不把非线性鲁棒性实验或经验子重建提升说成一般端到端收敛与安全保证。

实验关键数据

主实验

主文表 1 使用 100 次训练查询,报告 10 次随机初始化的均值和标准误。下表保留原文的百分制 RO 与 \(R^2\) 数字;AUC 是训练过程中 RO、父 \(R^2\)、平均子 \(R^2\) 的累计综合量,不是单独的最终优化指标。不同任务、不同可报告子指标的模型,AUC 不能直接理解为同尺度累计遗憾。

任务 模型 RO 父 \(R^2\) 子 \(R^2\) AUC
Michalewicz Vanilla GPBO 99.30 ± 20.25 55.29 ± 1.67 — 10,138.74
Michalewicz ADD GP 97.27 ± 1.43 75.17 ± 1.80 75.74 ± 2.34 18,716.24
Michalewicz BIF UCB 98.87 ± 0.60 86.10 ± 0.88 61.88 ± 3.25 18,587.90
Synthetic 3D Vanilla GPBO 80.79 ± 0.28 13.39 ± 0.13 — 7,677.74
Synthetic 3D BIF UCB 88.24 ± 3.23 61.39 ± 2.55 42.86 ± 5.87 14,986.14
Neurostimulation Vanilla GPBO 98.46 ± 0.07 70.13 ± 0.11 — 14,119.99
Neurostimulation BIF UCB 81.83 ± 0.25 79.70 ± 0.12 63.98 ± 0.15 18,229.36
HPO-GAN Vanilla GPBO 96.04 ± 0.45 9.67 ± 1.00 — 2,035.21
HPO-GAN BIF UCB 96.50 ± 0.45 12.19 ± 0.86 26.72 ± 1.74 2,596.53
HPO-Lasso Deep GP 99.86 ± 0.04 89.27 ± 5.89 — 14,655.16
HPO-Lasso BIF UCB 99.98 ± 0.02 75.35 ± 2.84 50.96 ± 5.79 17,906.14
HPO-Lasso BIF PI 99.83 ± 0.07 79.96 ± 0.94 71.63 ± 3.40 20,249.31

RO 的原文定义如下,\(\hat x\) 是采集函数选择的推荐位置,\(x^*\) 与 \(\tilde x\) 分别是真实最大值和最小值位置。

\[ RO=\frac{y(\hat x)+y(\tilde x)}{y(x^*)+y(\tilde x)}. \]

注意原式是“加最低值”,不是常见的减最低值归一化。若最低值为负,分母可能为零,也不能一般保证指标落在 \([0,1]\);这里按原文保留并标记疑点,不自行改成另一个定义。神经刺激结果正文把父 \(R^2\) 的 81.43 归给 EI,但表 1 归给 PI;此笔记以表格配置为准,并保留该冲突。

消融实验

附录 I 表 5 区分删除采集图软先验(No Up)与删除守恒响应信用(No Down)。下表选取最能揭示机制的子重建和学习轨迹指标;三项任务的全部 RO 并不都是完整 BIF 最优。

任务 指标 No Up No Down Full BIF
Sub 2D 子 \(R^2\) 74.76 ± 2.55 10.99 ± 1.67 81.65 ± 1.94
Sub 2D AUC 20,251.86 13,813.10 22,650.28
Michalewicz 子 \(R^2\) 47.43 ± 4.38 32.08 ± 4.74 61.88 ± 3.25
Michalewicz AUC 18,079.62 16,782.96 18,587.90
HPO-Lasso 子 \(R^2\) 37.68 ± 4.44 21.57 ± 3.94 50.96 ± 5.79
HPO-Lasso AUC 16,549.95 16,708.63 17,906.14

No Down 在 HPO-Lasso 的子 \(R^2\) 从 50.96 降到 21.57,按完整模型为分母约降 57.7%;Sub 2D 从 81.65 降到 10.99,约降 86.5%。主文所说删除上行导致 HPO-Lasso AUC 降 14%、Michalewicz 降 6%,与表 5 按完整模型为分母所得约 7.6%、2.7% 不一致;不采用正文百分比替代表格。

关键发现

  • 3D 的父 \(R^2\) 从 13.39 到 61.39、AUC 从 7,677.74 到 14,986.14,支持低预算重建与轨迹改进,但不证明任意高维可扩展性。
  • 神经刺激 BIF UCB 的重建与 AUC 更好,RO 却低于 Vanilla GPBO;调参目标偏向综合 AUC,不能据此说 BIF 在最终最优点搜索上全面胜出。
  • 精确 GP 的计算代价仍存在:附录 D 在 Michalewicz 的 100 查询耗时为 BIF 1:14、Vanilla 0:07、Deep GP 5:11。它追求环境样本效率,不是最小代理计算时间。

亮点与洞察

  • 采集效用不只负责“选下一个点”,还充当跨层传递的搜索知识。把这种知识放入软均值先验而不是硬约束,允许父级数据纠正不合适的组合假设。
  • 同一个真实整体观测同时推动父模型与各子模型更新。信用分配的价值在于提供可用学习方向,而不是生成新的独立证据;这一差别决定如何评估伪标签质量。

局限与展望

  • 子任务划分及真实子初始化是前提;没有可访问子环境时,仍需解决初始化来源,不能直接宣称全程只依赖整体反馈。
  • 非负效用、正最大值、非零归一化范围及查询计数防零都有边界要求。需要补充可验证实现规则,而非默认公式对任意奖励成立。
  • 强非线性或负交互会破坏信用的解释性;附录 H 的指数非线性测试报告父 \(R^2\) 降 37%、子 \(R^2\) 降 24%,说明较好 RO 不代表潜在子任务恢复成功。
  • 学习核遗憾界依赖额外假设,理论分析与计数修正 UCB、软非零均值及双流归一化的完整实现之间仍需谨慎连接;精确 GP 还具有立方级计算增长。

相关工作与启发

  • vs Laferrière 等层次 GPBO:都利用子模型引导父模型;BIF 增加父观测下行反馈,解决子模型初始化后停滞的问题,但新增信用偏差与校准需求。
  • vs ADD GP / Deep GP:ADD GP 提供加法结构,Deep GP 提供层次非线性表达;BIF 强调显式可复用子任务及反馈闭环,既非所有指标优于加法模型,也非任意非线性组合的通用识别器。
  • vs BILBO:BILBO 根据下层解硬约束上层可行集;BIF 用软先验保留父级修正余地,适合结构有用但并不完全准确的场景。

评分

  • 新颖性: 4/5 — 将采集图软先验、响应信用与双流校准连成明确的在线层次闭环。
  • 实验充分度: 4/5 — 五类基准、模块消融与鲁棒性测试较全面,但初始化成本和指标选择影响比较。
  • 写作质量: 3/5 — 机制可复述,但归一化边界、配置、指标归属与部分百分比存在不一致。
  • 价值: 4/5 — 对昂贵、可分子任务的黑盒优化有实用启发,不能替代子标签识别或安全验证。