Bayesian Optimization with Fisher Information Geometry: Gradient Bounds and Trust-Region Methods¶
会议: NeurIPS2026
arXiv: 2609.31107
领域: 优化/理论
关键词: 贝叶斯优化、Fisher 信息几何、采集函数梯度界、信赖域、高维优化
一句话总结¶
本文用后验映射的拉回 Fisher 张量分离采集函数梯度中的模型几何与效用敏感性,并据此用正则化局部 Fisher 对角权重替换 TuRBO 的核长度尺度权重,在 SE 核基准上取得有竞争力的表现,但不提供外层贝叶斯优化的遗憾或全局收敛保证。
研究背景与动机¶
贝叶斯优化(Bayesian optimization,BO)要用尽可能少的昂贵黑盒评估找到优解,每轮先拟合概率代理模型,再优化采集函数决定下一个评估点。高维问题的困难不只来自黑盒本身:即使代理训练成功,内部采集优化也可能遇到大片近乎没有梯度的区域。扩大长度尺度、在已有数据附近做随机轴对齐子空间扰动(RAASP)、限制信赖域都能改善表现,但这些办法通常分别从核函数、初始化或局部搜索解释,缺少统一的敏感性视角。
采集函数实际上通过预测分布的参数依赖输入。例如标量 Gaussian 预测只把输入映射到均值和方差;如果输入移动很远,这两个量仍几乎不变,再精细的采集效用也未必能产生有效的输入梯度。因此,需要区分“采集函数对预测分布是否敏感”与“代理模型是否把输入移动映射成预测变化”。TuRBO 虽然利用长度尺度调整搜索盒形状,但显式核长度尺度既不是当前位置的后验敏感性,也不适用于所有概率代理。
本文把预测分布族视为带 Fisher–Rao 度量的统计流形,再把这个度量通过代理后验映射拉回输入空间。这样既能解释梯度消失,也能在不依赖显式长度尺度的情况下构造局部搜索形状。核心 idea:用预测分布随输入变化的 Fisher 敏感性塑造信赖域,而把总体搜索尺度与重启探索继续交给 TuRBO 的外层控制。
方法详解¶
整体框架¶
理论部分研究一次 BO 迭代内固定的代理模型:输入经后验映射得到预测参数,采集函数再由这些参数计算期望效用。拉回 Fisher 张量描述第一步的局部敏感性,采集侧敏感性描述第二步,二者共同给出输入梯度上界。
算法部分称为 Fisher-Information Trust Region(FITR)。每轮拟合代理,在当前信赖域中心计算预测对数密度对各输入坐标的梯度平方均值,将这些局部 Fisher 对角估计加入曲率下限后转成反平方根权重,再做体积归一化。得到的轴对齐搜索盒用于优化 LogEI,评估黑盒后按原 TuRBO 规则扩大、缩小或重启区域。
这里改变的是搜索盒的相对边长,不是采集函数、代理训练目标或成功/失败计数规则。实验中的 FITR-REI 与 TuRBO-REI 共享 GP 建模及区域期望改进(Regional Expected Improvement,REI)重启中心选择;默认 FITR 是对角盒,而不是完整 Fisher 椭球。方法的核心是局部矩阵几何,以下直接用公式解释,不把理论推导画成网络结构图。
关键设计¶
1. 拉回 Fisher 张量:按预测变化而非输入距离衡量局部移动
记后验映射为 \(\varphi_t(\mathbf{x})=\bm{\theta}_{t,\mathbf{x}}\),其 Jacobian 为 \(J_t(\mathbf{x})\)。Fisher 矩阵 \(\mathcal{I}_{\mathcal{S}}\) 衡量预测参数改变对分布的影响,再通过链式法则得到输入空间的敏感性张量:
对任一输入方向,这个二次型表示该方向的小位移会引起多大预测变化。附录 D.7 说明,中心预测与邻近预测之间的 KL 散度,其二阶项是位移在该张量下二次型的一半。因此它有局部概率意义,但不能把中心处二阶近似当成整个有限区域内的精确 KL 约束。
对标量 Gaussian 预测,令 \(\Sigma\) 表示方差而非标准差,张量由均值和方差两个梯度外积构成:
第一项刻画均值相对不确定性的变化,第二项刻画不确定性本身的变化,所以这里只用均值梯度会遗漏一部分预测几何。即使统计流形上的 Fisher 矩阵正定,拉回张量也不一定正定:标量 Gaussian 的预测参数只有两个,因而张量秩至多为 \(2\),输入维数超过 \(2\) 时必然秩亏。零方向只表示预测参数一阶不变,并不保证黑盒真实函数不变。
2. 采集梯度分解:说明换采集效用何时仍不能救活梯度
命题 4.2 要求后验映射为 \(C^1\)、预测参数 Fisher 矩阵正定、采集函数可用与输入独立的基噪声重参数化,并允许交换梯度与期望且满足所需梯度二阶可积条件。令 \(\bar\alpha\) 为重参数化积分中的效用,采集侧敏感性与梯度界为:
证明先用链式法则把输入梯度写成 Jacobian 转置乘预测参数梯度的期望,再插入 Fisher 的平方根与逆平方根。Cauchy–Schwarz 给出几何因子的 Frobenius 范数,即拉回张量的迹;Jensen 不等式把采集因子控制为上述期望二次型。这一推导不需要输入空间拉回张量可逆,只需要预测参数空间的 Fisher 可逆。
当预测在某片区域退回近乎常量的先验,拉回迹趋近于零;若采集侧敏感性保持有界,输入梯度就必然变小。反过来,迹大不保证梯度大,界没有给出下界,也没有保证最优点可达。相同 Gaussian 预测状态下,不同代理使用同一个采集侧公式,但它们的输入 Jacobian 仍可能不同。
附录对解析 EI、UCB、PI 给出具体敏感性界;解析 PI 的界全局有界,EI 和 UCB 还需控制预测方差。实验采用稳定化 LogEI,正文与附录仅在严格正方差的紧子集上讨论其局部光滑性,不能把解析 EI 的显式界直接当成 LogEI 的全局统一界。
高维解释也需要限定条件。对单位立方体中独立均匀点,距离随维数平方根增长,因此各向同性 SE 或 Matérn 核需要相应的长度尺度增长,才能避免相关性退化。附录 D.5 在其渐近分析下给出的临界拉回迹仍为 \(\Theta(D_x^{-1})\),不是常数级敏感性;长度尺度缩放主要缓解更快的退化,并没有证明梯度不会消失。RAASP 的解释则是让初始化靠近已有数据,避免一开始就在后验近乎常量的区域搜索。
3. 对角 Fisher 估计与阻尼:把秩亏几何变成有限坐标权重
理想完整 Fisher 区域沿低敏感方向延伸、沿高敏感方向收缩,但秩亏会让零方向半径失去控制。完整张量还需要白化,并在输入边界产生难以高效采样的裁剪区域。默认 FITR 因此只估计每个坐标的 Fisher 对角项,用轴对齐盒保留可用的方向伸缩,不试图保留所有旋转与交叉项。
在中心预测分布抽取 \(S\) 个样本,对每个样本把预测对数密度反向传播到输入,平均坐标 score 的平方:
这里微分时样本值固定,计算的是输入方向的 score,不是沿采样路径把样本本身也作为输入函数求全导数。附录 D.8 通过 score 外积和链式法则证明,其期望恰为未正则拉回张量的对应对角项。无偏性只属于这一估计步骤,不属于之后加入阻尼、开反平方根或归一化的权重。
阻尼使用中心处平均对角曲率,再加很小的数值 jitter;高敏感坐标的原始权重较小,低敏感坐标较大:
这里用 \(r_{t,j}\) 单独表示原始权重,以区分原文同时用于原始值和归一化值的权重记号。平均曲率提供各向同性下限,防止近零坐标无限伸长;如果所有对角项均为零,jitter 使原始权重相同,归一化后回到各向同性盒。它是保守的搜索形状修正,不是通过正则化恢复真实黑盒的信息。
4. 体积归一化与外层控制:让局部形状和总体探索分工
若直接把原始反平方根权重作为边长,整体 Fisher 强弱也会改变搜索体积,混淆“区域形状”与“区域大小”。FITR 和 TuRBO 都除以权重的几何平均数,使边长权重乘积为一,再由公共长度参数控制未裁剪盒的体积:
盒边界逐坐标与输入域相交;因此乘积归一化固定的是裁剪前体积,边界处实际可行体积仍可能更小。在盒内优化 LogEI、评估真实目标、更新观测与计数,这些都与 TuRBO-REI 相同。本文没有引入 Fisher 自然梯度采集优化器,也没有用精确 KL 约束替代该外循环。
保留外层控制尤其重要,因为作者试过用增广拉格朗日方法直接处理 KL 约束,发现其过度利用局部区域、探索不足。FITR 仅让几何决定相对边长,成功时扩张、失败时收缩、区域塌缩时用 REI 选择新中心,继续保留原有探索通道。FullFITR 才使用完整正则张量白化,并作为额外消融,而不是主要实现。
损失函数 / 训练策略¶
这不是训练新神经网络的工作。SE 实验拟合 GP 时使用维数缩放的 LogNormal 长度尺度先验;输入归一化到单位立方体,输出标准化。采集优化用 LogEI 与 L-BFGS,使用 \(5\) 次重启及 \(256\) 个原始候选样本;Fisher 对角估计也使用 \(S=256\),二者是不同用途的采样数量。
每次运行从 \(30\) 个随机观测开始,顺序评估 \(q=1\)。信赖域在 \(10\) 次连续改善后加倍,失败阈值为 \(\min\{\lceil\max(4/q,D_x/q)\rceil,20\}\),触发后减半;长度低于 \(0.5^7\) 时重启。正文未提供可从文本直接核实的各任务完整评估预算,不把曲线横轴缺失的信息补成统一预算。
实验关键数据¶
主实验¶
论文主要通过曲线报告结果,缓存包含图注和讨论,但没有可核实的曲线终点数值。下表明确记录实验范围和作者定性结论,不是数值排行榜,也不计算提升百分比。
| 实验 | 明示条件 | 对照范围 | 原文结论与证据边界 |
|---|---|---|---|
| GP-SE 主比较(图 4) | 9 个连续基准,11 个独立种子,最佳已观测目标,越低越好 | FITR-REI、TuRBO-REI、DSP、BOUNCE | FITR 在若干任务优于 TuRBO-REI,其余与强基线有竞争力;没有逐任务可核实终点值 |
| GP-IBNN 迁移检查(图 5) | 深度 3,5 个独立种子,同样以越低越好报告 | FITR 与非信赖域基线 | 部分任务改善,其余相近;不是与其他非长度尺度信赖域方法的完整比较 |
| 主比较控制条件 | 初始观测 30,顺序评估 q=1 | FITR-REI 与 TuRBO-REI 共用 GP 建模及 REI 中心选择 | 主要差别是局部权重,不应归因为新的重启策略 |
SE 套件包含控制与机器人任务、HPA102-1 人力飞机设计、MOPTA08 汽车设计,以及 LassoDNA 和 SVM 相关任务;缓存正文未列全九个任务及其维数,不据名称推断维数。实验图按基准的最小化约定报告目标,而算法正文以最大化表述,两者不是相反的实验结果。
图 4、图 5 和图 6 图注均称阴影为标准误;但 checklist 第 7 项又使用“min-max shaded region”的措辞,且其说明不清楚。本笔记按图注记录均值与标准误,同时保留此冲突,不能将阴影改称置信区间或显著性检验。
消融实验¶
以下是消融与诊断分析表。除固定实验条件外,表现与耗时都是原文定性报告,没有从图形估读数值。
| 配置 / 分析 | 原文明示观察 | 可以支持什么 | 不能支持什么 |
|---|---|---|---|
| 默认对角 FITR | 正则化后各向异性保持有界,同时随局部预测变化 | 阻尼避免失控伸长 | 没有无阻尼定量消融,不能断言具体贡献百分比 |
| FullFITR | 仅在部分任务评估,未超过对角 FITR | 完整旋转几何并非自动更优 | 不能推出所有任务上完整张量都更差 |
| 长度轨迹(图 6) | FITR 与 TuRBO-REI 的长度定性相近 | 差异更可能来自形状而非不同长度控制 | 不等于每轮长度或重启位置完全相同 |
| 候选生成耗时(图 6) | 与 TuRBO 同一量级,计算局部权重增加适度开销 | 对角实现有实践可行性 | 没有可核实秒数或固定开销比例 |
| KL 约束 + ALM 变体 | 作者报告过度利用、探索下降及表现退化 | 保留外层探索机制有经验依据 | 没有完整量化表,不能给出下降幅度 |
附录诊断把各向异性定义为最大与最小归一化坐标权重之比;接近 \(1\) 表示近各向同性,而不是最优搜索效率。FullFITR 在中心几何变化快、边界裁剪或数值开销大的情况下可能受损,这些是作者给出的可能解释,并非逐因素实验证明。
关键发现¶
- 最干净的因果对照是 SE 设置下 FITR-REI 对 TuRBO-REI:共享建模及外循环,局部边长来源不同;但曲线结论不能升级成所有任务统一获胜。
- 不依赖显式长度尺度是构造层面的泛化。IBNN 比较只验证能够使用同一管线,尚未隔离其相对其他信赖域形状的优势。
- 更完整的几何信息未必改善有限区域搜索:中心处的局部精度、区域内几何变化与可行边界处理都影响最终收益。
亮点与洞察¶
- 把采集侧敏感性与代理侧几何分开,能定位梯度失败来自哪一环。只替换采集效用并不能保证修复后验映射几乎恒定的区域。
- Fisher 估计通过预测对数密度对输入反向传播,不必要求代理暴露 ARD 长度尺度。这为光滑概率代理提供共同接口,但仍要求密度、输入导数和正则条件可用。
- 几何只决定形状,TuRBO 外循环决定体积及重启,这是比直接把 KL 约束当作完整优化策略更保守的迁移方式。其可复用价值在于替换局部权重而不重写整套 BO 控制。
局限与展望¶
- 理论结论是内部采集优化的梯度上界,不是 BO 遗憾界,也不保证全局收敛、样本效率或实际梯度具有对应下界。
- 标量 Gaussian 的拉回张量秩至多为 \(2\);对角近似丢掉旋转信息,阻尼又改变原始几何。默认盒不能被称为精确 Fisher–Rao 球或精确 KL 信赖域。
- 非长度尺度、非各向同性代理可能没有同样的高维迹塌缩现象,FITR 收益因任务而异;IBNN 仅有非信赖域对照,尚不足以建立该类方法中的全面优势。
- 结果主要来自曲线,FullFITR 只覆盖部分任务;标准误与 checklist 的阴影描述冲突需要作者澄清。代码 checklist 称已有 GitHub 代码,但缓存没有具体仓库链接,故不猜写代码元数据。
- 后续可研究跨区域变化的 Fisher 几何、更严格的旋转区域边界处理以及批量或多目标扩展;这些是研究方向,不是当前顺序标量实验已经验证的能力。
相关工作与启发¶
- vs TuRBO-REI:TuRBO 以 ARD 长度尺度伸缩盒,FITR 以中心后验的正则化 Fisher 对角权重伸缩盒,体积归一化和外控制不变。附录 D.6 只给出长长度尺度对应宽搜索方向的定性联系,二者不是精确等价权重。
- vs DSP 与 RAASP:DSP 从维数缩放先验维持核相关性,RAASP 从初始化位置避开平坦区域;本文用拉回迹解释两者为何可能有效,再把这种敏感性用于局部区域形状。
- vs GIT-BO:GIT-BO 用预测均值梯度识别全局活跃子空间,本文同时考虑预测分布变化并局部塑造信赖域;原文没有直接对比,不能忽略代理差别宣称优势。
- vs 几何感知 BO 与自然梯度:前者可利用输入空间本有的流形结构,本文几何来自代理后验;自然梯度更新改变优化步方向,默认 FITR 则改变允许搜索的轴对齐区域,两种操作不能混同。
评分¶
- 新颖性: 4/5 — 将采集梯度分解与局部后验 Fisher 信赖域连接起来,接口比核长度尺度更一般。
- 实验充分度: 3/5 — 有 9 个 SE 基准和重复运行,但非长度尺度比较及完整张量覆盖有限。
- 写作质量: 4/5 — 主张与保证边界总体明确,阴影统计描述及部分记号仍需澄清。
- 价值: 4/5 — 提供可解释、可替换的信赖域形状构造,收益需依赖代理与任务验证。