Simple Extensions of Single-Objective Acquisition Functions and Hedge Strategies for Multi-Objective Bayesian Optimization¶
会议: NeurIPS 2026
arXiv: 2609.31940
领域: 优化/理论
关键词: 多目标贝叶斯优化、采集函数、超体积、帕累托候选、策略组合
一句话总结¶
本文用单目标采集函数的向量帕累托搜索生成候选,再以预测均值的超体积筛选查询点,并用 MO-Hedge 自适应选择采集策略;在九个基准上表现有竞争力,但低运行开销的优势主要体现在批量设置,不能概括为所有设置都最快。
研究背景与动机¶
昂贵黑盒优化常常不是寻找一个标量最优解,而是逼近一组互不支配的折中方案。多目标贝叶斯优化既要用有限查询学习未知函数,也要覆盖帕累托前沿。ParEGO 把多个目标标量化,EHVI 系列直接计算期望超体积改善,HVKG 考虑下一轮的信息价值,JES 则追求关于帕累托结构的信息增益;这些方法各有依据,但其标量化、积分、幻想样本或熵估计会增加实现与计算负担。
作者选择不重新推导一种复杂的多目标采集函数,而是拆开两个决策:每个目标上如何探索,由已有 EI 或 UCB 决定;多个目标之间如何选出有价值的查询,由候选集上的超体积排名决定。这里的关键不是把目标直接相加,也不是对真实目标做廉价进化搜索,而是让进化算法搜索代理模型提供的采集值。昂贵的真实函数只在最终选出的点上调用。
另一个问题是采集策略本身依赖任务。固定 EI 可能过早利用,固定 UCB 也未必在所有任务上最合适,因此作者还把单目标 GP-Hedge 的策略组合思想推广到多目标场景。核心 idea:用采集向量产生探索与利用的折中候选,用预测超体积决定当前查询,并用历史候选的预测超体积决定以后更信任哪一种采集策略。
方法详解¶
整体框架¶
qHAX 是 Parallel Hypervolume-ranked Acquisition Extension。每轮先根据已有观测拟合各目标的独立高斯过程,再经过“采集向量候选”“均值超体积排名”“批内贪心去重”得到待评估批次。MO-Hedge 是可选的外层策略选择器:所有组合成员先各自提交一个批次,选择器按历史表现为每个查询位置抽取一个成员的提名,而不是只运行最终获选的采集函数。
这里要分清三种空间:输入空间放设计变量,采集空间放每个目标的 EI/UCB 值,目标空间放预测或真实的目标值。候选集在采集空间中互不支配,最终排名才进入预测目标空间;实际观测返回后,才更新真实查询数据和下一轮代理模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
D["已有观测"] -->|拟合更新| G["各目标 GP"]
G --> A["采集向量候选"]
A --> B["均值超体积排名"]
B --> C["批内贪心去重"]
C -->|各成员提名批次| H["历史超体积 Hedge"]
C -->|固定策略直接查询| E["真实函数查询"]
H -->|按位置抽取提名| E
E -.->|新增观测后重新拟合| G
G -.->|重算旧候选预测奖励| H
关键设计¶
1. 采集向量候选:先保留各目标采集值之间的折中
对每个目标单独构造同一种单目标采集函数,再把这些采集值拼成向量。qHAX-UCB 的每个分量使用预测均值加不确定性奖励,qHAX-EI 的分量则衡量相对该目标当前最好值的期望改善。已有单目标采集函数负责各自目标上的探索与利用,不需要先把全部目标压成一个标量。
作者用 pymoo 的 NSGA-II 近似求解采集向量的多目标最大化,保留一组非支配输入点。一个候选可能对目标一的采集值很高、对目标二较低,另一个候选恰好相反,因此二者都能进入候选池。此时的“帕累托”是采集值的帕累托,不意味着这些输入已在未知真实目标上达到帕累托最优,也不意味着预测均值向量互不支配。
这一步避免随机标量化提前消除某些折中方向,也让采集函数的不确定性信息参与搜索。但它不是免费的:每轮仍有一次种群式多目标优化,候选质量取决于内层搜索是否充分。候选数量、NSGA-II 种群与迭代配置不能从本文缓存的实现说明中完整恢复,不能把“可插拔”理解为不需要调参。
2. 均值超体积排名:在预测目标空间比较候选的几何收益
有了候选之后,作者不再直接比较 EI/UCB 向量,而是用当前代理模型预测所有已评估输入的均值,非支配筛选后形成去噪前沿。候选也映射成预测均值向量,计算把它加入当前前沿后的超体积。最大化这个总超体积,与最大化相对同一基线的超体积增量等价。
为便于说明,下面把原文的总超体积排名写成等价增量形式;它不是另外一种采集函数推导。超体积是从被支配参考点到各目标向量形成的轴对齐盒子的并集体积,重复覆盖不会重复计数。
这不是 EHVI:排名并未对候选目标后验的随机性求期望,而是把均值代入超体积计算。探索来自前一步的采集向量候选生成,最后的几何筛选本身是确定性的。如此省掉嵌套积分与前瞻优化,却也可能淘汰均值暂时不好、但不确定性很有价值的候选;“保留单目标采集语义”不等于最终查询仍完整保留其不确定性偏好。
参考点必须在与预测目标相同的坐标系中,被相关目标向量支配。算法 1 写出逐坐标最小值减 0.01 的规则,但其记号把目标前沿与输入候选集直接并列,省略了候选到预测目标的映射。这里按正文的预测目标空间含义解释,不原样复写这个类型混用的式子;参考点的选取也并非对排名完全无影响。超体积相同时,作者使用帕累托优化器的排序作为平局处理,通常涉及拥挤距离。
3. 批内贪心去重:用预测覆盖避免整个批次扎堆
直接按初始超体积排名取前几个点,可能选出多个覆盖几乎相同目标区域的候选。qHAX 每选一个点,就把它的预测均值加入临时前沿,删除该输入,再对剩余候选重新计算排名。后面的点因此按照“前面已预测覆盖的区域之外还能增加什么”被选择,而不是独立地抢同一个最大收益区域。
整个批次构建期间不重新拟合 GP,也不假装已经拿到真实观测;更新的是临时预测集合。批次结束后,才并行评估真实函数并补充数据。若候选集耗尽,正文说明在输入域内均匀随机采样补足;算法 1 的空集分支没有清楚写出跳过后续空集 argmax 的控制流,实现时需要处理这一点。
超体积具有单调性与次模性,因此在固定候选集、固定预测向量和固定参考点下,贪心选择大小受限的批次,可得到最优单轮预测超体积增量的 \((1-1/e)\) 近似保证。这个保证不评价候选集之外的输入、不控制预测误差,也不是整个贝叶斯优化过程的累积 regret 保证;批次混入随机兜底点时也不能无条件沿用固定候选集的论述。
4. 历史超体积 Hedge:用当前后验重评所有策略过去的提名
MO-Hedge 不限定于 qHAX,只要求组合成员能够提出查询批次。每轮所有成员都生成提名,并各自维护过去提名的输入历史;历史包含没有真正被查询的点。随后用当前同一个代理后验重新预测每个成员的旧候选,以其整个历史预测集合的超体积作为 gain,再通过指数权重产生选择概率。
这里没有为每个未获选策略额外调用真实函数。所有成员获得的是代理模型提供的全信息式预测奖励,而非所有成员真实效果的全信息反馈;候选被别的策略带来的新观测纠正后,历史奖励也会改变。gain 是重新计算的历史集合超体积,不是每轮真实超体积改善的累加,更不是单个候选的独立奖励。
原文把本轮提名并入下一时刻历史,而奖励使用当前历史;算法 2 的时间标号因此指向旧提名,不能擅自解读成已用本轮真实结果发奖。每个批次位置按相同选择概率抽取一个成员,并取该成员在这个位置的提名,所以一个批次可能混用不同策略。原文没有说明跨策略重复提名如何去重,也没有为混合后的批次重新做整体超体积贪心选择。
这种做法能在任务结构未知时降低固定采集函数选错的风险,但开销包括全部成员的候选生成、全部历史的预测与超体积计算。并行性降低的是可并行部分的延迟,不代表消除了总计算量。作者明确承认:重算整个历史的实际版本不满足标准累计冻结奖励的 Hedge 理论条件;理论上有界的替代变体不等于本文报告的版本已有相同保证。
一个完整示例¶
考虑两个都需要最大化的目标。已有数据拟合出的两个 GP 让 NSGA-II 提出若干采集向量非支配点;它们可能分别偏向目标一的高 UCB、目标二的高 UCB,或二者之间的折中。随后将这些输入全部映射成预测均值,再问哪个输入能增加当前预测前沿的覆盖,而不是问哪个 UCB 总和最高。
假设选择大小为 3 的批次,第一个点扩展前沿的一端;将它的预测向量并入临时前沿后,原本排名第二但覆盖相同区域的点可能失去收益,另一个扩展前沿中部的候选会上升。重复直到选出三个点,才调用真实函数。这个示例说明为何批内重排名重要,不代表原文报告了这些候选的具体坐标或超体积数值。
若启用 MO-Hedge,以上过程由各 qHAX 成员独立运行,其他成员使用自己的批次生成方式。Hedge 根据旧提名在当前后验下的历史超体积抽取各位置提名;只查询最终混合批次,下一轮再利用这些观测修正所有成员历史的预测价值。
损失函数 / 训练策略¶
本文没有新的神经网络训练损失。所有模型型策略用 BoTorch 的 ModelListGP 和 SumMarginalLogLikelihood,输入域归一化,目标观测在拟合前标准化。批内临时前沿更新属于决策过程,不是增加了训练样本。
多数基线用 optimize_acqf,默认 num_restarts=10、raw_samples=500、batch_limit=5、maxiter=100。qHVKG 采用 num_fantasies=10、num_pareto=10,并且只有一个优化起点;数值优化失败时以 Sobol 批次搜索兜底。因此横向结果是在各自具体优化器与数值保护配置下成立,并非只比较采集函数的数学定义。
缓存未提供可核实的代码仓链接,也未完整列明 qHAX 的 NSGA-II 配置、UCB 探索系数以及 MO-Hedge 学习率设置,复现时仍需补齐这些细节。
实验关键数据¶
主实验¶
九个任务为 ZDT2、ZDT4、ZDT6、DTLZ1、DTLZ2、DTLZ3、Branin–Currin、Welded Beam、Vehicle Crash;对应输入维数分别为 9、6、6、8、6、4、2、4、5,目标数分别为 2、2、2、3、3、2、2、2、3。后两个是工程设计测试函数,Welded Beam 使用无约束版本,并非在线真实物理实验。
每种策略每个任务运行 20 次,同一次运行共享 30 个初始输入,之后追加 75 次函数评估。每个目标独立加入高斯噪声,标准差为初始设计上该目标均值绝对值的 1%。批量设置为 \(Q=3\)、25 轮,串行设置为 \(Q=1\)、75 轮;总评估预算相同,不是批量设置额外得到更多数据。
HV 衡量被支配区域体积,IGD 衡量参考前沿上的点到当前前沿最近邻的平均欧氏距离。原文使用高预算 NSGA-II 产生近似参考前沿,并报告相对初始误差的对数归一化指标差距:
这个量越低越好,起始误差比例为 1 时为 0;它不是直接的 HV 数值,也不是相对精确最优前沿的已知 regret。曲线为 20 次运行均值及上下一个标准差,不是置信区间。缓存只有图注和讨论,没有曲线逐点数值,因此不填造最终 HV/IGD 排名差值。
下表保留原文表 1 的可核实数字:批量模式每次完整优化运行的平均墙钟时间,单位秒。qMOJES 是文中 qLB-MOJES 的表格简称。
| 任务 | qHAX-UCB | qHAX-EI | qMOJES | qHVKG | qLNParEGO | qLNEHVI |
|---|---|---|---|---|---|---|
| ZDT2 | 230.41 | 226.79 | 1834.78 | 268.04 | 454.05 | 673.54 |
| ZDT4 | 214.38 | 219.12 | 2817.48 | 296.25 | 506.43 | 680.57 |
| ZDT6 | 221.89 | 214.73 | 8092.44 | 321.96 | 799.51 | 953.11 |
| DTLZ1 | 254.31 | 246.49 | 4636.83 | 424.22 | 372.96 | 711.56 |
| DTLZ2 | 243.24 | 243.02 | 4089.77 | 390.18 | 352.85 | 886.75 |
| DTLZ3 | 220.59 | 218.35 | 2943.21 | 229.57 | 507.18 | 506.37 |
| Branin–Currin | 246.04 | 242.39 | 2319.57 | 211.54 | 371.63 | 467.71 |
| Welded Beam | 226.48 | 223.13 | 3394.43 | 272.27 | 434.10 | 519.02 |
| Vehicle Crash | 242.42 | 235.32 | 4111.98 | 339.72 | 353.80 | 753.87 |
实验运行在 AMD EPYC 9654 CPU 集群上,每个实验运行分配 12 核及 160 GB 共享内存。该表不包含 MO-Hedge,不能据此认定组合方法与单个 qHAX 一样快;Branin–Currin 上 qHVKG 也明确比两种 qHAX 更快。
消融实验¶
本文没有给出逐一删除候选生成、超体积排名或贪心选择的定量消融。这里以原文表 3 的串行运行时间作设置分析,而非伪造模块消融;单位同为秒、每项平均 20 次运行。
| 任务 | qHAX-UCB | qHAX-EI | qMOJES | qHVKG | qLNParEGO | qLNEHVI |
|---|---|---|---|---|---|---|
| ZDT2 | 676.62 | 715.49 | 2945.64 | 558.25 | 126.52 | 185.74 |
| ZDT4 | 797.93 | 613.77 | 4469.76 | 668.50 | 265.70 | 186.82 |
| ZDT6 | 597.61 | 612.06 | 17750.69 | 817.01 | 228.30 | 523.60 |
| DTLZ1 | 685.13 | 717.91 | 6884.48 | 1074.03 | 378.68 | 453.49 |
| DTLZ2 | 668.83 | 684.98 | 6523.09 | 959.74 | 270.95 | 574.83 |
| DTLZ3 | 667.09 | 647.52 | 4010.11 | 615.54 | 167.90 | 127.60 |
| Branin–Currin | 721.12 | 729.20 | 3190.28 | 420.43 | 148.63 | 176.83 |
| Welded Beam | 576.17 | 584.69 | 4946.90 | 708.45 | 232.74 | 138.66 |
| Vehicle Crash | 775.76 | 674.66 | 5859.59 | 792.02 | 352.50 | 510.71 |
串行表中,qLNParEGO 和 qLNEHVI 在全部九个任务上都比两种 qHAX 更快。这限定了“低开销”的结论:qHAX 相比熵搜索开销较低,且能摊销批内候选生成,但不是串行优化的统一速度赢家。原文称运行时间对批大小基本不敏感;表格实际显示相同总评估预算下批量运行约需较少时间,应区分每轮候选生成成本与整次运行成本,不能把两者混为一谈。
MO-Hedge 1 的组合为 qHAX-UCB、qLNParEGO、随机采样;MO-Hedge 2 的组合为 qHAX-UCB、qHAX-EI、qHVKG、qLNEHVI。作者讨论指出前者即使包含弱成员也能跟随较强成员,后者整体表现稳定,但没有列出选择概率轨迹或历史奖励重算版本对冻结奖励版本的数字消融。
关键发现¶
- 作者对主图和附录的定性结论是 qHAX-UCB 更稳健,qHAX-EI 的表现更依赖任务,工程设计任务上仍有竞争力;这不是从文本中恢复的逐任务最终数值排名。
- 批量 HV、批量 IGD、串行 HV 和串行 IGD 的讨论方向一致,支持优势并非只来自批量选择;仍没有任何单个策略在所有任务上一致最优。
- qMOJES 的运行时间在两种设置中都显著较高;轻量设计的收益真实存在,但速度比较必须说明设置与基线。
- Hedge 结果说明策略组合可能提升稳定性,不能证明未报告的并行端到端开销可忽略,也不能验证其实际版本有标准 Hedge regret 界。
亮点与洞察¶
- 把“在哪里探索”和“哪些折中值得查询”拆开,给传统采集函数留下复用空间。这里可迁移的是接口设计,不是把任何任务简单换成均值超体积就能获得相同保证。
- 批内预测覆盖无需反复拟合模型,就能减少多个点争抢同一目标区域。它把次模集合选择的结构用在有限候选上的决策阶段,而非宣称解决了完整黑盒优化理论。
- 重新评价旧提名使没有被查询的策略也得到反馈,避免纯真实奖励过于稀疏。不过这种反馈依赖共享代理的准确性,稳定性收益与模型偏差会同时传播。
局限与展望¶
- 内层 NSGA-II 无法直接充分利用常见的梯度优化工具,作者建议进化搜索结合局部梯度细化。还需评估搜索预算改变后样本效率与墙钟成本如何共同变化。
- 预测均值 HV 不积分不确定性,标准化及参考点也会影响几何排名。可比较均值、后验样本和置信界排名,确认最终筛选是否压制了有价值的探索。
- 实验最多三个目标、九维输入、追加 75 次评估,不能外推到高维输入或 many-objective 场景;参考前沿也是高预算近似而非精确解。
- 缺少组件级消融、Hedge 端到端计时及其历史增长成本。需要在同等算力下比较组合大小、历史截断与奖励校准方式,并明确重算奖励版本的理论边界。
- 缓存里的算法 1 参考点记号、空候选分支,以及算法 2 历史时间下标需要实现层面澄清;这些问题不妨碍理解总体机制,但限制仅凭文字完整复现。
相关工作与启发¶
- vs ParEGO / qLNParEGO:前者通过随机权重标量化选择折中,qHAX 在采集向量空间先保留多个折中,再用目标空间覆盖筛选。串行计时则显示简单标量化仍有明显速度优势。
- vs EHVI / qLNEHVI:前者把后验不确定性纳入期望超体积改善,qHAX 只在候选生成阶段使用采集函数的不确定性信息,最终以均值 HV 排名。计算简化伴随对后验价值不同的近似,并非 EHVI 的等价实现。
- vs HVKG / JES:前者分别追求前瞻信息价值和帕累托信息增益,本文放弃这些复杂计算,利用有限候选上的局部几何选择。比较应同时考虑数值配置、运行时间和样本效率,而不是只看理论解释是否复杂。
- vs GP-Hedge:本文把单目标预测奖励替换为历史预测集合的超体积,并反复用当前后验重新校准。可研究冻结、折扣或滑动窗口奖励,但必须把策略选择 regret 与未知目标优化 regret 分开。
评分¶
- 新颖性: 4/5,贡献主要在轻量组合与决策接口,而非全新代理建模理论。
- 实验充分度: 3/5,九个任务与 20 次重复有价值,但缺少模块消融、完整复现参数和 Hedge 开销数据。
- 写作质量: 3/5,主要流程清楚,算法记号与串行运行时间概括仍需谨慎解释。
- 价值: 4/5,为复用成熟采集函数提供可实现路径,尤其适合探索小批量多目标优化。