跳转至

Behavioral Foundation Models for Quality Diversity

会议: NeurIPS2026
arXiv: 2609.35615
领域: 机器人/具身智能
关键词: 行为基础模型、质量多样性、潜空间搜索、后向推断、离线预训练

一句话总结

BFM-QD 冻结离线预训练的行为基础模型,在其潜码空间而非策略权重空间构建高质量、多样化的行为档案,并用闭式后向推断引导小步变异,在稀疏导航和接触操作中显著改善搜索,但仍需要环境 rollout 与预训练投入。

研究背景与动机

质量多样性(Quality-Diversity,QD)不是只找到一个奖励最高的策略,而是找到一组行为各异、各自表现良好的策略。例如,同样向前运动,可以采用不同足部接触比例;同样搬运方块,可以采用不同抓握角度。MAP-Elites 按行为描述符把空间分成格子,每格保留一个最优策略,因而得到的是可以选择、组合或用于适应的行为档案。然而,传统方法直接扰动神经网络的全部权重,搜索的大部分区域没有连贯行为;在需要持续导航或“接近—抓取—搬运”的环境中,随机权重扰动很难先产生有效轨迹。

CMA-ME 用协方差适应改进变异方向,PGA-ME 和 DCRL-ME 则学习在线 critic 来提供策略梯度,但它们仍需要在困难环境里获得足够信息。稀疏奖励意味着 critic 缺少正例,而从已有档案训练策略权重自编码器的 DDE-Elites 又受当前档案质量约束。本文因此没有继续改写 QD 的选择目标,而是改变其搜索对象:利用已从多样化离线交互中学到环境动态和行为结构的行为基础模型(Behavioral Foundation Model,BFM),让候选天然接近可执行技能,而不是从随机权重开始。

BFM 原本通常根据一个奖励函数提取一个任务潜码,再部署对应策略;它所包含的其他行为并未得到充分利用。QD 恰好需要遍历这些行为,但又不能把整个档案都推向同一个奖励最优点。核心 idea:把冻结 BFM 的行为潜空间作为 QD 搜索底座,并将闭式推断出的全局任务方向只小步混入各个父代,借助行为格竞争和随机变异保留多样性。

方法详解

整体框架

输入包括同一环境的离线转移数据、下游适应度函数、行为描述符和搜索预算;输出是按行为格组织的一组潜码,每个潜码都能调用同一个冻结 actor 产生策略。离线阶段先训练 BFM;QD 阶段只改变潜码,不更新 actor 权重,按“选父代—变异—归一化—环境评估—格内替换”循环构建档案。

框架本身允许任意 BFM 与 QD 优化器组合:FB-ME 用 Forward-Backward(FB)表示配高斯变异,FB-CMA-ME 用 FB 配 CMA-ME,TD-JEPA-CMA-ME 则替换行为底座。后向推断(Backward Inference,BI)是可选的定向变异器,不是所有 BFM-QD 变体都必须具备的独立训练模块。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    D["离线转移数据"] -->|仅离线训练| A["冻结行为底座"]
    A --> B["潜码档案与球面约束"]
    B --> C["小步后向推断"]
    R["历史评估轨迹"] -->|状态与奖励;闭式推断| C
    C -->|一半 BI;一半高斯| E["环境 rollout<br/>适应度与描述符"]
    A -.->|冻结 actor 执行候选| E
    E --> F["行为格竞争"]
    E -->|收集交互| R
    F -->|保留精英;选下一代父代| B

图中离线训练与下游环境评估是两种不同成本:BI 复用历史评估数据,但新候选仍需真正运行一个 episode。无需为 BI 训练 critic 或反向传播,不等于无需离线学习,也不等于不与环境交互。

关键设计

1. 冻结行为底座:先学会可执行的行为,再搜索行为组合

BFM 接收当前状态和潜码,输出动作;固定一个潜码就得到一个可持续执行的条件策略。它不是把潜码解码成另一份需要独立优化的网络权重,而是所有候选共享同一个 actor,行为差异由条件输入决定。主实验潜码维度为 50,相比参数空间基线约两万维,搜索和存储对象都大幅缩小,但 actor 本身并不因此变成一个只有 50 个参数的小网络。

FB 的前向表示描述在某个条件策略下未来会访问什么状态,后向表示把状态映射到可表达任务的特征空间。它们通过后继测度的时间差分一致性学习环境的长期动态,actor 再学习针对不同潜码行动。TD-JEPA 使用长期、策略条件的潜在预测表示,仍提供“改变任务潜码即可改变行为”的接口。本文的新意主要在复用这些接口做行为档案搜索,而不是重新发明 BFM 预训练损失。

冻结能够把同一环境的预训练成本分摊给多个奖励任务和随机种子,也使每轮搜索不必训练所有候选网络。代价是档案只能包含冻结模型可以表达的行为;如果底座未学会抓握,仅仅扩大搜索预算不能保证找到新的抓握技能。所谓 zero-shot 是已训练模型在下游奖励上的无额外模型训练提取,不是没有预训练的凭空学习。

2. 潜码档案与球面约束:变异对象换成潜码,评判标准仍来自真实行为

档案保存每格的潜码、适应度和行为描述符,而非策略参数。初始化时随机采样潜码;之后从已占据的格子中抽取父代,由高斯变异或 CMA-ME 产生子代,再调用冻结 actor 运行环境。格子索引由 rollout 的行为描述符决定,不是由潜码的某两个坐标决定,因此低维搜索空间与行为档案空间不能混为一谈。

BFM 训练对潜码施加定长约束,搜索后的潜码也必须回到同一个球面。对非零候选,归一化写为:

\[ z' \leftarrow \sqrt{d_z}\,\frac{z'}{\|z'\|_2},\qquad d_z=50. \]

这样,高斯扰动或线性混合不会仅靠不断增大潜码模长进入未按训练约束解释的区域。球面约束不是行为丰富性的来源:论文专门对比未训练 FB 和已训练 FB 的随机潜码,发现架构和几何本身不足以提供有效行为;真正有用的是离线数据学到的结构。

同样,降低维度本身也不是充分条件。DDE-Elites 的 VAE 潜空间也是 50 维,但主要编码当前档案里的网络权重;如果档案起初缺少抓取或导航行为,它就无法自动得到 BFM 那样覆盖环境动态的行为底座。

3. 小步后向推断:用全局奖励方向改进每个父代,而不是替换整个档案

普通高斯变异不知道哪个方向更符合当前奖励;在线策略梯度则需要训练 critic。BI 从所有过去评估轨迹的回放缓冲区采样状态—奖励对,把奖励投影到已学特征上。原文式(2)与算法 3 给出的闭式任务潜码为:

\[ z^*=\left(\mathbb{E}_{s\sim\rho}[\phi(s)\phi(s)^\top]\right)^{-1}\mathbb{E}_{s\sim\rho}[\phi(s)r(s)]. \]

这里的 \(\rho\) 是回放数据对应的状态分布,\(\phi\) 是底座学到的奖励表达特征。它相当于拟合最能线性解释已观察奖励的任务向量,不是针对每个行为格分别求一个最优潜码。原式使用矩阵逆;有限样本下可逆性和数值稳定性需要实现处理,笔记不把未说明的正则化细节补成作者算法。

得到的 \(z^*\) 是全局方向,但每个父代保留自己的起点:

\[ z' \leftarrow (1-\alpha)z+\alpha z^*,\qquad \alpha=0.02. \]

混合后再按上一设计投影回球面。如果直接把所有候选设成 \(z^*\),不同父代的行为差异将被抹去;小步混合则尝试让不同技能朝高适应度方向移动。每代一半子代使用 BI,另一半采用标准差为 1 的高斯变异,以避免搜索只沿同一个方向收缩。推断每次采样 10,000 个状态—奖励对,使用的交互来自既有评估,而不是额外执行专门的推断 rollout。

附录 A 将这一混合解释为局部二次代理目标上的阻尼 Newton 步:奖励须能被特征近似表示,理想条件策略须对应任务向量,且局部 Hessian 假定严格正定。真实目标与代理目标之间存在奖励投影残差,Taylor 展开也只提供局部近似;因此不能把 BI 写成与任意真实策略梯度全局严格等价,或保证所有父代每次都提升的算子。球面投影后更应依靠实际评估确认改进,而不是由推导替代实验。

4. 行为格竞争:奖励提高只有保留行为差异才构成 QD 改进

新候选执行后先确定行为格:格子为空就填入,已有精英则只在适应度更高时替换。即使候选全局奖励很高,如果大量候选落在同一个格子,也只能贡献一个精英。反过来,一个全局奖励较低但占据新行为格的候选仍可能扩大档案,这正是 QD 与单目标 CMA-ES 的区别。

三个评价量回答不同问题。覆盖率是已占据格子占全部格子的比例;QD-score 是所有已占据格子的精英适应度之和;最大适应度只看最好的一个精英。QD-score 同时受覆盖和格内质量影响,而最大适应度不衡量多样性。低 QD-score 也不自动意味着“从未成功”,必须结合任务、覆盖率和原始数值判断。

不同任务奖励量纲不同,论文逐任务取所有方法、所有种子的观察最小值和最大值作 min-max 归一化,再在同一环境内部平均;最大适应度曲线也用相同归一化方式。这个 0–1 值是相对于所比较方法的相对量,不是成功率,也不是已填格子比例,加入新方法后其标尺可能改变。

一个完整示例

以 Cube-single 的方块高度描述符和能耗适应度为例,底座先从离线 noisy 数据学到操作行为,QD 再寻找能把方块放在不同平面位置和高度、同时降低动作消耗的策略。档案保存的是描述符落入不同格子的潜码,不是“一个格子训练一个机器人”。

在一代 400 个候选的默认预算下,BI 变体将一半候选分配给小步后向推断,另一半给高斯变异。一个父代从自己的潜码向全局 \(z^*\) 混入 0.02 的比例,再回到半径 \(\sqrt{50}\) 的球面;它仍须执行 1,000 步 episode,才能知道是否保持了方块高度、能耗是否改善,以及最终应竞争哪一格。

即便候选比父代省能,如果它退回桌面、落入另一个行为格,也不会凭空改善原来的高处格子。回放缓冲区保留新轨迹供下一代 BI 使用,而档案只按真实描述符和适应度更新。该例说明奖励方向、行为多样性和真实环境反馈三者不能相互替代;这是流程示意,不是额外报告的实验轨迹。

损失函数 / 训练策略

BFM 离线训练与 QD 搜索分开。FB 用后继测度一致性目标联合学习前向、后向表示和条件策略;TD-JEPA 用时间差分的长期潜在预测目标学习表示和策略。本文在 QD 阶段不增加新的 actor 训练损失,BI 的奖励拟合也不需要重新训练神经 critic。

默认 FB 预训练为 2,000,000 个优化步,批量 1,024,学习率 \(10^{-4}\),折扣 \(\gamma=0.99\),EMA 系数 0.01。Walker 与 HalfCheetah 数据通过 RND 收集;AntMaze 使用 antmaze-medium-explore,Cube 使用 cube-single-noisy。奖励无关预训练不要求专家演示,但要求数据具有足够行为覆盖。

搜索使用原文声明的 \(50\times50\) 档案、500 代、每代 400 个完整 episode,共 200,000 次评估。Walker/HalfCheetah 每次 500 步,共 100M 转移;AntMaze/Cube 每次 1,000 步,共 200M 转移。原文同时列出 Ant 的四维足部接触描述符,但未在所读实现说明中解释其与二维网格配置如何对应,这一点应保留为复现疑问,不能自行补成已确认的四维离散方案。

单张 H100 上,附录表 16 报告 FB 一次性预训练 2.32 GPU-hours,FB-ME 每次搜索 1.63、FB-CMA-ME 1.83、ME 1.28 GPU-hours。首次 FB-ME 流程需要预训练加搜索,不能只报搜索时间来声称端到端更便宜;表中也未计入完整离线数据采集成本。复用底座可分摊训练,但每次 QD 搜索的环境评估仍然存在。

实验关键数据

主实验

四个环境共 18 个任务;下表从附录表 17–20 选取原始、未归一化 QD-score,均为 5 个种子的均值与标准差。不同列量纲不同,只能在同一列比较,不能把跨任务数值相加或当成功率。

方法 Walker 前向速度 HalfCheetah 后向行走 AntMaze 稀疏 Top Wall Cube 抓握风格
MAP-Elites 15253 ± 538 11874 ± 534 0 ± 0 6 ± 0
PGA-ME 13081 ± 535 14326 ± 473 0 ± 0 8 ± 1
DCRL-ME 14089 ± 456 13103 ± 479 0 ± 0 6 ± 0
DDE-Elites 13723 ± 132 8311 ± 125 14 ± 3 0 ± 0
FB-ME 16471 ± 175 11246 ± 228 61 ± 45 229 ± 103
FB-CMA-ME 15986 ± 169 13617 ± 201 611 ± 50 1073 ± 111
FB-BI 18908 ± 180 12514 ± 221 70 ± 48 255 ± 93
FB-PGA-ME 17906 ± 186 12520 ± 219 63 ± 43 255 ± 101

证据来自附录 E.12。在 AntMaze 稀疏 Top Wall 上,FB-CMA-ME 的 611 明显高于 ME 的 0,但 DDE-Elites 的 14 并非严格为零。Cube 抓握风格上,FB-CMA-ME 高于 FB-BI,说明闭式引导不意味着能替代所有协方差搜索优势。

原文正文“BFM-QD 变体始终领先”的概括比实表更强:HalfCheetah 后向行走中,PGA-ME 为 14326,FB-CMA-ME 为 13617,FB-ME 为 11246。笔记以表格为准,将结论限定为困难任务优势突出,而非每个变体、每个任务都胜出。

消融实验

下表来自附录 E.8 表 14,为 3 个种子的归一化 QD-score,比较围绕一个推断最优点采样与逐父代 BI。替代方法的 \(z^*\) 使用预训练数据计算,旨在避免搜索初期数据质量干扰;它与每代利用回放更新的 BI 不完全同条件,不能当作只改变几何操作的严格单因素消融。

配置 Walker Cube 说明
围绕 \(z^*\) 采样,\(\sigma=0.5\) 0.16 ± 0.03 0.09 ± 0.01 候选集中在全局推断点附近
围绕 \(z^*\) 采样,\(\sigma=1.0\) 0.18 ± 0.02 0.09 ± 0.02 增大局部噪声仍难覆盖行为空间
FB-BI 0.92 ± 0.04 0.96 ± 0.05 各父代分别小步移动,保留不同起点

这里的归一化值不可与主表原始值直接比较;也不把它与其他附录表的归一化汇总值拼接为一个统一榜单。差距支持保留父代行为结构的重要性,但不应解读为“BI 的真实成功率为 96%”。

关键发现

  • BI 与潜空间梯度更新的关系是任务相关的:Cube 抓握风格两者均值都是 255,Walker 前向速度则分别为 18908 和 17906,不能把“总体接近”写成每项指标严格相等。
  • 预训练检查点实验显示 QD-score 在最初 40k 步快速提升并较早饱和,而 zero-shot 表现继续改善;这是两个能耗任务的证据,不是所有环境无预训练即可工作的证明。
  • Walker 的 3 种子步长扫描显示 \(\alpha\in[0.005,0.1]\) 较稳定,更大步长损害多样性。随机潜码、未训练 FB 和插值实验的图形结论支持行为底座的结构作用,但这里不从曲线猜数值。

亮点与洞察

  • 改变搜索对象比继续修补权重变异更关键。BFM 提供的不是单纯降维,而是共享 actor 中已经形成的连贯行为,这让困难任务也能较早产生有效候选。
  • 全局任务方向与局部行为起点可以同时存在。BI 不把每个行为格单独训练成一个 actor,而是在共享特征中拟合奖励方向,再让档案保留多种出发点。
  • QD 所需的行为丰富性与 zero-shot 所需的价值精度不是一回事。前者先形成时,搜索可以弥补任务提取不够准确的问题,但这一解释仍依赖底座已有足够行为。

局限与展望

  • 冻结底座和离线数据限制行为表达;窄专家轨迹或 QD 采集数据未必适合预训练。适当在线扩展底座是可能方向,但会改变冻结表示和档案潜码之间的稳定关系。
  • 每个 BFM 对应一个环境,实验只覆盖仿真连续控制;跨环境通用性、真实机器人迁移和超出预训练数据的行为新颖性均未得到验证。
  • 奖励和行为描述符由外部给定,BI 又不直接按目标描述符推断任务。更大预算、数据采集成本、矩阵求逆稳定性及四维描述符的档案实现需要进一步明确。
  • 正文有绝对化领先表述,个别归一化附录比较也不宜跨表拼接。附录检查表未给出可核验的公开代码链接,复现不能仅依靠一个未提供的仓库地址。

相关工作与启发

  • vs MAP-Elites / CMA-ME:保留行为格竞争和变异搜索,但把策略权重替换为冻结 BFM 的潜码;CMA-ME 可以继续作为优化器使用,而非被整套替代。
  • vs PGA-ME / DCRL-ME:BI 不训练在线 critic,使用已有表示闭式推断奖励方向;DCRL-ME 的描述符条件引导则不是本文 BI 已经具备的能力。
  • vs DDE-Elites / PoMS:这些方法从档案策略参数学习低维表示;本文先从离线动态学到行为底座,再搜索条件策略。潜空间的训练对象和行为覆盖来源比潜维数本身更重要。

评分

  • 新颖性: 4/5 — 将 BFM 的单任务提取扩展为行为档案搜索,闭式小步变异有明确作用。
  • 实验充分度: 4/5 — 覆盖 18 个任务与多种表示、数据和算子分析,但部分对照并非严格单因素,缺少实机验证。
  • 写作质量: 3/5 — 方法主线清晰,正文绝对化结论与附录实表存在边界不一致。
  • 价值: 4/5 — 为复用离线控制模型建立多样化技能库提供可操作路径,但收益依赖预训练覆盖与成本分摊。