跳转至

Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark

会议: NeurIPS 2026 Evaluations and Datasets Track
arXiv: 2606.30170
代码: https://github.com/blaschma/TheNanotechnologyMolecularOptimizationBenchmark
领域: 计算生物学(分子优化;应用为纳米物理)
关键词: 分子优化、量子模拟、电极锚位、合成预训练、生成流网络

一句话总结

NMO 用三个受电极结合约束的纳米物理任务检验分子优化的真实迁移能力,并以显式锚位的 GGS 表示、随机分子预训练和遗传引导 GFN 找到具有物理研究价值的候选,但完整模型并非三个任务的 AUC 都最优。

研究背景与动机

分子生成领域常用 PMO 等药物任务评测优化能力,目标包括相似度、药物相关性质及其组合。这些任务的 oracle 通常计算便宜,模型又能利用 ZINC 等大规模药物数据学习强先验。因此,排行榜上的高分可能同时来自搜索能力、预训练分布接近答案,以及针对任务准备的词表,不能直接证明模型会在陌生科学领域发现新分子。NMO 选择纳米器件中的分子设计来暴露这一区别:对象不是孤立分子,而是与金电极形成接触的分子系统,连接位置本身会改变电子与振动传输。

过去,把这类问题变成通用机器学习基准的障碍不只是缺少数据。需要从分子字符串自动构建器件几何、完成结构弛豫,再计算量子传输或光谱;一次结构变化可能引起干涉特征的明显移动,导致奖励面崎岖、优化反馈昂贵。本文利用半经验 xTB 方法把这套物理流程封装成标量 oracle,使不熟悉量子物理的研究者也能提交候选。基准同时保留合成可及性、构象复杂度、器件几何和稳定性约束,不让算法仅靠极端结构获得漂亮分数。

作者进一步发现,药物先验的收益并不跨任务一致,而隐式选择电极锚位尤其限制双端连接任务。因此,论文不是只发布三种新评分函数,还提供可显式优化连接位置的表示与不依赖历史药物数据的训练路径。核心 idea:在统一预算与配置下,把“分子结构加电极锚位”作为搜索对象,用物理 oracle 区分真正的跨领域优化能力与药物分布先验带来的优势。

方法详解

整体框架

NMO 包含热电效率 TE、声子热输运 PH、分子光力学 MO 三个任务。输入为分子字符串及其连接信息,后端负责解析、添加金–硫醇锚基、弛豫和定向、构建物理系统、运行模拟,再返回 fitness 与可供科学分析的元数据。TE 与 PH 需要双端电极连接;MO 只有一端接到基底,另一端仍用于确定分子朝向与器件几何。

GGS 是可选接口而非参赛要求:标准 SMILES 加显式原子索引也可以指定锚位。论文中许多 SMILES 基线实际采用首尾非氢原子作为隐式锚位,不能把这些实验理解成“SMILES 无法描述显式锚位”的证明。作者的基线先在随机 GGS 图上预训练,再交替执行策略采样、图级遗传改进、oracle 评估和回放训练;DCD、DEX 与描述符辅助监督只影响训练和搜索,不是额外的物理评价指标。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["物理任务与统一协议"] -.->|规定 oracle 与预算| C
    A --> B["GGS与合成预训练"]
    B -.->|预训练权重| C["遗传引导的GFN"]
    C -->|策略采样与遗传候选| O["过滤与物理 oracle"]
    O -->|分数与候选| R["回放缓冲与最终候选"]
    R -.->|训练样本| D["自适应稳定与<br/>描述符监督"]
    D -.->|训练更新| C

实线表示数据或候选流程,虚线表示协议、初始化或训练信号。最终候选来自整个预算内的搜索记录,不能把图中训练回路误认为纯前向推理网络。

关键设计

1. 物理任务与统一协议:让分数对应可解释的器件性质

每个任务将目标物理量、合成可及性惩罚、可旋转键惩罚与硬约束相乘。硬约束失败直接得到零分,包含不能形成合理结几何、触发不稳定子结构过滤器,以及过小的 HOMO–LUMO 能隙;PH 实现中给出的能隙阈值为 0.2 eV。统一的可旋转键惩罚抑制难以控制的构象集合,因此优化的不是完全不受约束的物理极值。

\[ f_{\text{task}}(x)=c_{\text{task}}\mathcal{O}_{\text{task}}(x)\mathcal{P}_{\mathrm{SA,task}}(x)\mathcal{P}_{\mathrm{rot}}(x)\Theta(x),\qquad \mathcal{P}_{\mathrm{rot}}(x)=\frac{1}{1+e^{N_{\mathrm{rot}}-3.5}}. \]

PH 要求降低室温声子热导,物理目标取热导的倒数,SA 惩罚取 SA 的倒数,缩放常数为 0.5。其模拟由弛豫结构的质量加权 Hessian 得到振动信息,通过描述电极耦合的 Green 函数计算声子透射,再积分得到 300 K 下的热导。这解释了为什么改变连接位置、侧基质量或环间扭角会影响结果:它们改变传输通道,而不是简单增加某个药物描述符。

TE 要提高热电转换效率,需要同时保有电子输运与 Seebeck 系数,并压低电子和声子携带的热流。目标采用 Z,缩放常数为 0.01,SA 惩罚为从 SA=1 时的 1 线性降到 SA=10 时的 0。下面的关系也解释了 TE 与 PH 的关联及区别:PH 只针对声子项,TE 还必须避免通过抑制所有传输而一起破坏有用电流。文中物理候选通常报告无量纲的 ZT,而不是 fitness;两者不能混用。

\[ Z=\frac{GS^{2}}{\kappa_{\mathrm{ph}}+\kappa_{\mathrm{el}}},\qquad ZT=Z\,T. \]

TE 显式加入金电极簇,结合电子 Hamiltonian、重叠矩阵与电极表面 Green 函数计算电子透射,以获得电导、Seebeck 系数和电子热导。电极能级对齐十分重要:即使分子内部结构相同,不同接触几何也会改变费米能附近的透射,进而改变热电性能。NMO 的结构约束正是来自这种器件级物理,而非字符串的任意格式要求。

MO 寻找能将 THz/MIR 辐射上转换为可见/近红外信号的分子。有效振动模式必须兼有红外吸收和 Raman 散射能力;原文将 30–1000 cm⁻¹ 范围内模式的上转换强度求和、取对数并标准化,得到 P。几何项 F 则惩罚较长的腔间距 g 和较大的分子覆盖面积 S:前者降低场增强,后者减少腔内分子数。下式中的 S 是面积,与上式的 Seebeck 系数不是同一物理量;标准化参数来自既有参考分子集。

\[ P=\frac{1}{\sigma}\left(\log_{10}\left(\sum_{m\in M}I_m^c\right)-\mu\right),\qquad F=-\frac{2}{\sigma}\log_{10}(g)-\frac{1}{\sigma}\log_{10}(S). \]

MO 使用 P+F 作为物理目标,缩放常数为 1/4,SA 惩罚是 TE 线性惩罚的平方。后端用 GFN2-xTB 振动频率与 PTB 偶极、极化率导数估算光谱强度。这仍是可承受成本的近似模拟,而非实验测量或所有候选均通过 DFT 的保证。

协议要求每个任务、每个 seed 最多 10,000 次 fitness 评估,并报告五个连续、非挑选的 seeds。不得在优化前偷用昂贵 oracle 获取起点,不得使用任务专属数据或分别调超参数,三个任务必须使用相同配置与相同片段库。重复候选和廉价过滤器拦截的结构可以不消耗评估预算;PH 允许限制长度,以避免超长分子人为压低热导的退化解。

评价同时看 Top-10 AUC、终点 Top-10 平均 fitness、Top-10 平均 SA 和相关性指标 RI。AUC 衡量随 oracle 调用累积的前十名质量,兼顾样本效率与终点质量;RI 检查是否找到跨过领域阈值且满足 SA 门槛的候选。三个物理阈值分别是 TE 的 ZT>3、PH 的热导<0.25 pW/K、MO 的 P>7.88(xTB 层级)。SA 的实用门槛为 4.5,原文 RI 定义严格写为 SA<4.5;不能将四舍五入到 4.50 的候选直接判为合格。表中的 n/5 表示成功找到相关候选的 seed 数,不表示 Top-10 全部合格。

2. GGS与合成预训练:把可优化锚位和化学构造规则放进表示

Group SELFIES 用预定义片段、入连接位、出连接位以及分支返回 token 表示分子,但其后处理解析器可能在连接位不够时截断序列。于是,多个不同动作序列可能被映射到同一个缩短分子,训练奖励与原始生成意图脱节。GGS 改为维护片段级有向无环图,构造时追踪各片段可用连接位和价态,只允许符合约束的连接;图的 source、sink 与所选连接位自然承载电极锚位,不再让锚位成为评分前任意补上的信息。

这里的“构造即有效”有明确边界:成功建立的 GGS 图对应化学有效分子,但自回归 agent 仍可能生成无法转换成图的字符串,所以完整方法仍有非零无效率。化学有效也不等于稳定、可合成或能构成器件,仍需过滤、SA 与几何检查。当前实现还限制分支返回深度为一,不专门编码手性或立体化学;片段级 DAG 也不意味着片段内部不能有芳香环。

同样的图约束让遗传操作更有针对性。交叉交换合法切点两侧的子图;突变可替换片段、移动内部连接、改变电极锚位、插入或删除片段、增添侧支及修改端部片段,并检查所需连接位是否足够。尤其是锚位突变,直接把“同一骨架从哪里连接电极”纳入搜索。图级后代有效并不保证 fitness 非零,因为物理硬约束依然可能失败。

作者据此随机组装 300,000 个分子图,再转成 GGS 序列作为预训练数据,亦提供对应 SMILES 数据以便区分数据与表示的影响。随机组装只依赖片段库、连接规则及长度/分支限制,廉价稳定性过滤可在生成阶段使用,不需要预先计算目标量子性质。模型学习的是有效组装的语法先验,而不是记忆药物数据中哪些结构经常出现;“不依赖领域数据”也不等于没有任何先验,片段选择和随机组装分布仍是显式偏置。

片段库可以按实验室现有试剂构建“Chemist’s Shop”。NMO 的物理任务统一去掉含硫骨架片段,让硫保留在锚基中,减少替代金结合位点;库中包含乙炔等已知对分子输运重要的单元。这样得到可控、可讨论的搜索空间,但不能证明任意片段组合都已有可行合成路线,也不能将片段库携带的物理知识说成完全没有先验知识。

3. 遗传引导的GFN:让昂贵分数同时改善候选和生成策略

Genetic GFN 以奖励成比例采样为目标,而非只训练一个贪心生成器。在每轮搜索中,agent 自回归生成一批候选,去重、过滤后才提交 oracle;高分候选进入回放缓冲。遗传算法从缓冲中按排名选择亲本、交叉和突变,新的后代也经过过滤和 oracle 评估,足够好的结果继续进入缓冲。策略随后从缓冲中的轨迹学习,使遗传搜索发现的结构能反过来影响后续生成,而不只是一次独立的局部改进。

这种合作对昂贵、稀疏有效的物理任务很重要:单靠策略采样可能很少命中合理结几何,单靠遗传搜索又可能受初始种群限制。附录展示的代表性 TE run 中,策略先提供可用起点,约 3,000 次调用后遗传算法找到更高分结构;PH 中遗传交叉约在第 8,000 次调用产生好候选,随后策略继续探索该区域。这些是所选 run 的过程分析,不是对所有 seeds 的固定行为承诺。

作者用因果 decoder-only Transformer 替换原 GRU,采用 RoPE,并分出下一动作策略头和分子描述符回归头。GGS 的动作空间包含片段、入/出连接位、pop 与 end;物理任务去掉含硫片段后共有 91 种动作。关键不是“Transformer 更大所以更好”,而是模型能在带明确连接语义的序列上学习,并通过缓冲复用已有昂贵 oracle 的信息。

4. 自适应稳定与描述符监督:分别处理语法遗忘、模式坍塌与表示退化

物理奖励中的异常高分会使策略过快向少数轨迹移动,出现两种不同失败。DCD 在无效序列比例超过 35% 时,将回放训练从按排名抽样临时改为均匀抽样,并把批量大小扩大四倍,让模型重新接触较广的有效序列以恢复语法。DEX 在生成批次独特分子比例低于 30% 时,增大排名抽样系数,使采样分布变平,减轻重复采样和模式坍塌。它调整的是抽样策略,不应误写成直接提高 softmax 温度。

附录过程分析还给出退出滞回:DCD 在无效率降到 0.1 以下后解除,DEX 在重复率降到 0.3 以下后解除。作者移除原 Genetic GFN 的 KL 先验锚定,因为随机先验的意义在于提供化学语法,不值得要求优化策略始终贴近随机分子分布。稳定机制加上移除 KL 是一个联合变化,消融不能单独归因于 DCD 或 DEX。

描述符监督让 Transformer 从隐表示预测 17 个 RDKit 可廉价计算的分子性质,例如分子量、环数量、可旋转键、极性表面积与 LogP。目标按随机预训练集的均值与标准差标准化,避免数值大的描述符支配梯度;监督同时存在于预训练与任务优化阶段,不调用额外量子 oracle。其作用是维持可辨认的结构信息,而不是将 17 个描述符当成任务目标或额外输入标签。它有任务依赖性:TE 受益,MO 的 AUC 与终点分数反而下降。

损失函数 / 训练策略

预训练用序列负对数似然学习有效 GGS 语法;加入描述符时,两项损失的和乘以 1/2。任务阶段将物理 fitness 指数化为正奖励,使用简化轨迹平衡损失学习采样策略和可学习的归一化常数。以下式子对应原文,而不是自行添加通用 GFN 的其他项。

\[ R(x)=\exp(\beta f(x)),\qquad \mathcal{L}_{\mathrm{TB}}=\left(\log Z_{\mathrm p}+\sum_{t=0}^{T-1}\log P_{\theta}(s_{t+1}\mid s_t)-\log R(x)\right)^2. \]
\[ \mathcal{L}_{\mathrm{desc}}=\frac{1}{K}\sum_{k=1}^{K}\left(\hat y_{\mathrm d,k}-\frac{y_{\mathrm d,k}-\mu_k}{\sigma_k}\right)^2,\qquad K=17,\qquad \mathcal{L}_{\mathrm{opt}}=\mathcal{L}_{\mathrm{TB}}+0.1\mathcal{L}_{\mathrm{desc}}. \]

设置中奖励系数为 30,预训练 GGS 为 3 epochs,SMILES 为 5 epochs;预训练学习率 0.001、批量大小 128。任务优化的策略学习率为 0.0005,log 分区常数学习率为 0.1,梯度范数裁剪到 10,基础批量大小 64,回放容量 1,024。GGS 最大 token 数在 TE/MO 为 30、PH 为 18;PH 的特例属于协议允许的长度限制,不能直接按 token 数与原子级 SMILES 的 140 上限比较分子规模。

实验关键数据

主实验

下表摘录原文 Table 1 的 Top-10 AUC(均值±标准差)和 RI 成功 seed 数,每个任务均为五个 seeds、每 seed 10,000 次评估。不同任务有不同评分形式及缩放,AUC 不宜跨列比较绝对物理难度。SMILES 方法采用文中各自的既有设置,GGS molGA 同时更换遗传算子。

方法 TE AUC TE RI PH AUC PH RI MO AUC MO RI
f-RAG 0.00±0.00 0/5 0.02±0.01 0/5 0.10±0.06 0/5
GenMol 0.00±0.00 0/5 0.02±0.00 0/5 0.00±0.00 0/5
molGA,SMILES 0.13±0.10 1/5 0.07±0.01 0/5 0.57±0.14 5/5
molGA,GGS+图级算子 0.68±0.05 5/5 0.35±0.13 0/5 0.36±0.04 5/5
Genetic GFN,SMILES+ZINC 0.14±0.06 0/5 0.08±0.03 1/5 1.29±0.32 5/5
完整方法 0.78±0.23 5/5 0.33±0.16 4/5 0.42±0.08 5/5

完整方法 TE/PH/MO 的 Top-10 平均 fitness 分别为 1.19±0.42、0.75±0.48、0.59±0.16,平均 SA 为 4.06±0.30、3.37±0.42、4.40±0.37。原 Genetic GFN 的 MO AUC 更高,但平均 SA 为 4.55±0.39;平均超过门槛与 RI=5/5 并不矛盾,因为 RI 要求存在合格候选,不要求前十名全体通过。表中 0.00 是四舍五入结果,不代表没有任何正分。

消融实验

下表对应附录 Table 4 的累计配置;TE 无效率是最终一步样本的无效率,非所有 oracle 调用的失败比例。表格选择关键指标以避免把所有实验数字重复铺开。

累计配置 TE AUC TE 无效率 PH AUC MO AUC
原 Genetic GFN,SMILES+ZINC 0.14±0.06 0.37±0.26 0.08±0.03 1.29±0.32
+合成数据,仍用 SMILES 0.22±0.07 0.32±0.17 0.10±0.04 0.62±0.31
+GGS 0.63±0.22 0.46±0.33 0.52±0.22 0.55±0.10
+Transformer 0.65±0.13 0.53±0.36 0.31±0.15 0.69±0.29
+DCD/DEX,移除 KL 0.60±0.11 0.19±0.07 0.32±0.18 0.74±0.13
+描述符,完整方法 0.78±0.23 0.21±0.13 0.33±0.16 0.42±0.08

仅换合成数据并未解决 TE/PH,且 MO 从 1.29 降到 0.62;换 GGS 后 TE/PH 明显改善,但这一阶段同时改变表示、锚位语义和遗传操作,不能证明增益全部来自某一个孤立因素。Transformer 后加稳定机制与移除 KL,TE 无效率由 0.53 降至 0.19,AUC 并未随之提升;描述符进一步将 TE AUC 提到 0.78,却将 MO AUC 从 0.74 降到 0.42。

关键发现

  • 完整方法在三种任务都找到了相关候选,但不是每个 seed 都成功:PH 为 4/5,也不是 PH/MO 的最高 AUC 配置。
  • 片段库分析中,去掉乙炔后 PH AUC 从 0.33±0.16 降到 0.11±0.01,RI 从 4/5 变为 0/5;TE、MO 仍为 5/5。这是重要物理构造单元的贡献,不应被随机预训练“无偏”措辞掩盖。
  • 展示的 TE 候选在 300 K 下 ZT=8.50、SA=3.9;PH 候选热导为 0.0990 pW/K、SA=3.18;MO 候选的 PTB/DFT P 分别为 9.91/8.31、SA=4.35。它们是选出的物理案例,而非 Top-10 平均指标。
  • MO 对 180 个跨运行的高分候选做 DFT 验证,其中 78 个 P>7.88;部分 PTB 预测为 26–29 的结构在 DFT 下仅为 5–12,说明 oracle 高分尾部不能直接相信。
  • 原文存在需保留的表述边界:Table 4 的部分 RI 标记为“✗(1/5)”或“✗(3/5)”,与 Table 1 的勾号惯例不完全一致,本笔记以计数为准;PH 的正文“超过文献”也不能理解成纯热导最小值纪录,因为附录同时报告既有候选 0.07 pW/K、SA=4.4。本文候选主要改善了合成可及性与综合实用性,而非比 0.07 更低。

亮点与洞察

  • 电极锚位不是附属元数据,而是优化变量。这个结论可迁移到表面吸附、连接位点或接触几何决定性能的逆设计任务,不必绑定 GGS 这一具体编码。
  • 随机分子预训练切断历史药物分布与任务表现的部分联系,同时保留化学组装规则。其价值是把隐式分布偏置转成可审计的片段与组装偏置,而非宣称彻底无先验。
  • RI 将科学候选发现与排行榜积分分开。高 AUC、较好平均 SA 和发现一个值得后续验证的结构是不同目标,NMO 同时报告它们,使任务取舍可见。

局限与展望

  • xTB/PTB 是高通量近似,不提供实验准确性保证;MO 在 P>15 的尾部常明显高估,TE 又对能级对齐与电极模型敏感。应以更高层级计算和实验筛选最终候选。
  • PH 的超长分子退化区需要长度限制;SA 与过滤规则无法穷尽稳定性、真实合成路线及器件形成条件。片段“可购得”不意味着整个分子“已可合成”。
  • GGS 的分支深度、立体化学支持及固定片段库限制探索范围;乙炔消融显示库的领域知识确实影响结论。显式锚位的 SMILES 或开放词表方法值得进一步比较。
  • 五个 seeds 与较大的标准差限制统计把握;累计消融存在联合改变,缺少完全正交的表示、锚位、算子与 KL 因子实验。单 seed 的运行约为 TE 24、PH 50、MO 40 小时,均在文中指定的 36 核 CPU 条件下,跨硬件不能直接套用。

相关工作与启发

  • 对比 PMO:PMO 提供廉价药物代理目标,NMO 改成器件物理模拟并限制任务专属调优。本文完整方法在 23 个 PMO 任务的总 AUC 为 14.70±0.18,低于原 Genetic GFN 的 15.81±0.34,支持“仍能使用”,而不是通用性能全面提升。
  • 对比 TARTARUS:两者都试图走出简单代理 oracle;本文强调无需任务专属数据或起点,并把电极结构与三任务统一协议纳入评测。
  • 对比 Group SELFIES / Genetic GFN:前者提供片段字符串基础,本文把有效性约束移到图构造并加入原生锚位;后者提供策略与遗传搜索的混合框架,本文改变表示、先验与稳定训练机制,不能将整个基线当成全新 GFN 算法。

评分

  • 新颖性: 4/5 — 物理任务、电极锚位与严格迁移协议的组合具有辨识度。
  • 实验充分度: 4/5 — 多方法、累计消融和部分 DFT 验证充分,但正交控制与统计规模仍有限。
  • 写作质量: 4/5 — 基准与附录机制解释清楚,RI 符号和部分科学优越性措辞需谨慎解读。
  • 价值: 4/5 — 为陌生分子空间提供可复现评测入口,真正器件价值仍待后续验证。