PocketVE: Stable and Property-Guided Structure-Based Drug Design with Variance-Exploding Diffusion¶
会议: NeurIPS 2026(任务清单归属;所读版本为 arXiv v3)
arXiv: 2609.08101
领域: 计算生物学 / 结构基础药物设计
关键词: 口袋条件生成、方差爆炸扩散、几何稳定性、无分类器引导、口袋扰动
一句话总结¶
PocketVE 将保留蛋白–配体共同坐标尺度的 VE/EDM 去噪、训练期口袋扰动和推理期多性质 CFG 联合起来,在 CrossDocked2020 上相对 guided TAGMol 将三维有效率从 58.6% 提高到 80.6%、应变能从 457.4 降至 127.9,但不宣称这些收益可单独归因于 VE,也不宣称全面领先所有对接指标。
研究背景与动机¶
结构基础药物设计不是只生成一张合法分子图,还要把配体放进指定蛋白口袋,使内部构象和外部空间关系同时合理。TargetDiff 等非自回归方法能够联合去噪全部原子;TAGMol 则用外部性质预测器的梯度引导生成。然而,对接评分下降并不保证生成构象可信:模型可能通过扭曲键长、局部构象或口袋内位置获得较好的代理分数。重新对接还可能掩盖原始生成姿态的问题,因此需要把分子性质、三维构象和蛋白–配体冲突分开检查。
这使引导与去噪骨干不能被视为互不相关的插件。性质引导直接改变没有像素取值边界的欧氏坐标,而蛋白口袋又是显式的空间条件;如果配体输入被按通用 EDM 规则缩放、蛋白坐标却保持原样,网络看到的跨分子距离就不再对应原始物理尺度。与此同时,把单个晶体结构当作完全精确的条件,也可能让去噪器过度依赖脆弱的局部坐标细节。
PocketVE 因而研究的是一个集成系统的性质–几何运行曲线,而不是证明某个扩散家族天然优越。它沿用 TAGMol 的等变架构,改变坐标参数化、尺度处理、采样器、优化器和引导方式,并用多种诊断检查收益来源。核心 idea:先建立口袋坐标一致、对小扰动平滑的混合去噪器,再通过同一模型的性质条件分支与空性质分支做 CFG,让控制强度成为推理期可调的性质–几何权衡。
方法详解¶
整体框架¶
输入是蛋白口袋的原子坐标与特征,输出是配体原子坐标和类别;原子数量由口袋大小条件先验采样,并非本文主要新机制。配体位置以口袋中心为参照,而不是逐配体独立归一化。坐标使用方差爆炸扩散(variance-exploding diffusion,VE),类别使用离散流匹配(discrete flow matching,DFM);两条分支共享 TAGMol 的等变特征。
系统有三个相互配合的设计:训练时的口袋扰动正则、贯穿训练与采样的口袋尺度 VE 骨干、仅在推理时放大性质偏好的多性质 CFG。训练时,干净配体被加噪,口袋被小幅扰动,模型学习恢复原坐标和原子类别;采样时,从口袋中心附近的噪声状态出发,逐步减少噪声,必要时对预测结果进行 CFG。主设置不向测试口袋添加训练式扰动。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
P["蛋白口袋"] -->|仅训练| A["口袋扰动正则"]
P -->|推理保留原口袋| B["口袋尺度 VE 骨干"]
A --> B
X["配体状态"] -->|训练加噪 / 推理噪声初始化| B
B -->|训练:坐标与类别监督| L["联合去噪损失"]
B -->|推理:条件与空性质预测| C["多性质 CFG"]
Q["性质目标分位桶"] --> C
C -->|Euler 坐标更新 + DFM 类别更新| O["配体坐标与类别"]
关键设计¶
1. 口袋扰动正则:避免去噪器依赖单个精确晶体坐标
训练时只对口袋原子坐标施加小幅高斯噪声,原子特征不变,配体监督目标仍是原始干净配体。主设置的口袋噪声标准差为 \(\sigma_p=\min(0.1\sigma,0.5)\),其中 \(\sigma\) 是当次配体噪声尺度。高配体噪声阶段允许口袋条件更粗糙;低噪声阶段则减少扰动,以免把最后需要辨别的空间约束抹平。上限限制了增强幅度,而非把蛋白本身建模为一个共同生成对象。
其理由是输入噪声可以促使预测对邻近口袋坐标变化更平滑。附录 E 在光滑损失与小扰动假设下给出二阶展开:附加项与口袋方向的损失 Hessian 有关;在平方损失、残差较小的情形下,其中包含非负的 Jacobian 敏感性项。这是局部正则化解释,不能升级为“学到了真实蛋白构象集合”或“对任意口袋噪声保持不变”。较强扰动还会损害目标特异性,实验也不支持它在所有指标上同时占优。
2. 口袋尺度 VE 骨干:稳定去噪不能破坏跨分子的空间尺度
坐标前向过程直接在干净配体位置上加标准差为 \(\sigma\) 的高斯噪声,不逐步衰减干净坐标。原子类别则按相同噪声水平在保留原类别与均匀类别扰动之间混合;噪声越大,类别信息越少。共享等变网络同时预测干净坐标和干净类别 logits,使几何恢复与原子身份恢复相互关联,而不是对类别做连续坐标式回归。
普通 EDM 的输入归一化有一个口袋条件场景特有的问题:低噪声时只缩小配体、没有同步缩小蛋白,会改变蛋白–配体距离。PocketVE 保留 EDM 的输出预条件化,却将输入改为下面的尺度保持形式(正文第 3.2 节、附录 B):
当噪声趋近零,输入缩放系数趋近一,配体重新处于与未缩放口袋一致的尺度;高噪声时仍能抑制输入幅度。固定 \(\sigma_{\mathrm{data}}=10.0\) 用来覆盖配体内部范围和配体相对口袋中心的偏移,而不是声称所有分子的实测标准差都是 10。附录 B 进一步说明,实现中预测的是缩放坐标系中的位置,输出重构先减去缩放输入,再通过 EDM 残差与 skip 项映射回原始坐标。这与正文把网络抽象为残差预测器的记法应区分,不能直接把网络绝对位置当残差使用。
采样时,坐标分支从当前状态与干净预测的差构造更新方向,再沿递减噪声日程做一阶 Euler 更新;类别分支根据预测分布做 DFM 离散更新。主设置使用 100 步广义 arcsin 日程,噪声范围为 \([10^{-3},800]\),日程参数为 \(\beta=2.2\)、\(p=0.57\)。附录 H 还报告去掉采样期噪声处理会显著恶化结果,因此不能把该系统描述为“任意确定性 Euler 采样都一样”。全文没有在采样细节中完整展开这一噪声注入的实现参数,本笔记不补造更新式。
3. 多性质 CFG:用一个模型控制性质,而不是额外训练多个梯度头
Vina、QED 和归一化 SA 各自按训练集分位数划成五个桶,三个桶索引组成辅助条件。训练时以 0.5 概率联合丢弃这些性质条件,但始终保留蛋白口袋。因此所谓空条件分支只是“不指定性质”,不是“不指定靶点”。推理时,模型分别给出指定性质和空性质下的坐标预测,按下面的关系组合;这里 \(D_{\mathrm{cond}}\) 与 \(D_{\mathrm{null}}\) 都是在同一口袋和同一噪声状态下的预测。
\(s=0\) 是空性质分支,\(s=1\) 是普通性质条件模型,\(s>1\) 才是外推式引导。类别分支在 logits 空间做同样的线性组合,然后 softmax,而不是直接外推已经归一化的概率。这样不需要额外的噪声相关性质预测器,也避免外部梯度头在数值尺度与最大化/最小化方向上的逐头校准;但条件偏差依旧会被放大,强引导并不会自动满足分子几何约束。
主实验请求低 Vina、高 QED、高 SA 的有利桶,使用 \(s=5\) 作为代表运行点。正文按原始性质方向描述“最低 Vina 桶”,附录 O 则声明桶编号越大越有利,并用 \((4,4,4)\) 表示有利联合请求;这两个表述不能据以猜测代码中的原始索引方向。附录 O 还注明训练 Vina 边界使用 Vina Dock,分布诊断却使用 Vina Score,因此这些结果能支持方向性控制,不能当作严格的 Vina 桶命中率或三个性质独立、校准的控制器。
损失函数 / 训练策略¶
训练目标是噪声相关加权的坐标重建平方误差与原子类别交叉熵。坐标权重按 EDM 输出预条件化系数的平方倒数设置;口袋扰动与性质条件丢弃通过训练输入进入这一目标,不需要另加一个真实结合能监督损失。小扰动的正则化解释也不意味着实现显式计算了 Jacobian 惩罚。
作者训练 400,000 步,batch size 为 4,每 2,000 步验证,选择验证损失最低的 checkpoint。隐藏二维权重矩阵使用 Muon,学习率 \(10^{-3}\);其余参数使用 AdamW,学习率 \(10^{-4}\)。验证损失连续 20,000 步无改善时学习率乘 0.6;单张 A100 上训练约 24 小时。改变 CFG 强度复用同一个 checkpoint,而改变训练期口袋扰动需要对应训练配置。
实验关键数据¶
主实验¶
使用经过姿态与序列相似性筛选的 CrossDocked2020 标准划分,评测 100 个测试口袋,每个采样 100 个配体。对有公开生成分子的基线,作者在共同测试划分、对接与 GenBench3D 流水线下重新评测;这不等于所有方法都按统一训练预算重新训练。
指标必须分开理解:Vina Score、Vina Min、Vina Dock 是不同评估变体,越低越好;QED 是类药性,本文归一化 SA 越高越易合成。High Affinity 是每个口袋中 Vina Dock 不差于参考配体的比例;Joint-Ref 进一步要求 QED 和 SA 也分别不差于同口袋参考配体,再对口袋汇总。Joint-Ref 不是固定阈值 Hit Rate,也不是三维有效率。
几何指标中,Valid\(_{3\mathrm{D}}\) 表示通过 GenBench3D 三维构象检查的比例,包括参考分布下的键长、价角等检查;应变能衡量生成构象的内部能量代价,越低越好。GenBench3D clash-free 是该协议的无冲突比例;质心距离用来检查位置偏移,不能等同于原子级姿态 RMSD。JSD 比较生成与参考分子的距离或原子类别分布,是分布保真度,不是逐分子的物理有效性证明。
下表节选原文表 1;Vina Score、Vina Dock、QED、SA 为中位数,Joint-Ref 为口袋平均比例,应变按原表尺度报告。
| 方法 | Vina Score | Vina Dock | QED | SA | Joint-Ref (%) | Valid\(_{3\mathrm{D}}\) (%) | 应变能 | GenBench3D clash-free (%) |
|---|---|---|---|---|---|---|---|---|
| TargetDiff | -6.30 | -7.91 | 0.48 | 0.58 | 5.7 | 78.4 | 306.0 | 86.41 |
| TAGMol(guided) | -7.77 | -8.69 | 0.56 | 0.56 | 7.1 | 58.6 | 457.4 | 93.21 |
| PocketXMol | -6.14 | -7.59 | 0.51 | 0.80 | 未提供 | 67.0 | 80.0 | 93.46 |
| PAFlow | -8.92 | -9.49 | 0.50 | 0.57 | 8.9 | 47.4 | 1834.6 | 96.46 |
| PocketVE(\(s=5\)) | -7.89 | -8.89 | 0.64 | 0.71 | 26.4 | 80.6 | 127.9 | 94.02 |
相对 TargetDiff,按完整口袋配对 bootstrap 得到三维有效率差为 +2.25 个百分点,95% CI 为 [-0.75, 5.13],不能声称显著更高;应变降低为 178.10,CI 为 [150.38, 203.44],是更清晰的收益。相对 guided TAGMol,平均 Vina Score 优势为 0.43,但 CI 为 [-0.02, 1.07],也不支持严格对接领先。PocketXMol 的应变与 SA 更好,PAFlow 的 Vina 更好,进一步说明 PocketVE 并非全面支配其他方法。
消融实验¶
下表节选附录表 5,复用相同 checkpoint 与采样设置,较适合观察纯推理期引导变化;性质与 Vina 为中位数。
| CFG 强度 \(s\) | QED | SA | Vina Score | Valid\(_{3\mathrm{D}}\) (%) | 应变能 | GenBench3D clash-free (%) |
|---|---|---|---|---|---|---|
| 0 | 0.48 | 0.63 | -6.70 | 78.64 | 164.9 | 90.59 |
| 1 | 0.60 | 0.70 | -7.20 | 77.99 | 127.4 | 90.74 |
| 5 | 0.64 | 0.71 | -7.89 | 80.60 | 127.9 | 94.02 |
| 10 | 0.64 | 0.72 | -8.12 | 78.54 | 137.7 | 95.03 |
| 20 | 0.60 | 0.69 | -7.61 | 72.04 | 187.5 | 94.51 |
累计消融表 2 从 unguided TAGMol 到无扰动、无 CFG 的 PocketVE 骨干,三维有效率为 65.56% → 69.62%,应变为 401.3 → 274.4;再加广义 arcsin 日程后为 77.75% / 179.1。这是参数化、尺度、采样与优化的组合变化,不是 VE 的单变量因果实验。最终加口袋扰动,相对无扰动 \(s=5\) 设置,有效率为 77.33% → 80.60%,但应变为 125.9 → 127.9,说明扰动不是所有指标都改善。
口袋尺度诊断(附录表 17)更能体现内外几何的区别:去掉尺度保持因子,平均 Vina 从 -7.589 变为 +92.237,clash-free 从 94.23% 降至 3.39%,而三维有效率反而从 78.72% 到 82.39%。这些是 100 口袋 × 10 配体的单独诊断,不应混入主表;内部构象合格仍可能完全不适配蛋白口袋。
原文报告口径存在需保留的差异:表 2 的累计 \(s=1\) 行为 Vina -7.41、有效率 78.55%、应变 137.8,而表 5 为 -7.20、77.99%、127.4,两表并非可互换的同一行。附录表 7 的三次运行汇总另报 Vina -7.734 ± 0.0150、有效率 79.27 ± 0.68、应变 124.7 ± 1.29,并称表 1 属于三次之一;该 Vina 离散度与表 1 的 -7.89 难以协调,需作者核实,不能自行修正数值。
关键发现¶
- 引导不是越强越好:\(s=10\) 的 Vina 比 \(s=5\) 更低,但有效率下降、应变升高;\(s=20\) 时性质与几何同时回退。JSD 诊断也显示强引导增加参考分布偏移。
- 原始姿态的 PoseCheck 无冲突率仅为 PocketVE 4.54%、TargetDiff 1.65%(附录表 10);这与主表 GenBench3D 的 94.02%、86.41% 是不同指标,不能混称“无蛋白冲突率”。总接触数量更高也不必然代表结合更好。
- \(s=5\) 采样每个口袋的 100 个配体需 234.1 秒,\(s=1\) 为 127.8 秒,TargetDiff 为 1382.5 秒;条件外推增加双分支计算。时间来自单 A100、batch size 10、无混合精度,排除对接、MMFF 与后处理。
亮点与洞察¶
- 内部几何与口袋兼容性不是同一轴。尺度诊断展示了“有效分子却处于错误空间”的失败方式,因此只优化三维有效率仍不够。
- 空性质分支仍然看到口袋,使 CFG 调整的是同一靶点下的性质偏好。这个条件拆分比把所有条件一起丢弃更符合任务目标。
- 把引导尺度画成运行曲线比单一最佳分数更有信息量。对其他科学坐标生成任务,也可以同时报告偏好指标、内部几何和外部条件兼容性。
局限与展望¶
- 主要证据来自一个过滤后的 100 口袋基准,性质控制依赖对接代理,没有实验结合验证;\(s=5\) 是测试基准扫描中的描述性选择,而非独立验证集选择。
- VE、尺度、噪声处理、日程和优化器同时改变,现有实验不能建立 VE-only 因果归因。后续需要匹配骨干、优化器、原子数和采样预算的组件对照。
- 高斯口袋扰动只是局部增强,不是蛋白柔性动力学模型;严重测试口袋噪声仍会损害 Vina 与冲突指标。
- 条件桶存在耦合,附录 O 的联合有利请求也只有有限的性质桶命中率;Vina Dock 训练边界与 Vina Score 诊断不一致,更不支持严格的三目标校准控制。
- 附录 A 式 (15) 的外部引导系数为 \((1+w)\),式 (18) 却写为 \(w\),正文式 (7) 也用 \(w\);推导中系数约定不一致。本文只采用明确的 CFG 实现式,不替作者修补外部引导推导。
相关工作与启发¶
- vs TAGMol:共享等变去噪架构,但 TAGMol 依赖外部梯度引导;PocketVE 联合调整坐标骨干、采样和性质条件方式。父模型比较有工程解释力,却不能隔离 VE 本身的贡献。
- vs TargetDiff / PAFlow:TargetDiff 提供较强几何参照,PAFlow 提供较强对接参照。PocketVE 的价值是更有利的多指标折中,而不是把对接或几何中的某一项当成充分条件。
- vs VEDA / EDM:标准预条件化被带入有显式蛋白坐标的场景,关键新增问题是共享坐标尺度。将生成样本与条件对象放在同一个几何图中时,归一化也必须检查跨对象距离是否被改变。
- 与 GenBench3D / PoseCheck 的关系:两者分别补充构象质量与原始蛋白–配体姿态诊断。口袋置换是生成后的特异性检查,不是重新条件生成的实验,也不是网络组件因果对照。
评分¶
- 新颖性: 4/5;集成机制有明确的口袋几何适配,但核心工具多数来自已有扩散与 CFG 方法。
- 实验充分度: 4/5;有多轴消融、分布与原始姿态诊断,仍缺组件完全匹配和独立验证选择。
- 写作质量: 3/5;论证边界较克制,但跨表数值、运行方差与引导推导存在需核实之处。
- 价值: 4/5;提供了研究性质控制与几何稳定性耦合的实用框架,不等同于已验证药物发现效果。