KDD 2026 | PRIME:一种用于从头设计binder的 3D 分子模型

《PRIME: A Pretrained Representation-Induced Model for 3D Molecules in De Novo Binder Design》 这篇论文主要解决的是大分子(如多肽、抗体)的三维结构生成与结合物(Binder)从头设计 问题。研究团队提出了一种名为 PRIME 的新框架,通过引入预训练的基础模型和一种创新的采样策略,大幅提升了生成分子的亲和力(功能性)、几何合法性(结构真实度)和多样性。

链接:https://dl.acm.org/doi/10.1145/3770855.3818887


1. 研究背景与核心挑战

在药物设计中,生成能够与特定靶点紧密结合的多肽或抗体(Binder)是一项核心任务。近年来,潜在扩散模型(Latent Diffusion Models, LDMs) 在3D分子生成中大放异彩。但现有的LDM方法(如UniMoMo等)面临两个致命的挑战:

  • 挑战一:"可扩散性鸿沟"(Diffusability Gap):
    现有的LDM通常会从头训练一个自编码器(Autoencoder),将3D坐标压缩到潜在空间,然后在该空间中进行扩散。由于这个编码器仅仅是为了"最小化重构误差"而训练的,它学到的潜在空间往往充满了高频的、不规则的局部变化,缺乏生化物理规律的语义约束。这导致扩散模型很难在这个"崎岖"的空间中平滑地生成合法的分子结构。
  • 挑战二:各向同性噪声与静态条件约束的局限:
    • 传统的扩散模型在采样初始化时使用各向同性高斯噪声 (各方向随机的白噪声),但这忽略了蛋白质是线性链状拓扑结构这一物理事实,导致模型在去噪早期需要耗费大量精力去修复断链等局部破损。
    • 在条件生成(如给定受体口袋生成结合物)中,传统方法在整个去噪过程中施加恒定强度的条件引导。这在早期会导致模型过于僵化,无法探索更多样的结构空间,陷入局部最优。

2. 核心创新点 (Contributions)

为了解决上述问题,作者提出了 PRIME 框架,其核心贡献可以概括为"一个替换"和"两项策略":

  1. 引入基础表示骨架(Foundation Representation Backbone):
    打破"从头训练编码器"的惯例,直接使用冻结的(Frozen)3D预训练大模型(本文使用的是 EPT,Equivariant Pretrained Transformer)作为特征提取器。这样可以直接继承大模型在大规模无监督学习中掌握的强大物理、几何和生化先验知识,彻底跨越"可扩散性鸿沟"。
  2. 提出语义保持探索性采样(SPES, Semantics-Preserving Exploratory Sampling):
    这是一种在推理采样阶段的创新策略,包含两个子模块:
    • GLSN (图拉普拉斯谱噪声): 用于改进初始噪声,使其符合蛋白质链的拓扑结构。
    • CFM (条件自由度调制): 用于动态调整条件引导的强度,平衡"探索多样性"与"保证生成质量"。

3. 方法论详解 (Methodology)

图1:PRIME 框架概览。
A,训练流程采用了一个冻结的基础编码器(Foundation Encoder)从输入结构中提取"语义-几何"潜在表示,并在此基础上优化可训练的潜在扩散模型(Latent Diffusion Model)和几何解码器(Geometric Decoder)。
B,在"语义保持探索性采样(SPES)"的推理流程中,以图拉普拉斯谱噪声(GLSN)作为初始噪声起点,逆向扩散过程在"条件自由度调制(CFM)"策略的控制下,逐步对噪声变量进行细化(去噪),随后由几何解码器重构出最终的全原子结合物(binder)结构。
C,为了进一步阐明 SPES 模块的机制:GLSN 会构建一个链状图并计算其拉普拉斯矩阵,旨在将初始噪声投影到低频模式上,从而注入"感知主链连通性"的扰动。逆向扩散轨迹会迭代地细化含噪潜变量,同时,CFM 会根据中间预测结果评估每个分子块(per-block)的结构稳定性,并动态调整条件上下文:通过放宽对不稳定区域的约束,同时收紧对稳定区域的引导,以此来增强生成结果的多样性。

A. 基础表示骨架 (Foundation Representation Backbone)
  • 做法: 给定一个输入的3D分子结构,先用冻结的 EPT 编码器将其转化为包含语义特征和3D坐标的 block-level(残基/分子块级别)潜在表示。
  • 训练两步走:
    1. 训练一个 几何解码器 (Geometric Decoder),学习如何把上述固定潜在表示还原回真实的3D全原子结构。
    2. 在这个固定的潜在空间中,训练一个 潜在扩散模型 (Latent Diffusion Model)
  • 优势: 因为 EPT 编码器是不参与训练且已经具备极强生化常识的,所以在这个空间里进行扩散,生成的分子天生就更符合物理法则(如不会轻易发生原子碰撞)。
B. 语义保持探索性采样 (SPES)

这是在模型训练好后,生成(推理)阶段的技术:

  1. GLSN(Graph Laplacian Spectral Noise - 拓扑感知初始化):
    • 原理: 蛋白质是一条链。作者利用图信号处理技术,构建了一条链状图,并计算其图拉普拉斯矩阵。
    • 作用: 在扩散过程的第 TTT 步注入初始噪声时,不再使用纯白噪声,而是将其投影到该图的低频模式上(类似"粉红噪声")。这种低频噪声保留了全局的骨架连贯性,避免了局部高频振荡。相当于告诉模型:"你一开始面对的虽然是噪声,但它是一条像意大利面一样的链条噪声,而不是一盘散沙。"
  2. CFM(Conditional Freedom Modulation - 稳定性驱动的动态引导):
    • 原理: 引入一个"动态稳定性得分"。在扩散的每一步,计算当前预测的3D坐标与上一步相比的变化幅度。变化小,说明结构开始"稳定"了。
    • 作用: 在去噪早期(结构不稳定),CFM 会"模糊"或减弱受体口袋提供的条件信号(Condition),给模型极大的自由度去探索 (Exploration) 不同的结合姿态;随着去噪进行(结构逐渐稳定),CFM 会逐渐收紧条件,加强引导,让模型精细打磨 (Refinement) 局部互作。这是一种"先放飞自我,后精雕细琢"的策略。

4. 实验与结果分析 (Experiments)

作者在统一的多肽 (LNR) 和抗体 (RAbD) 零样本 (De Novo) 设计基准上进行了严格测试,并使用 Rosetta 能量函数作为评估标准。

主要结果 (Main Results):

  • 多肽设计 (LNR Benchmark):
    相比于之前的SOTA模型 UniMoMo,PRIME 将亲和力提升指标 (IMP) 从 29.03% 大幅提升至 38.89% ,界面能量 (ΔG) 降低至 -33.56。同时,生成配体的均方根误差 (RMSD) 从 1.48 Å 降至 1.01 Å ,且原子碰撞率 (Clash rate) 极低。这证明了PRIME完美打破了"结构僵化"与"高亲和力"之间的Trade-off。
  • 抗体CDR设计 (RAbD Benchmark):
    在抗体这种极度灵活的分子设计上,PRIME 同样刷新了 SOTA。亲和力提升 (IMP) 达到 69.49% ,RMSD 降至 0.97 Å,且序列和结构的多样性(Diversity)显著提升。

图2:代表性生成设计的定性结构分析。 该可视化结果将生成的结合物(蓝色)与靶点受体口袋(灰色)内的天然参考结构(粉色)进行了叠加对比。

消融实验 (Ablations - 证明为什么有效):

作者把 PRIME 拆开来验证每个模块的作用(见论文 Table 3):

  1. 只用 Foundation Backbone: 结构合理性(Clash rate)大幅下降,因为预训练大模型守住了物理底线;但生成的结构多样性很差(因为潜在空间太严格了)。
  2. 加入 GLSN: 结构多样性翻倍(0.11 -> 0.22),证明遵循拓扑的噪声能帮助模型跳出局部最优。
  3. 加入 CFM: 亲和力 (IMP) 进一步提升,证明"先探索后约束"确实能帮模型找到能量更低的结合构象。
  4. 三者结合 (PRIME): 取得了各项指标的最佳平衡。

5. 总结与评价 (Conclusion)

核心结论:

PRIME 成功开创了 "基于预训练表示诱导" 的3D生物分子生成新范式。它证明了:我们不需要、也不应该为了扩散模型去从头强行压缩3D分子;直接站在 3D Foundation Models 的肩膀上,并辅以符合物理直觉的采样策略(SPES),就能高效生成兼具高保真度、高亲和力和高多样性的结合大分子。

亮点评价:

  1. 直击痛点: 敏锐地指出了当前 LDM 中自编码器带来的"可扩散性鸿沟",解决方案直切要害。
  2. 物理直觉强: GLSN(链状拓扑噪声)和 CFM(稳定性动态调制)的设计极具启发性,完全遵循了蛋白质折叠和分子对接的物理逻辑。
  3. 统一框架: 将多肽和抗体的设计统一在一个框架下,证明了方法的普适性。

局限性(作者已提及):

目前模型的评估高度依赖于计算代理指标(如 Rosetta 能量和预设的参考结构),这不能完全替代湿实验(Wet-lab)的真实验证结果。此外,高性能的 Binder 生成技术也伴随着一定的生物安全风险(Dual-use risks)。

相关推荐
数智工坊2 小时前
SAMosaic3D:以可学习马赛克组装实现实时在线3D实例分割 | CVPR 2026 论文精读
学习·3d
dalong103 小时前
WPF:3D型材模型
3d·wpf
杀生丸学AI4 小时前
【前馈三维重建】AdaptiveSplat:前馈重建的纹理感知可控3DGS分配方法(ECCV 2026)
3d·三维重建·扩散模型·视觉大模型·高斯泼溅·前馈模型·大场景重建
数智工坊4 小时前
UECP:不确定性增强的协同感知 | 基于物理先验的BEV融合新范式
linux·ubuntu·3d·机器人
TAICHIFEI2 天前
光片显微镜海量3D图像重建/拼接软件全分类
3d·分类·数据挖掘
_张一凡2 天前
【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计
3d·具身智能·世界模型
huangns3 天前
汽车座椅、脚垫3D扫描数字化打版怎么做,需要哪些设备?
3d
云飞云共享云桌面3 天前
非标装备厂降本方案|8‑10 人三维研发共用一台主机,兼容SolidWorks等多款 3D 绘图软件
运维·服务器·3d·自动化·负载均衡·制造