AIDD - 蛋白质与配体结构的隐蔽结合口袋与晶体接触

欢迎关注我的CSDN:https://spike.blog.csdn.net/

本文地址:https://spike.blog.csdn.net/article/details/164999034

免责声明:本文来源于个人知识与公开资料,仅用于学术交流,欢迎讨论,不支持转载。

隐蔽结合口袋(Cryptic Pocket) 是在蛋白质未结合配体的常见结构中,不明显或处于闭合状态,通过自身构象波动,或配体结合,而显露的结合位点,为药物设计提供了常规静态结构可能遗漏的靶向机会。晶体接触(Crystal Contacts) 是蛋白质分子在晶格中堆积时,与相邻分子形成的接触,接触不一定代表生理条件下的相互作用,可能稳定特定构象,影响口袋的开放、闭合及可及性。在分析隐蔽结合口袋时,需要区分蛋白质本身的构象变化与晶体堆积造成的影响,结合不同晶型、分子动力学模拟及溶液实验,判断该口袋是否能在接近生理条件的环境中形成并结合配体。

1. 隐蔽结合口袋(Cryptic Pocket)

在蛋白质结构研究中,apo(游离态) 通常指未结合所关注配体的蛋白质状态,而 holo(配体结合态) 则指结合该配体后的状态。配体结合,常伴随蛋白质局部或整体构象的变化,进而影响结合口袋的形状、大小及可及性。Cryptic Pocket(隐蔽口袋) 是在常见 apo 结构中不明显或尚未形成,通过蛋白质自身的构象波动或配体诱导的构象变化而显露的结合口袋。这类口袋为发现静态结构,分析容易遗漏的潜在结合位点,提供机会,为药物设计带来新的靶向策略。

1JWP 和 1PZO 都是大肠杆菌 TEM-1 β-内酰胺酶的 PDB 结构编号。这个酶可以水解青霉素等抗生素的 β-内酰胺环,是细菌产生抗生素耐药性的重要因素。

结构 含义 对比
1JWP TEM-1 的 M182T 突变体,分辨率 1.75 Å 未结合 CBT,作为相对于配体的 apo 结构
1PZO TEM-1 与变构抑制剂 CBT 的复合物,分辨率 1.90 Å 结合 CBT 的 holo 结构

M182T 突变体,即第 182 位甲硫氨酸替换为苏氨酸。TEM-1:TEM 来源于患者 Temoniera,最初的相关耐药菌株分离自这名患者,"1"是该酶在 TEM 家族中的型号编号。

这组结构,说明 Cryptic Pocket(隐蔽口袋) ,CBT 结合的位置远离催化活性中心,结合时第 11、12 条 α 螺旋分离,暴露出原先被埋藏的部分疏水核心,形成容纳抑制剂的口袋。位点距活性中心约 16 Å ,通过构象变化影响催化残基,从而抑制酶活性,因此是一个变构结合位点

即:

CryptoBank

其中,CryptoBank 数据集,将经过整理与筛选的隐蔽口袋数据库、holo/apo 结构比对及基于序列的预测功能整合于同一界面。通过结构标识符、UniProt 登录号、配体与位点元数据以及隐蔽口袋评分,搜索 CryptoBank 数据集。

项目 信息
在线发表 2026 年 4 月 22 日,Science Advances
作者 Febrer Martinez、Fröhlking、Borsatto、Gervasio
总比较规模 约 600 万 apo--holo--ligand 组合
隐蔽性阳性组合 574,314
独立隐蔽口袋 5,151
涉及蛋白簇 3,643
结构评分训练集 199 对:71 阳性、128 阴性

CryptoBank 来自瑞士日内瓦大学(University of Geneva) 的 Francesco L. Gervasio 研究团队,论文同时署名英国伦敦大学学院(UCL)。

其中,阴性与阳性:

  • 阳性71对,即标注为具有隐蔽口袋特征,其中 holo 配体所需的空间在 apo 中被蛋白原子占据,需要局部构象变化才能容纳配体。
  • 阴性128对,即标注为不具有隐蔽口袋特征,其中 apo 已经存在相容的结合空间,无需明显重排就能容纳 holo 中的配体。

数据集:

其中,1JWP1PZO 的数据检索结果:

2. 晶体接触(Crystal Contacts)

在配体的全部接触中,与不属于主链所在生物学组装体的,晶体对称相关链(Crystal Symmetry Mate) ,形成的接触应少于 10% 。其中,主链(Primary Chain) 是与配体接触最多的那条蛋白质链。在蛋白质晶体中,相邻分子因晶格堆积而彼此靠近,这些邻近关系,不一定代表蛋白质在生理条件下的组装方式。该条件用于限制配体与生物学组装体之外的邻近链的接触,降低晶体堆积对所观察结合模式的影响。属于同一生物学组装体的其他链,例如天然二聚体的另一条链,不计入这里的晶体接触。晶体接触比例低于10%,以与配体接触最多的蛋白质链为主链,配体与该主链所属生物学组装体之外的晶体对称相关链之间的接触,占配体总接触数的比例须低于 10%。

4K4R 中的 Br27 配体 为例,说明晶体接触的含义。Br27 是研究中的化合物编号,即1-溴-2-萘甲酸 ,在 PDB 中的配体代码为 27B 。4K4R 的蛋白质是 HIV-1 蛋白酶 W6A 突变体,生物学组装体为同源二聚体。Br27 结合在蛋白酶的表面外位点(exosite) ,其羧基与 Lys14 形成盐桥,萘环与 Leu63、Glu65、Lys70 接触;萘环还与一个晶体对称相关分子的 Phe53 形成较弱的范德华接触。可用于计算,晶体接触比例。例如,定义两个重原子距离 <4 Å 就算一次接触,同一个配体原子如果靠近三个蛋白原子,就计 3 个原子对接触,同一生物学二聚体的 A、B 两条链都算组装体内。

接触距离定义 组装体内原子对 组装体外原子对 组装体外占比 仅按 <10% 判断
<4.0 Å 31 3 8.82% 保留
<4.5 Å 69 11 13.75% 排除
<5.0 Å 126 21 14.29% 排除

即:

显示效果是,半透明分子表面,同时保留丝带、绿色配体和接触虚线

3. LDDT 与 PAE 与 PDE

LDDT

lDDT(local Distance Difference Test),即 局部距离差异检验,用于衡量预测结构与参考结构的局部原子间距离是否一致,无需刚体叠合。

l D D T = 1 4 ∣ P ∣ ∑ ( i , j ) ∈ P ∑ τ ∈ { 0.5 , 1 , 2 , 4 }   A ˚ 1  ⁣ ∣ d i j p r e d − d i j r e f ∣ \< τ \mathrm{lDDT} = \frac{1}{4|\mathcal{P}|} \sum_{(i,j)\in\mathcal{P}} \sum_{\tau\in\{0.5,1,2,4\}\,\text{\AA}} \mathbf{1}\!\left \\left\|d_{ij}\^{\\mathrm{pred}}-d_{ij}\^{\\mathrm{ref}}\\right\|\<\\tau \\right lDDT=4∣P∣1(i,j)∈P∑τ∈{0.5,1,2,4}A˚∑1 dijpred−dijref \<τ

其中, P \mathcal{P} P 是参考结构中满足局部邻域条件的原子对集合; d i j d_{ij} dij 是原子间距离; 1 \mathbf{1}\\cdot 1 表示条件成立计 1,否则计 0。得分范围为 0--1,越高越好,也可乘以 100 表示。

在 AlphaFold2 的 lDDT-Cα 评估中,局部邻域截断距离为 15 Å(1.5 nm)。需要区分两个概念:

距离概念 数值 含义
邻域范围 参考结构中距离 < 15 Å 决定哪些 Cα 原子对参与计算,排除自身配对
距离误差阈值 0.5、1、2、4 Å 判断预测距离与参考距离有多接近

即:

其中,pLDDT(predicted LDDT) 中的 50 个 bin 是 AlphaFold2 预测 lDDT 分数设置的分类区间,是模型设计中的超参数。把 0--1 的 lDDT 分数范围均匀划分为 50 份,每份宽度为 0.02。运行过程中,使用 smooth LDDT 计算数值,具体过程是:

  1. 训练时计算标签:将预测结构与参考结构比较,得到每个残基的实际 lDDT-Cα,例如 0.873,对应区间 [0.86, 0.88)。模型学习预测 LDDT 分数属于区间。
  2. 预测时输出概率:每个残基输出 50 个 logits,经 Softmax 得到各区间的概率。
  3. 计算概率加权平均:以区间中心 0.01、0.03、...、0.99 为代表值,计算期望,再乘以 100,得到 pLDDT。

p i k = e z i k ∑ m = 1 50 e z i m , p L D D T i = 100 ∑ k = 1 50 p i k k − 1 2 50 p_{ik}=\frac{e^{z_{ik}}}{\sum_{m=1}^{50}e^{z_{im}}}, \qquad \mathrm{pLDDT}i =100\sum{k=1}^{50}p_{ik}\frac{k-\tfrac12}{50} pik=∑m=150ezimezik,pLDDTi=100k=1∑50pik50k−21

例如,概率集中在三个区间,其他区间概率忽略:

区间 中心值 预测概率
[0.84, 0.86) 0.85 0.2
[0.86, 0.88) 0.87 0.5
[0.88, 0.90) 0.89 0.3

即:

p L D D T = 100 ( 0.2 × 0.85 + 0.5 × 0.87 + 0.3 × 0.89 ) = 87.2 \mathrm{pLDDT} =100(0.2\times0.85+0.5\times0.87+0.3\times0.89) =\boxed{87.2} pLDDT=100(0.2×0.85+0.5×0.87+0.3×0.89)=87.2

源码:

python 复制代码
def compute_plddt(logits: np.ndarray) -> np.ndarray:
  """Computes per-residue pLDDT from logits.
  Args:
    logits: [num_res, num_bins] output from the PredictedLDDTHead.
  Returns:
    plddt: [num_res] per-residue pLDDT.
  """
  num_bins = logits.shape[-1]
  bin_width = 1.0 / num_bins
  bin_centers = np.arange(start=0.5 * bin_width, stop=1.0, step=bin_width)
  probs = np.array(_softmax(logits, axis=-1))
  predicted_lddt_ca = np.sum(probs * bin_centers[None, :], axis=-1)
  return predicted_lddt_ca * 100

PAE 与 PDE

其他指标 PAE 与 PDE:

  • PAE(Predicted Aligned Error):预测对齐误差,即以Token的局部坐标系为基准对齐后,其他 Token 的位置预计偏离真实位置值,AlphaFold 2 (2021年)。
  • PDE(Predicted Distance Error):预测距离误差,即两个Token代表原子之间的预测距离,预计与真实距离相差,AlphaFold 3 (2024年)。

相关公式:

PAE,由于以 i i i 为基准看 j j j 与反过来不同,PAE 矩阵非对称。常用于判断结构域之间、不同链之间的相对排布是否可信。假设以 Token (i) 的局部坐标系对齐预测结构与参考结构,真实的对齐误差可写为:

A E i → j = ∥ R i x j p r e d + t i − x j r e f ∥ 2 \mathrm{AE}_{i\rightarrow j} = \left\| R_i\mathbf{x}^{\mathrm{pred}}_j+\mathbf{t}_i -\mathbf{x}^{\mathrm{ref}}_j \right\|_2 AEi→j= Rixjpred+ti−xjref 2

PDE,关注两点间的距离,不需要对齐,AF3 将距离误差划分为 64 个 bin,预测其概率分布,再取期望值。对应的真实距离误差为:

D E i j = ∣ ∥ x i p r e d − x j p r e d ∥ 2 − ∥ x i r e f − x j r e f ∥ 2 ∣ \mathrm{DE}_{ij} = \left| \left\|\mathbf{x}^{\mathrm{pred}}_i-\mathbf{x}^{\mathrm{pred}}_j\right\|_2 - \left\|\mathbf{x}^{\mathrm{ref}}_i-\mathbf{x}^{\mathrm{ref}}_j\right\|_2 \right| DEij= xipred−xjpred 2− xiref−xjref 2

即:

其中,PAE 中的局部,是由 Token 附近的三个原子建立坐标系,而不是选取固定范围内的一些原子。

在 AlphaFold 3 中,其中 3 个原子的选择规则是:

Token 类型 局部坐标系的三个原子 坐标原点
蛋白质残基 同一残基的 N、Cα、C
DNA/RNA 核苷酸 同一核苷酸的 C1′、C3′、C4′ C3′
配体等单原子 token 原子及同一链中距离最近的两个原子 Token 原子

其他:

训练目标 主要作用
坐标去噪损失(MSE) 让扩散模型从加噪坐标恢复真实原子位置,是结构生成的核心目标
聚合物--配体共价键损失(bond loss) 约束共价连接的配体或糖基与所属链之间的连接距离
距离分布损失(distogram) 学习 token 代表原子之间的真实距离分布,为结构表征提供辅助监督
实验可解析性损失(resolved) 学习某个原子是否在实验参考结构中被解析,属于置信度相关任务
相关推荐
SpikeKing15 天前
AIDD - 索引 mmCIF 文件与 不同抗体类型实例
抗体·aidd
SpikeKing1 个月前
AIDD - SAbDab2 抗体感知聚类(Antibody-Perceived Clustering)
聚类·抗体·aidd·sabdab2·mmseqs
SpikeKing1 个月前
AIDD - ColabFold 的 MSA/Template 数据集与检索策略
template·msa·aidd·colabfold
沐籽李1 个月前
HuDiff在抗体人源化项目中的工程化落地
人工智能·算法·aidd·抗体设计
沐籽李1 个月前
从溶剂可及表面积SASA理解抗体结构与工程改造
人工智能·药物设计·aidd·sasa
沐籽李2 个月前
Roche 团队如何设计酸性 pH 激活的 anti-CD3 抗体
人工智能·aidd·抗体设计·ph敏感抗体
沐籽李3 个月前
Agent入门第三课:上下文不是越长越好,记忆也不是越多越聪明
人工智能·agent·aidd·基础术语·入门概念
沐籽李3 个月前
从问答到执行:Biomni 如何重构生物医学研究工作流
数据库·agent·aidd·抗体设计·biomni
沐籽李3 个月前
从 AlphaFold1 到 AlphaFold3:AI 如何一步步改变蛋白质结构预测?
人工智能·药物研发·aidd·结构预测·蛋白质模型