课前准备--3D-QSAR与药物结构优化

作者,Evil Genius
生化小课,CADD计算机辅助药物设计已经开启,对分子对接/分子动力学感兴趣的同学可以报名参加,我自己做了个合集,在分子动力学,感兴趣可以关注一下。

今天我们补充3D-QSAR 与药物结构优化

3D-QSAR(Three-Dimensional Quantitative Structure--Activity Relationship,三维定量构效关系) 的核心思想,是把一系列具有相似作用机制的活性化合物放到统一的三维空间中,分析分子不同空间位置的立体场、静电场等性质与生物活性之间的定量关系,再利用模型预测新化合物活性,从而指导药物结构优化。

简单理解:

已知化合物结构 + 已知活性 → 建立3D-QSAR模型 → 找到"什么位置应该增加/减少什么性质" → 设计新分子 → 预测活性 → 合成验证 → 进一步优化。


一、3D-QSAR到底解决什么问题?

传统SAR往往是:

苯环 → 换成甲基 → 活性提高

苯环 → 换成氟 → 活性下降

它能够告诉我们**"改了什么以后活性发生变化"**,但是不一定能解释:

为什么这个位置适合加大基团,而另一个位置不能加?

3D-QSAR进一步考虑分子的三维空间性质

例如一个蛋白结合口袋:

复制代码
                疏水区域
                   ↓
        ┌──────────────────┐
        │      ▓▓▓▓        │
        │   配体分子        │
        │      ●────●      │
        │        │         │
        │     ●───●        │
        └──────────────────┘
             ↑
           极性区域

3D-QSAR可以进一步告诉我们:

  • 哪个位置需要更大的基团?

  • 哪个位置需要更小的基团?

  • 哪个位置适合增加正电性?

  • 哪个位置适合增加负电性?

  • 哪个位置需要疏水基团?

  • 哪个位置增加极性可能导致活性下降?

这就是它对药物结构优化最有价值的地方。


二、3D-QSAR的完整分析流程

整个过程可以概括为:

复制代码
化合物库
   ↓
结构标准化
   ↓
活性数据整理
   ↓
三维结构生成
   ↓
分子构象优化
   ↓
分子叠合 Alignment
   ↓
计算三维分子场
   ↓
CoMFA / CoMSIA
   ↓
建立QSAR模型
   ↓
交叉验证
   ↓
外部验证
   ↓
Contour Map
   ↓
结构优化
   ↓
新化合物设计
   ↓
活性预测
   ↓
分子对接
   ↓
MD模拟
   ↓
实验验证

其中真正的核心是:

Alignment → Molecular Field → Statistical Model → Contour Map → Structure Optimization


三、第一步:准备化合物和活性数据

首先需要一批结构相似、作用机制相近的化合物。

例如有20~100个化合物:

Compound IC₅₀
C01 12.5 nM
C02 45.3 nM
C03 110.2 nM
C04 8.6 nM
C05 320 nM
... ...

通常把活性转换为:

例如:

则:

这样处理以后:

pIC₅₀越高 → 活性越强


四、第二步:结构标准化

需要对所有化合物进行统一处理。

主要包括:

1. 去除无关结构

例如:

  • 溶剂

  • counter ion

  • 不必要的小分子

2. 统一质子化状态

例如:

不同pH条件下的质子化状态可能影响:

  • 电荷

  • 氢键

  • 静电场

  • 分子构象

3. 统一立体化学

尤其需要注意:

  • R/S

  • E/Z

  • 手性中心

因为3D-QSAR高度依赖三维结构。


五、第三步:建立三维结构

3D-QSAR与普通2D-QSAR最大的区别之一,就是需要三维坐标。

例如:

复制代码
2D结构
   ↓
3D构象
   ↓
能量最小化
   ↓
合理构象

常见工具包括:

  • RDKit

  • Open Babel

  • Schrödinger

  • MOE

  • Discovery Studio

  • OpenEye

  • Gaussian等

通常需要进行:Conformer generation

然后:Energy minimization

得到合理的三维构象。


六、第四步:最关键的一步------分子叠合 Alignment

这是3D-QSAR中非常重要、同时也是最容易影响结果的一步

假设有三个化合物:

复制代码
Compound 1       Compound 2       Compound 3

    ●                ●                ●
   / \              / \              / \
  ●   ●            ●   ●            ●   ●
      \                \                \
       ●                ●                ●

必须把它们放到一个统一坐标系中。

例如:

复制代码
          Compound 1
             ↓
        ───────────
          Compound 2
             ↓
        ───────────
          Compound 3
             ↓
        ───────────

       统一空间坐标

这样才能比较:

空间中同一个位置的物理化学性质是否与活性相关。


七、为什么Alignment如此重要?

假设真实情况是:

复制代码
      蛋白结合口袋
   ┌───────────────┐
   │   疏水区域     │
   │       ↓       │
   │     [R]       │
   │               │
   │   [配体核心]   │
   └───────────────┘

如果配体叠合正确:

复制代码
Ligand 1
Ligand 2
Ligand 3
Ligand 4
   ↓
核心结构高度重合

3D-QSAR才能准确分析。

如果叠合错误:

复制代码
Ligand 1      Ligand 2
    ●             ●
       Ligand 3
           ●

空间位置错乱
      ↓
错误的3D场
      ↓
错误的QSAR模型
      ↓
错误的结构优化建议

因此:

Alignment质量往往直接决定3D-QSAR模型的可信度。


八、第五步:计算三维分子场

这是3D-QSAR的核心。

最经典的是:

CoMFA

Comparative Molecular Field Analysis

主要分析:

① Steric field

即:

立体场

通常使用探针原子在空间网格中扫描分子。

回答:

这个位置需要"大一点"还是"小一点"?


② Electrostatic field

即:

静电场

回答:

这个位置更适合正电性还是负电性?

因此CoMFA最经典的两个描述符:


九、CoMSIA

另一个经典方法是:

CoMSIA

Comparative Molecular Similarity Indices Analysis

可以同时分析:

  • Steric

  • Electrostatic

  • Hydrophobic

  • H-bond donor

  • H-bond acceptor

因此:

具体采用哪些场取决于研究体系。


十、为什么需要建立三维网格?

可以想象在分子周围建立一个巨大的三维"空间网格":

复制代码
             Z
             ↑
             │
        ┌───────────┐
       /│          /│
      / │         / │
     ┌───────────┐  │
     │  • • • •  │  │
     │  • 配体 •  │  │
     │  • • • •  │ /
     │           │/
     └───────────┘────→ X
    /
   ↓
   Y

每个网格点都会记录:

  • 立体能

  • 静电能

  • 疏水性

  • 氢键性质等

最终形成一个非常大的矩阵:

而实验活性:


十一、第六步:建立统计模型

最经典的方法是:

PLS

Partial Least Squares,偏最小二乘回归

建立:

也就是:

最终得到:


十二、第七步:模型验证

这一部分非常重要。

不能只看:R2

因为模型可能发生过拟合

需要至少考虑:

① R2

训练集拟合能力。


② Q2

交叉验证能力。

通常:Q2 > 0.5

可以作为一个较常见的经验性参考,但不能把0.5当成绝对合格线


③ RMSE

预测误差:

越小越好。


④ 外部验证

把数据分成:

复制代码
Training set
      ↓
建立模型

Test set
      ↓
完全不参与建模
      ↓
预测
      ↓
比较预测值和实验值

这是评价3D-QSAR真正预测能力的重要方式。


十三、第八步------最重要的结果:Contour Map

3D-QSAR最有价值的输出之一就是:

三维等高线图(Contour Map)

它能够直接告诉药物化学家:

"这个位置加什么基团可能更好?"

例如经典CoMFA:

Steric contour

绿色区域:

适合较大的基团

黄色区域:

不适合较大的基团

因此:

复制代码
          Green
           ↓
       [大基团]
           |
    ┌──────┴──────┐
    │    配体      │
    └─────────────┘
           ↑
        Yellow
      避免大基团

十四、Electrostatic contour

通常可以看到不同颜色区域分别代表:

正电性/负电性更有利或更不利的空间区域

例如:

复制代码
       电性有利区域
            ↓
          🔵
       ┌───────┐
       │ Ligand│
       └───────┘
          🔴
            ↑
       另一种电性

具体颜色含义必须以软件生成图例为准,不能脱离软件图例直接把某种颜色固定解释成"正电"或"负电"。


十五、从Contour Map进入药物结构优化

这才是3D-QSAR真正用于药物研发的地方。

假设原始分子:

复制代码
        R
        |
    ┌───────┐
    │ Core  │
    └───────┘

3D-QSAR发现:

复制代码
        🟢
         ↓
      适合大基团

        R
        |
    ┌───────┐
    │ Core  │
    └───────┘

那么可以设计:R = CH3

R = Et

R=iPr

R= Ph

然后分别预测活性。


十六、结构优化实际上是一个"迭代过程"

不是:

做一次3D-QSAR → 得到最终药物

而是:

复制代码
      已知活性化合物
             ↓
          3D-QSAR
             ↓
        Contour Map
             ↓
       结构改造设计
             ↓
       新化合物预测
             ↓
          分子对接
             ↓
        MD模拟验证
             ↓
         化合物合成
             ↓
          生物实验
             ↓
       新一轮SAR数据
             ↓
        更新3D-QSAR
             ↓
          再优化

这实际上是:

计算设计 → 实验验证 → 数据反馈 → 再设计

的循环。


十七、3D-QSAR + 分子对接 + MD是非常好的组合

分子对接、GROMACS分子动力学以及药物设计,把三种方法串起来。

它们解决的问题不同:

方法 核心问题
2D-QSAR 什么结构特征影响活性?
3D-QSAR 三维空间什么性质影响活性?
分子对接 配体可能如何结合蛋白?
MD 这个结合构象在动态环境下是否稳定?
MM/PBSA 结合自由能大致如何?

形成:


十八、一个非常典型的药物优化案例思路

假设研究一个蛋白靶点:

复制代码
Protein
   │
   ├── Compound 1   IC50 = 100 nM
   ├── Compound 2   IC50 = 30 nM
   ├── Compound 3   IC50 = 10 nM
   ├── Compound 4   IC50 = 3 nM
   └── Compound 5   IC50 = 1 nM

首先:

然后:

复制代码
化合物3D结构
      ↓
结构叠合
      ↓
CoMFA / CoMSIA
      ↓
建立模型
      ↓
Contour Map

发现:

复制代码
        疏水有利区域
              ↓
          ┌──────┐
          │      │
     ┌────┴──────┴───┐
     │    Ligand     │
     └───────────────┘
             ↑
        H-bond有利区域

于是提出:

在R1位置增加疏水基团,在R2位置引入氢键受体。

设计:

复制代码
Lead compound
      ↓
   R1优化
      ↓
   R2优化
      ↓
Compound A
Compound B
Compound C
Compound D

随后进行:

Docking

检查:

  • 是否进入binding pocket

  • 是否形成关键氢键

  • 是否存在π-π stacking

  • 疏水相互作用是否合理

  • 是否出现空间冲突

再进行:

MD

例如:

  • RMSD

  • RMSF

  • Radius of gyration

  • Hydrogen bonds

  • SASA

  • Protein-ligand contacts

  • MM/PBSA或MM/GBSA

最终筛选:


十九、3D-QSAR与药物结构优化的核心逻辑

可以把整个过程浓缩成下面这张"科研思维图":

复制代码
                 已知活性化合物
                       │
                       ↓
                三维结构准备
                       │
                       ↓
                 分子叠合
                       │
                       ↓
            ┌──────────────────┐
            │   3D Molecular   │
            │      Fields      │
            └──────────────────┘
                       │
                       ↓
                CoMFA / CoMSIA
                       │
                       ↓
                 PLS建模
                       │
                       ↓
              模型验证 R²/Q²
                       │
                       ↓
                Contour Map
                       │
              ┌────────┴────────┐
              ↓                 ↓
        有利区域             不利区域
              ↓                 ↓
       增加相应基团          避免相应基团
              └────────┬────────┘
                       ↓
                 新分子设计
                       ↓
                 活性预测
                       ↓
                    Docking
                       ↓
                     MD
                       ↓
                  实验验证
                       ↓
                  Lead优化

二十、3D-QSAR最需要注意的几个问题

1. 化合物不能太杂

如果化合物:

  • 作用机制不同

  • 结合位点不同

  • 构象差异巨大

  • 活性测定体系不同

那么建立一个3D-QSAR模型往往没有意义。


2. Alignment非常关键

错误Alignment:


3. 不要只看R²

一个:

R²=0.95

的模型并不一定好。

必须进一步看:

以及:

独立外部测试集表现。


4. 3D-QSAR不是结合机制证明

这是非常重要的一点。

3D-QSAR告诉你:

某个空间区域的某种物理化学性质与活性存在统计关联。

但它并不能单独证明:

配体一定以某种姿势结合蛋白。

所以最好结合:

3D-QSAR + Docking + MD + 实验

进行综合判断。


二十一、如果用于实际科研,推荐的完整技术路线

如果目标是做一套比较完整的计算药物设计/论文分析流程,可以采用:

复制代码
              化合物数据库
                   ↓
             PubChem / ChEMBL
                   ↓
              结构标准化
                   ↓
            IC50 / Ki / EC50
                   ↓
               pIC50
                   ↓
          3D构象生成与优化
                   ↓
            Molecular Alignment
                   ↓
          ┌────────┴────────┐
          ↓                 ↓
        CoMFA             CoMSIA
          ↓                 ↓
          └────────┬────────┘
                   ↓
                PLS
                   ↓
             QSAR模型验证
                   ↓
             3D Contour Map
                   ↓
             Lead结构优化
                   ↓
              新分子设计
                   ↓
              活性预测
                   ↓
            ┌──────┴──────┐
            ↓             ↓
         Docking          ADMET
            ↓
           MD
            ↓
     RMSD/RMSF/H-bond/SASA
            ↓
       MM/PBSA / MM/GBSA
            ↓
          候选化合物
            ↓
          实验验证

总结yixia :

3D-QSAR负责回答"分子三维空间中哪里应该增加/减少什么性质",分子对接负责回答"它可能怎样结合靶蛋白",分子动力学负责回答"这种结合在动态环境中是否稳定",三者结合可以形成从SAR规律发现 → 结构优化 → 结合模式验证 → 动力学稳定性评价的一套完整计算药物设计流程。

生活很好,有你更好。
相关推荐
BYSJMG5 小时前
计算机毕设选题做什么好?基于大数据的用户健身行为数据分析与可视化系统,Hadoop+Spark处理
大数据·人工智能·hadoop·数据分析·spark·课程设计
benchmark_cc12 小时前
REST API 和 Python SDK 应该怎么选?量化交易数据接口选型实战
开发语言·python·数据分析·pandas·量化交易·股票数据·quantdash
砚底藏山河17 小时前
【量化纯GET实战 #23】多股票相关性:用收益率看板块联动
java·数据库·python·金融·数据分析
quantdash_cc17 小时前
量化数据源怎么选:稳定性、实时性和数据完整性到底该如何权衡?
开发语言·python·数据分析·量化交易·股票数据·quantdash
hfywmsj17 小时前
广州餐饮铺位招租数据分析:选址权重模型与租金评估实操
人工智能·python·数据分析·广州餐饮铺位招租
quantdash_cc19 小时前
Python 股票 K 线数据质量校验:字段、缺失值、重复行和价格异常
开发语言·python·数据分析·量化交易·股票数据·quantdash
Wang's Blog20 小时前
Vibe Coding一人即团队系列62: Excel数据分析与可视化自动化
数据分析·自动化·excel
wang_yb1 天前
Beta 分布:如何用“成功”和“失败”来预测下次尝试
数据分析·databook
databook1 天前
Beta 分布:如何用“成功”和“失败”来预测下次尝试
python·数据挖掘·数据分析