课前准备--蛋白质PDB文件与PDBQT文件的格式与区别

作者,Evil Genius
接下来我们要准备生化小课了,这一次课程我们不再聚焦于基因组的内容,而是来到RNA的下游,蛋白组。
张雪峰其实说的很对,我们做事情第一目标不是如何赚钱,而是先把事情做好。学习最好的时代有两个阶段,1是学生时代,几乎没有后顾之忧,多学习一些技能作为储备;2就是编制内阶段,也没有后顾之忧,可以学习自己想做的事情。
工作了以后,很多事情就身不由己了,除非家底厚,不上班赚钱也可以。
这一篇我们来详细梳理一下PDB文件与PDBQT文件的格式。
蛋白质 PDB 文件的数据结构详解
PDB(Protein Data Bank)文件是描述蛋白质、核酸以及蛋白-配体复合物三维结构信息的标准文本格式。它是分子对接(AutoDock Vina)、分子动力学(GROMACS)、蛋白设计(PyRosetta)、结构预测分析等领域最基础的数据格式之一。
PDB 文件本质上是一个固定列宽(fixed-width)的文本文件,每一行代表一种结构信息。
典型 PDB 文件结构:
复制代码
HEADER
TITLE
COMPND
SOURCE
SEQRES
ATOM
HETATM
TER
CONECT
END
其中最重要的是:
SEQRES:蛋白质一级序列
ATOM:蛋白质原子三维坐标
HETATM:非标准分子(配体、水、金属等)
CONECT:化学键连接信息
1. PDB 文件整体结构
一个典型蛋白 PDB 文件:
复制代码
HEADER    TRANSCRIPTION FACTOR
TITLE     HUMAN PROTEIN STRUCTURE
COMPND    MOL_ID: 1;
COMPND    MOLECULE: P53 PROTEIN;
SOURCE    ORGANISM_SCIENTIFIC: HOMO SAPIENS;

SEQRES   1 A 393  MET GLU GLU GLY PRO GLY ...
SEQRES   2 A 393  ...

ATOM      1  N   MET A   1      12.560  13.345  10.223
ATOM      2  CA  MET A   1      13.220  14.512  10.850
ATOM      3  C   MET A   1      14.700  14.300  10.500
ATOM      4  O   MET A   1      15.300  13.200  10.700

...

HETATM 4500 ZN   ZN  B 500      20.300  15.200  13.500

CONECT 4500
END
2. HEADER ------ 结构基本信息
格式:
复制代码
HEADER    CLASSIFICATION DATE IDCODE
例如:
复制代码
HEADER    HYDROLASE                         01-JAN-25   8ABC
含义:
字段 意义
HYDROLASE 蛋白功能类别
01-JAN-25 提交日期
8ABC PDB ID
例如:
复制代码
HEADER    OXIDOREDUCTASE                    15-MAY-24  7XYZ
表示:
蛋白属于氧化还原酶
PDB编号7XYZ
3. TITLE ------ 结构名称
例如:
复制代码
TITLE     CRYSTAL STRUCTURE OF HUMAN BRCA1 DOMAIN
描述:
实验对象
蛋白名称
结构类型
4. COMPND ------ 分子组成信息
例如:
复制代码
COMPND    MOL_ID: 1;
COMPND    MOLECULE: BRCA1 DNA REPAIR PROTEIN;
COMPND    CHAIN: A;
表示:
字段 含义
MOL_ID 分子编号
MOLECULE 蛋白名称
CHAIN 链编号
例如:
复制代码
COMPND    CHAIN: A,B;
说明:
该结构包含两个蛋白链:
复制代码
Chain A
Chain B
5. SOURCE ------ 来源信息
例如:
复制代码
SOURCE    ORGANISM_SCIENTIFIC: HOMO SAPIENS;
表示:
来源:
复制代码
物种:
Human
常见:
SOURCE 含义
HOMO SAPIENS
MUS MUSCULUS 小鼠
ESCHERICHIA COLI 大肠杆菌
6. SEQRES ------ 蛋白一级序列
SEQRES 保存完整氨基酸序列。
例如:
复制代码
SEQRES   1 A  10  MET GLY SER LYS VAL LEU ASP GLU PHE TYR
解释:
复制代码
SEQRES
   ↓
序列信息

1
↓
第1行

A
↓
蛋白链A

10
↓
总长度10 aa
对应:
复制代码
M G S K V L D E F Y
三字母氨基酸代码
PDB使用:
PDB 单字母
ALA A
VAL V
LEU L
GLY G
ASP D
GLU E
LYS K
ARG R
PHE F
7. ATOM ------ 最核心的数据
ATOM记录蛋白质所有原子的三维坐标。
例如:
复制代码
ATOM      1  CA  ALA A   5      10.235  15.223  20.553
固定列结构:
复制代码
ATOM
123456789012345678901234567890123456789
ATOM      1  CA  ALA A   5      10.235  15.223  20.553
详细:
内容
1-6 ATOM
7-11 原子编号
13-16 原子名称
18-20 残基名称
22 链编号
23-26 残基编号
31-38 X坐标
39-46 Y坐标
47-54 Z坐标
55-60 占有率
61-66 B因子
8. 原子编号
例如:
复制代码
ATOM      125
表示:
第125个原子。
蛋白:
一个氨基酸通常:
4个主链原子:
复制代码
N
CA
C
O
例如丙氨酸:
复制代码
N
CA
C
O
CB
5个原子。
9. 原子名称
例如:
复制代码
ATOM      1  CA  GLY A   1
其中:
复制代码
CA
表示:
α碳原子。
蛋白骨架:
复制代码
      O
      ||
N --- C --- Cα --- C
      |
      R
主要原子:
名称 意义
N 主链氮
CA α碳
C 羰基碳
O
CB β碳
10. 残基名称
例如:
复制代码
ALA
GLY
VAL
LYS
ASP
代表氨基酸。
例如:
复制代码
ATOM 1 CA LYS A 10
表示:
链A:
第10号氨基酸:
赖氨酸。
11. Chain(链)
蛋白复合物:
例如:
复制代码
ATOM      1 CA ALA A 1
ATOM   2000 CA GLY B 1
表示:
复制代码
Chain A
+
Chain B
常见:
意义
A 蛋白1
B 蛋白2
C 配体链
12. Residue ID(残基编号)
例如:
复制代码
ALA A 100
表示:
链A
第100个氨基酸
注意:
PDB编号不一定连续:
例如:
复制代码
1
2
3
5
6
可能缺失:
复制代码
4
原因:
实验结构无法解析。
13. 三维坐标
核心:
复制代码
X       Y       Z
10.235  15.223 20.553
单位:
复制代码
Å (Angstrom)
换算:
复制代码
1 Å = 10^-10 m
蛋白尺度:
蛋白直径 ≈ 30-100 Å
14. Occupancy(占有率)
例如:
复制代码
0.50
表示:
该原子只有50%的概率处于该位置。
晶体结构:
通常:
复制代码
1.00
表示:
完整观察。
15. B-factor(温度因子)
也叫:
复制代码
Temperature factor
例如:
复制代码
ATOM ... 25.5
表示:
原子运动程度。
低:
复制代码
B=10
稳定区域
高:
复制代码
B=80
柔性区域
结构质量判断:
B-factor 意义
稳定
动态
极高 可能错误
16. HETATM ------ 非标准原子
用于:
复制代码
配体
金属
水
例如:
复制代码
HETATM 5000 O HOH A 300
小分子药物
复制代码
HETATM 6000 C ATP A 400
金属
复制代码
HETATM 7000 ZN ZN A 500
17. CONECT ------ 化学键
例如:
复制代码
CONECT 5000 5001
表示:
原子:
复制代码
5000
|
5001
存在键。
通常:
蛋白内部键不写。
主要用于:
复制代码
金属
配体
共价修饰
18. MODEL ------ 多构象结构
NMR结构:
复制代码
MODEL 1

ATOM...

ENDMDL


MODEL 2

ATOM...

ENDMDL
表示:
多个可能构象。
19. PDB结构层级关系
PDB数据实际上是:
复制代码
Protein Structure
│
├── Chain
│     │
│     ├── Residue
│     │       │
│     │       └── Atom
│     │
│     └── Residue
│
└── Ligand
        │
        └── Atom
例如:
复制代码
PDB
 |
 Chain A
 |
 Residue 100 Lys
 |
 Atom CA
 |
 Coordinate
 (10.2,15.3,20.1)
总结:PDB最重要的10个字段
字段 重要程度 用途
ATOM ★★★★★ 蛋白三维坐标
HETATM ★★★★★ 配体/金属
SEQRES ★★★★ 完整序列
CHAIN ★★★★ 区分亚基
RESID ★★★★ 残基编号
XYZ坐标 ★★★★★ 空间位置
B-factor ★★★ 结构柔性
Occupancy ★★ 可靠性
CONECT ★★★ 化学键
MODEL ★★ 多构象

PDBQT 文件结构与 PDB 文件的区别详解

PDBQT 是在 PDB 文件基础上,为 AutoDock / AutoDock Vina 分子对接设计的专用格式。
简单理解:
PDB = 描述蛋白质三维结构的通用格式
PDBQT = 为分子对接增加了"电荷 + 原子类型 + 可旋转键信息"的PDB增强格式
关系
复制代码
PDB
 |
 | 添加
 | 
 ├── Partial charge(部分电荷)
 ├── AutoDock atom type(Vina原子类型)
 ├── Torsion information(可旋转键)
 |
 ↓
PDBQT
1. PDB 与 PDBQT核心区别
内容 PDB PDBQT
用途 结构存储 分子对接
主要软件 PyMOL、PyRosetta、GROMACS AutoDock、AutoDock Vina
坐标
残基信息
链信息
原子编号
B-factor ×(通常不用)
Occupancy ×(通常不用)
部分电荷 ×
AutoDock原子类型 ×
可旋转键 ×
力场参数 × ×
2. PDB 文件 ATOM结构
PDB:
复制代码
ATOM      1  CA  ALA A   1      12.345  15.678  20.111  1.00 20.50
格式:
复制代码
ATOM
 |
 原子编号
 |
 原子名称
 |
 氨基酸
 |
 链
 |
 残基编号
 |
 X Y Z 坐标
 |
 occupancy
 |
 B-factor
例如:
复制代码
ATOM      1  CA  ALA A   1      12.345 15.678 20.111
表示:
复制代码
Chain A
Residue 1
Alanine
Alpha carbon
坐标:
(12.345,15.678,20.111)
3. PDBQT ATOM结构
PDBQT:
复制代码
ATOM      1  CA  ALA A   1      12.345 15.678 20.111  0.123 C
增加:
复制代码
0.123
 |
Partial charge

C
 |
AutoDock atom type
结构:
复制代码
ATOM
 |
 原子编号
 |
 原子名称
 |
 残基
 |
 链
 |
 坐标
 |
 电荷
 |
 原子类型
4. PDBQT增加的两个关键内容
4.1 Partial Charge(部分电荷)
PDB:
没有电荷:
复制代码
C
O
N
PDBQT:
例如:
复制代码
C  0.123
O -0.345
N -0.278
含义:
原子电子分布。
例如:
羰基:
复制代码
C=O

C:
+0.5

O:
-0.5
Vina利用电荷计算:
静电作用
氢键
4.2 AutoDock Atom Type
PDB:
只知道:
复制代码
C
N
O
S
PDBQT:
进一步分类:
例如:
PDB元素 AutoDock类型
C C
O OA
N NA
H HD
S SA
Cl Cl
例如:
氧:
普通氧:
复制代码
O
氢键受体氧:
复制代码
OA
氮:
普通氮:
复制代码
N
供氢氮:
复制代码
NA
5. PDBQT中的ROOT / BRANCH
这是配体最重要的区别。
蛋白:
一般:
复制代码
没有ROOT
配体:
有:
复制代码
ROOT
 |
 可旋转结构
 |
 BRANCH
例如:
复制代码
ROOT

ATOM      1 C1  LIG
ATOM      2 C2  LIG

BRANCH 1 5

ATOM      5 C3 LIG

ENDBRANCH

ENDROOT
表示:
复制代码
固定部分
 |
 C-C
 |
 可旋转键
 |
 侧链运动
6. 为什么PDB没有旋转键?
PDB只保存:
某一个瞬间结构
例如:
蛋白:
静态结构
但是Vina:
需要搜索:
配体不同构象
例如:
乙醇:
复制代码
CH3-CH2-OH
C-C键可以旋转:
构象1
复制代码
CH3
 |
CH2-OH
构象2
复制代码
    CH3
     \
      CH2-OH
Vina需要知道:
哪些键可以动。
7. 蛋白PDBQT vs 配体PDBQT
这是很多初学者容易混淆的地方。
蛋白PDBQT
特点:
复制代码
Rigid
固定
例如:
复制代码
ATOM
ATOM
ATOM

END
没有:
复制代码
ROOT
BRANCH
原因:
对接时:
蛋白通常保持刚性。
配体PDBQT
特点:
复制代码
Flexible
可旋转
包含:
复制代码
ROOT
BRANCH
TORSDOF
例如:
最后:
复制代码
TORSDOF 5
表示:
5个自由旋转键。
8. PDB → PDBQT转换流程
蛋白
复制代码
protein.pdb

↓

AutoDockTools

↓

protein.pdbqt
增加:
极性氢
电荷
原子类型
配体
复制代码
ligand.sdf/mol2

↓

OpenBabel

↓

ligand.pdb

↓

AutoDockTools

↓

ligand.pdbqt
增加:
rotatable bonds
charge
9. PDBQT实例比较
PDB
复制代码
ATOM      5  O   SER A  10
          12.33 15.22 18.55
信息:
复制代码
氧原子
Serine
坐标
PDBQT
复制代码
ATOM      5  O   SER A 10
          12.33 15.22 18.55
          -0.35 OA
增加:
复制代码
-0.35
 |
电荷


OA
 |
氢键受体氧
生活很好,有你更好。
相关推荐
hopsky1 小时前
《HBase 权威指南》 Lars George
大数据·数据库·hbase
Architect_Lee2 小时前
mac快速安装mysql
数据库·mysql·macos
Elastic 中国社区官方博客2 小时前
Elasticsearch:列式索引模式 - Columnar index mode
大数据·数据库·elasticsearch·搜索引擎·全文检索
Lysander.Jovian2 小时前
Nginx服务2
运维·数据库·nginx
小张同学a.2 小时前
zabbix企业级监控平台4——分布式监控与grafana数据可视化
linux·运维·数据库·分布式·信息可视化·zabbix·grafana
渣渣盟2 小时前
当 Redis 写入不再是瓶颈后,Flink 任务的反压可能来自哪里?如何系统性地定位和解决 Flink 反压问题?
数据库·redis·flink
七牛开发者2 小时前
Codex 实践系列 Vol.04:用 Goal 和 Plan 管住一个长任务
java·数据库·人工智能·github·copilot
仍然.2 小时前
服务端高并发分布式结构演进之路
大数据·数据库·redis
MC皮蛋侠客2 小时前
Redis 系列(三):底层实现(一)——对象系统、SDS 与 dict
数据库·redis·缓存