欢迎关注我的CSDN:https://spike.blog.csdn.net/
本文地址:https://spike.blog.csdn.net/article/details/164122510
免责声明:本文来源于个人知识与公开资料,仅用于学术交流,欢迎讨论,不支持转载。
数据格式,介绍训练与验证索引文件的字段与数据采样,通过结构案例深入展示不同蛋白质与分子类型的组织方式。索引文件每行记录一条链或界面样本,包含实体编号、链 ID、分子类型、聚类 ID、token 数、分辨率等 19 个字段,共涵盖 13 种分子组合类型。以流感血凝素抗体复合物 9NJ6、抗 Z-DNA 抗体复合物9WU2 和 HIV-1 Env 三聚体--双特异性抗体复合物 8TNI 为例,解析 mmCIF 结构文件,映射为 JSON 输入格式,包括序列定义、共价键连接、翻译后修饰等。
数据格式:
bash
indices/val.csv
训练日志:
bash
[Protenix IO] read_indices_csv finished in 0.013s: path=indices/val.csv, shape=(1569, 19)
#Rows in indices list: 1569
[removed] #Rows: 14
[removed] #PDB: 2
[filtered by n_token (1536)] #Rows: 1555
---------- Dataset sabdab2_val----------
intra_prot: 616/1555(39.61%)
prot_prot: 481/1555(30.93%)
intra_ligand: 151/1555(9.71%)
ligand_prot: 138/1555(8.87%)
ions_prot: 69/1555(4.44%)
intra_ions: 43/1555(2.77%)
nuc_prot: 16/1555(1.03%)
intra_nuc: 15/1555(0.96%)
ligand_ligand: 14/1555(0.9%)
nuc_nuc: 5/1555(0.32%)
ions_ions: 4/1555(0.26%)
ions_ligand: 2/1555(0.13%)
ligand_nuc: 1/1555(0.06%)
------------------------------
intra_prot: 99/479(20.67%)
prot_prot: 191/479(39.87%)
intra_ligand: 23/479(4.8%)
ligand_prot: 68/479(14.2%)
ions_prot: 50/479(10.44%)
intra_ions: 14/479(2.92%)
nuc_prot: 10/479(2.09%)
intra_nuc: 4/479(0.84%)
ligand_ligand: 11/479(2.3%)
nuc_nuc: 2/479(0.42%)
ions_ions: 4/479(0.84%)
ions_ligand: 2/479(0.42%)
ligand_nuc: 1/479(0.21%)
------------------------------
Final pdb ids: 248
------------------------------
val.csv 是 1569 行,以 1536 长度过滤 Tokens,剩余 1555 行。在 1555 行中,各个类型占比,即:
| 类型 | 含义 | 占比 |
|---|---|---|
intra_prot |
单条蛋白质链,通常用于链内/单链结构样本 | 39.61% |
prot_prot |
两条蛋白质链之间的界面,如抗体重链--轻链、抗体--蛋白抗原 | 30.93% |
intra_ligand |
单个小分子配体 | 9.71% |
ligand_prot |
小分子配体--蛋白质界面 | 8.87% |
ions_prot |
离子--蛋白质界面,如 Zn²⁺、Ca²⁺ 与蛋白 | 4.44% |
intra_ions |
单个离子实体 | 2.77% |
nuc_prot |
核酸--蛋白质界面;nuc 包括 DNA/RNA |
1.03% |
intra_nuc |
单条核酸链 | 0.96% |
ligand_ligand |
两个小分子配体之间的组合/界面 | 0.9% |
nuc_nuc |
两条核酸链之间的界面 | 0.32% |
ions_ions |
两个离子实体之间的组合 | 0.26% |
ions_ligand |
离子--小分子配体界面 | 0.13% |
ligand_nuc |
小分子配体--核酸界面 | 0.06% |
蛋白质 9NJ6 (intra_prot / intra_ions / prot_prot / ions_prot)
9NJ6 是一个由冷冻电镜解析的复合物结构(分辨率 2.36 Å),主体为计算优化的广谱反应性流感 B 病毒血凝素 BC2(COBRA HA),结合人源单克隆抗体的 Fab 片段。血凝素 HA 是流感病毒表面的三聚体糖蛋白:天然状态下负责识别宿主细胞表面的唾液酸受体,在病毒被内吞后介导病毒膜与内体膜融合;BC2 则是综合不同流感 B 病毒序列设计的人工免疫原,目的是同时呈现 Victoria 和 Yamagata 两大谱系的共有抗原特征,从而诱导更广泛的抗体反应。
糖链主要通过"糖基化"生成:细胞利用一系列糖基转移酶,把葡萄糖、NAG(N-乙酰葡糖胺)、甘露糖、FUC(岩藻糖)、半乳糖和唾液酸等单糖,逐步连接到蛋白质上。
val.csv 的数据,以 pdb_00009nj6_h_l 为例,即:
bash
# head -n 6 indices/val.csv
"entity_1_id","chain_1_id","mol_1_type","cluster_1_id","entity_2_id","chain_2_id","mol_2_type","cluster_2_id","cluster_id","pdb_id","release_date","num_tokens","num_prot_chains","resolution","type","mol_type_group","sub_mol_1_type","sub_mol_2_type","eval_type"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_3","","","","","pdb_cluster_pdb_000010gh_c_b_3","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","chain","intra_prot","prot","","intra_prot"
"3","Lxp","prot","pdb_cluster_pdb_000010gh_c_b_2","","","","","pdb_cluster_pdb_000010gh_c_b_2","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","chain","intra_prot","prot","","intra_prot"
"5","Mxb","ions","NAG_NAG_FUC","","","","","NAG_NAG_FUC","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","chain","intra_ions","ions","","intra_ions"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_3","3","Lxp","prot","pdb_cluster_pdb_000010gh_c_b_2","pdb_cluster_pdb_000010gh_c_b_2:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","interface","prot_prot","prot","prot","prot_prot"
"3","Lxp","prot","pdb_cluster_pdb_000010gh_c_b_2","5","Mxb","ions","NAG_NAG_FUC","NAG_NAG_FUC:pdb_cluster_pdb_000010gh_c_b_2","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","interface","ions_prot","prot","ions","ions_prot"
val.csv 的数据定义,即:
| 字段 | 值 | 含义 |
|---|---|---|
entity_1_id |
2 |
结构内部的实体编号。相同化学实体/序列的多条链可能共享 entity ID |
chain_1_id |
Hxp |
生物组装中的具体链 ID |
mol_1_type |
prot |
第一侧是蛋白质 |
cluster_1_id |
pdb_cluster_pdb_000010gh_c_b_3 |
该蛋白实体所属的序列聚类 ID |
entity_2_id |
空 | 没有第二个实体 |
chain_2_id |
空 | 没有第二条链 |
mol_2_type |
空 | 没有第二种分子 |
cluster_2_id |
空 | 没有第二侧聚类 |
cluster_id |
与 cluster_1_id 相同 |
当前样本的最终聚类 ID;单链样本直接使用第一侧聚类 |
pdb_id |
pdb_00009nj6_h_l |
该复合物在此数据集中的内部结构 ID,不是传统四字符 PDB ID |
release_date |
2026-03-11 |
数据记录中的发布日期 |
num_tokens |
495 |
整个结构经过 Protenix token 化后的 token 数量 |
num_prot_chains |
2 |
这个结构总共包含两条蛋白质链 |
resolution |
-1.0 |
分辨率不可用或不适用,-1 是占位值 |
type |
chain |
该行是一条单链记录,不是 interface 记录 |
mol_type_group |
intra_prot |
单蛋白链类别 |
sub_mol_1_type |
prot |
更细粒度分类仍为普通蛋白质 |
sub_mol_2_type |
空 | 没有第二侧分子 |
eval_type |
intra_prot |
评估类型为单蛋白链 |
单个蛋白类型:
bash
cp mmcif/pdb_00009nj6_h_l.cif.gz .
gzip -dk pdb_00009nj6_h_l.cif.gz
SabDab2 的 pdb_00009nj6_h_l 的结构,如下:

相关信息:
bash
糖残基编号:
1 = NAG
2 = NAG
3 = FUC
连接关系:
NAG(1):O4 --- C1:NAG(2)
NAG(1):O6 --- C1:FUC(3)
Protenix CCD 表示:CCD_NAG_NAG_FUC
数据格式:
json
[
{
"name": "pdb_00009nj6_h_l",
"sequences": [
{
"proteinChain": {
"id": ["H"],
"sequence": "EVQLVESGGHLVQPGGSLRLSCEASGFSFDEYAMHWVREAPGKGLEWVAGISWNSGAIGYAGSVKGRFTISKDSAKRVLYLQMNSLRPEDAALYYCAKDMREGCSGTNCYSYYYYFYAMDVWGQGTTVTVSSASTKGPSVFPLAPSSKSTSGGTAALGCLVKDYFPEPVTVSWNSGALTSGVHTFPAVLQSSGLYSLSSVVTVPSSSLGTQTYICNVNHKPSNTKVDKKVEPKSCDKTH",
"count": 1
}
},
{
"proteinChain": {
"id": ["L"],
"sequence": "QSVLTQPPSVSGAPGQGVTISCTGSSSNLGADYDVHWYQHLPGKAPKLLIYDNDKRPPGIPDRFSASRSGPSASLAISGLQGEDEADYYCQSYDSHLSGSVFGGGTKLTVVLGQPKAAPSVTLFPPSSEELQANKATLVCLISDFYPGAVTVAWKADSSPVKAGVETTTPSKQSNNKYAASSYLSLTPEQWKSHRSYSCQVTHEGSTVEKTVAPTEC",
"count": 1
}
},
{
"ligand": {
"id": ["M"],
"ligand": "CCD_NAG_NAG_FUC",
"count": 1
}
}
],
"covalent_bonds": [
{
"entity1": 3,
"copy1": 1,
"position1": 1,
"atom1": "O4",
"entity2": 3,
"copy2": 1,
"position2": 2,
"atom2": "C1"
},
{
"entity1": 3,
"copy1": 1,
"position1": 1,
"atom1": "O6",
"entity2": 3,
"copy2": 1,
"position2": 3,
"atom2": "C1"
}
]
}
]
糖残基之间的糖苷键,就是三个单糖组成一条支化糖链,即:
bash
FUC(3)
|
α1→6
|
NAG(2) ---β1→4--- NAG(1)
预测结果:

完整蛋白质的示例,如下:

蛋白质 9WU2 (intra_prot / intra_ligand / dna_prot / ligand_prot / nuc_nuc)
9WU2 是一个抗体 Fab--DNA 复合物的晶体结构,展示嵌合型抗 Z-DNA 抗体 cZ22-Fab 如何识别并稳定左手双螺旋 DNA。该结构采用 X 射线晶体学解析,分辨率为 2.35 Å;核心复合物由两分子 cZ22-Fab 对称结合一段由七核苷酸 d C ( G C ) 3 dC(GC)_{3} dC(GC)3(5′-CGCGCGC-3′)形成的 Z-DNA 双链构成,Fab:DNA 化学计量比为 2:1。
9WU2 的主要组成包括:
- cZ22-Fab 重链:236 aa
- cZ22-Fab 轻链:214 aa
- DNA:每条链 7 个核苷酸,形成带有5′端突出胞嘧啶的左手 Z-DNA 双链
- GOL:甘油,是结晶或冷冻保护条件中的小分子,不是具有特异生物学功能的配体
- PCA:部分重链N端 谷氨酰胺(Q),环化形成的焦谷氨酸修饰
val.csv 的数据,以 pdb_00009wu2_g_h 为例,即:
bash
# cat indices/val.csv | grep 9wu2
"entity_1_id","chain_1_id","mol_1_type","cluster_1_id","entity_2_id","chain_2_id","mol_2_type","cluster_2_id","cluster_id","pdb_id","release_date","num_tokens","num_prot_chains","resolution","type","mol_type_group","sub_mol_1_type","sub_mol_2_type","eval_type"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","","","","","pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_prot","modified_prot","","intra_prot"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_2","","","","","pdb_cluster_pdb_000010gh_c_b_2","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_prot","prot","","intra_prot"
"3","Kxp","nuc","CGCGCGC","","","","","CGCGCGC","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_nuc","dna","","intra_dna"
"3","Lxp","nuc","CGCGCGC","","","","","CGCGCGC","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_nuc","dna","","intra_dna"
"4","Ux1","ligand","GOL","","","","","GOL","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_ligand","excluded_ligand","","intra_ligand"
"4","Wx1","ligand","GOL","","","","","GOL","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_ligand","excluded_ligand","","intra_ligand"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_2","pdb_cluster_pdb_000010gh_c_b_2:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","prot_prot","modified_prot","prot","prot_prot"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","3","Kxp","nuc","CGCGCGC","CGCGCGC:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","nuc_prot","modified_prot","dna","dna_prot"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","4","Ux1","ligand","GOL","GOL:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","ligand_prot","modified_prot","excluded_ligand","ligand_prot"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_2","3","Kxp","nuc","CGCGCGC","CGCGCGC:pdb_cluster_pdb_000010gh_c_b_2","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","nuc_prot","prot","dna","dna_prot"
"3","Kxp","nuc","CGCGCGC","3","Lxp","nuc","CGCGCGC","CGCGCGC:CGCGCGC","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","nuc_nuc","dna","dna","nuc_nuc"
"3","Lxp","nuc","CGCGCGC","4","Ux1","ligand","GOL","CGCGCGC:GOL","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","ligand_nuc","dna","excluded_ligand","ligand_nuc"
测试序列:
json
[
{
"name": "pdb_00009wu2_G_H",
"modelSeeds": [
0
],
"sequences": [
{
"proteinChain": {
"sequence": "KVQLVESGGGLVQPKGSLKLSCAASGFNFNTYAMNWVRQAPGKGLEWVARIRSKSNNYATYYADSMKDRFTISRDDSENMLYLQMINLKAEDTAMYYCVRQAYSNYGAMDYWGQGISVTVSSASTKGPSVFPLAPSSKSTSGGTAALGCLVKDYFPEPVTVSWNSGALTSGVHTFPAVLQSSGLYSLSSVVTVPSSSLGTQTYICNVNHKPSNTKVDKKAEPKSCDKTHHHHHHHH",
"count": 1,
"id": [
"G"
],
"modifications": [
{
"ptmType": "CCD_PCA",
"ptmPosition": 3
}
]
}
},
{
"proteinChain": {
"sequence": "DIQMTQTTSSLSASLGDRVTISCSASQGISNYLNWYQQKPDGTVKLLIYYTSRLHSGVPSRFSGSGSGTDYSLTISNLEPEDIATYFCQQYSKFPFTFGSGTKLEIKRTVAAPSVFIFPPSDEQLKSGTASVVCLLNNFYPREAKVQWKVDNALQSGNSQESVTEQDSKDSTYSLSSTLTLSKADYEKHKVYACEVTHQGLSSPVTKSFNRNEC",
"count": 1,
"id": [
"H"
]
}
},
{
"dnaSequence": {
"sequence": "CGCGCGC",
"count": 2,
"id": [
"K",
"L"
]
}
}
]
}
]
9WU2 结构:

SabDab2 的子实例 pdb_00009wu2_g_h ,即:

蛋白质 8TNI (复杂多链蛋白)
8TNI 是一个用于研究 HIV-1 中和抗体作用机制的冷冻电镜结构,不是普通的单体蛋白。包含:
- HIV-1 BG505 DS-SOSIP Env 三聚体,即 3 份 gp120 和 3 份 gp41。
- 广谱中和双特异性抗体 CAP256L-R27。
- 抗体同时针对 Env 的 CD4 结合位点和 V2-apex 区域。
其主要用途是观察抗体如何结合 Env、两个抗体识别模块的空间排布,以及这些结合方式如何阻止病毒进入细胞。这类结构也可用于优化双特异性抗体和设计更接近天然 Env 的 HIV 疫苗免疫原。该结构通过冷冻电镜测定,分辨率约 3.61 Å。
| 名称 | 含义 |
|---|---|
| HIV-1 | 人类免疫缺陷病毒 1 型 |
| BG505 | HIV-1 病毒分离株的编号,不是需要逐字翻译的英文缩写 |
| Env | Envelope glycoprotein,包膜糖蛋白 |
| DS | Additional Disulfide,额外二硫键稳定化 |
| SOSIP | 一组使 Env 保持可溶性、三聚体和融合前构象的工程改造 |
Assembly1 结构:

相关链的信息非常复杂:
| entity_id | _struct_asym 数量 |
内容 | 图中颜色 |
|---|---|---|---|
| 1 | 3 | Env 蛋白链 A1/C1/E1 | 蓝色 |
| 2 | 3 | Env 蛋白链 B1/D1/F1 | 青色 |
| 3 | 3 | 抗体链 H1/I1/J1 | 粉色 |
| 4 | 1 | 抗体链 X1 | 黄色 |
| 5 | 12 | 独立/较短的糖基 subchain | 橙色 |
| 6 | 4 | 支链糖 | 珊瑚色 |
| 7 | 1 | 支链糖 | 红色 |
| 8 | 32 | 分别记录的单个 NAG 残基 | 棕黄色 |