AIDD - 索引 mmCIF 文件与 不同抗体类型实例

欢迎关注我的CSDN:https://spike.blog.csdn.net/

本文地址:https://spike.blog.csdn.net/article/details/164122510

免责声明:本文来源于个人知识与公开资料,仅用于学术交流,欢迎讨论,不支持转载。

数据格式,介绍训练与验证索引文件的字段与数据采样,通过结构案例深入展示不同蛋白质与分子类型的组织方式。索引文件每行记录一条链或界面样本,包含实体编号、链 ID、分子类型、聚类 ID、token 数、分辨率等 19 个字段,共涵盖 13 种分子组合类型。以流感血凝素抗体复合物 9NJ6、抗 Z-DNA 抗体复合物9WU2 和 HIV-1 Env 三聚体--双特异性抗体复合物 8TNI 为例,解析 mmCIF 结构文件,映射为 JSON 输入格式,包括序列定义、共价键连接、翻译后修饰等。

数据格式:

bash 复制代码
indices/val.csv

训练日志:

bash 复制代码
[Protenix IO] read_indices_csv finished in 0.013s: path=indices/val.csv, shape=(1569, 19)
#Rows in indices list: 1569
[removed] #Rows: 14
[removed] #PDB: 2
[filtered by n_token (1536)] #Rows: 1555
---------- Dataset sabdab2_val----------
intra_prot: 616/1555(39.61%)
prot_prot: 481/1555(30.93%)
intra_ligand: 151/1555(9.71%)
ligand_prot: 138/1555(8.87%)
ions_prot: 69/1555(4.44%)
intra_ions: 43/1555(2.77%)
nuc_prot: 16/1555(1.03%)
intra_nuc: 15/1555(0.96%)
ligand_ligand: 14/1555(0.9%)
nuc_nuc: 5/1555(0.32%)
ions_ions: 4/1555(0.26%)
ions_ligand: 2/1555(0.13%)
ligand_nuc: 1/1555(0.06%)
------------------------------
intra_prot: 99/479(20.67%)
prot_prot: 191/479(39.87%)
intra_ligand: 23/479(4.8%)
ligand_prot: 68/479(14.2%)
ions_prot: 50/479(10.44%)
intra_ions: 14/479(2.92%)
nuc_prot: 10/479(2.09%)
intra_nuc: 4/479(0.84%)
ligand_ligand: 11/479(2.3%)
nuc_nuc: 2/479(0.42%)
ions_ions: 4/479(0.84%)
ions_ligand: 2/479(0.42%)
ligand_nuc: 1/479(0.21%)
------------------------------
Final pdb ids: 248
------------------------------

val.csv 是 1569 行,以 1536 长度过滤 Tokens,剩余 1555 行。在 1555 行中,各个类型占比,即:

类型 含义 占比
intra_prot 单条蛋白质链,通常用于链内/单链结构样本 39.61%
prot_prot 两条蛋白质链之间的界面,如抗体重链--轻链、抗体--蛋白抗原 30.93%
intra_ligand 单个小分子配体 9.71%
ligand_prot 小分子配体--蛋白质界面 8.87%
ions_prot 离子--蛋白质界面,如 Zn²⁺、Ca²⁺ 与蛋白 4.44%
intra_ions 单个离子实体 2.77%
nuc_prot 核酸--蛋白质界面;nuc 包括 DNA/RNA 1.03%
intra_nuc 单条核酸链 0.96%
ligand_ligand 两个小分子配体之间的组合/界面 0.9%
nuc_nuc 两条核酸链之间的界面 0.32%
ions_ions 两个离子实体之间的组合 0.26%
ions_ligand 离子--小分子配体界面 0.13%
ligand_nuc 小分子配体--核酸界面 0.06%

蛋白质 9NJ6 (intra_prot / intra_ions / prot_prot / ions_prot)

9NJ6 是一个由冷冻电镜解析的复合物结构(分辨率 2.36 Å),主体为计算优化的广谱反应性流感 B 病毒血凝素 BC2(COBRA HA),结合人源单克隆抗体的 Fab 片段。血凝素 HA 是流感病毒表面的三聚体糖蛋白:天然状态下负责识别宿主细胞表面的唾液酸受体,在病毒被内吞后介导病毒膜与内体膜融合;BC2 则是综合不同流感 B 病毒序列设计的人工免疫原,目的是同时呈现 Victoria 和 Yamagata 两大谱系的共有抗原特征,从而诱导更广泛的抗体反应。

糖链主要通过"糖基化"生成:细胞利用一系列糖基转移酶,把葡萄糖、NAG(N-乙酰葡糖胺)、甘露糖、FUC(岩藻糖)、半乳糖和唾液酸等单糖,逐步连接到蛋白质上。

val.csv 的数据,以 pdb_00009nj6_h_l 为例,即:

bash 复制代码
# head -n 6 indices/val.csv
"entity_1_id","chain_1_id","mol_1_type","cluster_1_id","entity_2_id","chain_2_id","mol_2_type","cluster_2_id","cluster_id","pdb_id","release_date","num_tokens","num_prot_chains","resolution","type","mol_type_group","sub_mol_1_type","sub_mol_2_type","eval_type"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_3","","","","","pdb_cluster_pdb_000010gh_c_b_3","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","chain","intra_prot","prot","","intra_prot"
"3","Lxp","prot","pdb_cluster_pdb_000010gh_c_b_2","","","","","pdb_cluster_pdb_000010gh_c_b_2","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","chain","intra_prot","prot","","intra_prot"
"5","Mxb","ions","NAG_NAG_FUC","","","","","NAG_NAG_FUC","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","chain","intra_ions","ions","","intra_ions"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_3","3","Lxp","prot","pdb_cluster_pdb_000010gh_c_b_2","pdb_cluster_pdb_000010gh_c_b_2:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","interface","prot_prot","prot","prot","prot_prot"
"3","Lxp","prot","pdb_cluster_pdb_000010gh_c_b_2","5","Mxb","ions","NAG_NAG_FUC","NAG_NAG_FUC:pdb_cluster_pdb_000010gh_c_b_2","pdb_00009nj6_h_l","2026-03-11","495","2","-1.0","interface","ions_prot","prot","ions","ions_prot"

val.csv 的数据定义,即:

字段 含义
entity_1_id 2 结构内部的实体编号。相同化学实体/序列的多条链可能共享 entity ID
chain_1_id Hxp 生物组装中的具体链 ID
mol_1_type prot 第一侧是蛋白质
cluster_1_id pdb_cluster_pdb_000010gh_c_b_3 该蛋白实体所属的序列聚类 ID
entity_2_id 没有第二个实体
chain_2_id 没有第二条链
mol_2_type 没有第二种分子
cluster_2_id 没有第二侧聚类
cluster_id cluster_1_id 相同 当前样本的最终聚类 ID;单链样本直接使用第一侧聚类
pdb_id pdb_00009nj6_h_l 该复合物在此数据集中的内部结构 ID,不是传统四字符 PDB ID
release_date 2026-03-11 数据记录中的发布日期
num_tokens 495 整个结构经过 Protenix token 化后的 token 数量
num_prot_chains 2 这个结构总共包含两条蛋白质链
resolution -1.0 分辨率不可用或不适用,-1 是占位值
type chain 该行是一条单链记录,不是 interface 记录
mol_type_group intra_prot 单蛋白链类别
sub_mol_1_type prot 更细粒度分类仍为普通蛋白质
sub_mol_2_type 没有第二侧分子
eval_type intra_prot 评估类型为单蛋白链

单个蛋白类型:

bash 复制代码
cp mmcif/pdb_00009nj6_h_l.cif.gz .
gzip -dk pdb_00009nj6_h_l.cif.gz

SabDab2 的 pdb_00009nj6_h_l 的结构,如下:

相关信息:

bash 复制代码
糖残基编号:
1 = NAG
2 = NAG
3 = FUC

连接关系:
NAG(1):O4 --- C1:NAG(2)
NAG(1):O6 --- C1:FUC(3)

Protenix CCD 表示:CCD_NAG_NAG_FUC

数据格式:

json 复制代码
[
  {
    "name": "pdb_00009nj6_h_l",
    "sequences": [
      {
        "proteinChain": {
          "id": ["H"],
          "sequence": "EVQLVESGGHLVQPGGSLRLSCEASGFSFDEYAMHWVREAPGKGLEWVAGISWNSGAIGYAGSVKGRFTISKDSAKRVLYLQMNSLRPEDAALYYCAKDMREGCSGTNCYSYYYYFYAMDVWGQGTTVTVSSASTKGPSVFPLAPSSKSTSGGTAALGCLVKDYFPEPVTVSWNSGALTSGVHTFPAVLQSSGLYSLSSVVTVPSSSLGTQTYICNVNHKPSNTKVDKKVEPKSCDKTH",
          "count": 1
        }
      },
      {
        "proteinChain": {
          "id": ["L"],
          "sequence": "QSVLTQPPSVSGAPGQGVTISCTGSSSNLGADYDVHWYQHLPGKAPKLLIYDNDKRPPGIPDRFSASRSGPSASLAISGLQGEDEADYYCQSYDSHLSGSVFGGGTKLTVVLGQPKAAPSVTLFPPSSEELQANKATLVCLISDFYPGAVTVAWKADSSPVKAGVETTTPSKQSNNKYAASSYLSLTPEQWKSHRSYSCQVTHEGSTVEKTVAPTEC",
          "count": 1
        }
      },
      {
        "ligand": {
          "id": ["M"],
          "ligand": "CCD_NAG_NAG_FUC",
          "count": 1
        }
      }
    ],
    "covalent_bonds": [
      {
        "entity1": 3,
        "copy1": 1,
        "position1": 1,
        "atom1": "O4",
        "entity2": 3,
        "copy2": 1,
        "position2": 2,
        "atom2": "C1"
      },
      {
        "entity1": 3,
        "copy1": 1,
        "position1": 1,
        "atom1": "O6",
        "entity2": 3,
        "copy2": 1,
        "position2": 3,
        "atom2": "C1"
      }
    ]
  }
]

糖残基之间的糖苷键,就是三个单糖组成一条支化糖链,即:

bash 复制代码
              FUC(3)
                |
              α1→6
                |
NAG(2) ---β1→4--- NAG(1)

预测结果:

完整蛋白质的示例,如下:

蛋白质 9WU2 (intra_prot / intra_ligand / dna_prot / ligand_prot / nuc_nuc)

9WU2 是一个抗体 Fab--DNA 复合物的晶体结构,展示嵌合型抗 Z-DNA 抗体 cZ22-Fab 如何识别并稳定左手双螺旋 DNA。该结构采用 X 射线晶体学解析,分辨率为 2.35 Å;核心复合物由两分子 cZ22-Fab 对称结合一段由七核苷酸 d C ( G C ) 3 dC(GC)_{3} dC(GC)3(5′-CGCGCGC-3′)形成的 Z-DNA 双链构成,Fab:DNA 化学计量比为 2:1

9WU2 的主要组成包括:

  • cZ22-Fab 重链:236 aa
  • cZ22-Fab 轻链:214 aa
  • DNA:每条链 7 个核苷酸,形成带有5′端突出胞嘧啶的左手 Z-DNA 双链
  • GOL:甘油,是结晶或冷冻保护条件中的小分子,不是具有特异生物学功能的配体
  • PCA:部分重链N端 谷氨酰胺(Q),环化形成的焦谷氨酸修饰

val.csv 的数据,以 pdb_00009wu2_g_h 为例,即:

bash 复制代码
# cat indices/val.csv | grep 9wu2
"entity_1_id","chain_1_id","mol_1_type","cluster_1_id","entity_2_id","chain_2_id","mol_2_type","cluster_2_id","cluster_id","pdb_id","release_date","num_tokens","num_prot_chains","resolution","type","mol_type_group","sub_mol_1_type","sub_mol_2_type","eval_type"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","","","","","pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_prot","modified_prot","","intra_prot"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_2","","","","","pdb_cluster_pdb_000010gh_c_b_2","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_prot","prot","","intra_prot"
"3","Kxp","nuc","CGCGCGC","","","","","CGCGCGC","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_nuc","dna","","intra_dna"
"3","Lxp","nuc","CGCGCGC","","","","","CGCGCGC","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_nuc","dna","","intra_dna"
"4","Ux1","ligand","GOL","","","","","GOL","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_ligand","excluded_ligand","","intra_ligand"
"4","Wx1","ligand","GOL","","","","","GOL","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","chain","intra_ligand","excluded_ligand","","intra_ligand"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_2","pdb_cluster_pdb_000010gh_c_b_2:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","prot_prot","modified_prot","prot","prot_prot"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","3","Kxp","nuc","CGCGCGC","CGCGCGC:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","nuc_prot","modified_prot","dna","dna_prot"
"1","Gxp","prot","pdb_cluster_pdb_000010gh_c_b_3","4","Ux1","ligand","GOL","GOL:pdb_cluster_pdb_000010gh_c_b_3","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","ligand_prot","modified_prot","excluded_ligand","ligand_prot"
"2","Hxp","prot","pdb_cluster_pdb_000010gh_c_b_2","3","Kxp","nuc","CGCGCGC","CGCGCGC:pdb_cluster_pdb_000010gh_c_b_2","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","nuc_prot","prot","dna","dna_prot"
"3","Kxp","nuc","CGCGCGC","3","Lxp","nuc","CGCGCGC","CGCGCGC:CGCGCGC","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","nuc_nuc","dna","dna","nuc_nuc"
"3","Lxp","nuc","CGCGCGC","4","Ux1","ligand","GOL","CGCGCGC:GOL","pdb_00009wu2_g_h","2026-02-18","483","2","2.35","interface","ligand_nuc","dna","excluded_ligand","ligand_nuc"

测试序列:

json 复制代码
[
    {
        "name": "pdb_00009wu2_G_H",
        "modelSeeds": [
            0
        ],
        "sequences": [
            {
                "proteinChain": {
                    "sequence": "KVQLVESGGGLVQPKGSLKLSCAASGFNFNTYAMNWVRQAPGKGLEWVARIRSKSNNYATYYADSMKDRFTISRDDSENMLYLQMINLKAEDTAMYYCVRQAYSNYGAMDYWGQGISVTVSSASTKGPSVFPLAPSSKSTSGGTAALGCLVKDYFPEPVTVSWNSGALTSGVHTFPAVLQSSGLYSLSSVVTVPSSSLGTQTYICNVNHKPSNTKVDKKAEPKSCDKTHHHHHHHH",
                    "count": 1,
                    "id": [
                        "G"
                    ],
                    "modifications": [
                        {
                            "ptmType": "CCD_PCA",
                            "ptmPosition": 3
                        }
                    ]
                }
            },
            {
                "proteinChain": {
                    "sequence": "DIQMTQTTSSLSASLGDRVTISCSASQGISNYLNWYQQKPDGTVKLLIYYTSRLHSGVPSRFSGSGSGTDYSLTISNLEPEDIATYFCQQYSKFPFTFGSGTKLEIKRTVAAPSVFIFPPSDEQLKSGTASVVCLLNNFYPREAKVQWKVDNALQSGNSQESVTEQDSKDSTYSLSSTLTLSKADYEKHKVYACEVTHQGLSSPVTKSFNRNEC",
                    "count": 1,
                    "id": [
                        "H"
                    ]
                }
            },
            {
                "dnaSequence": {
                    "sequence": "CGCGCGC",
                    "count": 2,
                    "id": [
                        "K",
                        "L"
                    ]
                }
            }
        ]
    }
]

9WU2 结构:

SabDab2 的子实例 pdb_00009wu2_g_h ,即:

蛋白质 8TNI (复杂多链蛋白)

8TNI 是一个用于研究 HIV-1 中和抗体作用机制的冷冻电镜结构,不是普通的单体蛋白。包含:

  • HIV-1 BG505 DS-SOSIP Env 三聚体,即 3 份 gp120 和 3 份 gp41。
  • 广谱中和双特异性抗体 CAP256L-R27。
  • 抗体同时针对 Env 的 CD4 结合位点和 V2-apex 区域。

其主要用途是观察抗体如何结合 Env、两个抗体识别模块的空间排布,以及这些结合方式如何阻止病毒进入细胞。这类结构也可用于优化双特异性抗体和设计更接近天然 Env 的 HIV 疫苗免疫原。该结构通过冷冻电镜测定,分辨率约 3.61 Å。

名称 含义
HIV-1 人类免疫缺陷病毒 1 型
BG505 HIV-1 病毒分离株的编号,不是需要逐字翻译的英文缩写
Env Envelope glycoprotein,包膜糖蛋白
DS Additional Disulfide,额外二硫键稳定化
SOSIP 一组使 Env 保持可溶性、三聚体和融合前构象的工程改造

Assembly1 结构:

相关链的信息非常复杂:

entity_id _struct_asym 数量 内容 图中颜色
1 3 Env 蛋白链 A1/C1/E1 蓝色
2 3 Env 蛋白链 B1/D1/F1 青色
3 3 抗体链 H1/I1/J1 粉色
4 1 抗体链 X1 黄色
5 12 独立/较短的糖基 subchain 橙色
6 4 支链糖 珊瑚色
7 1 支链糖 红色
8 32 分别记录的单个 NAG 残基 棕黄色
相关推荐
SpikeKing13 天前
AIDD - SAbDab2 抗体感知聚类(Antibody-Perceived Clustering)
聚类·抗体·aidd·sabdab2·mmseqs
SpikeKing20 天前
AIDD - ColabFold 的 MSA/Template 数据集与检索策略
template·msa·aidd·colabfold
沐籽李23 天前
HuDiff在抗体人源化项目中的工程化落地
人工智能·算法·aidd·抗体设计
沐籽李1 个月前
从溶剂可及表面积SASA理解抗体结构与工程改造
人工智能·药物设计·aidd·sasa
沐籽李2 个月前
Roche 团队如何设计酸性 pH 激活的 anti-CD3 抗体
人工智能·aidd·抗体设计·ph敏感抗体
沐籽李2 个月前
Agent入门第三课:上下文不是越长越好,记忆也不是越多越聪明
人工智能·agent·aidd·基础术语·入门概念
沐籽李3 个月前
从问答到执行:Biomni 如何重构生物医学研究工作流
数据库·agent·aidd·抗体设计·biomni
沐籽李3 个月前
从 AlphaFold1 到 AlphaFold3:AI 如何一步步改变蛋白质结构预测?
人工智能·药物研发·aidd·结构预测·蛋白质模型
沐籽李3 个月前
Protein Hunter:当结构预测模型开始“反向设计”蛋白
人工智能·深度学习·模型·药物研发·aidd