机器学习酶功能预测--Nature

Enzyme specificity prediction using cross-attention graph neural networks

基于交叉注意力图神经网络的酶特异性预测

摘要

酶是生命体中的分子功能机器,底物特异性 是决定酶功能的核心特性,即酶识别特定底物并对其选择性发挥催化作用的能力。该特异性由酶活性中心三维空间结构,以及化学反应复杂的过渡态共同决定。 诸多酶还具备底物杂泛性,可催化天然进化之外的反应、作用于非天然底物。但目前海量已知酶仍缺乏可靠的底物特异性数据,既限制了酶的实际应用,也阻碍了人们全面解析自然界生物催化的多样性特征。

本研究构建了一款搭载交叉注意力机制SE (3) 等变图神经网络 模型 EZSpecificity,用于酶底物特异性预测;模型基于自建、覆盖序列与结构层面的大规模酶 - 底物互作数据集完成训练。

经未知底物 - 酶数据集及 7 类概念验证蛋白家族测试,EZSpecificity 预测性能优于现有同类机器学习模型。选取 8 种卤化酶与 78 种底物开展实验验证,该模型精准筛选单一潜在反应底物的准确率可达91.7% ,远高于当前主流最优酶底物预测模型的 58.3%。

EZSpecificity 是一款通用型机器学习预测模型,可为生物学、医学领域基础研究与应用研究相关酶类,精准完成底物特异性预测。

主体内容

近些年来,学界已研发多款用于预测酶底物特异性的机器学习工具,但这类工具整体预测效果有限,且大多仅针对特定蛋白家族开发计算预测平台。目前主流的酶功能预测工具,例如基于对比学习的酶注释工具 CLEAN、ProteInfer 与 DeepECTransformer,均难以区分同一酶学委员会编号(EC 编号)下不同酶的催化反应活性与底物特异性,这也是生物催化领域亟待攻克的核心难题。

酶底物预测模型 ESP 借助图神经网络对大量蛋白质对应的各类代谢物进行特征编码,但该模型仅收集约 1300 种底物,底物数据体量不足,无法在基因组尺度代谢模型中囊括所有天然及非天然酶 - 底物配对组合。此后,基于分子指纹与蛋白序列嵌入表征的研究取得了更为理想的预测效果,然而各类化合物 - 蛋白质互作分析方法,依旧难以精准刻画酶与底物之间的识别作用。这也印证了催化残基类型、空间排布方式以及长程耦合作用,是决定酶底物特异性的关键因素。

尽管 ESP、化合物 - 蛋白互作模型、通用深度学习多功能工具 ALDELE 等框架均展现出广泛应用潜力,但如何同步融合并充分利用序列信息、空间结构信息与分子互作信息,以此提升预测精度,依旧是行业内一大难点。

为解决上述现存短板,本研究搭建了融合空间结构信息、搭载交叉注意力辅助图神经网络的通用深度学习预测模型 EZSpecificity,用于酶底物特异性预测。研究首先构建了经过人工整理筛选的高质量酶 - 底物互作数据库 ESIBank,该数据库收录海量天然与非天然底物、底物取代形式,同时涵盖序列层面、结构层面及互作层面的酶 - 底物复合物相关数据。

随后本研究设计基于 SE (3) 等变图神经网络的编码器,用以捕捉酶催化活性中心内各个原子的微环境特征,并引入交叉注意力机制,强化酶与底物二者之间的相互作用关联。为验证 EZSpecificity 模型的通用性与预测准确度,本研究选取六大典型蛋白家族,对大量未知酶 - 底物组合开展全面的虚拟模拟实验。最后,利用自建卤化酶数据库(包含 386 种酶、449 种底物),借助该模型完成底物作用谱注释,并进一步开展体外实验验证。

EZSpecificity 模型架构

现阶段用于酶特异性预测的机器学习模型,大多仅从一维蛋白序列、二维分子拓扑图中提取特征,忽略了底物结合过程具备三维空间属性这一核心特点。此外,这类模型通常先将酶与底物分别转化为独立表征向量,再进行向量拼接融合,极大限制了模型捕捉酶与底物之间复杂相互作用的能力。

针对以上问题,本研究搭建 EZSpecificity 深度学习模型,整合蛋白序列数据、三维酶 - 底物复合物结构数据以及活性中心微环境信息,实现酶 - 底物特异性精准预测,模型整体架构如图 1 所示。序列层面,研究将目前性能顶尖的自监督序列表征编码器 ESM-2 所生成的全长氨基酸特征表征,嵌入至 EZSpecificity 模型中。

鉴于底物结合口袋是决定酶功能、尤其是底物特异性的核心结构,本研究将结合口袋构建为图结构\(G=(V,E)\):其中节点 V 代表酶或底物中的单个原子,边 E 用于连接结构内距离最近的 k 个相邻原子。借鉴 E (n) 等变图神经网络设计思路,采用 SE (3) 等变图神经网络对结合口袋进行建模,保证编码过程不受三维欧式空间变换影响。

同时该模型预留拓展接口,可灵活在原子层面、氨基酸残基层面或整体分子层面,接入各类分子指纹特征。上述设计让模型能够充分整合各类核心特征,大幅提升 EZSpecificity 的泛化预测能力。

需要说明的是,EZSpecificity 主打酶底物特异性预测,但受限于分子表征方式与编码策略分辨率不足,目前该模型暂无法实现化学选择性、区域选择性以及立体选择性的可靠预测。

研究采用ESM-2 与基于SE (3) 等变图神经网络 的活性中心环境编码方法,提取酶 - 底物复合物的序列表征与结构表征。 借助消息传递神经网络(MPNN) 分别获取底物内部特征表征、以及酶 - 底物互作特征表征。

交叉注意力层设置多个独立注意力头,通过可学习注意力机制捕捉酶氨基酸残基与底物原子之间的相互作用关系;该注意力机制由多层可训练线性网络构成。

将加权处理后的三维催化核心表征与加权序列表征作为输入,训练多层感知机模型。 本框架可灵活将原子级、残基级及整体分子层面的各类分子指纹,融入特征表征构建流程。 本文示意图均使用 BioRender 平台绘制(https://biorender.com)。

为精准捕捉活性中心环境中复杂的酶 - 底物相互作用,研究采用两层交叉注意力层,生成酶 - 底物配对的融合特征表征。

过往研究方法会对所有氨基酸与原子均等分配权重,而本文所设交叉注意力层,能够重点突出决定酶底物特异性的关键氨基酸与底物原子。该设计可最大程度剔除无效噪声,强化模型学习聚焦能力,进而提升模型泛化性能。

简言之,交叉注意力层可有效建立酶氨基酸残基与底物原子之间的关联作用,挖掘决定底物特异性的核心特征信息。最后依托多层感知机,基于酶 - 底物配对特征完成特异性预测。

后续研究采用 ESIBank 数据集对 EZSpecificity 模型开展训练,具体流程见下文。模型主要输入数据包含:酶氨基酸序列、分子对接得到的酶 - 底物复合物结构以及底物 SMILES 结构式,最终输出可判定酶底物特异性的预测分值。

酶 - 底物互作数据库

高质量训练数据集是提升机器学习模型性能的关键。为完成 EZSpecificity 模型训练,本研究整合序列类数据库(如 BRENDA、UniProt),结合 AlphaFold、AlphaFill 及 AutoDock/Vina-GPU 生成的结构数据,构建了完备的酶 - 底物互作数据库 ESIBank。

首先从 BRENDA 与 UniProt 数据库获取海量酶序列,同时收集六大典型酶家族的酶 - 底物数据,分别为酯酶、糖基转移酶、腈水解酶、磷酸酶、硫解酶以及未知功能结构域蛋白。

UniProt 等权威知识库依靠人工整理与规则预测体系整合多方数据,但数据库内容更新速度,往往远滞后于实验新数据的产出速度。

针对大量仅见于文献图谱、尚未被公共数据库收录的重要酶促反应数据,本研究搭建一套半自动数据提取流程 ,分为识别、提取、转译、关联四大步骤。依托该流程,研究构建出包含约 3300 组酶 - 底物配对的卤化酶 - 底物专用数据集 HaloS,专门用于后续模型实验验证。

a、ESIBank 数据库的构建流程。中间板块展示了从已发表的在线数据库和文献中获取各类天然与非天然底物、野生型酶和突变型酶的完整过程。上方板块展示半自动数据提取流程,下方板块展示 AutoDock-GPU 对接流程。半自动数据提取包含四个步骤:识别、提取、转换与关联。光学结构识别应用程序(OSRA)可将科研文献中的化合物化学结构信息转换为机器可读的 SMILES 格式。本研究选取卤化反应作为半自动数据提取的应用示例。AutoDock-GPU 对接流程包含两个环节:(1)输入准备;(2)对接与筛选流程。蛋白质三维结构取自 PDBank、AlphaFold 和 AlphaFill 数据库。通过距离与亲和力评分体系对 AutoDock-GPU 输出的多种结合构象进行筛选,选出最适配催化反应的酶 - 底物构象。b、ESIBank 数据集整体概况。图 a、图 b 示意图均使用 BioRender(https://biorender.com)绘制。

为制备可用于对接的功能性三维结构,我们以 BRENDA 数据库收录的辅因子为参照,从 AlphaFill 数据库中筛选含辅因子的蛋白结构。此外,针对 BRENDA 中已标注催化残基的所有反应,利用这些催化残基界定对接盒子的活性中心范围,通过 RDKit 基于简化分子线性输入规范(SMILES)制备底物结构,随后采用 AutoDock-GPU 完成对接流程(图 2a 底部)。AutoDock-GPU 作为 AutoDock 的硬件加速版本,可根据需求充分探索分子空间,同时有效规避冗余计算。本研究对已知活性中心的酶 - 底物配对采用距离打分策略,并结合亲和力打分,在 100 轮运算中筛选最优结合构象,每轮运算最多可完成 250 万次评分评估,单组配对最高可实现 2.5 亿次构象评估。综上,ESIBank 数据库整合了来自公开在线数据库与文献的 34417 种天然及非天然底物、8124 种野生型与突变型酶。其底物数量是 ESP 数据集(仅含 1379 种独特底物)的 25 倍。ESIBank 最终共收录 323783 组酶 - 底物配对(图 2b 及补充文本 2、3),是目前首个大规模的结构层面酶 - 底物复合物数据库。

EZSpecificity 计算机仿真评估

为验证 EZSpecificity 的性能,本研究基于完整 ESIBank 数据集设计多组基准实验,综合评估该模型的酶特异性预测效果。本研究将 EZSpecificity 与当前最优的酶底物特异性预测通用机器学习模型 ESP 进行对比,在 ESIBank 数据集上开展四折交叉验证,计算所有折次的平均性能。除常规的随机划分数据集设置外,本研究增设三种测试场景:(1)未知底物;(2)未知酶;(3)酶与底物均未知。其中未知底物场景的测试底物均未出现在其他折次的训练数据中,用于模拟各类真实应用场景。结果显示,EZSpecificity 在四种场景下的性能均持续优于 ESP 模型。随着未知底物、未知酶带来的测试难度提升,EZSpecificity 及 EZSpecificity-w/oGCS 相对 ESP 的性能提升幅度略有回落,但在难度最高的酶和底物均未知 场景中表现尤为优异(EZSpecificity 模型 AUROC 值为 0.7198,ESP 模型 AUROC 值为 0.6523,AUROC 为受试者工作特征曲线下面积),证明其在实际应用中具备更优的可靠性。同时,模型的精确率 - 召回率曲线下面积(AUPR)指标提升了 8.72%(补充图 4)。

a 图为 EZSpecificity 与通用酶特异性预测模型 ESP,在四种数据集划分方式(随机划分、未知底物、未知酶、酶与底物均未知)下的 AUROC 性能对比。b 图为 EZSpecificity 在酶与底物均未知数据集上以 AUROC 分值为评价指标开展的消融实验。c、d 图分别通过 AUROC 与 AUPR 指标,评估 EZSpecificity 针对四位酶学委员会编号的预测区分能力;该区分能力以真实酶 - 底物配对与对应负样本之间重合酶学委员会编号位数为划分依据,统计模型对应的 AUROC 或 AUPR 分值。由于部分特定酶家族数据缺少酶学委员会编号注释,此类数据统一归为一类。e 图为四种数据集划分方式下的平均区分能力分值,研究同时对比了 EZSpecificity-w/oGCS 与 ESP 模型,其中 EZSpecificity-w/oGCS 指代去除图结构、交叉注意力与结构嵌入模块的 EZSpecificity 简化模型。在不平衡数据集中侧重识别正样本时,AUPR 与 AUROC 两项指标适用性更强,而马修斯相关系数可均衡体现所有类别整体表现。酶底物特异性预测这类以筛选阳性作用配对为主要目标的研究任务中,AUPR 与 AUROC 能够提供更具参考价值的评价结果。

必须说明的是,由于 ESP 模型开源可访问性有限,本研究直接采用其成品模型进行验证。EZSpecificity-w/oGCS 与 ESP 模型架构几乎一致,但二者基于不同数据集训练:EZSpecificity-w/oGCS 基于 ESIBank 数据集训练(约 32.3 万条数据、3.4 万种底物、8 千种酶),ESP 基于其自有数据集训练(约 1.8 万条数据、1300 余种底物、1.2 万种酶)。如图 3a 所示,在随机划分数据集下,EZSpecificity-w/oGCS 的 AUROC 值(0.8822)显著高于 ESP(0.6572)。AUPR 评分也呈现相同趋势,EZSpecificity-w/oGCS 达到 0.5762,而 ESP 仅为 0.2057。上述结果充分表明,全面且高质量的 ESIBank 训练数据集是模型性能提升的重要原因。此外,本研究整合结构信息与互作信息的优化架构,结合覆盖面更广、内容更全面的 ESIBank 数据库,有望进一步提升模型在已有数据集和新数据集上的预测性能。

此外,本研究通过消融实验逐一解析 EZSpecificity 各模块的性能贡献。如图 3b 所示,去除活性结构模块后,模型 AUROC 值由 0.7198 降至 0.7036,证明对酶结合口袋与底物之间原子相互作用进行显式建模能够有效提升预测效果。同样,去除交叉注意力层后,AUROC 值由 0.7198 降至 0.7021,说明交叉注意力层对提升模型性能具有重要作用。虽然数值变化幅度看似较小,但在计算建模、尤其是深度学习领域中,微小的性能提升都极具难度,且能够真实反映模型预测精度的有效优化。除消融实验结果外,本研究证实结构特征、图网络机制与交叉注意力机制共同显著提升了 EZSpecificity 的预测性能,这一点在后续高质量人工整理的卤化酶数据集中表现尤为突出。与以往对所有氨基酸采用平均池化操作的方法不同,交叉注意力机制能够让模型重点聚焦于决定酶底物特异性的关键原子与氨基酸,从而降低非关键原子、氨基酸带来的预测偏差。基于 AUPR 指标的消融实验也得到了一致结果(附图 4)。

化合物 - 蛋白质相互作用模型可通过筛选候选化合物助力新药发现,同样具备预测酶底物特异性的潜力。经过架构对比,本研究发现传统化合物 - 蛋白质相互作用模型的结构,与去除图结构、交叉注意力及结构嵌入的 EZSpecificity 简化模型(EZSpecificity-w/oGCS)完全等价。为保证对比公平,本研究基于 ESIBank 数据集重新训练该简化模型(即 CPI / EZSpecificity-w/oGCS),结果显示完整架构的 EZSpecificity 在所有测试中性能均优于简化模型(图 3a)。同时,EZSpecificity 在各级酶学委员会编号区分任务中均表现出更优的分辨能力(图 3c--e、附表 3、附图 5--12),证实该模型在不同精细程度下均具备稳定、高精度的酶底物特异性预测能力。在一级酶学编号(EC.x.x.x)任务中,EZSpecificity 小幅优于 ESP,体现其区分同源酶与酶突变体的优势。后续图 4d 结果表明,针对特定蛋白家族进行微调可进一步提升模型性能。EZSpecificity 相对 ESP 的提升幅度在不同层级酶学编号任务中存在差异,这可能是由不同层级酶学分类数据的样本不均衡导致。

a 图展示六种酶家族的酶功能,并展示每个家族中代表性酶的结构。b 图为 EZSpecificity 模型在六种酶家族数据集上,经过微调与未经过微调的平均 AUPR 性能对比。c 图为分家族定制 EZSpecificity 模型在三种数据集划分方式下,作用于六种酶家族得到的平均 AUPR 结果。d 图为在酶与底物均未知的数据划分条件下,EZSpecificity 在各类特定蛋白家族中的 AUPR 表现。因腈水解酶样本数量过少,易造成实验结果可信度低,甚至在四折验证过程中无法出现阳性配对样本,故本次评估剔除该酶家族数据。

跨酶家族泛化能力

随着模型规模不断扩大,如何高效将大模型适配各类下游特定研究任务,已然成为一项极具研究价值的难题。为探究 EZSpecificity 在各类热门研究酶家族中的迁移应用能力,本研究选取上述六种酶家族开展性能测试。在随机划分、未知底物、未知酶三类数据集下,EZSpecificity 在所有酶家族中均表现良好,平均 AUPR 最高可达 0.6835。

本研究还设计两种微调策略,筛选适配目标酶家族的最优使用方案。第一种策略为利用目标酶家族数据,对 EZSpecificity 模型权重进行多轮迭代更新,所得模型命名为 EZSpecificity 微调模型。实验结果表明,经过微调后模型性能得到进一步提升;在未知底物数据集划分条件下,微调后模型 AUPR 值相比未微调模型提升约 7%,该结论与以往多项研究结论一致,即微调能够通过强化特征语义知识,让模型精准学习并运用领域专属信息,AUROC 评价指标也呈现相同规律。

第二种策略为沿用 EZSpecificity 完整网络结构,仅使用目标酶家族数据(阳性样本数量区间 85 至 5424 条)从零训练专属模型,命名为 EZSpecificity 独立定制模型。在三类数据集划分方式下,该专属模型 AUPR 指标均优于同架构 CPI 专属模型,性能提升幅度为 4.2%~8.3%,与 ESP 模型相比性能提升可达 27.4%~54.5%。这说明 EZSpecificity 能够有效适配小样本数据集,其内置的三维结构环境信息模块可简化酶底物特异性预测难度,两类微调策略下的 AUROC 评价结果也均印证了这一点。

本研究还利用研究基础较为薄弱的冷门酶与底物数据进一步测试模型性能。结果显示,EZSpecificity 在所有受试酶家族中的表现均优于 CPI 模型与 ESP 模型。同时实验证实微调操作并非总能带来性能提升,例如硫解酶与糖基转移酶相关测试中,模型微调后性能出现小幅下降;硫解酶与未知功能结构域蛋白两类酶家族的测试结果也表明,基于预训练 EZSpecificity 模型微调的效果,优于从零开始训练专属模型。

当研究任务难度较低或数据集质量较高时,基于少量数据训练的轻量化专属模型,不易出现过拟合问题,对新数据的泛化能力反而优于大模型;而其余部分酶家族数据则显示,从零训练的 EZSpecificity 专属模型效果优于原版模型与微调模型。以上结果说明,在实际应用中,EZSpecificity 适配不同下游任务的最优使用策略存在差异。研究人员可先在细分评估子集开展预实验,确定最优使用方式;若计算资源有限,直接使用原版 EZSpecificity 依旧是稳妥首选。

卤化酶实验验证

本研究选取底物特异性相关研究数据较为匮乏、研究程度尚浅的卤化酶作为研究对象,进一步验证 EZSpecificity 的实际预测精度。卤化酶广泛应用于生物催化碳氢键官能团化反应,具备优异的催化专一性与反应选择性,因此被选为实验验证研究对象。通常情况下,由卤化酶催化生成的含卤素小分子化合物,具备优良生物活性与理化性质,在医药、农药领域拥有广阔应用前景。

借助前文所述半自动数据提取方法,本研究最终筛选得到 386 条卤化酶序列,涵盖卤过氧化物酶、α- 酮戊二酸依赖性卤化酶、黄素依赖性卤化酶、S - 腺苷甲硫氨酸依赖性卤化酶四大类别。未经任何微调的原版 EZSpecificity,在简单至困难梯度的数据集场景中,AUROC 取值区间为 0.7720~0.9447,AUPR 取值区间为 0.5430~0.8506。

与六种验证酶家族所得结论一致,微调操作可进一步提升模型预测效果,微调后 EZSpecificity 模型 AUROC 可达 0.8008~0.9600,AUPR 可达 0.5698~0.8823。随着实验场景从随机划分升级至酶与底物均未知的高难度模式,EZSpecificity 专属模型相较去除结构与注意力模块的简易模型,AUPR 性能提升幅度由 27.87% 增至 35.26%,充分证明融合三维结构特征、图网络机制与交叉注意力机制,是 EZSpecificity 实现性能提升的核心关键。

a 图展示四类卤化酶的卤化催化功能,并呈现各类卤化酶的典型结构,其中 X 代表氯、碘、氟等卤素原子。b 图为 HaloS 数据集中具有代表性的底物分子结构。c 图为 HaloS 数据集内卤化反应的树状映射图,按四类卤化酶完成颜色区分标注。树状映射图是一种数据可视化方法,可将数百万条任意高维数据集转化为二维树形结构展示。d、f 图分别从 AUROC 与 AUPR 两项指标,对比 EZSpecificity 与当前主流机器学习模型在卤化酶底物特异性预测任务中的表现,最优数值以白色或红色星号标注。e 图对比 EZSpecificity 与主流机器学习模型对八种酶进行底物特异性预测的结果与真实实验结果之间的吻合准确率。

在所有卤化酶中,本研究选取四类主流卤化酶家族中区域选择性特征显著的八种黄素依赖性卤化酶 ,搭配 78 种底物开展实验验证。这 78 种底物与文献收录的 449 种底物的平均分子相似度仅约 9%,表明底物样本具有极高的结构多样性。本研究依据四项标准筛选实验用酶:(1)已有研究证实其底物谱广泛;(2)可在大肠杆菌中高效可溶性表达;(3)为非载体蛋白依赖性 卤化酶;(4)拥有经实验解析的结构或 AlphaFold 预测的可靠结构(如 Th-Hal、AetA,见附图 22)。本研究依托 96 孔板高通量筛选平台与液质联用检测方法,共计获取 624 组卤化反应实验数据。

随后,本研究直接采用经自建卤化酶数据集 HaloS 训练完成的 EZSpecificity 模型开展卤化酶 - 底物互作模式预测(该数据集通过半自动数据提取方法从文献挖掘得到,含约 3300 组数据,详见补充文本 1)。EZSpecificity、EZSpecificity-w/oGCS 与 ESP 模型分别对每种底物完成 8 种酶的优先级排序,以模型推荐结果的准确率作为性能对比依据。实验结果证实,78 种底物中有 55 种无对应催化活性酶(附图 22--26、28--48 及附表 8)。针对数据库中从未收录的 12 种全新底物,经 HaloS 数据集微调的 EZSpecificity 微调模型Top1 预测准确率可达 91.7% ,大幅优于 EZSpecificity-w/oGCS(41.7%)与 ESP 模型(58.3%)的基线水平。

实验结果同时显示,从零训练的 EZSpecificity 专属模型准确率为 66.7%,低于微调模型。本研究进一步构建融合专属模型与微调模型的 EZSpecificity 集成模型,准确率可达 75.0%。值得注意的是,将筛选范围扩大至 Top2--5 推荐酶时,各类 EZSpecificity 模型的真实预测准确率稳定维持在 62.5%--85.2% 之间(图 5e、附图 27 及附表 8),预测性能稳定可靠。

典型应用场景

凭借可为任意酶 - 底物配对输出特异性预测分值的核心能力,EZSpecificity 可实现两大核心应用:(1)针对目标酶,依据底物特异性对所有潜在底物进行优先级排序;(2)针对目标底物,依据底物特异性对所有适配酶进行优先级排序。本研究选取大肠杆菌的 34 种代谢物与 860 种酶作为研究案例,构建得到 29240 组(34×860)分子对接结构,利用 EZSpecificity 筛选可催化各目标代谢物的功能酶。

结果显示,在排名前 5% 的候选酶范围内,EZSpecificity 可精准匹配 34 种代谢物中的 10 种(匹配率 29.4%),优于对接打分法的 20.4%;将筛选阈值扩大至前 20% 时,累计匹配成功率可达 50%(17 种代谢物)。本研究通过二维核密度分布图,分析最优预测酶的排名百分位与其和训练集酶序列相似度的关联规律。结果表明,模型最优预测结果的密度峰值集中在 10% 排名区间,说明 EZSpecificity 在候选酶前 10% 区间内筛选功能酶的置信度最高。同时,图像左下角存在明显密度峰值,证明该模型不仅对高序列相似度酶预测效果优异,对与训练集序列差异较大的全新酶仍具备可观预测精度,具备良好的序列泛化能力。

此外,EZSpecificity 可关联生物合成基因簇基因与对应的生物合成中间体,助力生物合成基因簇研究。本研究选取克拉维酸生物合成通路阿洛奴菌素生物合成通路 两类典型生物合成基因簇完成模型验证(扩展数据图 2)。在生物合成各步骤的前三候选酶中,EZSpecificity 识别真实功能酶的最高准确率可达 66.7%(附表 10、11、14、15 及补充文本 5)。

由于生物合成中间体的化学修饰差异极其细微,基因 - 中间体配对识别一直是该领域的核心难题。当前相关数据集规整度较低,后续通过补充生物合成基因簇相关数据持续训练模型,可进一步提升 EZSpecificity 的预测性能。同时,研究通过多类特定酶家族测试,进一步证实了该模型的实际应用价值(附表 12、13、附图 51 及补充文本 6)。

上述案例充分证明,EZSpecificity 可高效完成代谢组与天然产物库的酶功能解析。需要说明的是,EZSpecificity 核心聚焦底物特异性预测 ,尽管模型编码过程可纳入酶立体选择性信息,但无法精准区分细微的立体选择性差异。该局限性源于当前图神经网络编码策略,对同一原子的不同立体构型特征做均等化处理,无法实现精细化区分。

结论

本研究构建了一款通用型深度学习模型 EZSpecificity,用于精准预测酶底物特异性,可适配各类蛋白家族及天然、非天然底物。该模型创新引入基于 ESIBank 数据集的三维复合物编码模块与交叉注意力层,弥补了传统化合物 - 蛋白互作研究忽视三维结合模式、原子级酶 - 底物互作特征的缺陷,解决了现有预测模型的固有局限。

ESIBank 复合物数据集也可为全球酶功能与催化机制研究提供优质公共资源(仅无活性中心注释的配对数据会轻微影响模型性能)。大量验证结果表明,EZSpecificity 性能优势显著:虚拟测试中 AUROC 指标较 ESP 模型最高提升 48.1%;基于 8 种卤化酶、78 种底物的体外实验中,预测准确率达 91.7%,远高于 ESP 模型的 58.3%。

EZSpecificity 可广泛应用于生物催化、合成生物学、酶工程与药物研发领域,后续通过融入动态结合特征信息,有望进一步提升模型预测精度。

方法

ESIBank 数据库构建

为构建 ESIBank 数据库,本研究首先从 BRENDA 数据库中收集以 SMILES 格式收录的天然与非天然底物。但 BRENDA 数据库大多未直接提供底物对应的具体酶序列,仅记录酶的 EC 编号与来源生物体信息。因此,本研究依据 EC 编号与生物体分类,从 UniProt 数据库中随机选取对应酶与底物进行匹配,最终得到约 18 万组阳性酶 - 底物配对。

为构建负样本数据集,本研究为每组阳性配对分别生成 5 个负样本酶与 5 个负样本底物,即每组阳性配对对应 10 组阴性酶 - 底物配对。正负样本之间设置不同差异等级,使模型可适配不同精细度的酶底物特异性预测任务。本研究依据 EC 编号重合位数划分差异等级,共设置五个等级,涵盖 EC 编号完全无重合至四位编号完全一致的全部情况。基于该分级规则,本研究随机生成约 110 万组不同等级的阴性酶 - 底物配对。

研究剔除了所有异常、低质量数据,包括原子数超过 280 的底物、氨基酸残基数超过 1000 的酶以及 UniProt 数据库中无活性中心注释信息的酶。同时,本研究补充六大典型酶家族数据丰富数据库,包括酯酶、糖基转移酶、腈水解酶、磷酸酶、硫解酶及未知功能结构域蛋白。此外,通过包含识别、提取、转换、关联四步的半自动数据提取流程,从文献中挖掘得到约 3300 组卤化酶 - 底物配对,具体流程详见补充文本 1。本研究最终整理得到 323783 组高质量酶 - 底物配对(附表 1、7)。

三维酶 - 底物复合物结构构建

为提升 ESIBank 数据库的信息完整性,本研究对所有酶 - 底物配对进行三维复合物结构预测。以往研究多采用暴力对接方式直接完成底物与酶的对接,但现有对接软件无法精准定位酶结合位点,易导致结构预测误差。本研究从 UniProt 数据库获取酶活性中心信息,结合数据集规模,以活性中心氨基酸为中心构建 20 埃立方体对接盒子,限定对接范围。

同时,为解决酶结构缺失辅因子导致的预测偏差,本研究借助 AlphaFill 工具为酶结构补全辅因子,使最终生成的催化对接构象更贴合天然结合口袋的真实微环境。

具体而言,研究通过 Open Babel 与 RDKit 工具基于底物 SMILES 字符串生成底物三维结构;从 AlphaFill 数据库获取反应酶三维结构及所需辅因子,所有游离态酶模型均参照 AlphaFill 官方流程,取自 AlphaFold 蛋白结构数据库 FTP 归档文件。

完成所有酶与底物输入文件制备后,本研究采用 AutoDock-GPU 对 ESIBank 中全部酶 - 底物配对开展分子对接。首先将所有酶结构文件转换为 AutoDock-GPU 可识别的映射文件,底物文件转换为 pdbqt 格式输入文件,整理得到所有已知活性中心的酶列表。针对已知活性中心的酶,以活性中心质心为对接盒子中心;无已知活性中心的酶,则以酶整体结构中心为盒子中心。对有活性中心坐标的酶,设置以活性中心为圆心、半径 20 埃的对接截断范围。

对接运算中,每组酶 - 底物配对设置 100 轮运算,每轮最多完成 250 万次独特结合位点评分计算,单组配对最大可完成 2.5 亿次构象评估。对接完成后,输出评分最高的结合构象结构文件,以此生成底物结合态酶结构,作为模型输入数据。后续研究也可进一步尝试 Co-Dock、AF3 等高效对接与复合物生成工具。

基于预训练蛋白语言模型的酶序列表征

本研究采用预训练 Transformer 蛋白语言模型 ESM-2 对 ESIBank 中的蛋白氨基酸序列进行特征嵌入。ESM-2 是参数量达 150 亿的高性能自监督蛋白语言模型,基于 Uniref 数据库蛋白序列训练,通过随机掩码重构蛋白序列实现学习。本研究提取模型倒数第二层输出作为酶的氨基酸特征嵌入,每个氨基酸对应 1280 维特征向量。通过线性层将原始 1280 维向量降维映射为 128 维特征,作为单氨基酸表征,所有氨基酸表征的均值即为整条酶蛋白的序列表征。

基于 SE (3) 等变图神经网络捕捉催化口袋微环境

本研究采用 SE (3) 等变图神经网络,对底物每个原子进行特征编码,表征原子周围微环境。本研究将结合口袋构建为图结构 G=(V,E),节点 V 代表酶或底物的单个原子,边 E 连接结构内距离最近的 32 个相邻原子。

酶原子特征包含化学元素、氨基酸类型与骨架原子标识信息;底物原子采用多热向量表征,包含元素类型与芳香性特征。边特征包含距离嵌入与化学键类型:距离嵌入通过 0--10 埃范围内 32 个径向基函数生成;化学键类型采用四维独热向量区分单键、双键、三键、虚键,同时搭配二维独热向量区分分子内键与酶 - 底物跨分子键。

借鉴 E (n) 等变图神经网络原理,为保证编码过程满足三维欧式变换等变性,本研究通过 SE (3) 等变图神经网络对催化口袋环境建模。在第 l 层网络中,原子隐层嵌入通过多层感知机更新,分别完成信息聚合与信息传递。原子初始隐层嵌入由两个独立线性层生成,分别对酶原子与底物原子特征进行映射。最终原子隐层嵌入为微环境表征,底物原子隐层嵌入均值为底物整体结构表征。

基于交叉注意力层建模酶 - 底物相互作用

传统机器学习模型通常拼接酶与底物整体表征,再通过多层感知机拟合酶 - 底物相互作用,无法直接建模原子级互作特征,而该特征是决定酶底物特异性的关键。为解决该问题,本研究借鉴 Transformer 架构,采用交叉注意力层生成适配酶特征的底物原子表征,同时通过另一交叉注意力层生成适配底物特征的酶氨基酸表征。

交叉注意力层包含多个独立注意力头,每个注意力头为可学习函数,用于捕捉酶氨基酸与底物原子的相互作用,由多层可训练线性层构成。该机制先依据氨基酸与原子表征生成注意力矩阵,再对底物原子表征进行加权求和。最终,适配酶特征的底物原子表征均值为酶感知底物表征,适配底物特征的酶氨基酸表征均值为底物感知酶表征。

多层感知机预测模块

本研究通过 ESM-2 编码酶序列特征、SE (3) 等变图神经网络编码结构微环境特征,得到酶表征与底物表征。依托交叉注意力层建模原子级互作,实现两类特征的上下文信息互补,生成底物感知酶表征与酶感知底物表征。将融合后的特征输入多层感知机,完成酶底物特异性预测。

EZSpecificity 模型训练流程

本研究将酶底物特异性预测定义为二分类任务,以交叉熵损失函数为训练目标,采用默认参数的 AdamW 优化器,初始学习率设置为 0.0003。为提升训练稳定性,设置学习率调度策略:训练初期采用线性升温策略,将学习率从 0.000006 逐步提升至 0.0003;若模型性能连续 10 个迭代无提升,则学习率减半;当学习率降至 0.000006 以下时终止训练。模型训练批次大小设置为 32,SE (3) 图神经网络包含 3 层图卷积层,预测用多层感知机包含 3 层前馈网络,所有隐层特征维度统一设置为 128。

实验试剂与菌株

本研究所有试剂均为分析纯及以上级别,购自 Sigma-Aldrich 与 Fisher Scientific 公司,无特殊说明均直接使用。八种卤化酶基因(PrnA、PyrH、AetA、BorH、ThaL、BrvH、PltM、Th-HaL)由 Twist Bioscience 公司合成,通过 NcoI 与 XhoI 酶切位点克隆至 pET28a (+) 载体,携带 C 端 His6 标签。采用大肠杆菌 BL21-Gold (DE3) 化学感受态细胞作为蛋白表达宿主。

卤化酶表达与纯化

八种卤化酶的表达流程参照已有研究。通过添加 0.5 mM 异丙基 -β-D - 硫代半乳糖苷(IPTG)诱导蛋白表达,30 ℃恒温培养 18 h 后,于 4 ℃、3600×g 条件下离心 15 min 收集菌体。菌体沉淀重悬于 20 mL A 缓冲液(50 mM 磷酸钠、10 mM 咪唑,pH 8.0),采用超声破碎细胞(振幅 50%,工作 10 s、间隔 5 s,总时长 10 min)。破碎后于 14000×g 条件下离心 1 h 去除细胞碎片。

采用 Protino Ni-IDA 2000 层析柱,搭配 A 缓冲液与 B 缓冲液(50 mM 磷酸钠、330 mM 咪唑,pH 8.0),按照说明书完成蛋白纯化。通过 PD-10 脱盐柱去除咪唑,纯化后的蛋白分装保存于磷酸钠缓冲液(50 mM 磷酸钠、5% 甘油,pH 8.0),-80 ℃冷冻储存,分装样品解冻后仅使用一次。

通过十二烷基硫酸钠 - 聚丙烯酰胺凝胶电泳验证蛋白纯度,所有蛋白纯度均高于 90%,采用 Pierce BCA 蛋白定量试剂盒测定蛋白浓度。为排除过氧化氢、次溴酸泄露引发的非位点特异性、非酶促卤化反应,本研究在反应体系中添加 3 U 超氧化物歧化酶与 3 U 过氧化氢酶作为对照,特异性清除活性氧,确保卤化反应由酶催化而非非特异性化学反应引发。对照实验结果证实,添加与未添加抗氧化酶的体系卤化结果一致,证明实验中的卤化反应均为酶促反应。

高通量酶活实验与高分辨质谱产物鉴定

本研究采用 96 孔板开展酶促反应,振荡转速 900 rpm。100 μL 反应体系包含 1 mM 底物、10 μM 黄素腺嘌呤二核苷酸、1 mM 辅酶 Ⅱ、10 mM 亚磷酸钠、10 μM 纯化卤化酶、5 μM SsuE 与 PtdH 蛋白,缓冲体系为 50 mM 磷酸钠(pH 8.0),设置添加溴化钠与不添加溴化钠两组对照,30 ℃恒温孵育 24 h。

反应结束后取 100 μL 反应液,加入 50 μL 预冷 2% 甲酸沉淀蛋白终止反应,4 ℃、15000×g 离心 5 min 去除沉淀,取 5 μL 上清液用于液质联用检测。

所有质谱检测均在赛默飞液质联用平台完成,采用 Hypersil GOLD VANQUISH PFP 超高效液相色谱柱(1.9 μm,2.1 mm×100 mm),流速 0.4 mL/min。流动相 A 为含 0.1% 甲酸的纯水,流动相 B 为含 0.1% 甲酸的乙腈,根据不同底物设置专属线性洗脱梯度。质谱设备搭载电喷雾离子源与轨道阱质量分析器,采用 Pierce LTQ Velos 电喷雾正离子校准液完成校准。

通过 Xcalibur 软件完成设备控制、数据采集与数据分析。质谱采用全扫描 - 选择离子监测模式,参数设置:分辨率 70000、扫描质荷比范围 50--750、自动增益控制目标 3×10⁶、最大注入时间 200 ms、正离子模式。最终基于保留时间比对与溴原子特征分子量偏移完成产物鉴定。

相关推荐
Tangyuewei6 小时前
给 AI 套上缰绳:Harness Engineering 是什么
人工智能
AI棒棒牛6 小时前
第11讲 | 目标检测任务:边界框、IoU、类别与置信度
人工智能·yolo·目标检测·yolo26
allione6 小时前
AI时代测试方向AI for Testing和Testing for AI
人工智能·ai测试
武子康6 小时前
GPT-Red:自动化红队如何形成 Agent 安全数据飞轮(4 个闭环 + 6 类评测指标 + 5 类风险误读)
人工智能·openai·agent
阿里云大数据AI技术6 小时前
DataWorks Data Agent 实战课堂(二):一句话搞定数据集成+处理,实现端到端数据流水线
人工智能·agent
Days20506 小时前
AI漫剧vs传统动漫vs真人短剧
人工智能
武子康6 小时前
从恶意 Dataset 到横向移动:一套可落地的 Dataset Processing Threat Model(资产边界 + 威胁枚举 + 5 层控制)
人工智能·安全
redreamSo6 小时前
一天涨 1800 星的 GitHub 榜首:AI 编程瓶颈变成了 token
人工智能·开源·github
wp123_16 小时前
实测数据对飙:COILCRAFT XFL4020-222MEC vs TONEVEE MVL4020-2R2M,2.2µH功率电感参数全解读
人工智能
本末倒置1836 小时前
从 PDF 到向量检索:一个最简单的本地 RAG 入库案例
人工智能