MISATO?
定位 :面向基于结构的药物发现的蛋白-配体复合物机器学习数据集,开源社区项目,2024年发表于Nature Computational Science。


a、我们构建了一个数据集,该数据集将小分子的半经验量子力学(QM)性质与全部实验蛋白-配体复合物的分子动力学(MD)模拟动力学信息相结合。蛋白与配体命名、质子化状态、几何结构等方面所有常见错误均已修正。分子的蓝色轮廓代表其电子密度。
b、数据集概述,以及半经验量子力学(QM)和力场(FF)分子动力学(MD)模拟所采用的流程,包含数据准备、预处理与人工智能基准模型。
数据集构成
- QM(量子力学子集):19443个配体,经过筛选优化;提供量子化学属性。
- MD(分子动力学子集):16972套蛋白-配体模拟结构,每套10 ns分子动力学模拟,刻画体系动态变化。
- 配套:电子密度文件、MD重启/拓扑文件;全部数据集托管在Zenodo,HDF5格式存储,附带训练/验证/测试划分。
AI配套能力
- 原生提供 PyTorch DataLoader + Pytorch Lightning Datamodule,开箱加载数据;
- 内置3个基线模型,可做MD、QM性质以及结合亲和力预测;
- 提供Jupyter Notebook入门教程与推理脚本。
部署方式
两种使用方案:
- 容器化(推荐):Docker / Singularity镜像,CUDA 11.8;一键拉起环境,避免依赖冲突。
- Conda本地环境:单独创建misato环境安装PyTorch、PyTorch Geometric等;MD推理需要独立conda环境安装ambertools。
项目目标
- 获取高精度配体分子属性;在合理时间尺度表征蛋白配体动态;开发药物发现AI模型。
- 长期目标:扩展至100 ns以上MD模拟、3万+蛋白-配体结构。
- 社区渠道:Discord、Hugging Face Space(可视化、QM预测)。
核心价值
传统药物发现数据集大多是静态晶体结构;MISATO亮点是引入分子动力学轨迹,给AI提供蛋白-配体动态构象,同时搭配量子力学计算标签,非常适合训练基于结构的药物分子预测模型。
侧重点在于drug药物发现,所以是配体数据,不是ppi数据


