MISATO:基于结构的药物发现的蛋白-配体复合物机器学习数据集

仓库参考:https://github.com/t7morgen/misato-dataset

文献参考:https://www.nature.com/articles/s43588-024-00627-2

MISATO?

定位 :面向基于结构的药物发现的蛋白-配体复合物机器学习数据集,开源社区项目,2024年发表于Nature Computational Science。

a、我们构建了一个数据集,该数据集将小分子的半经验量子力学(QM)性质与全部实验蛋白-配体复合物的分子动力学(MD)模拟动力学信息相结合。蛋白与配体命名、质子化状态、几何结构等方面所有常见错误均已修正。分子的蓝色轮廓代表其电子密度。

b、数据集概述,以及半经验量子力学(QM)和力场(FF)分子动力学(MD)模拟所采用的流程,包含数据准备、预处理与人工智能基准模型。

数据集构成

  1. QM(量子力学子集):19443个配体,经过筛选优化;提供量子化学属性。
  2. MD(分子动力学子集):16972套蛋白-配体模拟结构,每套10 ns分子动力学模拟,刻画体系动态变化。
  3. 配套:电子密度文件、MD重启/拓扑文件;全部数据集托管在Zenodo,HDF5格式存储,附带训练/验证/测试划分。

AI配套能力

  • 原生提供 PyTorch DataLoader + Pytorch Lightning Datamodule,开箱加载数据;
  • 内置3个基线模型,可做MD、QM性质以及结合亲和力预测;
  • 提供Jupyter Notebook入门教程与推理脚本。

部署方式

两种使用方案:

  1. 容器化(推荐):Docker / Singularity镜像,CUDA 11.8;一键拉起环境,避免依赖冲突。
  2. Conda本地环境:单独创建misato环境安装PyTorch、PyTorch Geometric等;MD推理需要独立conda环境安装ambertools。

项目目标

  • 获取高精度配体分子属性;在合理时间尺度表征蛋白配体动态;开发药物发现AI模型。
  • 长期目标:扩展至100 ns以上MD模拟、3万+蛋白-配体结构。
  • 社区渠道:Discord、Hugging Face Space(可视化、QM预测)。

核心价值

传统药物发现数据集大多是静态晶体结构;MISATO亮点是引入分子动力学轨迹,给AI提供蛋白-配体动态构象,同时搭配量子力学计算标签,非常适合训练基于结构的药物分子预测模型。

侧重点在于drug药物发现,所以是配体数据,不是ppi数据

相关推荐
拓海SEO外贸1 小时前
关键词聚类(Keyword Clustering)怎么做
人工智能·机器学习·聚类
Rocky Ding*2 小时前
一文读懂LLM Agent Skills 的运行时本质:从能力路由到渐进式披露
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·agent skills
桃西西呀2 小时前
体检报告上一堆箭头看不懂?背后的逻辑就是随机森林:一群树投票,比一棵树靠谱
人工智能·机器学习·llm
大江东去浪淘尽千古风流人物3 小时前
【LoMa】局部特征匹配重访:从LoMa-B到旋转不变LoMa-R的架构与工程实践
开发语言·深度学习·计算机视觉·r语言·视觉定位·sfm·局部特征匹配
Lintongzg3 小时前
KV-Cache 的显存账本:长上下文、并发与量化剪枝的取舍
算法·机器学习·剪枝
江润舟3 小时前
万物 | 炼器 从零手搓工业级旋转目标检测网络 · 卷2 —— 计算图、梯度与反向传播(三)
人工智能·深度学习
zhurui_xiaozhuzaizai3 小时前
github上关于节省token的项目一览,上下文压缩,节省token,agent优化skill,热门项目
人工智能·深度学习·github
计算机编程-吉哥4 小时前
基于机器学习的城市交通拥堵分析与预测平台【计算机毕业设计选题·机器学习·随机森林算法】
hadoop·算法·随机森林·机器学习·课程设计·计算机毕业设计选题·大数据毕业设计选题推荐
牧羊人.3334 小时前
动手学深度学习 04 | Dataset 和 DataLoader、数据增强
人工智能·pytorch·深度学习·算法