小分子的语言模型MolT5的使用

提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档

文章目录


前言

这是MolT5的安装和embedding获取(gpu版)。

零、安装

c 复制代码
conda activate base
conda install -c conda-forge mamba -y

conda create -n molt5 python=3.9 -y
conda activate molt5

mamba install pytorch pytorch-cuda=11.8 -c pytorch -c nvidia -y
pip install sentencepiece accelerate
mamba install -c conda-forge rdkit -y
pip install "transformers==4.38.2"

# 需要离线的,去下载https://huggingface.co/laituan245/molt5-base,作为./molt5-base

一、使用步骤

1.引入库

c 复制代码
import torch
from transformers import T5Tokenizer, T5EncoderModel

2.获取embedding

c 复制代码
device = "cuda" if torch.cuda.is_available() else "cpu"

tokenizer = T5Tokenizer.from_pretrained("./molt5-base")
model = T5EncoderModel.from_pretrained("./molt5-base").to(device)
model.eval()

def get_molt5_embedding(
    smiles: str,
    pooling: str = "mean"   # "mean" | "cls"
):
    """
    Returns a 1D torch tensor embedding for a SMILES string.
    """
    inputs = tokenizer(
        smiles,
        return_tensors="pt",
        padding=False,
        truncation=True,
        max_length=512
    ).to(device)

    with torch.no_grad():
        outputs = model(**inputs)  # last_hidden_state: [1, L, D]

    hidden = outputs.last_hidden_state.squeeze(0)  # [L, D]

    if pooling == "mean":
        emb = hidden.mean(dim=0)   # [D]
    elif pooling == "cls":
        emb = hidden[0]            # T5 没有真 CLS,只是第一个 token
    else:
        raise ValueError("pooling must be 'mean' or 'cls'")

    return emb.cpu()

smiles = "CCOC(=O)C1=CC=CC=C1"  # unmapped canonical SMILES
emb = get_molt5_embedding(smiles)

print(emb.shape)

输出:torch.Size(768)


总结

MolT5是小分子预训练好的语言模型,它能获得小分子768维的embedding,进行后续建模和操作。

相关推荐
TK泰妞1 分钟前
TikTok跨境电商提示词怎么找?Clipcat免费提示词资源与实用用法
大数据·人工智能
胡家伟++4 分钟前
从一段经文到 5 分半水墨动画短片:全 AI 流水线完整实录(即梦 + TTS 克隆 + ffmpeg + 思维链重构)
人工智能·ffmpeg·aigc
二川bro13 分钟前
手写Agent循环别再造轮子!AWS开源Strands Agents开箱即用
人工智能
DeviceHub13 分钟前
2026年硅电容市场观察:AI算力与汽车电子驱动下的选型与替代建议
人工智能·汽车
陈希瑞20 分钟前
VoiceStudio 多场景语音应用落地指南
人工智能·语音识别
xhy_070724 分钟前
AI 编程工具怎么选?Cursor、Copilot、Claude Code、Trae、WES Code 理解代码库的三条技术路线
人工智能·机器学习·copilot·知识图谱·ai编程·wes code
裕晟资质规划25 分钟前
涉密场所物理隔离与技术防护体系:标准矩阵、审查校验点与常见缺陷分析
大数据·前端·网络·人工智能·经验分享
waoooqwe33 分钟前
第三方问卷样本回收平台可靠吗:风险从哪来,怎么判断
大数据·人工智能
努力的骆驼36 分钟前
【ANSYS】转子动力学分析指南(Rotordynamic Analysis Guide)第三章
人工智能·有限元·ansys·转子动力学
a努力。36 分钟前
长期记忆如何让AI真正“记住你”
人工智能