【文献分享】abCRISPR:基于深度学习的脱碱基gRNA理性设计框架

一、文章介绍

CRISPR-Cas9系统已成为广泛使用的基因组编辑工具,通过设计一段与靶位点(20 nt)互补的gRNA引导序列,即可轻松编程切割任何DNA序列。然而,一个关键局限始终存在:gRNA与基因组中部分匹配的序列(最多6个错配)也会诱导非预期的脱靶切割 ,这严重限制了CRISPR在临床和精准研究中的应用。近年来,基于CRISPR RNA在噬菌体感染过程中天然发生的脱碱基氧化可降低脱靶活性的观察,研究者开发了gRNA的脱碱基修饰(OXO)------将gRNA的18-19位(相对于PAM)替换为dSpacer(脱碱基脱氧核苷酸),延伸至22位。这种生物学启发的方法在增强靶标特异性方面优于其他人工策略(如其他gRNA修饰和Cas9变体)。然而,OXO的效果随gRNA的位置序列背景而变化,其设计需要针对性的计算指导。

为构建一个能够理性设计OXO序列以最小化脱靶活性的计算框架,Geun-Woo Kim、Dowoon Gu及其合作者在Bioinformatics 上发表了题为"abCRISPR: a deep neural network framework for rational design of abasic guide RNAs with minimized off-target activity"的研究论文,提出了一个名为abCRISPR的深度神经网络框架。

abCRISPR的核心创新在于利用高质量随机错配靶标文库的穷举测序数据进行信息性小样本训练 。训练数据来自体外CRISPR-Cas9切割实验,覆盖了给定gRNA序列(3条)的几乎完整gRNA-DNA错配空间(≤3个错配,n=97,583),通过"掺杂"合成DNA库的耗竭程度(底物丰度,SA)精确量化脱靶活性。与常规训练集包含低于检测限的虚假阴性不同,该数据集提供了穷举测序深度下的真实阴性对照,避免了下游预测中的虚假阴性问题。这种具有大量多样化类别的小样本学习策略已被证明能增强模型性能和泛化能力。

abCRISPR采用基于多层感知器(MLP)的多任务回归模型,同时预测OXO和未修饰gRNA的SA值。错配序列编码考虑位置单核苷酸上下文------每个与20 nt gRNA间隔区匹配的核苷酸位置用10D向量表示,捕获转换/颠换错配以及gRNA间隔区和脱靶序列的单热编码核苷酸组成。特征通过三个全连接隐藏层,每层后接ReLU激活。采用早停策略(验证损失10轮不改善则停止)防止过拟合,MSE损失函数和Adam优化器(学习率0.001)用于训练。数据集随机分为70%训练、20%验证和10%测试,进行标准的10折交叉验证。

在10折交叉验证中,abCRISPR对OXO和未修饰gRNA的SA值预测与实验数据高度相关(Pearson r=0.95-0.96)。对于未修饰gRNA,abCRISPR的AUC达0.98,远超CRISPR-Net(0.68)、DeepCRISPR(0.64)、CRISPR-DIPOFF(0.61)、CNN_std(0.52)和CrisprDNT(0.45)。在独立CIRCLE-seq和SITE-seq脱靶数据集(≤6MM)评估中,abCRISPR在所有排名区间均保持最高阳性预测值(平均比率0.63 vs 第二名0.42),即使其他方法部分使用了这些测试集进行训练。值得注意的是,abCRISPR仅在≤3MM错配数据上训练,却对包含>3MM(4-6MM)的CIRCLE-seq数据集展现出泛化能力,体现了其零样本推理的优越性。

研究者将最终模型应用于人类基因组(hg19)中高效CRISPR靶向位点(效率>55,特异性>50,n=61,761,658),预测每个gRNA的脱靶位点(≤3MM,总计747,063,488个)。结果显示96.2%的OXO gRNA(n=58,875,004)的脱靶位点SA值显著提升(P<0.05),表明靶标特异性增强。abCRISPR网站(http://clip.korea.ac.kr/abCRISPR/)支持通过基因符号或基因组坐标搜索,返回设计的脱碱基gRNA列表,并提供UCSC基因组浏览器链接。

二、算法原理介绍

abCRISPR的算法设计围绕"穷举错配数据集构建 → MLP多任务回归 → 脱靶活性预测与评估"三个核心步骤展开。

(一)穷举错配数据集构建。 训练数据来源于体外CRISPR-Cas9切割实验,使用"掺杂"合成DNA文库覆盖给定gRNA(3条)所有≤3个错配的序列(n=97,583)。通过测序比较未修饰和OXO gRNA处理后的底物丰度(SA,相对于无gRNA对照的log₂比值),量化每个错配序列的脱靶活性。SA值越低(负值越大),表示切割越强(脱靶越严重)。关键设计:该数据集以饱和测序深度 覆盖了几乎所有可能的错配序列,提供了真实阴性对照(未检测到切割的序列可确认为真阴性),而传统方法依赖于基因组中未检测到的序列(可能因检测灵敏度限制而遗漏),导致训练集中存在虚假阴性。

(二)MLP多任务回归模型。 模型同时预测OXO和未修饰gRNA的SA值。输入编码:对20 nt长的gRNA间隔区与脱靶序列的每个位置进行编码,考虑:(1)错配类型 ------转换(嘌呤↔嘌呤,嘧啶↔嘧啶)或颠换(嘌呤↔嘧啶),编码为10D向量;(2)核苷酸组成 ------gRNA和脱靶序列该位置的碱基单热编码(4D×2);(3)二核苷酸上下文 ------位置i与i+1的碱基组合(4×4×19)。综合特征输入三层全连接隐藏层(每层后ReLU激活),输出两个SA预测值(OXO和未修饰)。损失函数为MSE,优化器为Adam(lr=0.001),早停(验证损失10轮不改善)防止过拟合。

(三)训练策略与评估。 采用10折交叉验证(70%训练/20%验证/10%测试)评估性能。最终部署模型使用序列增量训练 ------10次迭代,每次留出10%数据作为测试,用其余90%逐步更新权重,确保完整利用全部数据集。脱靶分类阈值通过两种方式确定:(1)SA=-2.17(由体外实验中切割比0.5时的线性回归导出);(2)SA=-2.16(10折交叉验证中最大化F1分数)。评估指标包括Pearson/Spearman相关系数、AUC和top-k召回率。在人类基因组应用中,对每个gRNA计算其所有脱靶位点SA值的统计显著性 (配对单侧t检验,P<0.05),以及效果量指标:ΔSAmean\Delta SA_{\text{mean}}ΔSAmean(平均SA提升)、ΔSAHR\Delta SA_{\text{HR}}ΔSAHR(最高风险脱靶位点的SA提升)和四分位排名。

三、总结

abCRISPR是一个基于深度学习的脱碱基gRNA理性设计框架,通过在体外穷举测序数据集(97,583个≤3MM错配序列)上训练MLP多任务回归模型,同时预测未修饰和OXO修饰gRNA的脱靶底物丰度,实现了对脱碱基修饰后靶标特异性增益的准确评估。其核心创新在于:利用穷举错配文库提供的真实阴性对照进行小样本训练,克服了传统训练集中虚假阴性导致的预测偏差 ,使模型在仅3条gRNA的训练数据上仍能获得高精度(r>0.95,AUC=0.98)并泛化到>3MM的脱靶位点。abCRISPR应用于人类基因组,设计了超过5,800万个具有显著提升靶标特异性的OXO gRNA序列,为安全精准的CRISPR基因组编辑提供了可搜索的计算资源。

相关推荐
腾视科技-AIoT41 分钟前
腾视科技重磅推出TensorAI智能体平台,开启智能助手新体验
大数据·人工智能·科技·ai·ai大模型·ainas·腾视科技
天天代码码天天43 分钟前
一个 HTML 文件就能跑 OCR:我把 PP-OCR 装进了浏览器
人工智能
蚂蚁集团数据体验技术1 小时前
推荐免费工具,AntV 开源社区出品数据可视化产品 Sive
github·agent·数据可视化
陈年老古董1 小时前
OpenCV图像处理笔记:图像拼接、答题卡识别与目标提取
人工智能·笔记·python·opencv·计算机视觉
大鹏的NLP博客1 小时前
WSL2 资源治理:从 ONNX Runtime CUDA 编译 OOM 到 `.wslconfig` 防御配置
c++·深度学习·onnx runtime
智购科技智能售货柜1 小时前
2026自动售货机峰值交易流量应对方案:从消息削峰到弹性扩容的工程实践~YH
数据库·人工智能·单片机·嵌入式硬件·yolo
深念Y1 小时前
为什么选 Go:直观、可维护、AI 友好
linux·开发语言·人工智能·golang·agent·harness
北京靠谱的GEO优化机构1 小时前
AI时代作品背书:书籍歌曲影视百科创建规则与实操技巧
人工智能·百度·seo·百科创建
像风一样自由20201 小时前
13.pgvector入门用PostgreSQL直接实现向量检
人工智能·postgresql·大模型·rag·智能体