《NG》作者采访视频:我们要学会“用”AI,而不是“学”AI

采访会议纪要

《Nature Genetics》一作采访纪要

参会人员:刘畅、Biomamba

会议内容:

刘畅作为浙江大学良渚实验室沈宁课题组成员在《Nature Genetics》(IF=25.5)发表综述论文为"Advances and challenges of splicing prediction with AI",本次他围绕AI预测RNA可变剪切的进展与挑战展开详细讲解,并在分享结束后与现场观众开展问答交流。

1、研究背景

在基因治疗和精准医学蓬勃发展的今天,一个核心难题始终笼罩在遗传病和肿瘤领域:为什么很多致病突变并不直接改变蛋白质编码,却依然引发严重疾病?

答案往往隐藏在RNA可变剪接之中。作为基因表达最关键的"加工厂",可变剪接赋予了基因组无限的灵活性,但一旦发生错误,就会产生异常的转录本。然而,实验测序成本高、耗时长,且心脏、大脑等组织无法活体采样,用AI预测"变异如何影响剪接"成临床刚需。

Transformer架构和基因组基础模型(Foundation model)的崛起,为这个古老的生物学难题提供了全新的突破口,但这股AI浪潮究竟是"无所不能"还是"过拟合的工具"?这成为该领域最值得探讨的前沿问题。

2、研究结果

详见**浙江大学良渚实验室沈宁团队系统综述从统计模型到基因组大模型:AI 可变剪接预测的进展与挑战**

3、启发

本综述带来的核心启发在于,未来AI剪接预测模型的发展应跳出单纯的方法论内卷,明确 应用导向 可解释性两大核心方向。一方面,强化临床转化应用 :放弃与硬件厂商(如英伟达)拼算力、卷效率的无效内卷(提升1%极易被硬件优化反超),必须立足真实的生物学与医学需求,使预测模型切实贴近下游临床应用。另一方面,聚焦模型可解释性:避免盲目堆叠模型、卷算法,应着力构建"可解模型",深入理解模型判断生物学事件的底层逻辑。

4、问答环节

①主持人:既然刘老师的这个作品主旋律是AI预测RNA可变剪切的进展与挑战。Biomamba生信基地也非常感兴趣AI在生物信息学的应用,近年来,AI对生物学的影响是显著并深选的,这里我们想邀请刘老师结合您丰富的科研经验,和大家分享一下AI时代下,对现在的生信工作有哪些影响,以及未来的发展趋势是什么?

刘畅:这个问题主要谈谈对我的直接冲击吧,至于长远发展,我可能也无法给出绝对准确的定论。

首先,在具体的科研工具层面,我觉得改变是翻天覆地的。我现在已经很久没有连续写过超过20行的代码了。基本上一大半的代码大框架都由AI帮我们生成,很多时候甚至拿到就能直接用,或者只需根据需求微调一下。这极大提高了效率,也让研究的门槛大大降低。

但这也引出了第二个层面的变化。沈宁老师一直和我们强调,如果只做纯生信分析和数据运算,未来可能很难有很广阔的前景。因为单纯拼算法、拼运算速度和代码,人类确实已经比不过AI了。

所以在AI时代,我认为我们人类的核心优势依然是"探究机制"。AI可以发现相关的线索和潜在关联,但它很难替代我们去思考"这个结果到底代表着什么"。要去挖掘、去解析这些现象背后隐藏的生物学机制和因果逻辑,依然需要我们长期深入的思考。未来,我们的价值就在于用人类独有的生物学逻辑去深度解读结果,而不是和AI卷代码、卷数据。

②主持人:可以看出刘老师是深度的AI使用者,确实AI它是工具,更多的还是使用者的判断和思维,那自2022年底大模型问世至今已有三年多,在这个过程中,哪一代大模型让您印象最为深刻?它对您的科研工作带来了哪些关键性的帮助?

刘畅:印象最深的确实是GPT-3。GPT-2虽在技术圈轰动,但直到GPT-3才真正实现应用层面的稳定可靠。后续GPT-4、GPT-5虽然不断补强,但论颠覆感和跨越式的质变,远不及GPT-3,可以说它彻底打破了我过往的科研范式。

这种冲击是全方位的。一方面,写代码、起草文字结构这类基础工作,AI现在能快速帮我搭好框架、理顺语言;另一方面,搜索引擎的使用频率骤降,遇到问题直接问AI,检索效率比传统搜索高得多,就连做PPT和文件检索,AI也基本承包了。不过,AI幻觉依然是客观存在的痛点。高效辅助的同时,我必须保持高度警惕,科研和写作中AI生成的内容必须经人工一步步审核、复核,确保信息准确。

客观地说,AI现在已经完全内化为我日常科研中一种根本性的生产模式。如果剥离AI,工作流程会瞬间卡顿、效率直线下降。甚至期刊编辑圈也普遍感受到投稿量激增------这很大程度上是AI带来的连锁反应,同时也让当下的发文竞争变得空前激烈。

③主持人:是的,我们在科研/工作中使用AI提高我们的效率,但是AI幻觉的是客观存在的,所以我们在使用AI的时候也不能一味的相信AI。刘老师那么从早期的GitHub Copilot,到如今十分流行的Codex、Cloud Code,AI编程助手深刻改变了生信分析的工作方式。想请您分享一下个人的使用体验和心得体会。

刘畅:我觉得大家可能都挺好奇这个。坦白说,我本身并不是程序员出身,而是做生信分析的,所以很难从代码专业维度去评判谁写的水平更高。借用一句老话,"黑猫白猫,抓到耗子就是好猫"------在实际工作中,Codex和Cloud Code生成的代码,90%的情况下都是可以直接拿来用的,所以我很难说哪一家绝对更强。

不过,近期有一个新闻引起了我的注意,就是部分国外的AI编程工具,似乎存在针对中国用户的特定"后门检测"隐患。出于对数据安全和合规性的考虑,我现在已经开始有意识地避免使用这些国外工具,并逐渐尝试转向国内的本土AI工具。像千问、DeepSeek这些国产大模型,我现在也都在逐步使用。因为刚开始使用,具体的体验效果和优劣对比还需要进一步测试。但就目前来看,在生信分析这个领域,只要我们的上游分析思路足够清晰、逻辑准确,国内目前的AI工具,在能力和算力上就已经完全能够满足我们日常的科研需求了。

④观众:刘老师,您的科研背景是怎样的?在如今的时代下,我们该如何进行生物学"干湿结合"的研究?

刘畅:这个问题很有意思,其实我的背景和沈宁老师非常相似------本科是纯生物学出身,而到了硕博阶段,则转攻纯算法方向(甚至还不是AI,是纯粹的序列相关算法)。生物学科拥有极其庞大的序列数据库,恰恰是算法训练最常用的数据来源。所以,这条跨学科的路径对我而言,更像是一个顺其自然的发展过程。

当然,这个路径不一定适合所有人。如果现在让我给正在做干湿结合的同学提建议,我会说:真正做到湿实验和干实验"两手抓"是非常困难的。尤其是养细胞、跑实验,一旦做起来就非常耗费精力,很难再有时间沉下心来做深度的数据分析。

因此我建议:对于偏实验为主的同学: 你们不需要把大量时间花在修炼AI底层技术上。要学会"用"AI,而不是"学"AI。比如用AI工具去处理RNA测序的基础流程和下游分析,AI完全可以帮你把繁琐的数据梳理好。学会用好这些工具,就已经很成功了。对于偏干实验方向的同学: 我觉得还是需要多积累一些实验背景和认知,避免"纸上谈兵"。

总之,无论哪个方向,我非常鼓励大家去拥抱AI,将它作为科研的加速器,去解决真正有价值的生物学问题。

⑤观众:刘老师,AI在生物信息学领域的研究成果,具体是如何实现科研或临床转化的呢?

刘畅:这确实是个分水岭,我主要想谈三个层面:第一,作为基础科研的工具属性。 AI本质上是一个工具。就像我们前面提到的剪接预测问题,如果某个纯做湿实验的科研工作者遇到这个痛点,而市面上又没有适配的工具,那么针对这个问题去开发一套算法,这就已经是很好的科研产出。第二,面向临床的诊断辅助转化。 这类工具离临床非常近,我们实验室也一直在做这方面的探索------把各种算法整合成一个辅助诊断工具。简单来说,当我们拿到一张图像时,AI能够判断出它是突变导致的提前终止密码子,还是其他表型效应,并评估它是否与特定疾病相关。在实际临床中,医生往往很难直接从这些图片中解读出复杂信息,我们的工具就可以辅助他们去做更精准的诊断。第三,助力药物研发与筛选。 这方面其实AI起步很早。比如AlphaFold指导蛋白药物设计,或者mRNA疫苗的研发,AI都扮演了核心角色。AI可以在计算机里进行高通量筛选,快速过滤掉海量无效的候选序列,只留下极少数真正有价值的候选分子。这样我们在下游做实验验证时,所需验证的样本更少、成本大幅降低,也更容易快速找到真正有效的治疗靶点和药物。

全平台回放,欢迎关注

B站:https://www.bilibili.com/video/BV1QQXZB7EFT

小红书:http://xhslink.cn/o/61vRJqQ5wXF

抖音:https://v.douyin.com/aqzzLtQ7b5I/

课题组简介

沈宁课题组,现有沈宁PI、在站博士后4名和在读博士研究生5名,课题组主要从事组学药理学、生物信息学研究。团队围绕"生物计算驱动的组学与精准医学转化研究"开展多维度研究,聚焦疑难未诊断疾病,运用生物信息学数据整合分析与人工智能算法,并结合实验筛选平台进行药物研发与精准治疗。主要研究方向如下:1、通过整合大规模基因组转录组等多组学数据进行计算生物分析与算法开发,针对癌症及其他疾病进行药物靶点预测、筛选,以及进行精准医疗相关的生物标志物分析与预测。2、针对遗传性疾病开展AI辅助的药物设计,结合患者来源iPSC细胞分化类器官实验平台进行药物研发。3、开发基于计算生物学的疾病诊断方法以及对未诊断遗传病患者进行基因诊断分析。

2026年6月25日,浙江大学良渚实验室沈宁课题组在《Nature Genetics***》***(IF=25.5)发表综述论文为"Advances and challenges of splicing prediction with AI"的研究论文,详细介绍见:浙江大学良渚实验室沈宁团队系统综述从统计模型到基因组大模型:AI 可变剪接预测的进展与挑战

该综述系统梳理了AI驱动的 RNA 剪接预测算法从统计模型、简单机器学习到深度学习、基因组大模型的发展脉络,重点讨论了模型设计、剪接事件定量、突变效应预测等技术细节,并总结了剪接预测算法的临床转化应用及未来的挑战。

文章摘要

背景:真核生物中超过95%的多外显子基因经历可变剪接(Alternative Splicing, AS),是转录后调控的核心环节,也是产生蛋白质组多样性的主要机制。剪接异常与数千种孟德尔遗传病及癌症密切相关。如何从基因组序列、多组学数据中准确预测剪接位点、剪接模式及突变对剪接的影响,是基因组学与精准医学的共同挑战。

发展现状:传统剪接预测始于基于序列保守信号的统计规则(位置权重矩阵PWM、最大熵模型MaxEntScan等),仅能捕捉剪接位点附近短窗口内的GC偏好与GT-AG信号,无法建模远端增强子/沉默子、分支点及组织特异性调控因子(如RBP结合位点)的影响。随着深度学习、Transformer架构及基因组预训练大模型(gLMs)的发展,AI驱动的剪接预测已从"能否识别剪接位点"推进到"能否理解不同序列背景、组织背景和突变背景下的剪接调控逻辑"。即剪接调控是基因表达和变异功能注释的核心环节,AI方法从早期统计模型到现代深度学习框架,剪接预测精度显著提升但仍面临挑战。

现状评价及前景预测:①剪接预测的临床转化价值。计算剪接预测已经成为临床基因组学和疾病研究中的重要辅助工具。大量疾病相关变异可能通过扰动剪接发挥作用,尤其是深内含子变异、非编码变异和隐匿剪接位点相关变异,往往难以仅凭常规注释直接解释。SpliceAI、MaxEntScan、SpTransformer、CADD-Splice、MAGPIE 等工具正在被用于变异优先级排序、致病性证据补充和组织特异性剪接异常识别需要注意的是,剪接预测结果本身并不等同于临床诊断结论。文章强调,模型分数应作为支持性计算证据,与 RNA 实验、功能验证、遗传共分离、临床表型和既有数据库证据等多维度信息结合,共同解释突变影响。也正因如此,未来剪接预测模型的重要方向并不仅是提高分数准确性,还包括提升可解释性、可验证性和与临床证据框架的兼容性。②从剪接改变到治疗。除了变异注释,剪接预测还正在进入治疗设计环节。剪接异常可通过反义寡核苷酸、siRNA、小分子和 CRISPR 等方式进行干预,其中 ASO 是目前最成熟的方向之一。AI 模型可辅助识别异常剪接事件、筛选候选靶点、预测寡核苷酸序列效果,并为剪接纠正策略提供更高通量的设计依据。在肿瘤研究中,异常剪接还可能产生肿瘤特异性新抗原,拓展免疫治疗候选靶点范围。将剪接预测与 RNA-seq、免疫肽组学和变异注释结合,有望发现传统 SNV 和 INDEL 流程之外的肿瘤特异性表位,为个体化癌症疫苗和免疫治疗提供新的候选来源。③大模型并不自动等于更好的剪接预测。随着基因组基础模型兴起,模型参数规模和输入序列长度快速增长。Nucleotide Transformer、Borzoi、AlphaGenome 等模型显示了长序列、多任务和预训练框架的潜力,但文章也指出,模型越大并不必然意味着在所有剪接任务上表现更好。剪接预测的成功取决于生物学任务定义、训练标签质量、组织背景覆盖度、模型结构和计算成本之间的平衡。对于某些明确任务,小型、任务特异性模型可能仍然更高效、更易解释,也更适合实际部署。未来领域需要的不只是更大的模型,还需要能将 DNA/RNA 序列、染色质状态、RNA 结合蛋白占位、RNA 结构、表观转录组修饰和蛋白质组信息整合起来的多模态框架,从而同时捕捉顺式元件和反式调控背景。值得一提的是,围绕"基因组大模型是否一定优于任务特异性模型"这一问题,沈宁课题组近期也在 Nature Communications 发表了题为"Benchmarking pre-trained genomic language models for RNA sequence-related predictive applications"的相关研究。该研究系统评估了 11 个预训练基因组大模型在多类 RNA 序列相关任务中的表现,在可变剪接位点预测的评估中,文章主要对比了预训练大模型与SpliceAI、SpliceTransformer等小型模型的表现差异。结果表明,预训练大模型在训练数据有限或类别高度不平衡的场景中具有明显潜力,但模型规模并不自动转化为更优性能;预训练数据、输入上下文长度、tokenization 策略、微调方式以及具体生物学任务本身,都会共同决定模型表现。这一结论也与本文综述中对剪接预测模型复杂度的讨论相互呼应:未来 RNA AI 模型的发展,不只是继续扩大参数规模,而是要在数据、算法与生物学问题之间建立更合适的匹配关系。****

结论:总体而言,可变剪接预测已经从早期统计规则和短序列打分,发展到深度学习、Transformer 和基因组基础模型驱动的长序列建模阶段。过去,算法主要回答"哪里可能是剪接位点";现在,模型正在进一步尝试回答"突变如何改变剪接、这种改变在哪些组织中发生、是否可能导致疾病,以及能否被治疗干预"。在可变剪接问题上,AI未来能做的,很可能比现在已经做到的更多。对于有兴趣设计和开发RNA相关算法的研究者来说,这篇综述在计算模型设计角度有独特的价值。它表明,未来的关键不只是一味构建更大的模型,而是能否把训练数据、模型结构、剪接定量、异构体重建、组织特异性和临床证据整合为同一套可预测、可解释、可验证的框架,并最终服务于精准诊断和剪接靶向治疗。

相关推荐
NutShell Wang3 小时前
DeepSeek-V4-Flash正式版深度拆解:不换架构,后训练如何让Agent能力暴涨7倍
人工智能·ai·架构·agent·后训练·deepseek
小马9263 小时前
当 Agent 学会“组队“:多智能体协作基础设施的工程革命
ai·agent·多智能体协作
hhb_6184 小时前
轻量化Hermes-Agent架构设计与技术选型解析
ai
yuhulkjv3354 小时前
ChatGPT 复制有星号导出文档杂乱?AI 导出鸭一站式清理格式解决导出难题
人工智能·ai·chatgpt·ai导出鸭
晨曦中的暮雨5 小时前
Learn Claude Code:CodeAgent 与后端程序大搭配——定时任务、Git Worktree 和MCP 服务
git·ai·llm·agent
JavaPub-rodert5 小时前
认识 Codex
ai·image·codex·guide
小燕子~~18 小时前
PS 怎么调整图片尺寸?4 种方法避免拉伸变形与放大失真
图像处理·人工智能·ai·aigc·photoshop
VIP_CQCRE21 小时前
用 Ace Data Cloud 快速接入 Suno 声音克隆 API:让 AI 音乐唱出你的专属声线
ai·aigc·api·音乐生成·suno