斯坦福医学院开发的AI模型为细胞生物学开辟全新研究视野
AI细胞模型,基于来自10余个物种的超1亿个细胞数据完成训练,将大幅提升跨物种间的细胞比对工作效率。
#AI细胞大模型 #通用细胞嵌入 #跨物种细胞比对 #单细胞组学 #虚拟细胞 #细胞演化 #细胞疗法 #斯坦福医学

斯坦福医学院的研究人员开发的AI模型,训练数据涵盖酵母、人类、青蛙、果蝇、海胆、海绵、小鼠、家兔、1种寄生虫、斑马鱼、鸡以及秀丽隐杆线虫。
Margarita Gallardo
斯坦福医学院研究人员开发出2款全新生物细胞AI模型。第1款名为通用细胞嵌入,为第2代模型TranscriptFormer奠定基础;TranscriptFormer基于来自12个物种的1.12亿个细胞数据训练完成,研究对象涵盖单细胞酵母直至人类。让虚拟细胞落地!
该类AI细胞模型极大简化了跨物种细胞比对工作,为疾病新机制研究与新型细胞疗法开发提供潜在方向。
生物工程教授、哲学博士Stephen Quake表示:「试图开创全新的细胞生物学研究思路。」他与计算机科学教授哲学博士Jure Leskovec、陈‑扎克伯格创新研究院哲学博士Theo Karaletsos共同担任2篇研究论文的通讯作者,2篇成果近期分别发表于Nature 与Science。Quake谈到:「希望这些论文能够标志全新研究领域的开端,开启长达10年的相关研究工作。」

Stephen Quake
基因组承载生命的遗传指令,但如今众多生物学家聚焦基因表达,即特定细胞实际启用的基因。
举例而言,胰腺β细胞会表达胰岛素基因,同时表达与激素储存、释放相关的基因;B淋巴细胞可合成抗体抵御疾病;而人体皮肤细胞会表达合成毛发或色素的相关基因。基因表达的这些差异可用于区分不同细胞类型。健康细胞与病变细胞、不同物种的细胞同样具备差异化的基因表达模式。
近些年,科研人员搭建了诸多图谱数据库,依据基因表达模式定义细胞与组织。海量数据包含来自众多物种、数亿细胞的数万条基因信息,数据规模十分庞大。
超出人脑处理能力
Quake称:「该如何同时解析全部这些基因?人类大脑无法做到,而这些模型可以辅助我们完成。算法能够解读人类难以理解的高度复杂数据。」
TranscriptFormer的训练集合包含12个物种。除人类与酵母外,还采用小鼠、家兔、鸡、斑马鱼、果蝇、非洲爪蟾、疟原虫、海胆、海绵以及秀丽隐杆线虫的细胞图谱数据。
模型针对基因表达谱开展训练,原理类似于ChatGPT这类大语言模型。大语言模型本质上通过反复查看存在缺词的文本,不断调整参数,直至可以准确预测缺失词汇。TranscriptFormer执行同类逻辑,只是将词汇替换为基因表达数值。
Quake将该模型输出结果描述为「通用空间」,并非物理实体,而是用于衡量样本异同的数学空间。他提到:「地球上所有生物体的全部细胞都可以映射至该空间内,能够直观查看细胞之间的关联。」
TranscriptFormer可用于解析不同物种间的演化关系。例如,海绵研究领域一直存在疑问:海绵体内哪类细胞和其他动物的神经元亲缘关系最近。该模型显示领细胞与秀丽隐杆线虫、青蛙的神经元相似度较高,有助于科研人员解析神经元演化以及海绵领细胞的功能。而海绵的神经样细胞,虽因具备部分神经元特征而得名,但其基因表达谱却更接近青蛙腺体细胞,提示该细胞或许参与消化过程。
该模型还可处理未参与训练的新物种:输入陌生物种的基因表达数据,TranscriptFormer即可识别其中的细胞类型。团队同时证实该模型可以区分健康细胞与病变细胞。
未来该模型有望助力新型细胞疗法的设计,能够推演目前现实中不存在的功能性细胞。
Quake表示:「期待它成为强大的科研发现工具,辅助专业生物学家攻克复杂科学问题。」
陈‑扎克伯格创新研究院、BioHub的研究人员参与本项研究。Nature论文的共同第1作者为斯坦福大学计算机科学博士生Yanay Rosen,以及现任Arc研究所机器学习副主管的哲学博士Yusuf Roohani。
本研究获得陈‑扎克伯格创新研究院、美国国防高级研究计划局、美国国家科学基金会、斯坦福数据科学研究院、吴蔡神经科学研究院、亚马逊、Genentech、GSK、日立、瞻博网络、KDDI、美国‑斯洛文尼亚教育基金会资助。
Helen Fields
Helen Fields为自由撰稿人。
详细总结

思维导图
基础信息

模型原理

模型能力与应用场景

参考
Stanford Medicine-developed AI model opens new horizons for cell biology
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。