简言之
对大规模单细胞群体开展扰动效应建模,需要具备捕捉异质性的能力。State模型在共享嵌入空间上对细胞集合进行训练,在向全新细胞环境泛化时性能优于现有基线模型。本研究配套开发的Cell‑Eval评测框架,可为后续模型提供1套完备的基准测试方案。
yusuf.roohani@arcinstitute.org
#单细胞 #扰动预测 #细胞异质性 #Transformer #零样本泛化 #虚拟细胞

亮点
-
State可对数据集内部及跨数据集的异质性进行建模,用于预测扰动效应
-
Cell‑Eval是套用于评估扰动预测模型的综合评测框架
-
State嵌入能够提升跨数据集的扰动效应检测能力
-
State支持面向假设生成的、环境特异性的虚拟实验
摘要
尽管机器学习模型具备预测扰动转录组效应的潜力,但目前这类模型在跨细胞环境泛化方面仍存在困难。本文提出State机器学习模型,该模型在预测扰动效应的同时,可兼顾实验内部以及跨实验的细胞异质性。State利用单细胞基因表达数据进行训练,针对细胞集合预测扰动带来的细胞响应。在大规模数据集上,State对扰动效应的区分能力提升幅度超过30%;相较于基线模型,其对遗传、信号、化学扰动下差异表达基因的识别准确率也得到显著提升。该模型基于1.67亿细胞的观测数据训练得到细胞嵌入,能够在训练阶段从未见过扰动的细胞环境中识别出强扰动。本研究进一步构建Cell‑Eval综合评估框架,可用于评估未来相关模型。综上,State的性能与灵活性为细胞状态AI模型的规模化发展奠定了基础。
结果
构建ST模型,用于对细胞集合的扰动效应进行预测

图1 基于Transformer、用于跨细胞集合预测扰动效应的模型State
A,在单细胞分辨率下对扰动效应建模,需要将生物学信号与噪声、批次效应带来的混杂变异分离开。
B,State是套多尺度机器学习架构,在基因、单细胞、细胞群体多个尺度上运算。核心模块ST学习经过相同处理的细胞之间的扰动效应与异质性;模型按照已知协变量(扰动类型、细胞环境、批次)分组,对扰动/未扰动细胞集合开展训练。ST既可以直接在基因表达谱上运算,也可以使用SE学习得到的紧凑细胞表征作为输入,SE从大规模观测数据中学习富含信息的细胞嵌入。ST输出嵌入后,通过多层感知机解码器预测转录组。
C,ST是Transformer模型,以未受扰动的细胞群体集合、扰动标签作为输入,预测对应的扰动后细胞群体。ST可直接在基因表达谱,或SE输出的细胞嵌入上运算;该多尺度架构使ST能够高效开展虚拟扰动模拟实验,并支持下游表达定量、差异基因分析、扰动效应大小估计等分析。D,增大细胞集合尺寸可降低验证损失,直至达到最优值;在Tahoe‑100M数据集上,当协变量匹配的分组被切分为768个细胞的集合时,模型取得最优性能。完整ST模型显著优于伪批量模型(将State的自注意力替换为均值池化)与单细胞版本(集合大小= 1);移除自注意力机制(State w/o self‑attention)会大幅降低性能,证明对集合内部细胞间相互作用进行建模十分关键。D图中纵轴为验证损失,横轴为累计浮点运算量。
State跨细胞环境预测扰动效应性能优于基线模型

图2 State跨细胞环境预测扰动效应性能优于现有基线模型
A,低占比环境泛化任务:模型在1个或多个细胞环境的扰动数据上训练,评估其在大部分未参与训练、占比较低的目标环境中预测相同扰动效应的能力。「扰动均值」基线通过对训练细胞环境中扰动‑对照的观测差值取平均估计效应;「环境均值」基线使用目标细胞环境在全部训练扰动下的平均表达谱。
B,在化学、信号、遗传扰动数据集上完成模型训练与评估;训练集、测试集取自同个数据集。对比包含A图中的均值基线、简单线性模型、GEARS、自编码器类模型(scVI、CPA)、基础模型scGPT。
C,使用Cell‑Eval指标,基于Perturb‑seq标准输出(表达计数、差异表达基因)评估模型性能。
D‑J,3套扰动数据集上 State 与基线方法的选定评估指标。每幅图中水平虚线代表次优基线,标注State相对该基线的提升(或下降)幅度;方法按照这些指标的平均性能排序;误差棒代表标准差。Parse‑PBMC、Replogle‑Nadig数据集使用4组训练‑测试拆分;Tahoe‑100M数据集使用5个留取测试细胞系。
D,扰动区分得分,基于归一化秩计算。
E,扰动后对数归一化表达计数的预测值与观测变化之间的皮尔逊相关系数。
F,差异表达基因预测的精确率‑召回曲线下面积。
G,差异表达基因预测的精确率‑召回曲线。
H,显著差异表达基因的对数倍数变化,预测值与真实值的斯皮尔曼相关系数。
I,top差异表达基因的重合度:观测数据中显著基因同时也被预测为显著基因的占比。
J,扰动总效应大小的预测值与真实值之间的斯皮尔曼相关系数。
K,混淆矩阵,对比State预测与观测得到的扰动效应大小(以每个扰动的差异表达基因数目衡量)。
State嵌入提升跨数据集、跨实验、跨模态的0样本扰动效应预测

图3 State嵌入提升跨数据集、实验、模态的零样本扰动效应预测性能
A,SE学习跨多样数据集、具备泛化能力的转录组信息细胞表征。给定对照组(未扰动)细胞群体,SE计算细胞嵌入;随后ST预测这些嵌入在特定扰动下如何发生偏移,在隐空间对扰动的分布效应建模;最后通过学习得到的解码器,将预测的嵌入映射回基因表达空间。
B,使用内在、外在指标评估嵌入质量:内在性能反映基于观测数据生成的嵌入对扰动细胞的分类准确率;外在性能衡量ST基于细胞嵌入预测得到的扰动嵌入的分类准确率。
C,在2套留取的扰动数据集上,使用内在、外在指标,将State嵌入与scFoundation、scGPT、UCE、Transcriptformer (TF)生成的细胞嵌入进行对比。State嵌入持续优于其他同类模型嵌入,甚至超过直接使用原始表达计数的性能;误差棒代表7个细胞系上的标准差。
D,0样本条件下(训练阶段未见过该环境的扰动,但见过对照细胞),State嵌入提升扰动效应预测;模型在图2同样的留取环境上评估。该条件下,绝大多数指标中ST+SE相比ST+HVG获得显著提升;百分比代表ST+SE相对ST+HVG的相对性能提升。Parse‑PBMC、Replogle‑Nadig数据集n=4组训练‑测试拆分;Tahoe‑100M数据集n=5个留取测试细胞系。
E,State在嵌入空间中将模拟药物扰动与遗传扰动匹配,解析药物作用机制。以MEK通路抑制剂曲美替尼为例,识别出通路核心成员(PTPN11、RAF1、SHOC2)为相似度最高的遗传扰动;模拟与实验测得距离之间具备高度一致性。
F,使用Tahoe‑100M对ST+SE预训练,再在包含1个或多个环境的查询数据集上微调,其中1个环境留作测试;在留取细胞环境不使用任何扰动训练数据的条件下评估 ST。
G,5套查询数据集上,对未见过细胞环境的扰动按总效应大小排序的性能,证明迁移学习有效;误差棒为每个数据集全部细胞系的标准差。
State可检测细胞类型特异性的扰动响应

图4 State检测扰动带来的细胞类型特异性基因表达变化
A,State用于识别具备细胞类型特异性效应的扰动的应用流程。
B,扰动效应预测与观测结果之间差异表达基因的重合度;左图State对比环境均值基线;右图State对比扰动均值基线。选取留取扰动(0.5 μM曲美替尼)作为示例,State相关系数显著高于2组基线,说明模型能够检测细胞类型特异性、无法被简单细胞类型均值预测的扰动效应。
C,差异表达基因对数倍数变化预测值与观测值的斯皮尔曼相关系数;左图State对比环境均值基线;右图State对比扰动均值基线。
D,0.5 μM曲美替尼扰动后,top2000高变异基因的差异表达基因显著性预测值与观测值对比;蓝色State,黄色基线;State与真值更加吻合。
E,真实显著差异表达基因的对数倍数变化,对比State(蓝)与基线(黄)预测结果。
F,5个细胞系在0.5 μM曲美替尼扰动后细胞类型特异性差异表达基因检测结果。每个细胞系第1行代表基于绝对值log倍数变化筛选得到的top100真实基因;下面各行分别为State与基线模型预测的top100基因;同时报告预测与真实差异表达基因的重合数目。
G,基于State预测计算的细胞周期得分相比扰动均值基线,与真值一致性显著更高;p值来自双侧配对t检验。
H,全部留取细胞系中药物诱导扰动的相似度热图;每行/列对应1组特定药物‑浓度配对;分别使用实验测量数据、State预测结果、扰动均值基线计算热图;使用调整兰德指数 ARI,将热图聚类结果与实测数据聚类做对比。
I,State在预测细胞活力方面优于基线模型。除非特别说明,p值均为对皮尔逊相关系数零假设的双侧检验。
State支持环境特异性的虚拟实验

图5 State实现环境特异性的虚拟模拟实验
A,从留取数据得到细胞系特异性基因程序;对比实验观测与State预测结果中各扰动对程序水平的效应。
B,不同通路程序效应的一致性。
C,State持续优于PerturbMean、ContextMean基线,每个程序层面与测量结果高度一致。
D,Replogle‑Nadig、Parse‑PBMC、Tahoe‑100M数据集上逆扰动设计任务的top‑k准确率;模型预测在留取细胞中诱导目标转录状态所需的扰动(沿用图2的训练‑测试拆分)。跨全部k值,State环境依赖预测优于均值基线,体现环境特异性的重要意义。
E,虚拟实验:由药物扰动产生新细胞状态,再将该状态输入模型,预测第2种药物的响应;单药效应的加和与最终输出之间的差值用于量化非加和效应。
F,在COLO 205细胞中,阿比特龙作为第1种扰动的药物组合预测,与DrugComb协同指标显著相关;类似,HS 578T细胞塞来昔布作为第1种扰动,组合预测结果与DrugComb全部协同指标高度相关。
G,虚拟实验:近似遗传扰动效应的全新扰动;遗传扰动在学习得到的药物扰动嵌入空间中表示为线性组合,无需重新训练或微调,实现零样本模拟。
H,Tahoe‑100M数据集50个细胞系上模拟遗传扰动响应热图;展现生物学结构:部分扰动基于已知功能关系聚类,部分细胞系基于已知注释分组;分析使用Replogle‑Nadig数据集全部2024个遗传扰动;每行细胞系内部做归一化,数值代表该细胞系中扰动效应与对照组之间的平均欧氏范数。
I,A549、HCT15、RKO细胞中,模拟遗传扰动的预测活力效应与DepMap CRISPR基因必需性数据存在相关性,证明从药物中学到的调控关系可以迁移至未见过的扰动模态。除非特别说明,报告的p值均为皮尔逊相关系数零假设的双侧检验。
数据与代码
A549 sgRNA Perturb‑seq数据集已存入GEO数据库(GSE337804)
全部原始代码已于论文发表时开源,仅限非商业用途使用,包含4套代码仓库
❶ State训练与推理
https://github.com/ArcInstitute/state
zenodo
10.5281/zenodo.21047879
❷ 数据加载工具cell‑load
https://github.com/ArcInstitute/cell‑load
zenodo
10.5281/zenodo.21040482
❸ 评测指标Cell‑Eval
https://github.com/ArcInstitute/cell‑eval
zenodo
10.5281/zenodo.21047675
❹ 基线模型与复现分析state‑reproduce
https://github.com/ArcInstitute/state‑reproduce
zenodo
10.5281/zenodo.21040713
训练模型权重托管于Hugging Face平台,包括SE‑100M、SE‑600M、ST+HVG(Replogle、Parse、Tahoe)、ST+SE(Replogle、Parse、Tahoe),均归属arcinstitute命名空间
详细总结

思维导图
论文基础信息

ST(State Transition)状态转移模块
核心预测器

Cell‑Eval评测套件
本论文重要产出

2类泛化测试任务定义

参考
Cell. 2026 Aug 31:S0092-8674(26)00921-9. doi: 10.1016/j.cell.2026.07.052.
Predicting cellular responses to perturbation across diverse contexts with State
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。