新型条件传输模型!虚拟细胞扰动预测

摘要

虚拟细胞模型旨在预测细胞群体对扰动的应答;但对照组与处理组细胞为非配对群体样本,这给学习扰动特异性效应带来很大困难。本文提出条件传输模型SCALE。该模型将细胞视作无序集合,无需细胞层面一一匹配即可预测处理后的细胞群体。模型采用集合感知共享编码器与条件DiT主干网络学习隐空间传输,直接以终点作为监督信号,无需辅助的差值损失函数。在遗传扰动、化学扰动、发育扰动、免疫扰动多类任务中,SCALE可以还原基因表达变化、应答方向以及群体结构。在存在强烈细胞系效应的CRISPR数据集上,SCALE在7项评价指标上均优于对比方法;并且可以保持各靶点基因表征相互区分,不会坍缩至同一表征区域。SCALE还可以对细胞因子做优先级排序,预测能够产生差异化免疫激活与炎症应答的候选因子。利用来自3名供体的配对外周血单个核细胞(PBMC)样本开展实验,证实了上述预测得到的应答差异。综上,SCALE能够基于非配对群体样本实现扰动特异性预测,可用于实验候选方案优先级筛选。

qqian@shu.edu.cn

qgao@zshospital.com

siqisun@fudan.edu.cn

gaozhangyang@ailab.org.cn

#虚拟细胞 #扰动预测 #条件传输 #单细胞基础模型 #BioNeMo #非配对群体 #细胞因子 #多基准测试

结果

SCALE通过学习非配对单细胞终点之间的传输,精准还原扰动特异性应答

图1 SCALE总览

a:预测任务;b:模型架构

(a) 群体层面预测任务:实验分别测得对照组、处理组细胞群体;模型输入对照组群体与扰动条件,预测处理后群体,不假设细胞之间一一配对。

(b) SCALE模型架构:将无序群体映射至低维集合感知隐空间,预测扰动后的终点群体。训练系统支持大规模数据集,评估环节检验模型预测结果是否具备扰动特异性。

注:该学习得到的传输路径仅用于连接对照组、处理组终点,并非真实生物学轨迹,原始数据没有中间时间点,也没有追踪单个细胞处理前后的变化。

表1 基于BioNeMo的SCALE系统训练与推理速度

训练速度使用各框架自身定义的epoch;推理速度以处理细胞数做归一化,并与STATE模型对比。

表2 3套数据集、7项指标扰动基准测试结果

加粗代表数据集内最优,下划线代表次优;MSE、MAE指标越小越好;其余指标越大越好。本表融合公开的CellEval结果,以及使用CellEval 0.6.6重新评估的VCBench预测结果;各行预测流水线、条件集合不完全一致,表注释标明每项结果来源。

SCALE在强细胞系偏移下,还原靶点特异性CRISPR应答

图2 SCALE可还原剔除细胞系均值效应后的基因特异性CRISPR应答

a‑d任务与细胞系结构;e‑i靶点特异性应答还原;j跨细胞系应答空间覆盖度;k隐表征扩散范围

(a) Replogle‑CRISPR任务:在4种人类细胞系上,预测靶基因诱导的表达谱。

(b) 数据划分:训练集、验证集、测试集内的扰动与对应对照组。

(c) 处理组细胞数量:每个细胞系下每种扰动的细胞数,点代表中位数。

(d) 表达谱主要按细胞系区分:主成分图按细胞系、扰动状态着色。

(e) 基因特异性应答与方向:SCALE与STATE的残差皮尔逊相关系数、Direction@100;标注中位数。

(f) 预测应答幅度:不同扰动强度分组下,预测与实测应答范数的log₂比值;0代表幅度相等。

(g) 超越均值应答的准确度:相较于细胞系均值、扰动均值预测中更优一者的提升幅度;正值代表靶点特异性预测效果更好。

(h) 共有应答与细胞系特异性应答:跨细胞系取平均的应答皮尔逊相关系数、各细胞系相对该均值偏差的皮尔逊相关系数、经过log(1+x)变换的应答组分误差;每个点代表至少在3个细胞系测得的靶基因。

(i) Top‑K应答基因重叠度:随选取基因数量增加,跨细胞系的差异基因重叠中位数。

(j) 分细胞系的应答空间覆盖度:log₂倍数变化向量PCA空间内,实测密度轮廓,以及SCALE、STATE预测结果50%、90%等高线;标注条件数量与全条件KDE的RMSE(数值越低越好)。

(k) 隐表征扩散范围:256个条件的2维隐空间投影;STATE的致密区域在插图放大展示。整体比较单元为每条扰动条件,不是单个细胞或单个基因。低维应答、隐空间投影仅用于描述性展示,不能直接证明完整处理组细胞分布被完全复原。

SCALE在跨细胞系、药物组合、不同剂量条件下保留药物应答特异性

图3 跨细胞系、药物组合、剂量的药物应答预测

a‑e跨细胞系迁移;f‑j训练集未见过的药物组合;k‑q高剂量预测

(a‑e) 单药从训练细胞系迁移至留出测试细胞系任务。

(b,c) 不同模型的条件级Δ皮尔逊相关、top100差异基因重叠度。

(d) MCF7代表性低维应答图;红点落在实测应答区域之外。

(e) 在不同实测效应强度分组下,SCALE、STATE、scLAMBDA的Δ皮尔逊相关。

(f‑j) 训练仅使用单药,测试未见过的药物组合。

(f) 任务设计,本矩阵不等同于后续5对组合独立分析。

(g) 5对组合数据集实测细胞的UMAP图,展示训练、验证、测试组合,附带部分分子结构;无模型预测结果。

(h) 6种模型的配对级Δ皮尔逊相关,以及SCALE相对直接加性基线的提升。

(i) top50基因总体RMSE与平均绝对误差。

(j) 3组代表性配对,实测基因层面差值对比SCALE与直接加性预测结果。

(k‑q) 高剂量预测:训练剂量10 nM、100 nM,验证集1 µM,测试集留出10 µM。

(l) 各模型在10 µM测试条件下的条件级Δ皮尔逊相关。

(m) 代表性低维应答图,附带top50基因MAE、斯皮尔曼相关。

(n‑p) 3种药物‑细胞系组合:不同剂量下实测效应、SCALE在10 µM的预测结果,top50基因平均绝对误差。

(q) 代表性基因‑剂量变化曲线;阴影标记留出的10 µM测试终点。每条匹配扰动条件为统计单元,不是单个细胞。低维图仅用于描述,不能证明完整处理组细胞分布得到复原。

详细总结

思维导图

要解决的核心问题

网络结构

3大基准数据集

训练效率对比

BioNeMo框架

3数据集7指标总览

Table 2,粗体为最优

各任务关键发现

实验结果

参考

SCALE: Scalable Conditional Atlas-Level Endpoint transport for virtual cell perturbation prediction

https://www.biorxiv.org/content/10.64898/2026.03.17.712536v1

注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。

相关推荐
实验室管理云平台1 小时前
环境检测实验室管理系统:提升效率与数据准确性的关键工具
大数据·数据库·科技
武子康1 小时前
两台机器跑 vLLM,什么时候才值得引入 Ray?
人工智能·llm·agent
AI技趣星球1 小时前
ChatGPT 杀进 Word:免费版可用,AI 办公落地进入深水区
人工智能
Raas1001 小时前
MAI Gateway(魔芋企业级AI网关)功能全解:AI网关支持流式输出吗?一文看懂AI网关能力矩阵
大数据·人工智能·gateway·mai gateway·企业级网关
wangqiaowq1 小时前
AI-Native(AI 原生) 指从产品、架构、交互到组织流程,从第一天起就以 AI 为核心来设计,而不是在传统软件上后加一个 AI 功能。
人工智能
AI深栈1 小时前
第 14 章 · LangGraph4j 入门:AI Agent 什么时候该上状态图
java·人工智能
学电子她就能回来吗1 小时前
把自然语言变成可制造 CAD:开源 SolidWorks Automation Skill 的工程化实践
人工智能·python·自动化·solidworks·mcp
广西生活网1 小时前
启元机器人接入腾讯 WorkBuddy 具身智能打通虚实服务新链路
人工智能
黄金龙PLUS1 小时前
5个800比特大状态置换算法的设计与分析
算法·网络安全·密码学·哈希算法·同态加密