新型条件传输模型!虚拟细胞扰动预测

摘要

虚拟细胞模型旨在预测细胞群体对扰动的应答;但对照组与处理组细胞为非配对群体样本,这给学习扰动特异性效应带来很大困难。本文提出条件传输模型SCALE。该模型将细胞视作无序集合,无需细胞层面一一匹配即可预测处理后的细胞群体。模型采用集合感知共享编码器与条件DiT主干网络学习隐空间传输,直接以终点作为监督信号,无需辅助的差值损失函数。在遗传扰动、化学扰动、发育扰动、免疫扰动多类任务中,SCALE可以还原基因表达变化、应答方向以及群体结构。在存在强烈细胞系效应的CRISPR数据集上,SCALE在7项评价指标上均优于对比方法;并且可以保持各靶点基因表征相互区分,不会坍缩至同一表征区域。SCALE还可以对细胞因子做优先级排序,预测能够产生差异化免疫激活与炎症应答的候选因子。利用来自3名供体的配对外周血单个核细胞(PBMC)样本开展实验,证实了上述预测得到的应答差异。综上,SCALE能够基于非配对群体样本实现扰动特异性预测,可用于实验候选方案优先级筛选。

qqian@shu.edu.cn

qgao@zshospital.com

siqisun@fudan.edu.cn

gaozhangyang@ailab.org.cn

#虚拟细胞 #扰动预测 #条件传输 #单细胞基础模型 #BioNeMo #非配对群体 #细胞因子 #多基准测试

结果

SCALE通过学习非配对单细胞终点之间的传输,精准还原扰动特异性应答

图1 SCALE总览

a:预测任务;b:模型架构

(a) 群体层面预测任务:实验分别测得对照组、处理组细胞群体;模型输入对照组群体与扰动条件,预测处理后群体,不假设细胞之间一一配对。

(b) SCALE模型架构:将无序群体映射至低维集合感知隐空间,预测扰动后的终点群体。训练系统支持大规模数据集,评估环节检验模型预测结果是否具备扰动特异性。

注:该学习得到的传输路径仅用于连接对照组、处理组终点,并非真实生物学轨迹,原始数据没有中间时间点,也没有追踪单个细胞处理前后的变化。

表1 基于BioNeMo的SCALE系统训练与推理速度

训练速度使用各框架自身定义的epoch;推理速度以处理细胞数做归一化,并与STATE模型对比。

表2 3套数据集、7项指标扰动基准测试结果

加粗代表数据集内最优,下划线代表次优;MSE、MAE指标越小越好;其余指标越大越好。本表融合公开的CellEval结果,以及使用CellEval 0.6.6重新评估的VCBench预测结果;各行预测流水线、条件集合不完全一致,表注释标明每项结果来源。

SCALE在强细胞系偏移下,还原靶点特异性CRISPR应答

图2 SCALE可还原剔除细胞系均值效应后的基因特异性CRISPR应答

a‑d任务与细胞系结构;e‑i靶点特异性应答还原;j跨细胞系应答空间覆盖度;k隐表征扩散范围

(a) Replogle‑CRISPR任务:在4种人类细胞系上,预测靶基因诱导的表达谱。

(b) 数据划分:训练集、验证集、测试集内的扰动与对应对照组。

(c) 处理组细胞数量:每个细胞系下每种扰动的细胞数,点代表中位数。

(d) 表达谱主要按细胞系区分:主成分图按细胞系、扰动状态着色。

(e) 基因特异性应答与方向:SCALE与STATE的残差皮尔逊相关系数、Direction@100;标注中位数。

(f) 预测应答幅度:不同扰动强度分组下,预测与实测应答范数的log₂比值;0代表幅度相等。

(g) 超越均值应答的准确度:相较于细胞系均值、扰动均值预测中更优一者的提升幅度;正值代表靶点特异性预测效果更好。

(h) 共有应答与细胞系特异性应答:跨细胞系取平均的应答皮尔逊相关系数、各细胞系相对该均值偏差的皮尔逊相关系数、经过log(1+x)变换的应答组分误差;每个点代表至少在3个细胞系测得的靶基因。

(i) Top‑K应答基因重叠度:随选取基因数量增加,跨细胞系的差异基因重叠中位数。

(j) 分细胞系的应答空间覆盖度:log₂倍数变化向量PCA空间内,实测密度轮廓,以及SCALE、STATE预测结果50%、90%等高线;标注条件数量与全条件KDE的RMSE(数值越低越好)。

(k) 隐表征扩散范围:256个条件的2维隐空间投影;STATE的致密区域在插图放大展示。整体比较单元为每条扰动条件,不是单个细胞或单个基因。低维应答、隐空间投影仅用于描述性展示,不能直接证明完整处理组细胞分布被完全复原。

SCALE在跨细胞系、药物组合、不同剂量条件下保留药物应答特异性

图3 跨细胞系、药物组合、剂量的药物应答预测

a‑e跨细胞系迁移;f‑j训练集未见过的药物组合;k‑q高剂量预测

(a‑e) 单药从训练细胞系迁移至留出测试细胞系任务。

(b,c) 不同模型的条件级Δ皮尔逊相关、top100差异基因重叠度。

(d) MCF7代表性低维应答图;红点落在实测应答区域之外。

(e) 在不同实测效应强度分组下,SCALE、STATE、scLAMBDA的Δ皮尔逊相关。

(f‑j) 训练仅使用单药,测试未见过的药物组合。

(f) 任务设计,本矩阵不等同于后续5对组合独立分析。

(g) 5对组合数据集实测细胞的UMAP图,展示训练、验证、测试组合,附带部分分子结构;无模型预测结果。

(h) 6种模型的配对级Δ皮尔逊相关,以及SCALE相对直接加性基线的提升。

(i) top50基因总体RMSE与平均绝对误差。

(j) 3组代表性配对,实测基因层面差值对比SCALE与直接加性预测结果。

(k‑q) 高剂量预测:训练剂量10 nM、100 nM,验证集1 µM,测试集留出10 µM。

(l) 各模型在10 µM测试条件下的条件级Δ皮尔逊相关。

(m) 代表性低维应答图,附带top50基因MAE、斯皮尔曼相关。

(n‑p) 3种药物‑细胞系组合:不同剂量下实测效应、SCALE在10 µM的预测结果,top50基因平均绝对误差。

(q) 代表性基因‑剂量变化曲线;阴影标记留出的10 µM测试终点。每条匹配扰动条件为统计单元,不是单个细胞。低维图仅用于描述,不能证明完整处理组细胞分布得到复原。

详细总结

思维导图

要解决的核心问题

网络结构

3大基准数据集

训练效率对比

BioNeMo框架

3数据集7指标总览

Table 2,粗体为最优

各任务关键发现

实验结果

参考

SCALE: Scalable Conditional Atlas-Level Endpoint transport for virtual cell perturbation prediction

https://www.biorxiv.org/content/10.64898/2026.03.17.712536v1

注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。

相关推荐
lhh_qrsly6 小时前
机器学习 深度学习 强化学习 都学啥 和 高等数学 线性代数 概率论数理统计 有啥关系
深度学习·线性代数·机器学习
智圣新创016 小时前
智圣新创智慧学生社区平台:高校一站式学生社区育人效能转化的落地方法论
大数据·人工智能
我不会插花弄玉6 小时前
3.通用命令【由浅入深-redis】
数据库·redis·bootstrap
思茂信息6 小时前
CST软件UV Slice切片后可直接删除指定一侧实体
算法·uv·emc·emi·cst·仿真软件
小炫y6 小时前
基于规则的NLP技术-词的处理
人工智能·自然语言处理
冬奇Lab6 小时前
LLM 驱动的自动化测试系列(09):移动端自动化(五)——当通用 Agent 框架下沉到测试场景
人工智能·agent·测试
冬奇Lab6 小时前
开源项目第233期:Open-XiaoAI — 刷机接管小米小爱音箱,接入 ChatGPT/小智 AI/Gemini Live
人工智能·开源·资讯
Sayai7 小时前
MCP Server 开发实战:Spring AI 把后端日志查询暴露给 AI Agent(7 条设计原则与踩坑实录)
java·人工智能·ai agent·spring ai·mcp
大牧师7 小时前
Mybatis 框架教程
java·数据库·mybatis·数据持久化·orm
INGNIGHT7 小时前
944 · 最大子矩阵(前缀和)
数据结构·c++·算法