摘要
预测细胞对遗传扰动的应答是虚拟细胞的核心能力,也是生物干预计算建模的关键步骤。现有大多数模型直接将未受扰动的分子谱与扰动映射到最终观测结果,并未显式表征干预所诱发的潜在细胞状态转变。本文提出以机理为中心的虚拟细胞世界模型VCLMU,将细胞状态表征为1组潜在机理单元(LMU,Latent Mechanism Units),并把遗传扰动视作作用于这些潜在状态的行动。每个潜在机理单元结合基于多模态生物学证据得到的可复用特征身份,以及对应单次观测的状态;扰动会在解码转录应答之前,诱发机理单元层面的随机状态转换。VCLMU采用2阶段预训练:第1阶段在约20万条伪批量扰动谱上训练,第2阶段继续在基因对齐的单细胞扰动数据上训练。在6套「扰动互斥」基准测试上,相较于性能强劲的基线模型,VCLMU能够持续提升扰动特异性应答基因的召回效果,同时整体应答预测精度仍具备竞争力。本文进一步通过扰动应答与潜在机理单元基因集之间的富集分析,对学习得到的潜在机理单元开展解析,结果表明该单元能够捕获结构化的生物学应答程序。以上结果说明:在虚拟细胞模型中,基于机理层面潜在状态转换进行建模,是预测并解释细胞对生物干预应答的有效方案。
#虚拟细胞 #潜在机理单元 #扰动应答预测 #世界模型 #单细胞遗传扰动 #机理可解释AI #VCLMU
引言

图1 以机理为中心的虚拟细胞世界模型总览
多模态生物学证据经过处理,生成可复用的潜在机理单元(LMU)身份。对照组细胞谱完成编码,路由得到稀疏激活的潜在机理单元集合,获得对照组机理状态。每个激活的潜在机理单元,在行动条件约束下发生随机状态转换,生成预测的扰动后机理状态,再解码得到应答分布与预测谱。训练阶段,观测得到的扰动后谱会通过同1套激活的潜在机理单元完成编码,提供状态转换的目标值,支持扰动行动的逆向预测;该目标分支不会参与前向预测路径。
结果

图2 扰动预测性能与潜在机理单元可解释性分析
(a) VCLMU‑FT与各基线模型在6套评估数据集上的Jaccard@20指标。
(b) 相同下游微调设置下,第1阶段预训练对比第2阶段预训练;标注数值代表Jaccard@20提升幅度。
(c) ∆PCC与∆PCC@20散点图,同时展示全局应答与差异基因层面的皮尔逊相关系数。
(d) 排除普遍应答基因、扣除共享应答信号之后,在留出扰动集上,扰动特异性应答基因在学习得到的潜在机理单元候选基因集中的富集情况;颜色代表-log10(BH‑FDR)。
(e) 6组代表性扰动‑潜在机理单元显著关联:2者重叠应答基因构成具备生物学一致性的程序,涵盖干扰素应答、有丝分裂调控、T细胞信号、T细胞活化、氧化磷酸化、RNA加工;数字代表2者重叠应答基因数目。
详细总结

思维导图
mindmap脑图
现有方法痛点

核心模块
LMU隐式机理单元

损失函数组成
多目标联合优化

2阶段课程式预训练

评价指标

VCLMU与传统扰动模型的对比

参考
VCLMU: Mechanism-Centric Virtual Cell World Modeling for Perturbation Response.
https://doi.org/10.48550/arXiv.2610.04475
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。