摘要
「虚拟细胞」这一术语涵盖范围广泛,既包括经过整理的生化仿真器,也包括基于图谱训练得到的神经网络表征。但其中关键的实证问题更加聚焦:相较于不嵌入已知生化规则的同等模型,遵循已知生化规则构建的模型,是否能够更好预测新药或者基因改变带来的效应。 本文这篇观点文章探讨:具备生物学先验定义的机理算子,相比性能优异的简单模型、关系型模型、传输类模型以及学习得到的动力学对照模型,能否提升分布外条件下单细胞扰动应答的预测效果。已有的基准测试显示,模型性能排名高度依赖数据集划分方式、统计单元、效应量分布、基因集与评价指标;部分深度模型与基础模型性能无法超越无变化基线、均值效应基线、加性基线、线性基线。基于集合、知识图谱、传输、学习状态方程的模型可在特定任务上获得性能提升。目前尚未有研究,在1套固定的评测条件下,完整隔离生物学指定算子相对于晚期融合、容量匹配静态模型、容量匹配学习动力学算子、拓扑重布线对照模型带来的增量收益。 本文区分6类信息来源,将算子类别进一步划分为生物学指定子类、学习动力学子类。以未折叠蛋白反应(UPR)为对象,给出1套最小可证伪框架;该框架包含明确的参数量预算,依据预先定义的第1阶段规则确定终点时间,设置1套固定对照模型集合。本框架属于前瞻性规范,文中未报告新实验数据、模型实现与性能结果,全部阈值均为设计选择,有待后续实证检验。
#预测性虚拟细胞 #机理算子 #神经微分方程 #细胞基础模型 #扰动预测 #分布外泛化 #可识别性 #模型偏差 #未折叠蛋白反应 #证伪
引言
术语与约定

图1 预测性虚拟细胞模型中的生物学结构来源
算子为父类别,分为生物学指定、学习动力学2个子类;另外5类非算子来源分别为结构化架构、关系先验、因果模型、几何正则化器、仿真特征。各类别可组合,但对应不同科学主张,需要各自配套对照实验。
分布外扰动预测的基准研究汇总
扰动应答的学习动力学模型

图2 分布外扰动预测证据图谱
基准校正已经推翻单纯依靠模型规模即可取胜的观点;现有性能提升来自2条技术路线:
① 关系‑集合‑传输类结构;
② 学习动力学算子。而经过匹配对照隔离后的生物学指定算子带来的增量贡献,仍然属于尚未解决的对比问题。
机理‑机器学习的6种集成模式

图3 基于约束严苛程度、梯度深度2个独立设计轴划分的6种集成模式
该排布仅为概念示意,不代表性能排名;耦合越紧密,数值计算要求越高,同时对可识别性失败、求解器错误的暴露风险越高。
可信机理混合模型的必备条件
不确定性、信息泄露与计算资源

图4 抵御信息泄露的评测设计
细胞属于嵌套观测单元;不同泛化维度需要分别打分;泄露控制同时作用于标签数据集与预训练语料;匹配对照集合包含通用预测器与4类算子隔离对照;在独立设计单元上完成配对分析,使用经过校准的不确定性、方差组分定义的噪声下限。
面向未折叠蛋白反应的最小可检验混合模型:前瞻性设计规范
简化算子与观测模型

图5 面向未折叠蛋白反应的最小可检验混合模型
基线观测用于推导初始状态分布;上下文‑参数模块在第1、2阶段不启用;毒胡萝卜素、毒胡萝卜内酯、基因干扰严格通过预先声明的干预算子起效;1套简化常微分方程模块预测通路状态;带秩‑3偏差项的受限计数观测模型输出经过校准的生物学重复水平分布。
阶段关卡与数据来源

图6 阶段关卡与结果解读逻辑
模型从合成数据恢复实验起步,经过直接通路测量、转录组预测关卡、外部案例验证,最后到前瞻性锁定批次测试;预测性能与机理归因需要分开评估;即便机理解释失败,只要预测有效,模型仍然具备使用价值。
详细总结

思维导图
mindmap脑图
背景与核心问题

生物结构来源分类
核心概念

现有扰动预测证据梳理

机理‑深度学习6种集成模式

UPR最小混合模型的状态变量

不同宣称对应的最低证据要求

参考
Cells. 2026 Sep 20;15(18):1711. doi: 10.3390/cells15181711.
Explicit Mechanistic Operators in Predictive Virtual Cells: Evidence, Failure Modes, and a Minimum Falsification Framework for Single-Cell Perturbation Prediction
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。