好,基因调控建模是计算生物学里最"漂亮"的方向之一------它把分子生物学的直觉和动力系统的数学严密度结合得特别好。
一、核心思想
基因调控的本质是:转录因子(TF)的浓度变化 → 靶基因表达水平变化 → 新的TF产生/降解 → 反馈循环。数学上就是一组耦合的动力学方程。
二、主流建模框架
1. 常微分方程(ODE)------最经典
描述mRNA和蛋白浓度的连续变化:
\frac{dM_i}{dt} = \alpha_i \cdot f_i([P_1], [P_2], \dots) - \beta_i M_i
\frac{dP_i}{dt} = \gamma_i M_i - \delta_i P_i
其中:
-
M_i = 基因i的mRNA浓度
-
P_i = 蛋白浓度
-
f_i(\cdot) = 调控函数,描述TF如何组合影响转录
调控函数怎么写? 最常用的是Hill函数:
f([P]) = \frac{[P]^n}{K^n + [P]^n} \quad \text{(激活)}
f([P]) = \frac{K^n}{K^n + [P]^n} \quad \text{(抑制)}
-
K = 半饱和常数
-
n = Hill系数(协同性,n越大响应越"开关化")
多TF组合用乘法或逻辑门近似:
-
AND逻辑:f = \frac{A^n \cdot B^m}{(K_A^n + A^n)(K_B^m + B^m)}
-
OR逻辑:用max或加和形式
📌 经典案例 :lac操纵子的ODE模型(Novick & Weiner, 1957;后来的Goodwin振子变体)
2. 随机建模------当分子太少时
当基因拷贝数=1~2、mRNA只有几个分子时,ODE的"连续近似"就崩了。这时候用:
-
化学主方程(CME):描述状态概率分布的精确演化
-
随机模拟算法(Gillespie):逐事件模拟,能看到"同一基因型细胞表现不同"的来源
-
化学Langevin方程:在ODE上加噪声项,介于确定性和完全随机之间
为什么重要? 基因表达的"爆发性"(bursty transcription)就是ODE看不到、随机模型能捕捉的现象。
3. 布尔网络/逻辑模型------粗粒度但可扩展
每个基因只有ON/OFF两种状态,更新规则是逻辑函数:
G_A(t+1) = G_B(t) \text{ AND } (\text{NOT } G_C(t))
-
优点:不需要精确参数,适合全基因组规模的网络
-
缺点:丢失了浓度信息和时间尺度
-
代表工具:GINsim, CellNetAnalyzer
4. 贝叶斯网络/概率图模型------从数据反推网络
给定表达量数据,推断"谁调控谁":
-
节点=基因,边=调控关系
-
用互信息、条件独立性测试来学结构
-
挑战:数据少、维度高、因果方向难定
5. 热力学/统计力学模型------最"从第一性原理出发"
把TF结合DNA看作热力学平衡过程:
P(\text{bound}) = \frac{[TF]^n / K_d^n}{1 + [TF]^n / K_d^n}
这个框架把结合亲和力、协同结合、竞争排斥都统一在一个物理图景下。Shea-Ackers模型(1985)是开山之作。
三、几个让人拍案的现象
| 现象 | 数学模型揭示的机理 |
|---|---|
| 双稳态 | 正反馈 + 迟滞回线 → 细胞命运决定(如分化) |
| 振荡 | 负反馈 + 延迟 → 周期行为(如p53脉冲、昼夜节律) |
| 超灵敏开关 | 协同结合(n>1)或级联 → 陡峭响应曲线 |
| 噪声滤波 | 负反馈降低噪声,正反馈放大差异 |
| 记忆 | 双稳态 + 表观遗传标记 → 细胞记住身份 |
四、参数从哪来?
这是最痛的部分:
-
体外实验:EMSA测结合亲和力、体外转录测转录速率
-
体内扰动:敲低/过表达 + 时序测量 → 用数据拟合
-
约束优化:用进化守恒信息、ChIP-seq峰宽等做先验
-
可辨识性分析 :先搞清楚哪些参数根本不可能从现有数据里唯一确定
五、前沿方向
-
单细胞建模:结合scRNA-seq数据做细胞状态轨迹推断(RNA velocity, 势能景观)
-
合成生物学闭环:先建模预测 → 设计基因线路 → 实验验证 → 迭代
-
多尺度耦合:从TF结合动力学 → 细胞表型 → 组织模式形成
-
AI辅助:用神经网络拟合调控函数,或用GNN推断网络结构