statistics

一、 核心基础概念与期望/方差计算

  1. 概率质量函数(PMF,概率质量函数)
  • 概念:离散型随机变量在各个可能取值上的概率分布函数。
  1. 期望(平均值 / 期望值,E(X))与方差(方差,var(X))
  • 期望:随机变量的平均值或中心位置。
  • 方差:衡量随机变量数据偏离其期望值的离散程度。
  • 线性变换性质 :若Y = aX + b,则:
    • E(Y) = aE(X) + b
    • var(Y) = a\^2 var(X)(截距b不影响方差)

二、 常见概率分布及其应用场景

课程中强调了"根据问题结构选择模型"而非单纯死记公式:

1. 离散概率分布(离散分布)
  • 二项分布(二项分布,\\text{Bin}(n, p))
  • 应用场景 :固定试验次数n,每次试验独立且成功概率为p,求"成功次数X"的概率。
  • 均值与方差 :E(X) = np,\\text{var}(X) = np(1-p)。
  • 泊松分布(泊松分布,\\text{Poi}(\\lambda))
  • 应用场景 :用于建模稀有事件(发生概率很小p \\to 0,试验次数很大n \\to \\infty)在特定区间内的发生次数。
  • 性质 :均值和方差相等,均等于\\lambda(即E(X) = \\text{var}(X) = \\lambda)。
  • 泊松近似二项分布(泊松近似):当n较大、p较小时,二项分布可用参数\\lambda = np的泊松分布近似。
  • 负二项分布(负二项分布)
  • 应用场景:固定目标成功次数,研究"达到该成功次数所需的等待时间/尝试次数"(例如猫咪损失固定生命次数所经历的天数)。
2. 连续概率分布(连续分布)
  • 正态分布(正态分布)
  • 概念:呈对称钟形曲线,由均值和标准差决定,在医学和统计检验中极常见。
  • 指数分布(指数分布)
  • 应用场景:连续时间内等待单个事件发生的等待时间。
  • 伽马分布(伽马分布)
  • 应用场景:多个独立且同分布的指数随机变量之和(等待多次成功的总时间)。

三、 正态性检验与数据可视化评估

在分析连续变量时,评估数据是否符合正态分布非常关键:

  1. 可视化工具:
    • 正态 QQ 图(Normal Q-Q Plot):通过数据点是否贴近一条直线来直观判断是否接近正态分布。
    • 直方图(直方图)与 箱线图(Boxplot):用于评估数据的对称性、偏态(Skewness)以及是否存在离群值(Outliers)。
  2. 正态性统计检验(正常性测试):
    • Shapiro-Wilk 检验 与 Anderson-Darling 检验。
    • 注意 :小样本下统计检验可能不可靠,通常更强调结合可视化图表综合评估,而不是仅仅依赖p值。
  3. 数据变换与离群值(Data Transformation & Outliers):
    • 数据变换:如对数变换(Log Transformation),不能因为数据非正态就盲目采用,需对比变换前后效果。
    • 离群值:偏离主体数据的极端值,会显著影响统计结果,需结合实际医学/健康研究背景谨慎判断。

四、 因果推断与图模型(因果推断与图模型)

  1. 边际独立(Marginal Independence)与条件独立(Conditional Independence)
  • 边际独立:不考虑其他条件时,一个变量的信息不会改变对另一个变量的判断。
  • 条件独立:在已知某个条件变量的约束下,两个变量相互独立。
  • 注意:条件独立与边际独立互不必然推导(条件独立不一定推出边际独立,反之亦然)。
  1. 有向无环图(DAG,有向无环图)
  • 概念:节点表示变量,有向边(箭头)表示可能存在的直接因果关系,且图中不存在闭环。
  • 应用:根据数据的真实生成过程确定箭头方向,用于识别和判定条件独立性与混杂因素。

模块一:概率分布与核心概念(对应图1)

在健康数据中,我们经常要建模"某个事件发生的概率"。

* **离散分布 (Discrete Distributions)**:结果可以一个一个数出来的(比如:误诊人数、发病次数)。
* **连续分布 (Continuous Distributions)**:结果是一个范围或测量值(比如:血压、等待时间)。
* **独立性 (Independence)**:
* **边际独立 (Marginal Independence)**:两个变量毫无关系。知道 A 发生,对 B 发生的概率没有任何影响(比如,今天下雨和隔壁老王感冒)。
* **条件独立 (Conditional Independence)**:在已知某个条件变量后,两个变量变得无关。
* *🩺 健康数据应用*:病人的症状和疾病之间可能存在关系,但如果我们"控制了年龄"这个变量(给定年龄),症状和疾病可能就独立了。
* **有向无环图 (DAG)**:因果推断的核心工具。用来画因果关系图,**不能有循环**(即A影响B,B影响C,C不能反过来影响A)。箭头代表因果方向。

模块二:概率模型的"选型"(对应图1、图2、图4)

这正是你需要补课的重中之重。老师强调:**"不要死记代码,要根据问题的结构判断模型"**。

**1. 二项分布 (Binomial Distribution)**
* **概念**:进行 \(n\) 次独立重复试验(比如抛硬币、看病),每次成功的概率是 \(p\),问总共成功 \(k\) 次的概率。
* **记忆口诀**:**固定试验次数 \(n\),求成功次数 \(k\)。**(\(n\) 大 \(p\) 小的时候,用泊松分布近似)。
* **🩺 应用**:假设医院有 600 名患者(\(n=600\)),误诊率是 0.01(\(p=0.01\)),求恰好有 \(X\) 个患者被误诊的概率。
* **均值与方差**:均值 \(E(X) = np\),方差 \(Var(X) = np(1-p)\)。
* **R语言**:`dbinom(x, size, prob)`(计算概率),`pbinom()`(累积概率)。

**2. 泊松分布 (Poisson Distribution)**
* **概念**:描述**单位时间或空间内**,稀有事件发生的次数。
* **记忆口诀**:**只知道平均发生率 \(\lambda\),求发生次数 \(k\)。** 实际上,它是二项分布在 \(n\) 很大、\(p\) 很小时的近似(图4中老师举例 \(n=600, p=0.01, \lambda = np = 6\))。
* **🩺 应用**:某医院每天急诊室接到的呼救电话数量。
* **R语言**:`dpois(x, lambda)`。

**3. 负二项分布 (Negative Binomial Distribution)**
* **概念**:为了获得第 \(r\) 次成功,需要进行的试验总次数(或失败次数)。它是几何分布的推广。
* **记忆口诀**:**固定成功次数 \(r\),求试验次数 \(X\)。**
* **🩺 应用(图4猫咪案例)**:猫咪有 \(r\) 条命(成功次数),每天被撞概率是 0.01,求它活 \(X\) 天的概率。
* **期望与方差**:期望 \(E(X) = r/p\),方差 \(Var(X) = r(1-p)/p^2\)。
*(图1提到的"等待多次成功可对应伽马分布",伽马分布就是负二项分布在连续时间上的对应版。)*

**4. 指数分布 (Exponential Distribution)** 与 **伽马分布 (Gamma Distribution)**
* **概念**:指数分布是"直到第一次事件发生"的等待时间(连续版)。伽马分布是"直到第 \(\alpha\) 次事件发生"的等待时间(多个指数分布之和)。
* *R语言*:`dexp()`,`dgamma()`。

模块三:正态性检验与数据可视化(对应图1)

医学数据中,正态分布非常常见,但真实数据往往只是"近似正态"。老师强烈建议**不要只依赖 p 值(比如 Shapiro 检验),要先看图**。

* **如何判断正态性?**

  1. **直方图 (Histogram)**:是否呈钟形、对称?
  2. **QQ图 (Quantile-Quantile Plot)**:**必看!** 横轴是理论正态分位数,纵轴是样本分位数。如果数据正态,点应该**大致贴紧一条45度的直线**。
  3. **箱线图 (Boxplot)**:看是否有离群值(偏态)。
    * **离群值 (Outliers)**:极端值。**不要机械地删除**,必须结合研究背景(比如记录错误、罕见病例)来谨慎决定是否删除或做数据变换。
    * **数据变换 (Data Transformation)**:如果数据非正态,常做**对数变换 (Log transformation)**。但如图2警示:**不要盲目做对数变换**,必须对比变换前后的 QQ 图和分布,确认效果真的改善了才用。

模块四:数据生成与因果图 (DAG) 基础(对应图1、图2)

图2中提到的"父母分别指向孩子,父母之间没有直接边"是因果推断的经典结构:
* 在"父母 -> 孩子"的结构中,父母之间是**边际独立**的。
* 但是,一旦**给定"孩子"**这个条件(即控制了孩子),父母之间就会产生**条件依赖**(也就是著名的"对撞偏差"或"选择偏差"Collider Bias)。这是处理健康数据(比如做中介分析或控制混杂变量时)极易犯的错误。

模块五:R 语言实践提示(对应图4)

图4 是上机实践课的问题,你需要知道:
* `Bin(1000, 0.001)` vs `Poi(1)`:这里的 \(\lambda = 1000 \times 0.001 = 1\)。画图时使用 `dbinom()` 和 `dpois()`,并利用 `par(mfrow = c(2, 1))` 将两张图画在一起,你会看到它们几乎完全重合。这就是**泊松近似二项分布**的直观验证。
* 请回顾基础的 R 语言语法:怎么定义向量,怎么用循环,怎么计算期望(`sum(x * p_x)`)和方差(`sum((x - mean)^2 * p_x)`)。


  1. **拿起纸笔,推导公式**:不要只看,自己推导一遍:\(Y = 2X + 1\) 的期望和方差怎么求?这涉及期望和方差的性质:\(E(aX+b) = aE(X)+b\),\(Var(aX+b) = a^2Var(X)\)。
  2. **重点攻克 R 语言基础**:复习 `d` (density/probability), `p` (cumulative probability), `q` (quantile), `r` (random generation) 这几个前缀的函数。
  3. **主动扩展学习**:可以去 YouTube 或者 B站 搜索关键词:**"二项分布 负二项分布 泊松分布 区别"**、**"QQ图怎么看"**、**"因果推断 DAG 入门"**。

这些知识在健康数据科学中会反复用到(比如临床预测模型、生存分析、因果推断),现在花时间补回来,对后面高年级的课程非常有帮助!


  1. **搞懂"四大分布"到底在解决什么问题(图2、图3):**

* **二项分布 (Binomial)**:比如,抛10次硬币,正面朝上的次数。或者,100个病人吃药,治愈的人数。核心特征:**知道总人数 \(n\),知道单次成功的概率 \(p\),求总成功次数 \(k\)**。公式:\(P(X=k) = \binom{n}{k} p^k (1-p)^{n-k}\)。

* **泊松分布 (Poisson)**:比如,一小时内急诊室来了几个病人。核心特征:**不知道总人数,只知道平均发生率 \(\lambda\),求发生 \(k\) 次的概率**。

* *重点理解(图3讲的)*:当 \(n\) 很大,\(p\) 很小时(比如 \(n=600, p=0.01\)),二项分布算起来极其复杂(阶乘太大),这时候我们可以用泊松分布来**近似**它,令 \(\lambda = np = 6\)。这是图3那道实践题的核心考点。

* **负二项分布 (Negative Binomial)**:比如,猫咪有9条命,每次出门有0.01概率死掉,求它第9次死掉时,总共过了多少天。核心特征:**知道想要成功几次(死几次 \(r\)),求总共需要经历多少次试验(活多少天 \(X\))**。

* **指数分布与伽马分布 (Exponential & Gamma)**:连续版的等待时间。指数分布是等"第1次"事件发生的时间,伽马分布是等"第 \(\alpha\) 次"事件发生的时间(多个指数分布相加)。

* **🩺 推荐资源**:去 B站 搜索"**可汗学院 概率论**"或者"**统计学 常见分布 通俗讲解**",看那种动画演示的短片,十分钟就能搞懂一个分布。

  1. **搞懂 QQ图 (QQ Plot)(图1):**

* 这是图里老师非常强调的。不要去背它的数学公式,只需要记住一句话:**"QQ图的横轴是理论上的正态分布,纵轴是你手头的数据。如果点乖乖地排成一条斜向上的直线,数据就是正态分布;如果点弯曲(比如呈现出S型、或者两头翘起)或者偏离直线,就不是正态分布。"**

* 图3举了牙齿生长的例子,做对数变换后 QQ图并没有改善,所以老师警告:**不要盲目做对数变换**,必须看图对比效果。

* *推荐行动*:去搜一下"**怎么看懂QQ图**",看图解,一分钟就能学会。

* **第一题**:考的是期望和方差的**线性性质**(即 \(Y = 2X + 1\),\(E(Y)\) 和 \(Var(Y)\) 怎么求)。去百度或B站搜"**期望和方差的性质**"(5分钟就能看懂)。

* **第二题**:考的是**二项分布、泊松分布及其近似**。

* 不要只算 \(P(X=0)\) 和 \(P(X=1)\),你要知道在 R 语言里怎么用 `dbinom` 和 `dpois` 算出来。

* 动手在 R 里画图,亲眼看看 `Bin(1000, 0.001)` 和 `Poi(1)` 的 PMF 图是不是几乎重叠。

* **第三题**:直接用负二项分布的公式(均值 \(r/p\),方差 \(r(1-p)/p^2\))套进去算就行。不用理解太深,先会算。

第三阶段:用 R 语言实操(花1-2天)

你是数据科学的学生,**不要光看纸面上的公式**。老师也说"概率模型的关键不是死记 R 命令,而是根据问题结构判断模型"(图3)。

  1. 在你的电脑上打开 RStudio。

  2. 把图4的三道题,全部用 R 语言敲一遍。比如:

```R

二项分布

dbinom(0, size=600, prob=0.01) # P(X=0)

dbinom(1, size=600, prob=0.01) # P(X=1)

泊松近似

dpois(0, lambda=6)

dpois(1, lambda=6)

验证两者是否接近

plot(0:10, dbinom(0:10, 1000, 0.001), type="h", col="blue")

lines(0:10, dpois(0:10, 1), type="h", col="red")

```

当你看到两张图几乎一模一样时,那个知识点你**一辈子都忘不掉**了。

  1. R 语言中 d/p/q/r 四个前缀(density, probability, quantile, random)要弄清楚它们分别输出什么。

第四阶段:关于因果推断 (DAG) 的补课(结合图2)

这部分对于大一刚学完概率的人来说,确实是陌生的概念(很多学校研究生才讲)。

* **先不要看复杂的教材**。去 B站搜索 **"因果推断 DAG 入门"** 或者 **"有向无环图 通俗讲解"**。

* 只需要记住图里说的:**"箭头代表因果方向"**。图2举了"父母指向孩子"的例子(这就是经典的"对撞结构")。父母之间本来没有直接联系(边际独立),但如果你把"孩子"这个变量固定住(条件独立),父母之间就会产生虚假的关联。这是健康数据分析中非常容易犯的错误(对撞偏差 Collider Bias)。

* 理解到这个层面,对于这门课已经足够了。


  1. **做好笔记**:把"二项分布、泊松分布、负二项分布、QQ图、DAG"这几个关键词写在笔记本上,旁边用你自己的话写一句注释(比如:二项分布=固定次数求成功次数;泊松=固定均值求稀有事件次数)。
    千万不要从头把整门概率论/统计学课程重新看一遍。

1. 抓主干:梳理"概率分布"的决策树

老师 PPT 中明确强调了:关键不是死记硬背公式或 R 命令,而是根据数据/问题结构选择正确的模型。
你可以自己整理一张"数据类型与模型选择"地图:

  • 数据是计数/离散的?
    • 关心"固定试验次数中成了几次"\\to 二项分布
    • 关心"稀有事件在一定时间/空间内发生了几次"\\to 泊松分布
    • 关心"达到n次成功需要等多久/尝试多少次"\\to 负二项分布
  • 数据是连续的?
    • 观察连续数据的分布与对称性\\to 正态分布
    • 关心"单个事件发生的等待时间"\\to 指数分布
    • 关心"多个事件发生的累积等待时间"\\to 伽马分布

2. 结合 R 语言实践,做中学(通过实践学习)

从你的 PPT 来看(如 , , )dbinom()``dpois()``par(mfrow=...),课程非常注重 R 语言的实际操作与可视化分析。

  • 手动敲代码,观察图像变化 : 在 R 中运行老师要求的代码,改变参数(比如改变二项分布的n和p),亲自看看直方图是如何逐渐变成泊松分布或正态分布的。通过图形(QQ图、箱线图、直方图)理解直观概念,比硬背理论记忆深得多。
  • 理解代码背后的含义:
    • dnorm / dbinom中的 代表 Density / PMF (求某一点的概率/密度)d
    • pnorm / pbinom中的 代表 CDF / Probability (求累积概率pP(X \\le x))
    • rnorm / rbinom中的 代表 Random (生成随机数)r

3. 精准查漏补缺,利用高效工具

不需要买厚重的教材,遇到不懂的具体名词(如:What is Poisson approximation? 什么是DAG?),使用以下方式快速补课:

  • StatQuest(YouTube 频道): 强烈推荐!作者 Josh Starmer 用极其直观的绘图和浅显的语言讲解统计概念(如 Normal Distribution, QQ Plots, Poisson Distribution, DAGs),每个视频只有 10-15 分钟,非常适合快速拾起概念。
  • 利用 AI 做针对性答疑: 直接把不会的课后题或代码丢给 AI(例如:"请用 Health Data 的实际例子解释什么是 DAG 中的条件独立和边际独立"),让它为你举例说明。

4. 紧扣 Health Data Science 的实际应用场景

在复习时,尝试把抽象的统计概念与医学/健康数据结合起来思考(如老师 PPT 里的案例):

  • 误诊率 (医院误诊)\\to二项分布 / 泊松近似
  • 患者生存时间/复发等待时间 \\to指数分布 / 伽马分布
  • 临床测量数据(如牙齿生长、血压) \\to正态性检验、数据变换
  • 疾病因果关系分析 \\to有向无环图(DAG)

> 核心主线:**4种离散分布 → 分布之间的关系 → 独立性(边际独立/条件独立/DAG)→ 正态性检验与可视化**


一、4个核心离散分布(重中之重,这节课所有题目都在这里)

1. Bernoulli 伯努利分布

  • **场景**:**单次试验,只有两种结果:成功 / 失败**

  • 例子:一次看病是否误诊;猫咪一天是否被车撞到;掷一次硬币正面与否

  • 参数:p =单次"成功"概率

  • 期望:E(X)=p,方差:Var(X)=p(1-p)

2. Binomial 二项分布 Bin(n,p)

> 题目Q1、Q2用到

  • **场景**:**固定n次独立伯努利试验,统计成功的次数**

> ✅关键词:固定试验次数 n,数成功多少次

  • 例子:600个病人,统计误诊人数;扔10次骰子,统计掷出6的次数

  • 参数:n=试验总次数;p=单次成功概率

  • 公式:

P(X=k)=\\binom{n}{k}p\^k(1-p)\^{n-k}

  • 期望:E(X)=np

  • 方差:Var(X)=np(1-p)

  • 重要性质:**n很大、p很小、np适中 → 可以用泊松近似**(Q2核心考点)

3. Poisson 泊松分布 Poi(\\lambda)

> Q2用到,二项的近似

  • **场景**:**稀有事件,单位时间/空间内发生的事件次数**

> ✅关键词:稀有事件,n大p小

  • 参数:\\lambda =单位区间内事件发生的**平均次数**

  • 近似规则:X\\sim Bin(n,p),当 n\\ge100, np\\le10,令 \\lambda=np,则 Bin(n,p)\\approx Poi(\\lambda)

  • 公式:

P(X=k)=\\frac{e\^{-\\lambda}\\lambda\^k}{k!}

  • 期望:E(X)=\\lambda

  • 方差:Var(X)=\\lambda

> 👉泊松特点:**均值=方差**,这是和二项分布最直观的区别

4. Negative Binomial 负二项分布 NB(r,p)

> Q3猫咪题目用到!

  • **场景**:**重复伯努利试验,直到观察到r次成功,统计一共做了多少次试验**

> ✅关键词:**等待r次成功,记录总试验次数**(等待时间/等待天数)

> Kitty例子:每天一次试验,等待被车撞r次(r条命全部耗尽),统计总天数

  • 参数:r=需要等待的成功次数;p=单次成功概率

  • 期望:E(X)=\\frac{r}{p}

  • 方差:Var(X)=\\frac{r(1-p)}{p\^2}

  • 几何分布是负二项特例:r=1,等待**第1次成功**

✨4个离散分布快速记忆表(强烈建议背)

| 分布 | 核心场景 | 一句话识别 |

| ---- | ---- | ---- |

| 伯努利 | 1次试验,成功与否 | 做1次,有没有成功 |

| 二项Bin | 固定n次试验,数成功次数 | n固定,数成功多少个 |

| 泊松Poi | 稀有事件发生次数,二项近似 | n很大p很小,数事件发生次数 |

| 负二项NB | 等待r次成功,记录总试验次数 | 目标r次成功,要等多少次试验 |

> 老师原话:**固定试验次数 → 二项;等待固定次数成功 → 负二项;稀有事件二项可以泊松近似**


二、线性变换的期望与方差(Q1用到,基础公式,后续所有分布通用)

若 Y=aX+b,a,b是常数

  1. E(aX+b)=aE(X)+b 👉**期望可以直接线性平移缩放**

  2. Var(aX+b)=a\^2Var(X) 👉**常数b不影响方差;方差要乘a的平方**

> Q1例子 Y=2X+1:方差只乘 2\^2=4,+1对方差没有任何贡献


三、独立性 & DAG(有向无环图,因果推断,健康数据科学高频)

1. 边际独立(Marginal independence)

不考虑任何其他变量,A的信息不会改变B的概率。

P(B\|A)=P(B)

2. 条件独立(Conditional independence)

**给定第三个变量C的前提下**,A和B互相独立。

P(B\|A,C)=P(B\|C)

> ⚠️重点考点:**条件独立 ≠ 边际独立;反过来也不成立**

> 课堂例子:父母基因型边际独立;给定孩子基因型后,父母不再条件独立(对撞节点collider)

3. DAG 有向无环图 Directed Acyclic Graph

  • 定义:所有边带箭头(有方向),**图里不能有环**,不能有无向边

  • 用途:**因果图,刻画数据生成过程**,健康流行病学、因果推断必用

  • 看图判断独立性:核心是d-separation(d分离),用来识别图里哪些变量条件独立


四、连续分布:指数分布 & 伽马分布

  • **指数分布 Exponential**:连续版本的几何分布。等待**第一次事件发生**的连续时间(不是天数这种离散试验,是连续时间)

  • **伽马分布 Gamma**:连续版本负二项分布。等待**r次事件发生**的连续时间;等于r个独立指数变量之和

> 记忆:离散等待→几何/负二项;连续等待→指数/伽马


五、正态分布 & 正态性检验(医学统计超级常用)

正态分布 Normal

  • 特点:钟形、对称;医学很多指标近似正态(血压、身高)

  • 现实:**真实数据几乎不会完美正态,大多只是近似正态**;不满足时可以尝试数据变换(对数变换等),但**变换不一定有用,需要验证**

正态性评估(老师重点强调:不要只看p值!可视化优先)

  1. **直方图Histogram**:看是否钟形对称

  2. **正态QQ图 Q-Q plot**:如果数据接近正态,点大致贴在一条直线上

  3. **箱线图Boxplot**:看对称性、离群值outlier

正态性检验(统计假设检验)

  1. Shapiro-Wilk 检验(Shapiro检验)

  2. Anderson-Darling 检验

> ⚠️老师提醒:**小样本下检验结果不可靠!优先看图,不要只依赖p值**

离群值 outlier

偏离主体数据的极端值。

> 重点:**不能随便删离群值!** 是否删除/变换,必须结合医学/研究背景谨慎判断。

数据变换

例如对数变换log-transformation,目的是把偏态数据拉近似正态。

> 重要提醒:**变换不一定能改善正态性,必须对比变换前后图形,不能一看到非正态就直接取log**


📚 你的补课学习路线(按顺序,循序渐进,适配你现在的情况)

> 你很久没碰统计,建议按这个顺序补,不要跳,每一节配R代码实操(贴合这门Practical)

  1. 【基础回顾】随机变量、期望E(X)、方差Var(X)、线性变换性质(Q1)

  2. 【4个离散分布】伯努利→二项→泊松近似→负二项(Q2 Q3核心,重中之重)

  • 重点区分:什么时候用二项,什么时候负二项(很多人在这里混淆)
  1. 【独立性】边际独立 vs 条件独立,DAG基础概念(健康数据科学特色,别的统计课不会重点讲)

  2. 【连续分布】指数、伽马

  3. 【正态分布、正态性检验、可视化QQ图/箱线图】

配套练习建议

就用课件里这3道题,吃透:

  • Q1:练期望方差线性变换

  • Q2:二项分布 + 泊松近似,R绘图

  • Q3:识别负二项分布,计算均值标准差


补充:容易踩坑的2个考点(这节课高频易错)

  1. 泊松近似:**只有二项分布在n大p小的时候才能近似**,近似后均值不变,方差从 np(1-p) 变成 \\lambda=np

  2. 负二项分布有两种定义!

  • 定义A(课件Q3用的):记录**总试验次数**(包含r次成功),E=\\frac{r}{p}

  • 定义B:记录**失败次数**(不包含r次成功),E=\\frac{r(1-p)}{p}

✅做题第一件事:看题目定义!这是负二项最容易错的地方。

如果你想要,我可以下一步:

方案A:把上面知识点压缩成一页**可直接打印的cheat sheet(公式+名词速记)**

或者

方案B:逐个模块出简单练习题+答案,用来自测巩固。你想选哪个?

相关推荐
FPGA信号处理3 天前
《随机信号分析与处理》第1章 随机变量基础:习题解答
人工智能·机器学习·概率论
金色光环4 天前
概率论笔记:连续型随机变量函数的分布与尺度变换 连续型随机变量函数的分布:定义法与公式法推导
笔记·概率论
tigershang14 天前
从工具到结构:工科数学的升阶之路
神经网络·机器学习·概率论
computersciencer18 天前
事件的六种关系之包含关系
程序人生·数学建模·数据分析·概率论
红烧code24 天前
统计学中的六大估计方法:从最大似然到核密度估计的本质理解
数学建模·概率论
啥都想学点的研究生1 个月前
一篇文章讲清楚:朴素贝叶斯
人工智能·机器学习·概率论
知识分享小能手1 个月前
深度学习学习教程,从入门到精通,概率与信息论 — 知识点详解(3)
人工智能·深度学习·学习·数据挖掘·概率论
知识分享小能手1 个月前
概理论与数理统计学习教程,从入门到精通,平稳随机过程(27)
学习·数据挖掘·概率论
知识分享小能手1 个月前
概理论与数理统计学习教程,从入门到精通,马尔可夫链(25)
学习·机器学习·概率论