概率论笔记:连续型随机变量函数的分布与尺度变换 连续型随机变量函数的分布:定义法与公式法推导

一、 题目背景

当 XXX 是连续型随机变量时,设 XXX 的概率密度函数为 fX(x)f_X(x)fX(x),显然一般 YYY 也是连续型随机变量,记其概率密度为 fY(y)f_Y(y)fY(y),则常用两种方法来计算:

(1) 公式法 :设 y=g(x)y = g(x)y=g(x) 是单调函数,导数不为0的可导函数,h(y)h(y)h(y) 为它的反函数,则

fY(y)=∣h′(y)∣fX(h(y)),α<y<βf_Y(y) = |h'(y)| f_X(h(y)), \quad \alpha < y < \betafY(y)=∣h′(y)∣fX(h(y)),α<y<β

其中 (α,β)(\alpha, \beta)(α,β) 是函数 g(x)g(x)g(x) 在 xxx 可能取值区间上的值域。其他情况 fY(y)=0f_Y(y) = 0fY(y)=0。

(2) 定义法 :先求 YYY 的分布函数 FY(y)F_Y(y)FY(y)。

FY(y)=P(Y≤y)=P(g(X)≤y)=∫g(x)≤yfX(x)dxF_Y(y) = P(Y \le y) = P(g(X) \le y) = \int_{g(x) \le y} f_X(x) dxFY(y)=P(Y≤y)=P(g(X)≤y)=∫g(x)≤yfX(x)dx

然后 fY(y)=FY′(y)f_Y(y) = F_Y'(y)fY(y)=FY′(y)。


二、 推导过程:公式法是怎么来的?

公式法本质上是定义法在特定条件下的"快捷方式"。下面分两种情况来推导:

情况 1:g(x)g(x)g(x) 单调递增

设 y=g(x)y = g(x)y=g(x) 单调递增,其反函数为 x=h(y)x = h(y)x=h(y)。由于 ggg 单调递增,事件 g(X)≤yg(X) \le yg(X)≤y 等价于 X≤h(y)X \le h(y)X≤h(y)。代入定义法:

FY(y)=P(g(X)≤y)=P(X≤h(y))=FX(h(y))F_Y(y) = P(g(X) \le y) = P(X \le h(y)) = F_X(h(y))FY(y)=P(g(X)≤y)=P(X≤h(y))=FX(h(y))

两边对 yyy 求导,依据复合函数求导法则(链式法则):

fY(y)=fX(h(y))⋅h′(y)f_Y(y) = f_X(h(y)) \cdot h'(y)fY(y)=fX(h(y))⋅h′(y)

因为 g(x)g(x)g(x) 递增,h(y)h(y)h(y) 也随之递增,所以 h′(y)>0h'(y) > 0h′(y)>0,此时绝对值可以省略。

情况 2:g(x)g(x)g(x) 单调递减

设 y=g(x)y = g(x)y=g(x) 单调递减,反函数依然为 x=h(y)x = h(y)x=h(y)。由于 ggg 单调递减,事件 g(X)≤yg(X) \le yg(X)≤y 等价于 X≥h(y)X \ge h(y)X≥h(y)。代入定义法:

FY(y)=P(g(X)≤y)=P(X≥h(y))=1−FX(h(y))F_Y(y) = P(g(X) \le y) = P(X \ge h(y)) = 1 - F_X(h(y))FY(y)=P(g(X)≤y)=P(X≥h(y))=1−FX(h(y))

两边对 yyy 求导:

fY(y)=−fX(h(y))⋅h′(y)f_Y(y) = -f_X(h(y)) \cdot h'(y)fY(y)=−fX(h(y))⋅h′(y)

因为 g(x)g(x)g(x) 递减,h(y)h(y)h(y) 也随之递减,所以 h′(y)<0h'(y) < 0h′(y)<0。为保证概率密度 fY(y)f_Y(y)fY(y) 恒非负,需要加上负号,或直接写成绝对值形式:

fY(y)=fX(h(y))⋅∣h′(y)∣f_Y(y) = f_X(h(y)) \cdot |h'(y)|fY(y)=fX(h(y))⋅∣h′(y)∣

合并结论

将递增与递减两种情况合并,即可得到公式法中的结论:

fY(y)=∣h′(y)∣fX(h(y))f_Y(y) = |h'(y)| f_X(h(y))fY(y)=∣h′(y)∣fX(h(y))


三、定义法的推导过程

定义法是最根本的方法,它的推导逻辑非常直接。

  1. 求分布函数 FY(y)F_Y(y)FY(y)

    根据分布函数的定义:

    FY(y)=P(Y≤y)F_Y(y) = P(Y \le y)FY(y)=P(Y≤y)

    因为Y=g(X)Y = g(X)Y=g(X),代入得:

    FY(y)=P(g(X)≤y)F_Y(y) = P(g(X) \le y)FY(y)=P(g(X)≤y)

    这就转换成了求随机变量 (X) 落在某个区域内的概率。对于连续型随机变量 (X),这个概率就是密度函数 fX(x)f_X(x)fX(x) 在区域 g(x)≤yg(x) \le yg(x)≤y 上的积分:

    FY(y)=∫g(x)≤yfX(x)dxF_Y(y) = \int_{g(x) \le y} f_X(x) dxFY(y)=∫g(x)≤yfX(x)dx

    这就是填写的公式:∫g(x)≤yfX(x)dx\int_{g(x) \le y} f_X(x) dx∫g(x)≤yfX(x)dx。

  2. 求概率密度 fY(y)f_Y(y)fY(y)

    对分布函数求导即可得到密度函数:

    fY(y)=ddyFY(y)=FY′(y)f_Y(y) = \frac{d}{dy} F_Y(y) = F_Y'(y)fY(y)=dydFY(y)=FY′(y)

总结:定义法的核心就是"先求CDF,再求导得PDF"。它不要求 g(x)g(x)g(x)单调,即使 g(x)g(x)g(x)是分段函数也可以做,只是积分区域需要分段讨论。

四、 我的疑问

你的直觉是:"求 yyy 发生的概率,就是求当 g(x)=yg(x)=yg(x)=y 时 xxx 发生的概率,所以 fY(y)=fX(h(y))f_Y(y) = f_X(h(y))fY(y)=fX(h(y))。"


五、 回答:为什么不能直接相等?

直觉非常自然,但这里有一个连续型随机变量最容易踩的坑:我把"概率"和"概率密度"混为一谈了。

1. 核心原因:连续型变量的单点概率为 0

对于连续型随机变量,P(X=x)=0P(X = x) = 0P(X=x)=0,P(Y=y)=0P(Y = y) = 0P(Y=y)=0。所以你不能说"yyy 发生的概率等于 xxx 发生的概率",因为它们都是 0。我们研究的不是单点的概率,而是概率密度(单位长度上的概率)。

2. 直观理解:概率守恒与"拉伸/压缩"

想象 XXX 轴上有一段极小的区间 x,x+dxx, x+dxx,x+dx,它的概率是 fX(x)dxf_X(x)dxfX(x)dx。

通过 y=g(x)y = g(x)y=g(x) 映射到 YYY 轴上,对应了一段极小的区间 y,y+dyy, y+dyy,y+dy,它的概率是 fY(y)dyf_Y(y)dyfY(y)dy。

因为这是同一个事件映射过去的,所以这两块概率必须相等 (概率守恒):

fX(x)dx=fY(y)dyf_X(x)dx = f_Y(y)dyfX(x)dx=fY(y)dy

如果 y=g(x)y = g(x)y=g(x) 把区间拉伸了(比如 y=2xy = 2xy=2x),那么 dy=2dxdy = 2dxdy=2dx。为了保持等式成立,fY(y)f_Y(y)fY(y) 必须变成原来的一半:

fY(y)=fX(x)dxdyf_Y(y) = f_X(x) \frac{dx}{dy}fY(y)=fX(x)dydx

这里的 dxdy\frac{dx}{dy}dydx 就是反函数 x=h(y)x = h(y)x=h(y) 的导数 h′(y)h'(y)h′(y)。因为导数可能为负,而概率密度必须非负,所以加上绝对值 ∣h′(y)∣|h'(y)|∣h′(y)∣。

3. 举个反例(如果不乘 ∣h′(y)∣|h'(y)|∣h′(y)∣ 会发生什么)

假设 XXX 服从 0,10, 10,1 上的均匀分布,即 fX(x)=1,0<x<1f_X(x) = 1, 0 < x < 1fX(x)=1,0<x<1。

现在令 Y=2XY = 2XY=2X。显然 YYY 的取值范围是 0,20, 20,2。

  • 如果用我的直觉(不乘导数) :

    h(y)=y2h(y) = \frac{y}{2}h(y)=2y,直接代入得 fY(y)=fX(h(y))=1f_Y(y) = f_X(h(y)) = 1fY(y)=fX(h(y))=1,范围是 0<y<20 < y < 20<y<2。

    此时对 fY(y)f_Y(y)fY(y) 在 0,20, 20,2 上积分:∫021 dy=2\int_0^2 1 \, dy = 2∫021dy=2。

    概率密度积分等于 2!这违背了概率公理(总概率必须等于 1)。

  • 如果用正确的公式法 :

    h(y)=y2h(y) = \frac{y}{2}h(y)=2y,求导得 h′(y)=12h'(y) = \frac{1}{2}h′(y)=21。

    代入公式:fY(y)=∣h′(y)∣fX(h(y))=12×1=12f_Y(y) = |h'(y)| f_X(h(y)) = \frac{1}{2} \times 1 = \frac{1}{2}fY(y)=∣h′(y)∣fX(h(y))=21×1=21。

    此时再积分:∫0212 dy=1\int_0^2 \frac{1}{2} \, dy = 1∫0221dy=1。

    完美,总概率为 1。

4. 数学本质:链式法则

从分布函数看,FY(y)=FX(h(y))F_Y(y) = F_X(h(y))FY(y)=FX(h(y))。两边对 yyy 求导,根据链式法则:fY(y)=FX′(h(y))⋅h′(y)=fX(h(y))⋅h′(y)f_Y(y) = F_X'(h(y)) \cdot h'(y) = f_X(h(y)) \cdot h'(y)fY(y)=FX′(h(y))⋅h′(y)=fX(h(y))⋅h′(y)。

我们再回到最根本的推导,看看导数是怎么冒出来的。

假设 y=g(x)y = g(x)y=g(x) 单调递增,反函数 x=h(y)x = h(y)x=h(y)。

求 YYY 的分布函数:

FY(y)=P(Y≤y)=P(g(X)≤y)F_Y(y) = P(Y \le y) = P(g(X) \le y)FY(y)=P(Y≤y)=P(g(X)≤y)

因为ggg 递增,所以 g(X)≤yg(X) \le yg(X)≤y等价于 X≤h(y)X \le h(y)X≤h(y):

FY(y)=P(X≤h(y))=FX(h(y))F_Y(y) = P(X \le h(y)) = F_X(h(y))FY(y)=P(X≤h(y))=FX(h(y))

现在两边对 (y) 求导,得到概率密度:

fY(y)=ddyFY(y)=ddyFX(h(y))f_Y(y) = \frac{d}{dy} F_Y(y) = \frac{d}{dy} F_X(h(y))fY(y)=dydFY(y)=dydFX(h(y))

根据复合函数求导法则(链式法则):

fY(y)=FX′(h(y))⋅h′(y)f_Y(y) = F_X'(h(y)) \cdot h'(y)fY(y)=FX′(h(y))⋅h′(y)

因为 FX′(x)=fX(x)F_X'(x) = f_X(x)FX′(x)=fX(x),所以:

fY(y)=fX(h(y))⋅h′(y)f_Y(y) = f_X(h(y)) \cdot h'(y)fY(y)=fX(h(y))⋅h′(y)

如果是单调递减,求导会多出一个负号,所以最后统一写成绝对值 (|h'(y)|)。

你看,导数 h′(y)h'(y)h′(y)是复合函数求导时"强制"带出来的,它代表了变量代换时的尺度变换比例。

5. 一维到二维的推广(雅可比行列式)

现在学的是 Y=g(X)Y = g(X)Y=g(X),是一维到一维的映射。

等到学多维随机变量时,比如 (Y1,Y2)=g(X1,X2)(Y_1, Y_2) = g(X_1, X_2)(Y1,Y2)=g(X1,X2),这个∣h′(y)∣|h'(y)|∣h′(y)∣ 就会升级成雅可比行列式 (Jacobian determinant) 的绝对值 ∣J∣|J|∣J∣。本质思想完全一样:概率质量守恒,面积/体积变换必须乘上伸缩因子。

总结一句话:

变量变换时,密度函数不仅要平移到新的位置,还要根据伸缩比例调整高度,以保证总概率(面积)为 1。加上这个 ∣h′(y)∣|h'(y)|∣h′(y)∣,理解就完美了。

相关推荐
维克兜率天2 小时前
【维克】均值回归:跌多了会涨,涨多了会跌
开发语言·笔记·python·算法·均值算法·回归·量化
zhangrelay2 小时前
ROS2 Lyrical实验5导航Nav2
linux·笔记·学习·ubuntu·机器人
yi0112 小时前
DAY 14: LeetCode 394. 字符串解码|递归和栈到底怎么处理嵌套?
数据结构·笔记·python·算法·leetcode
小刘在重生~3 小时前
CSS 零基础完整学习笔记|选择器|盒子模型|布局
css·笔记·学习
浩瀚地学3 小时前
deepagents学习打卡day07
经验分享·笔记·python·学习·agent
泰晶科技3 小时前
【智能手表晶振选型:小尺寸与低功耗如何兼得】
人工智能·笔记
Awh-3 小时前
ARM 裸机开发 DAY5 学习笔记
arm开发·笔记·学习
箓维4 小时前
线程的优缺点,与进程的关联和差异
java·服务器·笔记
江屿风4 小时前
【Linux系统】【从【收尾】缓冲区到【新开】磁盘块:一节课打通文件系统底层原理】流食般投喂
linux·运维·服务器·人工智能·笔记