一、 题目背景
当 XXX 是连续型随机变量时,设 XXX 的概率密度函数为 fX(x)f_X(x)fX(x),显然一般 YYY 也是连续型随机变量,记其概率密度为 fY(y)f_Y(y)fY(y),则常用两种方法来计算:
(1) 公式法 :设 y=g(x)y = g(x)y=g(x) 是单调函数,导数不为0的可导函数,h(y)h(y)h(y) 为它的反函数,则
fY(y)=∣h′(y)∣fX(h(y)),α<y<βf_Y(y) = |h'(y)| f_X(h(y)), \quad \alpha < y < \betafY(y)=∣h′(y)∣fX(h(y)),α<y<β
其中 (α,β)(\alpha, \beta)(α,β) 是函数 g(x)g(x)g(x) 在 xxx 可能取值区间上的值域。其他情况 fY(y)=0f_Y(y) = 0fY(y)=0。
(2) 定义法 :先求 YYY 的分布函数 FY(y)F_Y(y)FY(y)。
FY(y)=P(Y≤y)=P(g(X)≤y)=∫g(x)≤yfX(x)dxF_Y(y) = P(Y \le y) = P(g(X) \le y) = \int_{g(x) \le y} f_X(x) dxFY(y)=P(Y≤y)=P(g(X)≤y)=∫g(x)≤yfX(x)dx
然后 fY(y)=FY′(y)f_Y(y) = F_Y'(y)fY(y)=FY′(y)。
二、 推导过程:公式法是怎么来的?
公式法本质上是定义法在特定条件下的"快捷方式"。下面分两种情况来推导:
情况 1:g(x)g(x)g(x) 单调递增
设 y=g(x)y = g(x)y=g(x) 单调递增,其反函数为 x=h(y)x = h(y)x=h(y)。由于 ggg 单调递增,事件 g(X)≤yg(X) \le yg(X)≤y 等价于 X≤h(y)X \le h(y)X≤h(y)。代入定义法:
FY(y)=P(g(X)≤y)=P(X≤h(y))=FX(h(y))F_Y(y) = P(g(X) \le y) = P(X \le h(y)) = F_X(h(y))FY(y)=P(g(X)≤y)=P(X≤h(y))=FX(h(y))
两边对 yyy 求导,依据复合函数求导法则(链式法则):
fY(y)=fX(h(y))⋅h′(y)f_Y(y) = f_X(h(y)) \cdot h'(y)fY(y)=fX(h(y))⋅h′(y)
因为 g(x)g(x)g(x) 递增,h(y)h(y)h(y) 也随之递增,所以 h′(y)>0h'(y) > 0h′(y)>0,此时绝对值可以省略。
情况 2:g(x)g(x)g(x) 单调递减
设 y=g(x)y = g(x)y=g(x) 单调递减,反函数依然为 x=h(y)x = h(y)x=h(y)。由于 ggg 单调递减,事件 g(X)≤yg(X) \le yg(X)≤y 等价于 X≥h(y)X \ge h(y)X≥h(y)。代入定义法:
FY(y)=P(g(X)≤y)=P(X≥h(y))=1−FX(h(y))F_Y(y) = P(g(X) \le y) = P(X \ge h(y)) = 1 - F_X(h(y))FY(y)=P(g(X)≤y)=P(X≥h(y))=1−FX(h(y))
两边对 yyy 求导:
fY(y)=−fX(h(y))⋅h′(y)f_Y(y) = -f_X(h(y)) \cdot h'(y)fY(y)=−fX(h(y))⋅h′(y)
因为 g(x)g(x)g(x) 递减,h(y)h(y)h(y) 也随之递减,所以 h′(y)<0h'(y) < 0h′(y)<0。为保证概率密度 fY(y)f_Y(y)fY(y) 恒非负,需要加上负号,或直接写成绝对值形式:
fY(y)=fX(h(y))⋅∣h′(y)∣f_Y(y) = f_X(h(y)) \cdot |h'(y)|fY(y)=fX(h(y))⋅∣h′(y)∣
合并结论
将递增与递减两种情况合并,即可得到公式法中的结论:
fY(y)=∣h′(y)∣fX(h(y))f_Y(y) = |h'(y)| f_X(h(y))fY(y)=∣h′(y)∣fX(h(y))
三、定义法的推导过程
定义法是最根本的方法,它的推导逻辑非常直接。
-
求分布函数 FY(y)F_Y(y)FY(y)
根据分布函数的定义:
FY(y)=P(Y≤y)F_Y(y) = P(Y \le y)FY(y)=P(Y≤y)
因为Y=g(X)Y = g(X)Y=g(X),代入得:
FY(y)=P(g(X)≤y)F_Y(y) = P(g(X) \le y)FY(y)=P(g(X)≤y)
这就转换成了求随机变量 (X) 落在某个区域内的概率。对于连续型随机变量 (X),这个概率就是密度函数 fX(x)f_X(x)fX(x) 在区域 g(x)≤yg(x) \le yg(x)≤y 上的积分:
FY(y)=∫g(x)≤yfX(x)dxF_Y(y) = \int_{g(x) \le y} f_X(x) dxFY(y)=∫g(x)≤yfX(x)dx
这就是填写的公式:∫g(x)≤yfX(x)dx\int_{g(x) \le y} f_X(x) dx∫g(x)≤yfX(x)dx。
-
求概率密度 fY(y)f_Y(y)fY(y)
对分布函数求导即可得到密度函数:
fY(y)=ddyFY(y)=FY′(y)f_Y(y) = \frac{d}{dy} F_Y(y) = F_Y'(y)fY(y)=dydFY(y)=FY′(y)
总结:定义法的核心就是"先求CDF,再求导得PDF"。它不要求 g(x)g(x)g(x)单调,即使 g(x)g(x)g(x)是分段函数也可以做,只是积分区域需要分段讨论。
四、 我的疑问
你的直觉是:"求 yyy 发生的概率,就是求当 g(x)=yg(x)=yg(x)=y 时 xxx 发生的概率,所以 fY(y)=fX(h(y))f_Y(y) = f_X(h(y))fY(y)=fX(h(y))。"
五、 回答:为什么不能直接相等?
直觉非常自然,但这里有一个连续型随机变量最容易踩的坑:我把"概率"和"概率密度"混为一谈了。
1. 核心原因:连续型变量的单点概率为 0
对于连续型随机变量,P(X=x)=0P(X = x) = 0P(X=x)=0,P(Y=y)=0P(Y = y) = 0P(Y=y)=0。所以你不能说"yyy 发生的概率等于 xxx 发生的概率",因为它们都是 0。我们研究的不是单点的概率,而是概率密度(单位长度上的概率)。
2. 直观理解:概率守恒与"拉伸/压缩"
想象 XXX 轴上有一段极小的区间 x,x+dxx, x+dxx,x+dx,它的概率是 fX(x)dxf_X(x)dxfX(x)dx。
通过 y=g(x)y = g(x)y=g(x) 映射到 YYY 轴上,对应了一段极小的区间 y,y+dyy, y+dyy,y+dy,它的概率是 fY(y)dyf_Y(y)dyfY(y)dy。
因为这是同一个事件映射过去的,所以这两块概率必须相等 (概率守恒):
fX(x)dx=fY(y)dyf_X(x)dx = f_Y(y)dyfX(x)dx=fY(y)dy
如果 y=g(x)y = g(x)y=g(x) 把区间拉伸了(比如 y=2xy = 2xy=2x),那么 dy=2dxdy = 2dxdy=2dx。为了保持等式成立,fY(y)f_Y(y)fY(y) 必须变成原来的一半:
fY(y)=fX(x)dxdyf_Y(y) = f_X(x) \frac{dx}{dy}fY(y)=fX(x)dydx
这里的 dxdy\frac{dx}{dy}dydx 就是反函数 x=h(y)x = h(y)x=h(y) 的导数 h′(y)h'(y)h′(y)。因为导数可能为负,而概率密度必须非负,所以加上绝对值 ∣h′(y)∣|h'(y)|∣h′(y)∣。
3. 举个反例(如果不乘 ∣h′(y)∣|h'(y)|∣h′(y)∣ 会发生什么)
假设 XXX 服从 0,10, 10,1 上的均匀分布,即 fX(x)=1,0<x<1f_X(x) = 1, 0 < x < 1fX(x)=1,0<x<1。
现在令 Y=2XY = 2XY=2X。显然 YYY 的取值范围是 0,20, 20,2。
-
如果用我的直觉(不乘导数) :
h(y)=y2h(y) = \frac{y}{2}h(y)=2y,直接代入得 fY(y)=fX(h(y))=1f_Y(y) = f_X(h(y)) = 1fY(y)=fX(h(y))=1,范围是 0<y<20 < y < 20<y<2。
此时对 fY(y)f_Y(y)fY(y) 在 0,20, 20,2 上积分:∫021 dy=2\int_0^2 1 \, dy = 2∫021dy=2。
概率密度积分等于 2!这违背了概率公理(总概率必须等于 1)。
-
如果用正确的公式法 :
h(y)=y2h(y) = \frac{y}{2}h(y)=2y,求导得 h′(y)=12h'(y) = \frac{1}{2}h′(y)=21。
代入公式:fY(y)=∣h′(y)∣fX(h(y))=12×1=12f_Y(y) = |h'(y)| f_X(h(y)) = \frac{1}{2} \times 1 = \frac{1}{2}fY(y)=∣h′(y)∣fX(h(y))=21×1=21。
此时再积分:∫0212 dy=1\int_0^2 \frac{1}{2} \, dy = 1∫0221dy=1。
完美,总概率为 1。
4. 数学本质:链式法则
从分布函数看,FY(y)=FX(h(y))F_Y(y) = F_X(h(y))FY(y)=FX(h(y))。两边对 yyy 求导,根据链式法则:fY(y)=FX′(h(y))⋅h′(y)=fX(h(y))⋅h′(y)f_Y(y) = F_X'(h(y)) \cdot h'(y) = f_X(h(y)) \cdot h'(y)fY(y)=FX′(h(y))⋅h′(y)=fX(h(y))⋅h′(y)。
我们再回到最根本的推导,看看导数是怎么冒出来的。
假设 y=g(x)y = g(x)y=g(x) 单调递增,反函数 x=h(y)x = h(y)x=h(y)。
求 YYY 的分布函数:
FY(y)=P(Y≤y)=P(g(X)≤y)F_Y(y) = P(Y \le y) = P(g(X) \le y)FY(y)=P(Y≤y)=P(g(X)≤y)
因为ggg 递增,所以 g(X)≤yg(X) \le yg(X)≤y等价于 X≤h(y)X \le h(y)X≤h(y):
FY(y)=P(X≤h(y))=FX(h(y))F_Y(y) = P(X \le h(y)) = F_X(h(y))FY(y)=P(X≤h(y))=FX(h(y))
现在两边对 (y) 求导,得到概率密度:
fY(y)=ddyFY(y)=ddyFX(h(y))f_Y(y) = \frac{d}{dy} F_Y(y) = \frac{d}{dy} F_X(h(y))fY(y)=dydFY(y)=dydFX(h(y))
根据复合函数求导法则(链式法则):
fY(y)=FX′(h(y))⋅h′(y)f_Y(y) = F_X'(h(y)) \cdot h'(y)fY(y)=FX′(h(y))⋅h′(y)
因为 FX′(x)=fX(x)F_X'(x) = f_X(x)FX′(x)=fX(x),所以:
fY(y)=fX(h(y))⋅h′(y)f_Y(y) = f_X(h(y)) \cdot h'(y)fY(y)=fX(h(y))⋅h′(y)
如果是单调递减,求导会多出一个负号,所以最后统一写成绝对值 (|h'(y)|)。
你看,导数 h′(y)h'(y)h′(y)是复合函数求导时"强制"带出来的,它代表了变量代换时的尺度变换比例。
5. 一维到二维的推广(雅可比行列式)
现在学的是 Y=g(X)Y = g(X)Y=g(X),是一维到一维的映射。
等到学多维随机变量时,比如 (Y1,Y2)=g(X1,X2)(Y_1, Y_2) = g(X_1, X_2)(Y1,Y2)=g(X1,X2),这个∣h′(y)∣|h'(y)|∣h′(y)∣ 就会升级成雅可比行列式 (Jacobian determinant) 的绝对值 ∣J∣|J|∣J∣。本质思想完全一样:概率质量守恒,面积/体积变换必须乘上伸缩因子。
总结一句话:
变量变换时,密度函数不仅要平移到新的位置,还要根据伸缩比例调整高度,以保证总概率(面积)为 1。加上这个 ∣h′(y)∣|h'(y)|∣h′(y)∣,理解就完美了。