马尔科夫不等式:一个快速的概率上界工具

马尔科夫不等式:一个快速的概率上界工具

背景

马尔科夫不等式是浓度不等式中最基础的一条。它的核心作用是:给一个非负随机变量的大偏差概率提供一个简单易用的上界。尽管它很"粗糙",但因为对随机变量的要求很低,具有很广泛的应用场景。

核心思想

设 X X X 是一个非负随机变量(即 X ≥ 0 X \geq 0 X≥0 ),它的均值是 E X \mathbb{E}X EX 。假设你想知道 X X X 的值超过某个阈值 t > 0 t > 0 t>0 的概率,即:

P ( X ≥ t ) \mathbb{P}(X \geq t) P(X≥t)

直觉上来说,如果 X X X 的期望值很小,那么它偏离期望值很多(大于 t t t )的概率自然会受到限制。马尔科夫不等式就明确地把这种直觉量化为:
P ( X ≥ t ) ≤ E X t . \mathbb{P}(X \geq t) \leq \frac{\mathbb{E}X}{t}. P(X≥t)≤tEX.

这个公式的含义非常清楚:如果随机变量的均值小,超过某个阈值的概率就会相应变小。


推导过程

为了直观解释马尔科夫不等式,我们可以通过定义一个辅助随机变量 Y Y Y 来理解。设:
Y = { t , 如果 X ≥ t , 0 , 如果 X < t . Y = \begin{cases} t, & \text{如果 } X \geq t, \\ 0, & \text{如果 } X < t. \end{cases} Y={t,0,如果 X≥t,如果 X<t.

这个随机变量 Y Y Y 的值要么是 t t t,要么是 0 0 0,并且始终满足 Y ≤ X Y \leq X Y≤X ,因为 Y = t Y = t Y=t 的时候 t ≤ X t \leq X t≤X 。

图中展示了随机变量 Y Y Y 的定义。蓝色虚线表示 X X X,橙色曲线表示 Y Y Y 的取值。

  • 当 X ≥ t X \geq t X≥t 时, Y = t Y = t Y=t,这一部分用橙色填充区域表示。
  • 当 X < t X < t X<t 时, Y = 0 Y = 0 Y=0,这一部分用绿色填充区域表示。

红色虚线表示阈值 t t t。可以直观地看到, Y Y Y 的取值始终不超过 X X X,满足 Y ≤ X Y \leq X Y≤X 的条件

根据 Y Y Y 的定义,我们可以计算它的期望值:
E Y = E t ⋅ 1 ( X ≥ t ) = t ⋅ P ( X ≥ t ) . \mathbb{E}Y = \mathbb{E}t \\cdot \\mathbf{1}(X \\geq t) = t \cdot \mathbb{P}(X \geq t). EY=Et⋅1(X≥t)=t⋅P(X≥t).

由于 Y ≤ X Y \leq X Y≤X ,根据期望的单调性,有:
E Y ≤ E X . \mathbb{E}Y \leq \mathbb{E}X. EY≤EX.

代入 E Y = t ⋅ P ( X ≥ t ) \mathbb{E}Y = t \cdot \mathbb{P}(X \geq t) EY=t⋅P(X≥t) ,可以得到:
t ⋅ P ( X ≥ t ) ≤ E X . t \cdot \mathbb{P}(X \geq t) \leq \mathbb{E}X. t⋅P(X≥t)≤EX.

两边同时除以 t > 0 t > 0 t>0 ,我们就得到了马尔科夫不等式:
P ( X ≥ t ) ≤ E X t . \mathbb{P}(X \geq t) \leq \frac{\mathbb{E}X}{t}. P(X≥t)≤tEX.


例子:投资收益的概率估算

假设你投资一个项目 X X X,它的年平均收益是 5 % 5\% 5%(即 E X = 0.05 \mathbb{E}X = 0.05 EX=0.05 )。你想知道,收益超过 50 % 50\% 50%(即 t = 0.5 t = 0.5 t=0.5 )的概率有多大。

根据马尔科夫不等式:
P ( X ≥ 0.5 ) ≤ E X t = 0.05 0.5 = 0.1. \mathbb{P}(X \geq 0.5) \leq \frac{\mathbb{E}X}{t} = \frac{0.05}{0.5} = 0.1. P(X≥0.5)≤tEX=0.50.05=0.1.

也就是说,收益超过 50 % 50\% 50% 的概率不会超过 10 % 10\% 10%。


特点与不足

优点
  1. 简单直观:只需要随机变量的期望值,无需其他参数。
  2. 通用性强:适用于所有非负随机变量。
缺点
  1. 界限松弛:实际概率可能远小于上界。例如,如果随机变量的分布有更多结构信息(如方差或独立性),我们可以得到更紧的概率界限。

小结

马尔科夫不等式是一种"粗粒度"的工具,用最少的信息(均值)给出了概率的一个上界。它适合于初步的概率分析,但如果想要更精确地描述随机变量的偏差行为,我们可以进一步利用 切比雪夫不等式,它通过引入方差让界限更加紧密。

在下一部分中,我们将探索切比雪夫不等式,并看到如何通过方差改进概率估计。

相关推荐
蜜桃味女焊匠人2 分钟前
气保焊怎样改造,稳定达成40%-60%节气降耗效果?
人工智能·经验分享·其他·机器人
Ai_easygo26 分钟前
多Agent协作与A2A协议——CrewAI + LangGraph搭建AI协作团队
人工智能
HIT_Weston33 分钟前
151、【Agent】【OpenCode】启动分析(CLI 命令注册)
人工智能·agent·opencode
笑小枫38 分钟前
用 Claude Code 推翻重写笑小枫网站
java·人工智能·spring boot·ai编程
audyxiao0011 小时前
人工智能顶会AAAI 2026论文分享|SlideBot:用于生成信息丰富、可靠、多模态幻灯片的多智能体框架
人工智能·大模型·aaai·智能体·幻灯片
用户938515635071 小时前
Workflow 与 Agent 之争:确定性执行与智能探索的深度剖析
人工智能
阿里云大数据AI技术1 小时前
阿里云 EMR Serverless StarRocks(Stella 2.2.0) 发布:内表与湖表同时支持向量、全文与 AI Function,一条 SQL 完成多模态检索
人工智能
格林威1 小时前
工业相机Chunk功能全解析:图像嵌入时间戳、编码器元数据(附堡盟C#代码)
开发语言·人工智能·数码相机·计算机视觉·c#·视觉检测·工业相机
怪奇云呼军1 小时前
闪电智能Voice Agent:ASR 首字延迟和最终识别延迟怎么测?t0-t3 埋点实战
人工智能·科技·ai·语音识别
冬哥聊AI1 小时前
百万行代码里跑Claude Code?三面这题80%的人答不上来
人工智能