KS检验和Lilliefors正态性检验方法

KS正态性检验方法是通过构建样本的cdf,然后和指定的均值和标准差构建的正态分布的cdf比,计算两个cdf的最大绝对距离,如果距离显著大,就说明样本来自的总体不服从正态分布,反之则服从正态分布。 整体的逻辑就是首先假定样本从正态分布中抽出来,然后和对应的正态分布一比,如果距离差异不大,说明就是从正态分布中抽出。(如果直接使用样本的均值和标准差作为总体均值和标准差,可能引入人为的相似性)

Lilliefors方法则不需要知道总体的均值和标准差,只需要样本的均值和标准差就可以了。具体步骤如下:

1.零假设是样本取自正态分布;

2.对样本进行z分数转换;

3.对样本z分数计算cdf,然后和标准正态分布的cdf进行比较,计算最大绝对距离Dreal。

其实这里等同于是先把总体标准化,然后抽样,再算z分数:

μ是总体均值,σ是总体标准差;μx尖就是样本均值,σx尖就是样本标准差。

拿这个分数构建的cdf和从标准正态分布得到的cdf进行比较,就具有可比性。但是毕竟样本的均值和标准差未必代表总体,所以这个z分数的cdf和标准正态分布的cdf肯定有一些偏差。所以就使用蒙特卡洛模拟的方法,把这种偏差引入零模型中,然后将Dreal和零模型得到的D分布进行比较。

4.然后进行蒙特卡洛模拟,每次从标准正态分布中抽样(相当于从一个假定为正态分布,并经过z转换的总体中抽样,和step3一致),然后对样本计算z分数,之后再对样本z分数计算cdf,同样和标准正态分布的cdf进行比较,计算最大绝对距离Dsurr,构建零分布。这里同样存在样本z分数的cdf和标准正态分布的cdf之间的的偏差。

5.看Dreal是否在零分布右侧0.05,如果是就说明显著,反对零假设。

基本的逻辑和KS检验一样的,都是首先假定样本从正态分布中抽出来,和对应正态分布一比,看差异。

参考资料:Lilliefors Test for Normality

相关推荐
yi0111 小时前
DAY23: LeetCode 27 → 283:从移除元素到移动零,理解快慢指针的两种思路
人工智能·笔记·python·算法·leetcode·排序算法·双指针
怕浪猫1 小时前
多 Agent 系统面试怎么答?我总结了 4 种经典架构
人工智能·算法·面试
程序员清风1 小时前
排序算法:从冒泡排序到归并排序
数据结构·算法·排序算法
万年咸鱼1 小时前
C语言内功心法篇——变量与数据类型
c语言·jvm·算法
Omics Pro2 小时前
反式感知虚拟细胞!超越线性序列
数据库·人工智能·算法·机器学习·自然语言处理
-dzk-2 小时前
【动态规划】LC 152.乘积最大子数组
算法·动态规划
积流成海2 小时前
一致性哈希原理与实现:分布式系统负载均衡
算法·负载均衡·哈希算法·哈希函数·盘子工具站
Nil20812 小时前
leetcode 118杨辉三角
算法·leetcode·职场和发展
wanderist.14 小时前
线性筛法详解:从筛质数到欧拉函数、Möbius 函数与约数函数
java·数据结构·算法