(六)机器学习 - 正态数据分布

正态数据分布,也称为高斯分布(Gaussian distribution),是一种在统计学中非常重要的概率分布。它描述了自然和社会科学中许多现象的分布情况,如人的身高、体重、智商等。正态分布的图形特征是中间高、两边低,呈对称的钟形曲线,因此也被称为钟形曲线(bell curve)。

正态分布的数学表达式为:

其中,μμ 是分布的均值(mean),σσ 是分布的标准差(standard deviation),σ2σ2 是分布的方差(variance)。

正态分布具有以下特征:

  1. 对称性:正态分布的图形关于均值 μμ 对称,即分布的左侧和右侧是镜像的。

  2. 均值、中位数和众数相等:在正态分布中,均值、中位数(median)和众数(mode)是相同的,都等于 μμ。

  3. 标准差决定分布的宽度:标准差 σσ 决定了分布的宽度。标准差越大,分布越分散;标准差越小,分布越集中。

  4. 总面积为1:正态分布曲线下的总面积为1,表示所有可能结果的概率之和为1。

  5. 68-95-99.7规则:在正态分布中,约68%的数据点落在均值的一个标准差范围内(μ±σμ±σ),约95%的数据点落在均值的两个标准差范围内(μ±2σμ±2σ),约99.7%的数据点落在均值的三个标准差范围内(μ±3σμ±3σ)。

使用Python 创建一组正态数据分布:

python 复制代码
import numpy
import matplotlib.pyplot as plt

x = numpy.random.normal(5.0, 1.0, 100000)

plt.hist(x, 100)
plt.show()

结果:

直方图解释

我们使用 numpy.random.normal() 方法创建的数组(具有 100000 个值)绘制具有 100 栏的直方图。

我们指定平均值为 5.0,标准差为 1.0。

这意味着这些值应集中在 5.0 左右,并且很少与平均值偏离 1.0。

从直方图中可以看到,大多数值都在 4.0 到 6.0 之间,最高值大约是 5.0。

正态分布的这些特征使得它在统计分析中具有广泛的应用,如假设检验、置信区间的计算、回归分析等。在实际应用中,如果数据的分布接近正态分布,我们可以使用正态分布的性质来对数据进行分析和解释。

END.

相关推荐
工业机器人销售服务24 分钟前
应对频繁换模挑战:伯朗特机器人快换方案实现冲压产线“分钟级”换产
人工智能
2501_9219608525 分钟前
地图之外:对Lerchner“AI永无意识”论的系统反驳与协同本体论的重建
人工智能·重构
AI医影跨模态组学25 分钟前
Eur Radiol 温州医科大学第五附属医院等团队:开发与解释基于双能量CT的深度学习放射组学模型,用于预测颈动脉支架后新出现的脑缺血病灶
人工智能·深度学习·论文·医学·医学影像·影像组学
Bode_20021 小时前
制造企业实现产品服务化的路径
人工智能
Rubin智造社1 小时前
Claude Code开发者大会系列2|“饮鸩止渴”还是“即刻解药”?Anthropic与SpaceX的联姻内幕
大数据·数据库·人工智能·开发者大会·anthropic·claude code
AI机器学习算法1 小时前
机器学习基础知识
数据结构·人工智能·python·深度学习·算法·机器学习·ai学习路线
QQ8057806517 小时前
django基于机器学习的电商评论情感分析系统设计实现
python·机器学习·django
Sherlock Ma8 小时前
西瓜书《机器学习》全网最详细解读 第一章:绪论
人工智能·深度学习·考研·机器学习·学习方法·西瓜书·改行学it
烟锁池塘柳08 小时前
【机器学习】一文彻底搞懂正则化(Regularization)
人工智能·深度学习·机器学习
X journey8 小时前
机器学习进阶(13):支持向量机SVM
算法·机器学习·支持向量机