Python数据分析与可视化笔记 三 了解数据 数据分类 集中趋势 离散程度 相关性测量 数据缺失 噪声 离群点

数据分为定性数据和定量数据。

定性数据 包括两个基本层次,即定序(ordinal) 和**定义(nominal)**层次。定序变量是指该变量只是对某些特性的"多少"进行排序,但各等级之间的差别不确定。例如评价一个事物有"好"、"一般"、"不好"三个等级,但各个等级之间没有定量关系。名义变量则是指该变量只是测量某种特征出现或不出现。例如性别"男"、"女",两者之间没有任何关系,不能排序或刻度化。

定量数据 包含离散变量连续变量两个层次。离散变量是通过计数方式取得的,连续变量是一直叠加上去的。

数据分析者首先要考察每个变量的关键特征。有两个需要特别关注,即集中趋势(central tendency)离散程度(disperation)

1.集中趋势

集中趋势的主要测度是均值中位数众数。对于定量数据,其均值、中位数和众数的度量都是有效的;对于定性数据,这三个指标所能提供的信息很少。

2.离散程度

考虑变量的离散程度主要考虑变量的差别 如何。常见的测度有极差方差标准差,另外还有四分位距、平均差和变异系数等。对于定量数据,极差代表数据所处范围的大小,方差、平均差和标准差代表数据相对均值的偏离情况,但方差、标准差和平均差等都是数值的绝对量,无法规避数值度量单位的影响。变异系数修正了这个弊端,使用标准差除以均值得到一个相对量来反映数据集的变异程度或离散程度。

3.相关性测量

进行真正的数据分析之前,可以通过以下这些简单的统计方法计算变量之间的相关性。

(1)数据可视化处理

绘制成折线图或散点图,做图表相关分析

(2)计算变量间的协方差

协方差可以确定相关关系的正负,没有任何关于强度的信息。若变量测量单位发生变化,该值会发生变化,但实际变量间的相关关系没有发生变化。

(3)计算变量间的相关系数

(4)进行一元回归或多元回归分析

4.数据缺失

数据集中不含缺失变量的称完全变量,含缺失值的变量称不完全变量。

5.噪声

噪声是指被观测变量的随机误差或方差。数学形式表示为观测量(measurement)=真实数据(true data)+噪声(noise)

6.离群点

数据集中的一些数据对象,与数据的一般行为或模型不一致,这样的对象称离群点。离群点属于观测值。

相关推荐
belldeep1 小时前
python:reportlab 将多个图片合并成一个PDF文件
python·pdf·reportlab
FreakStudio4 小时前
全网最适合入门的面向对象编程教程:56 Python字符串与序列化-正则表达式和re模块应用
python·单片机·嵌入式·面向对象·电子diy
丶21364 小时前
【CUDA】【PyTorch】安装 PyTorch 与 CUDA 11.7 的详细步骤
人工智能·pytorch·python
_.Switch5 小时前
Python Web 应用中的 API 网关集成与优化
开发语言·前端·后端·python·架构·log4j
一个闪现必杀技5 小时前
Python入门--函数
开发语言·python·青少年编程·pycharm
小鹿( ﹡ˆoˆ﹡ )6 小时前
探索IP协议的神秘面纱:Python中的网络通信
python·tcp/ip·php
卷心菜小温6 小时前
【BUG】P-tuningv2微调ChatGLM2-6B时所踩的坑
python·深度学习·语言模型·nlp·bug
陈苏同学6 小时前
4. 将pycharm本地项目同步到(Linux)服务器上——深度学习·科研实践·从0到1
linux·服务器·ide·人工智能·python·深度学习·pycharm
唐家小妹6 小时前
介绍一款开源的 Modern GUI PySide6 / PyQt6的使用
python·pyqt
羊小猪~~7 小时前
深度学习项目----用LSTM模型预测股价(包含LSTM网络简介,代码数据均可下载)
pytorch·python·rnn·深度学习·机器学习·数据分析·lstm