Python数据分析(空值、重复值检测删除与设置)

打开Anaconda PowerShell

cd 进入指定该文件下,输入jupyter notebook,就能在该目录下打开

python 复制代码
import numpy as np
import pandas as pd
df_obj = pd.DataFrame({"类别":["小说", "散文随笔", "青春文学","传记"],
                   "书名":[np.nan, "《皮囊》", "《旅程结束时》", "《老舍自传》"],
                    "作者":["老舍", None, "张其鑫", "老舍"]})
import pandas as pd
df=pd.read_excel('线上课程-综合测试1-MG公司2019年销售数据试题.xlsx')
df

空值检测

python 复制代码
df['成本'].isnull().value_counts()# 成本这一列是空的True与False数量统计

df['成本'].isnull().any()# 成本这列是否存在空值

重复检测


python 复制代码
df.dropna(subset='收入类别',inplace=True) # subset检查"区域"这列的重复值情况
df
相关推荐
c++之路10 小时前
C++信号处理
开发语言·c++·信号处理
m0_4954964110 小时前
mysql处理复杂SQL性能_InnoDB优化器与MyISAM差异
jvm·数据库·python
forEverPlume11 小时前
PHP怎么使用Eloquent Attribute Composition属性组合_Laravel通过组合构建复杂属性【方法】
jvm·数据库·python
Aleeeeex11 小时前
RAG 那点事:从 8 份企业文档到能用的问答系统,全过程拆给你看
人工智能·python·ai编程
2301_8092047011 小时前
mysql在docker容器中如何部署_利用docker-compose快速启动
jvm·数据库·python
Legendary_00811 小时前
LDR6500:USB‑C DRP PD协议芯片技术详解与应用实践
c语言·开发语言
2301_8009769312 小时前
正则表达式
开发语言·python·正则表达式
故事还在继续吗12 小时前
C++20关键特性
开发语言·c++·c++20
码界奇点12 小时前
基于Python的新浪微博数据爬虫系统设计与实现
数据库·爬虫·python·毕业设计·新浪微博·源代码管理