建模步骤 3 :数据探索(EDA) — 1、初步了解数据:自定义函数

👏

1、自定义函数概述
--(1)title()
--(2)df_table(df)
--(3)df_style(df)
--(4)des_table(df)
--(5)des_chart(df)

1、自定义函数概述

尝试自己创建一个名为 my_package 模块,该模块中存放一些自定义的数据分析函数,可以重复调用。如下图在当前目录下,创建一个名为 my_package 的文件夹,在该文件夹下面创建一个名为 __pycache__ 的子文件夹;然后创建两个 python 模块(View.pyDEA.py);接着在这两个模块中定义函数。

👏

具体函数如下:

函数 解释 存放模块
title('') 显示一个标题 View.py
df_table(df) 用表格的方式展示数据框 View.py
df_style(df) 为数据框添加边框或热力图 View.py
des_table(df) 数据框概要表 DEA.py
des_chart(df) 数据框每个特征分布可视化 DEA.py
......

上表是我在初步了解数据过程中的几个自定义的函数,主要是将上一篇文章中的常用函数组合在一起使用。

(1)title()

custom 复制代码
# 导入库里面的模块,然后调用函数
from my_package import View

View.title('Good')
View.title('Good', style="#512b58")
View.title('Good', style="bold #fe346e")
View.title('Good', count=80)

(2)df_table(df)

custom 复制代码
import numpy as np
import pandas as pd

df = pd.DataFrame(
    np.random.randn(4, 6)
    , columns=list("ABCDEF")
    )

df
custom 复制代码
from my_package import View

# 参数 tablefmt 参考 tabulate 库
# 可能对中文支持不是很友好
print('\n')
View.df_table(df)
View.df_table(df, tablefmt="psql")
View.df_table(df, tablefmt="rounded_grid")

(3)df_style(df)

custom 复制代码
from my_package import View
View.df_style(df, background=True)
custom 复制代码
from my_package import View
View.df_style(df, background=False)

(4)des_table(df)

custom 复制代码
import os
file = os.path.join('datasets','titanic','train.csv')


import pandas as pd
df = pd.read_csv(file)
df.head()
custom 复制代码
from my_package import DEA

DEA.des_table(df)

(5)des_chart(df)

custom 复制代码
from my_package import DEA

DEA.des_chart(df)

👏

总结: 以上是我在初步了解数据过程中的几个自定义的函数,主要是将上一篇文章中的常用函数组合在一起使用。并且,尝试创建了一个简单的库来存储,方便重复执行。更多的 pandas 函数可以查看 pandas 函数

|--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| #### Python 端到端的机器学习 AI入门:详细介绍机器学习建模过程,步骤细节;以及人工智能的分阶段学习线路图。 🚀 点击查看 |

|------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| #### 统计学习\机器学习\深度学习算法 介绍有关统计学习,机器学习,深度学习的算法。 🚀 点击查看 |

|----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| #### SQL + Pandas 练习题 SQL 练习题目,使用 Pandas 库实现,使用 Sqlalchemy 库查看 SQL 代码血缘关系。 🚀 点击查看 |

|-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| #### Python 数据可视化 介绍了有关 Matplotlib,Seaborn,Plotly 几个 Python 绘图库的简单使用。 🚀 点击查看 |

相关推荐
薛定谔的悦3 小时前
储能 EMS 的功率策略:从一块电表到一次逆流的 200 毫秒
大数据·linux·能源·储能·bms
2601_962218476 小时前
万象生鲜系统区块链溯源技术帮助生鲜企业搭建食品安全数字化体系
大数据·运维·微服务·云原生·架构
DeepVisionary6 小时前
谷歌 Gemini Omni 1.1 Flash 正式发布:4K 视频、40 秒场景延伸,视频生成进入按 token 计费时代
python·自动化
ZGIAI6 小时前
ZGI Workflow:条件分支走错时先查哪一层
人工智能·架构
X54先生(人文科技)6 小时前
《元创力》纪实录 · 桥段 《窑变纪元:一份来自星历2227年的深空考古笔记》
人工智能·开源·ai写作·零知识证明
ZGIAI6 小时前
ZGI 文件产物:生成报告后怎样交付
人工智能·架构
东方-教育技术博主6 小时前
自动编码在教育场景中的重要性:一项基于多源证据的深度综述
大数据·人工智能
骥龙6 小时前
模块二:Ollama本地模型部署与OpenCode代理配置
人工智能
阡之尘埃6 小时前
Python数据分析案例85——大模型微调全流程(SFT的LoRA微调)
人工智能·python·深度学习·语言模型·llm·微调·千问
Regentsoft丽晶软件6 小时前
品牌方新品上市促销政策无法实时同步经销商,有没有支持总部-经销商-终端一站式的分销解决方案?
人工智能·经验分享·数据库架构