机器学习基本篇

1 基本概念

机器学习,分为 回归,分类,聚类,降维

有监督学习 回归,分类, 有特征,有标签,进行训练,然后对新数据进行预测

无监督学习 聚类,降维。

题目越多,训练越好,

2 基本流程

数据预处理------ 模型训练与评估

可以优化为 获取数据------数据预处理------EDA 分析------特征工程------模型训练------可解释性分析

2.0 数据获取

利用 kaggle, 天池 等平台的 开源 数据,

2.1 预处理

目的:

  1. 让数据更符合逻辑
  2. 让数据更容易计算
    借助函数实现变换 or 运算
认识数据

常用 pandas 包,是 python 中一个强大的数据分析和处理库。

其可以

  1. 数据处理,对数据进行 清洗,转换,合并,分组等操作,处理缺失的和重复的数据。
  2. 数据读取和写入, 如 CSV 格式,excel, JSON, SQL 等
  3. 对数据进行时间序列分析,移动窗口统计等操作

** 部分常用 API **

import pandas as pd

读取数据

df = pd.read_csv('data.csv')

查看数据

df.head()

显示数据集形状. (几行几列)

df.shape

查看数据集信息。 (特征的种类和标签)

Data.info

空值的数量

mean 均值

std 标准差

min 最小值

25% 第 25 百分位数

max 最大值

unique 唯一值数量

top 出现频率最高的值

freq 最高频率出现次数

显示数据集的统计特征,

df.decribe()

相关推荐
木非哲11 分钟前
机器学习--随机森林--从一棵树的直觉到一片林的哲学
人工智能·随机森林·机器学习
A尘埃1 小时前
保险公司车险理赔欺诈检测(随机森林)
算法·随机森林·机器学习
小瑞瑞acd6 小时前
【小瑞瑞精讲】卷积神经网络(CNN):从入门到精通,计算机如何“看”懂世界?
人工智能·python·深度学习·神经网络·机器学习
民乐团扒谱机6 小时前
【微实验】机器学习之集成学习 GBDT和XGBoost 附 matlab仿真代码 复制即可运行
人工智能·机器学习·matlab·集成学习·xgboost·gbdt·梯度提升树
Σίσυφος19007 小时前
PCL法向量估计 之 RANSAC 平面估计法向量
算法·机器学习·平面
rcc86287 小时前
AI应用核心技能:从入门到精通的实战指南
人工智能·机器学习
霖大侠7 小时前
【无标题】
人工智能·深度学习·机器学习
B站_计算机毕业设计之家8 小时前
猫眼电影数据可视化与智能分析平台 | Python Flask框架 Echarts 推荐算法 爬虫 大数据 毕业设计源码
python·机器学习·信息可视化·flask·毕业设计·echarts·推荐算法
deephub8 小时前
机器学习特征工程:分类变量的数值化处理方法
python·机器学习·特征工程·分类变量
墩墩冰8 小时前
计算机图形学 实现直线段的反走样
人工智能·机器学习