Scikit-Learn线性回归(三)

Scikit-Learn线性回归三:综合实践

1、线性回归理论回顾

Scikit-Learn线性回归(一)Scikit-Learn线性回归(二) 中,我们详细介绍了线性回归的概念、原理和推导,模型评估与数据预处理,详解了Scikit-Learn线性回归模型以及多项式回归的基本使用

本文将通过美国南瓜价格数据集从数据预处理到模型选择、训练,再到曲线拟合、预测、模型评估,从简单线性回归到多项式回归再到多元线性回归模型,全方位多角度针对Scikit-Learn线性回归进行综合实践。这些不同的模型将使我们能够根据不同的输入数据预测南瓜价格

本文使用的南瓜数据集属于公共数据。是从美国农业部分发的特种作物终端市场标准报告中提取的原始数据,它来源于美国农业部网站,可以单独下载每个城市的数据。为了方便起见,我们的数据已经是多个城市拼接好的数据集

南瓜数据集下载:预留

下面我们再简单回顾一下线性回归的一些理论

机器学习的真正力量来自于训练模型。机器学习模型通过历史数据(先验知识)进行训练以自动捕获(寻找)数据间的依赖关系(规律),并通过此规律预测新的结果

线性回归包括简单线性回归(一元线性回归)、多项式回归、多元线性回归。简单线性回归可以看作是次数和特征数量为1的多元线性回归;多项式回归也可以转化为多元线性回归

我们已经知道,线性回归的目标是通过大量训练数据(历史数据)得到一个能反映自变量与因变量关系的回归模型(拟合曲线),进而根据回归拟合曲线预测新数据点(测试数据)的目标标签值

最小二乘回归就是绘制回归线的常用方法。最小二乘法(Least Squares)是一种数学理论。它通过最小化误差的平方和寻找数据的最佳匹配函数。利用最小二乘法可以方便地求得未知的线性函数,并使得线性函数拟合的数据与实际数据之间误差的平方和为最小。最小二乘法还可用于曲线拟合。其核心就是保证所有数据偏差的平方和最小

最小二乘回归线也称为最佳拟合线:Y=ωX+b,X是自变量,Y是因变量,直线的斜率是ω,也称权重或回归系数;b是Y的截距,也称常数项系数

因为回归分类是有训练的机器学习,因此我们训练的数据中已经包括了特征变量X与预测标签Y,因此基于最小二乘回归模型需要求解的参数只有ω与b。因此,训练此模型的流程就可以分为:计算ω和b(得到回归模型)、测试评估模型

随着特征变量的增多,我们需要计算的ω(回归系数或斜率)也增多,截距(常量b)则始终只有一个

2、数据预处理与问题提出

3、简单线性回归实践

4、多项式回归实践

5、多元线性回归实践

相关推荐
爱笑的眼睛114 小时前
超越MSE与交叉熵:深度解析损失函数的动态本质与高阶设计
java·人工智能·python·ai
Rose sait5 小时前
【环境配置】Linux配置虚拟环境pytorch
linux·人工智能·python
过期动态6 小时前
JDBC高级篇:优化、封装与事务全流程指南
android·java·开发语言·数据库·python·mysql
一世琉璃白_Y6 小时前
pg配置国内数据源安装
linux·python·postgresql·centos
liwulin05066 小时前
【PYTHON】COCO数据集中的物品ID
开发语言·python
小鸡吃米…6 小时前
Python - XML 处理
xml·开发语言·python·开源
我赵帅的飞起6 小时前
python国密SM4加解密
python·sm4加解密·国密sm4加解密
yaoh.wang7 小时前
力扣(LeetCode) 1: 两数之和 - 解法思路
python·程序人生·算法·leetcode·面试·跳槽·哈希算法
liwulin05067 小时前
【PYTHON-YOLOV8N】关于YOLO的推理训练图片的尺寸
开发语言·python·yolo
我送炭你添花8 小时前
Pelco KBD300A 模拟器:04+1.Python 打包详解:历史、发展与多种方式对比
python·测试工具·运维开发