线性回归-学习笔记

线性回归

线性回归是最简单的有监督回归算法,用于建立自变量(特征 x) 和因变量(预测值 y) 之间的线性数学关系,目标是用一条直线(高维为超平面)拟合数据,实现连续值预测。

损失函数

误差 = 预测值 - 真实值

损失函数就是用来描述每个样本和其预测值之间关系的

各个样本的误差和,越小越好

公式:

正规方程

求解线性回归最小二乘的最优参数,不需要迭代,一步直接算出解析解。

正规方程的问题:

如果运算量可能内存溢出,

如果矩阵没有逆,则计算不出来

公式:

梯度下降

梯度下降是机器学习最基础、最常用的优化算法,核心目的:不断迭代更新参数,最小化损失函数(代价函数),找到函数最小值点。

更新公式:

例子:

梯度下降分类

  1. 全梯度下降:

    每次更新参数,使用全部 m 条样本计算梯度

  2. 随机梯度下降:

    每次只用 1 条随机样本更新参数

    每看完一条样本立刻更新 θ,不用等全部样本算完。

  3. 小批量梯度下降 Mini-batch GD(深度学习最常用):

    把数据集切成一小块一小块(batch,如 32/64 条)

    每次取一小批样本算梯度更新。

线性回归例子

py 复制代码
# 导包
from sklearn.linear_model import LinearRegression

# 1.加载数据集(身高/体重)
x_train = [[160],[166],[172],[174],[180]]
y_train = [56.3,60.6,65.1,68.5,75]
x_test = [[176]]

# 2.数据预处理
# 3.特征化处理

# 4.模型训练
estimator = LinearRegression()
estimator.fit(x_train, y_train)

# 显示权重(斜率)与偏置(截距)
print(f"权重:{estimator.coef_}")
print(f"偏置:{estimator.intercept_}")

# 5.模型预测
y_pred = estimator.predict(x_test)

print(y_pred)

欠拟合、过拟合、正好拟合

欠拟合

欠拟合就是训练集和测试集表现都不好

解决方法:增加模型复杂度,添加特征列

过拟合

过拟合就是训练集表现好,但是测试集表现不好

解决方法:手动筛选(减少)特征,还可以L1和L2正则化

L1和L2都是基于惩罚系统,来修改特征列的权重,惩罚系数越大,修改力度越大,对应的权重就越小

正好拟合

正好拟合就是训练集和测试集表现都好

线性回归的正则化

L1 正则:Lasso 套索回归

Lasso:几乎全部权重归零,只剩极少数有用特征

不重要权重直接 = 0,自动删除特征

L2 正则:Ridge 岭回归

Ridge:所有权重无限贴近 0,模型变成水平线,欠拟合

所有权重同步缩小,全部不为 0,保留所有特征

相关推荐
wixzjsh1 小时前
TCP通信与HTTP协议学习笔记:粘包、三次握手、四次挥手与C/S、B/S模型
学习·tcp/ip·http
ZhiMuZhiLing1 小时前
拓客软件学习成本实测方法论:从注册到出第一批名单要多久
学习·流量运营·用户运营
程序员大雄学编程2 小时前
微积分46. 无穷级数四大核心性质:从理论到实践的全方位解析
python·学习·微积分·学习工具
LuminousCPP3 小时前
数据结构-二叉树(六):BFS层序遍历与完全二叉树判断|复用链式队列 + (N_0=N_2+1) 性质证明
c语言·数据结构·笔记·算法·二叉树·宽度优先
指针常量4 小时前
【RL系列文章】难样本学习等
学习·大语言模型·rl·后训练
wuyk5554 小时前
从零吃透Modbus通信|第7章:终极工程整合(模块化架构、双模式主机从机、RTOS适配、量产级模板)
c语言·stm32·学习·架构
一条破秋裤5 小时前
STM32 学习笔记:PWM 驱动 LED 呼吸灯与舵机代码
笔记·stm32·学习
kyrie_sakura7 小时前
python学习笔记11 -- 进程和线程
笔记·python·学习
自小吃多7 小时前
PCB Editor软件差分对添加与设置笔记
笔记·嵌入式硬件
高亦真7 小时前
今天是学习嵌入式的第34天
linux·学习·算法