8-13课程归纳

8.线性回归与优化算法

线性回归

预测一个连续值,训练的时候按照和真实值的区别来作为损失

梯度下降算法

其中的η被称为超参数,不能选太大,也不能选太小;wt表示模型的参数,梯度算的是损失函数变化最大的方向,所以要沿着反方向来更新参数。

9.分类

通常会对类别做一位有效编码,y=y1,y2,...yn,结果是0,1,...就说明输出的是第二类,通常以softmax 的结果,也就是置信度最高的类别那个来作为预测的结果

softmax

所做的事情就是把原始分数压缩成一组加起来为 1 的概率(百分比),而且原来分数高的,占比会更高,得到的概率也被称为置信度

交叉熵损失

用于衡量模型预测所得的概率和真实概率之间的区别,比如模型预测结果猫,狗,兔=0.65,0.24,0.11,而真实概率却是1,0,0.而交叉熵并不是像

p−q 那样直接做差,而是通过 log 来放大差距,这样预测概率离真实概率越远,损失增长得越快,而且是指数级地快

10.感知机

单层

单层感知机只能分两类(yes/no),把几个输入加权求和,如果超过某个门槛,就输出是(1);否则输出否(0),相当于在平面上画一条分割线。

多层(MLP)

大体可以分成输入层-隐藏层-输出层,输入层接收原始数据,隐藏层提取特征,输出层综合隐藏层的结论,得出最后的结果,即这份数据代表了什么。

它与单感知层一个很大的区别就是,单感知层用阶跃函数来做分类,而多感知层用非线性激活函数,其最大的作用就是可以让网络去拟合任意复杂函数,解决非线性问题,当边界可以被扭曲模拟后,进而它可以做更多的事情,比如多分类(输出用softmax),也可以进行数据压缩。

最常用的激活函数就是relu

11.模型选择

训练误差和泛化误差

训练误差:模型在训练数据上的误差

泛化误差:模型在新数据上的误差

验证数据集:通常从训练集中拿出一半左右的数据来作为验证集,用来评估模型的好坏

测试数据集:只用一次的数据集,即测试泛化误差。尤其不能在测试集上进行超参数的调整

K-则交叉验证:没有足够数据时,将数据分成k块,训练k次,每次使用第i块

来作为验证集,其他的作为训练数据集。最后取k个验证集的误差平均

欠拟合与过拟合

指的是模型容量和数据大小的关系,如果模型容量很大但是数据集很小,那就过拟合了,如果模型容量很小,数据集很大,那就欠拟合了

12.权重衰退

目的是确保模型参数不会变得过大

13.丢弃法

训练时随机暂停一部分神经元的工作,使得网络不会过分依赖某几个节点。具体的做法就是,加了 Dropout 之后,每次训练迭代时:每个神经元以概率

p(比如 0.5)被临时丢弃,输出直接置 0,被丢弃的神经元这一步不参与计算,也不更新权重。

该方法通常被用在隐藏层的输出上

相关推荐
海天一色y1 天前
模型部署的「通用语」:ONNX 转换
pytorch·onnx
Thomas.Sir1 天前
第26课:工业零部件外观缺陷检测系统:从学术Demo到产线工程的重构实战
pytorch·ai
Zguigo2 天前
【CUDA6】CUDA Stream 是什么,为什么 CUDA 是异步执行,如何正确测量 GPU 时间以及多个任务如何重叠执行
人工智能·pytorch·深度学习
论文复现现场2 天前
RTX 3090 24GB 适合科研吗?单卡论文复现、PyTorch 显存检查与 OOM 排错
人工智能·pytorch·python·深度学习·cuda·rtx3090
论文复现现场3 天前
AutoDL、算家云与公有云 GPU 怎么选?环境复现、计费与断点恢复对比
pytorch·深度学习·云计算·gpu
盘古开天16663 天前
PPO算法代码实战(三):PyTorch从零实现PPO求解CartPole
人工智能·pytorch·算法
Είναι η κοπέλα3 天前
PyTorch 安装与验证
人工智能·pytorch·python
盼小辉丶4 天前
PyTorch强化学习实战(27)——进化策略在强化学习中的应用
人工智能·pytorch·深度学习·强化学习
weixin_447195294 天前
【无标题】
pytorch·python
bigdata-余建新4 天前
week2
人工智能·pytorch·深度学习