机器学习和深度学习-- 李宏毅(笔记与个人理解)Day 14

Day 14 Classfication (short version)

二分类的时候 用sigmoid 那不就是 logistic 回归嘛(softmax 的二分类等价)

Loss

哦 今天刚学的 ,KL散度 ,看来cross-entropy 和KL散度是等价的咯~ 我感觉我的直觉没错
这里MSE离得很远的时候会梯度消失,致使训练变得困难;

tell me WHY?

非线性激活函数:当使用非线性激活函数(如Sigmoid或Tanh)时,在输入值非常大或非常小的情况下,这些激活函数的梯度会接近于零。因此,如果在MSE损失函数的情况下,预测值与目标值之间的差异很大,经过激活函数的反向传播会产生非常小的梯度。

但是Cross Entropy 两个差距很大的时候整体乘积并不会无限大 --- 因为本质上描述的是两个概率分布的差异

相关推荐
71-3几秒前
MySQL的安装和卸载组件
笔记·学习·mysql
lisw052 分钟前
基于图像的恶意软件分类方法!
人工智能·机器学习
Alsian1 小时前
Day43 随机张量与广播机制
人工智能·深度学习·神经网络·机器学习
大写-凌祁2 小时前
[2026年03月15日] AI 深度早报
人工智能·深度学习·机器学习·计算机视觉·agi
Striver-Diligent2 小时前
您的解决方案准确吗?一种用于增强通信网络可靠性的、面向故障的性能预测方法
网络·深度学习·机器学习·网络性能估计·数字孪生网络·网络预测
高洁013 小时前
数据可视化实战:用AI工具制作专业数据分析图表
人工智能·python·深度学习·信息可视化·transformer
夏星印3 小时前
argparse解析器参数详解
经验分享·笔记·python·学习·argparse
我是大猴子4 小时前
零代码应用笔记
笔记
芯片-嵌入式5 小时前
具身智能(3):有哪些AI模型
人工智能·深度学习·机器学习
胡图图不糊涂^_^5 小时前
MySQL学习笔记——增删改查操作
数据库·笔记·增删改查