机器学习和深度学习-- 李宏毅(笔记与个人理解)Day 14

Day 14 Classfication (short version)

二分类的时候 用sigmoid 那不就是 logistic 回归嘛(softmax 的二分类等价)

Loss

哦 今天刚学的 ,KL散度 ,看来cross-entropy 和KL散度是等价的咯~ 我感觉我的直觉没错
这里MSE离得很远的时候会梯度消失,致使训练变得困难;

tell me WHY?

非线性激活函数:当使用非线性激活函数(如Sigmoid或Tanh)时,在输入值非常大或非常小的情况下,这些激活函数的梯度会接近于零。因此,如果在MSE损失函数的情况下,预测值与目标值之间的差异很大,经过激活函数的反向传播会产生非常小的梯度。

但是Cross Entropy 两个差距很大的时候整体乘积并不会无限大 --- 因为本质上描述的是两个概率分布的差异

相关推荐
redgxp6 分钟前
启发式算法WebApp实验室:从搜索策略到群体智能的能力进阶(七)
人工智能·机器学习·数据挖掘
数据门徒15 分钟前
神经网络原理 第八章:主分量分析
人工智能·深度学习·神经网络
dfsj6601119 分钟前
第十三章:Scaling Laws 与涌现能力
人工智能·深度学习
Hello_Embed22 分钟前
libmodbus 移植到 STM32H5
笔记·stm32·单片机·嵌入式硬件·嵌入式·ai编程
热心网友俣先生24 分钟前
2026年认证杯二阶段A题赛题解析
人工智能·算法·机器学习
头盔小妹30 分钟前
《计算机工程与应用》2026年投稿经验分享
人工智能·深度学习
时空无限32 分钟前
transformer自注意力机制的核心理解
人工智能·深度学习·transformer
Biocloudy34 分钟前
循环肿瘤细胞的分离和分型技术
人工智能·经验分享·笔记·其他
AI医影跨模态组学1 小时前
Eur Radiol(IF=4.7)哈尔滨医科大学肿瘤医院等团队:基于大语言模型和Gd-EOB-DTPA增强MRI的术后肝细胞癌风险分层系统
人工智能·深度学习·论文·医学·医学影像·影像组学
人工智能培训1 小时前
伦理与安全困境:在平衡中探寻前行之路
人工智能·深度学习·神经网络·机器学习·生成对抗网络