深度学习与神经网络 | 邱锡鹏 | 第七章学习笔记 网络优化与正则化

7.网络优化与正则化

文章目录

  • 7.网络优化与正则化
    • 7.1神经网络优化的特点
    • [7.2 优化算法改进](#7.2 优化算法改进)
    • [7.3 动态学习率](#7.3 动态学习率)
    • [7.4 梯度方向优化](#7.4 梯度方向优化)
    • [7.5 参数初始化](#7.5 参数初始化)
    • [7.6 数据预处理](#7.6 数据预处理)
    • [7.7 逐层规范化](#7.7 逐层规范化)
    • [7.8 超参数优化](#7.8 超参数优化)
    • [7.9 正则化](#7.9 正则化)
    • [7.10 暂退法](#7.10 暂退法)
    • [7.11 l1和l2正则化](#7.11 l1和l2正则化)
    • [7.12 数据增强](#7.12 数据增强)

7.1神经网络优化的特点

所以找个平坦最小值就好了,不一定需要全局最小值

7.2 优化算法改进

7.3 动态学习率

总体趋势还是减少的。时不时变大是为了找到更好的局部最优

7.4 梯度方向优化

效果比随机梯度要好

7.5 参数初始化

上图通常用在循环网络中

7.6 数据预处理

问题就是会对参数初始化产生一定的影响,也会对优化产生一定的影响

标准差为0的数据没啥意义,直接就扔了

7.7 逐层规范化

7.8 超参数优化

7.9 正则化

7.10 暂退法

可以提高网络的泛化能力

7.11 l1和l2正则化

7.12 数据增强

可以增强模型泛化能力

相关推荐
高洁015 小时前
孪生不止在工厂:能源、医疗与农业
人工智能·深度学习·transformer·知识图谱·tornado
日拱一卒的小田5 小时前
ZYNQ学习笔记4-ZYNQ的SD卡控制器1
笔记·学习
布吉岛的石头6 小时前
Java 程序员第 48 阶段15:Transformer 架构总览与自注意力直觉,注意力权重可视化:用 Java 打印注意力矩阵理解模型在看什么
人工智能·深度学习·transformer
拼图2098 小时前
Git常用语法
分布式·git·学习
Vcaker9 小时前
Linux学习29-kubernetes网络
学习
泡干脆面就番茄10 小时前
深度学习:PyTorch框架初识——MNIST手写数字识别
python·深度学习
richard_first11 小时前
第3章 PTQ:不用重新训练也能量化 LLM
人工智能·深度学习·语言模型·自然语言处理·transformer
萌新小码农‍11 小时前
KL散度的介绍
人工智能·深度学习·机器学习
dadaobusi12 小时前
学习:奈奎斯特
学习
面包狗AI4S13 小时前
GitHub AI4S 项目观察(2026-09-07—2026-09-13)
人工智能·深度学习·机器学习