【HCIA- AI(正课)】2.2 神经网络组成

神经网络组成

  • 通用机器学习流程与部署前置知识

    • 标准流程规范
      • 流程来源:当前全行业通用的机器学习、深度学习、数据挖掘类流程,均统一衍生自早期的 PASS 数据挖掘标准流程。
      • 核心环节:标准流程固定为数据获取、数据准备、建模、模型评估、模型部署五大核心执行步骤。
    • 模型轻量化操作
      • 应用场景:部署阶段的剪枝、量化属于模型轻量化操作,核心用于计算资源有限的端侧设备运行场景。
      • 后续安排:课程核心内容覆盖完成后,将组织学员开展模型压缩实操实验,验证量化操作的实际效果。
  • 神经网络核心基础概念

    • 前向传播机制:前向传播(对应前馈神经网络)指初始化权重 W 后,输入特征 X 计算得到预测值的正向信息传递过程。
    • 损失函数核心定义
      • 核心作用:损失函数(早期称代价函数,对应英文 cost function)是量化模型拟合效果的核心量化指标。
      • 计算逻辑:主流二次代价函数计算所有样本真实值与预测值的差值平方和,避免正负误差相互抵消。
      • 优化目标:损失函数值越小代表模型权重 W 拟合效果越优,核心优化方向为寻找损失函数的最小值点。
    • 反向传播与最小二乘法
      • 反向传播逻辑:根据损失函数结果反向调整权重 W 与偏置 B,实现损失函数下降的参数更新过程。
      • 最小二乘法定位:是神经网络权重优化的核心基础算法,是当前 BP 算法、大模型训练的底层支撑。
      • 最小二乘法逻辑:通过对损失函数求导寻找最小值点,公式中加入 1/2 系数用于抵消求导产生的系数 2。
    • 激活函数核心特性
      • 核心价值:为神经网络引入非线性因素,多层网络叠加激活函数后可拟合复杂曲线,大幅提升模型拟合能力。
      • 主流类型:包含 Sigmoid、ReLU、Softmax 等多类,分别适配梯度抑制、梯度优化、多分类等不同应用场景。
      • 选型原则:不同激活函数适配不同场景,选型核心逻辑为扬长避短,结合场景需求匹配对应特性。
  • 梯度下降算法体系

  • 批量梯度下降(BGD)

    • 运行逻辑:每次更新参数时需代入全部样本数据计算负梯度方向,参数更新的稳定性为三类算法最高。

    • 优缺点:可稳定收敛至全局最优解,但计算量最大,样本量较大时参数更新速度会变得极慢。

    • 随机梯度下降(SGD)

      • 运行逻辑:每次更新参数时仅随机选取单个样本计算负梯度方向,单步参数更新的计算量为三类最小。
      • 优缺点:参数更新速度快,但对噪声敏感,易陷入局部最优解,无法保证最终收敛至全局最优。
    • 小批量梯度下降(MBGD)

      • 运行逻辑:每次更新参数时选取自定义大小的小批量样本计算负梯度方向,是前两种算法的折中方案。
      • 优缺点:综合了前两种算法的优势,更新速度快且稳定性高,是当前工业界最常用的梯度下降方案。
    • 考核提示:三类梯度下降算法的英文缩写 BGD、SGD、MBGD 为考核重点,考试将直接使用英文缩写指代。

  • 主流优化器核心特性

    • 动量优化器:通过引入动量项帮助模型跳过局部最优解,参数更新步长固定,易出现跳过全局最优解的问题。
    • Adagrad 优化器
      • 核心逻辑:采用自适应学习率,初始阶段步长较大,随迭代推进步长逐步缩小,避免跳过全局最优解。
      • 固有缺陷:分母随迭代持续累加会不断增大,易导致迭代后期步长过小,未收敛至最低点就停止更新。
    • Adam 优化器
      • 核心逻辑:综合动量优化器与 Adagrad 的优势,采用双动量系数分别控制惯性与记忆长度,实现自适应学习。
      • 应用定位:是当前工业界应用最广泛的优化器方案,可适配绝大多数复杂网络的训练需求。
    • 参数提示:学习率为模型训练的核心超参数,设置合理性直接决定模型收敛效果,需结合具体场景调整。
  • 过拟合问题与正则化方案

  • 过拟合核心定义

    • 问题本质:模型对训练数据拟合过度甚至达到 100% 准确率,泛化能力与鲁棒性极差,生产环境无法使用。
    • 典型表现:输入存在微小瑕疵的样本时,模型会出现完全不符合逻辑的错误判断,无法适配真实场景变化。
  • 正则化核心方案

    • 核心逻辑:通过在损失函数中加入惩罚项,避免模型完全拟合训练数据,从根源上抑制过拟合问题。

    • 主流分类:分为 L1 正则(取权重绝对值,可用于特征选择)与 L2 正则(取权重平方,应用范围更广)两类。

    • 其他过拟合解决方案

      • 数据层面:通过扩充数据集、数据旋转/灰度变换、添加噪声等方式丰富训练数据的多样性。
      • 训练层面:采用 Dropout 随机丢弃部分神经元、提前停止训练等方式,避免模型过度拟合训练数据。
    • 考核提示:过拟合的解决方案为核心考核点,需重点记忆 Dropout、增广数据集、L1/L2 正则三类方案。

  • 后续工作计划

    • 模型压缩实验:课程核心内容覆盖完成后,组织学员开展模型压缩实操实验,验证量化操作的实际效果。
    • 剩余知识点讲授:本次课程未完成的深度学习相关知识点,将统一安排在下一课时进行系统讲解。
相关推荐
TAN-90°-1 小时前
Deep Learning for Computer Vision——Recurrent Neural Networks
数据结构·人工智能·rnn·深度学习·神经网络·机器学习·计算机视觉
海兰1 小时前
【应用】Ubuntu 24 搭建大数据 & AI 应用云原生容器化实践
大数据·人工智能·ubuntu
ZGi.ai1 小时前
ZGI 父子分块:连接检索片段与完整上下文
人工智能·算法·知识库·企业ai·zgi·父子分块
yyywxk1 小时前
ICCV 2025 目标检测(object detection)方向上接收论文总结
人工智能·目标检测·计算机视觉
欧特克_Glodon1 小时前
OpenCV计算机视觉开发入门与实践<十七>:点运算与灰度变换概述
c++·人工智能·opencv·计算机视觉
chen_zn951 小时前
《VLA 系列》MemoryVLA++ | 感知-认知记忆 | 潜空间未来想象 | 论文与源码边界解析
人工智能·具身智能·vla
狂云歌1 小时前
AI时代,学什么,怎么学
人工智能·学习
Allen_LVyingbo1 小时前
医疗AI可扩展网格信息系统中网格计算技术的智能优化
大数据·人工智能·python·算法·机器学习·django·健康医疗