






总结
大模型前置技术教学分享,围绕 RNN 原理、CNN 逻辑、RNN 问题及优化方案等内容展开讲解,内容如下:
-
RNN 核心原理与学习要求
-
技术定位:RNN 是 Transformer 的技术鼻祖,核心应用场景为自然语言处理,是理解 Transformer 运行逻辑的必要前置知识
-
运行逻辑:RNN 本质为单个神经网络在不同时刻的复用,通过将上一时刻输出传递至下一时刻,实现上下文信息的留存
-
公式规则:公式中 U、V、W 为不同传播路径的权重标识,仅为区分传播逻辑便于记忆,本质均为神经网络的权重参数
- 拓展特性:RNN 公式可实现无限嵌套,当前时刻输出由当前时刻输入与所有历史时刻输入共同计算得出
- 学习要求:需对照 3D 示意图、印刷体展开图反复理解 RNN 逻辑,掌握公式及嵌套拓展逻辑,完成对应作业
-
RNN 现存核心问题
- 长文本记忆衰退问题:处理长文本时,RNN 对较早输入的内容记忆会逐步衰减,类似写作时遗忘前文伏笔,无法有效捕捉长距离上下文关联
- 梯度消失问题:RNN 多层嵌套采用链式求导法则,权重多次点乘后数值会趋近于 0,导致权重参数无法正常调整优化
- 网络退化问题:随着网络层数增加,模型优化难度持续上升,测试数据显示 56 层网络效果已不及 20 层网络,出现反向退化
-
自然语言输入编码方案演进
- 早期数字映射方案:早期尝试将汉字直接映射为连续数字,会无意义赋予词汇顺序属性,导致模型学习到错误的关联规律
- 独热编码方案
- 方案逻辑:采用独热编码将词汇映射为等长单位向量,通过不同方向区分词汇,避免无意义顺序属性的引入
- 方案缺陷:词表规模扩大后,独热编码会出现维度过高的问题,直接导致模型计算量大幅上升、运行效率下降
- 词嵌入(Embedding)方案
- 方案逻辑:通过降低向量维度、调整向量数值的方式表示不同词汇,在控制计算量的同时保留词汇的差异化特征
- 相关概念:分词后的最小单元为 token,所有 token 对应的词向量共同组成词向量矩阵,以超维空间向量形式作为模型输入
-
CNN 核心逻辑与优化方案
- CNN 基础定位:CNN 为鼻祖级神经网络,核心应用场景为图像处理,通过卷积、池化操作实现图像特征的逐层提取
- CNN 运行流程
- 标准流程:输入 RGB 三通道图像后,经卷积核扫描提取轮廓、池化操作降维,叠加 ReLU 激活函数后输出多组特征图
- 1×1 卷积核作用:1×1 卷积核的核心作用为引入激活函数、增加非线性因素,属于可自定义设置的合法卷积核参数
- 深度网络退化解决方案
- 残差模块逻辑:何凯明提出的残差模块通过跨层直连的捷径逻辑,跳过中间层直接计算权重梯度,解决深度网络退化问题
- ResNet 网络价值:基于残差模块构建的 ResNet 网络,实现了网络层数越多、预测准确率越高的正向效果,是 Transformer 的核心基础之一
-
后续工作计划
- 课后巩固:反复复盘 RNN、CNN 相关原理内容,对照示意图理解核心逻辑,完成对应公式作业
- 课程安排:下节课于上午时段开展 Transformer 相关内容的教学