自学ai

root_123456_20 天前
网络·架构·transformer·自学ai
Transformer 架构二:多头注意力、位置编码与前馈网络上一章我们完成 Transformer 整体架构的宏观拆解,了解编码器、解码器的层级结构。本章将深入三大核心组件:多头注意力的内部子空间特性、各类位置编码技术的演进对比、前馈网络 FFN 的作用与现代变体改进。多头注意力、位置编码、前馈网络是 Transformer 的三大基础构件,共同决定模型的语义建模能力。很多学习者只记住公式,却不理解:为什么要切分成多头?正弦位置编码有什么短板?RoPE 旋转位置编码解决了什么问题?前馈网络究竟在做什么,SwiGLU 激活相比 ReLU 带来哪些收益。本章结合数学推
root_123456_18 天前
卷积神经网络·ai学习·自学ai·cnn核心
卷积神经网络一:CNN 核心 —— 卷积、池化与特征提取全连接神经网络处理结构化表格数据表现优秀,但面对图像、语音这类高维空间数据时,会遇到难以逾越的瓶颈。一张 256×256 的彩色图片,输入维度接近 20 万,全连接层参数会爆炸式增长,不仅训练困难,还会严重过拟合;更关键的是,全连接网络将像素展平为一维向量,彻底丢失了空间结构信息,而图像的核心信息恰恰蕴含在像素的空间排列中。
root_123456_21 天前
rnn·lstm·transformer·自学ai
注意力机制的诞生:从 Seq2Seq Attention 到注意力的本质在 Transformer 诞生之前,序列建模任务长期依赖 RNN、LSTM、GRU 这类循环结构。循环模型依靠时序逐次迭代完成文本编码,天然存在时序依赖,无法实现并行计算,长距离信息传递过程中还会出现梯度消失问题,当文本序列长度增加,模型很难捕捉相距较远词语之间的关联关系。注意力机制(Attention Mechanism)的提出,正是为了解决循环网络的信息遗忘瓶颈。本章将完整回溯注意力机制的发展脉络,从早期 Seq2Seq 架构的固有缺陷切入,讲解加法注意力、乘法注意力的数学推导,剖析注意力的底层本质
我是有底线的