Transformer 论文通俗解读:FFN 中的非线性表达

本文是通俗解读Transformer 论文的FFN部分,你可以点击本文最后左下角的标签查看全部内容。

=================================================================

上一节介绍 FFN层时,提到了在 Transformer 架构中添加 FFN 层的一个作用:为了给神经网络增加非线性表达能力

非线性是学习神经网络时的一个基础知识。

虽然基础,但是我还是希望针对这部分内容做一个更加详细的说明,希望你可以对此有一个更深刻的认识,而不仅仅是 Transfomer 结构。

1、线性系统是什么样的?

请你先回忆一个基础知识:什么是线性函数?回忆完毕后,继续往下看。

假设有一个线性函数:y = kx + b, 这个函数画出来是下面的样子,此时我们可以说 y 和 x 是线性关系。

而如果又有一个线性函数 z = hy + d,那么,我们可以推断出,变量 z 和 x 同样也是线性关系。

为什么呢? 因为你可以通过下面的变量代入变换得到:

z = hy + d = z(kx + b) + d = zk x + zb + d = zk(x) + (zb + d)

如果令 K = zk,B = zb + d,那么 z 和 x 的关系就可以写出 z = Kx + B。

所以,z 和 x 同样是线性关系,这里就引出一个前提------

两个线性函数的叠加还是线性关系,同理,多个线性函数的叠加最终还是线性关系?

2、FFN 中的 FC 是非线性还是线性呢?

不好意思,FFN 中的全连接层(FC)本身就是一个线性系统。

为了说明这个问题,我询问了一个AI模型,让其来回答一下这个问题。

AI 模型对于这类问题回答的非常好(这里贴个图你可以看一下,也省去了我打字的时间花销😂)。

甚至,你可以将两个首尾相连的全连接层看作是一个全连接层。

看到这你或许对非线性有了一个更深刻的认识了吧------

事实上,神经网络中的很多基础且核心的运算,比如卷积,比如全连接(矩阵乘法),都是一种线性变换层。

如果这些层后面直接连接其他的线性变换层,那么多个线性变换层会退化成一个。

因此,在这类的线性变换层后面,要添加非线性的激活函数,使得整个变换不至于是线性变换,从而使得神经网络模型可以拟合成更加复杂多变的非线性系统。

如此一来,模型就可以处理复杂的任务,而不用担心模型在数学上仅仅是一个简单的线性模型了。

在 Transformer 的 FFN 结构中,先后添加了两个 FC 层,因此,在两个 FC 中间是一定要加入非线性激活函数的,这也是为什么论文中给出的公式是下面的样子:

其中的 max(0, xW1 + b1) 便是对第一个线性层施加 Relu 激活函数。

本文暂且不论 FFN 中添加 FC 的作用,你只需要了解在多个线性层中间一定要添加非线性层,来防止多个线性层叠加退化成一个线性层就可以了。

关于 FFN 中添加 FC,也就是线性层的作用,在后面的文章中会有介绍。

更多内容:关注我,不迷路:点这里

相关推荐
Halo_tjn15 分钟前
Java 基于字符串相关知识点
java·开发语言·算法
念越31 分钟前
算法每日一题 Day08|双指针法解决三数之和
算法·力扣
黎阳之光1 小时前
黎阳之光透明管理:视频孪生重构智慧仓储新范式
人工智能·算法·安全·重构·数字孪生
CappuccinoRose2 小时前
回溯法 - 软考备战(四十三)
算法·排列组合·路径·n皇后·子集·解数独·岛屿
AC赳赳老秦2 小时前
OpenClaw进阶技巧:批量修改文件内容、替换关键词,解放双手
java·linux·人工智能·python·算法·测试用例·openclaw
Robot_Nav2 小时前
Shape-Aware MPPI(SA MPPI)算法:基于RC-ESDF的任意形状机器人实时轨迹优化
算法·机器人·sa-mppi
小O的算法实验室3 小时前
2026年ESWA,自适应基于排序的协同进化学习粒子群算法+边缘计算服务器部署,深度解析+性能实测
算法·论文复现·智能算法·智能算法改进
cpp_25014 小时前
P1832 A+B Problem(再升级)
数据结构·c++·算法·动态规划·题解·洛谷·背包dp
꧁细听勿语情꧂4 小时前
合并两个有序表、判断链表的回文结构、相交链表、环的链表一和二
c语言·开发语言·数据结构·算法
木井巳4 小时前
【递归算法】解数独
java·算法·leetcode·决策树·深度优先·剪枝