AI大模型与数学第64课:矩阵×向量乘法(神经网络矩阵运算底层)

上一节课我们学完了矩阵定义、矩阵加法、标量乘法。

我们建立了核心认知:

向量是状态,矩阵是规则;向量是单个特征,矩阵是批量特征与变换权重。

但真正让神经网络"能计算、能推理、能提取特征"的核心操作,只有一个:

矩阵 × 向量 乘法

一句话点明本节课的AI地位:

所有全连接层、所有Embedding计算、所有特征变换、所有Transformer前向传播,本质全部是 矩阵 × 向量。

不会矩阵乘向量,你永远只是调包侠;

看懂这一步,你才算真正看懂神经网络的底层数据流。

一、大白话核心模型(贯穿所有AI)

先记住这一句终身受用的公式逻辑:

权重矩阵 × 输入向量 = 输出新特征向量

输入向量:原始数据、文字向量、图像特征

权重矩阵:模型学出来的"变换规则、知识、参数"

输出向量:经过模型加工后的高级语义特征

神经网络训练,本质就是:

不断更新矩阵参数,让矩阵变换出来的向量越来越接近标准答案。

二、矩阵 × 向量 运算规则(从零讲透)

1、运算前提(硬性规则)

设:

矩阵是 m \times n

向量必须是 n 维列向量

核心口诀:矩阵列数 = 向量维度,才能相乘。

输出结果一定是:m维新向量

人话:

矩阵有多少行,输出特征就有多少维。

2、计算逻辑(逐行点积,超级好懂)

矩阵每一行,和输入向量做一次内积(点积),得到一个新数字。

一行出一个值,m行就拼成一个m维新向量。

3、完整举例(手把手演算)

矩阵(权重规则):

W=

\begin{bmatrix}

1 & 2

3 & 4

5 & 6

\end{bmatrix}

输入向量(2维特征):

x=

\begin{bmatrix}

7\8

\end{bmatrix}

第一行点积:1×7 + 2×8 = 23

第二行点积:3×7 + 4×8 = 53

第三行点积:5×7 + 6×8 = 83

输出新向量:

Wx=

\begin{bmatrix}

23\53\83

\end{bmatrix}

完美看懂:

2维输入 → 经过3×2矩阵变换 → 变成3维高级特征

这就是 AI 的「特征升维」底层!

三、几何意义(非常重要)

结合我们前面课程的统一世界观:

  1. 向量是空间里的一个状态点
  2. 矩阵是空间变换规则
    矩阵乘向量 = 对状态做一次完整空间变换
    包含:
    拉伸特征
    旋转方向
    维度升降
    特征重组
    神经网络没有魔法,就是不停对向量做矩阵变换。

四、绑定AI:为什么全连接层就是矩阵乘向量?

1、全连接层公式

y = Wx + b

W:权重矩阵

x:输入向量

b:偏置向量(矩阵加法)

流程:

原始向量 → 矩阵变换提取特征 → 加偏置微调 → 输出高级特征

这就是每一层神经网络的完整工作流程。

2、升维、降维全部靠它

3\times2 矩阵:2维 → 3维(升维、提取更多特征)

2\times3 矩阵:3维 → 2维(降维、压缩特征)

大模型Embedding、特征压缩、维度映射,全是这套数学。

五、和之前知识点完美串联(全书闭环)

1、第62课内积

矩阵乘向量,本质就是批量内积。

每一行就是一组匹配权重,和输入向量做相似度融合。

2、第63课矩阵基础

矩阵加法对应残差连接

标量乘法对应学习率缩放、注意力缩放

3、微积分联动

前向传播:矩阵 × 向量 做特征变换

反向传播:求梯度、更新矩阵参数

梯度下降:不断微调矩阵,让变换结果越来越准

微积分负责"怎么更新",线性代数负责"怎么运算"。

至此,AI数学体系彻底咬合!

六、NumPy实战代码(可直接运行)

python

import numpy as np

权重矩阵 3行2列

W = np.array([

1, 2,

3, 4,

5, 6

])

2维输入向量

x = np.array(\[7, 8])

矩阵 × 向量

y = W @ x

print("输出特征向量:")

print(y)

运行结果就是我们手算的:23、53、83

七、本节课核心总结

  1. 矩阵 × 向量 = 神经网络最底层核心运算
  2. 本质:矩阵每行与输入向量批量做内积,重组特征
  3. 作用:实现升维、降维、特征提取、空间变换
  4. 全连接层公式 Wx+b 完全建立在本节课基础上
  5. 大模型所有前向传播,都是连续多次矩阵向量变换

八、随堂思考题(检验真懂)

1、矩阵乘向量,为什么可以实现维度升降?

2、神经网络全连接层 Wx+b 分别对应什么数学操作?

3、矩阵乘向量的本质,是我们第62课学的什么运算?

本专栏《AI大模型与数学》微积分→线性代数逐课递进,

不讲应试、只讲AI底层,每一课都是神经网络、Transformer的前置地基。

弄懂本节课,你终于看懂了:

神经网络不是黑盒,就是向量在矩阵规则下的层层变换。

👉 评论区打卡作答

🌟 收藏、关注专栏,下一课精讲:矩阵×矩阵乘法(Transformer批量运算核心)

彻底打通大模型全部矩阵流!

相关推荐
正在走向自律18 分钟前
从 Python 基础到大模型落地:读《深入浅出 Python 人工智能》,吃透 AI 工程化 CRUD 实战
开发语言·人工智能·python·机器学习·知识脉络
171320330计算机毕设编程20 分钟前
2027计算机毕设五大方向对比&选题推荐
java·ide·python·算法·django·php·推荐算法
小欣加油1 小时前
Leetcode2058 找出临界点之间的最小和最大距离
数据结构·c++·算法·leetcode·职场和发展
2601_962382431 小时前
Python零基础入门,看完直接上手写代码
python·机器学习·编程语言·数据科学·入门教程
江厌011 小时前
金融大模型私有化:信创合规下,算力该按哪个口径配
人工智能·深度学习·大模型·私有化部署·gpu·信创·ai服务器
颜安青1 小时前
深度学习Pytorch下载推荐(笔记,仅记录学习)
pytorch·笔记·深度学习
CoderYanger1 小时前
A.每日一题:3345. 最小可整除数位乘积 I
java·数据结构·程序人生·算法·leetcode·面试·学习方法
带多刺的玫瑰1 小时前
Leecode#16刷题之最接近的三数之和
数据结构·算法
橘子汽水1682 小时前
Leetcode15:三数之和
java·数据结构·算法