承接上一课:我们搞懂了向量是高维状态、语义特征、模型参数的最小单元。
向量是「单一状态」,但大模型是海量状态叠加、海量参数协同运算。
只靠向量,无法描述多层变换、批量特征、权重参数矩阵、批量数据运算。
于是数学为 AI 准备了第二套核心基石:矩阵。
本节课是线性代数入门第一课,从零起步、逐级递进、大白话、绑定大模型真实场景,为后续矩阵乘法、空间变换、注意力矩阵打牢地基。
一、为什么大模型必须要有「矩阵」
一句话串联前后逻辑:
向量 = 单个样本、单个特征、单条语义状态
矩阵 = 一堆向量整齐打包 = 批量状态、批量变换、模型权重。
大模型里没有零散运算,全是批量运算:
一次输入一句话几十个字 → 几十条向量
模型每一层权重 → 百万级参数矩阵
注意力计算 → Q/K/V 三大矩阵批量运算
训练迭代 → 矩阵整体更新、整体修正
向量管"单点",矩阵管"批量"。
想学懂 Transformer、看懂神经网络,必须吃透最基础的矩阵定义与基础运算。
二、矩阵到底是什么?
1、数学定义
矩阵:由若干行、若干列数字,整齐排列成的矩形数表。
形式:
A_{m\times n}=
\begin{bmatrix}
a_{11} & a_{12} & \dots & a_{1n}
a_{21} & a_{22} & \dots & a_{2n}
\vdots & \vdots & \ddots & \vdots
a_{m1} & a_{m2} & \dots & a_{mn}
\end{bmatrix}
m = 行数
n = 列数
读作:m行n列矩阵
2、AI工程通俗理解(核心记忆)
两个视角,完全对应大模型:
- 按行看:每一行是一个向量 → 矩阵是一堆样本的集合
比如:10句文本向量排成10行,就是「10×512」特征矩阵 - 按列看:每一列是一类特征维度 → 矩阵是特征维度集合
大模型输入、输出、权重,全部都是「向量堆出来的矩阵」。
3、常见矩阵形态(AI天天见)
行向量:1\times n 矩阵(单行)
列向量:m\times 1 矩阵(单列)
方阵:n\times n(行列相等,模型内部特征变换常用)
结论:向量只是矩阵的特殊形态!
学完矩阵,你会发现:之前学的向量知识,全部被矩阵统一收纳。
三、矩阵加法(最简单、最核心规则)
1、运算前提(必考、AI必懂)
只有同型矩阵才能相加!
必须:行数相等、列数相等。
通俗理解:
两个结构一模一样的表格,才能对应位置相加。
行数不一样、列数不一样,结构不匹配,无法运算。
2、运算规则
对应位置元素,单独相加。
举例:
A=
\begin{bmatrix}
1 & 2
3 & 4
\end{bmatrix},\quad
B=
\begin{bmatrix}
5 & 6
7 & 8
\end{bmatrix}
A+B=
\begin{bmatrix}
1+5 & 2+6
3+7 & 4+8
\end{bmatrix}=
\begin{bmatrix}
6 & 8
10 & 12
\end{bmatrix}
3、AI真实落地场景
- 模型残差连接 = 矩阵加法
Transformer、ResNet 核心:
Output = 主分支特征矩阵 + 残差分支特征矩阵
本质就是两个同型特征矩阵逐位置相加。 - 偏置项更新、特征叠加、多维度信息融合
所有"信息叠加、特征拼接融合"的底层基础,都是矩阵加法。
4、矩阵加法两大性质 - 交换律:A+B = B+A(先后顺序不影响结果)
- 结合律:(A+B)+C = A+(B+C)(分批相加不影响结果)
四、矩阵标量乘法(AI最常用缩放操作)
1、定义
一个数字 × 一个矩阵 = 矩阵所有元素统一乘这个数字
这个单独数字,就叫「标量」。
2、运算举例
设标量 k=2
A=
\begin{bmatrix}
1 & 2
3 & 4
\end{bmatrix}
2A=
\begin{bmatrix}
2\times1 & 2\times2
2\times3 & 2\times4
\end{bmatrix}=
\begin{bmatrix}
2 & 4
6 & 8
\end{bmatrix}
一句话大白话:
标量乘法 = 整个矩阵整体放大、整体缩小
不改变矩阵结构、不改变特征方向,只改变整体强弱。
3、大模型核心落地场景(超级重要)
- 注意力分数缩放 \boldsymbol/\sqrt{d}
Transformer 经典公式:
\text{Attention} = \text{softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V
除以 \sqrt{d},本质就是标量除法(标量乘法的倒数)
作用:统一特征尺度、防止数值爆炸、稳定训练。 - 学习率全局缩放
梯度更新:参数 = 参数 - 学习率 \times 梯度矩阵
学习率就是标量,全局缩放所有参数更新幅度。 - 权重衰减、正则化缩放
统一压低、缩放权重矩阵数值,防止过拟合,全是标量乘法。
五、本节课核心:
向量、矩阵、AI 三者串联闭环
- 向量:单个语义、单个特征、单组参数状态
- 矩阵:批量向量打包,是大模型的参数容器、特征容器
- 矩阵加法:多路径特征融合、残差连接底层
- 标量乘法:全局尺度缩放、训练数值稳定核心操作
如果说向量是AI的"细胞",矩阵就是AI的"组织与结构"。
所有复杂大模型运算,都是从「矩阵加减、标量缩放」一步步堆叠出来的。
六、自测
1、两个行列数不同的矩阵,能不能相加?为什么?
2、矩阵标量乘法,会不会改变矩阵的形状?
3、Transformer 中除以根号维度,属于哪种矩阵运算?
本系列《AI大模型与数学》微积分完结、线性代数全新连载,
全程大白话、100%贴合大模型真实底层逻辑。
本节课作为矩阵入门第一课,铺垫了 Transformer 残差、注意力缩放、特征融合的底层数学。
👉 评论区留下你的3道自测答案
🌟 收藏专栏,跟着日更系统吃透AI底层数学
下一课精讲:矩阵乘法(大模型最核心运算,全网最通俗拆解)