AI大模型与数学/第63课:矩阵定义、矩阵加法、标量乘法(逐级精讲)

承接上一课:我们搞懂了向量是高维状态、语义特征、模型参数的最小单元。

向量是「单一状态」,但大模型是海量状态叠加、海量参数协同运算。

只靠向量,无法描述多层变换、批量特征、权重参数矩阵、批量数据运算。

于是数学为 AI 准备了第二套核心基石:矩阵。

本节课是线性代数入门第一课,从零起步、逐级递进、大白话、绑定大模型真实场景,为后续矩阵乘法、空间变换、注意力矩阵打牢地基。

一、为什么大模型必须要有「矩阵」

一句话串联前后逻辑:

向量 = 单个样本、单个特征、单条语义状态

矩阵 = 一堆向量整齐打包 = 批量状态、批量变换、模型权重。

大模型里没有零散运算,全是批量运算:

一次输入一句话几十个字 → 几十条向量

模型每一层权重 → 百万级参数矩阵

注意力计算 → Q/K/V 三大矩阵批量运算

训练迭代 → 矩阵整体更新、整体修正

向量管"单点",矩阵管"批量"。

想学懂 Transformer、看懂神经网络,必须吃透最基础的矩阵定义与基础运算。

二、矩阵到底是什么?

1、数学定义

矩阵:由若干行、若干列数字,整齐排列成的矩形数表。

形式:

A_{m\times n}=

\begin{bmatrix}

a_{11} & a_{12} & \dots & a_{1n}

a_{21} & a_{22} & \dots & a_{2n}

\vdots & \vdots & \ddots & \vdots

a_{m1} & a_{m2} & \dots & a_{mn}

\end{bmatrix}

m = 行数

n = 列数

读作:m行n列矩阵

2、AI工程通俗理解(核心记忆)

两个视角,完全对应大模型:

  1. 按行看:每一行是一个向量 → 矩阵是一堆样本的集合
    比如:10句文本向量排成10行,就是「10×512」特征矩阵
  2. 按列看:每一列是一类特征维度 → 矩阵是特征维度集合
    大模型输入、输出、权重,全部都是「向量堆出来的矩阵」。
    3、常见矩阵形态(AI天天见)
    行向量:1\times n 矩阵(单行)
    列向量:m\times 1 矩阵(单列)
    方阵:n\times n(行列相等,模型内部特征变换常用)
    结论:向量只是矩阵的特殊形态!
    学完矩阵,你会发现:之前学的向量知识,全部被矩阵统一收纳。

三、矩阵加法(最简单、最核心规则)

1、运算前提(必考、AI必懂)

只有同型矩阵才能相加!

必须:行数相等、列数相等。

通俗理解:

两个结构一模一样的表格,才能对应位置相加。

行数不一样、列数不一样,结构不匹配,无法运算。

2、运算规则

对应位置元素,单独相加。

举例:

A=

\begin{bmatrix}

1 & 2

3 & 4

\end{bmatrix},\quad

B=

\begin{bmatrix}

5 & 6

7 & 8

\end{bmatrix}

A+B=

\begin{bmatrix}

1+5 & 2+6

3+7 & 4+8

\end{bmatrix}=

\begin{bmatrix}

6 & 8

10 & 12

\end{bmatrix}

3、AI真实落地场景

  1. 模型残差连接 = 矩阵加法
    Transformer、ResNet 核心:
    Output = 主分支特征矩阵 + 残差分支特征矩阵
    本质就是两个同型特征矩阵逐位置相加。
  2. 偏置项更新、特征叠加、多维度信息融合
    所有"信息叠加、特征拼接融合"的底层基础,都是矩阵加法。
    4、矩阵加法两大性质
  3. 交换律:A+B = B+A(先后顺序不影响结果)
  4. 结合律:(A+B)+C = A+(B+C)(分批相加不影响结果)

四、矩阵标量乘法(AI最常用缩放操作)

1、定义

一个数字 × 一个矩阵 = 矩阵所有元素统一乘这个数字

这个单独数字,就叫「标量」。

2、运算举例

设标量 k=2

A=

\begin{bmatrix}

1 & 2

3 & 4

\end{bmatrix}

2A=

\begin{bmatrix}

2\times1 & 2\times2

2\times3 & 2\times4

\end{bmatrix}=

\begin{bmatrix}

2 & 4

6 & 8

\end{bmatrix}

一句话大白话:

标量乘法 = 整个矩阵整体放大、整体缩小

不改变矩阵结构、不改变特征方向,只改变整体强弱。

3、大模型核心落地场景(超级重要)

  1. 注意力分数缩放 \boldsymbol/\sqrt{d}
    Transformer 经典公式:
    \text{Attention} = \text{softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V
    除以 \sqrt{d},本质就是标量除法(标量乘法的倒数)
    作用:统一特征尺度、防止数值爆炸、稳定训练。
  2. 学习率全局缩放
    梯度更新:参数 = 参数 - 学习率 \times 梯度矩阵
    学习率就是标量,全局缩放所有参数更新幅度。
  3. 权重衰减、正则化缩放
    统一压低、缩放权重矩阵数值,防止过拟合,全是标量乘法。

五、本节课核心:

向量、矩阵、AI 三者串联闭环

  1. 向量:单个语义、单个特征、单组参数状态
  2. 矩阵:批量向量打包,是大模型的参数容器、特征容器
  3. 矩阵加法:多路径特征融合、残差连接底层
  4. 标量乘法:全局尺度缩放、训练数值稳定核心操作
    如果说向量是AI的"细胞",矩阵就是AI的"组织与结构"。
    所有复杂大模型运算,都是从「矩阵加减、标量缩放」一步步堆叠出来的。

六、自测

1、两个行列数不同的矩阵,能不能相加?为什么?

2、矩阵标量乘法,会不会改变矩阵的形状?

3、Transformer 中除以根号维度,属于哪种矩阵运算?

本系列《AI大模型与数学》微积分完结、线性代数全新连载,

全程大白话、100%贴合大模型真实底层逻辑。

本节课作为矩阵入门第一课,铺垫了 Transformer 残差、注意力缩放、特征融合的底层数学。

👉 评论区留下你的3道自测答案

🌟 收藏专栏,跟着日更系统吃透AI底层数学

下一课精讲:矩阵乘法(大模型最核心运算,全网最通俗拆解)

相关推荐
小婉21 分钟前
我用 Next.js + React Flow 从零搭建了一个可视化 AI 工作流编排平台
前端·人工智能·node.js
AI行业说22 分钟前
誉财自动化YC-18-M8045怎么选?2026中小服装工厂模板机选型指南
人工智能·机器人·自动化
余额瞒着我当琳25 分钟前
算法修炼 chapter 2 双指针进阶、盛最多水的容器、有效三角形的个数、两数之和、三数之和、四数之和
算法
Waiky26 分钟前
给 AI Agents 一双「眼睛」:CrawlEyes 开源了
人工智能
你压到我腿毛了66627 分钟前
C语言冒泡算法(Bubble sort)
c语言·数据结构·算法
甲维斯1 小时前
美版豆包又更新了!Gemini 3.8Flash是真Flash!
人工智能
云智慧AIOps社区1 小时前
2026年智能巡检机器人行业格局:三类厂商阵营、选型维度与产品推荐
运维·人工智能·机器人·巡检机器人
微三云 - 廖会灵 (私域系统开发)1 小时前
重资产的突围:当酒店遇上 RWA,用服务权益数字化重构产业供需关系
人工智能·重构
阿里云大数据AI技术1 小时前
从“找得到”到“找得准”:用 Hologres 构建智能达人圈选系统
大数据·人工智能