AI大模型与数学/第63课:矩阵定义、矩阵加法、标量乘法(逐级精讲)

承接上一课:我们搞懂了向量是高维状态、语义特征、模型参数的最小单元。

向量是「单一状态」,但大模型是海量状态叠加、海量参数协同运算。

只靠向量,无法描述多层变换、批量特征、权重参数矩阵、批量数据运算。

于是数学为 AI 准备了第二套核心基石:矩阵。

本节课是线性代数入门第一课,从零起步、逐级递进、大白话、绑定大模型真实场景,为后续矩阵乘法、空间变换、注意力矩阵打牢地基。

一、为什么大模型必须要有「矩阵」

一句话串联前后逻辑:

向量 = 单个样本、单个特征、单条语义状态

矩阵 = 一堆向量整齐打包 = 批量状态、批量变换、模型权重。

大模型里没有零散运算,全是批量运算:

一次输入一句话几十个字 → 几十条向量

模型每一层权重 → 百万级参数矩阵

注意力计算 → Q/K/V 三大矩阵批量运算

训练迭代 → 矩阵整体更新、整体修正

向量管"单点",矩阵管"批量"。

想学懂 Transformer、看懂神经网络,必须吃透最基础的矩阵定义与基础运算。

二、矩阵到底是什么?

1、数学定义

矩阵:由若干行、若干列数字,整齐排列成的矩形数表。

形式:

A_{m\times n}=

\begin{bmatrix}

a_{11} & a_{12} & \dots & a_{1n}

a_{21} & a_{22} & \dots & a_{2n}

\vdots & \vdots & \ddots & \vdots

a_{m1} & a_{m2} & \dots & a_{mn}

\end{bmatrix}

m = 行数

n = 列数

读作:m行n列矩阵

2、AI工程通俗理解(核心记忆)

两个视角,完全对应大模型:

  1. 按行看:每一行是一个向量 → 矩阵是一堆样本的集合
    比如:10句文本向量排成10行,就是「10×512」特征矩阵
  2. 按列看:每一列是一类特征维度 → 矩阵是特征维度集合
    大模型输入、输出、权重,全部都是「向量堆出来的矩阵」。
    3、常见矩阵形态(AI天天见)
    行向量:1\times n 矩阵(单行)
    列向量:m\times 1 矩阵(单列)
    方阵:n\times n(行列相等,模型内部特征变换常用)
    结论:向量只是矩阵的特殊形态!
    学完矩阵,你会发现:之前学的向量知识,全部被矩阵统一收纳。

三、矩阵加法(最简单、最核心规则)

1、运算前提(必考、AI必懂)

只有同型矩阵才能相加!

必须:行数相等、列数相等。

通俗理解:

两个结构一模一样的表格,才能对应位置相加。

行数不一样、列数不一样,结构不匹配,无法运算。

2、运算规则

对应位置元素,单独相加。

举例:

A=

\begin{bmatrix}

1 & 2

3 & 4

\end{bmatrix},\quad

B=

\begin{bmatrix}

5 & 6

7 & 8

\end{bmatrix}

A+B=

\begin{bmatrix}

1+5 & 2+6

3+7 & 4+8

\end{bmatrix}=

\begin{bmatrix}

6 & 8

10 & 12

\end{bmatrix}

3、AI真实落地场景

  1. 模型残差连接 = 矩阵加法
    Transformer、ResNet 核心:
    Output = 主分支特征矩阵 + 残差分支特征矩阵
    本质就是两个同型特征矩阵逐位置相加。
  2. 偏置项更新、特征叠加、多维度信息融合
    所有"信息叠加、特征拼接融合"的底层基础,都是矩阵加法。
    4、矩阵加法两大性质
  3. 交换律:A+B = B+A(先后顺序不影响结果)
  4. 结合律:(A+B)+C = A+(B+C)(分批相加不影响结果)

四、矩阵标量乘法(AI最常用缩放操作)

1、定义

一个数字 × 一个矩阵 = 矩阵所有元素统一乘这个数字

这个单独数字,就叫「标量」。

2、运算举例

设标量 k=2

A=

\begin{bmatrix}

1 & 2

3 & 4

\end{bmatrix}

2A=

\begin{bmatrix}

2\times1 & 2\times2

2\times3 & 2\times4

\end{bmatrix}=

\begin{bmatrix}

2 & 4

6 & 8

\end{bmatrix}

一句话大白话:

标量乘法 = 整个矩阵整体放大、整体缩小

不改变矩阵结构、不改变特征方向,只改变整体强弱。

3、大模型核心落地场景(超级重要)

  1. 注意力分数缩放 \boldsymbol/\sqrt{d}
    Transformer 经典公式:
    \text{Attention} = \text{softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V
    除以 \sqrt{d},本质就是标量除法(标量乘法的倒数)
    作用:统一特征尺度、防止数值爆炸、稳定训练。
  2. 学习率全局缩放
    梯度更新:参数 = 参数 - 学习率 \times 梯度矩阵
    学习率就是标量,全局缩放所有参数更新幅度。
  3. 权重衰减、正则化缩放
    统一压低、缩放权重矩阵数值,防止过拟合,全是标量乘法。

五、本节课核心:

向量、矩阵、AI 三者串联闭环

  1. 向量:单个语义、单个特征、单组参数状态
  2. 矩阵:批量向量打包,是大模型的参数容器、特征容器
  3. 矩阵加法:多路径特征融合、残差连接底层
  4. 标量乘法:全局尺度缩放、训练数值稳定核心操作
    如果说向量是AI的"细胞",矩阵就是AI的"组织与结构"。
    所有复杂大模型运算,都是从「矩阵加减、标量缩放」一步步堆叠出来的。

六、自测

1、两个行列数不同的矩阵,能不能相加?为什么?

2、矩阵标量乘法,会不会改变矩阵的形状?

3、Transformer 中除以根号维度,属于哪种矩阵运算?

本系列《AI大模型与数学》微积分完结、线性代数全新连载,

全程大白话、100%贴合大模型真实底层逻辑。

本节课作为矩阵入门第一课,铺垫了 Transformer 残差、注意力缩放、特征融合的底层数学。

👉 评论区留下你的3道自测答案

🌟 收藏专栏,跟着日更系统吃透AI底层数学

下一课精讲:矩阵乘法(大模型最核心运算,全网最通俗拆解)

相关推荐
回眸&啤酒鸭1 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智1 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
倒头就睡的小比特1 天前
算法竞赛C++常用的STL
c++·算法
AI的探索之旅1 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein1 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
小羊没烦恼!1 天前
初探性能优化——2个月到4小时的性能提升
java·开发语言·windows·算法·c#
LaughingZhu1 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台1 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb1 天前
智能网联汽车安全能力框架
人工智能