前置知识:向量、向量内积、基、向量空间。
在大模型中:正交化用于向量降维、注意力计算、向量数据库、语义向量处理、矩阵分解,是高维AI向量空间的核心工具。
1、什么是两个向量正交
定义
对于两个 n维实向量 \boldsymbol u,\boldsymbol v
如果它们的内积等于0:
\boldsymbol u \cdot \boldsymbol v=\boldsymbol u^\mathrm T \boldsymbol v = 0
则称 \boldsymbol u 和 \boldsymbol v 相互正交(垂直)。
二维/三维几何直观:就是几何上互相垂直。
高维空间没有直观几何图像,内积为0就是"广义垂直"的数学定义。
例子
\boldsymbol u=\begin{pmatrix}1\\0\end{pmatrix},\quad \boldsymbol v=\begin{pmatrix}0\\1\end{pmatrix}
\boldsymbol u^\mathrm T\boldsymbol v=1\times0+0\times1=0
两向量正交。
⚠️零向量和任何向量内积都是0,规定零向量不参与正交向量组。
正交向量组
一组非零向量 \boldsymbol v_1,\boldsymbol v_2,\dots,\boldsymbol v_k,组内两两互相正交:
\boldsymbol v_i^\mathrm T \boldsymbol v_j =0,\quad i\neq j
称为正交向量组。
重要定理:正交向量组一定线性无关。
这是巨大优势:只要两两正交,就自动是无关组,不用再算行列式判断线性相关性。
标准正交向量组(单位正交)
正交基础上,每一个向量自身长度(范数)为1:
\|\boldsymbol v_i\|=\sqrt{\boldsymbol v_i^\mathrm T\boldsymbol v_i}=1
两两内积满足:
\boldsymbol v_i^\mathrm T\boldsymbol v_j=
\begin{cases}
1,&i=j\\
0,&i\neq j
\end{cases}
2、正交基 & 标准正交基
基回顾
R^n空间一组基:n个线性无关向量,可以把空间中任意向量,写成这组基的线性组合。
-
正交基:一组基,同时又是正交向量组。
-
标准正交基:一组基,两两正交,并且每个向量长度等于1。
标准正交基巨大好处(AI高频)
如果 \{\boldsymbol e_1,\boldsymbol e_2\dots,\boldsymbol e_n\} 是标准正交基。
任意向量 \boldsymbol x 做分解:
\boldsymbol x = c_1\boldsymbol e_1 + c_2\boldsymbol e_2+\dots+c_n\boldsymbol e_n
系数直接用内积算出:
c_i=\boldsymbol x^\mathrm T \boldsymbol e_i
普通基求系数需要解线性方程组;标准正交基直接点积就得到系数,计算量大幅下降。
这就是为什么AI大量追求正交:简化高维向量投影、分解、相似度计算。
矩阵形式:正交矩阵
把标准正交基按列拼成矩阵 Q:
Q=\begin{bmatrix}\boldsymbol e_1&\boldsymbol e_2&\dots&\boldsymbol e_n\end{bmatrix}
满足:
Q^\mathrm T Q = I
叫正交矩阵。
性质:Q^\mathrm T=Q^{-1},转置直接等于逆矩阵,求逆几乎零成本。
AI中PCA主成分分析输出的主成分,就是一组标准正交基。
3、格拉姆‑施密特 Gram‑Schmidt 正交化算法
问题:给一组普通线性无关的基,怎么把它变成一组正交基,再变成标准正交基?
Gram‑Schmidt就是这套变换流程。
输入:线性无关向量 \boldsymbol a_1,\boldsymbol a_2,\dots,\boldsymbol a_k
输出:正交向量 \boldsymbol v_1,\boldsymbol v_2,\dots,\boldsymbol v_k
步骤公式
- 第一个向量直接取原向量
\boldsymbol v_1=\boldsymbol a_1
- 第二个向量:把 \boldsymbol a_2,减去它在 \boldsymbol v_1 上的投影,得到和\boldsymbol v_1正交的\boldsymbol v_2
\boldsymbol v_2=\boldsymbol a_2
-\frac{\boldsymbol a_2^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T \boldsymbol v_1}\boldsymbol v_1
- 第三个向量:\boldsymbol a_3,减去它在\boldsymbol v_1投影,再减去在\boldsymbol v_2投影
\boldsymbol v_3=\boldsymbol a_3
-\frac{\boldsymbol a_3^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T \boldsymbol v_1}\boldsymbol v_1
-\frac{\boldsymbol a_3^\mathrm T\boldsymbol v_2}{\boldsymbol v_2^\mathrm T \boldsymbol v_2}\boldsymbol v_2
- 通用递推公式
\boldsymbol v_k=\boldsymbol a_k-\sum_{i=1}^{k-1}
\frac{\boldsymbol a_k^\mathrm T \boldsymbol v_i}{\boldsymbol v_i^\mathrm T\boldsymbol v_i}\boldsymbol v_i
几何理解:每一步,把新向量,减去向前面所有已经得到正交向量上的投影分量,剩下的残差部分就和前面全部正交。
得到正交组\boldsymbol v_1,\boldsymbol v_2\dots之后,做单位化,得到标准正交向量:
\boldsymbol e_i=\frac{\boldsymbol v_i}{\|\boldsymbol v_i\|}
2阶完整手算例题
给定
\boldsymbol a_1=\begin{pmatrix}1\\1\end{pmatrix},\;
\boldsymbol a_2=\begin{pmatrix}0\\1\end{pmatrix}
1.\boldsymbol v_1=\boldsymbol a_1=\begin{pmatrix}1\\1\end{pmatrix}
2.计算投影系数
\frac{\boldsymbol a_2^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T\boldsymbol v_1}
=\frac{0\times1+1\times1}{1^2+1^2}=\frac12
\boldsymbol v_2=\boldsymbol a_2-\frac12 \boldsymbol v_1
=\begin{pmatrix}0\\1\end{pmatrix}-\frac12\begin{pmatrix}1\\1\end{pmatrix}
=\begin{pmatrix}-0.5\\0.5\end{pmatrix}
现在 \boldsymbol v_1,\boldsymbol v_2 互相正交。
再各自除以模长,得到标准正交基。
注意:数值计算,传统GS会有精度误差;工程上用修正格拉姆‑施密特(MGS),大模型、数值库实际使用MGS版本。
4、在AI大模型里面,正交/格拉姆施密特用来干什么
① PCA主成分分析
把海量高维语义向量,做正交基变换。新的正交基按方差从大到小排序,实现降维。
原始特征互相之间有冗余;正交之后,各个维度信息互不重叠。
② 向量数据库、Embedding语义向量
理想情况下,语义完全无关的句子对应的embedding向量,希望尽量接近正交(内积趋近0);语义相似向量内积大。
正交=信息互不重叠;内积就是相似度。
③ Transformer注意力机制底层数学
注意力本质大量做向量投影。如果基是标准正交,投影计算简化。
在部分模型的归一化、正交初始化权重矩阵,使用正交矩阵初始化,防止梯度爆炸消失。正交矩阵变换,向量长度保持不变。
正交矩阵性质:\|Q\boldsymbol x\|=\|\boldsymbol x\|,变换不改变向量长度,对深度网络梯度传播非常友好。
④ QR矩阵分解
Gram‑Schmidt就是QR分解的推导基础:A=QR
-
Q:标准正交列构成的正交矩阵
-
R:上三角矩阵
大模型求解最小二乘、矩阵求逆、数值线性代数库大量依赖QR分解。
⑤ 提示词、拒绝采样、RLHF
高维向量空间中,把无用/有害方向,通过正交投影剔除,把向量投影到安全子空间。
📝随堂练习题
给定向量
\boldsymbol a_1=\begin{pmatrix} 1 \\ -1 \end{pmatrix},\quad
\boldsymbol a_2=\begin{pmatrix} 2 \\ 0 \end{pmatrix}
-
使用格拉姆‑施密特求正交向量组\boldsymbol v_1,\boldsymbol v_2
-
再单位化得到标准正交基\boldsymbol e_1,\boldsymbol e_2
-
验证\boldsymbol e_1^\mathrm T\boldsymbol e_2=0,且各自模长等于1。
下一讲预告
正交投影,最小二乘,大模型里面拟合、对齐的核心数学工具。