AI大模型与数学|第81天 课程:正交向量、正交基、格拉姆‑施密特(Gram‑Schmidt)正交化

前置知识:向量、向量内积、基、向量空间。

在大模型中:正交化用于向量降维、注意力计算、向量数据库、语义向量处理、矩阵分解,是高维AI向量空间的核心工具。

1、什么是两个向量正交

定义

对于两个 n维实向量 \boldsymbol u,\boldsymbol v

如果它们的内积等于0:

\boldsymbol u \cdot \boldsymbol v=\boldsymbol u^\mathrm T \boldsymbol v = 0

则称 \boldsymbol u 和 \boldsymbol v 相互正交(垂直)。

二维/三维几何直观:就是几何上互相垂直。

高维空间没有直观几何图像,内积为0就是"广义垂直"的数学定义。

例子

\boldsymbol u=\begin{pmatrix}1\\0\end{pmatrix},\quad \boldsymbol v=\begin{pmatrix}0\\1\end{pmatrix}

\boldsymbol u^\mathrm T\boldsymbol v=1\times0+0\times1=0

两向量正交。

⚠️零向量和任何向量内积都是0,规定零向量不参与正交向量组。

正交向量组

一组非零向量 \boldsymbol v_1,\boldsymbol v_2,\dots,\boldsymbol v_k,组内两两互相正交:

\boldsymbol v_i^\mathrm T \boldsymbol v_j =0,\quad i\neq j

称为正交向量组。

重要定理:正交向量组一定线性无关。

这是巨大优势:只要两两正交,就自动是无关组,不用再算行列式判断线性相关性。

标准正交向量组(单位正交)

正交基础上,每一个向量自身长度(范数)为1:

\|\boldsymbol v_i\|=\sqrt{\boldsymbol v_i^\mathrm T\boldsymbol v_i}=1

两两内积满足:

\boldsymbol v_i^\mathrm T\boldsymbol v_j=

\begin{cases}

1,&i=j\\

0,&i\neq j

\end{cases}

2、正交基 & 标准正交基

基回顾

R^n空间一组基:n个线性无关向量,可以把空间中任意向量,写成这组基的线性组合。

  1. 正交基:一组基,同时又是正交向量组。

  2. 标准正交基:一组基,两两正交,并且每个向量长度等于1。

标准正交基巨大好处(AI高频)

如果 \{\boldsymbol e_1,\boldsymbol e_2\dots,\boldsymbol e_n\} 是标准正交基。

任意向量 \boldsymbol x 做分解:

\boldsymbol x = c_1\boldsymbol e_1 + c_2\boldsymbol e_2+\dots+c_n\boldsymbol e_n

系数直接用内积算出:

c_i=\boldsymbol x^\mathrm T \boldsymbol e_i

普通基求系数需要解线性方程组;标准正交基直接点积就得到系数,计算量大幅下降。

这就是为什么AI大量追求正交:简化高维向量投影、分解、相似度计算。

矩阵形式:正交矩阵

把标准正交基按列拼成矩阵 Q:

Q=\begin{bmatrix}\boldsymbol e_1&\boldsymbol e_2&\dots&\boldsymbol e_n\end{bmatrix}

满足:

Q^\mathrm T Q = I

叫正交矩阵。

性质:Q^\mathrm T=Q^{-1},转置直接等于逆矩阵,求逆几乎零成本。

AI中PCA主成分分析输出的主成分,就是一组标准正交基。

3、格拉姆‑施密特 Gram‑Schmidt 正交化算法

问题:给一组普通线性无关的基,怎么把它变成一组正交基,再变成标准正交基?

Gram‑Schmidt就是这套变换流程。

输入:线性无关向量 \boldsymbol a_1,\boldsymbol a_2,\dots,\boldsymbol a_k

输出:正交向量 \boldsymbol v_1,\boldsymbol v_2,\dots,\boldsymbol v_k

步骤公式

  1. 第一个向量直接取原向量

\boldsymbol v_1=\boldsymbol a_1

  1. 第二个向量:把 \boldsymbol a_2,减去它在 \boldsymbol v_1 上的投影,得到和\boldsymbol v_1正交的\boldsymbol v_2

\boldsymbol v_2=\boldsymbol a_2

-\frac{\boldsymbol a_2^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T \boldsymbol v_1}\boldsymbol v_1

  1. 第三个向量:\boldsymbol a_3,减去它在\boldsymbol v_1投影,再减去在\boldsymbol v_2投影

\boldsymbol v_3=\boldsymbol a_3

-\frac{\boldsymbol a_3^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T \boldsymbol v_1}\boldsymbol v_1

-\frac{\boldsymbol a_3^\mathrm T\boldsymbol v_2}{\boldsymbol v_2^\mathrm T \boldsymbol v_2}\boldsymbol v_2

  1. 通用递推公式

\boldsymbol v_k=\boldsymbol a_k-\sum_{i=1}^{k-1}

\frac{\boldsymbol a_k^\mathrm T \boldsymbol v_i}{\boldsymbol v_i^\mathrm T\boldsymbol v_i}\boldsymbol v_i

几何理解:每一步,把新向量,减去向前面所有已经得到正交向量上的投影分量,剩下的残差部分就和前面全部正交。

得到正交组\boldsymbol v_1,\boldsymbol v_2\dots之后,做单位化,得到标准正交向量:

\boldsymbol e_i=\frac{\boldsymbol v_i}{\|\boldsymbol v_i\|}

2阶完整手算例题

给定

\boldsymbol a_1=\begin{pmatrix}1\\1\end{pmatrix},\;

\boldsymbol a_2=\begin{pmatrix}0\\1\end{pmatrix}

1.\boldsymbol v_1=\boldsymbol a_1=\begin{pmatrix}1\\1\end{pmatrix}

2.计算投影系数

\frac{\boldsymbol a_2^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T\boldsymbol v_1}

=\frac{0\times1+1\times1}{1^2+1^2}=\frac12

\boldsymbol v_2=\boldsymbol a_2-\frac12 \boldsymbol v_1

=\begin{pmatrix}0\\1\end{pmatrix}-\frac12\begin{pmatrix}1\\1\end{pmatrix}

=\begin{pmatrix}-0.5\\0.5\end{pmatrix}

现在 \boldsymbol v_1,\boldsymbol v_2 互相正交。

再各自除以模长,得到标准正交基。

注意:数值计算,传统GS会有精度误差;工程上用修正格拉姆‑施密特(MGS),大模型、数值库实际使用MGS版本。

4、在AI大模型里面,正交/格拉姆施密特用来干什么

① PCA主成分分析

把海量高维语义向量,做正交基变换。新的正交基按方差从大到小排序,实现降维。

原始特征互相之间有冗余;正交之后,各个维度信息互不重叠。

② 向量数据库、Embedding语义向量

理想情况下,语义完全无关的句子对应的embedding向量,希望尽量接近正交(内积趋近0);语义相似向量内积大。

正交=信息互不重叠;内积就是相似度。

③ Transformer注意力机制底层数学

注意力本质大量做向量投影。如果基是标准正交,投影计算简化。

在部分模型的归一化、正交初始化权重矩阵,使用正交矩阵初始化,防止梯度爆炸消失。正交矩阵变换,向量长度保持不变。

正交矩阵性质:\|Q\boldsymbol x\|=\|\boldsymbol x\|,变换不改变向量长度,对深度网络梯度传播非常友好。

④ QR矩阵分解

Gram‑Schmidt就是QR分解的推导基础:A=QR

  • Q:标准正交列构成的正交矩阵

  • R:上三角矩阵

大模型求解最小二乘、矩阵求逆、数值线性代数库大量依赖QR分解。

⑤ 提示词、拒绝采样、RLHF

高维向量空间中,把无用/有害方向,通过正交投影剔除,把向量投影到安全子空间。

📝随堂练习题

给定向量

\boldsymbol a_1=\begin{pmatrix} 1 \\ -1 \end{pmatrix},\quad

\boldsymbol a_2=\begin{pmatrix} 2 \\ 0 \end{pmatrix}

  1. 使用格拉姆‑施密特求正交向量组\boldsymbol v_1,\boldsymbol v_2

  2. 再单位化得到标准正交基\boldsymbol e_1,\boldsymbol e_2

  3. 验证\boldsymbol e_1^\mathrm T\boldsymbol e_2=0,且各自模长等于1。

下一讲预告

正交投影,最小二乘,大模型里面拟合、对齐的核心数学工具。

相关推荐
镜象科技11 分钟前
AI情感大模型应用场景全解:从校园到医院再到企业的落地地图
人工智能
Joshua-a1 小时前
工程数学-理解卷积的含义_线性时不变系统的冲激响应与卷积
人工智能·深度学习
song5011 小时前
React Native for OpenHarmony 实战:三方库 react-native-css-transformer 的鸿蒙化适配指南
css·人工智能·深度学习·react native·transformer
夏幻灵5 小时前
JavaScript this 面试:五种绑定规则、优先级与常见面试陷阱
开发语言·javascript·面试
程序猿编码5 小时前
榨干 RTX5090 算力!Qwen3 专用单卡推理引擎,手写C++/CUDA 算子实现 MTP 推测解码
开发语言·c++·大模型推理·qwen3·多模态推理
老金带你玩AI5 小时前
ChatGPT dots,到底能替你操多少心?
人工智能
AliCloudROS6 小时前
计算巢 X DeepSeek Harness — 云端智能体工作台
人工智能·阿里云
深蓝AI6 小时前
GitHub的Push一年涨4.9倍:AI Agent为什么逼它重做Git存储?
人工智能·github
stereohomology7 小时前
大模型的观点谨:StoryTold 「Crafting Apps」四件套 · 深度总览
人工智能·llm
bkspiderx7 小时前
Qt 插件机制:动态扩展应用功能的核心框架
开发语言·qt·元数据·qt 插件·qpluginloader