AI大模型与数学|第81天 课程:正交向量、正交基、格拉姆‑施密特(Gram‑Schmidt)正交化

前置知识:向量、向量内积、基、向量空间。

在大模型中:正交化用于向量降维、注意力计算、向量数据库、语义向量处理、矩阵分解,是高维AI向量空间的核心工具。

1、什么是两个向量正交

定义

对于两个 n维实向量 \boldsymbol u,\boldsymbol v

如果它们的内积等于0:

\boldsymbol u \cdot \boldsymbol v=\boldsymbol u^\mathrm T \boldsymbol v = 0

则称 \boldsymbol u 和 \boldsymbol v 相互正交(垂直)。

二维/三维几何直观:就是几何上互相垂直。

高维空间没有直观几何图像,内积为0就是"广义垂直"的数学定义。

例子

\boldsymbol u=\begin{pmatrix}1\\0\end{pmatrix},\quad \boldsymbol v=\begin{pmatrix}0\\1\end{pmatrix}

\boldsymbol u^\mathrm T\boldsymbol v=1\times0+0\times1=0

两向量正交。

⚠️零向量和任何向量内积都是0,规定零向量不参与正交向量组。

正交向量组

一组非零向量 \boldsymbol v_1,\boldsymbol v_2,\dots,\boldsymbol v_k,组内两两互相正交:

\boldsymbol v_i^\mathrm T \boldsymbol v_j =0,\quad i\neq j

称为正交向量组。

重要定理:正交向量组一定线性无关。

这是巨大优势:只要两两正交,就自动是无关组,不用再算行列式判断线性相关性。

标准正交向量组(单位正交)

正交基础上,每一个向量自身长度(范数)为1:

\|\boldsymbol v_i\|=\sqrt{\boldsymbol v_i^\mathrm T\boldsymbol v_i}=1

两两内积满足:

\boldsymbol v_i^\mathrm T\boldsymbol v_j=

\begin{cases}

1,&i=j\\

0,&i\neq j

\end{cases}

2、正交基 & 标准正交基

基回顾

R^n空间一组基:n个线性无关向量,可以把空间中任意向量,写成这组基的线性组合。

  1. 正交基:一组基,同时又是正交向量组。

  2. 标准正交基:一组基,两两正交,并且每个向量长度等于1。

标准正交基巨大好处(AI高频)

如果 \{\boldsymbol e_1,\boldsymbol e_2\dots,\boldsymbol e_n\} 是标准正交基。

任意向量 \boldsymbol x 做分解:

\boldsymbol x = c_1\boldsymbol e_1 + c_2\boldsymbol e_2+\dots+c_n\boldsymbol e_n

系数直接用内积算出:

c_i=\boldsymbol x^\mathrm T \boldsymbol e_i

普通基求系数需要解线性方程组;标准正交基直接点积就得到系数,计算量大幅下降。

这就是为什么AI大量追求正交:简化高维向量投影、分解、相似度计算。

矩阵形式:正交矩阵

把标准正交基按列拼成矩阵 Q:

Q=\begin{bmatrix}\boldsymbol e_1&\boldsymbol e_2&\dots&\boldsymbol e_n\end{bmatrix}

满足:

Q^\mathrm T Q = I

叫正交矩阵。

性质:Q^\mathrm T=Q^{-1},转置直接等于逆矩阵,求逆几乎零成本。

AI中PCA主成分分析输出的主成分,就是一组标准正交基。

3、格拉姆‑施密特 Gram‑Schmidt 正交化算法

问题:给一组普通线性无关的基,怎么把它变成一组正交基,再变成标准正交基?

Gram‑Schmidt就是这套变换流程。

输入:线性无关向量 \boldsymbol a_1,\boldsymbol a_2,\dots,\boldsymbol a_k

输出:正交向量 \boldsymbol v_1,\boldsymbol v_2,\dots,\boldsymbol v_k

步骤公式

  1. 第一个向量直接取原向量

\boldsymbol v_1=\boldsymbol a_1

  1. 第二个向量:把 \boldsymbol a_2,减去它在 \boldsymbol v_1 上的投影,得到和\boldsymbol v_1正交的\boldsymbol v_2

\boldsymbol v_2=\boldsymbol a_2

-\frac{\boldsymbol a_2^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T \boldsymbol v_1}\boldsymbol v_1

  1. 第三个向量:\boldsymbol a_3,减去它在\boldsymbol v_1投影,再减去在\boldsymbol v_2投影

\boldsymbol v_3=\boldsymbol a_3

-\frac{\boldsymbol a_3^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T \boldsymbol v_1}\boldsymbol v_1

-\frac{\boldsymbol a_3^\mathrm T\boldsymbol v_2}{\boldsymbol v_2^\mathrm T \boldsymbol v_2}\boldsymbol v_2

  1. 通用递推公式

\boldsymbol v_k=\boldsymbol a_k-\sum_{i=1}^{k-1}

\frac{\boldsymbol a_k^\mathrm T \boldsymbol v_i}{\boldsymbol v_i^\mathrm T\boldsymbol v_i}\boldsymbol v_i

几何理解:每一步,把新向量,减去向前面所有已经得到正交向量上的投影分量,剩下的残差部分就和前面全部正交。

得到正交组\boldsymbol v_1,\boldsymbol v_2\dots之后,做单位化,得到标准正交向量:

\boldsymbol e_i=\frac{\boldsymbol v_i}{\|\boldsymbol v_i\|}

2阶完整手算例题

给定

\boldsymbol a_1=\begin{pmatrix}1\\1\end{pmatrix},\;

\boldsymbol a_2=\begin{pmatrix}0\\1\end{pmatrix}

1.\boldsymbol v_1=\boldsymbol a_1=\begin{pmatrix}1\\1\end{pmatrix}

2.计算投影系数

\frac{\boldsymbol a_2^\mathrm T\boldsymbol v_1}{\boldsymbol v_1^\mathrm T\boldsymbol v_1}

=\frac{0\times1+1\times1}{1^2+1^2}=\frac12

\boldsymbol v_2=\boldsymbol a_2-\frac12 \boldsymbol v_1

=\begin{pmatrix}0\\1\end{pmatrix}-\frac12\begin{pmatrix}1\\1\end{pmatrix}

=\begin{pmatrix}-0.5\\0.5\end{pmatrix}

现在 \boldsymbol v_1,\boldsymbol v_2 互相正交。

再各自除以模长,得到标准正交基。

注意:数值计算,传统GS会有精度误差;工程上用修正格拉姆‑施密特(MGS),大模型、数值库实际使用MGS版本。

4、在AI大模型里面,正交/格拉姆施密特用来干什么

① PCA主成分分析

把海量高维语义向量,做正交基变换。新的正交基按方差从大到小排序,实现降维。

原始特征互相之间有冗余;正交之后,各个维度信息互不重叠。

② 向量数据库、Embedding语义向量

理想情况下,语义完全无关的句子对应的embedding向量,希望尽量接近正交(内积趋近0);语义相似向量内积大。

正交=信息互不重叠;内积就是相似度。

③ Transformer注意力机制底层数学

注意力本质大量做向量投影。如果基是标准正交,投影计算简化。

在部分模型的归一化、正交初始化权重矩阵,使用正交矩阵初始化,防止梯度爆炸消失。正交矩阵变换,向量长度保持不变。

正交矩阵性质:\|Q\boldsymbol x\|=\|\boldsymbol x\|,变换不改变向量长度,对深度网络梯度传播非常友好。

④ QR矩阵分解

Gram‑Schmidt就是QR分解的推导基础:A=QR

  • Q:标准正交列构成的正交矩阵

  • R:上三角矩阵

大模型求解最小二乘、矩阵求逆、数值线性代数库大量依赖QR分解。

⑤ 提示词、拒绝采样、RLHF

高维向量空间中,把无用/有害方向,通过正交投影剔除,把向量投影到安全子空间。

📝随堂练习题

给定向量

\boldsymbol a_1=\begin{pmatrix} 1 \\ -1 \end{pmatrix},\quad

\boldsymbol a_2=\begin{pmatrix} 2 \\ 0 \end{pmatrix}

  1. 使用格拉姆‑施密特求正交向量组\boldsymbol v_1,\boldsymbol v_2

  2. 再单位化得到标准正交基\boldsymbol e_1,\boldsymbol e_2

  3. 验证\boldsymbol e_1^\mathrm T\boldsymbol e_2=0,且各自模长等于1。

下一讲预告

正交投影,最小二乘,大模型里面拟合、对齐的核心数学工具。

相关推荐
罗狮粉 991 小时前
AI-Gateway — 面向 AI Agent 的本地 Runtime Gateway
人工智能·python·inscode·ai编程
FL16238631291 小时前
电力场景变电站设备识别关键部件识别分割数据集labelme格式1660张15类别
人工智能·机器学习
武子康1 小时前
vLLM 的 token 预算还有余量,为什么请求仍被抢占?
人工智能·llm·agent
人工智能培训1 小时前
大语言模型:从语言理解到通用智能的跃迁
linux·服务器·前端·人工智能
程序员清风1 小时前
生产级智能体平台设计:任务编排、工具管理与运行监控
人工智能·python·aigc
龍德明宇1 小时前
预言机与闭环稳定性-龍德明宇
人工智能·大语言模型llm·负主体性·ai存在论·系统论·控制论
库玛西1 小时前
数据结构与算法之美:树、森林与二叉树全解析
c语言·数据结构·笔记·考研·算法·学习方法
毋小黑1 小时前
753K 参数打赢 SwinIR:CRAFT 用「高频先验」给 Transformer 超分查漏补缺
人工智能·opencv·计算机视觉
小贺儿开发1 小时前
Unity 结合百度AI开放平台 手写文字识别
人工智能·科技·学习·unity·云服务·文字识别·手写文字