人工智能的"训练算法"可以从两个层面理解:一是**优化算法**(如何更新参数),二是**学习范式/训练框架**(如何从数据中学习)。目前主流方法几乎都以**反向传播 + 梯度下降**为基础,再结合不同任务演化出各种算法。
一、深度学习优化器:最核心的训练算法
这是狭义的"训练算法",用于更新神经网络参数。
1. 梯度下降家族
-
**批量梯度下降(BGD)**:用全部样本计算梯度,稳定但慢。
-
**随机梯度下降(SGD)**:每次用一个样本,快但震荡大。
-
**小批量梯度下降(Mini-batch SGD)**:每次用一批样本,是深度学习最常用的基础方法。
更新公式:
\[
\theta_{t+1} = \theta_t - \eta \nabla L(\theta_t)
\]
2. 动量法(Momentum)
引入动量项,抑制震荡、加速收敛:
\[
v_t = \beta v_{t-1} + (1-\beta)\nabla L,\quad \theta_{t+1}=\theta_t-\eta v_t
\]
3. Nesterov 加速梯度(NAG)
先按动量方向"前瞻"一步,再计算梯度,收敛更好。
4. 自适应学习率算法
-
**AdaGrad**:累积历史梯度平方,适合稀疏数据,但学习率会单调下降。
-
**RMSProp**:用指数移动平均代替累积,解决 AdaGrad 学习率过早衰减问题。
-
**Adam**:结合动量 + RMSProp,同时估计一阶矩和二阶矩,并做偏差校正。目前最主流。
-
**AdamW**:Adam 的改进版,将权重衰减解耦,是大模型训练默认选择。
-
**LAMB**:层自适应优化器,支持超大 batch 训练。
二、传统机器学习主流训练算法
-
**线性回归 / 逻辑回归**:梯度下降、牛顿法、L-BFGS。
-
**支持向量机(SVM)**:SMO 算法。
-
**决策树**:ID3、C4.5、CART,贪心选择分裂特征。
-
**集成学习**:
-
Bagging:随机森林。
-
Boosting:AdaBoost、GBDT、XGBoost、LightGBM、CatBoost。
-
**聚类**:K-means(EM 式迭代)、DBSCAN、层次聚类。
-
**降维**:PCA(SVD/特征值分解)、t-SNE、UMAP。
-
**概率模型**:EM 算法、高斯混合模型。
三、自监督与无监督表示学习
这是当前大模型预训练的主流范式。
-
**自编码器(AE)**:重构输入,学习压缩表示。
-
**去噪自编码器(DAE)**:从加噪输入恢复干净数据。
-
**变分自编码器(VAE)**:优化 ELBO,生成建模。
-
**对比学习**:SimCLR、MoCo、BYOL,拉近正样本、推远负样本。
-
**掩码建模**:BERT 的 MLM、MAE,随机遮住部分输入并预测。
-
**自回归建模**:GPT 系列,用前文预测下一个 token。
四、生成模型训练算法
-
**GAN**:生成器与判别器对抗训练,minimax 博弈。
-
**VAE**:变分推断 + 重参数化技巧。
-
**扩散模型**:DDPM、DDIM,学习逐步去噪,是当前图像/视频生成主流。
-
**流模型**:Normalizing Flow,可逆变换。
五、强化学习训练算法
-
**值方法**:Q-learning、SARSA、DQN。
-
**策略梯度**:REINFORCE、A2C、A3C。
-
**Actor-Critic**:DDPG、TD3、SAC。
-
**信赖域/近端方法**:TRPO、PPO,PPO 是目前最常用。
-
**大模型对齐**:RLHF(PPO)、DPO、RLAIF。
六、大模型训练范式
-
**预训练 + 微调**:先大规模自监督预训练,再下游任务微调。
-
**指令微调(SFT)**:用指令-回答数据监督训练。
-
**对齐训练**:RLHF、DPO、PPO,让模型符合人类偏好。
-
**分布式训练算法**:
-
数据并行:AllReduce。
-
模型并行:张量并行、流水线并行。
-
混合并行:Megatron-LM、DeepSpeed ZeRO。
-
优化器:AdamW + 余弦退火 + warmup 最常见。
七、如何选择
-
传统小数据:XGBoost、LightGBM、SVM、随机森林。
-
图像:CNN + SGD/AdamW,扩散模型。
-
序列/NLP:Transformer + AdamW + 自监督预训练。
-
大模型:AdamW + 分布式并行 + SFT/RLHF/DPO。
-
强化学习:PPO、SAC、DQN。
-
生成任务:GAN、VAE、扩散模型。
总结
当前 AI 最主流的训练算法可以概括为:
**反向传播 + 小批量梯度下降 + Adam/AdamW 优化器 + 自监督预训练 + 微调/对齐**。
传统机器学习则常用 XGBoost、LightGBM、SVM、随机森林等;强化学习以 PPO、SAC、DQN 为主;生成模型以扩散模型和 GAN 为代表。实际选择取决于数据规模、任务类型和计算资源。