本文汇总了大模型从预训练、持续预训练、后训练微调、RLHF对齐、主动学习、注意力优化、KV缓存、量化、归一化、数据集范式、评测体系等知识。
一、大模型完整训练五阶段(核心链路)
大模型从原始基座到可上线对话模型,严格分为五个阶段,是所有LLM工程的底层骨架:
1. 预训练阶段(Pre-training)
基于海量无标注通用文本,采用自监督下一个token预测,让模型学习通用语言、语法、世界知识。
输出:基座Base模型。
特点:懂知识、会续写,但听不懂指令、不会对齐人类意图、安全性差。
2. 持续预训练阶段(Continued Pre-training)
属于预训练延伸 ,不是微调。在已有基座基础上,灌入领域无标注文本,依然使用next-token自监督损失。
作用:补领域知识、更新时效性知识、做领域基座适配。
和SFT核心区别:无指令问答对,纯文本续写范式。
3. 后训练阶段(Post-training)
广义总称:基座预训练完成后,所有对齐人类意图的训练统称为后训练。
包含两大核心:SFT有监督微调 + RLHF/DPO人类偏好对齐。
4. 有监督微调SFT
使用高质量指令-回答配对数据训练,只对回答部分计算loss。
核心作用:让模型听懂人类指令、规范输出格式、学会任务范式。
局限:只能模仿标注数据,无法区分回答好坏,存在啰嗦、幻觉、不优质问题。
5. 人类反馈强化学习RLHF/DPO
基于人类偏好排序数据,优化回答质量、简洁性、真实性、安全性。
传统RLHF分为:奖励模型RM训练 + PPO强化训练;
工业界主流:DPO直接替代PPO,无需单独训练RM,链路更简单、更稳。
核心:SFT学"对不对",DPO学"好不好"。
二、五大训练链路核心区别(面试必背)
| 阶段 | 数据形式 | 训练范式 | 核心价值 |
|---|---|---|---|
| 预训练 | 海量无标注文本 | 自监督next-token | 学习通用知识与语言能力 |
| 持续预训练 | 领域无标注文本 | 自监督next-token | 领域知识增强、时效更新 |
| SFT微调 | 指令问答对 | 有监督微调 | 学会服从指令、规范输出 |
| RLHF/DPO | 偏好排序数据 | 强化/偏好对齐 | 优化回答质量、安全、风格 |
| 主动学习 | 海量未标注数据 | 数据筛选方法论 | 低成本挖掘高价值难例样本 |
三、主动学习与业务负反馈闭环
1. 核心思想
不随机标注数据,用模型从未标注池中自动筛选信息增益最大的样本人工标注,以极低标注成本持续提升模型。
2. 三大采样策略
-
不确定性采样:选模型预测最犹豫、熵最大的样本;
-
委员会查询QBC:多模型预测分歧最大的样本;
-
多样性采样:避免样本扎堆,保证场景覆盖。
3. 主动学习 vs 业务BadCase负反馈
-
负反馈:只收集已经出错的线上坏案例,治标不治本,容易过拟合;
-
主动学习:不仅修复已出错样本,还能挖掘潜在风险、模型不确定但未暴露的难例,做到风险前置。
工业最佳实践:离线主动挖掘 + 线上负反馈闭环 + 混入正常样本防偏差。
四、大模型评估体系(学术 vs 工业落地)
1. 核心金句
海量数据下,业务评估不依赖统计学完美,依赖高频体感 + 负反馈驱动迭代。
2. 学术评测(Harness框架)
lm-evaluation-harness 核心理念:
一切皆插件,一切皆有迹可循
-
一切皆插件:模型后端、评测任务、指标全部可插拔,无需改动核心逻辑;
-
一切皆有迹可循:全量保存prompt、输出、标准答案、配置,可回溯、可复现、可做badcase分析。
作用:版本回归兜底,防止模型退化,不能替代线上真实评测。
3. 工业业务评估逻辑
-
不迷信全局准确率:统计均值会掩盖高频坏case;
-
优先保障Top高频流量场景,容忍极低频长尾错误;
-
以用户体感、会话完成率、重试率、点踩率为核心指标;
-
数据飞轮:线上负反馈回流 → 清洗筛选 → 增量微调迭代。
五、注意力机制优化与KV Cache体系
1. 推理两阶段
-
Prefill阶段:全量prompt一次性计算,计算密集型,瓶颈在算力;
-
Decode阶段:逐token生成,复用KV缓存,访存密集型,瓶颈在显存带宽。
2. KV Cache核心作用
缓存每一层历史K、V,避免每步重复计算,将Decode复杂度从O(N²)降为O(N),是LLM高速推理的核心。
痛点:KV Cache显存占用通常超过模型权重本身,是并发和长上下文的最大瓶颈。
3. 注意力结构演进(降KV显存)
-
MHA:Q/KV头数一致,显存最大;
-
MQA:全部Q头共享一组KV,显存极低、精度损失大;
-
GQA(工业主流):分组共享KV,精度与显存完美折中;
-
MLA:隐向量压缩KV,极致长上下文优化,需重新训练。
4. 工程优化
-
FlashAttention:分块计算、Online Softmax,消除O(N²)中间矩阵,加速Prefill、降显存;
-
PagedAttention(vLLM核心):KV分页内存管理,解决显存碎片、支持前缀缓存、大幅提升并发。
六、模型量化:GPTQ vs AWQ(工业PTQ后量化)
两者均为训练后权重量化(W4A16),无需重训练,权重4bit、激活FP16。
1. GPTQ
基于Hessian二阶信息,逐层最小化输出误差,逐列补偿量化误差。
优点:通用精度高、生态成熟、Marlin内核吞吐极强,适合大规模线上生产。
缺点:量化校准计算量大、速度慢。
2. AWQ
激活感知量化,识别高贡献权重通道,数学等价缩放保护重要权重,无需Hessian。
优点:量化速度极快、对话生成场景精度更优、小模型/低比特更稳。
缺点:对校准集分布匹配度敏感。
3. 选型总结
-
大厂量产、通用任务、追求极致稳定:GPTQ;
-
自研微调、对话场景、快速量化:AWQ。
七、四大归一化彻底辨析(面试高频坑)
1. 数据集归一化(数据预处理)
对输入特征做MinMax/Z-Score缩放,属于特征尺度对齐优化。
作用:抹平特征量纲差异、优化损失地形、加速梯度收敛。
注意:树模型不需要归一化;神经网络、SVM必须归一化。
2. LayerNorm / RMSNorm(LLM标配)
归一网络激活特征,稳定层输入分布、缓解梯度消失、加速收敛。
LLM使用Pre-Norm架构,每一层Attention/FFN前归一激活。
3. WeightNorm 权重归一化
对模型可训练权重参数重参数化:W = g·v/||v||
将权重方向与模长解耦,不依赖batch统计,小batch/RL/RNN场景稳定。
重点:LLM Transformer完全不用WeightNorm。
4. Softmax 归一(极易混淆)
作用于注意力分数logits,输出概率分布,求和为1;
属于激活变换,不是权重归一、不是数据归一。
核心结论:归一化本质是重参数化/数据预处理优化,不更新参数,而是让优化器更好收敛。
八、PyTorch两大数据集范式
1. 映射型数据集 Map-style
继承Dataset,实现__getitem__、len,支持随机下标访问。
特点:可shuffle、可索引、适合中小静态数据集、SFT微调。
2. 迭代型数据集 Iterable-style
继承IterableDataset,实现__iter__,流式惰性加载、无随机索引。
特点:适配TB级预训练语料、无需全量加载内存;无法直接shuffle,多进程需手动分片防重复。
九、AI行业经典金句(可直接背诵)
-
Garbage in,garbage out:数据质量决定模型上限,模型能力只是下限。
-
一切皆插件,一切皆有迹可循:评测框架插件化、实验可回溯、可复现。
-
Think step by step:思维链显式推理,大幅提升大模型逻辑能力。
-
静态指标只做兜底,业务迭代靠高频体感与负反馈闭环。
-
预训练学知识,SFT学指令,DPO学偏好,三者不可替代。
-
Prefill是计算瓶颈,Decode是显存带宽瓶颈。
-
归一化不直接求解最优解,而是把优化问题变得更容易求解。
-
映射数据集先有索引再取数据,迭代数据集边迭代边产出数据。