大模型训练、微调、对齐、推理、量化、优化、数据集等

本文汇总了大模型从预训练、持续预训练、后训练微调、RLHF对齐、主动学习、注意力优化、KV缓存、量化、归一化、数据集范式、评测体系等知识。

一、大模型完整训练五阶段(核心链路)

大模型从原始基座到可上线对话模型,严格分为五个阶段,是所有LLM工程的底层骨架:

1. 预训练阶段(Pre-training)

基于海量无标注通用文本,采用自监督下一个token预测,让模型学习通用语言、语法、世界知识。

输出:基座Base模型。

特点:懂知识、会续写,但听不懂指令、不会对齐人类意图、安全性差

2. 持续预训练阶段(Continued Pre-training)

属于预训练延伸 ,不是微调。在已有基座基础上,灌入领域无标注文本,依然使用next-token自监督损失。

作用:补领域知识、更新时效性知识、做领域基座适配。

和SFT核心区别:无指令问答对,纯文本续写范式。

3. 后训练阶段(Post-training)

广义总称:基座预训练完成后,所有对齐人类意图的训练统称为后训练

包含两大核心:SFT有监督微调 + RLHF/DPO人类偏好对齐。

4. 有监督微调SFT

使用高质量指令-回答配对数据训练,只对回答部分计算loss。

核心作用:让模型听懂人类指令、规范输出格式、学会任务范式

局限:只能模仿标注数据,无法区分回答好坏,存在啰嗦、幻觉、不优质问题。

5. 人类反馈强化学习RLHF/DPO

基于人类偏好排序数据,优化回答质量、简洁性、真实性、安全性。

传统RLHF分为:奖励模型RM训练 + PPO强化训练;

工业界主流:DPO直接替代PPO,无需单独训练RM,链路更简单、更稳。

核心:SFT学"对不对",DPO学"好不好"

二、五大训练链路核心区别(面试必背)

阶段 数据形式 训练范式 核心价值
预训练 海量无标注文本 自监督next-token 学习通用知识与语言能力
持续预训练 领域无标注文本 自监督next-token 领域知识增强、时效更新
SFT微调 指令问答对 有监督微调 学会服从指令、规范输出
RLHF/DPO 偏好排序数据 强化/偏好对齐 优化回答质量、安全、风格
主动学习 海量未标注数据 数据筛选方法论 低成本挖掘高价值难例样本

三、主动学习与业务负反馈闭环

1. 核心思想

不随机标注数据,用模型从未标注池中自动筛选信息增益最大的样本人工标注,以极低标注成本持续提升模型。

2. 三大采样策略

  • 不确定性采样:选模型预测最犹豫、熵最大的样本;

  • 委员会查询QBC:多模型预测分歧最大的样本;

  • 多样性采样:避免样本扎堆,保证场景覆盖。

3. 主动学习 vs 业务BadCase负反馈

  • 负反馈:只收集已经出错的线上坏案例,治标不治本,容易过拟合;

  • 主动学习:不仅修复已出错样本,还能挖掘潜在风险、模型不确定但未暴露的难例,做到风险前置。

工业最佳实践:离线主动挖掘 + 线上负反馈闭环 + 混入正常样本防偏差

四、大模型评估体系(学术 vs 工业落地)

1. 核心金句

海量数据下,业务评估不依赖统计学完美,依赖高频体感 + 负反馈驱动迭代

2. 学术评测(Harness框架)

lm-evaluation-harness 核心理念:

一切皆插件,一切皆有迹可循

  • 一切皆插件:模型后端、评测任务、指标全部可插拔,无需改动核心逻辑;

  • 一切皆有迹可循:全量保存prompt、输出、标准答案、配置,可回溯、可复现、可做badcase分析。

作用:版本回归兜底,防止模型退化,不能替代线上真实评测。

3. 工业业务评估逻辑

  • 不迷信全局准确率:统计均值会掩盖高频坏case;

  • 优先保障Top高频流量场景,容忍极低频长尾错误;

  • 以用户体感、会话完成率、重试率、点踩率为核心指标;

  • 数据飞轮:线上负反馈回流 → 清洗筛选 → 增量微调迭代。

五、注意力机制优化与KV Cache体系

1. 推理两阶段

  • Prefill阶段:全量prompt一次性计算,计算密集型,瓶颈在算力;

  • Decode阶段:逐token生成,复用KV缓存,访存密集型,瓶颈在显存带宽。

2. KV Cache核心作用

缓存每一层历史K、V,避免每步重复计算,将Decode复杂度从O(N²)降为O(N),是LLM高速推理的核心。

痛点:KV Cache显存占用通常超过模型权重本身,是并发和长上下文的最大瓶颈。

3. 注意力结构演进(降KV显存)

  • MHA:Q/KV头数一致,显存最大;

  • MQA:全部Q头共享一组KV,显存极低、精度损失大;

  • GQA(工业主流):分组共享KV,精度与显存完美折中;

  • MLA:隐向量压缩KV,极致长上下文优化,需重新训练。

4. 工程优化

  • FlashAttention:分块计算、Online Softmax,消除O(N²)中间矩阵,加速Prefill、降显存;

  • PagedAttention(vLLM核心):KV分页内存管理,解决显存碎片、支持前缀缓存、大幅提升并发。

六、模型量化:GPTQ vs AWQ(工业PTQ后量化)

两者均为训练后权重量化(W4A16),无需重训练,权重4bit、激活FP16。

1. GPTQ

基于Hessian二阶信息,逐层最小化输出误差,逐列补偿量化误差。

优点:通用精度高、生态成熟、Marlin内核吞吐极强,适合大规模线上生产。

缺点:量化校准计算量大、速度慢。

2. AWQ

激活感知量化,识别高贡献权重通道,数学等价缩放保护重要权重,无需Hessian。

优点:量化速度极快、对话生成场景精度更优、小模型/低比特更稳。

缺点:对校准集分布匹配度敏感。

3. 选型总结

  • 大厂量产、通用任务、追求极致稳定:GPTQ;

  • 自研微调、对话场景、快速量化:AWQ。

七、四大归一化彻底辨析(面试高频坑)

1. 数据集归一化(数据预处理)

对输入特征做MinMax/Z-Score缩放,属于特征尺度对齐优化

作用:抹平特征量纲差异、优化损失地形、加速梯度收敛。

注意:树模型不需要归一化;神经网络、SVM必须归一化。

2. LayerNorm / RMSNorm(LLM标配)

归一网络激活特征,稳定层输入分布、缓解梯度消失、加速收敛。

LLM使用Pre-Norm架构,每一层Attention/FFN前归一激活。

3. WeightNorm 权重归一化

模型可训练权重参数重参数化:W = g·v/||v||

将权重方向与模长解耦,不依赖batch统计,小batch/RL/RNN场景稳定。

重点:LLM Transformer完全不用WeightNorm

4. Softmax 归一(极易混淆)

作用于注意力分数logits,输出概率分布,求和为1;

属于激活变换,不是权重归一、不是数据归一

核心结论:归一化本质是重参数化/数据预处理优化,不更新参数,而是让优化器更好收敛。

八、PyTorch两大数据集范式

1. 映射型数据集 Map-style

继承Dataset,实现__getitem__、len支持随机下标访问

特点:可shuffle、可索引、适合中小静态数据集、SFT微调。

2. 迭代型数据集 Iterable-style

继承IterableDataset,实现__iter__,流式惰性加载、无随机索引

特点:适配TB级预训练语料、无需全量加载内存;无法直接shuffle,多进程需手动分片防重复。

九、AI行业经典金句(可直接背诵)

  1. Garbage in,garbage out:数据质量决定模型上限,模型能力只是下限。

  2. 一切皆插件,一切皆有迹可循:评测框架插件化、实验可回溯、可复现。

  3. Think step by step:思维链显式推理,大幅提升大模型逻辑能力。

  4. 静态指标只做兜底,业务迭代靠高频体感与负反馈闭环。

  5. 预训练学知识,SFT学指令,DPO学偏好,三者不可替代。

  6. Prefill是计算瓶颈,Decode是显存带宽瓶颈。

  7. 归一化不直接求解最优解,而是把优化问题变得更容易求解。

  8. 映射数据集先有索引再取数据,迭代数据集边迭代边产出数据。

相关推荐
YOLO数据集集合6 小时前
蚊子视觉验证数据集 | 蚊虫识别 疟疾防控 病媒生物 细粒度分类 YOLO格式 深度学习数据集
深度学习·yolo·分类·数据集·蚊子分类·蚊虫分类·蚊虫识别
Lee_jerome1 天前
python神经网络编程入门(四十四)——微调预训练 BERT 做下游任务
微调·bert·迁移学习·文本分类·预训练·小样本·冻结特征
像风一样自由20201 天前
14.什么时候用pgvector什么时候单独部署Milvus
postgresql·大模型·微调·milvus
@HNUSTer5 天前
基于 GEE 的 Sentinel-2 海岸线自动提取:从NDWI水体指数到Canny边缘检测全流程
云计算·数据集·遥感大数据·gee·云平台·canny边缘检测·sentinel-2
weixin_440213295 天前
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子
vllm·大模型推理·decode·kv cache·prefill·llm 部署
@HNUSTer5 天前
基于 GEE 的 LST 降尺度建模——利用 Sentinel-2 和 SRTM 提升 Landsat 热红外分辨率至 10 米
云计算·数据集·遥感大数据·gee·云平台·随机森林回归模型·多源遥感与随机森林回归
孙启超9 天前
【大模型应用开发】LLM 到底是什么,以及它是怎么训练的
人工智能·lora·llm·微调·sft·token·rlhf
林间码客10 天前
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”
sft·强化学习·grpo·agentic-rl
XLYcmy11 天前
小红书 算法一面 四
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数