在深度学习、大模型落地、NLP算法面试中,学习范式的区分 是高频重难点。很多同学容易混淆:自监督和无监督的区别、主动学习是不是半监督、弱监督和自训练怎么区分、迁移学习和微调的关联等。本文是对7种核心机器学习范式的梳理。
一、前置核心分类逻辑
所有机器学习范式,核心差异只围绕三个维度:
-
标签来源:人工标注 / 数据自生成伪标签 / 模型生成伪标签 / 弱 noisy 标签
-
数据使用方式:仅标注数据 / 标注+无标注混用 / 迭代筛选标注
-
训练目标:拟合任务、学习数据分布、迁移通用能力、降低标注成本
先记住终极底层区别:谁提供监督信号、怎么利用无标注数据、是否迭代扩充标注集。
二、七大范式逐一带懂(定义+核心+场景+误区)
1. 有监督学习(Supervised Learning)
核心定义 :使用**人工精准标注的成对数据(输入+真实标签)**训练模型,让模型学习输入到目标输出的映射关系。
核心特点:
-
监督信号:人工真实标签,质量高、无噪声
-
数据:全部为标注数据,无标注数据不参与训练
-
目标:拟合具体下游任务
实战场景:
-
传统CV:图像分类、目标检测
-
NLP:POS词性标注、NER命名实体识别、文本分类
-
大模型:SFT有监督微调(prompt-response人工标注对)
优缺点:效果精准,但标注成本极高,海量数据难以落地。
2. 自监督学习(Self-Supervised Learning, SSL)
核心定义 :属于无人工标注的监督学习 ,无需人工标签,从原始数据中自动构造伪标签,通过预训练任务学习数据底层分布与通用特征。
核心特点:
-
监督信号:数据自身生成伪标签,无人工参与
-
数据:海量无标注原始数据
-
目标:学习通用语义、语法、视觉特征,不绑定具体下游任务
实战场景:
-
LLM基座预训练:GPT系列下一个token预测、BERT掩码预测
-
CV:MAE图像掩码重构、CLIP图文匹配
关键误区 :自监督 ≠ 无监督学习。无监督是聚类、降维,无预测任务;自监督是有预测任务、有伪标签的专属范式。
3. 半监督学习(Semi-Supervised Learning)
核心定义 :同时使用少量人工标注数据 + 大量无标注数据联合训练,用少量精准标签引导模型,利用无标注数据优化数据分布建模能力。
核心特点:
-
无标注数据不经过人工标注,直接参与训练
-
核心手段:模型生成伪标签、一致性正则化等(FixMatch、Mean Teacher)
-
标注集固定,不会人工新增标注样本
一句话总结:人标少量数据,模型自己"自学"大量无标注数据。
4. 主动学习(Active Learning)
核心定义 :一种智能样本筛选策略 ,而非独立学习范式。在标注预算有限时,从无标注池中挑选信息量最大、不确定性最高的样本,交给人工标注后迭代加入训练集。
核心流程:少量标注数据训模型 → 筛选高价值无标注样本 → 人工标注 → 扩充训练集迭代训练
核心特点:
-
无标注样本不会直接训练,必须人工打标后才能使用
-
核心目标:用最少标注成本,最大化模型效果
重点面试结论 :主动学习不属于半监督学习。二者维度不同:半监督是数据训练范式,主动学习是标注采样策略,可组合使用。
5. 弱监督学习(Weakly Supervised Learning)
核心定义 :使用不精准、不完整、有噪声、粗粒度的监督信号训练模型,替代昂贵的精准人工标注。
弱标签三类形态:
-
不完整:只有文档级标签,无token/像素级标签(如文本整体情感,无分句标签)
-
不精准:标签存在错误、噪声
-
粗粒度:标签粒度远粗于任务需求
实战场景:远程监督关系抽取、海量舆情粗分类、无精细标注的工业数据建模。
核心区别:半监督是"无标签",弱监督是"有标签,但标签质量差"。
6. 自训练(Self-Training)
核心定义 :最简单、最经典的半监督实现算法。先用少量标注数据训初始模型,再用模型给无标注数据打伪标签,筛选高置信度样本并入训练集,迭代训练。
核心流程:标注数据训模型 → 模型给无标注数据打伪标签 → 筛选高置信样本 → 重新训练
关键区分:
-
自训练是具体算法
-
半监督是范式大类
-
主动学习是人工迭代标数据 ,自训练是模型自动标数据
7. 迁移学习(Transfer Learning)
核心定义 :将模型在源域、源任务 上学到的通用知识,迁移到目标域、目标任务,解决目标任务数据少、训练难的问题。
核心逻辑:不用从零训练,复用预训练基座知识。
LLM完整链路(迁移学习落地典范):
-
源任务(自监督预训练):海量文本学习通用语言能力
-
迁移到目标任务:SFT、NER、POS、文本分类等下游任务微调
核心价值:大幅降低下游任务数据需求、训练成本、收敛难度。
三、核心范式终极对比表(面试直接背)
| 学习范式 | 监督信号来源 | 无标注数据用法 | 核心目标 |
|---|---|---|---|
| 有监督学习 | 人工精准标签 | 不使用 | 精准拟合下游任务 |
| 自监督学习 | 数据自动生成伪标签 | 全量使用 | 学习通用数据分布 |
| 半监督学习 | 少量人工标签+模型伪标签 | 直接参与训练 | 利用无标注提升泛化 |
| 主动学习 | 迭代新增人工标签 | 筛选后人工标注再使用 | 降低标注成本 |
| 弱监督学习 | 粗粒度/噪声/不完整弱标签 | 一般不使用 | 规避高精度标注成本 |
| 自训练 | 人工标签+模型高置信伪标签 | 模型打标后使用 | 低成本扩充训练数据 |
| 迁移学习 | 跨任务知识迁移 | 视场景而定 | 复用通用能力,适配新任务 |
四、高频易错边界区分(面试必问)
1. 主动学习 vs 半监督学习
主动学习:找人标数据,无标注→人工标注→有标注;
半监督学习:模型自学数据,无标注不经过人工,直接用伪标签训练;
结论:二者无归属关系,可叠加使用。
2. 自监督 vs 自训练
自监督:伪标签数据自生(预测下一个token、掩码预测),预训练阶段;
自训练:伪标签模型生成,下游微调半监督方案;
3. 半监督 vs 弱监督
半监督:数据有有标签+无标签;
弱监督:数据全部有标签,但标签质量差;
4. SFT、POS、NER 所属范式
预训练(GPT/BERT):自监督学习;
SFT、POS词性标注、NER命名实体识别:有监督学习;
五、LLM完整训练链路(全范式串联)
自监督预训练(学通用知识) → 迁移学习(迁移基座能力) → 有监督SFT微调(对齐人类指令) → 可选:半监督/自训练扩充数据 / 主动学习筛选高质量标注 / 弱监督处理低成本粗数据 → RLHF强化学习对齐偏好
六、全文终极总结
-
有监督:人工精准标签,任务效果最优、成本最高;
-
自监督:数据自造伪标签,大模型预训练核心;
-
半监督/自训练:模型利用无标注数据,低成本提升泛化能力;
-
主动学习:智能选样本,精准节约标注成本;
-
弱监督:用劣质标签替代精准标注,适配海量低成本数据;
-
迁移学习:跨任务复用知识,是所有微调任务的底层逻辑。