一、AI、ML、DL 之间的关系
1. 什么是机器学习
机器学习(Machine Learning,ML)就是让计算机从历史数据中自动寻找规律,再利用这些规律预测新的数据。
可以把机器学习类比为人积累经验:
- 人经历很多事情以后,会总结出经验;
- 机器读取大量历史数据以后,会训练出模型;
- 人遇到新问题时,根据经验作出判断;
- 机器收到新数据时,根据模型给出预测。
例如,我们给机器以下历史数据:
| 房屋面积 | 房价 |
|---|---|
| 87㎡ | 160万元 |
| 102㎡ | 220万元 |
| 123㎡ | 250万元 |
| 150㎡ | 320万元 |
机器可以从中学习"面积和房价之间的关系"。以后输入一套 110㎡ 的新房,模型就可以预测它大约值多少钱。
需要注意:机器学习得到的是一种统计规律,所以预测结果通常不是百分之百准确。

2. 人工智能 AI
人工智能(Artificial Intelligence,AI) 是一个很大的研究领域,目标是让机器拥有类似人类的感知、判断、推理和决策能力。
例如:
- 图像识别;
- 语音识别;
- 自动驾驶;
- 智能问答;
- 机器人决策。
人工智能不完全等于机器学习。早期人工智能也大量依靠人工编写规则。
3. 机器学习 ML
机器学习是实现人工智能的一种重要途径。
传统程序由程序员直接编写判断规则;机器学习则让算法从数据中自动学习规则。
4. 深度学习 DL

深度学习(Deep Learning,DL)是机器学习的一个分支。
深度学习主要使用多层人工神经网络处理数据。因为网络中包含很多层,所以称为"深度"学习。
深度学习常用于:
- 图像识别;
- 语音识别;
- 自动驾驶感知;
- 自然语言处理;
- 大语言模型。
5. 深度学习和神经网络
人工神经网络借鉴了生物神经元处理信息的思路,但它本质上仍然是数学模型,并不是真正的人脑。
一个简单的人工神经元包含:
latex
x₁、x₂、x₃......:输入特征
w₁、w₂、w₃......:每个特征对应的权重
b:偏置
神经元先进行加权求和:
latex
z = w₁x₁ + w₂x₂ + w₃x₃ + ... + b
然后通过激活函数得到输出:
latex
output = 激活函数(z)
可以把权重理解为模型认为每个输入特征有多重要。训练神经网络,本质上就是不断调整大量的权重和偏置,让输出越来越接近正确答案。
多个神经元组成一层,多层神经网络连接起来,就形成深度神经网络:
latex
输入层 → 多个隐藏层 → 输出层
6. AI、ML、DL 的包含关系
latex
人工智能 AI
└── 机器学习 ML
└── 深度学习 DL
└── 大语言模型 LLM
大语言模型建立在深度学习之上。它通过规模很大的神经网络,从海量文本中学习语言规律,然后完成问答、生成、翻译、总结和代码编写等任务。
记忆口诀:机器学习是实现人工智能的一种途径,深度学习是机器学习的一种方法

7. 人工智能的简单发展历史
1956 年,约翰·麦卡锡等人在达特茅斯会议上正式提出"人工智能"概念,因此 1956 年通常被称为人工智能元年,约翰·麦卡锡也常被称为"人工智能之父"。
二、人工智能发展的三要素
AI 发展的三个基础要素是:
latex
数据 + 算法 + 算力
三者相互配合,缺一不可。

1. 数据
数据相当于机器学习使用的"教材"。模型通过大量数据学习其中的规律。
数据应当具备:
- 数量足够;
- 内容准确;
- 场景覆盖全面;
- 标签尽量正确;
- 重复和错误数据尽量少。
课件中"数据决定模型训练的上限"的意思是:如果数据本身错误,或者缺少关键场景,再复杂的算法也很难得到好结果。
数据并不是越多就一定越好,高质量数据通常比单纯堆积数量更重要。
2. 算法
算法相当于"学习方法"。算法负责从数据中寻找规律,并训练出模型。
不同问题需要选择不同算法,例如:
- 线性回归:预测连续数值;
- 逻辑回归:完成分类;
- KNN:根据附近样本进行分类或回归;
- K-Means:对没有标签的数据进行聚类;
- 神经网络:学习复杂关系。
3. 算力
算力相当于"学习所需要的硬件能力",通常由 CPU、GPU、NPU 等硬件提供。
复杂模型需要进行大量矩阵运算。如果算力不足:
- 模型训练时间会很长;
- 无法处理足够多的数据;
- 可能无法训练规模很大的模型。
4. 训练与推理中的三要素
latex
训练阶段:数据 + 算法 + 算力 → 训练好的模型
推理阶段:新数据 → 训练好的模型 → 预测结果
大模型也是如此:训练大模型需要海量数据和大量 GPU;我们平时向大模型提问,主要是在执行推理。
记忆口诀:数据是教材,算法是学习方法,算力是学习工具。
三、算法的学习方式
1. 基于规则的学习

基于规则的方式,是程序员先观察数据、总结规律,再使用 if-else 把规则写进程序。
例如判断垃圾邮件:
python
if "低价促销" in title:
result = "垃圾邮件"
elif sender_is_abnormal:
result = "垃圾邮件"
else:
result = "正常邮件"
完整过程如下:
latex
1. 收集多个历史样本
2. 人工观察并发现规律
3. 程序员把规律写成规则
4. 输入一个新的邮件样本
5. 程序执行提前写好的规则
6. 输出"垃圾邮件"或"正常邮件"
优点:
- 逻辑清楚;
- 容易理解和解释;
- 规则较少时容易实现。
缺点:
- 规则多了以后很难维护;
- 程序员无法提前列出所有情况;
- 面对图像、语音、自然语言等复杂数据时很难手工编写规则。
2. 基于模型的学习

基于模型的机器学习,不是让程序员手工写出全部规则,而是让算法从大量数据中自动寻找规律,最终得到一个模型。
完整过程如下:
latex
1. 准备大量历史数据
2. 使用算法进行学习
3. 反复调整并总结规律,得到模型
4. 输入一个新的样本
5. 模型根据学到的规律进行预测
6. 输出预测结果
例如识别大象:
- 准备许多动物图片和对应的正确名称;
- 算法反复学习图片与名称之间的关系;
- 训练完成后得到动物识别模型;
- 输入一张模型没见过的新图片;
- 模型预测图片中的动物是不是大象。
3. 训练与预测
基于模型的机器学习分为两个阶段。
训练(Training)
训练就是让算法反复查看历史数据,调整模型内部参数,使预测结果越来越接近正确答案。
latex
训练数据 → 学习算法 → 训练好的模型
预测或推理(Prediction / Inference)
训练完成后,把新数据输入模型并得到结果,这个过程称为预测或推理。
latex
新数据 → 训练好的模型 → 预测结果
二者不能混淆:
- 训练是在学习规律;
- 推理是在使用规律。
4. 房价预测示例

假设只研究面积和房价的关系,可以用一条直线进行近似:
latex
房价 = a × 面积 + b
数学形式是:
latex
y = ax + b
其中:
x:房屋面积,是输入;y:房价,是要预测的结果;a:直线斜率;b:截距;a、b:模型需要通过训练得到的参数。
训练的过程,就是根据历史数据寻找比较合适的 a 和 b,让直线尽可能接近所有数据点,使整体预测误差尽量小。
训练完成后,把 110㎡ 代入模型,就可以得到预测房价。
latex
模型:y = ax + b 这种关系形式
参数:模型中的 a 和 b
训练:根据数据寻找合适的 a 和 b
预测:把新的 x 代入训练好的模型,得到 y
5. 两种方式的核心区别
| 对比项 | 规则方式 | 模型方式 |
|---|---|---|
| 规律由谁得到 | 人工总结 | 算法从数据中学习 |
| 程序员主要工作 | 编写规则 | 准备数据、特征、算法并评价模型 |
| 适合的问题 | 规则清晰、变化少 | 规律复杂、数据较多 |
| 最终产物 | 一组规则代码 | 训练好的模型 |
四、数据集划分
在学习数据集划分之前,先掌握样本、特征和标签三个核心概念。
1. 样本、特征、标签
假设要根据学员信息预测就业薪资:
| 培训学科 | 作业成绩 | 学历 | 工作经验 | 工作地点 | 就业薪资 |
|---|---|---|---|---|---|
| Java | 90 | 本科 | 1年 | 北京 | 14k |
| AI | 92 | 研究生 | 2年 | 上海 | 25k |
| 测试 | 80 | 专科 | 0年 | 武汉 | 7k |
样本(Sample)
表格中的一行数据就是一个样本,有时也叫一条记录。
例如"AI、92分、研究生、2年经验、上海、25k"是一名学员的完整样本。多个样本组合起来就是数据集。
特征(Feature)
模型用来进行判断的输入信息叫作特征 ,通常使用大写 X 表示。
这个例子中的特征包括:
- 培训学科;
- 作业成绩;
- 学历;
- 工作经验;
- 工作地点。
"学员编号"一般只是身份标识,不能反映薪资规律,所以通常不作为有效特征。
标签(Label / Target)
希望模型预测的答案叫作标签 或目标值 ,通常使用小写 y 表示。
这个例子中,"就业薪资"就是标签。
X 和 y 的关系
latex
X:给模型看的条件,即输入特征
y:希望模型给出的答案,即标签
训练:模型学习 X 和 y 之间的关系
预测:输入新的 X,模型输出预测的 y
在数学中,一条有标签的样本可以写成 (Xᵢ, yᵢ)。
2. 为什么要划分数据集
如果把所有数据都交给模型训练,再使用同一批数据评价模型,就像学生提前背下了考试原题。即使得分很高,也不能证明他会解决新题。
因此,数据至少要划分为:
- 训练集(training set):用来训练模型;
- 测试集(testing set):用来测试模型面对新数据时的能力。
常见划分比例:
- 训练集 80%,测试集 20%;
- 训练集 70%,测试集 30%。
3. 四个重要变量

| 变量名 | 含义 |
|---|---|
X_train |
训练集中的特征 |
y_train |
训练集中的标签 |
X_test |
测试集中的特征 |
y_test |
测试集中的真实标签 |
训练和测试的过程:
latex
X_train + y_train → 训练模型
X_test → 模型预测 → y_pred
y_pred 与 y_test 比较 → 评价模型
4. 验证集
课件入门阶段先讲训练集和测试集。实际项目中还经常加入验证集(validation set):
latex
训练集:训练模型、学习参数
验证集:选择模型、调整超参数
测试集:最后进行一次客观评价
最重要的原则:测试集不能参与训练,否则测试结果将失去客观性。
五、机器学习的算法分类
按照训练数据是否带有标签,以及模型如何获得反馈,机器学习可以分为有监督学习、无监督学习、半监督学习和强化学习。
1. 有监督学习(Supervised Learning)
训练数据中既有特征 X,也有正确标签 y,数据中有标签的,相当于"带着标准答案学习"。
有监督学习主要分为分类和回归。
1.1 分类任务(Classification)
当标签是有限的离散类别时,就是分类任务。它要回答"属于哪一类"。
例如:
- 预测电影类别;
- 判断邮件是垃圾邮件还是正常邮件;
- 判断健康状态是正常还是异常;
- 预测薪资等级是低、中还是高;
- 判断图片中是猫、狗还是大象。
常见算法:KNN、逻辑回归、决策树、支持向量机、神经网络等。
1.2 回归任务(Regression)
当标签是连续数值时,就是回归任务。它要回答"具体是多少"。
例如:
- 预测房价;
- 预测实际就业薪资;
- 预测温度;
- 预测商品销量。
常见算法:线性回归、KNN 回归、决策树回归、神经网络等。
记忆口诀:预测类别用分类,预测连续数值用回归。
2. 无监督学习(Unsupervised Learning)
训练数据中只有特征 X,没有正确标签 y。数据中没有标签,模型需要自己发现数据内部的结构。
最常见的任务是聚类(Clustering),也就是把相似的样本自动分到同一组。
例如:
- 根据消费习惯把用户分成不同群体;
- 根据新闻内容自动归类;
- 从设备数据中发现不同运行模式。
代表算法:K-Means。
3. 半监督学习(Semi-supervised Learning)
一部分训练数据有标签,大部分训练数据没有标签,模型同时利用两部分数据进行学习。
例如,有十万张图片需要分类,但人工全部标注成本很高。可以只标注其中一部分,再配合大量未标注图片训练模型。
4. 强化学习(Reinforcement Learning,RL)
强化学习不会直接告诉智能体每一步的标准答案,而是让智能体不断与环境交互,根据奖励和惩罚学习更好的决策。

| 要素 | 含义 | 孩子走路的例子 |
|---|---|---|
| 智能体 Agent | 作出决策的主体 | 孩子 |
| 环境 Environment | 智能体所在的外部世界 | 有井盖和水坑的道路 |
| 状态 State | 当前环境的信息 | 前方是否有水坑 |
| 动作 Action | 智能体采取的行为 | 向前走、绕开、停下 |
| 奖励 Reward | 环境对结果的评分 | 安全通过得正奖励,踩进水坑得负奖励 |
课件把"环境状态"合并在一起记作四项也可以;进一步学习时,通常会把环境和状态分别理解。
强化学习的基本过程:
latex
智能体观察环境状态
↓
选择并执行一个动作
↓
环境发生变化,并返回奖励
↓
智能体根据奖励调整策略
↓
不断重复,逐渐学会更优的决策
应用场景包括 AlphaGo 围棋、游戏、机器人控制和自动驾驶决策等。
5. 四类学习方式对比
| 学习类型 | 数据有没有标签 | 主要目标 | 典型任务 |
|---|---|---|---|
| 有监督学习 | 有标签 | 学习 X 到 y 的关系 | 分类、回归 |
| 无监督学习 | 没有标签 | 发现数据内部结构 | 聚类 |
| 半监督学习 | 少量有标签,大量无标签 | 同时利用两类数据 | 图片分类等 |
| 强化学习 | 没有直接标准答案,有奖励反馈 | 学习最优决策策略 | 游戏、控制 |
六、机器学习的流程
一个完整的机器学习项目通常按照以下顺序进行:
latex
1. 明确要解决的问题
↓
2. 收集数据
↓
3. 确定特征 X 和标签 y
↓
4. 数据清洗和特征工程
↓
5. 划分训练集和测试集
↓
6. 选择算法并训练模型
↓
7. 使用测试集评价模型
↓
8. 调整数据、特征、算法或参数
↓
9. 部署模型,对新数据进行推理
1. 特征工程的概念
特征工程(Feature Engineering)是利用业务知识和数据处理方法,把原始数据转换成更适合模型学习的特征。
以房价预测为例,可能使用以下特征:
- 房屋面积;
- 所在城市和位置;
- 楼层;
- 朝向;
- 房龄;
- 距离地铁站的距离;
- 学区情况。
房地产中介知道哪些因素会影响房价,这种专业背景知识可以帮助我们选择和加工特征。
2. 常见的特征工程工作
- 选择真正有用的字段;
- 删除无关或重复字段;
- 处理缺失值;
- 处理异常值;
- 把文字类别编码为数值;
- 进行归一化或标准化;
- 根据业务知识组合出新特征。
例如,"北京市朝阳区"是文字,许多传统算法不能直接处理,需要先转换成数值形式。
3. 为什么特征工程重要
如果输入数据错误、遗漏关键因素,或者使用了大量无关字段,模型就很难学到正确规律。
因此,传统机器学习中经常说:
数据和特征决定模型效果的上限,算法负责尽量接近这个上限。
这是一种帮助理解的概括。实际效果还会受到训练方法、模型容量、评价方式和部署环境等因素影响。
七、拟合和泛化等相关概念

1. 拟合(Fitting)
拟合表示模型对数据规律的学习情况。训练模型的过程,在 sklearn 中通常使用 fit() 方法。
模型既不能过于简单,也不能把训练数据记得过细,需要找到合适的复杂程度。
2. 欠拟合(Underfitting)
欠拟合表示模型太简单,或者学习不充分,连训练数据中的主要规律都没有学会。
典型表现:
- 在训练集上表现很差;
- 在测试集上表现也很差。
生活类比:学生连教材中的基础例题都没有学会。
可能的改进方向:
- 增加有效特征;
- 使用表达能力更强的模型;
- 延长训练时间;
- 检查数据是否存在问题。
3. 过拟合(Overfitting)
过拟合表示模型把训练数据记得太细,甚至把噪声也当成规律,因此面对新数据时表现较差。
典型表现:
- 在训练集上表现很好;
- 在测试集上表现明显较差。
生活类比:学生背下了练习题答案,但是题目稍微变化就不会做。
可能的改进方向:
- 增加高质量数据;
- 减少无用特征;
- 降低模型复杂度;
- 使用正则化;
- 使用交叉验证。
4. 泛化(Generalization)
泛化能力是模型在没有参加训练的新数据上的表现能力。
机器学习真正追求的不是让训练集分数最高,而是让模型在新数据上也能表现良好。
latex
欠拟合:训练集差,测试集也差
拟合合适:训练集较好,测试集也较好
过拟合:训练集很好,测试集较差
记忆口诀:欠拟合是没学会,过拟合是只会背题,泛化好才是真的会。
5. 奥卡姆剃刀原则
如果两个模型在新数据上的表现接近,一般优先选择更简单的模型。
原因是简单模型通常:
- 更容易理解;
- 更容易部署;
- 更容易维护;
- 在一些场景下更不容易过拟合。
八、归一化和标准化
不同特征的数值范围可能相差很大,例如:
latex
房屋面积:50~200
房屋总价:1000000~10000000
房间数量:1~6
如果直接把这些数据交给某些算法,数值范围特别大的特征可能对计算结果产生过大影响。因此需要对特征进行缩放。
1. 归一化(Normalization)
归一化通常把数据缩放到固定范围,例如 [0, 1]。
常见公式:
latex
x' = (x - 最小值) / (最大值 - 最小值)
特点:
- 结果通常落在固定区间;
- 直观、容易理解;
- 容易受到极端最大值或最小值的影响。
sklearn 中常用:
python
from sklearn.preprocessing import MinMaxScaler
scaler = MinMaxScaler()
X_scaled = scaler.fit_transform(X)
2. 标准化(Standardization)
标准化把数据转换成均值接近 0、标准差接近 1 的形式。
常见公式:
latex
x' = (x - 均值) / 标准差
特点:
- 不要求结果处于固定区间;
- 通常比归一化更不依赖最大值和最小值;
- 是机器学习中很常用的特征缩放方式。
sklearn 中常用:
python
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
3. 两者对比
| 对比项 | 归一化 | 标准化 |
|---|---|---|
| 常见结果 | 通常在 [0, 1] |
均值约为 0,标准差约为 1 |
| 主要依据 | 最大值、最小值 | 均值、标准差 |
| 是否容易受极端值影响 | 较容易 | 相对较小,但仍会受影响 |
| sklearn 工具 | MinMaxScaler |
StandardScaler |
注意:并不是所有算法都必须进行特征缩放。
- KNN、支持向量机和很多梯度优化算法对特征尺度较敏感;
- 决策树类算法通常不太依赖归一化或标准化。
4. 避免数据泄漏
缩放器只能使用训练集计算参数,然后用相同参数处理测试集:
python
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = scaler.transform(X_test)
不能在全部数据上先执行 fit_transform() 再划分数据集,否则测试集的信息可能提前进入训练过程,这叫作数据泄漏。
九、机器学习中的核心算法

1. 机器学习框架 sklearn
scikit-learn,简称 sklearn,是 Python 中常用的传统机器学习框架。
安装
bash
pip install scikit-learn
导入
python
import sklearn
sklearn 的通用流程
latex
准备 X、y
↓
划分训练集和测试集
↓
创建模型
↓
model.fit(X_train, y_train)
↓
model.predict(X_test)
↓
评价预测结果
最重要的两个方法:
fit(X, y):训练模型;predict(X_new):使用训练好的模型预测新数据。
2. 经典算法:KNN
KNN 的全称是 K-Nearest Neighbors,K 近邻算法。
它的核心思想很直观:
看一个新样本附近距离最近的 K 个邻居,再根据这些邻居作出判断。
KNN 分类
如果最近的 K 个邻居中,大多数属于"猫",就把新样本预测为"猫"。
KNN 回归
如果要预测连续数值,可以取最近 K 个邻居标签的平均值作为预测结果。
如何寻找最近的邻居
需要计算样本之间的距离。最常见的是欧氏距离,可以把它理解为平面上两点之间的直线距离。
这也是 KNN 对特征尺度比较敏感的原因:如果一个特征的数值特别大,它会主导距离计算,所以 KNN 通常需要进行归一化或标准化。
3. 回归算法
回归用于预测连续数值。
核心代表:线性回归。
latex
输入:房屋面积、楼层、位置等特征
输出:预测房价
一个最小的线性回归示例:
python
import numpy as np
from sklearn.linear_model import LinearRegression
# X:房屋面积,每一行是一个样本
X = np.array([[87], [102], [123], [150]])
# y:对应房价,单位为万元
y = np.array([160, 220, 250, 320])
model = LinearRegression()
model.fit(X, y)
# 预测一套110㎡房子的价格
result = model.predict([[110]])
print(result)
4. 分类算法
分类用于预测离散类别。
核心代表之一:逻辑回归。
注意:逻辑回归的名字虽然包含"回归",但它主要用于分类任务。
latex
输入:邮件标题、发件人、正文等特征
输出:垃圾邮件 / 正常邮件
5. 聚类算法
聚类用于没有标签的数据,目标是把相似样本自动分组。
核心代表:K-Means。
latex
输入:用户的年龄、消费金额、购买次数等特征
输出:自动形成的不同用户群体
6. 核心算法速查表
| 算法 | 主要用途 | 最简单的理解 |
|---|---|---|
| KNN | 分类、回归 | 看距离最近的 K 个邻居 |
| 线性回归 | 回归 | 用线性关系预测连续数值 |
| 逻辑回归 | 分类 | 根据计算出的概率判断类别 |
| K-Means | 聚类 | 把相似样本自动分成 K 组 |
| 决策树 | 分类、回归 | 像连续执行多层 if-else |
| 神经网络 | 分类、回归、生成等 | 用多层神经元学习复杂关系 |
现阶段不用急着死记算法公式,先弄清楚每个算法解决什么类型的问题。
十、整章速记
- 机器学习:从历史数据中学习规律,再预测新数据。
- 包含关系:
AI > ML > DL > 大语言模型。 - AI 三要素:数据、算法、算力。
- 规则方式由人总结规律,模型方式由算法从数据中学习规律。
- 训练是在学习规律,推理是在使用规律。
- 一行是一个样本,输入列是特征
X,要预测的列是标签y。 - 训练集用于学习,测试集用于检验,测试集不能参加训练。
- 有标签是有监督学习;没有标签通常是无监督学习。
- 预测类别是分类,预测连续数值是回归,自动分组是聚类。
- 强化学习通过与环境交互,根据奖励学习决策策略。
- 特征工程是把原始数据加工成更适合模型学习的输入。
- 欠拟合是没学会,过拟合是只会背题,泛化好才是真的会。
- 归一化常把数据缩放到
[0, 1],标准化使均值约为 0、标准差约为 1。 - sklearn 中使用
fit()训练模型,使用predict()进行预测。
十一、自测题
1. 预测房价属于分类还是回归?
回归,因为房价是连续数值。
2. 判断邮件是否为垃圾邮件属于什么任务?
分类,因为结果是"垃圾邮件"和"正常邮件"等离散类别。
3. 自动把用户分成不同消费群体,但事先没有类别标签,属于什么任务?
无监督学习中的聚类任务。
4. 为什么不能使用测试集训练模型?
因为测试集用于模拟模型从未见过的新数据。如果模型提前看过测试集,测试结果就不能客观反映泛化能力。
5. 训练集效果很好,测试集效果很差,可能是什么问题?
可能发生了过拟合。
6. 薪资预测表中的"工作经验"和"就业薪资"分别是什么?
"工作经验"是特征 X,"就业薪资"是标签 y。
7. 逻辑回归是回归算法吗?
虽然名字中有"回归",但逻辑回归主要用于分类任务。
8. KNN 为什么通常需要归一化或标准化?
因为 KNN 依赖距离计算。不同特征的数值范围差距过大时,大数值特征会对距离产生过大影响。
十二、下一步学习建议
按照老师 XMind 的后续核心算法路线,可以这样继续:
- 使用 Pandas 读取和观察数据;
- 学会区分特征
X和标签y; - 使用
train_test_split()划分数据集; - 学习归一化和标准化;
- 学习 KNN,建立第一个分类模型;
- 学习线性回归,完成房价预测;
- 学习逻辑回归,理解分类概率;
- 学习 K-Means,理解聚类;
- 学习模型评价指标;
- 再进入神经网络、深度学习和大语言模型。
每次接触一个新问题时,先回答三个问题:
- 输入特征
X是什么? - 要预测的标签
y是什么? - 这是分类、回归、聚类,还是强化学习问题?
只要能先判断清楚这三个问题,机器学习的整体框架就已经建立起来了。