sklearn.preprocessing 的 LabelEncoder 类来对标签进行编码讲解

假设我们有一个标签数据集,它包含了一些文本类别标签,如下所示:

复制代码
labels = ['cat', 'dog', 'cat', 'bird', 'dog', 'bird']

我们希望将这些文本标签转换成数值,以便机器学习模型可以处理。`LabelEncoder` 就是用来做这个转换的工具。下面是使用 `LabelEncoder` 转换标签的过程:

  1. 首先,我们创建 `LabelEncoder` 的一个实例:
复制代码
from sklearn import preprocessing
le = preprocessing.LabelEncoder()
  1. 然后,我们将这个实例拟合到我们的标签数据 上:fit 方法会扫描整个 labels 数组或序列,识别出所有的唯一标签。
复制代码
le.fit(labels)

此时,`LabelEncoder` 会检查所有的标签,并创建一个映射,将每个唯一的标签映射到一个整数。在这个例子中,映射关系可能如下:

  • 'bird' -> 0

  • 'cat' -> 1

  • 'dog' -> 2

  1. 接下来,我们使用 `LabelEncoder` 将原始标签转换成整数:
复制代码
label_numbers = le.transform(labels)
print(label_numbers)

这将输出:

1 2 1 0 2 0

如你所见,文本标签 'cat'、'dog' 和 'bird' 被转换成了整数 1、2 和 0。
值得注意的是,`LabelEncoder` 会按照它们第一次出现的顺序给标签分配数字。在这个例子中,'cat' 是第一个出现的,所以它被分配了数字 1;'dog' 是第二个出现的,所以它被分配了数字 2;'bird' 是第三个出现的,所以它被分配了数字 0。
此外,`LabelEncoder` 还可以用来逆转换,即将整数标签再转换回原始的文本标签。例如:

复制代码
original_labels = le.inverse_transform(label_numbers)
print(original_labels)

这将输出:

'cat' 'dog' 'cat' 'bird' 'dog' 'bird'

这样,我们就可以将模型预测的整数标签转换回人类可读的文本标签。

完整代码:

复制代码
from sklearn import preprocessing
le = preprocessing.LabelEncoder()
labels = ['cat', 'dog', 'cat', 'bird', 'dog', 'bird']
le.fit(labels)
label_numbers = le.transform(labels)
print(label_numbers)
original_labels = le.inverse_transform(label_numbers)
print(original_labels)
相关推荐
金井PRATHAMA5 小时前
描述逻辑(Description Logic)对自然语言处理深层语义分析的影响与启示
人工智能·自然语言处理·知识图谱
Rock_yzh5 小时前
AI学习日记——参数的初始化
人工智能·python·深度学习·学习·机器学习
CiLerLinux6 小时前
第四十九章 ESP32S3 WiFi 路由实验
网络·人工智能·单片机·嵌入式硬件
青衫客366 小时前
基于 Python 构建的安全 gRPC 服务——TLS、mTLS 与 Casbin 授权实战
python·安全·微服务
-dzk-7 小时前
【3DGS复现】Autodl服务器复现3DGS《简单快速》《一次成功》《新手练习复现必备》
运维·服务器·python·计算机视觉·3d·三维重建·三维
七芒星20238 小时前
多目标识别YOLO :YOLOV3 原理
图像处理·人工智能·yolo·计算机视觉·目标跟踪·分类·聚类
Learn Beyond Limits8 小时前
Mean Normalization|均值归一化
人工智能·神经网络·算法·机器学习·均值算法·ai·吴恩达
摩羯座-185690305948 小时前
爬坑 10 年!京东店铺全量商品接口实战开发:从分页优化、SKU 关联到数据完整性闭环
linux·网络·数据库·windows·爬虫·python
ACERT3338 小时前
5.吴恩达机器学习—神经网络的基本使用
人工智能·python·神经网络·机器学习
韩立学长9 小时前
【开题答辩实录分享】以《基于python的奶茶店分布数据分析与可视化》为例进行答辩实录分享
开发语言·python·数据分析