机器学习时候必须要分为训练集、验证集和测试集嘛

在机器学习中,为了准确评估模型的性能和找到最佳的超参数配置,通常将数据集划分为训练集、验证集和测试集。在这种情况下,验证集用于调参和模型选择,而测试集则用于最终的模型评估。

具体流程如下:

  1. 划分数据集:将数据集划分为训练集、验证集和测试集。一般三者比例是0.8:0.1:0.1或者0.6:0.2:0.2。

  2. 训练模型:使用训练集训练模型,并根据验证集上的性能指标进行调参和模型选择。例如,可以尝试不同的超参数组合,选择在验证集上性能最好的模型。

  3. 模型评估:在完成调参和模型选择后,使用测试集对最终选定的模型进行评估。测试集提供了一个客观的度量,用于衡量模型在未见过的数据上的泛化能力。

通过将测试集与验证集分开,可以避免在模型选择过程中过度拟合验证集,并获得更准确的模型性能估计。这样可以确保对模型的评估是基于未直接与模型相关联的数据进行的。

重要的是要注意,在整个调参和模型选择的过程中,测试集应该被严格保留,不参与任何形式的调优和选择。这样可以确保测试集的独立性,并对最终的模型性能提供一个真实的估计。

模板代码:

将数据集划分为训练集、验证集和测试集,比例是0.8:0.1:0.1。

复制代码
from sklearn.model_selection import train_test_split

#0.8:0.1:0.1 划分为训练集、验证集和测试集
# 将数据分为训练集和剩余数据(包括验证集和测试集)
X_train, X_remaining, y_train, y_remaining = train_test_split(X, y, test_size=0.2, random_state=0)
# 将剩余数据分为验证集和测试集
X_val, X_test, y_val, y_test = train_test_split(X_remaining, y_remaining, test_size=0.5, random_state=0)
相关推荐
wudl55664 分钟前
华工科技(000988)2025年4月22日—10月22日
大数据·人工智能·科技
世强硬创小助手6 分钟前
世强硬创平台上新:天钰科技高集成AI SoC,助力客户解锁轻量智能家居新方案
人工智能·科技·智能家居
Tencent_TCB7 分钟前
Gemini CLI接入CloudBase-AI-Toolkit(MCP)保姆级教程
人工智能·ai·ai编程·云开发
俊哥V29 分钟前
AI一周事件(2025年10月15日-10月21日)
人工智能·ai
wperseverance35 分钟前
Pytorch常用层总结
深度学习·机器学习
永霖光电_UVLED1 小时前
FBH公司开发了200 MHz GaN降压变换器模块
人工智能·神经网络·生成对抗网络
说私域1 小时前
流量转化与生态重构:“开源AI智能名片链动2+1模式S2B2C商城小程序”对直播电商的范式革新
人工智能·重构·开源
TextIn智能文档云平台1 小时前
如何让AI更好地理解中文PDF中的复杂格式?
人工智能·pdf
小殊小殊1 小时前
【论文笔记】LTX-Video极致速度的视频生成模型
图像处理·人工智能·深度学习