决策树(Python)

决策树(Decision Tree)

为达到目标,根据一定的条件进行选择的过程,就是决策树,常用于分类

构成元素是结点和边

  • 结点:根据样本的特征作出判断,根节点、叶节点。
  • 边:指示方向。

衡量标准------熵

这里熵表示样本种类的丰富性,样本种类越多越混乱,熵越大;假若全部属于同一类,则熵等于零。

构造的基本思路

随着层数增加,让熵快速降低,降低速率越快,效率越高。

缺点------过拟合

解决------剪枝

  1. 预剪枝:达某条件就停止
  2. 后剪枝:先得树,再加上限制条件(如叶节点个数)进行剪枝。

Python代码

python 复制代码
from sklearn.model_selection import train_test_split
from sklearn.tree import DecisionTreeClassifier
from sklearn.metrics import accuracy_score
import pandas as pd

# 读取数据
data = pd.read_csv('data.csv')

# 假设数据中的最后一列是目标变量,其余列是特征
X = data.iloc[:, :-1]
y = data.iloc[:, -1]

# 将数据集拆分为训练集和测试集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)

# 创建决策树分类器
dt_classifier = DecisionTreeClassifier(random_state=42)

# 训练模型
dt_classifier.fit(X_train, y_train)

# 在测试集上进行预测
y_pred = dt_classifier.predict(X_test)
print(y_pred)
print(y_test)
# 评估模型准确性
accuracy = accuracy_score(y_test, y_pred)
print(f'Model Accuracy: {accuracy}')

附:构造样例数据的实例代码

python 复制代码
# 以通过学生的数学和英语成绩预测是否通过为例
import pandas as pd
import numpy as np
df = pd.DataFrame({
    'Math_Score': [np.random.randint(40, 101) for x1 in range(100)],
    'English_Score': [np.random.randint(40, 101) for x2 in range(100)],
    'Pass': [np.random.randint(0, 2) for x3 in range(100)],
})
df.to_csv('data.csv')
相关推荐
疯狂打码的少年10 分钟前
【数据结构】二叉树的性质(五大性质+计算)
数据结构·笔记·算法
wabs66643 分钟前
关于图论【A*算法 | 卡码网127.骑士的攻击的思考】
数据结构·算法·图论·卡码网·广搜的改进版
CIO_Alliance1 小时前
AI认知系列(3)| 数据、算法、算力、场景四要素协同
人工智能·算法·ipaas·系统集成·企业cio联盟·企业级ai化转型
啥都想学点的研究生1 小时前
一篇文章讲清楚:机器学习的相关概念
人工智能·机器学习
皖山文武2 小时前
逻辑代数基础学习笔记--概述
笔记·学习·机器学习
..Dauntless..2 小时前
手写vector vs std::vector:从功能正确到性能达标
算法
EasyGBS2 小时前
告别“通用AI”的三大痛点:国标GB28181公网平台EasyGBS+DLTM让企业拥有专属AI安防大脑
人工智能·深度学习·机器学习
m0_547486662 小时前
《数据结构与算法》全套PPT课件2026(中国海洋大学)
数据结构·算法
旖旎夜光3 小时前
LeetCode 904:水果成篮(滑动窗口) —— 题解
数据结构·c++·算法·leetcode·滑动窗口
怪奇云呼军3 小时前
G.711、Opus 和重采样会拖慢识别吗?闪电智能VoiceAgent 的音频入口怎么选
java·人工智能·python·算法·云计算·音视频