决策树项目——电信客户流失预测

AUC性能测量

在机器学习中,性能测量是一项基本任务。因此,当涉及到分类问题时,我们可以依靠AUC - ROC曲线。当我们需要检查或可视化多类分类问题的性能时,我们使用AUC(曲线下面积)ROC(接收器工作特性)曲线。它是检查任何分类模型性能的最重要评估指标之一。

AUC的含义

AUC是衡量学习器优劣的一种性能指标。从定义可知,AUC可通过对ROC曲线下各部分的面积求和而得。AUC越大,说明模型对正负样本的区分能力越强,模型的性能也就越好。

AUC的优点

AUC考虑了分类器对于正例和负例的分类能力,在样本不平衡的情况下,依然能够对分类器作出合理的评价。它不受样本不平衡问题的影响,因此是一个相对稳健的评价指标。

项目案例:

python 复制代码
import pandas as pd


# 可视化混淆矩阵
def cm_plot(y, yp):
    from sklearn.metrics import confusion_matrix
    import matplotlib.pyplot as plt

    cm = confusion_matrix(y, yp)
    plt.matshow(cm, cmap=plt.cm.Blues)
    plt.colorbar()
    for x in range(len(cm)):
        for y in range(len(cm)):
            plt.annotate(cm[x, y], xy=(y, x), horizontalalignment='center',
                         verticalalignment='center')
            plt.ylabel('True label')
            plt.xlabel('Predicted label')
    return plt


# 导入数据
datas = pd.read_excel(r"E:\xwechat_files\wxid_qi43v1w2nqcb12_e432\msg\file\2025-12\电信客户流失数据.xlsx")
# 将变量与结果划分开
data = datas.iloc[:, :-1]  # 1、datas.年龄    datas[年龄]   datas.iloc[ : , :-1]
target = datas.iloc[:, -1]  #

# 划分数据集
"""

导入模块对数据进行划分;
"""
from sklearn.model_selection import train_test_split

data_train, data_test, target_train, target_test = \
    train_test_split(data, target, test_size=0.2,
                     random_state=42)
# 定义决策树
from sklearn import tree

dtr = tree.DecisionTreeClassifier(criterion='gini', max_depth=8, random_state=60)
dtr.fit(data_train, target_train)

"""
训练集混淆矩阵
"""
# 训练集预测值
train_predicted = dtr.predict(data_train)

from sklearn import metrics

# 绘制混淆矩阵
print(metrics.classification_report(target_train, train_predicted))
# 可视化混淆矩阵
cm_plot(target_train, train_predicted).show()

"""
测试集混淆矩阵
"""
# 测试集预测值
test_predicted = dtr.predict(data_test)  # 直接得到预测的结果

# 绘制混淆矩阵
print(metrics.classification_report(target_test, test_predicted))
# 可视化混淆矩阵
cm_plot(target_test, test_predicted).show()
# 对决策树测试集进行评分
dtr.score(data_test, target_test)

'''AUC值的计算'''
y_pred_proba = dtr.predict_proba(data_test)
a = y_pred_proba[:, 1]
auc_result = metrics.roc_auc_score(target_test, a)

'''绘制AUC-ROC曲线'''
import matplotlib.pyplot as plt
from sklearn.metrics import roc_curve  # 得到不同阈值的roc

# 计算ROC曲线的点
fpr, tpr, thresholds = roc_curve(target_test, a)  # 用来计算不同阈值下的fpr和tpr,

# 绘制ROC曲线
plt.figure()
plt.plot(fpr, tpr, color='darkorange', lw=2, label='ROC curve(area=%0.2f)' % auc_result)
plt.plot([0, 1], [0, 1], color='navy', lw=2, linestyle='--')  # 函数来绘制一条从点 (0,0) 到点 (1,1) 的线段。
plt.xlim([0.0, 1.0])
plt.ylim([0.0, 1.05])
plt.xlabel('False Positive Rate')
plt.ylabel('True Positive Rate')
plt.title('Receiver Operating Characteristic')
plt.legend()
plt.show()
# 到逻辑回归里
相关推荐
YH552698434 分钟前
GPT‑5.6 Sol 原本支持 1M 上下文,Codex 现已放开此前限制,如何看待这次调整?
java·jvm·人工智能·gpt·算法·chatgpt
遥感知识服务2 小时前
从局部阈值、双极化到暗地表剔除:NASA OPERA DSWx-S1全球动态水体算法拆解
大数据·人工智能·深度学习·神经网络·算法·机器学习
晚风醉蝶2 小时前
1-13-TimSort
算法
ZJU_统一阿萨姆3 小时前
【算子开发】算子融合与Softmax_LayerNorm实现
人工智能·算法·语言模型·硬件架构
chunmiao30323 小时前
皮尤研究:ChatGPT 发布后,超三成新网页带 AI 创作痕迹
人工智能·机器学习·chatgpt
叩码以求索5 小时前
浅谈:前序遍历反转法求解N叉树的后序遍历
算法
lancyu5 小时前
关于多轮对话机器人的上下文Token优化和解决方案
人工智能·python·深度学习·机器学习·chatgpt·机器人·prompt
单词记忆方法研究5 小时前
大学英语单词:我踩过的坑,和你该走的路
机器学习·小程序·学习方法
北风toto6 小时前
中缀、前缀、后缀表达式
算法·软件设计师
听取WA声一片(无恶意)6 小时前
CSP-J/CSP-S 深度优先搜索(DFS)完全讲义
c++·算法·深度优先