news 2026/1/30 11:22:50

决策树项目——电信客户流失预测

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
决策树项目——电信客户流失预测

AUC性能测量

在机器学习中,性能测量是一项基本任务。因此,当涉及到分类问题时,我们可以依靠AUC - ROC曲线。当我们需要检查或可视化多类分类问题的性能时,我们使用AUC(曲线下面积)ROC(接收器工作特性)曲线。它是检查任何分类模型性能的最重要评估指标之一。

AUC的含义

AUC是衡量学习器优劣的一种性能指标。从定义可知,AUC可通过对ROC曲线下各部分的面积求和而得。AUC越大,说明模型对正负样本的区分能力越强,模型的性能也就越好。

AUC的优点

AUC考虑了分类器对于正例和负例的分类能力,在样本不平衡的情况下,依然能够对分类器作出合理的评价。它不受样本不平衡问题的影响,因此是一个相对稳健的评价指标。

项目案例:

import pandas as pd # 可视化混淆矩阵 def cm_plot(y, yp): from sklearn.metrics import confusion_matrix import matplotlib.pyplot as plt cm = confusion_matrix(y, yp) plt.matshow(cm, cmap=plt.cm.Blues) plt.colorbar() for x in range(len(cm)): for y in range(len(cm)): plt.annotate(cm[x, y], xy=(y, x), horizontalalignment='center', verticalalignment='center') plt.ylabel('True label') plt.xlabel('Predicted label') return plt # 导入数据 datas = pd.read_excel(r"E:\xwechat_files\wxid_qi43v1w2nqcb12_e432\msg\file\2025-12\电信客户流失数据.xlsx") # 将变量与结果划分开 data = datas.iloc[:, :-1] # 1、datas.年龄 datas[年龄] datas.iloc[ : , :-1] target = datas.iloc[:, -1] # # 划分数据集 """ 导入模块对数据进行划分; """ from sklearn.model_selection import train_test_split data_train, data_test, target_train, target_test = \ train_test_split(data, target, test_size=0.2, random_state=42) # 定义决策树 from sklearn import tree dtr = tree.DecisionTreeClassifier(criterion='gini', max_depth=8, random_state=60) dtr.fit(data_train, target_train) """ 训练集混淆矩阵 """ # 训练集预测值 train_predicted = dtr.predict(data_train) from sklearn import metrics # 绘制混淆矩阵 print(metrics.classification_report(target_train, train_predicted)) # 可视化混淆矩阵 cm_plot(target_train, train_predicted).show() """ 测试集混淆矩阵 """ # 测试集预测值 test_predicted = dtr.predict(data_test) # 直接得到预测的结果 # 绘制混淆矩阵 print(metrics.classification_report(target_test, test_predicted)) # 可视化混淆矩阵 cm_plot(target_test, test_predicted).show() # 对决策树测试集进行评分 dtr.score(data_test, target_test) '''AUC值的计算''' y_pred_proba = dtr.predict_proba(data_test) a = y_pred_proba[:, 1] auc_result = metrics.roc_auc_score(target_test, a) '''绘制AUC-ROC曲线''' import matplotlib.pyplot as plt from sklearn.metrics import roc_curve # 得到不同阈值的roc # 计算ROC曲线的点 fpr, tpr, thresholds = roc_curve(target_test, a) # 用来计算不同阈值下的fpr和tpr, # 绘制ROC曲线 plt.figure() plt.plot(fpr, tpr, color='darkorange', lw=2, label='ROC curve(area=%0.2f)' % auc_result) plt.plot([0, 1], [0, 1], color='navy', lw=2, linestyle='--') # 函数来绘制一条从点 (0,0) 到点 (1,1) 的线段。 plt.xlim([0.0, 1.0]) plt.ylim([0.0, 1.05]) plt.xlabel('False Positive Rate') plt.ylabel('True Positive Rate') plt.title('Receiver Operating Characteristic') plt.legend() plt.show() # 到逻辑回归里

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/1/26 2:20:45

GraniStudio : S7 协议深度剖析​

在工业自动化的复杂生态中,设备间的通信协议如同 “语言”,决定了不同品牌、不同型号的工业设备能否协同工作。西门子 S7 协议作为工业通信领域的 “通用语言” 之一,凭借其高效性、稳定性和专属适配性,成为连接西门子 PLC 与各类…

作者头像 李华
网站建设 2026/1/30 8:45:48

Wan2.2:MoE架构赋能高清视频创作

Wan2.2视频生成模型正式发布,通过创新的Mixture-of-Experts(MoE)架构和大规模数据训练,实现了计算效率与生成质量的双重突破,推动开源视频生成技术迈入电影级创作新纪元。 【免费下载链接】Wan2.2-T2V-A14B-Diffusers …

作者头像 李华
网站建设 2026/1/29 19:56:48

4、Windows 10 使用指南:系统设置、网络连接与账户创建

Windows 10 使用指南:系统设置、网络连接与账户创建 1. 检查重要更新 在使用 Windows 10 系统时,及时更新系统是保障系统性能和安全的重要步骤。以下是检查更新的具体操作: 1. 打开“设置”屏幕,选择“更新和安全”选项。若不清楚如何进入“设置”屏幕,可参考相关指引。…

作者头像 李华
网站建设 2026/1/29 16:24:32

5、Windows 10 账户管理与桌面使用全攻略

Windows 10 账户管理与桌面使用全攻略 在使用 Windows 10 系统时,账户管理和桌面操作是非常重要的两个方面。合理管理账户能保障个人隐私和数据安全,而熟练运用桌面功能则能提高工作和娱乐的效率。下面将详细介绍 Windows 10 中账户的创建、切换、密码管理以及桌面的基本操作…

作者头像 李华
网站建设 2026/1/25 20:29:27

16、Windows 10 文件备份、恢复与电脑重置全攻略

Windows 10 文件备份、恢复与电脑重置全攻略 在使用 Windows 10 系统时,文件备份、恢复以及电脑重置是非常重要的操作。它们能帮助我们保护数据安全,解决电脑出现的各种问题。下面将详细介绍这些操作的具体步骤和相关注意事项。 开启文件历史记录功能 文件历史记录功能可以…

作者头像 李华
网站建设 2026/1/27 5:49:00

MySQL的安装与卸载

一、MySQL的安装 1.1 下载 点开链接:https://dev.mysql.com/downloads/mysql/ 点击Download 就可以下载对应的安装包了。 1.2 解压 下载完成后我们得到的是一个压缩包,将其解压,我们就可以得到MySQL 8.0.44 的软件本体了(就是一个文件夹…

作者头像 李华