机器学习应用篇（五）——决策树分类实例

2023年6月15日下午12:04 • 人工智能 • 阅读 106

机器学习应用篇（五）——决策树分类实例

文章目录

机器学习应用篇（五）——决策树分类实例
*
一、数据集
二、实现过程
–
三、KEYS
–

一、数据集

小企鹅数据集，提取码：xqee
该数据集一共包含8个变量，其中7个特征变量，1个目标分类变量。共有150个样本，目标变量为企鹅的类别其都属于企鹅类的三个亚属，分别是(Adélie, Chinstrap and Gentoo)。包含的三种种企鹅的七个特征，分别是所在岛屿，嘴巴长度，嘴巴深度，脚蹼长度，身体体积，性别以及年龄。

二、实现过程

1 数据特征分析


import numpy as np
import pandas as pd

import matplotlib.pyplot as plt
import seaborn as sns

data = pd.read_csv('D:\Python\ML\data\penguins_raw.csv')

data = data[['Species','Culmen Length (mm)','Culmen Depth (mm)',
            'Flipper Length (mm)','Body Mass (g)']]
data.info()

print(data.head())

data=data.fillna(-1)
print(data.tail())

print(data['Species'].unique())

print(pd.Series(data['Species']).value_counts())

print(data.describe())

sns.pairplot(data=data,diag_kind='hist',hue='Species')
plt.show()

def trans(x):
    if x == data['Species'].unique()[0]:
        return 0
    if x == data['Species'].unique()[1]:
        return 1
    if x == data['Species'].unique()[2]:
        return 2
data['Species'] = data['Species'].apply(trans)

for col in data.columns:
    if col != 'Species':
        sns.boxplot(x='Species', y=col, saturation=0.5, palette='pastel', data=data)
        plt.title(col)
        plt.show()
        plt.figure()

from mpl_toolkits.mplot3d import Axes3D
fig = plt.figure(figsize=(10,8))
ax = fig.add_subplot(111, projection='3d')

data_class0 = data[data['Species']==0].values
data_class1 = data[data['Species']==1].values
data_class2 = data[data['Species']==2].values

ax.scatter(data_class0[:,0], data_class0[:,1], data_class0[:,2],label=data['Species'].unique()[0])
ax.scatter(data_class1[:,0], data_class1[:,1], data_class1[:,2],label=data['Species'].unique()[1])
ax.scatter(data_class2[:,0], data_class2[:,1], data_class2[:,2],label=data['Species'].unique()[2])
plt.legend()
plt.show()

运行结果

2 利用决策树模型在二分类上进行训练和预测


from sklearn.model_selection import train_test_split

data_target_part = data[data['Species'].isin([0,1])][['Species']]
data_features_part = data[data['Species'].isin([0,1])][['Culmen Length (mm)','Culmen Depth (mm)',
            'Flipper Length (mm)','Body Mass (g)']]

x_train, x_test, y_train, y_test = train_test_split(
    data_features_part, data_target_part, test_size = 0.2, random_state = 2020)

from sklearn.tree import DecisionTreeClassifier
from sklearn import tree

clf = DecisionTreeClassifier(criterion='entropy')

clf.fit(x_train, y_train)

import pydotplus
dot_data = tree.export_graphviz(clf, out_file=None)
graph = pydotplus.graph_from_dot_data(dot_data)
graph.write_png("D:\Python\ML\DTpraTree.png")

train_predict = clf.predict(x_train)
test_predict = clf.predict(x_test)
from sklearn import metrics

print('The accuracy of the train_DecisionTree is:',metrics.accuracy_score(y_train,train_predict))
print('The accuracy of the test_DecisionTree is:',metrics.accuracy_score(y_test,test_predict))

confusion_matrix_result = metrics.confusion_matrix(test_predict,y_test)
print('The confusion matrix result:\n',confusion_matrix_result)

plt.figure(figsize=(8, 6))
sns.heatmap(confusion_matrix_result, annot=True, cmap='Blues')
plt.xlabel('Predicted labels')
plt.ylabel('True labels')
plt.show()

运行结果

3 利用决策树模型在多分类（三分类）上进行训练与预测


x_train, x_test, y_train, y_test = train_test_split(data[['Culmen Length (mm)','Culmen Depth (mm)',
            'Flipper Length (mm)','Body Mass (g)']], data[['Species']], test_size = 0.2, random_state = 2020)

clf = DecisionTreeClassifier()

clf.fit(x_train, y_train)

train_predict = clf.predict(x_train)
test_predict = clf.predict(x_test)
train_predict_proba = clf.predict_proba(x_train)
test_predict_proba = clf.predict_proba(x_test)

print('The test predict Probability of each class:\n',test_predict_proba)

print('The accuracy of the train_DecisionTree is:',metrics.accuracy_score(y_train,train_predict))
print('The accuracy of the test_DecisionTree is:',metrics.accuracy_score(y_test,test_predict))

confusion_matrix_result = metrics.confusion_matrix(test_predict,y_test)
print('The confusion matrix result:\n',confusion_matrix_result)

plt.figure(figsize=(8, 6))
sns.heatmap(confusion_matrix_result, annot=True, cmap='Blues')
plt.xlabel('Predicted labels')
plt.ylabel('True labels')
plt.show()

运行结果

三、KEYS

1 构建过程

决策树的构建过程是一个递归的过程，函数存在三种返回状态：

当前节点包含的样本全部属于同一类别，无需继续划分
当前属性集为空或者所有样本在某个属性上的取值相同，无法继续划分
当前节点包含的样本几何为空，无法划分

2 划分选择

决策树构建的关键是从特征集中选择最优划分属性，一般大家希望决策树每次划分节点中包含的样本尽量属于同一类别，也就是节点的”纯度”最高

信息熵：衡量数据混乱程度的指标，信息熵越小，数据的”纯度”越高
基尼指数：反应了从数据集中随机抽取两个类别的标记不一致的概率

3 重要参数

criterion：用来决定模型特征选择的计算方法，sklearn提供两种方法：
*

 entropy&#xFF1A;&#x4F7F;&#x7528;&#x4FE1;&#x606F;&#x71B5;

 gini&#xFF1A;&#x4F7F;&#x7528;&#x57FA;&#x5C3C;&#x7CFB;&#x6570;

random_state&splitte：
*

 random_state&#x7528;&#x4E8E;&#x8BBE;&#x7F6E;&#x5206;&#x652F;&#x7684;&#x968F;&#x673A;&#x6A21;&#x5F0F;&#x7684;&#x53C2;&#x6570;

 splitter&#x7528;&#x6765;&#x63A7;&#x5236;&#x51B3;&#x7B56;&#x6811;&#x4E2D;&#x7684;&#x968F;&#x673A;&#x9009;&#x9879;

max_depth：限制数的深度
min_samples_leaf：一个节点在分支之后的每个子节点都必须包含至少几个训练样本。该参数设置太小，会出现过拟合现象，设置太大会阻止模型学习数据

886~~

Original: https://blog.csdn.net/qq_43368987/article/details/122376146
Author: 柚子味的羊
Title: 机器学习应用篇（五）——决策树分类实例

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/614630/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

No module named ‘utils‘，untils库的安装，不是pip和conda指令，特别可以的教程，还有为什么不能的原因，绝对良心。

这个问题相信难到了很多初学者，我们熟知像这样没有这个模块的错误直接使用下面这个： pip install utils 或者： conda install utils ，但是对于 u…

人工智能 2023年7月5日
0070
YOLOv5算法详解

1：输入端（1） Mosaic数据增强 Yolov5的输入端采用了和Yolov4一样的Mosaic数据增强的方式。Mosaic是参考2019年底提出的CutMix数据增强的方式，…

人工智能 2023年6月26日
00132
【自学】利用python进行数据分析 LESSON7 ＜pandas入门——pandas基本功能＞

目录前言一、重建索引 1. reindex 2. reindex + method 3. 改变行索引和列索引 4. reindex方法的参数二、轴向上删除条目 1. Seri…

人工智能 2023年7月8日
0087
C++版本的OpenCV 5.x编译生成opencv-python==5.x(GPU版本)接口并进行调用

抵扣说明： 1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。 Original: https://blo…

人工智能 2023年7月19日
0065
【愚公系列】2022年08月 python界面可视化 VS2022配置PyQt5环境

文章目录一、VS2022配置PyQt5环境 * 1.安装anaconda及opencv-python – 1.1 安装对应的anaconda包 1.2 安装openc…

人工智能 2023年7月18日
0071
Python 内建数据结构、函数及文件总结——《利用Python进行数据分析》第三章总结笔记

因为需要准备美赛，所以开始进行数模和python数据分析的学习，之前呢，断断续续看了这本书的第三章，本人决定从第三章开始进行学习笔记的更新，数模部分后续也会出一部分。至于为什么会跳…

人工智能 2023年6月11日
0072
Graph Embedding

Graph Embedding 基本概念 Graph Embedding 技术是一种将图的拓扑结构进行向量表示的方法，从而获取到网络关系信息，可应用于推荐等多种场景。计算节点在图中…

人工智能 2023年6月4日
00116
【Keras】保存模型的前几层，删除最后几层

⭐️ 需求：在使用Keras的过程中，只想保留模型的前几层，删除最后一层，以便网络进行增量训练。⭐️ 以sklearn中的鸢尾花数据集为例，建立一个多层感知机，以用来删除网络的…

人工智能 2023年5月23日
00106
多目标检测

这是最简单的情形，只需要判定一张图片是属于哪一个类别即可。这种图像往往有一个非常显著的特殊，就是图像主体清晰且突出。但是日常生活中这类图像并不多，更多的是一张图片中包含了多个主体，…

人工智能 2023年7月9日
00113
VS2019 MFC配置OpenCV430

一、环境变量配置下载OpenCV，解压结束后，鼠标右键此电脑，打开属性，打开高级系统设置，选择环境变量，找到系统变量中的path变量，双击，点击新建，将解压后opencv文件夹中…

人工智能 2023年7月20日
0062
np.linalg.norm()用法总结

前言 np.linalg.norm()用于求范数，linalg本意为linear(线性) + algebra(代数)，norm则表示范数。用法 np.linalg.norm(x,…

人工智能 2023年7月4日
0081
高斯滤波器讲解（python实现）

文章目录 * – 1.高斯滤波器 – 2.高斯函数讲解 – + （1）高斯函数 + （2）参数详解 + （3）高斯函数具体实现过程 + （3）那…

人工智能 2023年5月26日
0078
100天精通Python（进阶篇）——第34天：正则表达式大总结

抵扣说明： 1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。2.余额无法直接购买下载，可以购买VIP、C币套餐、付费专栏及课程。 Original: https:…

人工智能 2023年7月15日
0072
python微信公众号自动推送（十分简单的教程）

目录一、注册微信公众号 1.注册链接 2.登录成功 3.关注该公众号 4.创建模板二、代码实现 1.爬取天气信息 2.计算生日天数 3.获取access token 4.获取关…

人工智能 2023年7月31日
0070
790. 多米诺和托米诺平铺 : 简单状态机 DP 运用题

题目描述这是 LeetCode 上的 790. 多米诺和托米诺平铺，难度为中等。 Tag : 「状态机 DP」有两种形状的瓷砖：一种是 2 x 1 的多米诺形，另一种是形如…

人工智能 2023年6月29日
0094
Hyperledger Fabric无系统通道启动及通道的创建和删除

前言在Hyperledger Fabric组织的动态添加和删除中，我们已经完成了在运行着的网络中动态添加和删除组织，但目前为止，我们启动 orderer 节点的方式都是通过系统通…

人工智能 2023年6月4日
0074

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31

机器学习应用篇（五）——决策树分类实例

文章目录

一、数据集

二、实现过程

1 数据特征分析

2 利用决策树模型在二分类上进行训练和预测

3 利用决策树模型在多分类（三分类）上进行训练与预测

三、KEYS

1 构建过程

2 划分选择

3 重要参数

大家都在看