python使用sklearn实现决策树的方法示例


Posted in Python onSeptember 12, 2019

1. 基本环境

安装 anaconda 环境, 由于国内登陆不了他的官网 https://www.continuum.io/downloads, 不过可以使用国内的镜像站点: https://mirrors.tuna.tsinghua.edu.cn/anaconda/archive/

添加绘图工具 Graphviz http://www.graphviz.org/Download_windows.php

安装后, 将bin 目录内容添加到环境变量path 即可

参考blog : https://3water.com/article/169878.htm

官网技术文档 : http://scikit-learn.org/stable/modules/tree.html#tree-algorithms-id3-c4-5-c5-0-and-cart

2. 遇到的一些问题

csv 文件读取 https://docs.python.org/3.5/library/csv.html?highlight=csv#module-csv

https://docs.python.org/2/library/csv.html?highlight=csv#module-csv

3. 实现

数据文件:

python使用sklearn实现决策树的方法示例 

这是一个给定 4 个属性, age, income, student, credit_rating 以及 一个 标记属性 class_buys_computer 的数据集, 我们需要根据这个数据集进行分析并构建一颗决策树

代码实现:

核心就是调用 tree 的 DecisionTreeClassifier 方法对数据进行 训练得到一颗决策树

# -*- coding: utf-8 -*-
"""
Created on Sun Dec 25 11:25:40 2016

@author: Administrator
"""

from sklearn.feature_extraction import DictVectorizer
import csv
from sklearn import tree
from sklearn import preprocessing
from sklearn.externals.six import StringIO
import pydotplus
from IPython.display import Image

# Read in the csv file and put features into list of dict and list of class label
allElectornicsData = open('AllElectronics.csv', 'r')
reader = csv.reader(allElectornicsData)
# headers = reader.next()  python2.7 supported  本质获取csv 文件的第一行数据
#headers = reader.__next__()  python 3.5.2 
headers = next(reader)

print(headers)

featureList = []
labelList = []

for row in reader:
  labelList.append(row[len(row) - 1])
  rowDict = {}
  for i in range(1, len(row) - 1):
    rowDict[headers[i]] = row[i]
  featureList.append(rowDict)

print(featureList)
print(labelList)

# Vetorize features
vec = DictVectorizer()
dummyX = vec.fit_transform(featureList).toarray()

print("dummyX: " + str(dummyX))
print(vec.get_feature_names())
print("labelList: " + str(labelList))

# vectorize class labels
lb = preprocessing.LabelBinarizer()
dummyY = lb.fit_transform(labelList)
print("dummyY: ", str(dummyY))

# Using decision tree for classification    ===========【此处调用为算法核心】============
#clf = tree.DecisionTreeClassifier(criterion='entropy')
clf = tree.DecisionTreeClassifier(criterion='gini')
clf = clf.fit(dummyX, dummyY)
print("clf: ", str(clf))

# Visualize model
# dot -Tpdf iris.dot -o ouput.pdf
with open("allElectronicInformationGainOri.dot", 'w') as f:
  f = tree.export_graphviz(clf, feature_names = vec.get_feature_names(), out_file = f)


# predict
oneRowX = dummyX[0, :]
print("oneRowX: " + str(oneRowX))

newRowX = oneRowX
newRowX[0] = 1
newRowX[2] = 0
print("newRowX: " + str(newRowX))

predictedY = clf.predict(newRowX)
print("predictedY: " + str(predictedY))

输出结果:

ID3 算法

python使用sklearn实现决策树的方法示例

CART 算法

python使用sklearn实现决策树的方法示例

4. 决策树的优缺点

决策树的优势

  1. 简单易用,而且输出的结果易于解释,树能够被图形化,加深了直观的理解。
  2. 几乎不需要对数据进行预处理。
  3. 算法的开销不大,而且决策树一旦建立,对于未知样本的分类十分快,最坏情况下的时间复杂度是O(w),w是树的最大深度。
  4. 能够用于多类的分类。
  5. 能够容忍噪点。

决策树的劣势

  1. 容易过拟合。
  2. 容易被类别中占多数的类影响而产生bias,所以推荐在送入算法之间先平衡下数据中各个类别所占的比例。
  3. 决策树采用的是自顶向下的递归划分法,因此自定而下到了末端枝叶包含的数据量会很少,我们会依据很少的数据量取做决策,这样的决策是不具有统计意义的,这就是数据碎片的问题。

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持三水点靠木。

Python 相关文章推荐
python虚拟环境virualenv的安装与使用
Dec 18 Python
Python读取数据集并消除数据中的空行方法
Jul 12 Python
Python绘制频率分布直方图的示例
Jul 08 Python
基于pytorch的保存和加载模型参数的方法
Aug 17 Python
Pandas DataFrame中的tuple元素遍历的实现
Oct 23 Python
Python 面向对象之封装、继承、多态操作实例分析
Nov 21 Python
Spring实战之使用util:命名空间简化配置操作示例
Dec 09 Python
Python中实现输入超时及如何通过变量获取变量名
Jan 18 Python
详解Python3中的 input() 函数
Mar 18 Python
解决tensorflow读取本地MNITS_data失败的原因
Jun 22 Python
python如何快速生成时间戳
Jul 21 Python
python 密码学示例——理解哈希(Hash)算法
Sep 21 Python
Python环境Pillow( PIL )图像处理工具使用解析
Sep 12 #Python
Python列表删除元素del、pop()和remove()的区别小结
Sep 11 #Python
python conda操作方法
Sep 11 #Python
多版本python的pip 升级后, pip2 pip3 与python版本失配解决方法
Sep 11 #Python
浅谈Django+Gunicorn+Nginx部署之路
Sep 11 #Python
初次部署django+gunicorn+nginx的方法步骤
Sep 11 #Python
python 如何将数据写入本地txt文本文件的实现方法
Sep 11 #Python
You might like
PHP简单验证码功能机制实例详解
2019/03/27 PHP
JavaScript高级程序设计(第3版)学习笔记10 再访js对象
2012/10/11 Javascript
javascript时间函数基础介绍
2013/03/28 Javascript
Jquery submit()无法提交问题
2013/04/21 Javascript
javascript获取URL参数与参数值的示例代码
2013/12/20 Javascript
js实现鼠标感应图片展示的方法
2015/02/27 Javascript
jquery使用remove()方法删除指定class子元素
2015/03/26 Javascript
基于JavaScript创建动态Dom
2015/12/08 Javascript
一种新的javascript对象创建方式Object.create()
2015/12/28 Javascript
JavaScript仿商城实现图片广告轮播实例代码
2016/02/06 Javascript
Vuex和前端缓存的整合策略详解
2017/05/09 Javascript
BootStrap表单时间选择器详解
2017/05/09 Javascript
简单谈谈require模块化jquery和angular的问题
2017/06/23 jQuery
react-router4 嵌套路由的使用方法
2017/07/24 Javascript
JavaScript使用享元模式实现文件上传优化操作示例
2018/08/07 Javascript
解决vue keep-alive 数据更新的问题
2018/09/21 Javascript
vue 实现setInterval 创建和销毁实例
2020/07/21 Javascript
[50:17]Newbee vs Serenity 2018国际邀请赛小组赛BO2 第二场 8.17
2018/08/18 DOTA
在 Django/Flask 开发服务器上使用 HTTPS
2014/07/03 Python
Python之Web框架Django项目搭建全过程
2017/05/02 Python
Python中用字符串调用函数或方法示例代码
2017/08/04 Python
Python实现抓取网页生成Excel文件的方法示例
2017/08/05 Python
python使用Tkinter实现在线音乐播放器
2018/01/30 Python
python如何读写csv数据
2018/03/21 Python
python实现动态数组的示例代码
2019/07/15 Python
解决Pycharm双击图标启动不了的问题(JetBrains全家桶通用)
2020/08/07 Python
Python之字典添加元素的几种方法
2020/09/30 Python
建筑工程自我鉴定
2013/10/18 职场文书
售后服务科岗位职责范文
2013/11/13 职场文书
简历中个人求职的自我评价模板
2013/11/29 职场文书
品质主管岗位职责
2014/03/16 职场文书
建筑专业毕业生求职信
2014/09/30 职场文书
三好学生评选事迹材料(2016精选版)
2016/02/25 职场文书
canvas绘制折线路径动画实现
2021/05/12 Javascript
java设计模式--建造者模式详解
2021/07/21 Java/Android
抖音动画片,皮皮虾,《治愈系》动画在用这首REMIX作为背景音乐,Anak ,The last world with you完整版
2022/03/16 杂记