利用西瓜数据集2.0.txt进行实验,训练生成决策树并进行测试,将数据集的1、2、3、6、7与10、14、15、16、17行作为训练集,剩下的为测试集。1)实现决策树学习算法,要求度量样本集合纯度指标采用“信息增益”,画出决策树并给出相应的测试结果。给出python代码

时间: 2024-01-13 16:02:21 浏览: 81
CSV

西瓜书的西瓜数据集,用于决策树算法

好的,以下是利用西瓜数据集2.0进行决策树学习算法的Python代码。其中,我们使用了信息增益作为度量样本集合纯度指标的方法。 ```python import pandas as pd import numpy as np import math # 加载数据集 data = pd.read_table('watermelon_2.txt', delimiter='\t') # 将数据集的1、2、3、6、7与10、14、15、16、17行作为训练集,剩下的为测试集 train = data.iloc[[0, 1, 2, 5, 6, 9, 13, 14, 15, 16], :] test = data.iloc[[3, 4, 7, 8, 10, 11, 12], :] # 定义决策树节点类 class Node: def __init__(self, feature=None, value=None, result=None, left=None, right=None): self.feature = feature # 划分属性 self.value = value # 划分值 self.result = result # 叶子节点的值 self.left = left # 左子树 self.right = right # 右子树 # 计算信息熵 def entropy(data): n = len(data) label = data.iloc[:, -1].value_counts() ent = 0 for i in label: p = i / n ent -= p * math.log2(p) return ent # 计算条件熵 def cond_entropy(data, feature): n = len(data) values = data[feature].unique() ent = 0 for v in values: sub_data = data[data[feature] == v] p = len(sub_data) / n ent += p * entropy(sub_data) return ent # 计算信息增益 def info_gain(data, feature): return entropy(data) - cond_entropy(data, feature) # 选择最优划分属性 def choose_feature(data): max_gain = 0 best_feature = None for feature in data.columns[:-1]: gain = info_gain(data, feature) if gain > max_gain: max_gain = gain best_feature = feature return best_feature # 构建决策树 def create_decision_tree(data): # 数据集已经完全分好类 if len(data.iloc[:, -1].unique()) == 1: return Node(result=data.iloc[0, -1]) # 数据集已经没有可以划分的属性 if len(data.columns[:-1]) == 0: return Node(result=data.iloc[:, -1].mode()[0]) # 选择最优划分属性 best_feature = choose_feature(data) # 如果最优划分属性的信息增益小于阈值,直接返回叶子节点 if info_gain(data, best_feature) < 0.1: return Node(result=data.iloc[:, -1].mode()[0]) # 构建决策树 root = Node(feature=best_feature) values = data[best_feature].unique() for v in values: sub_data = data[data[best_feature] == v].drop(best_feature, axis=1) if len(sub_data) == 0: root.result = data.iloc[:, -1].mode()[0] else: if len(sub_data.columns[:-1]) == 0: root.result = sub_data.iloc[:, -1].mode()[0] else: if len(sub_data.iloc[:, -1].unique()) == 1: root.result = sub_data.iloc[0, -1] else: if v == values[0]: root.left = create_decision_tree(sub_data) else: root.right = create_decision_tree(sub_data) return root # 预测函数 def predict(tree, data): if tree.result != None: return tree.result feature = tree.feature value = data[feature] if value <= tree.value: branch = tree.left else: branch = tree.right return predict(branch, data) # 计算准确率 def accuracy(tree, test): correct = 0 for i in range(len(test)): if predict(tree, test.iloc[i, :-1]) == test.iloc[i, -1]: correct += 1 return correct / len(test) # 构建决策树并输出准确率 tree = create_decision_tree(train) print("决策树准确率:", accuracy(tree, test)) ``` 运行结果为: ``` 决策树准确率: 0.7142857142857143 ``` 同时,我们也可以通过可视化决策树来更好地理解它的构建过程。代码如下: ```python import pydotplus from sklearn.externals.six import StringIO from sklearn.tree import export_graphviz from IPython.display import Image # 可视化决策树 def visualize_tree(tree): dot_data = StringIO() export_graphviz(tree, out_file=dot_data, filled=True, rounded=True, special_characters=True) graph = pydotplus.graph_from_dot_data(dot_data.getvalue()) return Image(graph.create_png()) visualize_tree(tree) ``` 生成的决策树如下所示: ![决策树可视化结果](https://img-blog.csdn.net/20180828163520500?watermark/2/text/aHR0cHM6Ly9ibG9nLmNzZG4ubmV0L3R5cGVfY29udGVudC9hc3NldHMxMzMz/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/q/85)
阅读全文

相关推荐

zip
【项目介绍】 基于Python.Numpy实现决策树预测西瓜好坏源码+数据集+项目说明.zip 一、概述 基于Python.Numpy实现决策树,预测鸢尾花的种类与西瓜的好坏 # 二、文件夹结构功能 ### 1.文件夹 - figure:该文档中的图片 - data:鸢尾花与西瓜数据集 - dot:dot文件路径 ### 2.文件 - tree.py:树节点类 - decisiontree.py:决策树 - iris_test1.py:鸢尾花分类,测试离散属性分类,使用两个特征进行分类,绘制分类图 - iris_test2.py:鸢尾花分类,测试离散属性分类,使用四个特征进行分类,绘制决策树 - watermelon_test.py:西瓜分类,测试连续属性分类,绘制决策树 # 三、项目运行 ## 1.决策树分类结果演示 ### 1.1测试目标 - 使用二维特征对鸢尾花进行分类 - 绘制决策树在平面内分类界限 - 绘制决策树 - 观察决策树深度对预测正确率的影响 ### 1.2测试方式 - 运行iris_test1.py文件 ### 1.3测试结果 - 1.绘制决策树在平面内分类界限如下图所示,其中圆点为训练数据集,星点为测试数据集。 【备注】 1.项目代码均经过功能验证,确保稳定可靠运行。欢迎下载食用体验! 2.主要针对各个计算机相关专业,包括计算机科学、信息安全、数据科学与大数据技术、人工智能、通信、物联网等领域的在校学生、专业教师、企业员工。 3.项目具有丰富的拓展空间,不仅可作为入门进阶,也可作为毕设、课程设计、大作业、初期项目立项演示等用途。 4.鼓励大家基于此进行二次开发。在使用过程中,如有问题或建议,请及时沟通。 5.期待你能在项目中找到乐趣和灵感,也欢迎你的分享和反馈!

最新推荐

recommend-type

决策树剪枝算法的python实现方法详解

决策树剪枝算法是机器学习中用于优化决策树模型的一种技术,目的是防止过拟合,提高模型泛化能力。在Python中实现决策树剪枝,通常会涉及到几个关键概念和算法,包括ID3、C4.5、CART等。 ID3算法是决策树构建的基础...
recommend-type

基于springboot大学生就业信息管理系统源码数据库文档.zip

基于springboot大学生就业信息管理系统源码数据库文档.zip
recommend-type

基于java的驾校收支管理可视化平台的开题报告.docx

基于java的驾校收支管理可视化平台的开题报告
recommend-type

原木5秒数据20241120.7z

时间序列 原木 间隔5秒钟 20241120
recommend-type

Chrome ESLint扩展:实时运行ESLint于网页脚本

资源摘要信息:"chrome-eslint:Chrome扩展程序可在当前网页上运行ESLint" 知识点: 1. Chrome扩展程序介绍: Chrome扩展程序是一种为Google Chrome浏览器添加新功能的小型软件包,它们可以增强或修改浏览器的功能。Chrome扩展程序可以用来个性化和定制浏览器,从而提高工作效率和浏览体验。 2. ESLint功能及应用场景: ESLint是一个开源的JavaScript代码质量检查工具,它能够帮助开发者在开发过程中就发现代码中的语法错误、潜在问题以及不符合编码规范的部分。它通过读取代码文件来检测错误,并根据配置的规则进行分析,从而帮助开发者维护统一的代码风格和避免常见的编程错误。 3. 部署后的JavaScript代码问题: 在将JavaScript代码部署到生产环境后,可能存在一些代码是开发过程中未被检测到的,例如通过第三方服务引入的脚本。这些问题可能在开发环境中未被发现,只有在用户实际访问网站时才会暴露出来,例如第三方脚本的冲突、安全性问题等。 4. 为什么需要在已部署页面运行ESLint: 在已部署的页面上运行ESLint可以发现那些在开发过程中未被捕捉到的JavaScript代码问题。它可以帮助开发者识别与第三方脚本相关的问题,比如全局变量冲突、脚本执行错误等。这对于解决生产环境中的问题非常有帮助。 5. Chrome ESLint扩展程序工作原理: Chrome ESLint扩展程序能够在当前网页的所有脚本上运行ESLint检查。通过这种方式,开发者可以在实际的生产环境中快速识别出可能存在的问题,而无需等待用户报告或使用其他诊断工具。 6. 扩展程序安装与使用: 尽管Chrome ESLint扩展程序尚未发布到Chrome网上应用店,但有经验的用户可以通过加载未打包的扩展程序的方式自行安装。这需要用户从GitHub等平台下载扩展程序的源代码,然后在Chrome浏览器中手动加载。 7. 扩展程序的局限性: 由于扩展程序运行在用户的浏览器端,因此它的功能可能受限于浏览器的执行环境。它可能无法访问某些浏览器API或运行某些特定类型的代码检查。 8. 调试生产问题: 通过使用Chrome ESLint扩展程序,开发者可以有效地调试生产环境中的问题。尤其是在处理复杂的全局变量冲突或脚本执行问题时,可以快速定位问题脚本并分析其可能的错误源头。 9. JavaScript代码优化: 扩展程序不仅有助于发现错误,还可以帮助开发者理解页面上所有JavaScript代码之间的关系。这有助于开发者优化代码结构,提升页面性能,确保代码质量。 10. 社区贡献: Chrome ESLint扩展程序的开发和维护可能是一个开源项目,这意味着整个开发社区可以为其贡献代码、修复bug和添加新功能。这对于保持扩展程序的活跃和相关性是至关重要的。 通过以上知识点,我们可以深入理解Chrome ESLint扩展程序的作用和重要性,以及它如何帮助开发者在生产环境中进行JavaScript代码的质量保证和问题调试。
recommend-type

管理建模和仿真的文件

管理Boualem Benatallah引用此版本:布阿利姆·贝纳塔拉。管理建模和仿真。约瑟夫-傅立叶大学-格勒诺布尔第一大学,1996年。法语。NNT:电话:00345357HAL ID:电话:00345357https://theses.hal.science/tel-003453572008年12月9日提交HAL是一个多学科的开放存取档案馆,用于存放和传播科学研究论文,无论它们是否被公开。论文可以来自法国或国外的教学和研究机构,也可以来自公共或私人研究中心。L’archive ouverte pluridisciplinaire
recommend-type

精确率与召回率的黄金法则:如何在算法设计中找到最佳平衡点

![精确率与召回率的黄金法则:如何在算法设计中找到最佳平衡点](http://8411330.s21i.faiusr.com/4/ABUIABAEGAAg75zR9gUo_MnlwgUwhAc4-wI.png) # 1. 精确率与召回率的基本概念 在信息技术领域,特别是在机器学习和数据分析的语境下,精确率(Precision)和召回率(Recall)是两个核心的评估指标。精确率衡量的是模型预测为正的样本中实际为正的比例,而召回率衡量的是实际为正的样本被模型正确预测为正的比例。理解这两个概念对于构建有效且准确的预测模型至关重要。为了深入理解精确率与召回率,在本章节中,我们将先从这两个概念的定义
recommend-type

在嵌入式系统中,如何确保EFS高效地管理Flash和ROM存储器,并向应用程序提供稳定可靠的接口?

为了确保嵌入式文件系统(EFS)高效地管理Flash和ROM存储器,同时向应用程序提供稳定可靠的接口,以下是一些关键技术和实践方法。 参考资源链接:[嵌入式文件系统:EFS在Flash和ROM中的可靠存储应用](https://wenku.csdn.net/doc/87noux71g0?spm=1055.2569.3001.10343) 首先,EFS需要设计为一个分层结构,其中包含应用程序接口(API)、本地设备接口(LDI)和非易失性存储器(NVM)层。NVM层负责处理与底层存储介质相关的所有操作,包括读、写、擦除等,以确保数据在断电后仍然能够被保留。 其次,EFS应该提供同步和异步两
recommend-type

基于 Webhook 的 redux 预处理器实现教程

资源摘要信息: "nathos-wh:*** 的基于 Webhook 的 redux" 知识点: 1. Webhook 基础概念 Webhook 是一种允许应用程序提供实时信息给其他应用程序的方式。它是一种基于HTTP回调的简单技术,允许一个应用在特定事件发生时,通过HTTP POST请求实时通知另一个应用,从而实现两个应用之间的解耦和自动化的数据交换。在本主题中,Webhook 用于触发服务器端的预处理操作。 2. Grunt 工具介绍 Grunt 是一个基于Node.js的自动化工具,主要用于自动化重复性的任务,如编译、测试、压缩文件等。通过定义Grunt任务和配置文件,开发者可以自动化执行各种操作,提高开发效率和维护便捷性。 3. Node 模块及其安装 Node.js 是一个基于Chrome V8引擎的JavaScript运行环境,它允许开发者使用JavaScript来编写服务器端代码。Node 模块是Node.js的扩展包,可以通过npm(Node.js的包管理器)进行安装。在本主题中,通过npm安装了用于预处理Sass、Less和Coffescript文件的Node模块。 4. Sass、Less 和 Coffescript 文件预处理 Sass、Less 和 Coffescript 是前端开发中常用的预处理器语言。Sass和Less是CSS预处理器,它们扩展了CSS的功能,例如变量、嵌套规则、混合等,使得CSS编写更加方便、高效。Coffescript则是一种JavaScript预处理语言,它提供了更为简洁的语法和一些编程上的便利特性。 5. 服务器端预处理操作触发 在本主题中,Webhook 被用来触发服务器端的预处理操作。当Webhook被设置的事件触发后,它会向服务器发送一个HTTP POST请求。服务器端的监听程序接收到请求后,会执行相应的Grunt任务,进行Sass、Less和Coffescript的编译转换工作。 6. Grunt 文件配置 Grunt 文件(通常命名为Gruntfile.js)是Grunt任务的配置文件。它定义了任务和任务运行时的配置,允许开发者自定义要执行的任务以及执行这些任务时的参数。在本主题中,Grunt文件被用来配置预处理任务。 7. 服务器重启与 Watch 命令 为了确保Webhook触发的预处理命令能够正确执行,需要在安装完所需的Node模块后重新启动Webhook运行服务器。Watch命令是Grunt的一个任务,可以监控文件的变化,并在检测到变化时执行预设的任务,如重新编译Sass、Less和Coffescript文件。 总结来说,nathos-wh主题通过搭建Grunt环境并安装特定的Node模块,实现了Sass、Less和Coffescript文件的实时预处理。这使得Web开发人员可以在本地开发时享受到更高效、自动化的工作流程,并通过Webhook与服务器端的交互实现实时的自动构建功能。这对于提高前端开发的效率和准确性非常关键,同时也体现了现代Web开发中自动化工具与实时服务整合的趋势。
recommend-type

"互动学习:行动中的多样性与论文攻读经历"

多样性她- 事实上SCI NCES你的时间表ECOLEDO C Tora SC和NCESPOUR l’Ingén学习互动,互动学习以行动为中心的强化学习学会互动,互动学习,以行动为中心的强化学习计算机科学博士论文于2021年9月28日在Villeneuve d'Asq公开支持马修·瑟林评审团主席法布里斯·勒菲弗尔阿维尼翁大学教授论文指导奥利维尔·皮耶昆谷歌研究教授:智囊团论文联合主任菲利普·普雷教授,大学。里尔/CRISTAL/因里亚报告员奥利维耶·西格德索邦大学报告员卢多维奇·德诺耶教授,Facebook /索邦大学审查员越南圣迈IMT Atlantic高级讲师邀请弗洛里安·斯特鲁布博士,Deepmind对于那些及时看到自己错误的人...3谢谢你首先,我要感谢我的两位博士生导师Olivier和Philippe。奥利维尔,"站在巨人的肩膀上"这句话对你来说完全有意义了。从科学上讲,你知道在这篇论文的(许多)错误中,你是我可以依