
数据挖掘实验报告
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
数据挖掘实验报告共11页,当前为第1页。数据挖掘实验报告共11页,当前为第1页。 数据挖掘实验报告共11页,当前为第1页。 数据挖掘实验报告共11页,当前为第1页。 数据挖掘实验报告 学院名称 计算机科学与技术学院 专业名称 学生姓名 学号 5 指导教师 二〇一六年十一月 数据挖掘实验报告共11页,当前为第2页。数据挖掘实验报告共11页,当前为第2页。 实验内容 数据挖掘实验报告共11页,当前为第2页。 数据挖掘实验报告共11页,当前为第2页。 实验一 实验原理 (1).缺省值的处理:使用均值替换、回归查补以及多重查补方法来处理缺失值。通过R语言提供的功能识别出哪些数据存在缺失值,哪些数据属于异常值,并将异常值标记为缺失值进行处理,并通过表格形式展示这些数据集的完整部分和缺失部分。此外,数据集也被分割成包含完整数据和包含缺失数据的两组子集。(2).均值替换:对于变量中未出现缺失值的部分,计算该变量的均值并用该均值替换所有缺失值。(3).回归查补:通过建立回归模型来预测缺失属性的值,其中缺失属性作为因变量,其他相关属性作为自变量。利用这些属性之间的关系来完成缺失值的插补。(4).多重查补:多重插补方法基于贝叶斯估计的原理进行推断,认为待插补的值是随机的,其取值为已观测到的值的集合. 在实际应用中通常会估计出待插补的值,然后添加一定的噪声,生成若干个可能的插补值. 根据某种选择标准选取最合适的插补值. 多重插补方法通常包含三个步骤: 为每个空值生成一套可能的插补值,这些插补值的生成反映了无响应模型的不确定性;每个可能的插补值都可以被用于替换数据集中的缺失值,从而产生多个完整的数据集合;最后,对来自各个插补数据集的结果进行统计分析,并根据评分函数选择最终的插补结果. 实验目的 掌握数据预处理的基本方法。 实验内容 R语言初步认识(掌握R程序运行环境) 实验数据预处理。(掌握R语言中数据预处理的使用) 对给定的测试用例数据集进行以下操作: (1) 加载程序并熟悉各个按钮的功能;(2) 熟悉各个函数的具体功能以及如何运行程序并对其结果进行分析;针对餐饮销量数据进行统计量分析,包括计算销量数据的均值、中位数、极差、标准差、变异系数和四分位数间距;针对餐饮企业菜品的盈利贡献度(即菜品盈利帕累托分析),绘制帕累托图。(3) 数据预处理 数据挖掘实验报告共11页,当前为第3页。 缺省值的处理:使用均值替换、回归查补以及多重查补方法来处理缺失值 数据挖掘实验报告共11页,当前为第3页。 对连续属性进行离散化:采用等频、等宽等方法对数据进行离散化处理 实验步骤 (a) 将数据加载到程序中并通过函数计算所需的值;(b) 对餐饮企业菜品的盈利贡献度(即菜品盈利帕累托分析),绘制帕累托图;(c) 进行数据预处理操作包括分别采用等宽离散化、等频离散化和聚类离散化来实现目标结果绘制图示结果. 实验结果 展示销售数据的加载以及函数计算的结果 并绘制帕累托图 数据挖掘实验报告共11页,当前为第4页 。 对数据的预处理 数据挖掘实验报告共11页,当前为第4 页 。 (a)缺省值的处理 (b)对连续属性离散化 思考与分析 异常值的存在会对提取出的信息造成什么样的负面影响? 对异常值的识别和分析有助于检测是否存在录入错误或者含有不符合常理的数据. 不加剔除异常值的存在可能会导致分析结果出现偏差. 需要对输入的数据进行规范化吗? 进行规范化的目的在于使结构更加合理,减少存储中的冗余信息,方便插入、删除和更新操作.
全部评论 (0)


