
决策树模型
5星
- 浏览量: 0
- 大小:None
- 文件类型:PDF
简介:
基于决策树的方法进行分类;信息增益指标用于评估特征的重要程度;其计算方式为:先计算划分前系统的整体不确定性(即熵),再减去划分后各子系统不确定性加权的总和。当信息增益值越大时,越应该选择对应的特征来进行分类决策;在基于信息增益的方法中,倾向于选取分割后子类群数量较多的特征作为判别标准;针对分类过程中可能出现偏向于具有更多类别的问题,引入了调整后的信息增益指标;尽管如此,在实际应用中发现其效果并不显著;基尼不平等指数用于衡量数据集内部的类别分散程度;基尼不平等指数值越低,说明数据集中的样本分布越均衡。在数据集D中随机选取两例,其类别标签不一致的频率。当基尼系数数值减小时,数据集D的纯度相应提升。在决策树中,被选作最优分割特征的是那些使划分后基尼系数最小化的属性 / 信息增益类决策树主要用于基于属性值进行数据分类的任务:/ ID3决策树倾向于优先分割具有更多分类类别的属性;只能处理离散的数据集 / 信息增益率调整了信息增益的计算方式以减少对单个特征分裂效果的过度依赖,其适用于基于属性分割的方法;C4.5决策树在生成决策树的过程中引入了一个称为信息增益率的概念,在处理数据时更加注重平衡不同特征的重要性。
全部评论 (0)
还没有任何评论哟~


