增益比率
增益比率是信息增益办法的一种扩大,是为了克服信息增益带来的弱泛化的缺点。因为按照信息增益选择,老是会偏向于选择分支多的属性,如许会是的每个子集的信息熵最小。例如给每个数据添加一个第一无二的id值特点,则按照这个id值进行分类是获得信息增益最大年夜的,如许每个子集中的信息熵都为0,然则如许的分类便没有任何意义,没有任何泛化才能,类似过拟合。
是以我们可以经由过程惹人一个决裂信息来找到一个更合适的衡量数据划分的标准,即增益比率。
决裂信息的公式表示为:

- def get_nodes_edges(self, tree=None, root_node=None):
- ''' 返回想中所有节点和边
- '''
- Node = namedtuple('Node', ['id', 'label'])
- Edge = namedtuple('Edge', ['start', 'end', 'label'])
- if tree is None:
- tree = self.tree
- if type(tree) is not dict:
- return [], []
- nodes, edges = [], []
- if root_node is None:
- label = list(tree.keys())[0]
- root_node = Node._make([uuid.uuid4(), label])
- nodes.append(root_node)
- for edge_label, sub_tree in tree[root_node.label].items():
- node_label = list(sub_tree.keys())[0] if type(sub_tree) is dict else
推荐阅读
【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! SQL注入(SQLi)应用不安然 Web App 和数据库驱动的类似软件,采取或修改数据(如用户账户记录),甚至在办事>>>详细阅读
本文标题:机器学习算法实践:决策树 (Decision Tree)
地址:http://www.17bianji.com/lsqh/36282.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示