作家
登录

机器学习算法实践:决策树 (Decision Tree)

作者: 来源: 2017-07-18 18:02:17 阅读 我要评论

  •  
  •     ''
  •  
  •     uniq_vals = set(values
  •  
  •     val_nums = {keyvalues.count(keyfor key in uniq_vals} 
  •  
  •     probs = [v/len(valuesfor k, v in val_nums.items()] 
  •  
  •     entropy = sum([-prob*log2(prob) for prob in probs]) 
  •  
  •     return entropy  
  • 信息增益

    我们将一组数据集进行划分后,数据的信息熵会产生改变,我们可以经由过程应用信息熵的计算公式分别计算被划分的子数据集的信息熵并计算他们的平均值(期望值)来作为瓜分后的数据集的信息熵。新的信息熵的比拟未划分数据的信息熵的减小值就是信息增益了. 这里我在最初就懂得错了,于是写出的代码并不克不及创建精确的决定计划树。

    假设我们将数据集D划分成kk 份D1,D2,…,Dk,则划分后的信息熵为:

    信息增益就是两个信息熵的差值

    媒介

    在这里我重要应用信息增益来进行属性选择,具体的实现代码如下:

    1. def choose_best_split_feature(self, dataset, classes): 
    2.  
    3.     ''' 根据信息增益肯定最好的划分数据的特点 
    4.  
    5.   
    6.  
    7.     :param dataset: 待划分的数据集 
    8.  
    9.     :param classes: 数据集对应的类型 
    10.  
    11.   
    12.  
    13.     :return: 划分数据的增益最大年夜的属性索引 
    14.  
    15.     ''
    16.  
    17.     base_entropy = self.get_shanno_entropy(classes) 
    18.  
    19.   
    20.  
    21.     feat_num = len(dataset[0]) 
    22.  
    23.     entropy_gains = [] 
    24.  
    25.     for i in range(feat_num): 
    26.  
    27.         splited_dict = self.split_dataset(dataset, classes, i) 
    28.  
    29.         new_entropy = sum([ 
    30.  
    31.             len(sub_classes)/len(classes)*self.get_shanno_entropy(sub_classes) 
    32.  
    33.             

        推荐阅读

        手机只需发条消息即可开始大规模SQL注入攻击

      【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! SQL注入(SQLi)应用不安然 Web App 和数据库驱动的类似软件,采取或修改数据(如用户账户记录),甚至在办事>>>详细阅读


      本文标题:机器学习算法实践:决策树 (Decision Tree)

      地址:http://www.17bianji.com/lsqh/36282.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)