if conf >= min_conf and big_rule not in big_rule_list: # print freq_set-sub_set, " => ", sub_set, "conf: ", conf big_rule_list.append(big_rule) sub_set_list.append(freq_set) return big_rule_list if __name__ == "__main__": """ Test """ data_set = load_data_set() L, support_data = generate_L(data_set, k=3, min_support=0.2) big_rules_list = generate_big_rules(L, support_data, min_conf=0.7) for Lk in L: print "="*50 print "frequent " + str(len(list(Lk)[0])) + "-itemsets\t\tsupport" print "="*50 for freq_set in Lk: print freq_set, support_data[freq_set] print print "Big Rules" for item in big_rules_list: print item[0], "=>", item[1], "conf: ", item[2] Apriori算法是经典的发掘频繁项集和接洽关系规矩的数据发掘算法。A priori在拉丁语中指”来自以前”。当定义问题时,平日会应用先验常识或者假设,这被称作”一个先验”(a priori)。Apriori算法的名字恰是基于如许的事实:算法应用频繁项集性质的先验性质,即频繁项集的所有非空子集也必定是频繁的。Apriori算法应用一种称为逐层搜刮的迭代办法,个中k项集用于摸索(k+1)项集。起首,经由过程扫描数据库,累计每个项的计数,并收集知足最小支撑度的项,找出频繁1项集的集合。该集合记为L1。然后,应用L1找出频繁2项集的集合L2,应用L2找出L3,如斯下去,直到不克不及再找到频繁k项集。每找出一个Lk须要一次数据库的完全扫描。Apriori算法应用频繁项集的先验性质来紧缩搜刮空间。
代码运行结不雅截图如下:

【编辑推荐】
- 若何做好数据精细化分析,让你的运营效不雅指数级增长?
- 微信高可用分布式数据库PhxSQL设计与实现
- Hadoop常见缺点和处理方法
- 数据分析与可视化,你靠什么搞定?
- 六个提示 预防企业数据产生灾害
【义务编辑:武晓燕 TEL:(010)68476606】
推荐阅读
家用NAS有什么用?充分挖掘你的NAS功能
家用NAS有什么竽暌姑?具体整顿如下:1. 存储所有照片并分类整顿。2. 建立本身的视频办事器,出差在外可以播放家里的视频、音频,看照片。3. 存储大年夜量音乐,经由过程光纤声卡直接连到音>>>详细阅读
本文标题:Apriori算法介绍(Python实现)
地址:http://www.17bianji.com/lsqh/34841.html
1/2 1