在存储了分类器之后,就可以应用该分类器来进行分类了。
三、应用分类器进行分类,并给出概率值
给出概率值的意思是用分类器断定一条评论文本的积极概率和消极概率。给出类别也是可以的,也就是可以直接用分类器断定一条评论文本是积极的┞氛样消极的,但概率可以供给更多的参考信息,对今后断定评论的效用也是比纯真给出类别更有赞助。
1. 把文本变为特点表示的情势
要对文本进行分类,起重要把文本变成特点表示的情势。并且要选择和分类器一样的特点提取办法。
- #! /usr/bin/env python2.7
- #coding=utf-8
- moto = pickle.load(open('D:/code/review_set/senti_review_pkl/moto_senti_seg.pkl','r')) #载入文本数据
- def extract_features(data):
- feat = []
- for i in data:
- feat.append(best_word_features(i))
- return feat
- moto_features = extract_features(moto) #把文本转化为特点表示的情势
统计办法包含:词频(Term Frequency)、文档频率(Document Frequency)、互信息(Pointwise Mutual Information)、信息熵(Information Entropy)、卡方统计(Chi-Square)等等。
注:载入的文本数据已经经由分词和去停用词处理。
2. 对文本进行分类,给出概率值
- import pickle
- import sklearn
- clf = pickle.load(open('D:/code/sentiment_test/classifier.pkl')) #载入分类器
- pred = clf.batch_prob_classify(moto_features) #该办法是计算分类概率值的
- p_file = open('D:/code/sentiment_test/score/Motorala/moto_ml_socre.txt','w') #把结不雅写入文档
- for i in pred:
- p_file.write(str(i.prob('pos')) + ' ' + str(i.prob('neg')) + '\n')
- p_file.close()
前面是积极概率,后面是消极概率
折腾了这么久就为了搞这么一个文件出来。。。这伤不起的节拍已经无人阻挡了吗。。。
不过这个结不雅确切比词典匹配精确很多,也算欣慰了。。。
【编辑推荐】
- R vs Python,数据分析中谁与争锋?
- 基于Python的Grib数据可视化
- 数据处理机能比较(Python原生vs Pandas vs Numpy)
- 用Python实现一个大年夜数据搜刮引擎
- 关于Python数据分析的入门指南
- #! /usr/bin/env python2.7
- #coding=utf-8
- pos_review = pickle.load(open('D:/code/sentiment_test/pos_review.pkl','r'))
- neg_review = pickle.load(open('D:/code/sentiment_test/neg_review.pkl'
推荐阅读
进修怎么在保护 root 暗码的安然性的同时,为可托用户付与所治理的收集功能和特定办事的权限。我比来写了一个简短的 Bash 法度榜样来将 MP3 文件大年夜一台收集主机的 USB 盘中拷贝到另一台收集主机上去。拷贝出来的>>>详细阅读
本文标题:使用python+机器学习方法进行情感分析(详细步骤)
地址:http://www.17bianji.com/lsqh/40229.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示