作家
登录

如何科学地蹭热点:用python爬虫获取热门微博评论并进行情感分析

作者: 来源: 2017-10-10 15:04:14 阅读 我要评论

5.分析结不雅

本次分析的目标高兴的大年夜分析粉丝们对待薛之谦事宜的情感变成了纯真分析粉丝们的情感(●—●)。

  1. plt.hist(sentimentslist,bins=np.arange(0,1,0.02)) 
  2.  
  3. plt.show()  

对上节经由处理获得的情感值列表进行统计,并生成分布图。下图数据采集时光9月27日19时,采集评论2w条。

第一条:恶心 呸 给出了0.01的分值,最后一条:力挺薛之谦 给出了0.99的分值。看其他几句根本相符语境的立场,当须要评测单个商品的评价立场时就可以应用snowNLP。然则因为老薛的评论中涉及到三小我,他本身,李雨桐,高磊鑫,算法无法断定评论是关于谁的情感值,又因为微博评论可以粉丝之间互相答复,这让断定评论的主体是谁加倍扑朔迷离(机械表示我进修不克不及啊…)。

移动端微博的网址显得肥肠简单,不似PC端那么复杂而不明逻辑:https://m.weibo.cn/status/4154417035431509 多点几条微博就可以知道status后面的数字,就是单条微博的id了。

我还趁便(真的是趁便,正经脸)爬潦攀李雨桐将网友转账借钱的微博的2w条评论。

我又顺趁便(真的趁便,看我真诚的眼神)爬了陈赫出轨时揭橥我错了博文的微博评论。

 

根据这三张图,可以看到情感值袈溱接近0、1两端以及0.5阁下地位频率较高,解释粉丝们对于词攀类事宜的情感无论是积极照样消极都是比脚绫趋显的。但也可以大年夜图片中看到一些奥妙的差别,老薛的微博中情感值接近1的数量高于接近0的数量,但都没有跨越700,李雨桐微博中情感值接近1的数量远低于接近0的数量,甚至接近0的数量达到了1000以上,但二者都跨越了700,而陈赫的微博分析结不雅,俩者则都接近800。因为算法存在必定误差,不代表真实评论结不雅,我就不再多分析了(你们懂的)。

6.彩蛋

因为本次分析结不雅十分的……惨白(我真的…尽力了…_(:зゝ∠)_

我又对评论中出现的微博神情进行了统计。

  1. #薛微博评论神情统计 
  2. Counter({'[加油]': 128, '[哆啦A梦高兴]': 28, '[哆啦A梦亲亲]': 17, '[哆啦A梦厚味]': 12, '[em]': 4, '[/em]': 4, '[愛你]': 4, '[攤手]': 3, '[怒罵]': 3, '[好棒]': 3, '[转发]': 2, '[可愛]': 1, '[太開心]': 1, '[/cp]': 1, '[呵呵]': 1, '[xkl转圈]': 1, '[暖和帽子]': 1, '[ok]': 1}) 
  3. #李微博评论神情统计 
  4. Counter({'[攤手]': 13, '[加油]': 10, '[ok]': 8, '[皱眉]': 6, '[怒罵]': 4, '[太開心]': 3, '[左哼哼]': 3, '[饞嘴]': 2, '[擠眼]': 2, '[呵呵]': 2, '[嘿哈]': 2, '[机灵]': 2, '[/cp]': 1, '[抱抱_旧]'

      推荐阅读

      国内最火的 HTML、CSS、JavaScript 开源项目 Top 榜,你知多少?

    操作体系:跨平台 对于开辟者而言,想要着手前端开辟,HTML、CSS 和 JavaScript 是三项必备的基本技能。而若何事半功倍地控制好这些常识?经由过程懂得当下火热的开源项目不乏为最佳进修姿>>>详细阅读


    本文标题:如何科学地蹭热点:用python爬虫获取热门微博评论并进行情感分析

    地址:http://www.17bianji.com/lsqh/37761.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)