作家
登录

Python利用Beautifulsoup爬取笑话网站

作者: 来源: 2017-09-19 19:07:54 阅读 我要评论

  •     soup_first = BeautifulSoup(html.text,'lxml'
  •     list_first = soup_first.find_all('li',class_='article-summary'
  •     for i in list_first: 
  •         soup_second = BeautifulSoup(i.prettify(),'lxml'
  •         list_second = soup_second.find_all('a',target = '_blank',class_='all-read'
  •         for b in list_second: 
  •             href = b['href'
  •             list_href.append(href) 
  •     return list_href 
  • def GetTrueUrl(liebiao): 
  •     list = [] 
  •     for i in liebiao: 
  •         url = 'http://xiaohua.zol.com.cn  
  •  
  • '+str(i) 
  •         list.append(url) 
  •     return list 
  • def GetText(url): 
  •     for i in url: 
  •         html = requests.get(i) 
  •         soup = BeautifulSoup(html.text,'lxml'
  •         content = soup.find('div',class_='article-text'
  •         title = soup.find('h1',class_ = 'article-title'
  •  
  •         SaveText(title.text,content.text) 
  • def SaveText(TextTitle,text): 
  •     os.chdir('/home/lei/zol/'
  •     f = open(str(TextTitle)+'txt','w'
  •     f.write(text) 
  •     f.close() 
  • while num<=100: 
  •     url = 'http://xiaohua.zol.com.cn/new/  
  •  
  • ' + str(num) + '.html' 
  •     GetText(GetTrueUrl(Gethref(url))) 
  •     num=num+1  
  • 效不雅图:

    【编辑推荐】

    1. 一个Reentrant Error激发的对Python旌旗灯号机制的摸索和思虑
    2. Python赶超R说话,成为数据科学、机械进修平台中最热点的说话?

        推荐阅读

        Java并发编程之并发代码设计

      【沙龙】51CTO诚邀您9月23号和多位技巧大年夜咖一路聊智能CDN的优化之路,抓紧时光哦! 引子之前的文┞仿我们商量了激发线程安然的原因主如果因为多线程的对共享内存的操作导致的可见性或有>>>详细阅读


      本文标题:Python利用Beautifulsoup爬取笑话网站

      地址:http://www.17bianji.com/lsqh/37529.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)