作家
登录

Python利用Beautifulsoup爬取笑话网站

作者: 来源: 2017-09-19 19:07:54 阅读 我要评论

'_blank',class_='all-read'
  •         for b in list_second: 
  •             href = b['href'
  •             list_href.append(href) 
  •     return list_href 
  • def GetTrueUrl(liebiao): 
  •     list = [] 
  •     for i in liebiao: 
  •         url = 'http://xiaohua.zol.com.cn  
  •  
  • '+str(i) 
  •         list.append(url) 
  •     return list 
  • def GetText(url): 
  •     for i in url: 
  •         html = requests.get(i) 
  •         soup = BeautifulSoup(html.text,'lxml'
  •         content = soup.find('div',class_='article-text'
  •         title = soup.find('h1',class_ = 'article-title'
  •         SaveText(title.text,content.text) 
  • def SaveText(TextTitle,text): 
  •     os.chdir('/home/lei/zol/'
  •     f = open(str(TextTitle)+'txt','w'
  •     f.write(text) 
  •     f.close() 
  • GetText(GetTrueUrl(Gethref(all_url)))  
  • (因为我的体系为linux体系,路径问题请按照本身电脑本身更改)

    我们的目标不是抓取一个页面的笑话那么简单,下一步我们要做的是把须要的页面遍历一遍!

    经由过程不雅察可以获得全部笑话页面url为http://xiaohua.zol.com.cn/new/+页码+html,接下来我们遍历前100页的所有笑话,全手下载下来!

    接下来我们再次修改代码:

    1. from bs4 import BeautifulSoup 
    2. import os 
    3. import requests 
    4. num = 1 
    5. url = 'http://xiaohua.zol.com.cn/new/  
    6.  
    7. '+str(num)+'.html' 
    8. os.mkdir('/home/lei/zol'
    9. def Gethref(url): 
    10.     list_href = [] 
    11.     headers = { 'User-Agent'"Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1"
    12.     html = requests.get(url,headers = headers) 

        推荐阅读

        Java并发编程之并发代码设计

      【沙龙】51CTO诚邀您9月23号和多位技巧大年夜咖一路聊智能CDN的优化之路,抓紧时光哦! 引子之前的文┞仿我们商量了激发线程安然的原因主如果因为多线程的对共享内存的操作导致的可见性或有>>>详细阅读


      本文标题:Python利用Beautifulsoup爬取笑话网站

      地址:http://www.17bianji.com/lsqh/37529.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)