
(因为我的体系为linux体系,路径问题请按照本身电脑本身更改)
我们的目标不是抓取一个页面的笑话那么简单,下一步我们要做的是把须要的页面遍历一遍!
经由过程不雅察可以获得全部笑话页面url为http://xiaohua.zol.com.cn/new/+页码+html,接下来我们遍历前100页的所有笑话,全手下载下来!
接下来我们再次修改代码:
- from bs4 import BeautifulSoup
- import os
- import requests
- num = 1
- url = 'http://xiaohua.zol.com.cn/new/
- '+str(num)+'.html'
- os.mkdir('/home/lei/zol')
- def Gethref(url):
- list_href = []
- headers = { 'User-Agent': "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1"}
- html = requests.get(url,headers = headers)
推荐阅读
【沙龙】51CTO诚邀您9月23号和多位技巧大年夜咖一路聊智能CDN的优化之路,抓紧时光哦! 引子之前的文┞仿我们商量了激发线程安然的原因主如果因为多线程的对共享内存的操作导致的可见性或有>>>详细阅读
本文标题:Python利用Beautifulsoup爬取笑话网站
地址:http://www.17bianji.com/lsqh/37529.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示