作家
登录

爬虫-化被动为主动

作者: 来源: 2017-05-10 15:51:20 阅读 我要评论

 = ""
  •         var but_list=document.getElementsByTagName("input"); 
  •         for (b_i=0;b_i<but_list.length;b_i++){ 
  •                 var but_type=but_list[b_i].attributes["type"].value 
  •         if (but_type == "button" || but_type == "submit"){ 
  •         but_list[b_i].setAttribute('target','_blank'); 
  •         but_list[b_i].click(); 
  •         } 
  •         } 
  •         """ 
  • 5. 点击超链接

    这里留意下,我在click前给标签加了一个target=”_blank”,在新的标签页打开链接

    6. 封闭标签

    1. for h in driver.window_handles[1:]: 
    2. driver.switch_to_window(h) 
    3. driver.close() 
    1. _a_click = ""
    2.        var a_list=document.getElementsByTagName("a"); 
    3.        for (a_i=0;a_i<a_list.length;a_i++){ 
    4.        a_list[a_i].setAttribute('target','_blank'); 
    5.        a_list[a_i].click(); 
    6.        } 
    7.        """ 

    留意:应当先获取有标签页的handle在用switch_to_window

    切换到该标签页,履行quit()操作。driver.window_handles[1:]保存的是第一个页面。

    在完成所有操作后封闭浏览器

    经由过程burpsuite抓到的请求包

    1. url_list=[] 
    2. a_list=self.driver.find_elements_by_xpath("//a[@href]") 
    3. for a in a_list: 
    4. url_list.append(a.get_attribute("href")) 
    5. print(url_list) 

    经由过程burpsuite抓到的请求包

    最终实现的结不雅展示

    经由过程burpsuite抓到的请求包

    一些留意点:

    若何获取当前页面的所有标签的href?

    1. driver.close() 

    若何获取当前标签的URL?

    1. driver.current_url 

    如今网上有很多被动式扫描器,设备一个代劳给浏览器设置,然后人去点击浏览器上的网页,在这种模式下抓到的URL数量没有效爬虫的效不雅好。

    有什么坑?

    a.浏览器打页面要时光,但python不知道(不是真不知道)


      推荐阅读

      研究学习Kotlin的一些方法

    Kotlin是一门让人认为很舒畅的说话,比拟Java来说,它加倍简洁,省去了琐琐碎碎的语法工作,同时了供给了类似Lambda,String template,Null Safe Operator等特点。闪开辟者用起来轻车熟路>>>详细阅读


    本文标题:爬虫-化被动为主动

    地址:http://www.17bianji.com/lsqh/35132.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)