作家
登录

Python爬虫之BeautifulSoup

作者: 来源: 2017-06-14 17:04:45 阅读 我要评论

-- Elsie --></a>, <a class="sister" href=http://developer.51cto.com/art/201706/"http://example.com/lacie" id="link2">Lacie, Tillie] 

经由过程id名查找

  1. print soup.select('#link1'
  2.  
  3. #[<a class="sister" href=http://developer.51cto.com/art/201706/"http://example.com/elsie" id="link1"><!-- Elsie --></a>] 

组合查找

学过 css 的都知道 css 选择器,如 p #link1 是查找 p 标签下的 id 属性为 link1 的标签

  1. print soup.select('p #link1')    #查找p标签中内容为id属性为link1的标签 
  2.  
  3. #[<a class="sister" href=http://developer.51cto.com/art/201706/"http://example.com/elsie" id="link1"><!-- Elsie --></a>] 
  4.  
  5.   
  6.  
  7. print soup.select("head > title")   #直接查找子标签 
  8.  
  9. #[<title>The Dormouse's story</title>] 

查找时还可以参加属性元素,属性须要用中括号括起来,留意属性和标签属于同一节点,所以中心不克不及加空格,不然会无法匹配到。

  1. print soup.select('a[class="sister"]'
  2.  
  3. #[<a class="sister" href=http://developer.51cto.com/art/201706/"http://example.com/elsie" id="link1"><!-- Elsie --></a>, <a class="sister" href=http://developer.51cto.com/art/201706/"http://example.com/lacie" id="link2">Lacie, Tillie] 
  4.   
  5.  
  6. print soup.select('a[href=http://developer.51cto.com/art/201706/"http://example.com/elsie"]'
  7.  
  8. #[<a class="sister" href=http://developer.51cto.com/art/201706/"http://example.com/elsie" id="link1"><!-- Elsie --></a>] 

同样,属性仍然可以与上述查找方法组合,不在同一节点的空格隔开,同一节点的不加空格,代码如下:

属性查找

  1. print soup.select('p a[href=http://developer.51cto.com/art/201706/"http://example.com/elsie"]'
  2.  
  3. #[<a class="sister" href=http://developer.51cto.com/art/201706/"http://example.com/elsie" id="link1"><!-- Elsie --></a>] 

以上的 select 办法返回的结不雅都是列表情势,可以遍历情势输出,然后用 get_text() 办法来获取它的内容


  推荐阅读

  华为发力云端 撬动城市云计算产业升级

【51CTO.com原创稿件】进入2017年,记者异常明显地感到到,云办事的成长,已经成为城市之间比拼实力的重要赛道>>>详细阅读


本文标题:Python爬虫之BeautifulSoup

地址:http://www.17bianji.com/lsqh/35763.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)