数据抓取完了 怎么保存是个问题
这里我们经由过程key 来给数据做分类,每次按照key来获取链接,进行遍历,如许的好处是保存的数据是一个整体,如今思虑数据保存的问题
- /**
- * 爬虫抓取主人口
- */
- const start = async() => {
- let booklistRes = await bookListInit();
- if (!booklistRes) {
- logger.warn('书本列表抓取掉足,法度榜样终止...');
- return;
- }
- logger.info('书本列表抓取成功,如今进行书本章节抓取...');
- let chapterlistRes = await chapterListInit();
- if (!chapterlistRes) {
- logger.warn('书本章节列表抓取掉足,法度榜样终止...');
- return;
- }
- logger.info('书本章节列表抓取成功,如今进行书本内容抓取...');
- let contentListRes = await contentListInit();
- if (!contentListRes) {
- logger.warn('书本章节内容抓取掉足,法度榜样终止...');
- return;
- }
- logger.info('书本内容抓取成功');
- }
- // 开端人口
- if (typeof bookListInit === 'function' && typeof chapterListInit === 'function') {
- // 开端抓取
- start();
- }
1、可以以整体的方法进行插入
广泛的遍历方法 是每次萌芽必定的数量,来做抓取,如许缺点是只是以必定命量做分类,数据之间没有接洽关系,以批量方法进行插入,如不雅掉足 则容错会有一些小问题,并且我们想一本书作为一个集合零丁保存会碰到问题。是以我们采取第二种就是以一个书本单位进行内容抓取和保存。
长处 : 速度快 数据库操作不浪费时光。
缺点 : 有的书本可能有几百个章节 也就意味着要先保存几百个页面的内容再进行插入,如许做同样很消费内存,有可能造检法度榜样运行不稳定。
2、可以以每一篇文┞仿的情势插入数据库。
长处 : 页面抓取即保存的方法 使得数据可以或许及时保存,即使后续掉足也不须要从新保存前面的┞仿节,
推荐阅读
【限时免费】岁尾最强一次云计算大年夜会,看传统、社区、互联网企业若何碰撞? 一、模块 or global很多初学者有个误区,就是在Python中须要设备一个全局的参数时,起首想到的是global关键>>>详细阅读
本文标题:NodeJs爬虫抓取古代典籍,共计16000个页面心得体会总结及项目分享
地址:http://www.17bianji.com/lsqh/40135.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示