为了知够数据的一次采集、多次花费的需求,这里要说的就是Kafka。
6.1 关于Kafka
- 什么是Kafka?
Kafka的核心概念及名词解释。
6.2 若何安排和应用Kafka
- 应用单机安排Kafka,并成功运行自带的临盆者和花费者例子。
- 应用Java法度榜样本身编写并运行临盆者和花费者法度榜样。
- Flume和Kafka的集成,应用Flume监控日记,并将日记数据及时发送至Kafka。
如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

这时,应用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个花费者同时花费,个一一个花费者,就是将数据同步到HDFS。
如不雅你已经按照《写给大年夜数据开辟初学者的话3》中第五章和第六章的流程卖力完全的走了一遍,那么你应当已经具备以下技能和常识点:
- 为什么Spark比MapReduce快。
- 应用SparkSQL代替Hive,更快的运行SQL。
- 应用Kafka完成数据的一次收集,多次花费架构。
- 本身可以写法度榜样完成Kafka的临盆者和花费者。
早年面的进修,你已经控制了大年夜数据平台中的数据采集、数据存储和计算、数据交换等大年夜部分技能,而这个中的每一步,都须要一个义务(法度榜样)来完成,各个义务之间又存在必定的依附性,比如,必须等数据采集义务成功完成后,数据计算义务才能开端运行。如不雅一个义务履行掉败,须要给开辟运维人员发送告警,同时须要供给完全的日记来便利查错。
第七章:越来越多的分析义务
不仅仅是分析义务,数据采集、数据交换同样是一个个的义务。这些义务中,有的是准时触发,有点则须要依附其他义务来触发。当平台中有几百上千个义务须要保护和运行时刻,仅仅靠crontab远远不敷了,这时便须要一个调剂监控体系来完成这件事。调剂监控体系是全部数据平台的中枢体系,类似于AppMaster,负责分派和监控义务。
7.1 Apache Oozie
- Oozie是什么?有哪些功能?
- Oozie可声调剂哪些类型的义务(法度榜样)?
- Oozie可以支撑哪些义务触发方法?
- 安装设备Oozie。
7.2 其他开源的义务调剂体系
light-task-scheduler:
- https://github.com/ltsopensource/light-task-scheduler
等等……
别的,我这边是之前零丁开辟的义务调剂与监控体系,具体请参考《大年夜数据平台义务调剂与监控体系》.
如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

Azkaban:
- https://azkaban.github.io/
在第六章介绍Kafka的时刻提到了一些须要及时指标的营业场景,及时根本可以分为绝对及时和准及时,绝对及时的延迟请求一般在毫秒级,准及时的延迟请求一般在秒、分钟级。对于须要绝对及时的营业场景,用的比较多的是Storm,对于其他准及时的营业场景,可所以Storm,也可所以Spark Streaming。当然,如不雅可以的话,也可以本身写法度榜样来做。
8.1 Storm
- 什么是Storm?有哪些可能的应用处景?
- Storm由哪些核心组件构成,各自担负什么角色?
- Storm的简单安装和安排。
- 本身编写Demo法度榜样,应用Storm完成及时数据流计算。
8.2 Spark Streaming
- 什么是Spark Streaming,它和Spark是什么关系?
- Spark Streaming和Storm比较,各有什么竽暌古缺点?
- 应用Kafka + Spark Streaming,完成及时F算的Demo法度榜样。
如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

至此,你的大年夜数据平台底层架构已经成型了,个中包含了数据采集、数据存储与计算(离线和及时)、数据同步、义务调剂与监控这几大年夜模块。接下来是时刻推敲若何更好的对外供给数据了。
第九章:我的数据要对外
平日对外(营业)供给数据拜访,大年夜体上包含以下方面:
- 离线:比如,天天将前一天的数据供给到指定的数据源(DB、FILE、FTP)等;离线数据的供给可以采取Sqoop、DataX等离线数据交换对象。
- 及时:比如,在线网站的推荐体系,须要及时大年夜数据平台中获取给用户的推荐数据,这种请求延时异常低(50毫秒以内)。
- 根据延时要乞降及时数据的萌芽须要,可能的筹划有:HBase、Redis、MongoDB、ElasticSearch等。
- OLAP分析:OLAP除了请求底层的数据模型比较规范,别的,对萌芽的响应速度请求也越来越高,可能的筹划有:Impala、Presto、SparkSQL、Kylin。如不雅你的数据模型比较范围,那么Kylin是最好的选择。
- 即席萌芽:即席萌芽的数据比较随便,一般很难建立通用的数据模型,是以可能的筹划有:Impala、Presto、SparkSQL。
这么多比较成熟的框架和筹划,须要结合本身的营业需求及数据平台技巧架构,选择合适的。原则只有一个:越简单越稳定的,就是最好的。
如不雅你已经控制了若何很好的对外(营业)供给数据,那么你的“大年夜数据平台”应当是如许的:
推荐阅读
开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散 当今,数字化正在各行业快速成长,酝酿着一场巨大年夜的变革,很多企业将会经历前所未竽暌剐的改变。在数字化转型的门路上,数据是上>>>详细阅读
本文标题:写给大数据开发初学者的话 | 附教程
地址:http://www.17bianji.com/lsqh/39576.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示