作家
登录

写给大数据开发初学者的话 | 附教程

作者: 来源: 2017-12-07 16:27:06 阅读 我要评论

为了知够数据的一次采集、多次花费的需求,这里要说的就是Kafka。

6.1 关于Kafka

  • 什么是Kafka?

Kafka的核心概念及名词解释。

6.2 若何安排和应用Kafka

  • 应用单机安排Kafka,并成功运行自带的临盆者和花费者例子。
  • 应用Java法度榜样本身编写并运行临盆者和花费者法度榜样。
  • Flume和Kafka的集成,应用Flume监控日记,并将日记数据及时发送至Kafka。

如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

大年夜数据

这时,应用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个花费者同时花费,个一一个花费者,就是将数据同步到HDFS。

如不雅你已经按照《写给大年夜数据开辟初学者的话3》中第五章和第六章的流程卖力完全的走了一遍,那么你应当已经具备以下技能和常识点:

  • 为什么Spark比MapReduce快。
  • 应用SparkSQL代替Hive,更快的运行SQL。
  • 应用Kafka完成数据的一次收集,多次花费架构。
  • 本身可以写法度榜样完成Kafka的临盆者和花费者。

早年面的进修,你已经控制了大年夜数据平台中的数据采集、数据存储和计算、数据交换等大年夜部分技能,而这个中的每一步,都须要一个义务(法度榜样)来完成,各个义务之间又存在必定的依附性,比如,必须等数据采集义务成功完成后,数据计算义务才能开端运行。如不雅一个义务履行掉败,须要给开辟运维人员发送告警,同时须要供给完全的日记来便利查错。

第七章:越来越多的分析义务

不仅仅是分析义务,数据采集、数据交换同样是一个个的义务。这些义务中,有的是准时触发,有点则须要依附其他义务来触发。当平台中有几百上千个义务须要保护和运行时刻,仅仅靠crontab远远不敷了,这时便须要一个调剂监控体系来完成这件事。调剂监控体系是全部数据平台的中枢体系,类似于AppMaster,负责分派和监控义务。

7.1 Apache Oozie

  1. Oozie是什么?有哪些功能?
  2. Oozie可声调剂哪些类型的义务(法度榜样)?
  3. Oozie可以支撑哪些义务触发方法?
  4. 安装设备Oozie。

7.2 其他开源的义务调剂体系

light-task-scheduler:

  • https://github.com/ltsopensource/light-task-scheduler

等等……

别的,我这边是之前零丁开辟的义务调剂与监控体系,具体请参考《大年夜数据平台义务调剂与监控体系》.

如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

大年夜数据

Azkaban:

  • https://azkaban.github.io/

在第六章介绍Kafka的时刻提到了一些须要及时指标的营业场景,及时根本可以分为绝对及时和准及时,绝对及时的延迟请求一般在毫秒级,准及时的延迟请求一般在秒、分钟级。对于须要绝对及时的营业场景,用的比较多的是Storm,对于其他准及时的营业场景,可所以Storm,也可所以Spark Streaming。当然,如不雅可以的话,也可以本身写法度榜样来做。

8.1 Storm

  • 什么是Storm?有哪些可能的应用处景?
  • Storm由哪些核心组件构成,各自担负什么角色?
  • Storm的简单安装和安排。
  • 本身编写Demo法度榜样,应用Storm完成及时数据流计算。

8.2 Spark Streaming

  • 什么是Spark Streaming,它和Spark是什么关系?
  • Spark Streaming和Storm比较,各有什么竽暌古缺点?
  • 应用Kafka + Spark Streaming,完成及时F算的Demo法度榜样。

如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

大年夜数据

至此,你的大年夜数据平台底层架构已经成型了,个中包含了数据采集、数据存储与计算(离线和及时)、数据同步、义务调剂与监控这几大年夜模块。接下来是时刻推敲若何更好的对外供给数据了。

第九章:我的数据要对外

平日对外(营业)供给数据拜访,大年夜体上包含以下方面:

  • 离线:比如,天天将前一天的数据供给到指定的数据源(DB、FILE、FTP)等;离线数据的供给可以采取Sqoop、DataX等离线数据交换对象。
  • 及时:比如,在线网站的推荐体系,须要及时大年夜数据平台中获取给用户的推荐数据,这种请求延时异常低(50毫秒以内)。
  • 根据延时要乞降及时数据的萌芽须要,可能的筹划有:HBase、Redis、MongoDB、ElasticSearch等。
  • OLAP分析:OLAP除了请求底层的数据模型比较规范,别的,对萌芽的响应速度请求也越来越高,可能的筹划有:Impala、Presto、SparkSQL、Kylin。如不雅你的数据模型比较范围,那么Kylin是最好的选择。
  • 即席萌芽:即席萌芽的数据比较随便,一般很难建立通用的数据模型,是以可能的筹划有:Impala、Presto、SparkSQL。

这么多比较成熟的框架和筹划,须要结合本身的营业需求及数据平台技巧架构,选择合适的。原则只有一个:越简单越稳定的,就是最好的。

如不雅你已经控制了若何很好的对外(营业)供给数据,那么你的“大年夜数据平台”应当是如许的:


  推荐阅读

  数字化转型中的自动化大数据治理

开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散 当今,数字化正在各行业快速成长,酝酿着一场巨大年夜的变革,很多企业将会经历前所未竽暌剐的改变。在数字化转型的门路上,数据是上>>>详细阅读


本文标题:写给大数据开发初学者的话 | 附教程

地址:http://www.17bianji.com/lsqh/39576.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)