作家
登录

写给大数据开发初学者的话 | 附教程

作者: 来源: 2017-12-07 16:27:06 阅读 我要评论

建议闇练控制。

3.2 HDFS API

HDFS供给了写数据的API,本身用编程说话将数据写入HDFS,put敕令本身也是应用API。

实际情况一一般本身较少编写法度榜样应用API来写数据到HDFS,平日都是应用其他框架封装好的办法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。

建议懂得道理,会写Demo。

3.3 Sqoop

Sqoop是一个重要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。

就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。

本身下载和设备Sqoop(建议先应用Sqoop1,Sqoop2比较复杂)。

  • 懂得Sqoop常用的设备参数和办法。
  • 应用Sqoop完成大年夜MySQL同步数据到HDFS;
  • 应用Sqoop完成大年夜MySQL同步数据到Hive表;

PS:如不雅后续选型肯定应用Sqoop作为数据交换对象,那么建议闇练控制,不然,懂得和会用Demo即可。

3.4 Flume

  • Flume是一个分布式的海量日记采集和传输框架,因为“采集和传输框架”,所以它并不合适关系型数据库的数据采集和传输。
  • Flume可以及时的大年夜收集协定、消息体系、文件体系采集日记,并传输到HDFS上。

第二章:更高效的WordCount

就我小我而言,重要经验是在第二个偏向(开辟/设计/架构),且听听我的建议吧。

下载和设备Flume。

应用Flume监控一个赓续追加数据的文件,并将数据传输到HDFS;

PS:Flume的设备和应用较为复杂,如不雅你没有足够的兴趣和耐烦,可以先跳过Flume。

3.5 阿里开源的DataX

你也可以在其之上做二次开辟。

之所以介绍这个,是因为我们公司今朝应用的Hadoop与关系型数据库数据交换的对象,就是之前基于DataX开辟的,异常好用。

可以参考我的博文《异构数据源海量数据交换对象-Taobao DataX 下载和应用》。

如今DataX已经是3.0版本,支撑很多半据源。

PS:有兴趣的可以研究和应用一下,比较一下它与Sqoop。

如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

大年夜数据

第四┞仿:把Hadoop上的数据搞到别处去

前面介绍了若何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以应用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结不雅若何大年夜Hadoop上同步到其他体系和应用中去呢?

其实,此处的办法和第三章根本一致的。

你不会Java?Shell、Python都可以,有个器械叫Hadoop Streaming。

是以,如不雅你的营业有这些数据源的数据,并且须要及时的采集,那么就应当推敲应用Flume。

4.1 HDFS GET敕令

第八章:我的数据要及时

把HDFS汕9依υ?件GET到本地。须要闇练控制。

4.2 HDFS API

同3.2.

Hadoop可以算是大年夜数据存储和计算的开山开山祖师,如今大年夜多开源的大年夜数据框架都依附Hadoop或者与它能很好的兼容。

4.3 Sqoop

2.3 SQL src="http://s5.51cto.com/oss/201712/07/baaebb20988202cd2b447005616f9e47.jpeg" />

同3.3.

  • 应用Sqoop完成将HDFS汕9依υ?件同步到MySQL;
  • 应用Sqoop完成将Hive表中的数据同步到MySQL;

4.4 DataX

同3.5.

Zeus:

  • https://github.com/alibaba/zeus

如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

大年夜数据

如不雅你已经按照《写给大年夜数据开辟初学者的话2》中第三章和第四┞仿的流程卖力完全的走了一遍,那么你应当已经具备以下技能和常识点:

  • 知道若何把已有的数据采集到HDFS上,包含离线采集和及时采集;
  • 你已经知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换对象;
  • 你已经知道flume可以用作及时的日记采集。

早年面的进修,对于大年夜数据平台,你已经控制的不少的常识和技能,搭建Hadoop集群,把数据采集到Hadoop上,应用Hive和MapReduce来分析数据,把分析结不雅同步到其他数据源。

接下来的问题来了,Hive应用的越来越多,你会发明很多不爽的处所,特别是速度慢,大年夜多情况下,明明我的数据量很小,它都要申请资本,启动MapReduce来履行。

第五章:快一点吧,我的SQL

其实大年夜家都已经发明Hive后台应用MapReduce作为履行引擎,实袈溱是有点慢。

是以SQL src="http://s3.51cto.com/oss/201712/07/2cfe536c59ac4bf9313de7a894cff770.jpeg" />

第六章:一夫多妻制

请不要被这个名字所诱惑。其实我想说的是数据的一次采集、多次花费。

在实际营业场景下,特别是对于一些监控日记,想即时的大年夜日记中懂得一些指标(关于及时F算,后面章节会有介绍),这时刻,大年夜HDFS上分析就太慢了,尽管是经由过程Flume采集的,但Flume也不克不及距离很短就往HDFS上滚动文件,如许会导致小文件特别多。


  推荐阅读

  数字化转型中的自动化大数据治理

开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散 当今,数字化正在各行业快速成长,酝酿着一场巨大年夜的变革,很多企业将会经历前所未竽暌剐的改变。在数字化转型的门路上,数据是上>>>详细阅读


本文标题:写给大数据开发初学者的话 | 附教程

地址:http://www.17bianji.com/lsqh/39576.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)