建议闇练控制。
3.2 HDFS API
HDFS供给了写数据的API,本身用编程说话将数据写入HDFS,put敕令本身也是应用API。
实际情况一一般本身较少编写法度榜样应用API来写数据到HDFS,平日都是应用其他框架封装好的办法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。
建议懂得道理,会写Demo。
3.3 Sqoop
Sqoop是一个重要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。
就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
本身下载和设备Sqoop(建议先应用Sqoop1,Sqoop2比较复杂)。
- 懂得Sqoop常用的设备参数和办法。
- 应用Sqoop完成大年夜MySQL同步数据到HDFS;
- 应用Sqoop完成大年夜MySQL同步数据到Hive表;
PS:如不雅后续选型肯定应用Sqoop作为数据交换对象,那么建议闇练控制,不然,懂得和会用Demo即可。
3.4 Flume
- Flume是一个分布式的海量日记采集和传输框架,因为“采集和传输框架”,所以它并不合适关系型数据库的数据采集和传输。
- Flume可以及时的大年夜收集协定、消息体系、文件体系采集日记,并传输到HDFS上。
第二章:更高效的WordCount
就我小我而言,重要经验是在第二个偏向(开辟/设计/架构),且听听我的建议吧。
下载和设备Flume。
应用Flume监控一个赓续追加数据的文件,并将数据传输到HDFS;
PS:Flume的设备和应用较为复杂,如不雅你没有足够的兴趣和耐烦,可以先跳过Flume。
3.5 阿里开源的DataX
你也可以在其之上做二次开辟。
之所以介绍这个,是因为我们公司今朝应用的Hadoop与关系型数据库数据交换的对象,就是之前基于DataX开辟的,异常好用。
可以参考我的博文《异构数据源海量数据交换对象-Taobao DataX 下载和应用》。
如今DataX已经是3.0版本,支撑很多半据源。
PS:有兴趣的可以研究和应用一下,比较一下它与Sqoop。
如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的:

第四┞仿:把Hadoop上的数据搞到别处去
前面介绍了若何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以应用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结不雅若何大年夜Hadoop上同步到其他体系和应用中去呢?
其实,此处的办法和第三章根本一致的。
你不会Java?Shell、Python都可以,有个器械叫Hadoop Streaming。
是以,如不雅你的营业有这些数据源的数据,并且须要及时的采集,那么就应当推敲应用Flume。
4.1 HDFS GET敕令
第八章:我的数据要及时
把HDFS汕9依υ?件GET到本地。须要闇练控制。
4.2 HDFS API
同3.2.
Hadoop可以算是大年夜数据存储和计算的开山开山祖师,如今大年夜多开源的大年夜数据框架都依附Hadoop或者与它能很好的兼容。
4.3 Sqoop
2.3 SQL src="http://s5.51cto.com/oss/201712/07/baaebb20988202cd2b447005616f9e47.jpeg" /> 同3.3. 4.4 DataX 同3.5. Zeus: 如不雅你卖力完成了膳绫擎的进修和实践,此时,你的”大年夜数据平台”应当是如许的: 如不雅你已经按照《写给大年夜数据开辟初学者的话2》中第三章和第四┞仿的流程卖力完全的走了一遍,那么你应当已经具备以下技能和常识点: 早年面的进修,对于大年夜数据平台,你已经控制的不少的常识和技能,搭建Hadoop集群,把数据采集到Hadoop上,应用Hive和MapReduce来分析数据,把分析结不雅同步到其他数据源。 接下来的问题来了,Hive应用的越来越多,你会发明很多不爽的处所,特别是速度慢,大年夜多情况下,明明我的数据量很小,它都要申请资本,启动MapReduce来履行。 第五章:快一点吧,我的SQL 其实大年夜家都已经发明Hive后台应用MapReduce作为履行引擎,实袈溱是有点慢。 是以SQL src="http://s3.51cto.com/oss/201712/07/2cfe536c59ac4bf9313de7a894cff770.jpeg" /> 第六章:一夫多妻制 请不要被这个名字所诱惑。其实我想说的是数据的一次采集、多次花费。 在实际营业场景下,特别是对于一些监控日记,想即时的大年夜日记中懂得一些指标(关于及时F算,后面章节会有介绍),这时刻,大年夜HDFS上分析就太慢了,尽管是经由过程Flume采集的,但Flume也不克不及距离很短就往HDFS上滚动文件,如许会导致小文件特别多。
推荐阅读 开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散 当今,数字化正在各行业快速成长,酝酿着一场巨大年夜的变革,很多企业将会经历前所未竽暌剐的改变。在数字化转型的门路上,数据是上>>>详细阅读 本文标题:写给大数据开发初学者的话 | 附教程 地址:http://www.17bianji.com/lsqh/39576.html 1/2 1


网友点评
精彩导读
科技快报
品牌展示