作家
登录

写给大数据开发初学者的话 | 附教程

作者: 来源: 2017-12-07 16:27:06 阅读 我要评论

开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散


导读:

  • 第一章:初识Hadoop
  • 第二章:更高效的WordCount
  • 第三章:把别处的数据搞到Hadoop上
  • 第四┞仿:把Hadoop上的数据搞到别处去
  • 第五章:快一点吧,我的SQL
  • 第六章:一夫多妻制
  • 第七章:越来越多的分析义务
  • 第八章:我的数据要及时
  • 第九章:我的数据要对外
  • 第十章:牛逼高大年夜上的机械进修

经常有初学者在博客和QQ问我,本身想往大年夜数据偏向成长,钙揭捉?哪些技巧,进修路线是什么样的,认为大年夜数据很火,就业很好,薪资很高。如不雅本身很迷茫,为了这些原因想往大年夜数据偏向成长,也可以,那么我就想问一下,你的专业是什么,对于计算机/软件,你的兴趣是什么?是计算机专业,对操作体系、硬件、收集、办事器感兴趣?是软件专业,对软件开辟、编程、写代码感兴趣?照样数学、统计学专业,对数据和数字特别感兴趣。。

写给大年夜数据开辟初学者的话 | 附教程

其拭魅这就是想告诉你的大年夜数据的三个成长偏向,平台搭建/优化/运维/监控、大年夜数据开辟/设计/架构、数据分析/发掘。请不要问我哪个轻易,哪个前景好,哪个钱多。

先扯一下大年夜数据的4V特点:

  • 数据量大年夜,TB->PB
  • 数据类型繁多,构造化、非构造化文本、日记、视频、图片、地舆地位等;
  • 贸易价值高,然则这种价值须要在海量数据之上,经由过程数据分析与机械进修更快速的发掘出来;

处理时效性高,海量数据的处篮孟耋不再局限在离线计算傍边。

现如今,正式为了应对大年夜数据的┞封几个特点,开源的大年夜数据框架越来越多,越来越强,先列举一些常见的:

  • 文件存储:Hadoop HDFS、Tachyon、KFS
  • 离线计算:Hadoop MapReduce、Spark
  • 流式、及时F算:Storm、Spark Streaming、S4、Heron
  • K-V、NOSQL数据库:HBase、Redis、MongoDB
  • 资本治理:YARN、Mesos
  • 日记收集:Flume、Scribe、Logstash、Kibana
  • 消息体系:Kafka、StormMQ、ZeroMQ、RabbitMQ
  • 萌芽分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
  • 分布式调和办事:Zookeeper
  • 集群治理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
  • 数据发掘、机械进修:Mahout、Spark MLLib
  • 数据同步:Sqoop
  • 义务调剂:Oozie
  • ……

目眩了吧,膳绫擎的有30多种吧,别说精晓了,全部都邑应用的,估计也没几个。

第一章:初识Hadoop

1.1 学会百度与Google

不论碰到什愦问题,先尝尝搜刮并本身解决。

Google首选,翻不以前的,就用百度吧。

1.2 参考材料首选官方文档

信赖搞这块的大年夜多是文化人,英文凑合就行,实袈溱看不下去的,请参考第一步。

1.3 先让Hadoop跑起来

2.1 学点SQL吧

关于Hadoop,你至少须要搞清跋扈以下是什么:

  • Hadoop 1.0、Hadoop 2.0
  • MapReduce、HDFS
  • NameNode、DataNode
  • JobTracker、TaskTracker
  • Yarn、ResourceManager、NodeManager

本身搭建Hadoop,请应用第一步和第二步,能让它跑起来久煨。

建议先应用安装包敕令行安装,不要应用治理对象安装。

别的:Hadoop1.0知道它就行了,如今都用Hadoop 2.0.

1.4 尝尝应用Hadoop

  • HDFS目次操作敕令;
  • 上传、下载文件敕令;
  • 提走运行MapReduce示例法度榜样;
  • 打开Hadoop WEB界面,查看Job运行状况,查看Job运行日记。

知道Hadoop的体系日记在哪里。

1.5 你该懂得它们的道理了

  • MapReduce:若何分而治之;
  • HDFS:数据到底在哪里,什么是副本;
  • Yarn到底是什么,它能干什么;
  • NameNode到底在干些什么;
  • ResourceManager到底在干些什么;

1.6 本身写一个MapReduce法度榜样

请模仿WordCount例子,本身写一个(照抄也行)WordCount法度榜样,

打包并提交到Hadoop运行。

如不雅你卖力完成了以上几步,恭喜你,你的一只脚已经进来了。

你知道数据库吗?你会写SQL吗?

机械进修确切牛逼高大年夜上,也是我进修的目标。

如不雅不会,请学点SQL吧。

2.2 SQL版WordCount

在1.6中,你写(或者抄)的WordCount一共有几行代码?

给你看看我的:

  • SELECT word,COUNT(1) FROM wordcount GROUP BY word;

这就是SQL的魅力,编程须要几十行,甚至上百行代码,我这一句就搞定;应用SQL处理分析Hadoop上的数据,便利、高效、易上手、更是趋势。不论是离线计算照样及时F算,越来越多的大年夜数据处理框架都在积极供给SQL接口。

那么问题来了,海量数据若何到HDFS上呢?

第三章:把别处的数据搞到Hadoop上

此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。

3.1 HDFS PUT敕令

这个在前面你应当已经应用过了。

put敕令在实际情况中也比较常用,平日合营shell、python等脚本说话来应用。

 1/4    1 2 3 4 下一页 尾页

  推荐阅读

  数字化转型中的自动化大数据治理

开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散 当今,数字化正在各行业快速成长,酝酿着一场巨大年夜的变革,很多企业将会经历前所未竽暌剐的改变。在数字化转型的门路上,数据是上>>>详细阅读


本文标题:写给大数据开发初学者的话 | 附教程

地址:http://www.17bianji.com/lsqh/39576.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)