Oozie:既然学会Hive了,我信赖你必定须要这个器械,它可以帮你治理你的Hive或者MapReduce、Spark脚本,还能检查你的法度榜样是否履行精确,掉足了给你发报警并能帮你重试法度榜样,最重要的是还能帮你设备义务的依附关系。我信赖你必定会爱好上它的,不然你看着那一大年夜堆脚本,和密密麻麻的crond是不是有种想屎的感到。
Hbase:这是Hadoop生态体系中的NOSQL数据库,他的数据是按照key和value的情势存储的并且key是独一的,所以它能用来做数据的排重,它与MYSQL比拟能存储的数据量大年夜很多。所以他常被用于大年夜数据处理完成之后的存储目标地。
Kafka:这是个比较好用的队列对象,队列是干吗的?列队买票你知道不?数据多了同样也须要列队处理,如许与你协作的其它同窗不会叫起来,你干吗给我这么多的数据(比如好几百G的文件)我怎么处理得过来,你别怪他因为他不是搞大年夜数据的,你可以跟他讲我把数据放在队列里你应用的时刻一个个拿,如许他就不在抱怨了立时灰流流的却竽暌古化他的法度榜样去了,因为处理不过来就是他的工作。而不是你给的问题。当然我们也可以应用这个对象来做线上及时数据的入库或人HDFS,这时你可以与一个叫Flume的对象合营应用,它是专门用来供给对数据进内行单处理,并写到各类数据接收方(比如Kafka)的。
Spark:它是用来弥补基于MapReduce处理数据速度上的缺点,它的特点是把数据装载到内存上钩算而不是去读慢的要逝世进化还特别慢的硬盘。特别合适做迭代运算,所以算法流们特别稀饭它。它是用scala编写的。Java说话或者Scala都可以操作它,因为它们都是用JVM的。
·会这些器械你就成为一个专业的大年夜数据开辟工程师了,月薪2W都是小毛毛雨
后续进步:当然照样有很有可以进步的处所,比如进修下python,可以用它来编写收集爬虫。如许我们就可以本身造数据了,收集上的各类数据你高兴都可以下载到你的集群上去处理。
End.
推荐阅读
科技世界大年夜良久以前就开端接收高风险、高回报的创意了,人们经常会听到关于某种技巧将若何彻底改变世界的评论辩论。区块链可能激发重大年夜变革,包含袭击选举讹诈和重建世界金融体系。区块链的将来似乎十分光亮>>>详细阅读
本文标题:从小白到大数据技术专家的学习历程
地址:http://www.17bianji.com/lsqh/36143.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示