
HDFS
HDFS 是Hadoop集群中数据存储的优等公平易近。数据在集群数据节点中主动复制。
MapReduce2
众所周知,mapreduce分为两个阶段,Map阶段:起首将输入数据进行分片,然后对每一片数据履行Mapper法度榜样,计算出每个词典个数,之后对计算结不雅进行分组,每一组由一个Reducer法度榜样进行处理,到此Map阶段完成。
Reduce阶段:每个Reduce法度榜样大年夜Map的结不雅中拉取本身要处理的分组(叫做Shuffling过程),进行汇总和排序(桶排序),对排序后的结不雅运行Reducer法度榜样,最后所有的Reducer结不雅进行规约写入HDFS。
MapReduce2 是运行在YARN上的。
YARN (Yet Another Resource Negotiator,另一种资本调和者)是一种新的 Hadoop 资本治理器,它是一个通用资本治理体系,可为上层应用供给同一的资本治理和调剂。YARN的根本思惟是将JobTracker的两个重要功能(资本治理和功课调剂/监控)分别,重要办法是创建一个全局的ResourceManager(RM)和若干个针对应用法度榜样的ApplicationMaster(AM)。
Tez
Tez是Apache最新的支撑DAG功课的开源计算框架,它可以将多个有依附的功课转换为一个功课大年夜而大年夜幅晋升DAG功课的机能。Tez并不直接面向最终用户——事实上它许可开辟者为最终用户构建机能更快、扩大性更好的应用法度榜样。Tez产生的重要原因是绕开MapReduce所施加的限制。
Hive
Hive以类SQL方法简单而又强大年夜地大年夜HDFS中萌芽数据. 在用Java写了10行代码的MapReduce处所,在Hive中, 只须要一条 SQL 萌芽语句.
HBase
Hbase是一个分布式的、面向列的开源数据库,该技巧来源竽暌冠 Fay Chang 所撰写的Google论文“Bigtable:一个构造化数据的分布式存储体系”,是Google Bigtable的开源实现,应用Hadoop HDFS作为其文件存储体系。
Pig
Pig是一种数据流说话和运行情况,用于检索异常大年夜的数据集。为大年夜型数据集的处理供给了一个更高层次的抽象。Pig包含两部分:一是用于描述数据流的说话,称为Pig Latin;二是用于运行Pig Latin法度榜样的履行情况。Pig 合适于应用 Hadoop 和 MapReduce 平台来萌芽大年夜型半构造化数据集。经由过程许可对分布式数据集进行类似 SQL 的萌芽,Pig 可以简化 Hadoop 的应用。
Sqoop
Sqoop是一个大年夜构造化数据库传说大年夜量数据到HDFS. 应用它,既可以年腋荷琐外部的关系型数据库将数据导入到HDFS, Hive, 或者 HBase, 也可以Hadoop 集群导出到一个关系型数据库或者数据仓库.
Oozie
Oozie是一种Java Web应用法度榜样,它运行在Java servlet容器——即Tomcat——中,并应用数据库来存储工作流定义和当前运行的工作流实例,包含实例的状况和变量。Oozie工作流是放置在控制依附DAG(有向无环图 Direct Acyclic Graph)中的一组动作(例如,Hadoop的Map/Reduce功课、Pig功课等),个中指定了动作履行的次序。
Zookeeper
Zookeeper 分布式办事框架主如果用来解决分布式应用中经常碰到的一些数据治理问题,如:同必定名办事、状况同步办事、集群治理、分布式应用设备项的治赖寥。
Falcon
Falcon 是一个面向Hadoop的、新的数据处理和治理平台,设计用于数据移动、数据管道调和、生命周期治理和数据发明。它使终端用户可以快速地将他们的数据及其相干的处理和治理义务“上载(onboard)”到Hadoop集群,可以削减应用法度榜样开辟和治理人员编写和治理复杂数据治理和处理应用法度榜样的苦楚。
还可以经由过程虚拟机的共享目次实现,甚至在sandbox 前次一个ftp server。
Storm
Storm是一个分布式高容错的及时F算体系。Storm令持续赓续的流计算变得轻易,弥补了Hadoop批处理所不克不及知足的及时请求。Storm经常用于在及时分析、在线机械进修、持续计算、分布式长途调用和ETL等范畴。
Flume
文件传输
当查看生成的摄取日记的时刻,可以应用Apache Flume; 它是稳定且高可用的,供给了一个简单,灵活和基于流数据的可感知编程模型。根本上,仅经由过程设备治理不须要写一行代码就可以陪着一个数据流水线。
Ambri Metrics
andbox 文件复制到本地:

Ambari Metrics System 简称为 AMS,它重要为体系治理员供给了集群机能的监察功能。Metrics 一般分为 Cluster、Host 以及 Service 三个层级。Cluster 和 Host 级重要负责监察集群机械相干的机能,而 Service 级别则负责 Host Component 的机能。
Atlas
Atlas 是一个可伸缩和可扩大的核心功能治理办事。企业可以应用它高效的治理 Hadoop 以及全部企业数据生态的集成。核心功能包含:数据分类、集中审计、搜刮、安然和策略引擎。
Kafka
Apache Kafka 是一个由Linkedin开辟的订阅-宣布消息的分布式应用。是一个持久化消息的高吞吐量体系 , 支撑队列和话题语意, 应用 ZooKeeper形成集群节点。 详情拜见kafka.apache.org.
Knox
knox是一个拜访hadoop集群的restapi网关,它为所有rest拜访供给了一个简单的拜访接口点,能完成3A认证(Authentication,Authorization,Auditing)和SSO(单点登录)等。
推荐阅读
比来大年夜家针对preload、HTTP/2 push和ServiceWorker的浏览器缓存实现展开了激烈的评论辩论,而这也引起了很多人的困惑。鉴于此,我想讲个故事来让大年夜家懂得一个请求若何完成他的任务>>>详细阅读
地址:http://www.17bianji.com/lsqh/34756.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示