作家
登录

基于Hadoop大数据分析应用场景与实战

作者: 来源: 2017-09-19 09:50:44 阅读 我要评论

【沙龙】51CTO诚邀您9月23号和多位技巧大年夜咖一路聊智能CDN的优化之路,抓紧时光哦!


基于Hadoop大年夜数据分析应用处景与拭魅战

大年夜数据是不克不及用传统的计算技巧处理的大年夜型数据集的集合。它不是一个单一的技巧或对象,而是涉及的营业和技巧典范多范畴。

今朝主流的三大年夜分布式计算体系分别为:Hadoop、Spark和Strom:

  • Hadoop当前大年夜数据治理标准之一,应用在当前很多贸易应用体系。可以轻松地集成构造化、半构造化甚至非构造化数据集。
  • Spark采取了内存计算。大年夜多迭代批处理出发,许可将数据载入内存作反复萌芽,此外还融合数据仓库,流处理和图形计算等多种计算范式。Spark构建在HDFS上,能与Hadoop很好的结合。它的RDD是一个很大年夜的特点。
  • Storm用于处理高速、大年夜型数据流的分布式及时F算体系。为Hadoop添加了靠得住的及时数据处理功能

Hadoop是应用Java编写,许可分布在集群,应用简单的编程模型的计算机大年夜型数据集处理的Apache的开源框架。 Hadoop框架应用工程供给跨计算机集群的分布式存储和计算的情况。 Hadoop是专为大年夜单一办事器到上千台机械扩大,每个机械都可以供给本地计算和存储。

Hadoop实用于海量数据、离线数据和负责数据,应用处景如下:

为了知足日益增长的营业变更,京东的京麦团队在京东大年夜数据平台的基本上,采取了Hadoop等热点的开源大年夜数据计算引擎,打造了一款为京东运营和产品供给决定计划性的数据类产品-北斗平台。

场景1:数据分析,如京东海量日记分析,京东商品推荐,京东用户行动分析

场景2:离线计算,(异构计算+分布式计算)天文计算

场景3:海量数据存储,如京东的存储集群

HDFS(Hadoop File System),是Hadoop的分布式文件存储体系。

基于京麦营业三个实用处景

  • 京麦用户分析
  • 京麦流量分析
  • 京麦订单分析

都属于离线数据,决定采取Hadoop作为京麦数据类产品的数据计算引擎,后续会根据营业的成长,会增长Storm等流式计算的计算引擎,下图是京麦的北斗体系架构图:

(图一)京东北斗体系

二、浅谈Hadoop的基来源基本理

Hadoop分布式处理框架核心设计

  • HDFS :(Hadoop Distributed File System)分布式文件体系
  • MapReduce: 是一种计算模型及软件架构

2.1 HDFS

将大年夜文件分化为多个Block,每个Block保存多个副本。供给容错机制,副本损掉或者宕机时主动恢复。默扰绫强个Block保存3个副本,64M为1个Block。将Block按照key-value映射到内存傍边。

一、Hadoop的应用营业分析

(图二)数据写入HDFS

(图三)HDFS攫取数据

2.2 MapReduce

MapReduce是一个编程模型,封装了并行计算、容错、数据分布、负载均衡等细节问题。MapReduce实现最开端是映射map,将操作映射到集合中的每个文档,然后按照产生的键进行分组,并将产生的键值构成列表放到对应的键中。化简(reduce)则是把列表中的值化简成一个单值,这个值被返回,然后再次进行键分组,直到每个键的列表只有一个值为止。如许做的好处是可以在义务被分化后,可以经由过程大年夜量机械进行并行计算,削减全部操作的时光。但如不雅你液喂寿通俗点介绍,那么,说白了,Mapreduce的道理就是一个分治算法。

算法:

MapReduce筹划分三个阶段履行,即竽暌钩射阶段,shuffle阶段,并削减阶段。


映射阶段:映射或映射器的工作是处理输入数据。一般输入数据是在文件或目次的情势,并且被存储在Hadoop的文件体系(HDFS)。输入文件被传递到由线映射器功能线路。映射器处理该数据,并创建数据的若干小块。

削减阶段:这个阶段是:Shuffle阶段和Reduce阶段的组合。减速器的工作是处理该来自映射器中的数据。处理之后,它产生一组新的输出,这将被存储在HDFS。

(图四)MapReduce

2.3 HIVE

hive是基于Hadoop的一个数据仓库对象,可以将构造化的数据文件映射为一张数据库表,并供给完全的sql萌芽功能,可以将sql语句转换为MapReduce义务进交运行,这套SQL 简称HQL。使不熟悉mapreduce 的用户很便利的应用SQL 说话萌芽,汇总,分析数据。而mapreduce开辟人员可以把己写的mapper 和reducer 作为插件来支撑Hive 做更复杂的数据分析。

(图五)HIVE体系架构图

由上图可知,hadoop和mapreduce是hive架构的基本。Hive架构包含如下组件:CLI(command line interface)、JDBC/ODBC、Thrift Server、WEB GUI、metastore和Driver(Complier、Optimizer和Executor)。


  推荐阅读

  从三大神经网络,测试对比TensorFlow、MXNet、CNTK、Theano四个框架

【沙龙】51CTO诚邀您9月23号和多位技巧大年夜咖一路聊智能CDN的优化之路,抓紧时光哦! 本文比较了 Keras 支撑的主流深度进修框架机能,包含 TensorFlow、CNTK、MXNet 和 Theano,作者欲望>>>详细阅读


本文标题:基于Hadoop大数据分析应用场景与实战

地址:http://www.17bianji.com/lsqh/37502.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)