作家
登录

大数据道场(HDP SandBox) 初探

作者: 来源: 2017-04-12 15:03:54 阅读 我要评论

Ranger

Ranger是一个hadoop集群权限框架,供给操作、监控、治理复杂的数据权限,它供给一个集中的治理机制,治理基于yarn的hadoop生态圈的所稀有据权限。

Slider

Slider 是一个 Yarn 应用,它可以用来在 Yarn 上安排并监控分布式应用。Slider 可以在应用运行期随便扩大或者紧缩应用。Slider对象是一个Java的敕令行应用,它会把信息持久化为JSON文档并存储到HDFS。当集群启动后,我们可以应用敕令扩大或者紧缩集群。集群也可以被停止或者重启。

一般的,经由过程拜访 http://127.0.0.1:8080 就可以经由过程Ambri 来浏览和治理。然则为了治理办事,须要以治理员的身份登录ambri。Sandbox 2.4 中须要经由过程履行脚本来重置ambri的治理员暗码。

Spark

Spark是一个环绕速度、易用性和复杂分析构建的大年夜数据处理框架。Spark为我们供给了一个周全、同一的框架用于治理各类有着不合性质(文本数据、图表数据等)的数据集和数据源(批量数据或及时的流数据)的大年夜数据处理的需求。Spark则许可法度榜样开辟者应用有向无环图(DAG)开辟复杂的多步数据管道。并且还支撑跨有向无环图的内存数据共享,以便不合的功课可以合营处理同一个数据。

YARN

Spark运行在现有的Hadoop分布式文件体系基本之上(HDFS)供给额外的加强功能。它支撑将Spark应用安排到现存的Hadoop v1集群(with SIMR – Spark-Inside-MapReduce)或Hadoop v2 YARN集群甚至是Apache Mesos之中。

Zeppelin Notebook

Zeppelin供给了web版的类似ipython的notebook,用于做数据分析和可视化。背后可以接入不合的数据处理引擎,包含spark, hive, tajo等,原生支撑Scala, java, shell, markdown等。Zeppelin 供给了内置的 Apache Spark 集成。Zeppelin的Spark集成供给了:

  • 主动惹人SparkContext 和 SQLContext
  • 大年夜本地文件体系或maven库载入运行时依附的jar包。更多关于依附袈湄入器
  • 可撤消job 和 展示job进度

HDP Sandbox 默认为我们供给了如斯多的组件办事,几乎涵盖了hadoop 生态体系,完了么?没有,还可以用治理员的身份来增长/启动/封闭 办事,例如Accumulo,Mahout,NiFi,Ranger KMS,SmartSense等,甚至可以自定义办事的。

【编辑推荐】

  1. Hadoop情况中治理大年夜数据存储八大年夜技能
  2. Jarvis对大年夜数据分析的将来将会有哪些赞助?
  3. 若何将逝世板的大年夜数据出现为可视化的图和动画?
  4. 打趣到实际,大年夜数据涉足文学研究–用数据模型分析莎翁著作
  5. 大年夜数据在猜测性维修中的应用
【义务编辑:51CTO_OS TEL:(010)68476606】

  推荐阅读

  关于Web缓存的那些风流事儿

比来大年夜家针对preload、HTTP/2 push和ServiceWorker的浏览器缓存实现展开了激烈的评论辩论,而这也引起了很多人的困惑。鉴于此,我想讲个故事来让大年夜家懂得一个请求若何完成他的任务>>>详细阅读


本文标题:大数据道场(HDP SandBox) 初探

地址:http://www.17bianji.com/lsqh/34756.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)