Ranger
Ranger是一个hadoop集群权限框架,供给操作、监控、治理复杂的数据权限,它供给一个集中的治理机制,治理基于yarn的hadoop生态圈的所稀有据权限。
Slider
Slider 是一个 Yarn 应用,它可以用来在 Yarn 上安排并监控分布式应用。Slider 可以在应用运行期随便扩大或者紧缩应用。Slider对象是一个Java的敕令行应用,它会把信息持久化为JSON文档并存储到HDFS。当集群启动后,我们可以应用敕令扩大或者紧缩集群。集群也可以被停止或者重启。
一般的,经由过程拜访 http://127.0.0.1:8080 就可以经由过程Ambri 来浏览和治理。然则为了治理办事,须要以治理员的身份登录ambri。Sandbox 2.4 中须要经由过程履行脚本来重置ambri的治理员暗码。
Spark
Spark是一个环绕速度、易用性和复杂分析构建的大年夜数据处理框架。Spark为我们供给了一个周全、同一的框架用于治理各类有着不合性质(文本数据、图表数据等)的数据集和数据源(批量数据或及时的流数据)的大年夜数据处理的需求。Spark则许可法度榜样开辟者应用有向无环图(DAG)开辟复杂的多步数据管道。并且还支撑跨有向无环图的内存数据共享,以便不合的功课可以合营处理同一个数据。
YARN
Spark运行在现有的Hadoop分布式文件体系基本之上(HDFS)供给额外的加强功能。它支撑将Spark应用安排到现存的Hadoop v1集群(with SIMR – Spark-Inside-MapReduce)或Hadoop v2 YARN集群甚至是Apache Mesos之中。
Zeppelin Notebook
Zeppelin供给了web版的类似ipython的notebook,用于做数据分析和可视化。背后可以接入不合的数据处理引擎,包含spark, hive, tajo等,原生支撑Scala, java, shell, markdown等。Zeppelin 供给了内置的 Apache Spark 集成。Zeppelin的Spark集成供给了:
- 主动惹人SparkContext 和 SQLContext
- 大年夜本地文件体系或maven库载入运行时依附的jar包。更多关于依附袈湄入器
- 可撤消job 和 展示job进度
HDP Sandbox 默认为我们供给了如斯多的组件办事,几乎涵盖了hadoop 生态体系,完了么?没有,还可以用治理员的身份来增长/启动/封闭 办事,例如Accumulo,Mahout,NiFi,Ranger KMS,SmartSense等,甚至可以自定义办事的。
【编辑推荐】
- Hadoop情况中治理大年夜数据存储八大年夜技能
- Jarvis对大年夜数据分析的将来将会有哪些赞助?
- 若何将逝世板的大年夜数据出现为可视化的图和动画?
- 打趣到实际,大年夜数据涉足文学研究–用数据模型分析莎翁著作
- 大年夜数据在猜测性维修中的应用
推荐阅读
比来大年夜家针对preload、HTTP/2 push和ServiceWorker的浏览器缓存实现展开了激烈的评论辩论,而这也引起了很多人的困惑。鉴于此,我想讲个故事来让大年夜家懂得一个请求若何完成他的任务>>>详细阅读
地址:http://www.17bianji.com/lsqh/34756.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示