副本的更新
与上一模型比较,其最大年夜的变更就是该架构中不存在任何master节点,体系中的每个节点可以做类似master的义务:存储体系元信息以及治理集群节点。
数据的萌芽方法也有所不合,client可以拜访体系中的随便率性节点,而不再局限于master节点,具体萌芽流程如下:1. 萌芽体系中随便率性节点,如不雅该数据在此节点上则返回响应的数据,如不雅不在该节点,则返回对应数据的节点地址,履行第二步;2. 获得数据对应的地址后向相干请求数据。
节点之间共享状况信息是若何做到的呢?常用的办法是应用如gossip的协定以及在此基本之上开辟的serf框架,感兴趣的话可以参考redis cluster 和 consul实现。
针对以上问题,基于yarn模式的新的处理架构模型,将义务履行状况的监控和义务资本的调剂分开。本来的Job tracker分为resource manger 负责资本的调剂,义务履行的监控则交给每个appMaster来负责,本来的task tracker,变为了node manager,负责资本的监控和task的启动,而task的履行状况和异常处理则交给appMaster处理。
数据计算处理体系
分布式体系: 每小我都在提分布式体系,那么什么是分布式体系?其根本概念就是组件分布在收集计算机上,组件之间仅仅经由过程消息传递来通信并调和行动。
常见的分布式体系分为数据存储体系如hdfs,hbase;数据处理计算体系如storm、spark、flink;数据存储兼分析混淆体系,这类体系在数据存储的基本上供给了复杂的数据搜刮萌芽功能,如elastic search、druid。对于存储兼计算的体系,我们仍然可以分开分析,所以本文会大年夜数据存储和计算两种体系来阐述。
常用的数据计算重要分为离线批量计算,可所以及时F算,也可所以准及时mini-batch计算,固然开源的体系很多,且每个体系都有其侧重点,但有些问题倒是共性相通的。
分布式体系在互联网公司中的应用已经异常广泛,开源软件层出不穷。hadoop生态体系,大年夜hdfs到hbase,大年夜mapreduce到spark,大年夜storm到spark streaming, heron, flink等等,如安在开源的汪洋中不会迷掉本身?本文将大年夜根本概念、架构并结合本身进修工作中的感悟,阐述若何进修分布式体系。因为分布式体系理论体系异常宏大年夜,常识面异常广博,笔者才能有限,不足之处,迎接评论辩论交换。
数据送达策略
在数据处理中起重要推敲一个问题,我们的数据记录在体系中会被处收成回(包含正常情况和异常情况):
- at most>

上图是通用的架构模型图,有些人会问这是hadoop v1版本的mapreduce计算框架图,如今都已经yarn模式的新的计算框架图,谁还用这种模式?哈哈,说的对,然则如今仍然有些处理框架就是这种模型————storm。
不妨把图上的一些概念和storm的概念映射起来:Job tracker 对应于 nimbus,task tracker 对应于 supervisor,每台supervisor 同样要设备worker slot,worker对应于storm中的worker。 如许一比较,是不是就认为一样了?
这种框架模型有它的问题,义务不明白,每个模块干着多样工作。例如Job tracker不仅要监控义务的履行状况,还要负责义务的调剂。TaskTracker也同样,不仅要监控task的状况、履行,同样还要监控节点资本的应用。

同样的,twitter 根据storm架构方面的一些问题,推出了新的处理框架heron,其解决的问题也是将义务的调剂和义务的履行状况监控义务分别,惹人了新的概念Topology Master,类似于这儿的appMaster。
总结
分布式体系涵盖的内容异常多,本篇文┞仿重要大年夜整体架构以及概念上介绍若何入门,进修过程有一些共性的问题,在这儿总结一下:
- 先分析该体系是数据存储照样计算体系。
- 如不雅是数据存储体系,大年夜数据分布和副本策略开端入手;如不雅是数据处理问题,大年夜数据送达策略入手。
- 读对应体系架构图,对应着常用的架构模型,每个组件和已有的体系进行类比,想一下这个组件类似于hdfs的namenode等等,最后在脑海里梳理下数据流的┞符个流程。
- 在懂得了体系的大年夜概,侧重看下文档中fault tolerence章节,看体系若何容错,或者本身可以预先问些问题,比如如不雅一个节点挂了、一个义务挂了体系是若何处理这些异常的,带着问题看文档。
- 文档具体读了一遍,就可以按照官方文档写些hello world的例子了,具体查看下体系设备项,跟着工作的深刻就可以看些体系的细节和关键源码了。
此次分享的文┞仿内容就这么多,中心不免有些忽略,有任何问题迎接随时斧正交换,大年夜家合营进步,感谢大年夜家。
作者:李峰,高等工程师,今朝就职于LogicMonitor(供给SaaS办事监控平台,天天采集监控数据上百亿条),大年夜事数据处理平台架构,专注于分布式存储流式计算。点击浏览原文查看交换实录。
【编辑推荐】
- 及时处理大年夜数据的分布式体系Druid-IO
- 若何解决分布式体系可治理性问题?
- 浅析分布式系同一些事
- 分布式体系中生成全局ID的总结与思虑
推荐阅读
沙龙晃荡 | 去哪儿、陌陌、ThoughtWorks在主动化运维中的实践!10.28不见不散! 上周,iOS、Android 应用开辟帮助对象 Fastlane 的开创人、安然专家 Felix Krause 颁布了一篇文┞仿(链接在>>>详细阅读
本文标题:如何学习分布式系统?一文全Get!
地址:http://www.17bianji.com/lsqh/38088.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示