拓扑监控包含数据源和全部拓扑流程,须要用户本身去整顿和构建,更新的时刻就可以或许知道这个器械依附谁、是否依附线上办事,如不雅半途停的话会造成机械故障。营业监控的话,第一个就是Topic Lag,Topic Lag每一个波动都是不一样的,用这种方法监控会频繁报警,90%的中位数都是落在80—100毫秒范围内,就可以监控到全部范围。
- –env TZ=Asia/Shanghai
- –volume /etc/localtime:/etc/localtime:ro
- –env JAVA_TOOL_OPTIONS=”-Dfile.encoding=UTF-8 -Duser.timezone=PRC
容器监控上存眷以下三方面:
Google cAdvisor足够有效
- mount rootfs可能导致容器删除掉败 #771
- –docker_only
- –docker_env_metadata_whitelist
Statsd + Watcher
- 基于Graphite的切切级指标监控平台
Nagios
临时文件
- java.io.tmpdir=/mnt/mesos/sandbox
- spark.local.dir=/mnt/mesos/sandbox
容器这一块比较简单,应用Docker并合营Mesos,再把Marathon的ID抓掏出来就可以了。我们这边在实践的过程发明一个问题,因为Statsd Watcher轻易出现问题,你直接用Docker的时刻它会报一些缺点出来,这个问题就是Statsd Watcher把路径给挂了的原因。今朝我们平台就曾碰到过一次,社区琅绫擎也有人曝,不过复现率比较低。用的时刻如不雅发明这个问题把Statsd Watcher直接停掉落就好。指标的话,每台机械上放一个statsd再发一个后台的Worker,报警平台也是这个。
其拭魅针对Docker监控的话,照样存在着一些问题:
基本监控压力
- 数据膨胀
- 垃圾指标增多
- 大年夜量的通配符导致数据库压力较高
单个义务的容器生命周期
- 宣布
- 扩容
- 异常退出
起首主如果监控体系压力比较大年夜。本来监控虚拟机时都是针对每一个虚拟机的,只要虚拟机不删的话是经久报告请示,指标名固定,但在容器中这个器械一向在变,它在这套体系下用指标并在本地之外建一个目次存文件,所以在这种存储机制下去存容器的指标不合适。重要问题是数据膨胀比较厉害,可能一个容器会起名,起名多次之后,在Graphite那边对应了有十多个指标,像这种都是预生成的监控文件。比如说定义每一秒钟一个数据点,要保存一年,这个时刻它就会根据每年有若干秒生成一个RRD文件放那儿。这部分指标如不雅按照现有标准的话,可能容器的生命周期仅有几天时光,不实用这种机制。测试雷同的指标量,公司存储的方法相对来说比Graphite好一点。因为Graphite是基于文件体系来做的,第一个优化指标名,目次要转存到数据库里做一些索引加快和萌芽,然则因为容器这边相对通配符比较多,不克不及直接得知具体对应的ID,只能通配符萌芽做聚合。因为经久的通配符在字符串的索引上照样易于应用的,所以如今算是折中的做法,把一些常用的萌芽结不雅、目次放到里边。
另一个是容器的生命周期。可以做一些审计或者变革的版本,在Mesos层面基于Marathon去监控,发明这些状况后打上标记:当前是哪一个容器或者哪一个TASK出了问题,对应扩容和记录下来。还有Docker本身的问题,如许后面做全部记录时会有一份比拟较较完全的TASK-ID。
【编辑推荐】
- 关于Docker琅绫擎的几个重要概念
- Docker Compose:链接外部容器的几种方法
- 为什么Docker如斯受迎接
- Docker 容器健康检查机制
- Docker是传统的应用宣布治理的终结者么?
51CTO诚邀您9月23号和秒拍/国美/美团元专家一路聊智能CDN的优化之路,抓紧时光哦!
推荐阅读
云应用的快速增长赓续进步人们在云计算情况中对于数据、应用法度榜样和工作负载的兴趣。Gartner公司宣布的云安然技巧成熟曲线有助于安然专业人士懂得哪些技巧已经预备好应用于主流应用,而对于大年夜多>>>详细阅读
本文标题:去哪儿网基于Mesos和Docker构建私有云服务实践
地址:http://www.17bianji.com/lsqh/37375.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示