云计算之路-阿里云上：docker swarm 集群故障与异常

cmt 2018-01-19 原文

在上次遭遇 docker swarm 集群故障后，我们将 docker 由 17.10.0-ce 升级为最新稳定版 docker 17.12.0-ce 。

前天晚上22:00之后集群中的2个节点突然出现CPU波动，在CPU波动之后，在凌晨夜深人静、访问量极低的时候，整个集群出现了故障，访问集群上的所有站点都出现了502，过了一段时间后自动恢复正常。

ECS实例：swarm1-node5，CPU百分比于00:52发生告警，值为96.14%，持续时间0分钟

。。。

昨天早上发现访问部分节点中的容器应用响应有些慢，于是我们通过阿里云控制台强制重启这些节点后恢复正常。

今天上午我们在集群上更新一个应用时（部署新的镜像），出现了奇怪的问题。应用是在 swarm1-node1 这个 manager 节点上部署的，部署后容器运行在其他节点上，但奇怪的是只有在 swarm1-node1 这个节点上可以正常访问容器中的站点，在其他节点上访问都是 503 ，用 docker stack rm 命令删除应用并重新部署问题依旧。

当时 docker-flow-proxy（路由应用）的 2 个容器都是部署在 swarm1-node1 节点上的，从问题现象看，在 swarm1-node1 节点上 docker-flow-proxy 容器与外界的通信正常，docker-flow-proxy 容器与其他节点上的容器的 overlay 网络（网络A）通信正常；在其他节点上，外界的请求通过 overlay 网络（网络B）被正常转发到 docker-flow-proxy 容器，却不能被正常路由到其他节点上对应的容器（也是通过 overlay 网络A）。对这个奇怪现象实在想不通，但是问题摆在那，想不通也要解决。想不通背后的原因，那我们换个角度，其他节点都异常，就 swarm1-node1 正常，根据少数服从多数的粗暴原则，那就认为 swarm1-node1 不正常吧。于是通过下面的命令将 swarm1-node1 节点下线：

docker node update --availability drain swarm1-node1

swarm1-node1 下线后，其他节点都恢复了正常，果然是 swarm1-node1 不正常。

swarm1-node1 下线的背后是 docker-flow-proxy 容器换到其他节点上运行。

问题就这样被猜测解决了。

本文链接：https://www.cnblogs.com/cmt/p/8316263.html

云计算之路-阿里云上：docker swarm 集群故障与异常的更多相关文章

人均年薪50万以上，docker到底是什么？为什么这么火？

为什么要使用Docker？场景一：公司双十一买了一堆服务器，技术总监让你给它们一个个都配置上JDK、Mysq […]...

使用k8s创建容器一直处于ContainerCreating状态

容器报错信息为（两种）： FailedSynError syncing pod, skipping: fail […]...

ESP8266 玩板记

ESP8266实现WiFi杀手/钓鱼,接入阿里云物联网平台上传温湿度数据一、前言 esp8266的玩板记，后 […]...

网络模型 – 每天5分钟玩转 Docker 容器技术（169）

本节我们讨论 Kubernetes 网络模型这个重要主题。本节我们讨论 Kubernetes 网络这个重要主 […]...

k8s 如何 Failover？- 每天5分钟玩转 Docker 容器技术（127）

上一节我们有 3 个 nginx 副本分别运行在 k8s-node1 和 k8s-node2 上。现在模拟 k […]...

Docker命令

1.Docker简介 Docker 是一个开源的应用容器引擎，基于 Go 语言并遵从 Apache2.0 […]...

Linux 使用 docker 下搭建xunsearch 搜索引擎服务

Linux 使用 docker 下搭建 xunsearch 搜索引擎服务安装 docker 环境（菜鸟教程有 […]...

014.Docker Harbor+Keepalived+LVS+共享存储高可用架构

一多Harbor高可用介绍共享后端存储是一种比较标准的方案，将多个Harbor实例共享同一个后端存储，任何 […]...

随机推荐

使用gitblit搭建一个简单的局域网服务器

使用gitblit搭建一个简单的局域网服务器 1、使用背景现在很多使用github管理代码，但是gith […]...

13.秋招复习简单整理之编程题根据前序遍历和中序遍历结果还原二叉树？

对于二叉树，由前序遍历和中序遍历或中序遍历和后序遍历都可以还原二叉树，但是由前序遍历和后序遍历无法还原二叉树， […]...

构建虚拟web主机 Apache 配置与应用

一.构建虚拟 Web主机虚拟Web主机指的是在同一台服务器中运行多个Web站点，中每个站点实际上并不独立整 […]...

team explorer everywhere 2010解决license试用到期的问题 – sinxsoft

team explorer everywhere 2010解决license试用到期的问题在Eclipse中 […]...

原码、反码、补码的用法和理解

基本记忆原码符号位加上真值的绝对值, 即用第一位表示符号, 其余位表示值正数原码、反码、补码都是一样，不变 […]...

【Nuitka】python打包单文件

1、官网https://nuitka.net/ 2、githubhttps://github.com/Nuitka/Nuitka 3、安装mingw64https://winlibs.com/ 4、创建python项目...

SATA接口硬盘加密器

加密卡置于主板与硬盘、光驱之间，透明实时地对写入数据进行加密，对读出数据进行解密，有效防止信息被窃、未经授权的 […]...

【oppo手机】oppo 手机永久打开usb调试模式

现象：十分钟不使用就会自动关闭 usb 调试模式，重新打开还得输入验证码，真尼玛烦人。方法：数字拨号盘输 […]...

云计算之路-阿里云上：docker swarm 集群故障与异常

云计算之路-阿里云上：docker swarm 集群故障与异常的更多相关文章

随机推荐

热门专题

目录导航