如何用Kubernetes部署高可用MySQL集群?

作者:袖梨 2026-08-28

直接用 Helm 安装 bitnami/mysql chart 得不到高可用集群——它只起一个 StatefulSet,没自动故障转移、没组复制、没法声明式扩缩容角色;真要高可用,必须用 mysql-operator,它才是 Kubernetes 里管 MySQL 集群的“大脑”。

直接用 Helm 安装 bitnami/mysql chart 得不到高可用集群——它只起一个 StatefulSet,没自动故障转移、没组复制、没法声明式扩缩容角色。真要高可用,必须用 mysql-operator,它才是 Kubernetes 里管 MySQL 集群的“大脑”。

别装错 Helm chart:mysql-operator 不是 mysql

常见错误是执行 helm install mysql bitnami/mysql,结果只看到 1 个 Pod,或者强行改 replicas 后复制中断、主库选不出来。这是因为 bitnami/mysql 是单实例或简单主从模板,不带控制器逻辑。

  1. 正确做法:先加 Operator 专用仓库:helm repo add presslabs https://charts.presslabs.orghelm repo add bitnami https://charts.bitnami.com/bitnami
  2. 安装 Operator 控制器本身:helm install mysql-operator presslabs/mysql-operator --namespace=mysql-operator --create-namespace
  3. 验证是否就绪:kubectl get pods -n mysql-operator -l app=mysql-operator,必须是 Running 状态;否则后续 MysqlCluster CR 创建会静默失败

MysqlCluster CR 才是集群“地图”,不是 YAML 就能跑

Operator 装完只是司机,MysqlCluster 才是指定路线和站点的地图。漏掉这步,集群根本不会启动。

  1. apiVersion: mysql.presslabs.org/v1alpha1 必须匹配已安装 Operator 支持的版本,查 CRD 列表:kubectl get crd | grep mysqlcluster
  2. spec.replicas: 3 表示至少 3 个节点参与组复制(少于 3 个无法容忍单点故障)
  3. secretName: mysql-credentials 必须提前创建,含 root 和复制用户密码;Operator 会自动注入并轮换,但初始 Secret 缺失会导致 Pod 卡在 Init:0/1
  4. 备份配置如 backupSchedule: "0 2 * * *" 要配 backupURL(S3 或兼容接口),否则备份任务不触发

StorageClass 和 PV 绑定方式决定数据能不能活下来

用本地存储(hostPathlocal-path)做测试可以,但生产环境必须用支持 ReadWriteOnce 且能跨节点迁移的存储,比如 Ceph RBD、AWS EBS 或 NFS(需配 volumeBindingMode: WaitForFirstConsumer)。

  1. StatefulSet 的每个 Pod 会绑定独立 PVC,PVC 名按 mysqlclustername-0mysqlclustername-1 生成,不能手动改名
  2. 如果 StorageClass 设置了 reclaimPolicy: Delete,删掉 MysqlCluster 时 PVC 会连带删除——想保留数据?得提前改成 Retain 并手动备份 PV
  3. Operator 默认为每个 Pod 分配 10Gi PVC,实际大小要按写入量+binlog+备份预留调大,否则 mysql-operator 会因磁盘满反复重启 Pod

故障转移不是秒级的,Raft 选举有真实延迟

文档说“30 秒内完成切换”,这是理想网络下的理论值。实际中,Pod 重建、PV 挂载、MySQL 实例启动、Raft 投票、GTID 校验全部走完,常耗时 60–90 秒。应用层必须做好重试和连接池超时配置。

  1. 检查当前主库:kubectl get mysqlcluster production-db -o jsonpath='{.status.primaryPod}'
  2. 模拟主库宕机:kubectl delete pod production-db-0 -n mysql-cluster,观察 kubectl get pods -n mysql-cluster 状态变化
  3. 切主期间,mysql-read Service 仍可读,但写请求会失败;务必确认应用连接串指向的是 production-db-mysql.mysql-cluster.svc.cluster.local(Headless Service),而非某个固定 Pod DNS

最易被忽略的是:Operator 控制器和 MysqlCluster 必须在同一个 Namespace 吗?不是——Operator 在 mysql-operator,CR 可在任意 Namespace,但 RBAC 权限必须显式放开,否则 Operator 看不见你的集群定义。

相关文章

精彩推荐