核心是让容器主动报告健康状态:Docker HEALTHCHECK 指令配合 --start-period 等参数实现主动探活,docker ps 和 inspect 可观察状态,结合 on-failure 重启策略形成自愈闭环,并通过 Prometheus 等监控异常趋势。
核心是让容器自己“说话”——不是等它挂了才报警,而是它主动报告“我卡住了”或“我好了”。Docker 原生的 HEALTHCHECK 指令就是干这事的,配合状态观察和自动响应策略,就能实现真正的主动监控。
这是最稳妥的做法,所有基于该镜像启动的容器默认带健康探活能力:
HEALTHCHECK --interval=30s --timeout=5s --start-period=60s --retries=3 CMD curl -f http://localhost:8080/health || exit 1
/health 返回 200,或执行 mysqladmin ping 确认数据库可连可查容器跑起来后,立刻能确认健康机制是否生效:
docker ps 看 STATUS 列:会显示 (healthy)、(unhealthy) 或 (starting)
docker inspect --format='{{json .State.Health}}' 容器名 查详细状态,包括当前 Status、连续失败次数 FailingStreak 和最近几次检查的 Output
"Status": "unhealthy",说明检查已触发且连续失败达到阈值,不是没运行,而是明确报错光知道不健康还不够,得让它自己动起来:
--restart=on-failure:3:当健康状态变成 unhealthy 或进程退出码非 0,最多自动重启 3 次docker-compose.yml 配置:restart: on-failure + health_check 块,编排层能感知健康变化并决定是否剔除或重建restart policy 响应的是进程退出或健康失败;而 Swarm/K8s 会把 unhealthy 当作“不可用”,自动从负载均衡池中摘除单个容器状态是瞬时的,长期看异常模式才有价值:
container_status{state="unhealthy"} 指标,查某容器是否频繁进出 unhealthy 状态count by (container_name) (changes(container_status[1h]) == 1) > 5,表示 1 小时内健康状态反复切换超 5 次,大概率存在不稳定问题