Ansible 通过组合命令、模块和逻辑判断实现 Linux 健康检查标准化,聚焦三类检查:服务可用性(systemd 状态、端口监听、HTTP 响应)、资源阈值(CPU 负载、磁盘使用率、Inode)、日志异常(journalctl 时间窗口扫描),并支持自动化闭环处理。
Ansible 本身不直接提供“健康状态”的抽象概念,而是通过组合命令、模块和逻辑判断,把 Linux 健康检查的通用实践标准化、批量执行。关键不是“Ansible 怎么检测”,而是“用 Ansible 怎么可靠地执行三类检查”:服务是否真可用、资源是否够用、日志是否干净。
别只跑 systemctl status 或 ps —— 它们容易误判。推荐在 playbook 中分步验证:
ansible all -m command -a "systemctl is-active --quiet nginx && echo ok" -c local,靠 $? 判断是否返回 0(active)ansible all -m command -a "ss -tln | grep ':80' > /dev/null",用 ss 而非 netstat,避免高负载卡顿ansible all -m uri -a "url=http://localhost/health method=GET status_code=200 timeout=3",URI 模块自动处理 HTTP 状态码和超时健康不是“看起来还行”,而是指标没越界。常用指标可封装为变量+条件任务:
shell 模块读 /proc/loadavg,对比 {{ ansible_processor_vcpus }},例如 load1 > vcpus × 2 就告警df -h / | awk '$5 ~ /[0-9]+%/ {sub(/%/,"",$5); if ($5 > 90) print $1,$5}',提取超 90% 的分区df -i / | awk 'NR==2 {if ($5 > 95) print "inode critical"}',尤其要防日志写爆服务“活着但已瘫痪”最常藏在日志里。避免全量扫描,用 journalctl 限定范围:
ansible web -m command -a "journalctl -u nginx --since '1 hour ago' | grep -i 'error|fail|timeout' | head -n 10"
ansible db -m shell -a "journalctl -u mysqld --since '24 hours ago' | grep 'ERROR' | wc -l",结果大于 50 就触发后续动作grep 'No space left' /var/log/syslog 或 grep 'Connection refused' /var/log/messages
巡检不是只报错,而是形成“发现→记录→通知→尝试恢复”链路:
/opt/bin/health-check.sh),每项设明确阈值(如磁盘 >90%、curl 连续 3 次失败)script 模块分发并执行:- script: /opt/bin/health-check.sh,结果存入 register 变量when 和 Jinja2 测试语句做判断:when: health_result.stdout | search("CRITICAL"),再触发重启服务或清理磁盘等动作